diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9f6473e88cd99643c822bf45ef39ff3e35a42abb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1100/trainer_state.json @@ -0,0 +1,1189 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.7372353673723535, + "eval_steps": 20, + "global_step": 1100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0877774590688256e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..656214990d92f0166ed73936c80de6d0f59b4c5e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1120/trainer_state.json @@ -0,0 +1,1210 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.7870485678704857, + "eval_steps": 20, + "global_step": 1120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1058529480242586e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f62027fbd098933ce5afaec1cb2de7b2619c09f3 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1140/trainer_state.json @@ -0,0 +1,1231 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8368617683686175, + "eval_steps": 20, + "global_step": 1140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1277422592347136e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..991861f63200a900bdb8c2974b8e10e8f9e549c4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1160/trainer_state.json @@ -0,0 +1,1252 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.8866749688667497, + "eval_steps": 20, + "global_step": 1160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1472790102826803e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..594c403e07d0a37d075b5c5e11c381453220bfb8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1180/trainer_state.json @@ -0,0 +1,1273 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.936488169364882, + "eval_steps": 20, + "global_step": 1180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1675715246487757e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ae5182e3dd8dd2fb3f3bdf2c190469600c69f19c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-120/trainer_state.json @@ -0,0 +1,160 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.298879202988792, + "eval_steps": 20, + "global_step": 120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1745836528934912e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5f0ff0ed76b2e1a36414158402ec5648c6a23f87 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1200/trainer_state.json @@ -0,0 +1,1294 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 2.9863013698630136, + "eval_steps": 20, + "global_step": 1200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.1868291279628493e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4888ecada49175a7cad4a4dd19d7f7b148c82eb4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1220/trainer_state.json @@ -0,0 +1,1315 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.0348692403486925, + "eval_steps": 20, + "global_step": 1220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2056756391157555e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..beae269072d8b8393114f675dece3225fe90eb52 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1240/trainer_state.json @@ -0,0 +1,1336 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.0846824408468243, + "eval_steps": 20, + "global_step": 1240, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2245230478497997e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..10c8c10f6552220b90cd0ef000140954a961ff7f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1260/trainer_state.json @@ -0,0 +1,1357 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.1344956413449565, + "eval_steps": 20, + "global_step": 1260, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2456036384549888e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..185a39947694a800ce64e7bba5d5947753531233 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1280/trainer_state.json @@ -0,0 +1,1378 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.1843088418430883, + "eval_steps": 20, + "global_step": 1280, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.26603168757291e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ddb2a2b757f5c7a3f9e6cb98f251371c3acfb673 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1300/trainer_state.json @@ -0,0 +1,1399 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2341220423412205, + "eval_steps": 20, + "global_step": 1300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.2852129964902605e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..47102a1b0b5272c3706330c9de0eb50f5bf8c0a5 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1320/trainer_state.json @@ -0,0 +1,1420 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.2839352428393527, + "eval_steps": 20, + "global_step": 1320, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3068070035063398e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..9fb822ec06af2777904cd373c827126ade57150e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1340/trainer_state.json @@ -0,0 +1,1441 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.3337484433374844, + "eval_steps": 20, + "global_step": 1340, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3249722505755648e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5cfb2a805f44ecbacfc5aaecf9da15b8aa9415f7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1360/trainer_state.json @@ -0,0 +1,1462 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.383561643835616, + "eval_steps": 20, + "global_step": 1360, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3445125919480832e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..b89d642c64eb3fc39aef7579dbcc8436426c906f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1380/trainer_state.json @@ -0,0 +1,1483 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4333748443337484, + "eval_steps": 20, + "global_step": 1380, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.363284603866542e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a0fcf51d039d4e307e5b4518910d1400d74007ea --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-140/trainer_state.json @@ -0,0 +1,181 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.34869240348692404, + "eval_steps": 20, + "global_step": 140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.3754802631827456e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f3c921f22ec89dd19b6b6a3407a0667a5990ecb7 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1400/trainer_state.json @@ -0,0 +1,1504 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.4831880448318806, + "eval_steps": 20, + "global_step": 1400, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.385097620680274e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..461029ab87dd1ce47b5fe6707a1af4d302196b85 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1420/trainer_state.json @@ -0,0 +1,1525 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.5330012453300124, + "eval_steps": 20, + "global_step": 1420, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.405775197354537e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..611b8a10dbfa16ac13082c2cd8ec83d99487e962 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1440/trainer_state.json @@ -0,0 +1,1546 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.5828144458281446, + "eval_steps": 20, + "global_step": 1440, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4260650189772186e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4d36cbc00cb92fe1f1a950dbdb4cacd7fbdf8104 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1460/trainer_state.json @@ -0,0 +1,1567 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.6326276463262763, + "eval_steps": 20, + "global_step": 1460, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4456080530931507e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..3783057f9d3b20b84a7c70fa79bd9e14e0e00fda --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1480/trainer_state.json @@ -0,0 +1,1588 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.6824408468244085, + "eval_steps": 20, + "global_step": 1480, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4642463254220595e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c534c43d4fc9e56dbd032084096c7d070bf2a7ed --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1500/trainer_state.json @@ -0,0 +1,1609 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.7322540473225407, + "eval_steps": 20, + "global_step": 1500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.4841169766533325e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a2598165697b48a1cbf4b38f810ba1e254dca09e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1520/trainer_state.json @@ -0,0 +1,1630 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.7820672478206725, + "eval_steps": 20, + "global_step": 1520, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5019420404712858e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8256a701ee9bb1540f16cb81f82f3c5e3fb55edf --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1540/trainer_state.json @@ -0,0 +1,1651 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.8318804483188043, + "eval_steps": 20, + "global_step": 1540, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5214482737605632e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..54149e695b57f0dcec6d769962217ef3ba02b918 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1560/trainer_state.json @@ -0,0 +1,1672 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.8816936488169365, + "eval_steps": 20, + "global_step": 1560, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.541802721225175e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..e443e9a6957831e739b6d18d9fb3a86ca6504086 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1580/trainer_state.json @@ -0,0 +1,1693 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 3.9315068493150687, + "eval_steps": 20, + "global_step": 1580, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.559732802036265e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..a8458b86382906713596c3d94f3a93b246aab242 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-160/trainer_state.json @@ -0,0 +1,202 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.398505603985056, + "eval_steps": 20, + "global_step": 160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.5751830905585664e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2a0c9eadd2ff0b57d45a42e2f1ff6c9bb1bc5eed --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/trainer_state.json @@ -0,0 +1,1945 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.5280199252802, + "eval_steps": 20, + "global_step": 1820, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.7933742942132634e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..d7804176663dfd053dc183faffc03b9ee8a2c06f --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1840/trainer_state.json @@ -0,0 +1,1966 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.577833125778331, + "eval_steps": 20, + "global_step": 1840, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.8121184811164467e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..df13b7a15bb232a2adb1a1884e94471a562c2d7c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1860/trainer_state.json @@ -0,0 +1,1987 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.627646326276463, + "eval_steps": 20, + "global_step": 1860, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.83182936290517e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..46c8053a4761dfe62141b0d12c6a46dde47b4d6e --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1880/trainer_state.json @@ -0,0 +1,2008 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.677459526774595, + "eval_steps": 20, + "global_step": 1880, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.85193428281344e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..7cd3aeabea1b1c4262e6a1852400bb97922aa3a9 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1900/trainer_state.json @@ -0,0 +1,2029 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.7272727272727275, + "eval_steps": 20, + "global_step": 1900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.87351931401814e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..56ac1600c2fec064dd206f78d9acd5223a3ddd08 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1920/trainer_state.json @@ -0,0 +1,2050 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.777085927770859, + "eval_steps": 20, + "global_step": 1920, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.894537073943675e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5d5c7251ab3f5bf7bb099a6494c9acb9a8cfb2f8 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1940/trainer_state.json @@ -0,0 +1,2071 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.826899128268991, + "eval_steps": 20, + "global_step": 1940, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.913542456957993e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..46734b688fefdd107382b2f03872f068fcb704aa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1960/trainer_state.json @@ -0,0 +1,2092 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.876712328767123, + "eval_steps": 20, + "global_step": 1960, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9335782631186432e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..ea992d0e8ab885f3196c63dbfa8d6967fa5c79e4 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1980/trainer_state.json @@ -0,0 +1,2113 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.926525529265255, + "eval_steps": 20, + "global_step": 1980, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9516824746704896e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..231bffb5e5b86a1a6b507f6a257af01ebc4211aa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-20/trainer_state.json @@ -0,0 +1,55 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.049813200498132, + "eval_steps": 20, + "global_step": 20, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2024853289033728.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..78ab28c1ae4edb5d604d532de8e40967c8b89226 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-200/trainer_state.json @@ -0,0 +1,244 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.49813200498132004, + "eval_steps": 20, + "global_step": 200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0027099623612416e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..073ab67faf4f13b00d7b832d5450af05e800e2c1 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2000/trainer_state.json @@ -0,0 +1,2134 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 4.976338729763388, + "eval_steps": 20, + "global_step": 2000, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.973209163101225e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6125c38556bf215520454f1a028abc53e9935afa --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2020/trainer_state.json @@ -0,0 +1,2155 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.024906600249066, + "eval_steps": 20, + "global_step": 2020, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.9920107951972352e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..15c1539b592aee8be75ca17a1f4023fb2c73a02b --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2040/trainer_state.json @@ -0,0 +1,2176 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.074719800747198, + "eval_steps": 20, + "global_step": 2040, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0125268072666726e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..553c946e044889932b0576f04281119af5df99cb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2060/trainer_state.json @@ -0,0 +1,2197 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.12453300124533, + "eval_steps": 20, + "global_step": 2060, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0320025227972608e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5b7a9b8bd83351c379cb6c3d8f13dcd2255e463a --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2080/trainer_state.json @@ -0,0 +1,2218 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.174346201743462, + "eval_steps": 20, + "global_step": 2080, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.052914368148521e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1d793f405e6c1da1ec676097edebb30e0584418c --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2100/trainer_state.json @@ -0,0 +1,2239 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.224159402241594, + "eval_steps": 20, + "global_step": 2100, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0744841404738765e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..33aa79110f9928a0facbc8d08fbb08689a69ac42 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2120/trainer_state.json @@ -0,0 +1,2260 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.273972602739726, + "eval_steps": 20, + "global_step": 2120, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.0924151188661043e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..41102879a3d0f85560d87bfba6a2aed80fce2644 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2140/trainer_state.json @@ -0,0 +1,2281 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.323785803237858, + "eval_steps": 20, + "global_step": 2140, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.111302021170217e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f00876ceff8f7892cf8af98663bf0270ef4a6b16 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2160/trainer_state.json @@ -0,0 +1,2302 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.37359900373599, + "eval_steps": 20, + "global_step": 2160, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.1310784263820083e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..11f8a6f71eb4711e23d7b257423d62d8b96fcd2d --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2180/trainer_state.json @@ -0,0 +1,2323 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 5.423412204234122, + "eval_steps": 20, + "global_step": 2180, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + }, + { + "entropy": 0.6287345830351114, + "epoch": 0.597758405977584, + "grad_norm": 0.848779022693634, + "learning_rate": 0.00013452932886648739, + "loss": 0.5506546020507812, + "mean_token_accuracy": 0.8438881888985634, + "num_tokens": 566596.0, + "step": 240 + }, + { + "epoch": 0.597758405977584, + "eval_entropy": 0.6307531505130058, + "eval_loss": 0.5573338270187378, + "eval_mean_token_accuracy": 0.8431362606758295, + "eval_num_tokens": 566596.0, + "eval_runtime": 86.3535, + "eval_samples_per_second": 15.923, + "eval_steps_per_second": 1.992, + "step": 240 + }, + { + "entropy": 0.6223786748945713, + "epoch": 0.6475716064757161, + "grad_norm": 0.7316951751708984, + "learning_rate": 0.0001457870132904612, + "loss": 0.5495625972747803, + "mean_token_accuracy": 0.8440376669168472, + "num_tokens": 613603.0, + "step": 260 + }, + { + "epoch": 0.6475716064757161, + "eval_entropy": 0.623454462476941, + "eval_loss": 0.5619264245033264, + "eval_mean_token_accuracy": 0.8431175777385401, + "eval_num_tokens": 613603.0, + "eval_runtime": 86.2008, + "eval_samples_per_second": 15.951, + "eval_steps_per_second": 1.995, + "step": 260 + }, + { + "entropy": 0.6281675305217505, + "epoch": 0.6973848069738481, + "grad_norm": 0.7639564871788025, + "learning_rate": 0.00015704469771443506, + "loss": 0.5604369163513183, + "mean_token_accuracy": 0.8401600055396556, + "num_tokens": 658565.0, + "step": 280 + }, + { + "epoch": 0.6973848069738481, + "eval_entropy": 0.63416675980701, + "eval_loss": 0.5612760782241821, + "eval_mean_token_accuracy": 0.842435666294985, + "eval_num_tokens": 658565.0, + "eval_runtime": 86.25, + "eval_samples_per_second": 15.942, + "eval_steps_per_second": 1.994, + "step": 280 + }, + { + "entropy": 0.6427909277379513, + "epoch": 0.7471980074719801, + "grad_norm": 0.6475813388824463, + "learning_rate": 0.0001683023821384089, + "loss": 0.573763370513916, + "mean_token_accuracy": 0.8370340794324875, + "num_tokens": 705680.0, + "step": 300 + }, + { + "epoch": 0.7471980074719801, + "eval_entropy": 0.6231539840268534, + "eval_loss": 0.5566866397857666, + "eval_mean_token_accuracy": 0.844177934319474, + "eval_num_tokens": 705680.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 300 + }, + { + "entropy": 0.6226776849478484, + "epoch": 0.797011207970112, + "grad_norm": 0.8886699676513672, + "learning_rate": 0.00017956006656238274, + "loss": 0.558210802078247, + "mean_token_accuracy": 0.84083157107234, + "num_tokens": 752616.0, + "step": 320 + }, + { + "epoch": 0.797011207970112, + "eval_entropy": 0.6066981683983359, + "eval_loss": 0.5585207939147949, + "eval_mean_token_accuracy": 0.8423153311014175, + "eval_num_tokens": 752616.0, + "eval_runtime": 86.3463, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 320 + }, + { + "entropy": 0.6249004438519478, + "epoch": 0.8468244084682441, + "grad_norm": 0.8791211843490601, + "learning_rate": 0.00019081775098635657, + "loss": 0.5603597164154053, + "mean_token_accuracy": 0.8420463085174561, + "num_tokens": 797151.0, + "step": 340 + }, + { + "epoch": 0.8468244084682441, + "eval_entropy": 0.6082247584018596, + "eval_loss": 0.5616299510002136, + "eval_mean_token_accuracy": 0.8431286801432454, + "eval_num_tokens": 797151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 340 + }, + { + "entropy": 0.6362396612763405, + "epoch": 0.8966376089663761, + "grad_norm": 0.8606319427490234, + "learning_rate": 0.0002020754354103304, + "loss": 0.5735773563385009, + "mean_token_accuracy": 0.8371490836143494, + "num_tokens": 843585.0, + "step": 360 + }, + { + "epoch": 0.8966376089663761, + "eval_entropy": 0.6492362072648004, + "eval_loss": 0.5646467804908752, + "eval_mean_token_accuracy": 0.8415517574825953, + "eval_num_tokens": 843585.0, + "eval_runtime": 86.3351, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 360 + }, + { + "entropy": 0.638665035739541, + "epoch": 0.9464508094645081, + "grad_norm": 0.7773950099945068, + "learning_rate": 0.00021333311983430425, + "loss": 0.5820859909057617, + "mean_token_accuracy": 0.8372561208903789, + "num_tokens": 889842.0, + "step": 380 + }, + { + "epoch": 0.9464508094645081, + "eval_entropy": 0.6434498637221581, + "eval_loss": 0.5645168423652649, + "eval_mean_token_accuracy": 0.8420382481674815, + "eval_num_tokens": 889842.0, + "eval_runtime": 86.1216, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 380 + }, + { + "entropy": 0.6316851265728474, + "epoch": 0.9962640099626401, + "grad_norm": 1.6120579242706299, + "learning_rate": 0.00022459080425827807, + "loss": 0.5637502670288086, + "mean_token_accuracy": 0.8386227294802666, + "num_tokens": 935589.0, + "step": 400 + }, + { + "epoch": 0.9962640099626401, + "eval_entropy": 0.6469012776086497, + "eval_loss": 0.5758090615272522, + "eval_mean_token_accuracy": 0.8397158470957778, + "eval_num_tokens": 935589.0, + "eval_runtime": 86.6139, + "eval_samples_per_second": 15.875, + "eval_steps_per_second": 1.986, + "step": 400 + }, + { + "entropy": 0.5894816922835815, + "epoch": 1.0448318804483188, + "grad_norm": 1.1616325378417969, + "learning_rate": 0.00022626713048053178, + "loss": 0.5316025257110596, + "mean_token_accuracy": 0.8466163017810919, + "num_tokens": 980589.0, + "step": 420 + }, + { + "epoch": 1.0448318804483188, + "eval_entropy": 0.5860798164855602, + "eval_loss": 0.5777581930160522, + "eval_mean_token_accuracy": 0.8396938103576039, + "eval_num_tokens": 980589.0, + "eval_runtime": 86.1449, + "eval_samples_per_second": 15.961, + "eval_steps_per_second": 1.997, + "step": 420 + }, + { + "entropy": 0.5818420693278312, + "epoch": 1.0946450809464507, + "grad_norm": 0.7999453544616699, + "learning_rate": 0.00022622107023288778, + "loss": 0.5221010208129883, + "mean_token_accuracy": 0.8474301159381866, + "num_tokens": 1027852.0, + "step": 440 + }, + { + "epoch": 1.0946450809464507, + "eval_entropy": 0.5783926014636838, + "eval_loss": 0.5700300931930542, + "eval_mean_token_accuracy": 0.8430753537388735, + "eval_num_tokens": 1027852.0, + "eval_runtime": 86.5308, + "eval_samples_per_second": 15.89, + "eval_steps_per_second": 1.988, + "step": 440 + }, + { + "entropy": 0.5612493887543678, + "epoch": 1.1444582814445827, + "grad_norm": 1.015687346458435, + "learning_rate": 0.00022614090619491568, + "loss": 0.5084867000579834, + "mean_token_accuracy": 0.8495561093091964, + "num_tokens": 1077649.0, + "step": 460 + }, + { + "epoch": 1.1444582814445827, + "eval_entropy": 0.5841563874205877, + "eval_loss": 0.5693665742874146, + "eval_mean_token_accuracy": 0.8427817298229351, + "eval_num_tokens": 1077649.0, + "eval_runtime": 86.5256, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 460 + }, + { + "entropy": 0.5828216474503278, + "epoch": 1.1942714819427147, + "grad_norm": 1.9750930070877075, + "learning_rate": 0.00022602666254299594, + "loss": 0.5180017948150635, + "mean_token_accuracy": 0.8515685826539994, + "num_tokens": 1124872.0, + "step": 480 + }, + { + "epoch": 1.1942714819427147, + "eval_entropy": 0.5806607044366903, + "eval_loss": 0.5804352760314941, + "eval_mean_token_accuracy": 0.8413014668364858, + "eval_num_tokens": 1124872.0, + "eval_runtime": 86.1199, + "eval_samples_per_second": 15.966, + "eval_steps_per_second": 1.997, + "step": 480 + }, + { + "entropy": 0.5926914308220148, + "epoch": 1.244084682440847, + "grad_norm": 0.8917353749275208, + "learning_rate": 0.0002258783737314558, + "loss": 0.528910779953003, + "mean_token_accuracy": 0.8486074328422546, + "num_tokens": 1168698.0, + "step": 500 + }, + { + "epoch": 1.244084682440847, + "eval_entropy": 0.5593361884009006, + "eval_loss": 0.5675153732299805, + "eval_mean_token_accuracy": 0.8433507802181466, + "eval_num_tokens": 1168698.0, + "eval_runtime": 86.7289, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 500 + }, + { + "entropy": 0.5865630559623242, + "epoch": 1.293897882938979, + "grad_norm": 0.7482362985610962, + "learning_rate": 0.00022569608448217823, + "loss": 0.5250466823577881, + "mean_token_accuracy": 0.8477916084229946, + "num_tokens": 1216679.0, + "step": 520 + }, + { + "epoch": 1.293897882938979, + "eval_entropy": 0.543057840230853, + "eval_loss": 0.5671008229255676, + "eval_mean_token_accuracy": 0.8428726016088973, + "eval_num_tokens": 1216679.0, + "eval_runtime": 86.3403, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 520 + }, + { + "entropy": 0.5870206747204065, + "epoch": 1.3437110834371109, + "grad_norm": 0.9473814964294434, + "learning_rate": 0.00022547984977111448, + "loss": 0.5252370834350586, + "mean_token_accuracy": 0.8468369916081429, + "num_tokens": 1261365.0, + "step": 540 + }, + { + "epoch": 1.3437110834371109, + "eval_entropy": 0.590982622878496, + "eval_loss": 0.5676343441009521, + "eval_mean_token_accuracy": 0.8429348746011424, + "eval_num_tokens": 1261365.0, + "eval_runtime": 86.5168, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 540 + }, + { + "entropy": 0.5785854265093804, + "epoch": 1.3935242839352429, + "grad_norm": 0.9353351593017578, + "learning_rate": 0.0002252297348117042, + "loss": 0.5304938316345215, + "mean_token_accuracy": 0.8463383808732032, + "num_tokens": 1306879.0, + "step": 560 + }, + { + "epoch": 1.3935242839352429, + "eval_entropy": 0.6099918867612995, + "eval_loss": 0.5620437860488892, + "eval_mean_token_accuracy": 0.8430728347495545, + "eval_num_tokens": 1306879.0, + "eval_runtime": 86.7741, + "eval_samples_per_second": 15.846, + "eval_steps_per_second": 1.982, + "step": 560 + }, + { + "entropy": 0.5768801040947438, + "epoch": 1.4433374844333748, + "grad_norm": 0.9198738932609558, + "learning_rate": 0.0002249458150352077, + "loss": 0.520513391494751, + "mean_token_accuracy": 0.8487689301371575, + "num_tokens": 1353534.0, + "step": 580 + }, + { + "epoch": 1.4433374844333748, + "eval_entropy": 0.6349420670506566, + "eval_loss": 0.5645340085029602, + "eval_mean_token_accuracy": 0.8447844597489335, + "eval_num_tokens": 1353534.0, + "eval_runtime": 86.3257, + "eval_samples_per_second": 15.928, + "eval_steps_per_second": 1.992, + "step": 580 + }, + { + "entropy": 0.5822233572602272, + "epoch": 1.4931506849315068, + "grad_norm": 0.832811176776886, + "learning_rate": 0.0002246281760679571, + "loss": 0.5295282363891601, + "mean_token_accuracy": 0.8504064798355102, + "num_tokens": 1399537.0, + "step": 600 + }, + { + "epoch": 1.4931506849315068, + "eval_entropy": 0.5829724387027496, + "eval_loss": 0.5612193942070007, + "eval_mean_token_accuracy": 0.8449643853791925, + "eval_num_tokens": 1399537.0, + "eval_runtime": 86.6617, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 600 + }, + { + "entropy": 0.571855777129531, + "epoch": 1.5429638854296388, + "grad_norm": 0.7665547728538513, + "learning_rate": 0.00022427691370553263, + "loss": 0.5187931060791016, + "mean_token_accuracy": 0.8534420043230057, + "num_tokens": 1448422.0, + "step": 620 + }, + { + "epoch": 1.5429638854296388, + "eval_entropy": 0.5623592240519302, + "eval_loss": 0.5575760006904602, + "eval_mean_token_accuracy": 0.8468210229346919, + "eval_num_tokens": 1448422.0, + "eval_runtime": 86.6324, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 620 + }, + { + "entropy": 0.5740394659340382, + "epoch": 1.592777085927771, + "grad_norm": 0.6500429511070251, + "learning_rate": 0.00022389213388387174, + "loss": 0.5283198833465577, + "mean_token_accuracy": 0.8502798482775689, + "num_tokens": 1495009.0, + "step": 640 + }, + { + "epoch": 1.592777085927771, + "eval_entropy": 0.5548852207355721, + "eval_loss": 0.5561797022819519, + "eval_mean_token_accuracy": 0.8452786498291548, + "eval_num_tokens": 1495009.0, + "eval_runtime": 86.5205, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 640 + }, + { + "entropy": 0.6020145989954472, + "epoch": 1.6425902864259028, + "grad_norm": 0.7056867480278015, + "learning_rate": 0.00022347395264732053, + "loss": 0.5400049209594726, + "mean_token_accuracy": 0.8447613954544068, + "num_tokens": 1536932.0, + "step": 660 + }, + { + "epoch": 1.6425902864259028, + "eval_entropy": 0.5618055154417836, + "eval_loss": 0.556106686592102, + "eval_mean_token_accuracy": 0.8465680112672407, + "eval_num_tokens": 1536932.0, + "eval_runtime": 86.2971, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 660 + }, + { + "entropy": 0.5665927153080702, + "epoch": 1.692403486924035, + "grad_norm": 0.5987663865089417, + "learning_rate": 0.00022302249611363625, + "loss": 0.5143643856048584, + "mean_token_accuracy": 0.8529589556157589, + "num_tokens": 1585718.0, + "step": 680 + }, + { + "epoch": 1.692403486924035, + "eval_entropy": 0.568248552118623, + "eval_loss": 0.5476346015930176, + "eval_mean_token_accuracy": 0.8476775434128073, + "eval_num_tokens": 1585718.0, + "eval_runtime": 86.9583, + "eval_samples_per_second": 15.812, + "eval_steps_per_second": 1.978, + "step": 680 + }, + { + "entropy": 0.5673687808215618, + "epoch": 1.7422166874221667, + "grad_norm": 0.735261857509613, + "learning_rate": 0.00022253790043595193, + "loss": 0.509885597229004, + "mean_token_accuracy": 0.8537046857178211, + "num_tokens": 1635718.0, + "step": 700 + }, + { + "epoch": 1.7422166874221667, + "eval_entropy": 0.5616967284748721, + "eval_loss": 0.5439274311065674, + "eval_mean_token_accuracy": 0.8488946217437123, + "eval_num_tokens": 1635718.0, + "eval_runtime": 86.0604, + "eval_samples_per_second": 15.977, + "eval_steps_per_second": 1.999, + "step": 700 + }, + { + "entropy": 0.5529541682451964, + "epoch": 1.792029887920299, + "grad_norm": 0.7014835476875305, + "learning_rate": 0.00022202031176171442, + "loss": 0.5078992366790771, + "mean_token_accuracy": 0.8525233261287213, + "num_tokens": 1681291.0, + "step": 720 + }, + { + "epoch": 1.792029887920299, + "eval_entropy": 0.5827173320359962, + "eval_loss": 0.5419450402259827, + "eval_mean_token_accuracy": 0.8477318609176681, + "eval_num_tokens": 1681291.0, + "eval_runtime": 85.2984, + "eval_samples_per_second": 16.12, + "eval_steps_per_second": 2.016, + "step": 720 + }, + { + "entropy": 0.5755720350891351, + "epoch": 1.841843088418431, + "grad_norm": 0.705613911151886, + "learning_rate": 0.00022146988618860824, + "loss": 0.5181350708007812, + "mean_token_accuracy": 0.8467609457671642, + "num_tokens": 1729102.0, + "step": 740 + }, + { + "epoch": 1.841843088418431, + "eval_entropy": 0.5743971356125765, + "eval_loss": 0.5415896773338318, + "eval_mean_token_accuracy": 0.847328585940738, + "eval_num_tokens": 1729102.0, + "eval_runtime": 85.5602, + "eval_samples_per_second": 16.071, + "eval_steps_per_second": 2.01, + "step": 740 + }, + { + "entropy": 0.561330484598875, + "epoch": 1.891656288916563, + "grad_norm": 0.6722865700721741, + "learning_rate": 0.0002208867897174789, + "loss": 0.499837589263916, + "mean_token_accuracy": 0.8518734864890576, + "num_tokens": 1773578.0, + "step": 760 + }, + { + "epoch": 1.891656288916563, + "eval_entropy": 0.5865232653396074, + "eval_loss": 0.5437926650047302, + "eval_mean_token_accuracy": 0.8450997017843779, + "eval_num_tokens": 1773578.0, + "eval_runtime": 86.4116, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 760 + }, + { + "entropy": 0.547389242425561, + "epoch": 1.9414694894146949, + "grad_norm": 0.7935577034950256, + "learning_rate": 0.00022027119820226907, + "loss": 0.4977591514587402, + "mean_token_accuracy": 0.8539491161704064, + "num_tokens": 1821725.0, + "step": 780 + }, + { + "epoch": 1.9414694894146949, + "eval_entropy": 0.5290903090391048, + "eval_loss": 0.5409526824951172, + "eval_mean_token_accuracy": 0.8497545698354411, + "eval_num_tokens": 1821725.0, + "eval_runtime": 86.7262, + "eval_samples_per_second": 15.854, + "eval_steps_per_second": 1.983, + "step": 780 + }, + { + "entropy": 0.5687909748405218, + "epoch": 1.9912826899128269, + "grad_norm": 0.6180546283721924, + "learning_rate": 0.00021962329729698345, + "loss": 0.5109643459320068, + "mean_token_accuracy": 0.8521598495543004, + "num_tokens": 1868431.0, + "step": 800 + }, + { + "epoch": 1.9912826899128269, + "eval_entropy": 0.5503541858390321, + "eval_loss": 0.5361555218696594, + "eval_mean_token_accuracy": 0.8510884285666221, + "eval_num_tokens": 1868431.0, + "eval_runtime": 86.3339, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 800 + }, + { + "entropy": 0.4739728841261986, + "epoch": 2.0398505603985058, + "grad_norm": 0.8058829307556152, + "learning_rate": 0.0002189432823996982, + "loss": 0.4204097747802734, + "mean_token_accuracy": 0.8728981889211215, + "num_tokens": 1915280.0, + "step": 820 + }, + { + "epoch": 2.0398505603985058, + "eval_entropy": 0.5077334992414297, + "eval_loss": 0.5531114339828491, + "eval_mean_token_accuracy": 0.8489257208136625, + "eval_num_tokens": 1915280.0, + "eval_runtime": 86.4801, + "eval_samples_per_second": 15.9, + "eval_steps_per_second": 1.989, + "step": 820 + }, + { + "entropy": 0.4594309840351343, + "epoch": 2.0896637608966375, + "grad_norm": 0.6906896829605103, + "learning_rate": 0.0002182313585936314, + "loss": 0.4071959495544434, + "mean_token_accuracy": 0.8732857562601566, + "num_tokens": 1965306.0, + "step": 840 + }, + { + "epoch": 2.0896637608966375, + "eval_entropy": 0.49850136994622474, + "eval_loss": 0.5486204624176025, + "eval_mean_token_accuracy": 0.8507991450470548, + "eval_num_tokens": 1965306.0, + "eval_runtime": 86.3364, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 840 + }, + { + "entropy": 0.4881629109382629, + "epoch": 2.1394769613947697, + "grad_norm": 0.6343470215797424, + "learning_rate": 0.0002174877405852928, + "loss": 0.41669540405273436, + "mean_token_accuracy": 0.8711295068264008, + "num_tokens": 2008562.0, + "step": 860 + }, + { + "epoch": 2.1394769613947697, + "eval_entropy": 0.49155513924914734, + "eval_loss": 0.555109441280365, + "eval_mean_token_accuracy": 0.8496399400539176, + "eval_num_tokens": 2008562.0, + "eval_runtime": 86.3295, + "eval_samples_per_second": 15.927, + "eval_steps_per_second": 1.992, + "step": 860 + }, + { + "entropy": 0.4648668970912695, + "epoch": 2.1892901618929015, + "grad_norm": 0.8014165163040161, + "learning_rate": 0.00021671265263973133, + "loss": 0.4110250473022461, + "mean_token_accuracy": 0.8754166305065155, + "num_tokens": 2056474.0, + "step": 880 + }, + { + "epoch": 2.1892901618929015, + "eval_entropy": 0.4909258722219356, + "eval_loss": 0.5539511442184448, + "eval_mean_token_accuracy": 0.8492401502160138, + "eval_num_tokens": 2056474.0, + "eval_runtime": 86.3468, + "eval_samples_per_second": 15.924, + "eval_steps_per_second": 1.992, + "step": 880 + }, + { + "entropy": 0.4824485514312983, + "epoch": 2.2391033623910337, + "grad_norm": 0.6665191054344177, + "learning_rate": 0.00021590632851289967, + "loss": 0.4181404113769531, + "mean_token_accuracy": 0.8726993151009083, + "num_tokens": 2103543.0, + "step": 900 + }, + { + "epoch": 2.2391033623910337, + "eval_entropy": 0.4986876940657926, + "eval_loss": 0.547695517539978, + "eval_mean_token_accuracy": 0.8501384708770486, + "eval_num_tokens": 2103543.0, + "eval_runtime": 86.3838, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 900 + }, + { + "entropy": 0.4751896943897009, + "epoch": 2.2889165628891655, + "grad_norm": 0.81158047914505, + "learning_rate": 0.00021506901138115678, + "loss": 0.40689678192138673, + "mean_token_accuracy": 0.8745221219956875, + "num_tokens": 2147861.0, + "step": 920 + }, + { + "epoch": 2.2889165628891655, + "eval_entropy": 0.507153491121392, + "eval_loss": 0.5501641631126404, + "eval_mean_token_accuracy": 0.8495670116918032, + "eval_num_tokens": 2147861.0, + "eval_runtime": 86.0912, + "eval_samples_per_second": 15.971, + "eval_steps_per_second": 1.998, + "step": 920 + }, + { + "entropy": 0.4873133715242147, + "epoch": 2.3387297633872977, + "grad_norm": 0.7218056321144104, + "learning_rate": 0.0002142009537679292, + "loss": 0.42701358795166017, + "mean_token_accuracy": 0.8695114746689796, + "num_tokens": 2190561.0, + "step": 940 + }, + { + "epoch": 2.3387297633872977, + "eval_entropy": 0.5202612736543943, + "eval_loss": 0.5491839051246643, + "eval_mean_token_accuracy": 0.8494071208460386, + "eval_num_tokens": 2190561.0, + "eval_runtime": 86.1142, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 940 + }, + { + "entropy": 0.4762951169162989, + "epoch": 2.3885429638854294, + "grad_norm": 0.7194424867630005, + "learning_rate": 0.0002133024174675534, + "loss": 0.42299847602844237, + "mean_token_accuracy": 0.8709790132939815, + "num_tokens": 2239412.0, + "step": 960 + }, + { + "epoch": 2.3885429638854294, + "eval_entropy": 0.4899340462546016, + "eval_loss": 0.5522511601448059, + "eval_mean_token_accuracy": 0.8492208258357159, + "eval_num_tokens": 2239412.0, + "eval_runtime": 86.463, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 960 + }, + { + "entropy": 0.49650347977876663, + "epoch": 2.4383561643835616, + "grad_norm": 0.8406022787094116, + "learning_rate": 0.0002123736734663221, + "loss": 0.4275330066680908, + "mean_token_accuracy": 0.8670595556497573, + "num_tokens": 2286283.0, + "step": 980 + }, + { + "epoch": 2.4383561643835616, + "eval_entropy": 0.49691385654515996, + "eval_loss": 0.5491269826889038, + "eval_mean_token_accuracy": 0.850309816210769, + "eval_num_tokens": 2286283.0, + "eval_runtime": 86.17, + "eval_samples_per_second": 15.957, + "eval_steps_per_second": 1.996, + "step": 980 + }, + { + "entropy": 0.48843890577554705, + "epoch": 2.488169364881694, + "grad_norm": 0.9082473516464233, + "learning_rate": 0.00021141500186075868, + "loss": 0.4309722423553467, + "mean_token_accuracy": 0.8686766296625137, + "num_tokens": 2333733.0, + "step": 1000 + }, + { + "epoch": 2.488169364881694, + "eval_entropy": 0.5543508351195691, + "eval_loss": 0.5478800535202026, + "eval_mean_token_accuracy": 0.8478029522784921, + "eval_num_tokens": 2333733.0, + "eval_runtime": 86.3835, + "eval_samples_per_second": 15.917, + "eval_steps_per_second": 1.991, + "step": 1000 + }, + { + "entropy": 0.4777219031006098, + "epoch": 2.5379825653798256, + "grad_norm": 0.7448089122772217, + "learning_rate": 0.0002104266917731438, + "loss": 0.423325252532959, + "mean_token_accuracy": 0.8706337086856365, + "num_tokens": 2384270.0, + "step": 1020 + }, + { + "epoch": 2.5379825653798256, + "eval_entropy": 0.49857561550168106, + "eval_loss": 0.5511948466300964, + "eval_mean_token_accuracy": 0.8502220289651737, + "eval_num_tokens": 2384270.0, + "eval_runtime": 86.5399, + "eval_samples_per_second": 15.889, + "eval_steps_per_second": 1.988, + "step": 1020 + }, + { + "entropy": 0.4844174191355705, + "epoch": 2.587795765877958, + "grad_norm": 0.794029176235199, + "learning_rate": 0.00020940904126432, + "loss": 0.4176753044128418, + "mean_token_accuracy": 0.873535567522049, + "num_tokens": 2428036.0, + "step": 1040 + }, + { + "epoch": 2.587795765877958, + "eval_entropy": 0.485467542222766, + "eval_loss": 0.5539286732673645, + "eval_mean_token_accuracy": 0.8495475081510322, + "eval_num_tokens": 2428036.0, + "eval_runtime": 86.135, + "eval_samples_per_second": 15.963, + "eval_steps_per_second": 1.997, + "step": 1040 + }, + { + "entropy": 0.49070929251611234, + "epoch": 2.6376089663760895, + "grad_norm": 0.7558256983757019, + "learning_rate": 0.0002083623572438007, + "loss": 0.42867293357849123, + "mean_token_accuracy": 0.8696666076779366, + "num_tokens": 2476815.0, + "step": 1060 + }, + { + "epoch": 2.6376089663760895, + "eval_entropy": 0.490822730889154, + "eval_loss": 0.5434785485267639, + "eval_mean_token_accuracy": 0.850568296950917, + "eval_num_tokens": 2476815.0, + "eval_runtime": 86.4933, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 1060 + }, + { + "entropy": 0.47806114703416824, + "epoch": 2.6874221668742218, + "grad_norm": 0.6608979105949402, + "learning_rate": 0.00020728695537721047, + "loss": 0.4289727687835693, + "mean_token_accuracy": 0.8693130135536193, + "num_tokens": 2527131.0, + "step": 1080 + }, + { + "epoch": 2.6874221668742218, + "eval_entropy": 0.5285773256490397, + "eval_loss": 0.5444230437278748, + "eval_mean_token_accuracy": 0.8498796481032704, + "eval_num_tokens": 2527131.0, + "eval_runtime": 86.7091, + "eval_samples_per_second": 15.858, + "eval_steps_per_second": 1.984, + "step": 1080 + }, + { + "entropy": 0.5046216730028391, + "epoch": 2.7372353673723535, + "grad_norm": 0.8428544998168945, + "learning_rate": 0.00020618315999108454, + "loss": 0.43131070137023925, + "mean_token_accuracy": 0.8701941035687923, + "num_tokens": 2572537.0, + "step": 1100 + }, + { + "epoch": 2.7372353673723535, + "eval_entropy": 0.49888394738352576, + "eval_loss": 0.5459766387939453, + "eval_mean_token_accuracy": 0.8511758872935938, + "eval_num_tokens": 2572537.0, + "eval_runtime": 86.2222, + "eval_samples_per_second": 15.947, + "eval_steps_per_second": 1.995, + "step": 1100 + }, + { + "entropy": 0.5212558470666409, + "epoch": 2.7870485678704857, + "grad_norm": 1.129318118095398, + "learning_rate": 0.00020505130397505635, + "loss": 0.44249300956726073, + "mean_token_accuracy": 0.8654101334512234, + "num_tokens": 2616047.0, + "step": 1120 + }, + { + "epoch": 2.7870485678704857, + "eval_entropy": 0.5179622324053631, + "eval_loss": 0.5522801280021667, + "eval_mean_token_accuracy": 0.8497019947268242, + "eval_num_tokens": 2616047.0, + "eval_runtime": 86.1903, + "eval_samples_per_second": 15.953, + "eval_steps_per_second": 1.996, + "step": 1120 + }, + { + "entropy": 0.4988406613469124, + "epoch": 2.8368617683686175, + "grad_norm": 0.6460545063018799, + "learning_rate": 0.00020389172868146263, + "loss": 0.4386270523071289, + "mean_token_accuracy": 0.8690383620560169, + "num_tokens": 2664744.0, + "step": 1140 + }, + { + "epoch": 2.8368617683686175, + "eval_entropy": 0.5042278484203094, + "eval_loss": 0.5433034300804138, + "eval_mean_token_accuracy": 0.8497674451317898, + "eval_num_tokens": 2664744.0, + "eval_runtime": 86.3028, + "eval_samples_per_second": 15.932, + "eval_steps_per_second": 1.993, + "step": 1140 + }, + { + "entropy": 0.4926559619605541, + "epoch": 2.8866749688667497, + "grad_norm": 0.8199329972267151, + "learning_rate": 0.00020270478382239615, + "loss": 0.4313485145568848, + "mean_token_accuracy": 0.8674727231264114, + "num_tokens": 2710196.0, + "step": 1160 + }, + { + "epoch": 2.8866749688667497, + "eval_entropy": 0.503873193160046, + "eval_loss": 0.5388111472129822, + "eval_mean_token_accuracy": 0.8526195034731266, + "eval_num_tokens": 2710196.0, + "eval_runtime": 86.4054, + "eval_samples_per_second": 15.913, + "eval_steps_per_second": 1.991, + "step": 1160 + }, + { + "entropy": 0.5020013231784105, + "epoch": 2.936488169364882, + "grad_norm": 0.7344821095466614, + "learning_rate": 0.00020149082736423723, + "loss": 0.43590536117553713, + "mean_token_accuracy": 0.8671772189438343, + "num_tokens": 2758752.0, + "step": 1180 + }, + { + "epoch": 2.936488169364882, + "eval_entropy": 0.5368241809828337, + "eval_loss": 0.5355703830718994, + "eval_mean_token_accuracy": 0.8517617773871089, + "eval_num_tokens": 2758752.0, + "eval_runtime": 86.2945, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1180 + }, + { + "entropy": 0.5112275708466768, + "epoch": 2.9863013698630136, + "grad_norm": 0.6951606869697571, + "learning_rate": 0.00020025022541969622, + "loss": 0.43579301834106443, + "mean_token_accuracy": 0.8641206480562686, + "num_tokens": 2803186.0, + "step": 1200 + }, + { + "epoch": 2.9863013698630136, + "eval_entropy": 0.5066795706055885, + "eval_loss": 0.5415249466896057, + "eval_mean_token_accuracy": 0.8493563373421513, + "eval_num_tokens": 2803186.0, + "eval_runtime": 86.5005, + "eval_samples_per_second": 15.896, + "eval_steps_per_second": 1.988, + "step": 1200 + }, + { + "entropy": 0.42298635305502474, + "epoch": 3.0348692403486925, + "grad_norm": 0.8201794028282166, + "learning_rate": 0.00019898335213739863, + "loss": 0.35593905448913576, + "mean_token_accuracy": 0.889238600547497, + "num_tokens": 2848509.0, + "step": 1220 + }, + { + "epoch": 3.0348692403486925, + "eval_entropy": 0.4584170470750609, + "eval_loss": 0.569487452507019, + "eval_mean_token_accuracy": 0.8495814173027526, + "eval_num_tokens": 2848509.0, + "eval_runtime": 86.2281, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 1220 + }, + { + "entropy": 0.37450140453875064, + "epoch": 3.0846824408468243, + "grad_norm": 0.7308394908905029, + "learning_rate": 0.0001976905895890471, + "loss": 0.307823920249939, + "mean_token_accuracy": 0.9001288741827012, + "num_tokens": 2894976.0, + "step": 1240 + }, + { + "epoch": 3.0846824408468243, + "eval_entropy": 0.45185995916294497, + "eval_loss": 0.5672881603240967, + "eval_mean_token_accuracy": 0.8511318519364955, + "eval_num_tokens": 2894976.0, + "eval_runtime": 86.0819, + "eval_samples_per_second": 15.973, + "eval_steps_per_second": 1.998, + "step": 1240 + }, + { + "entropy": 0.3887945845723152, + "epoch": 3.1344956413449565, + "grad_norm": 0.7299330830574036, + "learning_rate": 0.0001963723276541939, + "loss": 0.32047903537750244, + "mean_token_accuracy": 0.8960984498262405, + "num_tokens": 2944401.0, + "step": 1260 + }, + { + "epoch": 3.1344956413449565, + "eval_entropy": 0.44865354549053105, + "eval_loss": 0.5666037201881409, + "eval_mean_token_accuracy": 0.8496572649063066, + "eval_num_tokens": 2944401.0, + "eval_runtime": 86.4858, + "eval_samples_per_second": 15.899, + "eval_steps_per_second": 1.989, + "step": 1260 + }, + { + "entropy": 0.39677664265036583, + "epoch": 3.1843088418430883, + "grad_norm": 0.9533219933509827, + "learning_rate": 0.00019502896390265838, + "loss": 0.3253983497619629, + "mean_token_accuracy": 0.8964207418262958, + "num_tokens": 2990243.0, + "step": 1280 + }, + { + "epoch": 3.1843088418430883, + "eval_entropy": 0.4641980809527774, + "eval_loss": 0.5814996957778931, + "eval_mean_token_accuracy": 0.8485886212005171, + "eval_num_tokens": 2990243.0, + "eval_runtime": 86.7784, + "eval_samples_per_second": 15.845, + "eval_steps_per_second": 1.982, + "step": 1280 + }, + { + "entropy": 0.39210722744464876, + "epoch": 3.2341220423412205, + "grad_norm": 0.7447651028633118, + "learning_rate": 0.00019366090347462545, + "loss": 0.3276803970336914, + "mean_token_accuracy": 0.8930055953562259, + "num_tokens": 3037248.0, + "step": 1300 + }, + { + "epoch": 3.2341220423412205, + "eval_entropy": 0.43595615254585135, + "eval_loss": 0.5722188353538513, + "eval_mean_token_accuracy": 0.8501105755567551, + "eval_num_tokens": 3037248.0, + "eval_runtime": 86.5271, + "eval_samples_per_second": 15.891, + "eval_steps_per_second": 1.988, + "step": 1300 + }, + { + "entropy": 0.3684127271175385, + "epoch": 3.2839352428393527, + "grad_norm": 0.6934201121330261, + "learning_rate": 0.00019226855895846078, + "loss": 0.3156379222869873, + "mean_token_accuracy": 0.8976306475698947, + "num_tokens": 3088676.0, + "step": 1320 + }, + { + "epoch": 3.2839352428393527, + "eval_entropy": 0.4628148723480313, + "eval_loss": 0.5631352066993713, + "eval_mean_token_accuracy": 0.8504934813394103, + "eval_num_tokens": 3088676.0, + "eval_runtime": 86.3436, + "eval_samples_per_second": 15.925, + "eval_steps_per_second": 1.992, + "step": 1320 + }, + { + "entropy": 0.4073401909321547, + "epoch": 3.3337484433374844, + "grad_norm": 0.9386897683143616, + "learning_rate": 0.00019085235026627994, + "loss": 0.34265310764312745, + "mean_token_accuracy": 0.8902062118053437, + "num_tokens": 3132874.0, + "step": 1340 + }, + { + "epoch": 3.3337484433374844, + "eval_entropy": 0.46455050623694133, + "eval_loss": 0.5586736798286438, + "eval_mean_token_accuracy": 0.8506874702004499, + "eval_num_tokens": 3132874.0, + "eval_runtime": 86.1286, + "eval_samples_per_second": 15.964, + "eval_steps_per_second": 1.997, + "step": 1340 + }, + { + "entropy": 0.4046429242938757, + "epoch": 3.383561643835616, + "grad_norm": 0.9633992314338684, + "learning_rate": 0.00018941270450730836, + "loss": 0.33816893100738527, + "mean_token_accuracy": 0.8927541889250279, + "num_tokens": 3178055.0, + "step": 1360 + }, + { + "epoch": 3.383561643835616, + "eval_entropy": 0.46846531660750856, + "eval_loss": 0.561501681804657, + "eval_mean_token_accuracy": 0.8496256377114806, + "eval_num_tokens": 3178055.0, + "eval_runtime": 86.685, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1360 + }, + { + "entropy": 0.39872407019138334, + "epoch": 3.4333748443337484, + "grad_norm": 0.7786458730697632, + "learning_rate": 0.00018795005585907113, + "loss": 0.33342490196228025, + "mean_token_accuracy": 0.8944805048406124, + "num_tokens": 3223389.0, + "step": 1380 + }, + { + "epoch": 3.4333748443337484, + "eval_entropy": 0.42709505973860273, + "eval_loss": 0.5751848220825195, + "eval_mean_token_accuracy": 0.8507290447867194, + "eval_num_tokens": 3223389.0, + "eval_runtime": 86.6892, + "eval_samples_per_second": 15.861, + "eval_steps_per_second": 1.984, + "step": 1380 + }, + { + "entropy": 0.3923338124528527, + "epoch": 3.4831880448318806, + "grad_norm": 0.9305956363677979, + "learning_rate": 0.0001864648454364511, + "loss": 0.33188116550445557, + "mean_token_accuracy": 0.8943330392241478, + "num_tokens": 3274096.0, + "step": 1400 + }, + { + "epoch": 3.4831880448318806, + "eval_entropy": 0.4386174779298694, + "eval_loss": 0.5680831074714661, + "eval_mean_token_accuracy": 0.8513129727784977, + "eval_num_tokens": 3274096.0, + "eval_runtime": 86.2671, + "eval_samples_per_second": 15.939, + "eval_steps_per_second": 1.994, + "step": 1400 + }, + { + "entropy": 0.3856233984231949, + "epoch": 3.5330012453300124, + "grad_norm": 1.0362752676010132, + "learning_rate": 0.0001849575211586545, + "loss": 0.33098697662353516, + "mean_token_accuracy": 0.8961390435695649, + "num_tokens": 3322044.0, + "step": 1420 + }, + { + "epoch": 3.5330012453300124, + "eval_entropy": 0.4574795474493226, + "eval_loss": 0.5630439519882202, + "eval_mean_token_accuracy": 0.8520988873964133, + "eval_num_tokens": 3322044.0, + "eval_runtime": 86.6035, + "eval_samples_per_second": 15.877, + "eval_steps_per_second": 1.986, + "step": 1420 + }, + { + "entropy": 0.39812871962785723, + "epoch": 3.5828144458281446, + "grad_norm": 0.7807195782661438, + "learning_rate": 0.0001834285376141247, + "loss": 0.3333771228790283, + "mean_token_accuracy": 0.8930827379226685, + "num_tokens": 3369147.0, + "step": 1440 + }, + { + "epoch": 3.5828144458281446, + "eval_entropy": 0.4556825893909432, + "eval_loss": 0.5689062476158142, + "eval_mean_token_accuracy": 0.8507103507601937, + "eval_num_tokens": 3369147.0, + "eval_runtime": 86.1606, + "eval_samples_per_second": 15.959, + "eval_steps_per_second": 1.996, + "step": 1440 + }, + { + "entropy": 0.4147744856774807, + "epoch": 3.6326276463262763, + "grad_norm": 0.6429352164268494, + "learning_rate": 0.00018187835592344443, + "loss": 0.3482560873031616, + "mean_token_accuracy": 0.8910200245678425, + "num_tokens": 3415600.0, + "step": 1460 + }, + { + "epoch": 3.6326276463262763, + "eval_entropy": 0.46600024540757023, + "eval_loss": 0.5609709024429321, + "eval_mean_token_accuracy": 0.8491220876227977, + "eval_num_tokens": 3415600.0, + "eval_runtime": 86.8039, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1460 + }, + { + "entropy": 0.40425071083009245, + "epoch": 3.6824408468244085, + "grad_norm": 0.8613698482513428, + "learning_rate": 0.0001803074436002682, + "loss": 0.342916464805603, + "mean_token_accuracy": 0.8916418336331844, + "num_tokens": 3460471.0, + "step": 1480 + }, + { + "epoch": 3.6824408468244085, + "eval_entropy": 0.43855057899342026, + "eval_loss": 0.5720968246459961, + "eval_mean_token_accuracy": 0.8500823641932288, + "eval_num_tokens": 3460471.0, + "eval_runtime": 86.6746, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1480 + }, + { + "entropy": 0.39465143866837027, + "epoch": 3.7322540473225407, + "grad_norm": 0.6285189986228943, + "learning_rate": 0.0001787162744103265, + "loss": 0.3424591779708862, + "mean_token_accuracy": 0.8906558901071548, + "num_tokens": 3507647.0, + "step": 1500 + }, + { + "epoch": 3.7322540473225407, + "eval_entropy": 0.4509461877304454, + "eval_loss": 0.5590082406997681, + "eval_mean_token_accuracy": 0.8511747371318729, + "eval_num_tokens": 3507647.0, + "eval_runtime": 86.8126, + "eval_samples_per_second": 15.839, + "eval_steps_per_second": 1.981, + "step": 1500 + }, + { + "entropy": 0.4021005939692259, + "epoch": 3.7820672478206725, + "grad_norm": 0.8821248412132263, + "learning_rate": 0.00017710532822854468, + "loss": 0.3462103843688965, + "mean_token_accuracy": 0.889109355956316, + "num_tokens": 3548934.0, + "step": 1520 + }, + { + "epoch": 3.7820672478206725, + "eval_entropy": 0.4502199075596277, + "eval_loss": 0.566046416759491, + "eval_mean_token_accuracy": 0.8501714208098345, + "eval_num_tokens": 3548934.0, + "eval_runtime": 86.8336, + "eval_samples_per_second": 15.835, + "eval_steps_per_second": 1.981, + "step": 1520 + }, + { + "entropy": 0.4017397932708263, + "epoch": 3.8318804483188043, + "grad_norm": 0.8400952816009521, + "learning_rate": 0.0001754750908943189, + "loss": 0.34890995025634763, + "mean_token_accuracy": 0.8892098367214203, + "num_tokens": 3597186.0, + "step": 1540 + }, + { + "epoch": 3.8318804483188043, + "eval_entropy": 0.4614003023435903, + "eval_loss": 0.5617933869361877, + "eval_mean_token_accuracy": 0.8515863616106122, + "eval_num_tokens": 3597186.0, + "eval_runtime": 86.4609, + "eval_samples_per_second": 15.903, + "eval_steps_per_second": 1.989, + "step": 1540 + }, + { + "entropy": 0.4112051840871572, + "epoch": 3.8816936488169365, + "grad_norm": 0.769478440284729, + "learning_rate": 0.0001738260540649939, + "loss": 0.34711437225341796, + "mean_token_accuracy": 0.8911717928946018, + "num_tokens": 3646646.0, + "step": 1560 + }, + { + "epoch": 3.8816936488169365, + "eval_entropy": 0.4540443811998811, + "eval_loss": 0.5576469898223877, + "eval_mean_token_accuracy": 0.8512079674144124, + "eval_num_tokens": 3646646.0, + "eval_runtime": 86.5103, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 1560 + }, + { + "entropy": 0.41105241514742374, + "epoch": 3.9315068493150687, + "grad_norm": 0.8468427062034607, + "learning_rate": 0.00017215871506758568, + "loss": 0.3433023452758789, + "mean_token_accuracy": 0.8898739732801915, + "num_tokens": 3689560.0, + "step": 1580 + }, + { + "epoch": 3.9315068493150687, + "eval_entropy": 0.4707539707075718, + "eval_loss": 0.5641466379165649, + "eval_mean_token_accuracy": 0.8495440957851188, + "eval_num_tokens": 3689560.0, + "eval_runtime": 86.609, + "eval_samples_per_second": 15.876, + "eval_steps_per_second": 1.986, + "step": 1580 + }, + { + "entropy": 0.41016379147768023, + "epoch": 3.9813200498132004, + "grad_norm": 0.7482675313949585, + "learning_rate": 0.0001704735767487946, + "loss": 0.34550890922546384, + "mean_token_accuracy": 0.8893028847873211, + "num_tokens": 3736533.0, + "step": 1600 + }, + { + "epoch": 3.9813200498132004, + "eval_entropy": 0.46391099864660307, + "eval_loss": 0.5593640804290771, + "eval_mean_token_accuracy": 0.8510130581467651, + "eval_num_tokens": 3736533.0, + "eval_runtime": 86.3975, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 1600 + }, + { + "entropy": 0.33167599791135544, + "epoch": 4.029887920298879, + "grad_norm": 0.9435692429542542, + "learning_rate": 0.00016877114732335337, + "loss": 0.2716026544570923, + "mean_token_accuracy": 0.9133149828666296, + "num_tokens": 3783985.0, + "step": 1620 + }, + { + "epoch": 4.029887920298879, + "eval_entropy": 0.38499350005457567, + "eval_loss": 0.6298249363899231, + "eval_mean_token_accuracy": 0.8488117071778275, + "eval_num_tokens": 3783985.0, + "eval_runtime": 86.2933, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1620 + }, + { + "entropy": 0.3000166634097695, + "epoch": 4.0797011207970115, + "grad_norm": 0.8080845475196838, + "learning_rate": 0.0001670519402207569, + "loss": 0.22617182731628419, + "mean_token_accuracy": 0.9253474645316601, + "num_tokens": 3828830.0, + "step": 1640 + }, + { + "epoch": 4.0797011207970115, + "eval_entropy": 0.370110988703578, + "eval_loss": 0.6338461637496948, + "eval_mean_token_accuracy": 0.8485634801692741, + "eval_num_tokens": 3828830.0, + "eval_runtime": 85.9508, + "eval_samples_per_second": 15.998, + "eval_steps_per_second": 2.001, + "step": 1640 + }, + { + "entropy": 0.2986910421401262, + "epoch": 4.129514321295143, + "grad_norm": 0.7310900092124939, + "learning_rate": 0.0001653164739304185, + "loss": 0.22367463111877442, + "mean_token_accuracy": 0.9252275295555592, + "num_tokens": 3878616.0, + "step": 1660 + }, + { + "epoch": 4.129514321295143, + "eval_entropy": 0.3944379702037157, + "eval_loss": 0.6109381914138794, + "eval_mean_token_accuracy": 0.849291454220927, + "eval_num_tokens": 3878616.0, + "eval_runtime": 86.6728, + "eval_samples_per_second": 15.864, + "eval_steps_per_second": 1.984, + "step": 1660 + }, + { + "entropy": 0.3095553796738386, + "epoch": 4.179327521793275, + "grad_norm": 0.7059140801429749, + "learning_rate": 0.0001635652718453007, + "loss": 0.23651680946350098, + "mean_token_accuracy": 0.9208931416273117, + "num_tokens": 3924763.0, + "step": 1680 + }, + { + "epoch": 4.179327521793275, + "eval_entropy": 0.3910588648949945, + "eval_loss": 0.6104469299316406, + "eval_mean_token_accuracy": 0.8486883893262508, + "eval_num_tokens": 3924763.0, + "eval_runtime": 86.7612, + "eval_samples_per_second": 15.848, + "eval_steps_per_second": 1.982, + "step": 1680 + }, + { + "entropy": 0.3001101028174162, + "epoch": 4.229140722291407, + "grad_norm": 0.6787802577018738, + "learning_rate": 0.00016179886210406728, + "loss": 0.23130471706390382, + "mean_token_accuracy": 0.9233332790434361, + "num_tokens": 3967474.0, + "step": 1700 + }, + { + "epoch": 4.229140722291407, + "eval_entropy": 0.3794369170832079, + "eval_loss": 0.6182110905647278, + "eval_mean_token_accuracy": 0.8495433777570724, + "eval_num_tokens": 3967474.0, + "eval_runtime": 85.94, + "eval_samples_per_second": 16.0, + "eval_steps_per_second": 2.001, + "step": 1700 + }, + { + "entropy": 0.3031421799212694, + "epoch": 4.2789539227895395, + "grad_norm": 0.9732038378715515, + "learning_rate": 0.0001600177774318036, + "loss": 0.2359529733657837, + "mean_token_accuracy": 0.9217648565769195, + "num_tokens": 4013170.0, + "step": 1720 + }, + { + "epoch": 4.2789539227895395, + "eval_entropy": 0.3923123094231583, + "eval_loss": 0.6057384610176086, + "eval_mean_token_accuracy": 0.8508818288182103, + "eval_num_tokens": 4013170.0, + "eval_runtime": 86.7647, + "eval_samples_per_second": 15.847, + "eval_steps_per_second": 1.982, + "step": 1720 + }, + { + "entropy": 0.29365369994193313, + "epoch": 4.328767123287671, + "grad_norm": 0.7681498527526855, + "learning_rate": 0.0001582225549793541, + "loss": 0.2269371747970581, + "mean_token_accuracy": 0.9245341829955578, + "num_tokens": 4062594.0, + "step": 1740 + }, + { + "epoch": 4.328767123287671, + "eval_entropy": 0.4011661055129628, + "eval_loss": 0.6144486665725708, + "eval_mean_token_accuracy": 0.8480324357054955, + "eval_num_tokens": 4062594.0, + "eval_runtime": 87.1306, + "eval_samples_per_second": 15.781, + "eval_steps_per_second": 1.974, + "step": 1740 + }, + { + "entropy": 0.29396994728595016, + "epoch": 4.378580323785803, + "grad_norm": 1.0001007318496704, + "learning_rate": 0.0001564137361613248, + "loss": 0.22777395248413085, + "mean_token_accuracy": 0.9262309700250626, + "num_tokens": 4110719.0, + "step": 1760 + }, + { + "epoch": 4.378580323785803, + "eval_entropy": 0.38518730195802314, + "eval_loss": 0.6202630400657654, + "eval_mean_token_accuracy": 0.8493869807137999, + "eval_num_tokens": 4110719.0, + "eval_runtime": 86.6616, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 1760 + }, + { + "entropy": 0.3096018506214023, + "epoch": 4.428393524283935, + "grad_norm": 1.0448365211486816, + "learning_rate": 0.00015459186649280024, + "loss": 0.23696351051330566, + "mean_token_accuracy": 0.9217322513461113, + "num_tokens": 4156827.0, + "step": 1780 + }, + { + "epoch": 4.428393524283935, + "eval_entropy": 0.3946371126140273, + "eval_loss": 0.6079026460647583, + "eval_mean_token_accuracy": 0.8492515852978063, + "eval_num_tokens": 4156827.0, + "eval_runtime": 86.6582, + "eval_samples_per_second": 15.867, + "eval_steps_per_second": 1.985, + "step": 1780 + }, + { + "entropy": 0.32619857545942066, + "epoch": 4.478206724782067, + "grad_norm": 0.7210651636123657, + "learning_rate": 0.00015275749542482337, + "loss": 0.24651215076446534, + "mean_token_accuracy": 0.9177676141262054, + "num_tokens": 4200878.0, + "step": 1800 + }, + { + "epoch": 4.478206724782067, + "eval_entropy": 0.3947690814560236, + "eval_loss": 0.6065912246704102, + "eval_mean_token_accuracy": 0.8502957744653835, + "eval_num_tokens": 4200878.0, + "eval_runtime": 86.5959, + "eval_samples_per_second": 15.878, + "eval_steps_per_second": 1.986, + "step": 1800 + }, + { + "entropy": 0.3193941755220294, + "epoch": 4.5280199252802, + "grad_norm": 0.8281906843185425, + "learning_rate": 0.0001509111761786888, + "loss": 0.23936262130737304, + "mean_token_accuracy": 0.9201708927750587, + "num_tokens": 4244423.0, + "step": 1820 + }, + { + "epoch": 4.5280199252802, + "eval_entropy": 0.38704028864239537, + "eval_loss": 0.6006569266319275, + "eval_mean_token_accuracy": 0.8502406720505205, + "eval_num_tokens": 4244423.0, + "eval_runtime": 86.8059, + "eval_samples_per_second": 15.84, + "eval_steps_per_second": 1.981, + "step": 1820 + }, + { + "entropy": 0.3164879363030195, + "epoch": 4.577833125778331, + "grad_norm": 0.7892968654632568, + "learning_rate": 0.00014905346557909867, + "loss": 0.24541733264923096, + "mean_token_accuracy": 0.9175932116806507, + "num_tokens": 4289773.0, + "step": 1840 + }, + { + "epoch": 4.577833125778331, + "eval_entropy": 0.38861122120951497, + "eval_loss": 0.6115967631340027, + "eval_mean_token_accuracy": 0.849471275196519, + "eval_num_tokens": 4289773.0, + "eval_runtime": 86.2946, + "eval_samples_per_second": 15.934, + "eval_steps_per_second": 1.993, + "step": 1840 + }, + { + "entropy": 0.3051785985007882, + "epoch": 4.627646326276463, + "grad_norm": 0.8109654188156128, + "learning_rate": 0.0001471849238862319, + "loss": 0.23433220386505127, + "mean_token_accuracy": 0.9206570319831371, + "num_tokens": 4336894.0, + "step": 1860 + }, + { + "epoch": 4.627646326276463, + "eval_entropy": 0.37162452295076015, + "eval_loss": 0.6184061765670776, + "eval_mean_token_accuracy": 0.8501173268223918, + "eval_num_tokens": 4336894.0, + "eval_runtime": 86.6865, + "eval_samples_per_second": 15.862, + "eval_steps_per_second": 1.984, + "step": 1860 + }, + { + "entropy": 0.3168198253959417, + "epoch": 4.677459526774595, + "grad_norm": 0.9512342214584351, + "learning_rate": 0.0001453061146267775, + "loss": 0.23832404613494873, + "mean_token_accuracy": 0.9197044663131237, + "num_tokens": 4382947.0, + "step": 1880 + }, + { + "epoch": 4.677459526774595, + "eval_entropy": 0.3845940856912801, + "eval_loss": 0.606762707233429, + "eval_mean_token_accuracy": 0.8504838194957999, + "eval_num_tokens": 4382947.0, + "eval_runtime": 86.5175, + "eval_samples_per_second": 15.893, + "eval_steps_per_second": 1.988, + "step": 1880 + }, + { + "entropy": 0.30791807882487776, + "epoch": 4.7272727272727275, + "grad_norm": 0.8123113512992859, + "learning_rate": 0.00014341760442398248, + "loss": 0.2395785331726074, + "mean_token_accuracy": 0.918928150832653, + "num_tokens": 4433050.0, + "step": 1900 + }, + { + "epoch": 4.7272727272727275, + "eval_entropy": 0.39762327222283494, + "eval_loss": 0.5994202494621277, + "eval_mean_token_accuracy": 0.8509274201337681, + "eval_num_tokens": 4433050.0, + "eval_runtime": 86.2873, + "eval_samples_per_second": 15.935, + "eval_steps_per_second": 1.993, + "step": 1900 + }, + { + "entropy": 0.3021434534341097, + "epoch": 4.777085927770859, + "grad_norm": 0.731787383556366, + "learning_rate": 0.000141519962826766, + "loss": 0.23494718074798585, + "mean_token_accuracy": 0.9201403826475143, + "num_tokens": 4483598.0, + "step": 1920 + }, + { + "epoch": 4.777085927770859, + "eval_entropy": 0.3827026732439219, + "eval_loss": 0.5995895862579346, + "eval_mean_token_accuracy": 0.851468373523202, + "eval_num_tokens": 4483598.0, + "eval_runtime": 86.3006, + "eval_samples_per_second": 15.933, + "eval_steps_per_second": 1.993, + "step": 1920 + }, + { + "entropy": 0.31626159623265265, + "epoch": 4.826899128268991, + "grad_norm": 0.8848487138748169, + "learning_rate": 0.00013961376213795132, + "loss": 0.2439030647277832, + "mean_token_accuracy": 0.9196575872600079, + "num_tokens": 4529201.0, + "step": 1940 + }, + { + "epoch": 4.826899128268991, + "eval_entropy": 0.388698436839636, + "eval_loss": 0.6000174283981323, + "eval_mean_token_accuracy": 0.8518068187458571, + "eval_num_tokens": 4529201.0, + "eval_runtime": 86.8979, + "eval_samples_per_second": 15.823, + "eval_steps_per_second": 1.979, + "step": 1940 + }, + { + "entropy": 0.30520407035946845, + "epoch": 4.876712328767123, + "grad_norm": 0.8532460927963257, + "learning_rate": 0.00013769957724166695, + "loss": 0.23458616733551024, + "mean_token_accuracy": 0.9221912942826748, + "num_tokens": 4578167.0, + "step": 1960 + }, + { + "epoch": 4.876712328767123, + "eval_entropy": 0.38777847102908203, + "eval_loss": 0.6004981398582458, + "eval_mean_token_accuracy": 0.8516481768253238, + "eval_num_tokens": 4578167.0, + "eval_runtime": 87.0777, + "eval_samples_per_second": 15.791, + "eval_steps_per_second": 1.975, + "step": 1960 + }, + { + "entropy": 0.3226448342204094, + "epoch": 4.926525529265255, + "grad_norm": 0.6945561766624451, + "learning_rate": 0.0001357779854299694, + "loss": 0.24048397541046143, + "mean_token_accuracy": 0.9195300146937371, + "num_tokens": 4622316.0, + "step": 1980 + }, + { + "epoch": 4.926525529265255, + "eval_entropy": 0.38581624263247777, + "eval_loss": 0.6029234528541565, + "eval_mean_token_accuracy": 0.8514213260523108, + "eval_num_tokens": 4622316.0, + "eval_runtime": 85.8729, + "eval_samples_per_second": 16.012, + "eval_steps_per_second": 2.003, + "step": 1980 + }, + { + "entropy": 0.3051655298098922, + "epoch": 4.976338729763388, + "grad_norm": 0.7976452708244324, + "learning_rate": 0.00013384956622874001, + "loss": 0.23584742546081544, + "mean_token_accuracy": 0.9216851457953453, + "num_tokens": 4670746.0, + "step": 2000 + }, + { + "epoch": 4.976338729763388, + "eval_entropy": 0.37913159246361533, + "eval_loss": 0.6057604551315308, + "eval_mean_token_accuracy": 0.8525801203971686, + "eval_num_tokens": 4670746.0, + "eval_runtime": 86.1145, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2000 + }, + { + "entropy": 0.27438195240803254, + "epoch": 5.024906600249066, + "grad_norm": 0.6729586124420166, + "learning_rate": 0.0001319149012229075, + "loss": 0.19775952100753785, + "mean_token_accuracy": 0.9339428559327737, + "num_tokens": 4716176.0, + "step": 2020 + }, + { + "epoch": 5.024906600249066, + "eval_entropy": 0.3448961910813354, + "eval_loss": 0.6750120520591736, + "eval_mean_token_accuracy": 0.8487970232963562, + "eval_num_tokens": 4716176.0, + "eval_runtime": 86.1169, + "eval_samples_per_second": 15.967, + "eval_steps_per_second": 1.997, + "step": 2020 + }, + { + "entropy": 0.21423916313797237, + "epoch": 5.074719800747198, + "grad_norm": 0.6934391856193542, + "learning_rate": 0.00012997457388105022, + "loss": 0.1439570426940918, + "mean_token_accuracy": 0.9528236843645572, + "num_tokens": 4763269.0, + "step": 2040 + }, + { + "epoch": 5.074719800747198, + "eval_entropy": 0.3570949243771475, + "eval_loss": 0.6465504169464111, + "eval_mean_token_accuracy": 0.8490785547467166, + "eval_num_tokens": 4763269.0, + "eval_runtime": 85.9574, + "eval_samples_per_second": 15.996, + "eval_steps_per_second": 2.001, + "step": 2040 + }, + { + "entropy": 0.20838565267622472, + "epoch": 5.12453300124533, + "grad_norm": 0.7286986112594604, + "learning_rate": 0.00012802916937942972, + "loss": 0.14467307329177856, + "mean_token_accuracy": 0.950994835793972, + "num_tokens": 4809047.0, + "step": 2060 + }, + { + "epoch": 5.12453300124533, + "eval_entropy": 0.3452463157821533, + "eval_loss": 0.6705958843231201, + "eval_mean_token_accuracy": 0.8490352796953778, + "eval_num_tokens": 4809047.0, + "eval_runtime": 86.228, + "eval_samples_per_second": 15.946, + "eval_steps_per_second": 1.995, + "step": 2060 + }, + { + "entropy": 0.20453082229942082, + "epoch": 5.174346201743462, + "grad_norm": 0.7515555620193481, + "learning_rate": 0.00012607927442550974, + "loss": 0.13732000589370727, + "mean_token_accuracy": 0.9537357829511166, + "num_tokens": 4857965.0, + "step": 2080 + }, + { + "epoch": 5.174346201743462, + "eval_entropy": 0.32431264914745506, + "eval_loss": 0.6743043065071106, + "eval_mean_token_accuracy": 0.8504878629085629, + "eval_num_tokens": 4857965.0, + "eval_runtime": 86.5948, + "eval_samples_per_second": 15.879, + "eval_steps_per_second": 1.986, + "step": 2080 + }, + { + "entropy": 0.21812320686876774, + "epoch": 5.224159402241594, + "grad_norm": 0.9093465209007263, + "learning_rate": 0.0001241254770810132, + "loss": 0.14311420917510986, + "mean_token_accuracy": 0.9514068141579628, + "num_tokens": 4905151.0, + "step": 2100 + }, + { + "epoch": 5.224159402241594, + "eval_entropy": 0.33086285835435225, + "eval_loss": 0.6676449179649353, + "eval_mean_token_accuracy": 0.8505287662495015, + "eval_num_tokens": 4905151.0, + "eval_runtime": 86.1253, + "eval_samples_per_second": 15.965, + "eval_steps_per_second": 1.997, + "step": 2100 + }, + { + "entropy": 0.2180163251236081, + "epoch": 5.273972602739726, + "grad_norm": 0.6703007221221924, + "learning_rate": 0.00012216836658457075, + "loss": 0.14803968667984008, + "mean_token_accuracy": 0.9521303348243236, + "num_tokens": 4947072.0, + "step": 2120 + }, + { + "epoch": 5.273972602739726, + "eval_entropy": 0.33162341708707255, + "eval_loss": 0.6658875942230225, + "eval_mean_token_accuracy": 0.8500757605530495, + "eval_num_tokens": 4947072.0, + "eval_runtime": 86.6296, + "eval_samples_per_second": 15.872, + "eval_steps_per_second": 1.985, + "step": 2120 + }, + { + "entropy": 0.22511130161583423, + "epoch": 5.323785803237858, + "grad_norm": 0.8078880906105042, + "learning_rate": 0.00012020853317401455, + "loss": 0.15228408575057983, + "mean_token_accuracy": 0.947144789993763, + "num_tokens": 4991974.0, + "step": 2140 + }, + { + "epoch": 5.323785803237858, + "eval_entropy": 0.3354601170434508, + "eval_loss": 0.6677829623222351, + "eval_mean_token_accuracy": 0.8482600024273229, + "eval_num_tokens": 4991974.0, + "eval_runtime": 86.4689, + "eval_samples_per_second": 15.902, + "eval_steps_per_second": 1.989, + "step": 2140 + }, + { + "entropy": 0.2244176059961319, + "epoch": 5.37359900373599, + "grad_norm": 0.9636075496673584, + "learning_rate": 0.00011824656790837037, + "loss": 0.15260883569717407, + "mean_token_accuracy": 0.9471467643976211, + "num_tokens": 5038400.0, + "step": 2160 + }, + { + "epoch": 5.37359900373599, + "eval_entropy": 0.3381616926297199, + "eval_loss": 0.6694412231445312, + "eval_mean_token_accuracy": 0.8482369603805764, + "eval_num_tokens": 5038400.0, + "eval_runtime": 86.4147, + "eval_samples_per_second": 15.912, + "eval_steps_per_second": 1.99, + "step": 2160 + }, + { + "entropy": 0.22982364390045404, + "epoch": 5.423412204234122, + "grad_norm": 0.775401771068573, + "learning_rate": 0.00011628306248960262, + "loss": 0.15140302181243898, + "mean_token_accuracy": 0.9492553934454918, + "num_tokens": 5083166.0, + "step": 2180 + }, + { + "epoch": 5.423412204234122, + "eval_entropy": 0.3305150235808173, + "eval_loss": 0.6717822551727295, + "eval_mean_token_accuracy": 0.8489849723355715, + "eval_num_tokens": 5083166.0, + "eval_runtime": 86.4728, + "eval_samples_per_second": 15.901, + "eval_steps_per_second": 1.989, + "step": 2180 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.1495650074986086e+17, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5626442a6e8bb724db6ff507a736b3f0a1aa8629 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-220/trainer_state.json @@ -0,0 +1,265 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.547945205479452, + "eval_steps": 20, + "global_step": 220, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.955029806494713, + "epoch": 0.049813200498132, + "grad_norm": 3.020533561706543, + "learning_rate": 1.0694800202775147e-05, + "loss": 1.7107986450195312, + "mean_token_accuracy": 0.6487608112394809, + "num_tokens": 46794.0, + "step": 20 + }, + { + "epoch": 0.049813200498132, + "eval_entropy": 1.3144892034835594, + "eval_loss": 1.1198534965515137, + "eval_mean_token_accuracy": 0.7460246955932572, + "eval_num_tokens": 46794.0, + "eval_runtime": 87.0565, + "eval_samples_per_second": 15.794, + "eval_steps_per_second": 1.976, + "step": 20 + }, + { + "entropy": 1.0063214391469955, + "epoch": 0.099626400996264, + "grad_norm": 1.572906494140625, + "learning_rate": 2.1952484626748985e-05, + "loss": 0.8663722991943359, + "mean_token_accuracy": 0.7779282338917255, + "num_tokens": 90754.0, + "step": 40 + }, + { + "epoch": 0.099626400996264, + "eval_entropy": 0.7921617945959402, + "eval_loss": 0.7062025666236877, + "eval_mean_token_accuracy": 0.8100443180910376, + "eval_num_tokens": 90754.0, + "eval_runtime": 86.5189, + "eval_samples_per_second": 15.892, + "eval_steps_per_second": 1.988, + "step": 40 + }, + { + "entropy": 0.7682028576731682, + "epoch": 0.149439601494396, + "grad_norm": 1.3003711700439453, + "learning_rate": 3.3210169050722824e-05, + "loss": 0.673183822631836, + "mean_token_accuracy": 0.8182129614055157, + "num_tokens": 137472.0, + "step": 60 + }, + { + "epoch": 0.149439601494396, + "eval_entropy": 0.7059133584762729, + "eval_loss": 0.6481946706771851, + "eval_mean_token_accuracy": 0.8227418761613757, + "eval_num_tokens": 137472.0, + "eval_runtime": 86.5098, + "eval_samples_per_second": 15.894, + "eval_steps_per_second": 1.988, + "step": 60 + }, + { + "entropy": 0.7029960259795189, + "epoch": 0.199252801992528, + "grad_norm": 1.3664201498031616, + "learning_rate": 4.4467853474696664e-05, + "loss": 0.6354611873626709, + "mean_token_accuracy": 0.8243416830897331, + "num_tokens": 187408.0, + "step": 80 + }, + { + "epoch": 0.199252801992528, + "eval_entropy": 0.6867308004997498, + "eval_loss": 0.6179807186126709, + "eval_mean_token_accuracy": 0.8302594811417335, + "eval_num_tokens": 187408.0, + "eval_runtime": 86.3969, + "eval_samples_per_second": 15.915, + "eval_steps_per_second": 1.991, + "step": 80 + }, + { + "entropy": 0.6764581337571144, + "epoch": 0.24906600249066002, + "grad_norm": 0.9815880656242371, + "learning_rate": 5.57255378986705e-05, + "loss": 0.5988658905029297, + "mean_token_accuracy": 0.8329168625175953, + "num_tokens": 234197.0, + "step": 100 + }, + { + "epoch": 0.24906600249066002, + "eval_entropy": 0.6790881479202315, + "eval_loss": 0.5998476147651672, + "eval_mean_token_accuracy": 0.8318756420251935, + "eval_num_tokens": 234197.0, + "eval_runtime": 86.6653, + "eval_samples_per_second": 15.866, + "eval_steps_per_second": 1.985, + "step": 100 + }, + { + "entropy": 0.6744543805718421, + "epoch": 0.298879202988792, + "grad_norm": 0.932099461555481, + "learning_rate": 6.698322232264434e-05, + "loss": 0.5991750717163086, + "mean_token_accuracy": 0.8304223112761975, + "num_tokens": 281241.0, + "step": 120 + }, + { + "epoch": 0.298879202988792, + "eval_entropy": 0.6813044282932614, + "eval_loss": 0.5922021269798279, + "eval_mean_token_accuracy": 0.8346439617317777, + "eval_num_tokens": 281241.0, + "eval_runtime": 86.1551, + "eval_samples_per_second": 15.96, + "eval_steps_per_second": 1.996, + "step": 120 + }, + { + "entropy": 0.6663189359009266, + "epoch": 0.34869240348692404, + "grad_norm": 0.9528499841690063, + "learning_rate": 7.824090674661818e-05, + "loss": 0.5891091346740722, + "mean_token_accuracy": 0.832152470946312, + "num_tokens": 327393.0, + "step": 140 + }, + { + "epoch": 0.34869240348692404, + "eval_entropy": 0.6398407208711602, + "eval_loss": 0.5859636664390564, + "eval_mean_token_accuracy": 0.8372074996316156, + "eval_num_tokens": 327393.0, + "eval_runtime": 86.2706, + "eval_samples_per_second": 15.938, + "eval_steps_per_second": 1.994, + "step": 140 + }, + { + "entropy": 0.64859763905406, + "epoch": 0.398505603985056, + "grad_norm": 0.8468204140663147, + "learning_rate": 8.949859117059201e-05, + "loss": 0.569426441192627, + "mean_token_accuracy": 0.8401990942656994, + "num_tokens": 373834.0, + "step": 160 + }, + { + "epoch": 0.398505603985056, + "eval_entropy": 0.6381674285891444, + "eval_loss": 0.5744525790214539, + "eval_mean_token_accuracy": 0.838626817908398, + "eval_num_tokens": 373834.0, + "eval_runtime": 86.2848, + "eval_samples_per_second": 15.936, + "eval_steps_per_second": 1.993, + "step": 160 + }, + { + "entropy": 0.6432608783245086, + "epoch": 0.44831880448318806, + "grad_norm": 0.8765804767608643, + "learning_rate": 0.00010075627559456587, + "loss": 0.5687318801879883, + "mean_token_accuracy": 0.839249350130558, + "num_tokens": 422572.0, + "step": 180 + }, + { + "epoch": 0.44831880448318806, + "eval_entropy": 0.6047098288355872, + "eval_loss": 0.5679298043251038, + "eval_mean_token_accuracy": 0.8410577181466791, + "eval_num_tokens": 422572.0, + "eval_runtime": 86.5879, + "eval_samples_per_second": 15.88, + "eval_steps_per_second": 1.986, + "step": 180 + }, + { + "entropy": 0.6440276011824608, + "epoch": 0.49813200498132004, + "grad_norm": 0.9576020240783691, + "learning_rate": 0.00011201396001853971, + "loss": 0.5828506469726562, + "mean_token_accuracy": 0.837553184479475, + "num_tokens": 471879.0, + "step": 200 + }, + { + "epoch": 0.49813200498132004, + "eval_entropy": 0.6161119360909906, + "eval_loss": 0.5702911615371704, + "eval_mean_token_accuracy": 0.8407089398350827, + "eval_num_tokens": 471879.0, + "eval_runtime": 86.3341, + "eval_samples_per_second": 15.926, + "eval_steps_per_second": 1.992, + "step": 200 + }, + { + "entropy": 0.6377195850014686, + "epoch": 0.547945205479452, + "grad_norm": 0.7212373614311218, + "learning_rate": 0.00012327164444251353, + "loss": 0.5702451229095459, + "mean_token_accuracy": 0.8397969007492065, + "num_tokens": 520984.0, + "step": 220 + }, + { + "epoch": 0.547945205479452, + "eval_entropy": 0.6080108886194784, + "eval_loss": 0.5633499622344971, + "eval_mean_token_accuracy": 0.8396634854549585, + "eval_num_tokens": 520984.0, + "eval_runtime": 86.4945, + "eval_samples_per_second": 15.897, + "eval_steps_per_second": 1.989, + "step": 220 + } + ], + "logging_steps": 20, + "max_steps": 4020, + "num_input_tokens_seen": 0, + "num_train_epochs": 10, + "save_steps": 20, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.2106705362059264e+16, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +} diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/README.md @@ -0,0 +1,209 @@ +--- +base_model: Qwen/Qwen3.5-4B-Base +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:Qwen/Qwen3.5-4B-Base +- lora +- sft +- transformers +- trl +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.18.1 \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/adapter_config.json @@ -0,0 +1,46 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 256, + "lora_bias": false, + "lora_dropout": 0.028265386974777595, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": null, + "peft_type": "LORA", + "peft_version": "0.18.1", + "qalora_group_size": 16, + "r": 128, + "rank_pattern": {}, + "revision": null, + "target_modules": [ + "up_proj", + "q_proj", + "o_proj", + "v_proj", + "k_proj", + "gate_proj", + "down_proj" + ], + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb --- /dev/null +++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/tokenizer_config.json @@ -0,0 +1,31 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|endoftext|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +}