diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/TRAINING_COMPLETED b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/TRAINING_COMPLETED new file mode 100644 index 0000000000000000000000000000000000000000..e69de29bb2d1d6434b8b29ae775ad8c2e48c5391 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/args.json new file mode 100644 index 0000000000000000000000000000000000000000..f87e1241b42011d71443f9395aa0b92b2e8c5058 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..813f75c9673fb9919c650bb329f62094c3d07d41 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(down_proj|gate_proj|v_proj|q_proj|k_proj|o_proj|up_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|gate_proj|mlp.2|mlp.0|attn.proj|up_proj|qkv))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..bcc8efbf11d25d3e7ed72731ad34247675216a66 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:19c7b6c9e258fe66271a3679c27e86db79f4739b8be4db623e005a0d4bb53d09 +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/args.json new file mode 100644 index 0000000000000000000000000000000000000000..f87e1241b42011d71443f9395aa0b92b2e8c5058 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a9b02d296aa7534336f832b01b4983fb2caacee8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7c616c0744da3f03e3e5489e12f828d0f3bfd9fae23f7d49e7cad92255fe3e9b +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..f5e53e48e5fec622175bd1bebb73dde606a590b2 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aa188dff5acda8cb12290fc95ef451bcb6735b4ddba1b421b42f1bb2f9183463 +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..44604aa4fe2d2ae0489dca226164673e37029614 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:728418ac1133c1b0b1a028a3ea4da7777a2f627421ff7d6b9d66de5c01aac457 +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..c92091a276d992bd88a304a21e10d034bbd55271 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:763d728fa1d6bab41a2c53d4f0bb50f0b57c71aa441b675760d7b59b6dfe26da +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a30fcc55e9ef62ec564417a89045d4a74dffe00b --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11e8a58a23502f6544d903f7db155b0a0dd9268605bcbc77d4dbe167f3154e5a +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..3ede66c7c8f028a873a6061044cc1b629f59bc64 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fe525d5a8946fc4c009ddd9ee768eb43eeda360acff3fe55002ed6c7544ebb37 +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..95b672ab9d70dc18163a827b148ac6b3c663964e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8dc44d606cd34981f2e5d0aaf345b289fb26b96615175ea9aa0758e9b6a40b74 +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..44726baffb7c2e27509e9138191bafa648d8f744 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:58714da4b3a169f377914cffd62544399dd1dc2c07629d7be1208b66453d3938 +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..300804e9c318ceff8313441c1a4aed7f0e237b4f --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/global_step780/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0b5b11bbab678f37c2744ef98f9f6acb31d3b7c43d586bc033cfaf1ade9a4ca6 +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/latest new file mode 100644 index 0000000000000000000000000000000000000000..1ec3dad1fcdbec2feb24a2594f56f8ac93ca6ae6 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/latest @@ -0,0 +1 @@ +global_step780 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..461ff944ebf61a9e4990f9cdc6a968469132a466 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d2d67a7653ca73070c0e5e9b7428c6f257c97a2be864621e01245307aa0ab3a8 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..90bf8110af1de0b64cfd8422a53a16bc51624136 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:18ddec5c1474625f52764f045a6604e9ad444b53e7ae8f2dfc5eeb16b1908275 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..75994f46e47f34ec42c93888c5a198e74404711c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fba3ca9ac3c505fa5aa53f3a972536a2ea9e8aae621826ca00f07b215621642a +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..fe274888025e9cf99989265ad530022cb4a4d8d4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9dc72645d284ae879349d1ce218ab2c9cdae1b86fea3db329c1744254ab2e1a5 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..0646fb1416aa820ad7344c8f57bf4215de270b4e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11c2a09183b4bc09c31d7468f22e46cce8c144d0717acf57ffdb4ef886d487cf +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..d66c273829f2b75731ad1050e0cdceca4c0300ca --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cbae61a973b3e66c38aa8d77332d8a94ce591ac7aa54d8199d8d6574ae0991ef +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..ccd4715cf545597a9966489e8088f401442e2c3b --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2b61f6a37e4341149158a625c408bb2f4c38290092daece1108663b1c0350b74 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..17af2adef533e8704eb968e5dd3b60118440ca8f --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8b02085a94dd4126b429b3b7e2aff09d258ed084fd90b539b6fd4712e8a6b1d5 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..372669d5d6117ac9bc43efff9bc091a403d26fbc --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fbb84c2c585c8df368024c404ab725c0b20622db0462431267332163768c002e +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..0ca4b629d3773aed19000c2f0ecc97bbcf32d829 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/trainer_state.json @@ -0,0 +1,6274 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9511889862327911, + "eval_steps": 2000, + "global_step": 780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 2.9617536067962646, + "learning_rate": 3.125e-07, + "loss": 1.4579824209213257, + "step": 1, + "token_acc": 0.6568419333768779 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 1.423774242401123, + "learning_rate": 6.25e-07, + "loss": 1.5049985647201538, + "step": 2, + "token_acc": 0.6365098770992857 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 1.5966103076934814, + "learning_rate": 9.375e-07, + "loss": 1.4851462841033936, + "step": 3, + "token_acc": 0.6467950044849238 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 1.452944278717041, + "learning_rate": 1.25e-06, + "loss": 1.4441643953323364, + "step": 4, + "token_acc": 0.6555674699475139 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 2.1675608158111572, + "learning_rate": 1.5625e-06, + "loss": 1.4831663370132446, + "step": 5, + "token_acc": 0.6366577364403782 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 8.398337364196777, + "learning_rate": 1.875e-06, + "loss": 1.4721344709396362, + "step": 6, + "token_acc": 0.6424400084943724 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 3.0731256008148193, + "learning_rate": 2.1875e-06, + "loss": 1.4525271654129028, + "step": 7, + "token_acc": 0.6579513486678802 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 1.5642091035842896, + "learning_rate": 2.5e-06, + "loss": 1.4381799697875977, + "step": 8, + "token_acc": 0.6511047537890315 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 2.8113529682159424, + "learning_rate": 2.8125e-06, + "loss": 1.541656255722046, + "step": 9, + "token_acc": 0.618830879071843 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.6361396312713623, + "learning_rate": 3.125e-06, + "loss": 1.5417851209640503, + "step": 10, + "token_acc": 0.6177715521179086 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 12.022518157958984, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5132269859313965, + "step": 11, + "token_acc": 0.6238978192242098 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 2.668394088745117, + "learning_rate": 3.75e-06, + "loss": 1.46922767162323, + "step": 12, + "token_acc": 0.6533487002176975 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 7.9799017906188965, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4974768161773682, + "step": 13, + "token_acc": 0.6374414379959843 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 3.233323574066162, + "learning_rate": 4.375e-06, + "loss": 1.4622106552124023, + "step": 14, + "token_acc": 0.6697823145984504 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 24.691530227661133, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.477518081665039, + "step": 15, + "token_acc": 0.66816 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 2.897843360900879, + "learning_rate": 5e-06, + "loss": 1.4357118606567383, + "step": 16, + "token_acc": 0.6778693025809994 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 19.82540512084961, + "learning_rate": 5.3125e-06, + "loss": 1.5187983512878418, + "step": 17, + "token_acc": 0.6306321643400296 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 2.93292236328125, + "learning_rate": 5.625e-06, + "loss": 1.455895185470581, + "step": 18, + "token_acc": 0.6512200710276091 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 1.6330183744430542, + "learning_rate": 5.9375e-06, + "loss": 1.422993540763855, + "step": 19, + "token_acc": 0.661488625487742 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 4.298096179962158, + "learning_rate": 6.25e-06, + "loss": 1.4982240200042725, + "step": 20, + "token_acc": 0.6452436974789916 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 1.313482403755188, + "learning_rate": 6.5625e-06, + "loss": 1.518486738204956, + "step": 21, + "token_acc": 0.6326643752078944 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 1.76573646068573, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4727129936218262, + "step": 22, + "token_acc": 0.6483625537545484 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 1.4560825824737549, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4510971307754517, + "step": 23, + "token_acc": 0.6514202049780381 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.091919183731079, + "learning_rate": 7.5e-06, + "loss": 1.5022644996643066, + "step": 24, + "token_acc": 0.6532272645091304 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.740084171295166, + "learning_rate": 7.8125e-06, + "loss": 1.4717752933502197, + "step": 25, + "token_acc": 0.639137679650073 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 2.8075263500213623, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4721131324768066, + "step": 26, + "token_acc": 0.6409317316144155 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 1.5441093444824219, + "learning_rate": 8.437500000000002e-06, + "loss": 1.5016684532165527, + "step": 27, + "token_acc": 0.6426081151249907 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 2.806373119354248, + "learning_rate": 8.75e-06, + "loss": 1.4954692125320435, + "step": 28, + "token_acc": 0.6546207959911342 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 4.36266565322876, + "learning_rate": 9.0625e-06, + "loss": 1.4520496129989624, + "step": 29, + "token_acc": 0.6418620292083013 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 1.5149106979370117, + "learning_rate": 9.375000000000001e-06, + "loss": 1.4115290641784668, + "step": 30, + "token_acc": 0.651825091489162 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 2.1750094890594482, + "learning_rate": 9.6875e-06, + "loss": 1.4292242527008057, + "step": 31, + "token_acc": 0.6480092934840004 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 2.171316623687744, + "learning_rate": 1e-05, + "loss": 1.4468941688537598, + "step": 32, + "token_acc": 0.6347569955817378 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 1.6085623502731323, + "learning_rate": 1.03125e-05, + "loss": 1.4548325538635254, + "step": 33, + "token_acc": 0.6387750322051763 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 2.6019768714904785, + "learning_rate": 1.0625e-05, + "loss": 1.3636939525604248, + "step": 34, + "token_acc": 0.6694069289489136 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 1.7189018726348877, + "learning_rate": 1.09375e-05, + "loss": 1.3792800903320312, + "step": 35, + "token_acc": 0.6634405670665212 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 3.069101572036743, + "learning_rate": 1.125e-05, + "loss": 1.418148398399353, + "step": 36, + "token_acc": 0.652867715078631 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 0.9760923385620117, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.487064242362976, + "step": 37, + "token_acc": 0.6303966303966304 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 0.9802103638648987, + "learning_rate": 1.1875e-05, + "loss": 1.3090462684631348, + "step": 38, + "token_acc": 0.6665271562409453 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 4.357207298278809, + "learning_rate": 1.21875e-05, + "loss": 1.4249074459075928, + "step": 39, + "token_acc": 0.6332261759597975 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 1.186145305633545, + "learning_rate": 1.25e-05, + "loss": 1.3373064994812012, + "step": 40, + "token_acc": 0.6725337118523775 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 5.261158466339111, + "learning_rate": 1.28125e-05, + "loss": 1.340531349182129, + "step": 41, + "token_acc": 0.6683364091747956 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 2.458296775817871, + "learning_rate": 1.3125e-05, + "loss": 1.332282304763794, + "step": 42, + "token_acc": 0.667586315623522 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 2.0579333305358887, + "learning_rate": 1.34375e-05, + "loss": 1.3493250608444214, + "step": 43, + "token_acc": 0.6604139715394567 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 1.6432338953018188, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.3249701261520386, + "step": 44, + "token_acc": 0.6745012519182618 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 1.0298691987991333, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.349682092666626, + "step": 45, + "token_acc": 0.6590545786709294 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 1.3843709230422974, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.300336480140686, + "step": 46, + "token_acc": 0.6736927993472496 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 15.729647636413574, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.295595645904541, + "step": 47, + "token_acc": 0.6904139433551199 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 1.218788743019104, + "learning_rate": 1.5e-05, + "loss": 1.329056739807129, + "step": 48, + "token_acc": 0.6649002289826628 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.2413642406463623, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3466482162475586, + "step": 49, + "token_acc": 0.6608733843644121 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 1.7129898071289062, + "learning_rate": 1.5625e-05, + "loss": 1.1971522569656372, + "step": 50, + "token_acc": 0.6957063780980401 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 12.908634185791016, + "learning_rate": 1.59375e-05, + "loss": 1.338015079498291, + "step": 51, + "token_acc": 0.664876476906552 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 2.4744150638580322, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3184266090393066, + "step": 52, + "token_acc": 0.6541958563124162 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 1.5035480260849, + "learning_rate": 1.65625e-05, + "loss": 1.3414291143417358, + "step": 53, + "token_acc": 0.6604707140946777 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 0.9383847117424011, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2710291147232056, + "step": 54, + "token_acc": 0.6716895400593472 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 0.8049397468566895, + "learning_rate": 1.71875e-05, + "loss": 1.321635365486145, + "step": 55, + "token_acc": 0.6582027168234065 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 0.9869638085365295, + "learning_rate": 1.75e-05, + "loss": 1.3294317722320557, + "step": 56, + "token_acc": 0.6607637747193387 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 3.6263885498046875, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2151306867599487, + "step": 57, + "token_acc": 0.689805574037111 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 2.4337313175201416, + "learning_rate": 1.8125e-05, + "loss": 1.2164831161499023, + "step": 58, + "token_acc": 0.6946524064171123 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 1.2465195655822754, + "learning_rate": 1.84375e-05, + "loss": 1.2001479864120483, + "step": 59, + "token_acc": 0.6949291573452647 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 1.211704969406128, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2468581199645996, + "step": 60, + "token_acc": 0.6773460003031987 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 1.1252233982086182, + "learning_rate": 1.90625e-05, + "loss": 1.2663486003875732, + "step": 61, + "token_acc": 0.6731120837719541 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 0.68025803565979, + "learning_rate": 1.9375e-05, + "loss": 1.2598896026611328, + "step": 62, + "token_acc": 0.6730806308564378 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 3.702453374862671, + "learning_rate": 1.96875e-05, + "loss": 1.2166805267333984, + "step": 63, + "token_acc": 0.691328125 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 53.140132904052734, + "learning_rate": 2e-05, + "loss": 1.2387148141860962, + "step": 64, + "token_acc": 0.6720997123681688 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 2.1026854515075684, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2545907497406006, + "step": 65, + "token_acc": 0.6658680632939603 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 1.5480505228042603, + "learning_rate": 2.0625e-05, + "loss": 1.2474756240844727, + "step": 66, + "token_acc": 0.6753335794525606 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 8.795135498046875, + "learning_rate": 2.09375e-05, + "loss": 1.1903716325759888, + "step": 67, + "token_acc": 0.7095110155830199 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 1.6788009405136108, + "learning_rate": 2.125e-05, + "loss": 1.255184531211853, + "step": 68, + "token_acc": 0.675844505309692 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 2.194441080093384, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.2032387256622314, + "step": 69, + "token_acc": 0.6907407407407408 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 1.1291356086730957, + "learning_rate": 2.1875e-05, + "loss": 1.1963188648223877, + "step": 70, + "token_acc": 0.6802986594264382 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 1.3670284748077393, + "learning_rate": 2.21875e-05, + "loss": 1.2278125286102295, + "step": 71, + "token_acc": 0.6708903388760261 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 2.758354663848877, + "learning_rate": 2.25e-05, + "loss": 1.2158769369125366, + "step": 72, + "token_acc": 0.6867505551443376 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 2.6226625442504883, + "learning_rate": 2.28125e-05, + "loss": 1.074498176574707, + "step": 73, + "token_acc": 0.718917166477549 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 5.092314720153809, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.183173656463623, + "step": 74, + "token_acc": 0.6937396580253723 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 1.6192283630371094, + "learning_rate": 2.34375e-05, + "loss": 1.1696088314056396, + "step": 75, + "token_acc": 0.6922164214523019 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 1.9894205331802368, + "learning_rate": 2.375e-05, + "loss": 1.02431058883667, + "step": 76, + "token_acc": 0.7350316975815919 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 5.026700019836426, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1793923377990723, + "step": 77, + "token_acc": 0.6889119550616681 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 0.9851458668708801, + "learning_rate": 2.4375e-05, + "loss": 1.2031577825546265, + "step": 78, + "token_acc": 0.6798439806029939 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 1.4935272932052612, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.2100965976715088, + "step": 79, + "token_acc": 0.6759376522162689 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 2.0270609855651855, + "learning_rate": 2.5e-05, + "loss": 1.2182433605194092, + "step": 80, + "token_acc": 0.672459042468586 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 2.171703577041626, + "learning_rate": 2.53125e-05, + "loss": 1.1599236726760864, + "step": 81, + "token_acc": 0.6896967941290073 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 1.3919153213500977, + "learning_rate": 2.5625e-05, + "loss": 1.2469699382781982, + "step": 82, + "token_acc": 0.6607023411371238 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 5.726469039916992, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.0905996561050415, + "step": 83, + "token_acc": 0.705477288521069 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 2.4800686836242676, + "learning_rate": 2.625e-05, + "loss": 1.1631360054016113, + "step": 84, + "token_acc": 0.6929383361834826 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 1.3907530307769775, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0351084470748901, + "step": 85, + "token_acc": 0.7256065167345493 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 4.023968696594238, + "learning_rate": 2.6875e-05, + "loss": 1.1698168516159058, + "step": 86, + "token_acc": 0.6915017462165308 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.434358596801758, + "learning_rate": 2.71875e-05, + "loss": 1.0965162515640259, + "step": 87, + "token_acc": 0.7119186046511627 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 1.8500336408615112, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0884002447128296, + "step": 88, + "token_acc": 0.7045622522340926 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 3.2268683910369873, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1824790239334106, + "step": 89, + "token_acc": 0.6851617168990027 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 16.243087768554688, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.971013069152832, + "step": 90, + "token_acc": 0.7361684210526316 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 2.5743207931518555, + "learning_rate": 2.84375e-05, + "loss": 1.0600107908248901, + "step": 91, + "token_acc": 0.7134351911627573 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.0203638076782227, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.1500616073608398, + "step": 92, + "token_acc": 0.6882268690919507 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 1.1112314462661743, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0045973062515259, + "step": 93, + "token_acc": 0.7273007237078478 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 2.5539236068725586, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1666638851165771, + "step": 94, + "token_acc": 0.6864643371757925 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 2.1663148403167725, + "learning_rate": 2.96875e-05, + "loss": 1.0808672904968262, + "step": 95, + "token_acc": 0.695645939874779 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 1.9498071670532227, + "learning_rate": 3e-05, + "loss": 0.9929013252258301, + "step": 96, + "token_acc": 0.738973897389739 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 4.303379058837891, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.1222727298736572, + "step": 97, + "token_acc": 0.688846697280113 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 4.010090351104736, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1498996019363403, + "step": 98, + "token_acc": 0.6880553287546227 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 1.8286547660827637, + "learning_rate": 3.09375e-05, + "loss": 1.0506386756896973, + "step": 99, + "token_acc": 0.7126414484319431 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 2.414545774459839, + "learning_rate": 3.125e-05, + "loss": 1.0510246753692627, + "step": 100, + "token_acc": 0.711717754376551 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 35.13666534423828, + "learning_rate": 3.15625e-05, + "loss": 1.105303168296814, + "step": 101, + "token_acc": 0.6977885525070956 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 1.9485750198364258, + "learning_rate": 3.1875e-05, + "loss": 1.0945279598236084, + "step": 102, + "token_acc": 0.7003108322092546 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 3.3463339805603027, + "learning_rate": 3.21875e-05, + "loss": 1.068230390548706, + "step": 103, + "token_acc": 0.7030742861310675 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 2.5563361644744873, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.001434564590454, + "step": 104, + "token_acc": 0.721863062004114 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 1.6362377405166626, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.0632514953613281, + "step": 105, + "token_acc": 0.7117752471241112 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 2.2173712253570557, + "learning_rate": 3.3125e-05, + "loss": 1.127671241760254, + "step": 106, + "token_acc": 0.6865707549439446 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 2.128298044204712, + "learning_rate": 3.34375e-05, + "loss": 1.0473824739456177, + "step": 107, + "token_acc": 0.7126287780582656 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 1.5433886051177979, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9804874658584595, + "step": 108, + "token_acc": 0.7238202367561197 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 6.602525234222412, + "learning_rate": 3.40625e-05, + "loss": 1.0798405408859253, + "step": 109, + "token_acc": 0.6913783927621076 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 1.55194091796875, + "learning_rate": 3.4375e-05, + "loss": 1.0854990482330322, + "step": 110, + "token_acc": 0.7073425229282223 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 1.3037891387939453, + "learning_rate": 3.46875e-05, + "loss": 1.0851027965545654, + "step": 111, + "token_acc": 0.7052621625455061 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 1.3887872695922852, + "learning_rate": 3.5e-05, + "loss": 0.9681501984596252, + "step": 112, + "token_acc": 0.7300288416392783 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 2.441603422164917, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0306782722473145, + "step": 113, + "token_acc": 0.7176060047405847 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 1.4105886220932007, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.015556812286377, + "step": 114, + "token_acc": 0.7166026744339997 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 3.6527352333068848, + "learning_rate": 3.59375e-05, + "loss": 1.1317176818847656, + "step": 115, + "token_acc": 0.6872061871303644 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 1.8553370237350464, + "learning_rate": 3.625e-05, + "loss": 1.0447880029678345, + "step": 116, + "token_acc": 0.7100111234705228 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.274932861328125, + "learning_rate": 3.65625e-05, + "loss": 0.8988428711891174, + "step": 117, + "token_acc": 0.7594645889521526 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 1.7594488859176636, + "learning_rate": 3.6875e-05, + "loss": 1.0872691869735718, + "step": 118, + "token_acc": 0.7017732981189027 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 3.4330825805664062, + "learning_rate": 3.71875e-05, + "loss": 1.0752581357955933, + "step": 119, + "token_acc": 0.7016698075995967 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 4.466182708740234, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9912147521972656, + "step": 120, + "token_acc": 0.7193773043834494 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 1.5049115419387817, + "learning_rate": 3.78125e-05, + "loss": 1.018737554550171, + "step": 121, + "token_acc": 0.7152019002375297 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 3.3945202827453613, + "learning_rate": 3.8125e-05, + "loss": 0.9846063256263733, + "step": 122, + "token_acc": 0.7239054568527918 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 1.5377535820007324, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0859057903289795, + "step": 123, + "token_acc": 0.698030902197399 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 2.696385622024536, + "learning_rate": 3.875e-05, + "loss": 1.0317624807357788, + "step": 124, + "token_acc": 0.711888309124242 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.061471700668335, + "learning_rate": 3.90625e-05, + "loss": 0.9196208715438843, + "step": 125, + "token_acc": 0.7408977209560867 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 1.1909533739089966, + "learning_rate": 3.9375e-05, + "loss": 0.908572793006897, + "step": 126, + "token_acc": 0.7447868298860278 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 2.976712226867676, + "learning_rate": 3.96875e-05, + "loss": 0.8775178790092468, + "step": 127, + "token_acc": 0.7585321100917432 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 3.037933349609375, + "learning_rate": 4e-05, + "loss": 1.0048859119415283, + "step": 128, + "token_acc": 0.7140471578384877 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 5.830648422241211, + "learning_rate": 4.0312500000000004e-05, + "loss": 0.9985315799713135, + "step": 129, + "token_acc": 0.7206040268456376 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 1.3143258094787598, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.9825519323348999, + "step": 130, + "token_acc": 0.7247136031316562 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 2.4536049365997314, + "learning_rate": 4.09375e-05, + "loss": 0.8758414387702942, + "step": 131, + "token_acc": 0.7611605215439081 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 3.183997631072998, + "learning_rate": 4.125e-05, + "loss": 0.9772047400474548, + "step": 132, + "token_acc": 0.722866503718342 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 1.653651237487793, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0216748714447021, + "step": 133, + "token_acc": 0.71066228276186 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 1.1030162572860718, + "learning_rate": 4.1875e-05, + "loss": 0.9526140689849854, + "step": 134, + "token_acc": 0.7339804459449955 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 4.92834997177124, + "learning_rate": 4.21875e-05, + "loss": 0.8791989088058472, + "step": 135, + "token_acc": 0.7551160285910115 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 0.7831388115882874, + "learning_rate": 4.25e-05, + "loss": 1.0653268098831177, + "step": 136, + "token_acc": 0.7019186391507879 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 1.9757318496704102, + "learning_rate": 4.28125e-05, + "loss": 1.0078719854354858, + "step": 137, + "token_acc": 0.7167237320778943 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 4.613290786743164, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.8363289833068848, + "step": 138, + "token_acc": 0.7749772244154267 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 1.626499891281128, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.9550644755363464, + "step": 139, + "token_acc": 0.732905151161282 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 7.68024206161499, + "learning_rate": 4.375e-05, + "loss": 0.8922043442726135, + "step": 140, + "token_acc": 0.7493879367905631 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 5.447193622589111, + "learning_rate": 4.40625e-05, + "loss": 0.8937676548957825, + "step": 141, + "token_acc": 0.7455310199789695 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 2.561711311340332, + "learning_rate": 4.4375e-05, + "loss": 1.030370831489563, + "step": 142, + "token_acc": 0.712084974676421 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 2.330228328704834, + "learning_rate": 4.46875e-05, + "loss": 0.8835145831108093, + "step": 143, + "token_acc": 0.7573455306612916 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 3.3042826652526855, + "learning_rate": 4.5e-05, + "loss": 0.9554994702339172, + "step": 144, + "token_acc": 0.7331631024577082 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.903152346611023, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9345872402191162, + "step": 145, + "token_acc": 0.7318692226564923 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 1.0897647142410278, + "learning_rate": 4.5625e-05, + "loss": 0.9259800910949707, + "step": 146, + "token_acc": 0.7344223913159155 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 1.892134428024292, + "learning_rate": 4.59375e-05, + "loss": 0.8477439284324646, + "step": 147, + "token_acc": 0.7550676911818515 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 1.995365858078003, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.926980197429657, + "step": 148, + "token_acc": 0.7390321121664405 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 0.967679500579834, + "learning_rate": 4.65625e-05, + "loss": 1.040574073791504, + "step": 149, + "token_acc": 0.7037716802789759 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 1.3489030599594116, + "learning_rate": 4.6875e-05, + "loss": 0.9701130390167236, + "step": 150, + "token_acc": 0.722164475695506 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 1.8906278610229492, + "learning_rate": 4.71875e-05, + "loss": 1.0237723588943481, + "step": 151, + "token_acc": 0.7124020961289232 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 1.4073423147201538, + "learning_rate": 4.75e-05, + "loss": 0.8609241247177124, + "step": 152, + "token_acc": 0.7521867897238101 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 1.7892054319381714, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.0169634819030762, + "step": 153, + "token_acc": 0.7109900672861262 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 5.222759246826172, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.8839869499206543, + "step": 154, + "token_acc": 0.7499611740953565 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 47.99449920654297, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9847191572189331, + "step": 155, + "token_acc": 0.7206756827869284 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 2.1542346477508545, + "learning_rate": 4.875e-05, + "loss": 0.8897120952606201, + "step": 156, + "token_acc": 0.7461834889580554 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 1.6777710914611816, + "learning_rate": 4.90625e-05, + "loss": 0.9585904479026794, + "step": 157, + "token_acc": 0.726420528934276 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 1.6333376169204712, + "learning_rate": 4.937500000000001e-05, + "loss": 0.8516196012496948, + "step": 158, + "token_acc": 0.7541220115416323 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 1.346437692642212, + "learning_rate": 4.96875e-05, + "loss": 0.8823418021202087, + "step": 159, + "token_acc": 0.752115152181079 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 3.7089667320251465, + "learning_rate": 5e-05, + "loss": 0.9368952512741089, + "step": 160, + "token_acc": 0.7302366635405748 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 1.9471855163574219, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8721541166305542, + "step": 161, + "token_acc": 0.7594202898550725 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 2.1255381107330322, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.875278115272522, + "step": 162, + "token_acc": 0.7485261365125114 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 1.0908252000808716, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8458836078643799, + "step": 163, + "token_acc": 0.7550397067806964 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 1.6298143863677979, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.0290120840072632, + "step": 164, + "token_acc": 0.7065329357549471 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 1.5110621452331543, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9266539812088013, + "step": 165, + "token_acc": 0.7334730109720461 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.3298150300979614, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9487897157669067, + "step": 166, + "token_acc": 0.7244558712708896 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 1.4212807416915894, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8636137247085571, + "step": 167, + "token_acc": 0.75104248110503 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.1823561191558838, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.944591224193573, + "step": 168, + "token_acc": 0.7279493670886076 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 3.800663471221924, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.7865618467330933, + "step": 169, + "token_acc": 0.7755815987405982 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 2.064781427383423, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8385809659957886, + "step": 170, + "token_acc": 0.7639746370765893 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 2.5913920402526855, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8421958088874817, + "step": 171, + "token_acc": 0.7620282597030943 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 1.7713373899459839, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8133989572525024, + "step": 172, + "token_acc": 0.760867708600222 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 1.529839038848877, + "learning_rate": 4.994911507566217e-05, + "loss": 1.000519037246704, + "step": 173, + "token_acc": 0.712219074598678 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 1.5380620956420898, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9671303033828735, + "step": 174, + "token_acc": 0.7277875219243297 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 2.8864336013793945, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8283255100250244, + "step": 175, + "token_acc": 0.7675478577939836 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 1.0531455278396606, + "learning_rate": 4.99229333433282e-05, + "loss": 0.915996789932251, + "step": 176, + "token_acc": 0.7366725083385155 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 1.4250882863998413, + "learning_rate": 4.991300473502437e-05, + "loss": 0.8618585467338562, + "step": 177, + "token_acc": 0.7541533421729975 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 5.33800745010376, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.002793788909912, + "step": 178, + "token_acc": 0.7128742904190319 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 1.2855201959609985, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8489822745323181, + "step": 179, + "token_acc": 0.7639533864890914 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.6636594533920288, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9121615290641785, + "step": 180, + "token_acc": 0.7437731849496555 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 1.5193665027618408, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8066229224205017, + "step": 181, + "token_acc": 0.7651162790697674 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 1.5862308740615845, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9458524584770203, + "step": 182, + "token_acc": 0.7302548696579126 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 2.379222869873047, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9564061164855957, + "step": 183, + "token_acc": 0.7301209802502326 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.0790810585021973, + "learning_rate": 4.982671142387316e-05, + "loss": 0.942729651927948, + "step": 184, + "token_acc": 0.7303644468955375 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 9.259621620178223, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8534692525863647, + "step": 185, + "token_acc": 0.7507731234186112 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 3.4542312622070312, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0024710893630981, + "step": 186, + "token_acc": 0.7177069583254762 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 8.031414985656738, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8734491467475891, + "step": 187, + "token_acc": 0.7507000736919676 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 1.1859290599822998, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9791375398635864, + "step": 188, + "token_acc": 0.7258350951374207 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 3.053464889526367, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8371925354003906, + "step": 189, + "token_acc": 0.7536518241479077 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 1.5525466203689575, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8489048480987549, + "step": 190, + "token_acc": 0.7543675535526885 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 1.2123963832855225, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8702831864356995, + "step": 191, + "token_acc": 0.7504071889918562 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 4.12030553817749, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8116580843925476, + "step": 192, + "token_acc": 0.7636261170598181 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 3.596958875656128, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.8202139139175415, + "step": 193, + "token_acc": 0.7595227168425883 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 3.500709295272827, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9322924017906189, + "step": 194, + "token_acc": 0.7302081098476721 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 2.0435562133789062, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7780945301055908, + "step": 195, + "token_acc": 0.7680968459194598 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 1.0618855953216553, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8902656435966492, + "step": 196, + "token_acc": 0.7357566856373539 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 1.3093773126602173, + "learning_rate": 4.958879433443904e-05, + "loss": 0.7953319549560547, + "step": 197, + "token_acc": 0.7690320619966571 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 4.695700645446777, + "learning_rate": 4.95663319832678e-05, + "loss": 0.9916477203369141, + "step": 198, + "token_acc": 0.7183775051303323 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 1.1738910675048828, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8842062950134277, + "step": 199, + "token_acc": 0.7402211505674899 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 1.958127737045288, + "learning_rate": 4.951963201008076e-05, + "loss": 0.8272268772125244, + "step": 200, + "token_acc": 0.7592515245175842 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 0.9756200313568115, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8797040581703186, + "step": 201, + "token_acc": 0.7454005184295378 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 1.441583275794983, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7635867595672607, + "step": 202, + "token_acc": 0.7780200258397932 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 0.9431282877922058, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8886734247207642, + "step": 203, + "token_acc": 0.7458984875672905 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.4262967109680176, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9764437675476074, + "step": 204, + "token_acc": 0.7219959266802444 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 1.837144136428833, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8055057525634766, + "step": 205, + "token_acc": 0.7705683101242002 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 0.9157178401947021, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9508963227272034, + "step": 206, + "token_acc": 0.7266013284407079 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 1.1117141246795654, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8796980381011963, + "step": 207, + "token_acc": 0.7448091668820539 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 1.206092119216919, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.7853018045425415, + "step": 208, + "token_acc": 0.7676789587852495 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 3.613619804382324, + "learning_rate": 4.92803071949828e-05, + "loss": 0.930952250957489, + "step": 209, + "token_acc": 0.7290444145356663 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 2.278681755065918, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9441535472869873, + "step": 210, + "token_acc": 0.7330724921204217 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 1.102830410003662, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9249938130378723, + "step": 211, + "token_acc": 0.7305298501351241 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.1460347175598145, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.938249945640564, + "step": 212, + "token_acc": 0.7304270462633452 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.1301722526550293, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8906076550483704, + "step": 213, + "token_acc": 0.7410463483146067 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 1.019655466079712, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8547159433364868, + "step": 214, + "token_acc": 0.7477573904179409 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 0.8400518298149109, + "learning_rate": 4.9094401644886e-05, + "loss": 0.9786480069160461, + "step": 215, + "token_acc": 0.7191857669498317 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 1.3454630374908447, + "learning_rate": 4.906138091134118e-05, + "loss": 0.930005669593811, + "step": 216, + "token_acc": 0.7302245555212423 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 1.7261593341827393, + "learning_rate": 4.90277804028108e-05, + "loss": 0.7304342985153198, + "step": 217, + "token_acc": 0.7930695985079023 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 0.8376732468605042, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9497151374816895, + "step": 218, + "token_acc": 0.7235062817684856 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 1.5206397771835327, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7451450228691101, + "step": 219, + "token_acc": 0.7850740452065471 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 2.350113868713379, + "learning_rate": 4.892350839330522e-05, + "loss": 0.894478440284729, + "step": 220, + "token_acc": 0.7408569868995634 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 2.151811361312866, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8410134315490723, + "step": 221, + "token_acc": 0.7524846536100556 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 2.2998857498168945, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8774259090423584, + "step": 222, + "token_acc": 0.7482207812747114 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 4.154652118682861, + "learning_rate": 4.881404839143988e-05, + "loss": 0.848537027835846, + "step": 223, + "token_acc": 0.7471583220568335 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 3.917426824569702, + "learning_rate": 4.877641290737884e-05, + "loss": 0.8067992925643921, + "step": 224, + "token_acc": 0.7612280960094242 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 6.496757507324219, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8888064026832581, + "step": 225, + "token_acc": 0.7468172852788237 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 2.212669849395752, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8939536809921265, + "step": 226, + "token_acc": 0.7427561031257129 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 2.2665131092071533, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8388830423355103, + "step": 227, + "token_acc": 0.7591590470858991 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 1.6633414030075073, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8939744234085083, + "step": 228, + "token_acc": 0.7423191278493558 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 10.390888214111328, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8337754607200623, + "step": 229, + "token_acc": 0.760409214479897 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 1.9441218376159668, + "learning_rate": 4.853860162957552e-05, + "loss": 0.8908044099807739, + "step": 230, + "token_acc": 0.741635046567782 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 5.351205825805664, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6824640035629272, + "step": 231, + "token_acc": 0.7986786566342449 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 5.388350486755371, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.8338614702224731, + "step": 232, + "token_acc": 0.7588204709203 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 33.36974334716797, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8330967426300049, + "step": 233, + "token_acc": 0.7553732862360055 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.2575448751449585, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8081785440444946, + "step": 234, + "token_acc": 0.7618624367564611 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 5.851841926574707, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8118147253990173, + "step": 235, + "token_acc": 0.7588138835747472 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 1.2276482582092285, + "learning_rate": 4.828037336897009e-05, + "loss": 0.85323566198349, + "step": 236, + "token_acc": 0.7462974887314875 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 1.4128162860870361, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9805375337600708, + "step": 237, + "token_acc": 0.7154090994195843 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.1258808374404907, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.7949981689453125, + "step": 238, + "token_acc": 0.7637019230769231 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 2.17614483833313, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8806252479553223, + "step": 239, + "token_acc": 0.7484175458078846 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 2.775895357131958, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8502448797225952, + "step": 240, + "token_acc": 0.7478745871013158 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 3.2797460556030273, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.7003047466278076, + "step": 241, + "token_acc": 0.7912219560008713 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 3.991440773010254, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.90602707862854, + "step": 242, + "token_acc": 0.7321293536764378 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 1.5725153684616089, + "learning_rate": 4.79536020593051e-05, + "loss": 0.9273116588592529, + "step": 243, + "token_acc": 0.729396270880987 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 1.5961885452270508, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.8434361219406128, + "step": 244, + "token_acc": 0.7547051878602681 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.036643385887146, + "learning_rate": 4.785524389258827e-05, + "loss": 0.93770432472229, + "step": 245, + "token_acc": 0.727697519566995 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 1.0603351593017578, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8905070424079895, + "step": 246, + "token_acc": 0.7367771247962862 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.6090335845947266, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.773712694644928, + "step": 247, + "token_acc": 0.7752465741468099 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 2.8802406787872314, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.889683723449707, + "step": 248, + "token_acc": 0.7375587262919784 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 0.9473100304603577, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9071462750434875, + "step": 249, + "token_acc": 0.7377093584939732 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 1.420573353767395, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7493491172790527, + "step": 250, + "token_acc": 0.7773999683694449 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 1.5327718257904053, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.845209538936615, + "step": 251, + "token_acc": 0.7534288560263581 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 1.9740188121795654, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8819962739944458, + "step": 252, + "token_acc": 0.7408409658617818 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 4.266992092132568, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.836998462677002, + "step": 253, + "token_acc": 0.753389326102771 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 3.870814085006714, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7518301010131836, + "step": 254, + "token_acc": 0.7717560376586164 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 6.527884006500244, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.7232604622840881, + "step": 255, + "token_acc": 0.786843072399853 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 1.4010592699050903, + "learning_rate": 4.72751631047092e-05, + "loss": 0.8275509476661682, + "step": 256, + "token_acc": 0.756143383181784 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 6.857308864593506, + "learning_rate": 4.721918194465169e-05, + "loss": 0.799940288066864, + "step": 257, + "token_acc": 0.7626774847870182 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 1.6401067972183228, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7834373116493225, + "step": 258, + "token_acc": 0.7659123055162659 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 1.6125162839889526, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8310164213180542, + "step": 259, + "token_acc": 0.7511212139829206 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 1.442099690437317, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.879160463809967, + "step": 260, + "token_acc": 0.7447237531926334 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 1.0048458576202393, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9174377918243408, + "step": 261, + "token_acc": 0.7316501716824884 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 6.172839164733887, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7322565317153931, + "step": 262, + "token_acc": 0.7848805398504468 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 2.718960762023926, + "learning_rate": 4.687209999162396e-05, + "loss": 0.9046364426612854, + "step": 263, + "token_acc": 0.7374393892499742 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 0.7975059151649475, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9695983529090881, + "step": 264, + "token_acc": 0.7193242184098232 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 2.3180477619171143, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8064447641372681, + "step": 265, + "token_acc": 0.7668189605939463 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 2.5961692333221436, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.836155354976654, + "step": 266, + "token_acc": 0.7518848526387937 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 0.7738305330276489, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.9511428475379944, + "step": 267, + "token_acc": 0.7291764338177841 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 1.9640631675720215, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8413755297660828, + "step": 268, + "token_acc": 0.7570005091279366 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 3.4764976501464844, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8661715984344482, + "step": 269, + "token_acc": 0.7496790040752526 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 2.8140335083007812, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8345517516136169, + "step": 270, + "token_acc": 0.7584374551199196 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 2.1373839378356934, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8521395921707153, + "step": 271, + "token_acc": 0.7504881307162676 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 0.9885866641998291, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8748230934143066, + "step": 272, + "token_acc": 0.7425441926038391 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 3.56126070022583, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.8168613314628601, + "step": 273, + "token_acc": 0.7603961787018826 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 25.966888427734375, + "learning_rate": 4.618673848685586e-05, + "loss": 0.7895940542221069, + "step": 274, + "token_acc": 0.7658349328214972 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 1.3936517238616943, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8234192132949829, + "step": 275, + "token_acc": 0.758264992311635 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 2.4734811782836914, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8250598311424255, + "step": 276, + "token_acc": 0.7552643893308376 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 2.5281338691711426, + "learning_rate": 4.59890152099534e-05, + "loss": 0.9137836694717407, + "step": 277, + "token_acc": 0.7314060158619934 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 1.5060079097747803, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8653621077537537, + "step": 278, + "token_acc": 0.7430385386500334 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 1.0087921619415283, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8411096930503845, + "step": 279, + "token_acc": 0.7529303234208813 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 1.5636194944381714, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7783745527267456, + "step": 280, + "token_acc": 0.7702870220272718 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 1.9277583360671997, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9275861978530884, + "step": 281, + "token_acc": 0.724974081327036 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 1.4190716743469238, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8562414646148682, + "step": 282, + "token_acc": 0.7458445307056832 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.4012247323989868, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8905417323112488, + "step": 283, + "token_acc": 0.7400331750843677 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 2.845858335494995, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7349405288696289, + "step": 284, + "token_acc": 0.7778809689652504 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 2.043717622756958, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.739836573600769, + "step": 285, + "token_acc": 0.7864004044489383 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 1.1184813976287842, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7316737771034241, + "step": 286, + "token_acc": 0.7790425932906144 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 1.7550926208496094, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9168081283569336, + "step": 287, + "token_acc": 0.7349883025734338 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 2.2734856605529785, + "learning_rate": 4.522542485937369e-05, + "loss": 0.8405396342277527, + "step": 288, + "token_acc": 0.753734827264239 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 0.8263589143753052, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9497283697128296, + "step": 289, + "token_acc": 0.7289892452187454 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 4.233347415924072, + "learning_rate": 4.508018828701612e-05, + "loss": 0.8274160623550415, + "step": 290, + "token_acc": 0.7547876258286276 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 2.796037197113037, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8769165277481079, + "step": 291, + "token_acc": 0.7473155929038282 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 0.9638167023658752, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9158531427383423, + "step": 292, + "token_acc": 0.736260350471789 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 2.0772323608398438, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8095401525497437, + "step": 293, + "token_acc": 0.7583516215557181 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 1.0814753770828247, + "learning_rate": 4.478392321601651e-05, + "loss": 0.8873149752616882, + "step": 294, + "token_acc": 0.7437832431695232 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 4.168087005615234, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7311573028564453, + "step": 295, + "token_acc": 0.78859817771462 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 1.3557254076004028, + "learning_rate": 4.463292327201862e-05, + "loss": 0.8367257118225098, + "step": 296, + "token_acc": 0.752932016156504 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 2.2594828605651855, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8442533016204834, + "step": 297, + "token_acc": 0.7561402328241706 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 1.4002978801727295, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7559725642204285, + "step": 298, + "token_acc": 0.7742537313432836 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.6578376293182373, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8327486515045166, + "step": 299, + "token_acc": 0.7559387210816846 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 3.8968186378479004, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.8528477549552917, + "step": 300, + "token_acc": 0.750763448437867 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 1.1830475330352783, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9132996797561646, + "step": 301, + "token_acc": 0.7312029217073728 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 1.79401433467865, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8471458554267883, + "step": 302, + "token_acc": 0.7578536464464961 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.1060916185379028, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8816431760787964, + "step": 303, + "token_acc": 0.7383714445064138 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 3.274479627609253, + "learning_rate": 4.401014914000078e-05, + "loss": 0.7977585792541504, + "step": 304, + "token_acc": 0.7648344784509682 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 4.249853610992432, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8551120162010193, + "step": 305, + "token_acc": 0.7446675388203174 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 9.041977882385254, + "learning_rate": 4.384983704904674e-05, + "loss": 0.806232213973999, + "step": 306, + "token_acc": 0.7649096031932379 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 1.081554889678955, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8331530094146729, + "step": 307, + "token_acc": 0.7551795135761163 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.7485742568969727, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7645971775054932, + "step": 308, + "token_acc": 0.776908023483366 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 2.283208131790161, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8550758361816406, + "step": 309, + "token_acc": 0.7544976635514019 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 0.8769519925117493, + "learning_rate": 4.352377813387398e-05, + "loss": 0.9192790389060974, + "step": 310, + "token_acc": 0.7294477565108253 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 2.909032106399536, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.6819452047348022, + "step": 311, + "token_acc": 0.7967241883591694 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 2.9573018550872803, + "learning_rate": 4.335806273589214e-05, + "loss": 0.791392982006073, + "step": 312, + "token_acc": 0.7667422052043448 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 2.8347651958465576, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7407418489456177, + "step": 313, + "token_acc": 0.781952 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 24.759061813354492, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8645349740982056, + "step": 314, + "token_acc": 0.7462040885571295 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 2.6164278984069824, + "learning_rate": 4.310617707378668e-05, + "loss": 0.8003748059272766, + "step": 315, + "token_acc": 0.764179104477612 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 1.0327874422073364, + "learning_rate": 4.302133991757297e-05, + "loss": 0.883104681968689, + "step": 316, + "token_acc": 0.7430525185862521 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 1.9250575304031372, + "learning_rate": 4.2936068525181e-05, + "loss": 0.8418888449668884, + "step": 317, + "token_acc": 0.7478256547885294 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 0.9483305811882019, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9749743938446045, + "step": 318, + "token_acc": 0.7198247535596933 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 4.413815975189209, + "learning_rate": 4.276423126095974e-05, + "loss": 0.8005592226982117, + "step": 319, + "token_acc": 0.7621298667191911 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 3.177881956100464, + "learning_rate": 4.267766952966369e-05, + "loss": 0.941821813583374, + "step": 320, + "token_acc": 0.7269460518947172 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 1.1445744037628174, + "learning_rate": 4.259068184315608e-05, + "loss": 0.905495285987854, + "step": 321, + "token_acc": 0.7364675688287448 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 2.5400984287261963, + "learning_rate": 4.250327029746309e-05, + "loss": 0.749504029750824, + "step": 322, + "token_acc": 0.7781667031284183 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 1.716409683227539, + "learning_rate": 4.24154369988241e-05, + "loss": 0.7389223575592041, + "step": 323, + "token_acc": 0.7833673658808242 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.4108213186264038, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9132614135742188, + "step": 324, + "token_acc": 0.7287277061252287 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 2.222651720046997, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7642686367034912, + "step": 325, + "token_acc": 0.7748897656068694 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 2.48195481300354, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6340684294700623, + "step": 326, + "token_acc": 0.8057753164556962 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 0.8498600721359253, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9634742736816406, + "step": 327, + "token_acc": 0.7193177752156801 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 1.3811802864074707, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8113643527030945, + "step": 328, + "token_acc": 0.7561390347586897 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 0.8957132697105408, + "learning_rate": 4.187969961854726e-05, + "loss": 0.995599627494812, + "step": 329, + "token_acc": 0.71316625740286 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 1.3119924068450928, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7408137917518616, + "step": 330, + "token_acc": 0.7839771101573677 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 2.3570327758789062, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6798240542411804, + "step": 331, + "token_acc": 0.8010324216627422 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 1.039640188217163, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.7958476543426514, + "step": 332, + "token_acc": 0.7642944234101264 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 5.126318454742432, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7409902811050415, + "step": 333, + "token_acc": 0.7794841832902095 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 1.3792798519134521, + "learning_rate": 4.142204747357604e-05, + "loss": 0.8940519094467163, + "step": 334, + "token_acc": 0.7399400438141358 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 2.766155481338501, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8875488042831421, + "step": 335, + "token_acc": 0.7465056801284721 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 1.169003963470459, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7597804069519043, + "step": 336, + "token_acc": 0.7758186397984886 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 1.2755037546157837, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8294762372970581, + "step": 337, + "token_acc": 0.7564102564102564 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.5991193056106567, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8293130397796631, + "step": 338, + "token_acc": 0.760047203828755 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 9.708932876586914, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6401220560073853, + "step": 339, + "token_acc": 0.8131151428910234 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 2.348402261734009, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7404853105545044, + "step": 340, + "token_acc": 0.7849596539389402 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 0.9730225801467896, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8264370560646057, + "step": 341, + "token_acc": 0.7558938089380893 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 3.2532331943511963, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7033358812332153, + "step": 342, + "token_acc": 0.7849215157761218 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 6.3877081871032715, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8262134790420532, + "step": 343, + "token_acc": 0.7543069554650083 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 0.9934179782867432, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8746166229248047, + "step": 344, + "token_acc": 0.7440602317298589 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 1.709168791770935, + "learning_rate": 4.038078976451567e-05, + "loss": 0.854055643081665, + "step": 345, + "token_acc": 0.7495352374514112 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.4886112213134766, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7562270164489746, + "step": 346, + "token_acc": 0.7793035107587769 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 1.901759147644043, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8186328411102295, + "step": 347, + "token_acc": 0.7593344425956738 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 1.0580676794052124, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7164099216461182, + "step": 348, + "token_acc": 0.7871918390478889 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 1.3126521110534668, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8912985324859619, + "step": 349, + "token_acc": 0.7413303013075612 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 4.351490020751953, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9175525903701782, + "step": 350, + "token_acc": 0.7297975018925057 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.268661379814148, + "learning_rate": 3.979373519225858e-05, + "loss": 0.9188856482505798, + "step": 351, + "token_acc": 0.7321795398520953 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 0.9793360829353333, + "learning_rate": 3.969463130731183e-05, + "loss": 0.885201096534729, + "step": 352, + "token_acc": 0.7393814077711726 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.042937994003296, + "learning_rate": 3.959517334544466e-05, + "loss": 0.885141134262085, + "step": 353, + "token_acc": 0.7363861965631877 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 4.194576263427734, + "learning_rate": 3.949536370316285e-05, + "loss": 0.8621309995651245, + "step": 354, + "token_acc": 0.7478715283894075 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 1.0623916387557983, + "learning_rate": 3.939520478544614e-05, + "loss": 0.9318335056304932, + "step": 355, + "token_acc": 0.7253218884120172 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 0.7876653075218201, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.8923368453979492, + "step": 356, + "token_acc": 0.7409687068568799 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 3.866694927215576, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8551492094993591, + "step": 357, + "token_acc": 0.7514216084484159 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 1.3935068845748901, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7526187896728516, + "step": 358, + "token_acc": 0.7810574580885513 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 2.3392226696014404, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7576834559440613, + "step": 359, + "token_acc": 0.7734380288363907 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.7921333312988281, + "learning_rate": 3.888925582549006e-05, + "loss": 0.83681321144104, + "step": 360, + "token_acc": 0.7514089615534847 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 1.2905741930007935, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8470603227615356, + "step": 361, + "token_acc": 0.7570712784871505 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 1.3079355955123901, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8253287076950073, + "step": 362, + "token_acc": 0.7527549467275495 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 1.8668463230133057, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7714506387710571, + "step": 363, + "token_acc": 0.7745460659045057 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 1.1210169792175293, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6929470300674438, + "step": 364, + "token_acc": 0.7864339547798492 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 1.4827960729599, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8307613730430603, + "step": 365, + "token_acc": 0.7528935515137694 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.1803950071334839, + "learning_rate": 3.827110064348773e-05, + "loss": 0.8122671842575073, + "step": 366, + "token_acc": 0.7532679738562091 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.0265437364578247, + "learning_rate": 3.816694101379631e-05, + "loss": 0.865354061126709, + "step": 367, + "token_acc": 0.7445534777510338 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 2.4629406929016113, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.6830093264579773, + "step": 368, + "token_acc": 0.7940572856250557 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 1.6382622718811035, + "learning_rate": 3.795767247323533e-05, + "loss": 0.925508975982666, + "step": 369, + "token_acc": 0.7297501555970481 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 2.4283573627471924, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7516419887542725, + "step": 370, + "token_acc": 0.7758667024993281 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 2.3246383666992188, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8408146500587463, + "step": 371, + "token_acc": 0.7506207875133026 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 1.099416732788086, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9075899720191956, + "step": 372, + "token_acc": 0.7271246458923513 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 1.478629469871521, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8168604373931885, + "step": 373, + "token_acc": 0.7583498307682482 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 2.8805809020996094, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9121578335762024, + "step": 374, + "token_acc": 0.7350334520809801 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 2.7889788150787354, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.8579491376876831, + "step": 375, + "token_acc": 0.7476709613478691 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 2.072909116744995, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8317067623138428, + "step": 376, + "token_acc": 0.7571112340896513 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 5.177697658538818, + "learning_rate": 3.710831292775353e-05, + "loss": 0.761266827583313, + "step": 377, + "token_acc": 0.7681555758128229 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 2.7568130493164062, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7219102382659912, + "step": 378, + "token_acc": 0.7849854227405247 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 0.9146714806556702, + "learning_rate": 3.689300402536093e-05, + "loss": 0.981315016746521, + "step": 379, + "token_acc": 0.717638864704858 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.7547582387924194, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8267868757247925, + "step": 380, + "token_acc": 0.7560030491678312 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 1.010188341140747, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8323397636413574, + "step": 381, + "token_acc": 0.7527500819173337 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 2.1391537189483643, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7416062355041504, + "step": 382, + "token_acc": 0.7789564467442863 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 2.62939190864563, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7494302988052368, + "step": 383, + "token_acc": 0.7737996532750433 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 3.6275126934051514, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6191868782043457, + "step": 384, + "token_acc": 0.8121914573942907 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 2.8354475498199463, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8018133044242859, + "step": 385, + "token_acc": 0.7613926797511694 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.408925175666809, + "learning_rate": 3.613053314713671e-05, + "loss": 0.839815616607666, + "step": 386, + "token_acc": 0.7488550290646468 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 2.7679271697998047, + "learning_rate": 3.602051485530486e-05, + "loss": 0.9087778925895691, + "step": 387, + "token_acc": 0.7297227794064702 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 3.360543727874756, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7623568177223206, + "step": 388, + "token_acc": 0.7737416741056101 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 1.070449948310852, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9299885034561157, + "step": 389, + "token_acc": 0.7274739583333333 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 4.474368572235107, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6639401912689209, + "step": 390, + "token_acc": 0.8028589716236398 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 1.5885690450668335, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8066656589508057, + "step": 391, + "token_acc": 0.7599889165973954 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.550413727760315, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7741931676864624, + "step": 392, + "token_acc": 0.767988750969744 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 1.496748685836792, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.7883261442184448, + "step": 393, + "token_acc": 0.7652963974839571 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.4409575462341309, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7302615642547607, + "step": 394, + "token_acc": 0.7827070285316632 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 0.9429992437362671, + "learning_rate": 3.513103285012475e-05, + "loss": 0.8207824230194092, + "step": 395, + "token_acc": 0.7606800348735833 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 1.858787178993225, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7316930294036865, + "step": 396, + "token_acc": 0.7801478515324195 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 2.4561638832092285, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7595556378364563, + "step": 397, + "token_acc": 0.7770890355820319 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 5.845393180847168, + "learning_rate": 3.47933752712989e-05, + "loss": 0.7122775316238403, + "step": 398, + "token_acc": 0.7888438880706922 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 1.6096240282058716, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8571289777755737, + "step": 399, + "token_acc": 0.7485540516367539 + }, + { + "epoch": 1.0, + "grad_norm": 1.6828404664993286, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7422727942466736, + "step": 400, + "token_acc": 0.7744593202883625 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 0.9042538404464722, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7470591068267822, + "step": 401, + "token_acc": 0.775092699143332 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 1.5840198993682861, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8494120836257935, + "step": 402, + "token_acc": 0.7467780083988994 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 1.7264753580093384, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7390634417533875, + "step": 403, + "token_acc": 0.778258834542476 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 3.9057250022888184, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6417334079742432, + "step": 404, + "token_acc": 0.803967657013915 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 13.16217041015625, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7573444843292236, + "step": 405, + "token_acc": 0.7765481064483112 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 2.6184492111206055, + "learning_rate": 3.388277253201041e-05, + "loss": 0.8021650314331055, + "step": 406, + "token_acc": 0.7634555116500885 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 0.9962872266769409, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8162388205528259, + "step": 407, + "token_acc": 0.7603709738062414 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 0.9261815547943115, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8409506678581238, + "step": 408, + "token_acc": 0.748269765092195 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 1.4823356866836548, + "learning_rate": 3.353768924152341e-05, + "loss": 0.6996514797210693, + "step": 409, + "token_acc": 0.7920583326012475 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 0.8279326558113098, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9892264008522034, + "step": 410, + "token_acc": 0.7166431939256629 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 1.2230151891708374, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7444078326225281, + "step": 411, + "token_acc": 0.7746187959419233 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 9.82090950012207, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8885623216629028, + "step": 412, + "token_acc": 0.7364721589570408 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 1.5039560794830322, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6384131908416748, + "step": 413, + "token_acc": 0.8135575732562939 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 2.572512626647949, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7594075202941895, + "step": 414, + "token_acc": 0.7756237883809642 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 1.3949657678604126, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8497216105461121, + "step": 415, + "token_acc": 0.7483397140401594 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 0.8779869079589844, + "learning_rate": 3.272542485937369e-05, + "loss": 0.8191887140274048, + "step": 416, + "token_acc": 0.7570150580652331 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 1.1911786794662476, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8783491849899292, + "step": 417, + "token_acc": 0.743301789989739 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.146852970123291, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8371091485023499, + "step": 418, + "token_acc": 0.7499376299376299 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.089304208755493, + "learning_rate": 3.23744632744341e-05, + "loss": 0.6695387363433838, + "step": 419, + "token_acc": 0.7941865916549461 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 3.357786178588867, + "learning_rate": 3.225711693136156e-05, + "loss": 0.6326532363891602, + "step": 420, + "token_acc": 0.8059025891725512 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 2.2081801891326904, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.8187626600265503, + "step": 421, + "token_acc": 0.7580794906936646 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 1.6402069330215454, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8068948984146118, + "step": 422, + "token_acc": 0.7584321435153898 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 1.57941734790802, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6910836696624756, + "step": 423, + "token_acc": 0.7918921316419764 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 1.2747334241867065, + "learning_rate": 3.178601124662686e-05, + "loss": 0.8506636619567871, + "step": 424, + "token_acc": 0.7479412315178738 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.1297740936279297, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.7539167404174805, + "step": 425, + "token_acc": 0.7679508587786259 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 2.4306747913360596, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7760396599769592, + "step": 426, + "token_acc": 0.7693063119364343 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 5.903867721557617, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8116412162780762, + "step": 427, + "token_acc": 0.7637670144406826 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 1.788726568222046, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7813456058502197, + "step": 428, + "token_acc": 0.7658718104495748 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 1.1867510080337524, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7816579937934875, + "step": 429, + "token_acc": 0.7660856605974211 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 4.440535068511963, + "learning_rate": 3.10745044975816e-05, + "loss": 0.800601601600647, + "step": 430, + "token_acc": 0.7669773635153129 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 1.7238138914108276, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8070148825645447, + "step": 431, + "token_acc": 0.7644200626959248 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 1.256711721420288, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8894907236099243, + "step": 432, + "token_acc": 0.7408053749836394 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 17.011455535888672, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8306131958961487, + "step": 433, + "token_acc": 0.7497091777383212 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 2.2736356258392334, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6613236665725708, + "step": 434, + "token_acc": 0.7976870839776776 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 2.7610883712768555, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8434382677078247, + "step": 435, + "token_acc": 0.7529855761774286 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 1.8570743799209595, + "learning_rate": 3.035772882662627e-05, + "loss": 0.7464153170585632, + "step": 436, + "token_acc": 0.7765296188122519 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 0.9314292073249817, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8278151750564575, + "step": 437, + "token_acc": 0.7535232235013894 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 1.3774133920669556, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8242682218551636, + "step": 438, + "token_acc": 0.7544135317496996 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 6.930232048034668, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.6596634984016418, + "step": 439, + "token_acc": 0.8021640826873385 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 4.866252422332764, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.506635308265686, + "step": 440, + "token_acc": 0.845995670995671 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.6028552055358887, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8647710680961609, + "step": 441, + "token_acc": 0.74706401151186 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 1.7333229780197144, + "learning_rate": 2.963630595278977e-05, + "loss": 0.6376317739486694, + "step": 442, + "token_acc": 0.8071622670807453 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 2.3443095684051514, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.721710205078125, + "step": 443, + "token_acc": 0.7838688149489942 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 0.9060749411582947, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.8552244901657104, + "step": 444, + "token_acc": 0.7432900127136601 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 0.749415397644043, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.785362720489502, + "step": 445, + "token_acc": 0.7612843660237998 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 0.7980436086654663, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8517442941665649, + "step": 446, + "token_acc": 0.7480493097557598 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 1.1448819637298584, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7649672031402588, + "step": 447, + "token_acc": 0.766477547078706 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 1.3443630933761597, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7490493059158325, + "step": 448, + "token_acc": 0.7757421770526879 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 4.406916618347168, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6007850170135498, + "step": 449, + "token_acc": 0.8233651384686991 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 1.3313847780227661, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6746580004692078, + "step": 450, + "token_acc": 0.7969903260480115 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 1.466326355934143, + "learning_rate": 2.854682793330633e-05, + "loss": 0.6978734731674194, + "step": 451, + "token_acc": 0.7890699904122723 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 1.363837718963623, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.6915320158004761, + "step": 452, + "token_acc": 0.7912602792120864 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 1.3149843215942383, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8228940963745117, + "step": 453, + "token_acc": 0.753298655163664 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 0.9304903745651245, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9149479269981384, + "step": 454, + "token_acc": 0.7286713286713287 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 1.7254271507263184, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.6899095773696899, + "step": 455, + "token_acc": 0.7892930042679532 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 5.276956081390381, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7458426356315613, + "step": 456, + "token_acc": 0.7750451577045991 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 1.1026403903961182, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.7810262441635132, + "step": 457, + "token_acc": 0.7638233460956282 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 5.3592143058776855, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7947831153869629, + "step": 458, + "token_acc": 0.7666825386028161 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 0.9304280281066895, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8342410922050476, + "step": 459, + "token_acc": 0.7494535884740622 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 1.1788454055786133, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8770091533660889, + "step": 460, + "token_acc": 0.7431479686260686 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.513720989227295, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8232619762420654, + "step": 461, + "token_acc": 0.7538295577130528 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 4.04278564453125, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8583269119262695, + "step": 462, + "token_acc": 0.7469663815396856 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 4.869415760040283, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.848386824131012, + "step": 463, + "token_acc": 0.7457259998452851 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 0.6062310338020325, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9125447273254395, + "step": 464, + "token_acc": 0.730836499607985 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 1.0651655197143555, + "learning_rate": 2.683911408999169e-05, + "loss": 0.716744601726532, + "step": 465, + "token_acc": 0.7814047029702971 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 2.8472161293029785, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6440662741661072, + "step": 466, + "token_acc": 0.80859707132735 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 3.403329372406006, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5214649438858032, + "step": 467, + "token_acc": 0.8430800314288921 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 5.556786060333252, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7512074708938599, + "step": 468, + "token_acc": 0.7785773595350125 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 2.395378351211548, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7191562652587891, + "step": 469, + "token_acc": 0.7896934402812877 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 0.9507644176483154, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8339272737503052, + "step": 470, + "token_acc": 0.7492740562731551 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 4.5672526359558105, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.7139979600906372, + "step": 471, + "token_acc": 0.7805757991197056 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 3.54498028755188, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8693740367889404, + "step": 472, + "token_acc": 0.7447919385996972 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 1.9187616109848022, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7921099662780762, + "step": 473, + "token_acc": 0.7626466275659824 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.4660390615463257, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.8307129144668579, + "step": 474, + "token_acc": 0.7560743513290618 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 0.8690254092216492, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8098856210708618, + "step": 475, + "token_acc": 0.7564140026883291 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 5.853299140930176, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6704491376876831, + "step": 476, + "token_acc": 0.7966314731020613 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 1.3092992305755615, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7706613540649414, + "step": 477, + "token_acc": 0.7744230161239329 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 2.787741184234619, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9088181257247925, + "step": 478, + "token_acc": 0.7326246933769419 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 2.232443332672119, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8565571308135986, + "step": 479, + "token_acc": 0.7444141689373297 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 9.54522705078125, + "learning_rate": 2.5e-05, + "loss": 0.7313039898872375, + "step": 480, + "token_acc": 0.781882145998241 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 20.989471435546875, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7575576901435852, + "step": 481, + "token_acc": 0.7708077584090351 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 1.1482243537902832, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.852341890335083, + "step": 482, + "token_acc": 0.7459840258458225 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 2.051314353942871, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.7475820183753967, + "step": 483, + "token_acc": 0.7779799247176914 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 1.342245101928711, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8240025043487549, + "step": 484, + "token_acc": 0.7542182827851346 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 1.3632580041885376, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8413196802139282, + "step": 485, + "token_acc": 0.7483724879705632 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 3.429781675338745, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9569882154464722, + "step": 486, + "token_acc": 0.7205176520780745 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.1299811601638794, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8428609371185303, + "step": 487, + "token_acc": 0.7533573202250038 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 1.7048869132995605, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7102815508842468, + "step": 488, + "token_acc": 0.7857550670853554 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 0.8680364489555359, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8275526762008667, + "step": 489, + "token_acc": 0.7501430369607507 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 1.3328769207000732, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.6902611255645752, + "step": 490, + "token_acc": 0.789313820240232 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 0.7926998734474182, + "learning_rate": 2.365075276976245e-05, + "loss": 0.8937082290649414, + "step": 491, + "token_acc": 0.7341974265051188 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 3.3240389823913574, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6675207614898682, + "step": 492, + "token_acc": 0.7990766225694753 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 5.930650234222412, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.783113420009613, + "step": 493, + "token_acc": 0.7705388240114731 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 0.8512884974479675, + "learning_rate": 2.328329352789066e-05, + "loss": 0.720180332660675, + "step": 494, + "token_acc": 0.7808032675289313 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 0.9648559093475342, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8460649251937866, + "step": 495, + "token_acc": 0.7489092921794621 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.8170979022979736, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8336548805236816, + "step": 496, + "token_acc": 0.7534397763225664 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 6.261831283569336, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6261081099510193, + "step": 497, + "token_acc": 0.8074581430745814 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 1.3391427993774414, + "learning_rate": 2.279394073699077e-05, + "loss": 0.7004765272140503, + "step": 498, + "token_acc": 0.7875529744153195 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.6274718046188354, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7182587385177612, + "step": 499, + "token_acc": 0.7839771101573677 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 4.34530782699585, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5547084808349609, + "step": 500, + "token_acc": 0.8279490944689183 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 6.319797515869141, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6171272993087769, + "step": 501, + "token_acc": 0.8103328365623448 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 1.2070508003234863, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8684753179550171, + "step": 502, + "token_acc": 0.7461618586114759 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.6517104506492615, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.929027795791626, + "step": 503, + "token_acc": 0.7245761408043324 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 7.505336761474609, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6728816032409668, + "step": 504, + "token_acc": 0.7991531132711 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 28.833297729492188, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7386347055435181, + "step": 505, + "token_acc": 0.7764926774314682 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 2.210476875305176, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6468443274497986, + "step": 506, + "token_acc": 0.8010013577732519 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 3.5139503479003906, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6901583671569824, + "step": 507, + "token_acc": 0.7926749509483323 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 1.6830179691314697, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8085765838623047, + "step": 508, + "token_acc": 0.7562606529434902 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 0.7797915935516357, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7800910472869873, + "step": 509, + "token_acc": 0.7595796361473256 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 1.7019588947296143, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8174337148666382, + "step": 510, + "token_acc": 0.7578614234731668 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 2.03682541847229, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.7452907562255859, + "step": 511, + "token_acc": 0.7781870595771941 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 0.9780297875404358, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8239941596984863, + "step": 512, + "token_acc": 0.7526496005217674 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 0.8718163371086121, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.796176552772522, + "step": 513, + "token_acc": 0.7592091654069536 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 2.4679477214813232, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7568551301956177, + "step": 514, + "token_acc": 0.7764072381190908 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 0.9792693853378296, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.8425300121307373, + "step": 515, + "token_acc": 0.7470879270715649 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.598029375076294, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7938356399536133, + "step": 516, + "token_acc": 0.7659052404042764 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 0.6741415858268738, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8783785104751587, + "step": 517, + "token_acc": 0.7394762056850847 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 1.6082953214645386, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7845078110694885, + "step": 518, + "token_acc": 0.7642520708137079 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 11.830879211425781, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8358283042907715, + "step": 519, + "token_acc": 0.7517000098551296 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 2.87798810005188, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.8649904131889343, + "step": 520, + "token_acc": 0.744602534154456 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 0.8139316439628601, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8346877098083496, + "step": 521, + "token_acc": 0.7504469606674613 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 2.8759028911590576, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7899202108383179, + "step": 522, + "token_acc": 0.7665122907018169 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 3.1788880825042725, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7810243368148804, + "step": 523, + "token_acc": 0.7666379186430933 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 0.7860379815101624, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8263541460037231, + "step": 524, + "token_acc": 0.7530105677070533 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 1.430240511894226, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7155407667160034, + "step": 525, + "token_acc": 0.7868094218415418 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 1.3369076251983643, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8235485553741455, + "step": 526, + "token_acc": 0.7551513200257566 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.0790313482284546, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8188608288764954, + "step": 527, + "token_acc": 0.7536337209302325 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 1.1045833826065063, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.8424797058105469, + "step": 528, + "token_acc": 0.7525659245223433 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 2.495410919189453, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8533246517181396, + "step": 529, + "token_acc": 0.7410009624639076 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 2.277566432952881, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8401960134506226, + "step": 530, + "token_acc": 0.7548590617685967 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 1.675037145614624, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6369855403900146, + "step": 531, + "token_acc": 0.8045444517979263 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 0.8442081212997437, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9534618854522705, + "step": 532, + "token_acc": 0.7226131426154497 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 0.8929516077041626, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.7794415354728699, + "step": 533, + "token_acc": 0.7713848312814952 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 1.1687227487564087, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.8722778558731079, + "step": 534, + "token_acc": 0.741757647821857 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 1.490539789199829, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.7561089396476746, + "step": 535, + "token_acc": 0.7730009802548663 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 1.109947919845581, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8310334086418152, + "step": 536, + "token_acc": 0.748946763692072 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 1.1950045824050903, + "learning_rate": 1.809595995707573e-05, + "loss": 0.8079832196235657, + "step": 537, + "token_acc": 0.7568485763589301 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 1.7237908840179443, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7125290632247925, + "step": 538, + "token_acc": 0.7834860972040361 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 3.228860855102539, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6453254222869873, + "step": 539, + "token_acc": 0.8018173950670705 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 0.8453672528266907, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8240500688552856, + "step": 540, + "token_acc": 0.7492266123663703 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 1.102385401725769, + "learning_rate": 1.762553672556591e-05, + "loss": 0.809388279914856, + "step": 541, + "token_acc": 0.7596028368794326 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.3018745183944702, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7180289030075073, + "step": 542, + "token_acc": 0.7798978365384616 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 3.1542391777038574, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.646782398223877, + "step": 543, + "token_acc": 0.8056676178293811 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 0.9923869967460632, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7879891991615295, + "step": 544, + "token_acc": 0.7618517074257701 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.2172160148620605, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7576411962509155, + "step": 545, + "token_acc": 0.7704047777040478 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 1.6602948904037476, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6707481145858765, + "step": 546, + "token_acc": 0.7971698113207547 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 1.4677680730819702, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8081753849983215, + "step": 547, + "token_acc": 0.755311542390194 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 2.0665853023529053, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8146413564682007, + "step": 548, + "token_acc": 0.7519490397413957 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 7.000178337097168, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7256150245666504, + "step": 549, + "token_acc": 0.7825356229448301 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 2.5341522693634033, + "learning_rate": 1.65777536651945e-05, + "loss": 0.726395845413208, + "step": 550, + "token_acc": 0.7819339150336146 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 1.4585434198379517, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.8065874576568604, + "step": 551, + "token_acc": 0.7564932940791625 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 1.8352439403533936, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8275594711303711, + "step": 552, + "token_acc": 0.7518390951226772 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.9580649137496948, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.7503329515457153, + "step": 553, + "token_acc": 0.7738378819846186 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 7.628960609436035, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.7021602392196655, + "step": 554, + "token_acc": 0.7898421209413167 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.2870745658874512, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.872342050075531, + "step": 555, + "token_acc": 0.7418959244573438 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 1.5503294467926025, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7012907266616821, + "step": 556, + "token_acc": 0.7840224809313528 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 1.410538673400879, + "learning_rate": 1.577407047339834e-05, + "loss": 0.7987989783287048, + "step": 557, + "token_acc": 0.7634807225667296 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 0.9178221821784973, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6806648969650269, + "step": 558, + "token_acc": 0.7902989575256311 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 0.756145179271698, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8719301819801331, + "step": 559, + "token_acc": 0.7413455258001306 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 1.1691936254501343, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.8100090026855469, + "step": 560, + "token_acc": 0.7591771792249119 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 35.45746994018555, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.7490640878677368, + "step": 561, + "token_acc": 0.7792402034101107 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 0.8100907206535339, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.778845489025116, + "step": 562, + "token_acc": 0.7706413851426537 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 1.7158607244491577, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8065593242645264, + "step": 563, + "token_acc": 0.7590346686267304 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 1.1593443155288696, + "learning_rate": 1.498127917242148e-05, + "loss": 0.9521163702011108, + "step": 564, + "token_acc": 0.7233781660727286 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 1.9125734567642212, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7740306258201599, + "step": 565, + "token_acc": 0.7697730265706096 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 0.8952035903930664, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8384573459625244, + "step": 566, + "token_acc": 0.7489069083392956 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 1.7073853015899658, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7088779211044312, + "step": 567, + "token_acc": 0.7877416700946113 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 2.4692201614379883, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.744478702545166, + "step": 568, + "token_acc": 0.7732206100765452 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 1.4949043989181519, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.7565535306930542, + "step": 569, + "token_acc": 0.7761570184817473 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 3.145484209060669, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7933104634284973, + "step": 570, + "token_acc": 0.761278654870717 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 1.172170877456665, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7600586414337158, + "step": 571, + "token_acc": 0.7707200207200208 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 1.8115105628967285, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7291625738143921, + "step": 572, + "token_acc": 0.7803458951638732 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 1.2004317045211792, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6606731414794922, + "step": 573, + "token_acc": 0.7994050797040653 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.2376269102096558, + "learning_rate": 1.38694668528633e-05, + "loss": 0.7951904535293579, + "step": 574, + "token_acc": 0.7661833626244874 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 2.052445411682129, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8511407971382141, + "step": 575, + "token_acc": 0.7467882836587872 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 0.9733930230140686, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.7993616461753845, + "step": 576, + "token_acc": 0.7636341403766203 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 5.800482749938965, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8141838908195496, + "step": 577, + "token_acc": 0.7566569997363565 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 2.696800470352173, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6543649435043335, + "step": 578, + "token_acc": 0.8048088161629654 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 4.301677703857422, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.647895872592926, + "step": 579, + "token_acc": 0.8066424494032174 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.5148913860321045, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7648165822029114, + "step": 580, + "token_acc": 0.7755042385267465 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 2.949655055999756, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7404133081436157, + "step": 581, + "token_acc": 0.7728736170461863 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 0.9238078594207764, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.917509138584137, + "step": 582, + "token_acc": 0.7355649875870905 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 83.38187408447266, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6469459533691406, + "step": 583, + "token_acc": 0.804023989166183 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 4.518279075622559, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8533624410629272, + "step": 584, + "token_acc": 0.7441301661403268 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 1.7925207614898682, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7255446314811707, + "step": 585, + "token_acc": 0.7831757417671992 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 6.655250072479248, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7307141423225403, + "step": 586, + "token_acc": 0.7741544170115598 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 0.8873371481895447, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8177270889282227, + "step": 587, + "token_acc": 0.7530202699287267 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 1.2454488277435303, + "learning_rate": 1.235856566555039e-05, + "loss": 0.6675281524658203, + "step": 588, + "token_acc": 0.7933152664859981 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.0082811117172241, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.7248143553733826, + "step": 589, + "token_acc": 0.7810338039259801 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 3.0372278690338135, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.666105329990387, + "step": 590, + "token_acc": 0.7997976825455214 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 1.4600460529327393, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.742726743221283, + "step": 591, + "token_acc": 0.7767523073085557 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 1.42963445186615, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.639944851398468, + "step": 592, + "token_acc": 0.8049067713444553 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.4108234643936157, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7738537788391113, + "step": 593, + "token_acc": 0.7662790011216719 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 2.011065721511841, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8032472133636475, + "step": 594, + "token_acc": 0.7643509458577952 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.9228585958480835, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7139896154403687, + "step": 595, + "token_acc": 0.7792246580252076 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 3.42121958732605, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6642230749130249, + "step": 596, + "token_acc": 0.7990822386179594 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 1.0371363162994385, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8180509209632874, + "step": 597, + "token_acc": 0.7535639466557662 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 1.0604794025421143, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8822356462478638, + "step": 598, + "token_acc": 0.7422369483029608 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 1.3429787158966064, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.70334792137146, + "step": 599, + "token_acc": 0.7864246823956443 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 1.2942774295806885, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7598515152931213, + "step": 600, + "token_acc": 0.7675241320058624 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 1.6313791275024414, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7451797723770142, + "step": 601, + "token_acc": 0.7745493358633776 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 1.9830615520477295, + "learning_rate": 1.090734344462458e-05, + "loss": 0.890819787979126, + "step": 602, + "token_acc": 0.7403223646024021 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 0.9711636900901794, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.766528844833374, + "step": 603, + "token_acc": 0.7713293650793651 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 2.051830530166626, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.7500281929969788, + "step": 604, + "token_acc": 0.7705687242132514 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 4.245327472686768, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.696961522102356, + "step": 605, + "token_acc": 0.7896506917373691 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 2.7437992095947266, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.891823410987854, + "step": 606, + "token_acc": 0.7399556762939663 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 1.5363843441009521, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.834951639175415, + "step": 607, + "token_acc": 0.7486957896400906 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 1.307376742362976, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.7804543375968933, + "step": 608, + "token_acc": 0.7650488867946754 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 1.2029725313186646, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.7981626987457275, + "step": 609, + "token_acc": 0.7576776926431197 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 2.243136405944824, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.618813693523407, + "step": 610, + "token_acc": 0.815751960085531 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 1.10971200466156, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.6312989592552185, + "step": 611, + "token_acc": 0.7997975894746527 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 0.9803842902183533, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7642860412597656, + "step": 612, + "token_acc": 0.7725077929221931 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 31.448169708251953, + "learning_rate": 9.813437667457229e-06, + "loss": 0.6522811651229858, + "step": 613, + "token_acc": 0.8037220388705537 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 0.9943018555641174, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8382527232170105, + "step": 614, + "token_acc": 0.751096142848065 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 0.9227951765060425, + "learning_rate": 9.619210235484333e-06, + "loss": 0.742218017578125, + "step": 615, + "token_acc": 0.7749133312322724 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 2.2479007244110107, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7250561714172363, + "step": 616, + "token_acc": 0.7738378549896875 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.514958143234253, + "learning_rate": 9.426465236041651e-06, + "loss": 0.6989889144897461, + "step": 617, + "token_acc": 0.7902208201892744 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 4.668854236602783, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7964303493499756, + "step": 618, + "token_acc": 0.7607207916892325 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 1.226259708404541, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8113234043121338, + "step": 619, + "token_acc": 0.7567243367935409 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 1.911278486251831, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7754377126693726, + "step": 620, + "token_acc": 0.7682521732984663 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.0659726858139038, + "learning_rate": 9.04549669873337e-06, + "loss": 0.810962975025177, + "step": 621, + "token_acc": 0.7570060922541341 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 1.9304813146591187, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6094653606414795, + "step": 622, + "token_acc": 0.8164489183979439 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 1.2579195499420166, + "learning_rate": 8.857309879408324e-06, + "loss": 0.66182541847229, + "step": 623, + "token_acc": 0.8028033383265568 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 1.7250380516052246, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8147578239440918, + "step": 624, + "token_acc": 0.7585159470600998 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 1.7458322048187256, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8331553339958191, + "step": 625, + "token_acc": 0.7498431694252763 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 1.2221341133117676, + "learning_rate": 8.577952526423969e-06, + "loss": 0.8016361594200134, + "step": 626, + "token_acc": 0.7612431882148631 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 3.993870973587036, + "learning_rate": 8.48562182685487e-06, + "loss": 0.7019971609115601, + "step": 627, + "token_acc": 0.7859397606208076 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 1.235687255859375, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6411934494972229, + "step": 628, + "token_acc": 0.8020742548370229 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 3.2990431785583496, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6782665252685547, + "step": 629, + "token_acc": 0.7922122674017918 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 1.9648222923278809, + "learning_rate": 8.211026128824539e-06, + "loss": 0.7926424741744995, + "step": 630, + "token_acc": 0.7613293051359517 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 1.3128774166107178, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8763965368270874, + "step": 631, + "token_acc": 0.7375299322212752 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 4.890468120574951, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6273766756057739, + "step": 632, + "token_acc": 0.8168607757239021 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 3.2160139083862305, + "learning_rate": 7.940071245792579e-06, + "loss": 0.5967519283294678, + "step": 633, + "token_acc": 0.8187688782418499 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 3.608379602432251, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6925722360610962, + "step": 634, + "token_acc": 0.7882998495442074 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 9.473015785217285, + "learning_rate": 7.761486381573327e-06, + "loss": 0.6970810890197754, + "step": 635, + "token_acc": 0.7880604576543105 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 1.1449179649353027, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7602096199989319, + "step": 636, + "token_acc": 0.7702360391479562 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 1.8277896642684937, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8149503469467163, + "step": 637, + "token_acc": 0.7562889343287841 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 2.1330368518829346, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.5871918201446533, + "step": 638, + "token_acc": 0.825297654131793 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 0.8962414264678955, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9314594268798828, + "step": 639, + "token_acc": 0.7280786651697573 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 1.338875412940979, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.7250627875328064, + "step": 640, + "token_acc": 0.7798726587129876 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 1.2020128965377808, + "learning_rate": 7.235768739040258e-06, + "loss": 0.7996973991394043, + "step": 641, + "token_acc": 0.76426948268948 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 96.59671783447266, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8170174360275269, + "step": 642, + "token_acc": 0.7553259286234523 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 0.7030874490737915, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9379591345787048, + "step": 643, + "token_acc": 0.7227594896834147 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 0.6374858617782593, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.8708009123802185, + "step": 644, + "token_acc": 0.73965669792957 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 1.4184483289718628, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7691725492477417, + "step": 645, + "token_acc": 0.7662367750405437 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 2.5497591495513916, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7211395502090454, + "step": 646, + "token_acc": 0.786339260513689 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 0.9087345004081726, + "learning_rate": 6.725459488639211e-06, + "loss": 0.872456431388855, + "step": 647, + "token_acc": 0.7409202044898866 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 1.3358864784240723, + "learning_rate": 6.641937264107867e-06, + "loss": 0.7510902881622314, + "step": 648, + "token_acc": 0.7725919309215423 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 3.704888105392456, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6040841341018677, + "step": 649, + "token_acc": 0.8143631436314364 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 0.9267286658287048, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8058043718338013, + "step": 650, + "token_acc": 0.7605926828030649 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 2.041635513305664, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8099769949913025, + "step": 651, + "token_acc": 0.7577828397873956 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 1.5155539512634277, + "learning_rate": 6.312291828435077e-06, + "loss": 0.6196180582046509, + "step": 652, + "token_acc": 0.8073305536701251 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 1.768568754196167, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7132784128189087, + "step": 653, + "token_acc": 0.78446311592139 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 0.8426440954208374, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8485860824584961, + "step": 654, + "token_acc": 0.748229935138882 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 4.96816873550415, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8367786407470703, + "step": 655, + "token_acc": 0.7491434739756887 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 3.880038022994995, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7719601392745972, + "step": 656, + "token_acc": 0.7681572629051621 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 0.7856653332710266, + "learning_rate": 5.910380944855087e-06, + "loss": 0.884110689163208, + "step": 657, + "token_acc": 0.7399053801298273 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 1.2310268878936768, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.7690421938896179, + "step": 658, + "token_acc": 0.7697993664202746 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 1.58376145362854, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8109105825424194, + "step": 659, + "token_acc": 0.7599358974358974 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 0.8561725616455078, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7711523771286011, + "step": 660, + "token_acc": 0.7678626345463865 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 1.3532984256744385, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7253690958023071, + "step": 661, + "token_acc": 0.7845570220501067 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 0.9115194082260132, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7143407464027405, + "step": 662, + "token_acc": 0.7897275258552108 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 1.3191654682159424, + "learning_rate": 5.443287214979592e-06, + "loss": 0.5992724299430847, + "step": 663, + "token_acc": 0.8163878593609135 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 1.710970163345337, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6404308080673218, + "step": 664, + "token_acc": 0.8054426911083814 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 0.9878676533699036, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6878443956375122, + "step": 665, + "token_acc": 0.7945592651475004 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.9691998958587646, + "learning_rate": 5.216076783983493e-06, + "loss": 0.6850720643997192, + "step": 666, + "token_acc": 0.7939158279963403 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 2.0937020778656006, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8503432273864746, + "step": 667, + "token_acc": 0.7473723926049696 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 1.6833800077438354, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8047228455543518, + "step": 668, + "token_acc": 0.7568868681465633 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 1.451167106628418, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8017756342887878, + "step": 669, + "token_acc": 0.7592959295929593 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 1.0639798641204834, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8059713840484619, + "step": 670, + "token_acc": 0.7561111111111111 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 1.0357158184051514, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8241342306137085, + "step": 671, + "token_acc": 0.7454847415403778 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 0.8671360015869141, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8555394411087036, + "step": 672, + "token_acc": 0.7474217794091942 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 5.883766174316406, + "learning_rate": 4.702687000087386e-06, + "loss": 0.6854438781738281, + "step": 673, + "token_acc": 0.7845229069641503 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 1.1688947677612305, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7587765455245972, + "step": 674, + "token_acc": 0.7688396791323014 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 21.169240951538086, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7326650619506836, + "step": 675, + "token_acc": 0.778235294117647 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 1.8388570547103882, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8537799119949341, + "step": 676, + "token_acc": 0.7444394008170676 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 1.0319663286209106, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7793920040130615, + "step": 677, + "token_acc": 0.7675712922718118 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 1.0005559921264648, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7914720773696899, + "step": 678, + "token_acc": 0.76452527161077 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 2.67810320854187, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.846095085144043, + "step": 679, + "token_acc": 0.748864050943584 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 2.256237506866455, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7095650434494019, + "step": 680, + "token_acc": 0.7868913027414468 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 1.4217983484268188, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7278553247451782, + "step": 681, + "token_acc": 0.7863779527559055 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.8460546731948853, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7024481892585754, + "step": 682, + "token_acc": 0.785208907425337 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 1.1893222332000732, + "learning_rate": 4.010984790046615e-06, + "loss": 0.6665959358215332, + "step": 683, + "token_acc": 0.7990233626962849 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 1.255271077156067, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8407459855079651, + "step": 684, + "token_acc": 0.7514467761734962 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 1.7191383838653564, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6034694314002991, + "step": 685, + "token_acc": 0.8184937382055241 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 2.4348859786987305, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8750420808792114, + "step": 686, + "token_acc": 0.7380963867046167 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 0.8619440793991089, + "learning_rate": 3.748372666094277e-06, + "loss": 0.8297964334487915, + "step": 687, + "token_acc": 0.752178699201908 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 1.1556035280227661, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7030929327011108, + "step": 688, + "token_acc": 0.7906772207563765 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 5.856689929962158, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.691868782043457, + "step": 689, + "token_acc": 0.7897428808404755 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.3657550811767578, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7366336584091187, + "step": 690, + "token_acc": 0.7799872733057588 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 1.1932430267333984, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6758766174316406, + "step": 691, + "token_acc": 0.7963037770147445 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 3.9285967350006104, + "learning_rate": 3.431640350555204e-06, + "loss": 0.6101948618888855, + "step": 692, + "token_acc": 0.8136406396989652 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 1.802047610282898, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6865506172180176, + "step": 693, + "token_acc": 0.7931622716610989 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 1.071358561515808, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8051484227180481, + "step": 694, + "token_acc": 0.7542495653853584 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.3180400133132935, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7677326202392578, + "step": 695, + "token_acc": 0.7704300280774347 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 1.2523272037506104, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7943510413169861, + "step": 696, + "token_acc": 0.7613922986379688 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 4.4054646492004395, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.701897382736206, + "step": 697, + "token_acc": 0.7884122654764857 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.3302299976348877, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8355323076248169, + "step": 698, + "token_acc": 0.7492808759395008 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 2.5054686069488525, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8056568503379822, + "step": 699, + "token_acc": 0.7634914412648635 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 8.32154369354248, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8949613571166992, + "step": 700, + "token_acc": 0.7380827429371118 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 2.0578978061676025, + "learning_rate": 2.894385171586095e-06, + "loss": 0.820101261138916, + "step": 701, + "token_acc": 0.7541902236453695 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.6051064729690552, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8328648209571838, + "step": 702, + "token_acc": 0.7533528918692373 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 3.2739200592041016, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6855148673057556, + "step": 703, + "token_acc": 0.7909475289387953 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 1.0998915433883667, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8189454078674316, + "step": 704, + "token_acc": 0.7593880389429764 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.3392704725265503, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7710374593734741, + "step": 705, + "token_acc": 0.7730310411592031 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 1.1777687072753906, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7353923916816711, + "step": 706, + "token_acc": 0.7839009776095869 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 10.78748893737793, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7313755750656128, + "step": 707, + "token_acc": 0.7793038863742782 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.7959760427474976, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8813682198524475, + "step": 708, + "token_acc": 0.7371300265360278 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 0.780621349811554, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8895928859710693, + "step": 709, + "token_acc": 0.7356559217024333 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 2.668718099594116, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.717865526676178, + "step": 710, + "token_acc": 0.7831172937085046 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 1.2820848226547241, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7374362945556641, + "step": 711, + "token_acc": 0.7759100253960576 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 1.9358655214309692, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8812097311019897, + "step": 712, + "token_acc": 0.7435395043423003 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 1.745857834815979, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.7244051694869995, + "step": 713, + "token_acc": 0.7779913161079081 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 3.7521867752075195, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9032388925552368, + "step": 714, + "token_acc": 0.7290010784039621 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 1.7055495977401733, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7481585144996643, + "step": 715, + "token_acc": 0.777170868347339 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 0.9156860113143921, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7256063222885132, + "step": 716, + "token_acc": 0.7821610365571494 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 1.2200286388397217, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.8634334206581116, + "step": 717, + "token_acc": 0.7441658887851713 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 1.2045998573303223, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7755439281463623, + "step": 718, + "token_acc": 0.7641643497065184 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.3511375188827515, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.7537750005722046, + "step": 719, + "token_acc": 0.7733905101358878 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 1.8665510416030884, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.6132658123970032, + "step": 720, + "token_acc": 0.8148300720906282 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 2.0403921604156494, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6217367053031921, + "step": 721, + "token_acc": 0.8100779115653142 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 0.9130368828773499, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8725777268409729, + "step": 722, + "token_acc": 0.7401973184922843 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 1.6816152334213257, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.821160614490509, + "step": 723, + "token_acc": 0.7509228532010888 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 1.0426051616668701, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7367508411407471, + "step": 724, + "token_acc": 0.7796639679637851 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 5.269510269165039, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7357650995254517, + "step": 725, + "token_acc": 0.7775466333818737 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 2.369504451751709, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7867926955223083, + "step": 726, + "token_acc": 0.7645618688156687 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.0830355882644653, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7860344648361206, + "step": 727, + "token_acc": 0.77024591593512 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 1.7200018167495728, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7187607288360596, + "step": 728, + "token_acc": 0.7883736120182887 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 1.1093928813934326, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.7947019934654236, + "step": 729, + "token_acc": 0.7565024903154399 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 3.5864369869232178, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.7369488477706909, + "step": 730, + "token_acc": 0.7861624969440143 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 1.4384573698043823, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8529449105262756, + "step": 731, + "token_acc": 0.7451984635083226 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 1.0439518690109253, + "learning_rate": 1.379848838328049e-06, + "loss": 0.7178291082382202, + "step": 732, + "token_acc": 0.7799321010939269 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 5.857388496398926, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7438476085662842, + "step": 733, + "token_acc": 0.7818851452734961 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 2.247035264968872, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8263076543807983, + "step": 734, + "token_acc": 0.7534708988947569 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.8630707263946533, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8856115341186523, + "step": 735, + "token_acc": 0.737244543305992 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 1.0327478647232056, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8134746551513672, + "step": 736, + "token_acc": 0.7548228013344292 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.5423094034194946, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6325390934944153, + "step": 737, + "token_acc": 0.8093323216995447 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 2.8762223720550537, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.6955031156539917, + "step": 738, + "token_acc": 0.7930338996198898 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 3.0213489532470703, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7289446592330933, + "step": 739, + "token_acc": 0.7758358662613982 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 0.8395518660545349, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.7442881464958191, + "step": 740, + "token_acc": 0.7756042787069322 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 0.9416394233703613, + "learning_rate": 1.041156686749717e-06, + "loss": 0.8054038286209106, + "step": 741, + "token_acc": 0.7603202943245144 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.5183863639831543, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.7220344543457031, + "step": 742, + "token_acc": 0.7839028916035256 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 2.2427620887756348, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8078048229217529, + "step": 743, + "token_acc": 0.7565702296819788 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 2.045294761657715, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6964831352233887, + "step": 744, + "token_acc": 0.7878059305838111 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 1.1594103574752808, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8750351667404175, + "step": 745, + "token_acc": 0.7404593114573162 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 1.434904932975769, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7638275623321533, + "step": 746, + "token_acc": 0.7692307692307693 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 3.405057907104492, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7193398475646973, + "step": 747, + "token_acc": 0.7806420567814669 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 0.7262636423110962, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8926572203636169, + "step": 748, + "token_acc": 0.7351848512173129 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 2.206441879272461, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8085426092147827, + "step": 749, + "token_acc": 0.7553703944798854 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 1.2215319871902466, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7416259050369263, + "step": 750, + "token_acc": 0.7799287594858293 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 1.1965488195419312, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7884664535522461, + "step": 751, + "token_acc": 0.7657542966263526 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 1.436772108078003, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6527396440505981, + "step": 752, + "token_acc": 0.7996812898387702 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 0.7072064280509949, + "learning_rate": 6.623969226072363e-07, + "loss": 0.9023393392562866, + "step": 753, + "token_acc": 0.7401707438459477 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 4.452742099761963, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8880629539489746, + "step": 754, + "token_acc": 0.7322737412364564 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.0246522426605225, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7470305562019348, + "step": 755, + "token_acc": 0.7724305041394629 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 1.336074709892273, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7636432647705078, + "step": 756, + "token_acc": 0.771588564692013 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 6.5312275886535645, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7831899523735046, + "step": 757, + "token_acc": 0.7635535636836779 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 1.6498327255249023, + "learning_rate": 5.294312162731934e-07, + "loss": 0.6954912543296814, + "step": 758, + "token_acc": 0.7876533742331289 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 1.4230884313583374, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7910645008087158, + "step": 759, + "token_acc": 0.7663237605372196 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 1.2716556787490845, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7857385277748108, + "step": 760, + "token_acc": 0.7617182793107603 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 3.85703706741333, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.740379810333252, + "step": 761, + "token_acc": 0.7729265967588179 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 1.468467354774475, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7387019991874695, + "step": 762, + "token_acc": 0.7750095334943434 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 1.6433247327804565, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.721135675907135, + "step": 763, + "token_acc": 0.7758144995597299 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 1.5427294969558716, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.6293338537216187, + "step": 764, + "token_acc": 0.8072302940167029 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 1.2883336544036865, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7614178657531738, + "step": 765, + "token_acc": 0.7687590187590188 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 2.724231243133545, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7500782608985901, + "step": 766, + "token_acc": 0.7765294194051175 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 3.1029133796691895, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8163322806358337, + "step": 767, + "token_acc": 0.7529584398371675 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 1.1530697345733643, + "learning_rate": 3.077914851215585e-07, + "loss": 0.729668140411377, + "step": 768, + "token_acc": 0.7845285524568393 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 3.2592809200286865, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.801484227180481, + "step": 769, + "token_acc": 0.760657514450867 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 18.562549591064453, + "learning_rate": 2.705872508804747e-07, + "loss": 0.6273467540740967, + "step": 770, + "token_acc": 0.8140587288817377 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 0.9975523352622986, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8133840560913086, + "step": 771, + "token_acc": 0.7572153325817362 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 1.3826740980148315, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6214898228645325, + "step": 772, + "token_acc": 0.8168546113572291 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 0.9996422529220581, + "learning_rate": 2.192509677903687e-07, + "loss": 0.7946609854698181, + "step": 773, + "token_acc": 0.7653636764922263 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 2.9878437519073486, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.8433146476745605, + "step": 774, + "token_acc": 0.7486024904583831 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 2.0441744327545166, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.762677788734436, + "step": 775, + "token_acc": 0.7752121679709026 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 5.5609130859375, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7419829368591309, + "step": 776, + "token_acc": 0.7775021264530763 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 1.5714855194091797, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.7751676440238953, + "step": 777, + "token_acc": 0.7671714112658995 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 1.8620251417160034, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6445480585098267, + "step": 778, + "token_acc": 0.8050112118553183 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 2.552483081817627, + "learning_rate": 1.327100431795125e-07, + "loss": 0.7001749873161316, + "step": 779, + "token_acc": 0.7868405963302753 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 0.9818560481071472, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.863308846950531, + "step": 780, + "token_acc": 0.7440897738547333 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.901882225393664e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..0a5c0949b9e78863976a098788736c9e2fa4561c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70864e8baf48fd11f3bcc3f8c1a6bc83ff4a36f38843321e0e319388c62d18a5 +size 8977 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-780/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..813f75c9673fb9919c650bb329f62094c3d07d41 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(down_proj|gate_proj|v_proj|q_proj|k_proj|o_proj|up_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|gate_proj|mlp.2|mlp.0|attn.proj|up_proj|qkv))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..8e53aee0a75bd525fac0618ae5ff73d79f8ac19d --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0a8d956cc290ec23409c8dcc7cbf1839ea3fb1bee706dda51be41616cf316d43 +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/args.json new file mode 100644 index 0000000000000000000000000000000000000000..f87e1241b42011d71443f9395aa0b92b2e8c5058 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..ef3f665d01e84b92f21ad5c640f247e1c56845ea --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3792f3fc7d86f19bbb88ce8e66310ec21430240efa0d1fd15035662651387c18 +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..d831e459fa733d9af4aefacf91c4791e2bf3bf1e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:27d02fbc7b1162edd7faa78b8ba8db812e71d0c38e44fb972b08fbbd222a1b24 +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..4761ec1677b365295ed608f14a7360f64ce5c14d --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ffd2ac4973a048fd3b6744e3443b8463f59870bd3ce8ddc6d95835b6ec134ead +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..213835008d70b72ce52a1743a445788844db6476 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7d5df32cd95a000798bb77aa064ecc6a3b07d7ac40303b85aef18935f81dc479 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..108e6a299cc36e11c65272b86b9753a295f02eec --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9a8e73f50c2935b0de8e8ab17af95993b1f7c0a05fa7bed41c8376e5176b9e21 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..0d77e9b09e1d71619767d40463771b5b57e97f19 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bb9a0a967d2986e0ebb4a56e7570ce33d02a59148d815b5817ff8a9a6e511cb3 +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..295d67bc192d9711a917127db96d63a23d119a85 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ad874d0b3506c6cefea75466653ce13fad02625ba102c56f1a45f24cdf94c135 +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..4b139f6ddc3cec30c410ad4d99053bb4b8ebc8ee --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:41904ab8da7d44ac053add58748a5bef8da81dee97e16f39ba2f27e2bcade32b +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..ba3fcbbea997481c306ee58b409c66f77a3430c1 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/global_step790/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cabbb04506edbe8344a51af4d79c7158d9a1584e5f4fcfdf5161a3cf59f6ef2c +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/latest new file mode 100644 index 0000000000000000000000000000000000000000..4063e09c8e977daac7183734788b33f1e7c57532 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/latest @@ -0,0 +1 @@ +global_step790 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..ebed1cbf3be515c6a146f854c42a2a57446b9366 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e15fd64abc18c52608bfd2f2c10ae306c90e7bb2e6a4c8b0c563cfaa50ca3620 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..753fa4c90fd6b5e96a93ea3a0b204c806cdf355f --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:187c5af8b30f9f91a2d4e768432c827931c1396dbe96a58ba13f812fe52a387c +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..19f4ff0f83ccd18ffdca7f056da78922e4e887e3 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8772a2e426d7cb32f50addc2ae913df822dd2c7c1148a8a0fddf5fcbd3dc1c4c +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..5f611cc4edff18a53ba6adb3a3bf40a985dd9e43 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f43511c24e4245d6e36be3a43629849cc6ece1dc445f926ed7de1a322c61576d +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..112858422cf9663802e94ff737110668bfac7e73 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8b92ce604f2d7755609926f3c7dc545b633f9026cc0809fb9925212c065f8da6 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..7fe153b5e09bbde652d01a58929614a5e6ca3ef0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f43cf5e839305162a2d06abf606bac2c8a53c554b012daba6e6b7f7daa3b165e +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..f50e59d6084e70b561ea40f4417d984ca1cc5693 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:230702e0ec4b4316353a735f1f086b110ca4f6ef38229b102fede372f0410023 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..17b7191b9e6ddb25b7e755b7beb664a421e95be1 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:111fac9cf238ba0e8f9c11380e293ed22de8f2aff003da2ce1dd912c1bab83a6 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..a9a2d9bb4e829f08f192e2dd4d91dc944579ace9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d41f6995235eb5427339d2fc8cc042254d91f00a2b7526717fd1bc7cec9e2ada +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..1b6f25581446f3907cc5865ad0618de1237aaa79 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/trainer_state.json @@ -0,0 +1,6354 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9762202753441802, + "eval_steps": 2000, + "global_step": 790, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 2.9617536067962646, + "learning_rate": 3.125e-07, + "loss": 1.4579824209213257, + "step": 1, + "token_acc": 0.6568419333768779 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 1.423774242401123, + "learning_rate": 6.25e-07, + "loss": 1.5049985647201538, + "step": 2, + "token_acc": 0.6365098770992857 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 1.5966103076934814, + "learning_rate": 9.375e-07, + "loss": 1.4851462841033936, + "step": 3, + "token_acc": 0.6467950044849238 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 1.452944278717041, + "learning_rate": 1.25e-06, + "loss": 1.4441643953323364, + "step": 4, + "token_acc": 0.6555674699475139 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 2.1675608158111572, + "learning_rate": 1.5625e-06, + "loss": 1.4831663370132446, + "step": 5, + "token_acc": 0.6366577364403782 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 8.398337364196777, + "learning_rate": 1.875e-06, + "loss": 1.4721344709396362, + "step": 6, + "token_acc": 0.6424400084943724 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 3.0731256008148193, + "learning_rate": 2.1875e-06, + "loss": 1.4525271654129028, + "step": 7, + "token_acc": 0.6579513486678802 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 1.5642091035842896, + "learning_rate": 2.5e-06, + "loss": 1.4381799697875977, + "step": 8, + "token_acc": 0.6511047537890315 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 2.8113529682159424, + "learning_rate": 2.8125e-06, + "loss": 1.541656255722046, + "step": 9, + "token_acc": 0.618830879071843 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.6361396312713623, + "learning_rate": 3.125e-06, + "loss": 1.5417851209640503, + "step": 10, + "token_acc": 0.6177715521179086 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 12.022518157958984, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5132269859313965, + "step": 11, + "token_acc": 0.6238978192242098 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 2.668394088745117, + "learning_rate": 3.75e-06, + "loss": 1.46922767162323, + "step": 12, + "token_acc": 0.6533487002176975 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 7.9799017906188965, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4974768161773682, + "step": 13, + "token_acc": 0.6374414379959843 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 3.233323574066162, + "learning_rate": 4.375e-06, + "loss": 1.4622106552124023, + "step": 14, + "token_acc": 0.6697823145984504 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 24.691530227661133, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.477518081665039, + "step": 15, + "token_acc": 0.66816 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 2.897843360900879, + "learning_rate": 5e-06, + "loss": 1.4357118606567383, + "step": 16, + "token_acc": 0.6778693025809994 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 19.82540512084961, + "learning_rate": 5.3125e-06, + "loss": 1.5187983512878418, + "step": 17, + "token_acc": 0.6306321643400296 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 2.93292236328125, + "learning_rate": 5.625e-06, + "loss": 1.455895185470581, + "step": 18, + "token_acc": 0.6512200710276091 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 1.6330183744430542, + "learning_rate": 5.9375e-06, + "loss": 1.422993540763855, + "step": 19, + "token_acc": 0.661488625487742 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 4.298096179962158, + "learning_rate": 6.25e-06, + "loss": 1.4982240200042725, + "step": 20, + "token_acc": 0.6452436974789916 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 1.313482403755188, + "learning_rate": 6.5625e-06, + "loss": 1.518486738204956, + "step": 21, + "token_acc": 0.6326643752078944 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 1.76573646068573, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4727129936218262, + "step": 22, + "token_acc": 0.6483625537545484 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 1.4560825824737549, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4510971307754517, + "step": 23, + "token_acc": 0.6514202049780381 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.091919183731079, + "learning_rate": 7.5e-06, + "loss": 1.5022644996643066, + "step": 24, + "token_acc": 0.6532272645091304 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.740084171295166, + "learning_rate": 7.8125e-06, + "loss": 1.4717752933502197, + "step": 25, + "token_acc": 0.639137679650073 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 2.8075263500213623, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4721131324768066, + "step": 26, + "token_acc": 0.6409317316144155 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 1.5441093444824219, + "learning_rate": 8.437500000000002e-06, + "loss": 1.5016684532165527, + "step": 27, + "token_acc": 0.6426081151249907 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 2.806373119354248, + "learning_rate": 8.75e-06, + "loss": 1.4954692125320435, + "step": 28, + "token_acc": 0.6546207959911342 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 4.36266565322876, + "learning_rate": 9.0625e-06, + "loss": 1.4520496129989624, + "step": 29, + "token_acc": 0.6418620292083013 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 1.5149106979370117, + "learning_rate": 9.375000000000001e-06, + "loss": 1.4115290641784668, + "step": 30, + "token_acc": 0.651825091489162 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 2.1750094890594482, + "learning_rate": 9.6875e-06, + "loss": 1.4292242527008057, + "step": 31, + "token_acc": 0.6480092934840004 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 2.171316623687744, + "learning_rate": 1e-05, + "loss": 1.4468941688537598, + "step": 32, + "token_acc": 0.6347569955817378 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 1.6085623502731323, + "learning_rate": 1.03125e-05, + "loss": 1.4548325538635254, + "step": 33, + "token_acc": 0.6387750322051763 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 2.6019768714904785, + "learning_rate": 1.0625e-05, + "loss": 1.3636939525604248, + "step": 34, + "token_acc": 0.6694069289489136 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 1.7189018726348877, + "learning_rate": 1.09375e-05, + "loss": 1.3792800903320312, + "step": 35, + "token_acc": 0.6634405670665212 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 3.069101572036743, + "learning_rate": 1.125e-05, + "loss": 1.418148398399353, + "step": 36, + "token_acc": 0.652867715078631 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 0.9760923385620117, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.487064242362976, + "step": 37, + "token_acc": 0.6303966303966304 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 0.9802103638648987, + "learning_rate": 1.1875e-05, + "loss": 1.3090462684631348, + "step": 38, + "token_acc": 0.6665271562409453 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 4.357207298278809, + "learning_rate": 1.21875e-05, + "loss": 1.4249074459075928, + "step": 39, + "token_acc": 0.6332261759597975 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 1.186145305633545, + "learning_rate": 1.25e-05, + "loss": 1.3373064994812012, + "step": 40, + "token_acc": 0.6725337118523775 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 5.261158466339111, + "learning_rate": 1.28125e-05, + "loss": 1.340531349182129, + "step": 41, + "token_acc": 0.6683364091747956 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 2.458296775817871, + "learning_rate": 1.3125e-05, + "loss": 1.332282304763794, + "step": 42, + "token_acc": 0.667586315623522 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 2.0579333305358887, + "learning_rate": 1.34375e-05, + "loss": 1.3493250608444214, + "step": 43, + "token_acc": 0.6604139715394567 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 1.6432338953018188, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.3249701261520386, + "step": 44, + "token_acc": 0.6745012519182618 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 1.0298691987991333, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.349682092666626, + "step": 45, + "token_acc": 0.6590545786709294 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 1.3843709230422974, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.300336480140686, + "step": 46, + "token_acc": 0.6736927993472496 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 15.729647636413574, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.295595645904541, + "step": 47, + "token_acc": 0.6904139433551199 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 1.218788743019104, + "learning_rate": 1.5e-05, + "loss": 1.329056739807129, + "step": 48, + "token_acc": 0.6649002289826628 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.2413642406463623, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3466482162475586, + "step": 49, + "token_acc": 0.6608733843644121 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 1.7129898071289062, + "learning_rate": 1.5625e-05, + "loss": 1.1971522569656372, + "step": 50, + "token_acc": 0.6957063780980401 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 12.908634185791016, + "learning_rate": 1.59375e-05, + "loss": 1.338015079498291, + "step": 51, + "token_acc": 0.664876476906552 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 2.4744150638580322, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3184266090393066, + "step": 52, + "token_acc": 0.6541958563124162 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 1.5035480260849, + "learning_rate": 1.65625e-05, + "loss": 1.3414291143417358, + "step": 53, + "token_acc": 0.6604707140946777 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 0.9383847117424011, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2710291147232056, + "step": 54, + "token_acc": 0.6716895400593472 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 0.8049397468566895, + "learning_rate": 1.71875e-05, + "loss": 1.321635365486145, + "step": 55, + "token_acc": 0.6582027168234065 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 0.9869638085365295, + "learning_rate": 1.75e-05, + "loss": 1.3294317722320557, + "step": 56, + "token_acc": 0.6607637747193387 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 3.6263885498046875, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2151306867599487, + "step": 57, + "token_acc": 0.689805574037111 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 2.4337313175201416, + "learning_rate": 1.8125e-05, + "loss": 1.2164831161499023, + "step": 58, + "token_acc": 0.6946524064171123 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 1.2465195655822754, + "learning_rate": 1.84375e-05, + "loss": 1.2001479864120483, + "step": 59, + "token_acc": 0.6949291573452647 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 1.211704969406128, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2468581199645996, + "step": 60, + "token_acc": 0.6773460003031987 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 1.1252233982086182, + "learning_rate": 1.90625e-05, + "loss": 1.2663486003875732, + "step": 61, + "token_acc": 0.6731120837719541 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 0.68025803565979, + "learning_rate": 1.9375e-05, + "loss": 1.2598896026611328, + "step": 62, + "token_acc": 0.6730806308564378 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 3.702453374862671, + "learning_rate": 1.96875e-05, + "loss": 1.2166805267333984, + "step": 63, + "token_acc": 0.691328125 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 53.140132904052734, + "learning_rate": 2e-05, + "loss": 1.2387148141860962, + "step": 64, + "token_acc": 0.6720997123681688 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 2.1026854515075684, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2545907497406006, + "step": 65, + "token_acc": 0.6658680632939603 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 1.5480505228042603, + "learning_rate": 2.0625e-05, + "loss": 1.2474756240844727, + "step": 66, + "token_acc": 0.6753335794525606 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 8.795135498046875, + "learning_rate": 2.09375e-05, + "loss": 1.1903716325759888, + "step": 67, + "token_acc": 0.7095110155830199 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 1.6788009405136108, + "learning_rate": 2.125e-05, + "loss": 1.255184531211853, + "step": 68, + "token_acc": 0.675844505309692 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 2.194441080093384, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.2032387256622314, + "step": 69, + "token_acc": 0.6907407407407408 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 1.1291356086730957, + "learning_rate": 2.1875e-05, + "loss": 1.1963188648223877, + "step": 70, + "token_acc": 0.6802986594264382 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 1.3670284748077393, + "learning_rate": 2.21875e-05, + "loss": 1.2278125286102295, + "step": 71, + "token_acc": 0.6708903388760261 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 2.758354663848877, + "learning_rate": 2.25e-05, + "loss": 1.2158769369125366, + "step": 72, + "token_acc": 0.6867505551443376 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 2.6226625442504883, + "learning_rate": 2.28125e-05, + "loss": 1.074498176574707, + "step": 73, + "token_acc": 0.718917166477549 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 5.092314720153809, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.183173656463623, + "step": 74, + "token_acc": 0.6937396580253723 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 1.6192283630371094, + "learning_rate": 2.34375e-05, + "loss": 1.1696088314056396, + "step": 75, + "token_acc": 0.6922164214523019 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 1.9894205331802368, + "learning_rate": 2.375e-05, + "loss": 1.02431058883667, + "step": 76, + "token_acc": 0.7350316975815919 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 5.026700019836426, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1793923377990723, + "step": 77, + "token_acc": 0.6889119550616681 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 0.9851458668708801, + "learning_rate": 2.4375e-05, + "loss": 1.2031577825546265, + "step": 78, + "token_acc": 0.6798439806029939 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 1.4935272932052612, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.2100965976715088, + "step": 79, + "token_acc": 0.6759376522162689 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 2.0270609855651855, + "learning_rate": 2.5e-05, + "loss": 1.2182433605194092, + "step": 80, + "token_acc": 0.672459042468586 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 2.171703577041626, + "learning_rate": 2.53125e-05, + "loss": 1.1599236726760864, + "step": 81, + "token_acc": 0.6896967941290073 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 1.3919153213500977, + "learning_rate": 2.5625e-05, + "loss": 1.2469699382781982, + "step": 82, + "token_acc": 0.6607023411371238 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 5.726469039916992, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.0905996561050415, + "step": 83, + "token_acc": 0.705477288521069 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 2.4800686836242676, + "learning_rate": 2.625e-05, + "loss": 1.1631360054016113, + "step": 84, + "token_acc": 0.6929383361834826 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 1.3907530307769775, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0351084470748901, + "step": 85, + "token_acc": 0.7256065167345493 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 4.023968696594238, + "learning_rate": 2.6875e-05, + "loss": 1.1698168516159058, + "step": 86, + "token_acc": 0.6915017462165308 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.434358596801758, + "learning_rate": 2.71875e-05, + "loss": 1.0965162515640259, + "step": 87, + "token_acc": 0.7119186046511627 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 1.8500336408615112, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0884002447128296, + "step": 88, + "token_acc": 0.7045622522340926 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 3.2268683910369873, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1824790239334106, + "step": 89, + "token_acc": 0.6851617168990027 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 16.243087768554688, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.971013069152832, + "step": 90, + "token_acc": 0.7361684210526316 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 2.5743207931518555, + "learning_rate": 2.84375e-05, + "loss": 1.0600107908248901, + "step": 91, + "token_acc": 0.7134351911627573 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.0203638076782227, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.1500616073608398, + "step": 92, + "token_acc": 0.6882268690919507 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 1.1112314462661743, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0045973062515259, + "step": 93, + "token_acc": 0.7273007237078478 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 2.5539236068725586, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1666638851165771, + "step": 94, + "token_acc": 0.6864643371757925 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 2.1663148403167725, + "learning_rate": 2.96875e-05, + "loss": 1.0808672904968262, + "step": 95, + "token_acc": 0.695645939874779 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 1.9498071670532227, + "learning_rate": 3e-05, + "loss": 0.9929013252258301, + "step": 96, + "token_acc": 0.738973897389739 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 4.303379058837891, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.1222727298736572, + "step": 97, + "token_acc": 0.688846697280113 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 4.010090351104736, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1498996019363403, + "step": 98, + "token_acc": 0.6880553287546227 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 1.8286547660827637, + "learning_rate": 3.09375e-05, + "loss": 1.0506386756896973, + "step": 99, + "token_acc": 0.7126414484319431 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 2.414545774459839, + "learning_rate": 3.125e-05, + "loss": 1.0510246753692627, + "step": 100, + "token_acc": 0.711717754376551 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 35.13666534423828, + "learning_rate": 3.15625e-05, + "loss": 1.105303168296814, + "step": 101, + "token_acc": 0.6977885525070956 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 1.9485750198364258, + "learning_rate": 3.1875e-05, + "loss": 1.0945279598236084, + "step": 102, + "token_acc": 0.7003108322092546 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 3.3463339805603027, + "learning_rate": 3.21875e-05, + "loss": 1.068230390548706, + "step": 103, + "token_acc": 0.7030742861310675 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 2.5563361644744873, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.001434564590454, + "step": 104, + "token_acc": 0.721863062004114 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 1.6362377405166626, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.0632514953613281, + "step": 105, + "token_acc": 0.7117752471241112 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 2.2173712253570557, + "learning_rate": 3.3125e-05, + "loss": 1.127671241760254, + "step": 106, + "token_acc": 0.6865707549439446 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 2.128298044204712, + "learning_rate": 3.34375e-05, + "loss": 1.0473824739456177, + "step": 107, + "token_acc": 0.7126287780582656 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 1.5433886051177979, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9804874658584595, + "step": 108, + "token_acc": 0.7238202367561197 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 6.602525234222412, + "learning_rate": 3.40625e-05, + "loss": 1.0798405408859253, + "step": 109, + "token_acc": 0.6913783927621076 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 1.55194091796875, + "learning_rate": 3.4375e-05, + "loss": 1.0854990482330322, + "step": 110, + "token_acc": 0.7073425229282223 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 1.3037891387939453, + "learning_rate": 3.46875e-05, + "loss": 1.0851027965545654, + "step": 111, + "token_acc": 0.7052621625455061 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 1.3887872695922852, + "learning_rate": 3.5e-05, + "loss": 0.9681501984596252, + "step": 112, + "token_acc": 0.7300288416392783 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 2.441603422164917, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0306782722473145, + "step": 113, + "token_acc": 0.7176060047405847 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 1.4105886220932007, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.015556812286377, + "step": 114, + "token_acc": 0.7166026744339997 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 3.6527352333068848, + "learning_rate": 3.59375e-05, + "loss": 1.1317176818847656, + "step": 115, + "token_acc": 0.6872061871303644 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 1.8553370237350464, + "learning_rate": 3.625e-05, + "loss": 1.0447880029678345, + "step": 116, + "token_acc": 0.7100111234705228 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.274932861328125, + "learning_rate": 3.65625e-05, + "loss": 0.8988428711891174, + "step": 117, + "token_acc": 0.7594645889521526 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 1.7594488859176636, + "learning_rate": 3.6875e-05, + "loss": 1.0872691869735718, + "step": 118, + "token_acc": 0.7017732981189027 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 3.4330825805664062, + "learning_rate": 3.71875e-05, + "loss": 1.0752581357955933, + "step": 119, + "token_acc": 0.7016698075995967 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 4.466182708740234, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9912147521972656, + "step": 120, + "token_acc": 0.7193773043834494 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 1.5049115419387817, + "learning_rate": 3.78125e-05, + "loss": 1.018737554550171, + "step": 121, + "token_acc": 0.7152019002375297 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 3.3945202827453613, + "learning_rate": 3.8125e-05, + "loss": 0.9846063256263733, + "step": 122, + "token_acc": 0.7239054568527918 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 1.5377535820007324, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0859057903289795, + "step": 123, + "token_acc": 0.698030902197399 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 2.696385622024536, + "learning_rate": 3.875e-05, + "loss": 1.0317624807357788, + "step": 124, + "token_acc": 0.711888309124242 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.061471700668335, + "learning_rate": 3.90625e-05, + "loss": 0.9196208715438843, + "step": 125, + "token_acc": 0.7408977209560867 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 1.1909533739089966, + "learning_rate": 3.9375e-05, + "loss": 0.908572793006897, + "step": 126, + "token_acc": 0.7447868298860278 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 2.976712226867676, + "learning_rate": 3.96875e-05, + "loss": 0.8775178790092468, + "step": 127, + "token_acc": 0.7585321100917432 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 3.037933349609375, + "learning_rate": 4e-05, + "loss": 1.0048859119415283, + "step": 128, + "token_acc": 0.7140471578384877 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 5.830648422241211, + "learning_rate": 4.0312500000000004e-05, + "loss": 0.9985315799713135, + "step": 129, + "token_acc": 0.7206040268456376 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 1.3143258094787598, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.9825519323348999, + "step": 130, + "token_acc": 0.7247136031316562 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 2.4536049365997314, + "learning_rate": 4.09375e-05, + "loss": 0.8758414387702942, + "step": 131, + "token_acc": 0.7611605215439081 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 3.183997631072998, + "learning_rate": 4.125e-05, + "loss": 0.9772047400474548, + "step": 132, + "token_acc": 0.722866503718342 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 1.653651237487793, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0216748714447021, + "step": 133, + "token_acc": 0.71066228276186 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 1.1030162572860718, + "learning_rate": 4.1875e-05, + "loss": 0.9526140689849854, + "step": 134, + "token_acc": 0.7339804459449955 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 4.92834997177124, + "learning_rate": 4.21875e-05, + "loss": 0.8791989088058472, + "step": 135, + "token_acc": 0.7551160285910115 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 0.7831388115882874, + "learning_rate": 4.25e-05, + "loss": 1.0653268098831177, + "step": 136, + "token_acc": 0.7019186391507879 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 1.9757318496704102, + "learning_rate": 4.28125e-05, + "loss": 1.0078719854354858, + "step": 137, + "token_acc": 0.7167237320778943 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 4.613290786743164, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.8363289833068848, + "step": 138, + "token_acc": 0.7749772244154267 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 1.626499891281128, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.9550644755363464, + "step": 139, + "token_acc": 0.732905151161282 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 7.68024206161499, + "learning_rate": 4.375e-05, + "loss": 0.8922043442726135, + "step": 140, + "token_acc": 0.7493879367905631 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 5.447193622589111, + "learning_rate": 4.40625e-05, + "loss": 0.8937676548957825, + "step": 141, + "token_acc": 0.7455310199789695 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 2.561711311340332, + "learning_rate": 4.4375e-05, + "loss": 1.030370831489563, + "step": 142, + "token_acc": 0.712084974676421 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 2.330228328704834, + "learning_rate": 4.46875e-05, + "loss": 0.8835145831108093, + "step": 143, + "token_acc": 0.7573455306612916 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 3.3042826652526855, + "learning_rate": 4.5e-05, + "loss": 0.9554994702339172, + "step": 144, + "token_acc": 0.7331631024577082 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.903152346611023, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9345872402191162, + "step": 145, + "token_acc": 0.7318692226564923 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 1.0897647142410278, + "learning_rate": 4.5625e-05, + "loss": 0.9259800910949707, + "step": 146, + "token_acc": 0.7344223913159155 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 1.892134428024292, + "learning_rate": 4.59375e-05, + "loss": 0.8477439284324646, + "step": 147, + "token_acc": 0.7550676911818515 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 1.995365858078003, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.926980197429657, + "step": 148, + "token_acc": 0.7390321121664405 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 0.967679500579834, + "learning_rate": 4.65625e-05, + "loss": 1.040574073791504, + "step": 149, + "token_acc": 0.7037716802789759 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 1.3489030599594116, + "learning_rate": 4.6875e-05, + "loss": 0.9701130390167236, + "step": 150, + "token_acc": 0.722164475695506 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 1.8906278610229492, + "learning_rate": 4.71875e-05, + "loss": 1.0237723588943481, + "step": 151, + "token_acc": 0.7124020961289232 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 1.4073423147201538, + "learning_rate": 4.75e-05, + "loss": 0.8609241247177124, + "step": 152, + "token_acc": 0.7521867897238101 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 1.7892054319381714, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.0169634819030762, + "step": 153, + "token_acc": 0.7109900672861262 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 5.222759246826172, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.8839869499206543, + "step": 154, + "token_acc": 0.7499611740953565 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 47.99449920654297, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9847191572189331, + "step": 155, + "token_acc": 0.7206756827869284 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 2.1542346477508545, + "learning_rate": 4.875e-05, + "loss": 0.8897120952606201, + "step": 156, + "token_acc": 0.7461834889580554 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 1.6777710914611816, + "learning_rate": 4.90625e-05, + "loss": 0.9585904479026794, + "step": 157, + "token_acc": 0.726420528934276 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 1.6333376169204712, + "learning_rate": 4.937500000000001e-05, + "loss": 0.8516196012496948, + "step": 158, + "token_acc": 0.7541220115416323 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 1.346437692642212, + "learning_rate": 4.96875e-05, + "loss": 0.8823418021202087, + "step": 159, + "token_acc": 0.752115152181079 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 3.7089667320251465, + "learning_rate": 5e-05, + "loss": 0.9368952512741089, + "step": 160, + "token_acc": 0.7302366635405748 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 1.9471855163574219, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8721541166305542, + "step": 161, + "token_acc": 0.7594202898550725 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 2.1255381107330322, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.875278115272522, + "step": 162, + "token_acc": 0.7485261365125114 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 1.0908252000808716, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8458836078643799, + "step": 163, + "token_acc": 0.7550397067806964 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 1.6298143863677979, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.0290120840072632, + "step": 164, + "token_acc": 0.7065329357549471 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 1.5110621452331543, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9266539812088013, + "step": 165, + "token_acc": 0.7334730109720461 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.3298150300979614, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9487897157669067, + "step": 166, + "token_acc": 0.7244558712708896 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 1.4212807416915894, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8636137247085571, + "step": 167, + "token_acc": 0.75104248110503 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.1823561191558838, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.944591224193573, + "step": 168, + "token_acc": 0.7279493670886076 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 3.800663471221924, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.7865618467330933, + "step": 169, + "token_acc": 0.7755815987405982 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 2.064781427383423, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8385809659957886, + "step": 170, + "token_acc": 0.7639746370765893 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 2.5913920402526855, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8421958088874817, + "step": 171, + "token_acc": 0.7620282597030943 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 1.7713373899459839, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8133989572525024, + "step": 172, + "token_acc": 0.760867708600222 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 1.529839038848877, + "learning_rate": 4.994911507566217e-05, + "loss": 1.000519037246704, + "step": 173, + "token_acc": 0.712219074598678 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 1.5380620956420898, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9671303033828735, + "step": 174, + "token_acc": 0.7277875219243297 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 2.8864336013793945, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8283255100250244, + "step": 175, + "token_acc": 0.7675478577939836 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 1.0531455278396606, + "learning_rate": 4.99229333433282e-05, + "loss": 0.915996789932251, + "step": 176, + "token_acc": 0.7366725083385155 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 1.4250882863998413, + "learning_rate": 4.991300473502437e-05, + "loss": 0.8618585467338562, + "step": 177, + "token_acc": 0.7541533421729975 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 5.33800745010376, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.002793788909912, + "step": 178, + "token_acc": 0.7128742904190319 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 1.2855201959609985, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8489822745323181, + "step": 179, + "token_acc": 0.7639533864890914 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.6636594533920288, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9121615290641785, + "step": 180, + "token_acc": 0.7437731849496555 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 1.5193665027618408, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8066229224205017, + "step": 181, + "token_acc": 0.7651162790697674 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 1.5862308740615845, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9458524584770203, + "step": 182, + "token_acc": 0.7302548696579126 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 2.379222869873047, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9564061164855957, + "step": 183, + "token_acc": 0.7301209802502326 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.0790810585021973, + "learning_rate": 4.982671142387316e-05, + "loss": 0.942729651927948, + "step": 184, + "token_acc": 0.7303644468955375 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 9.259621620178223, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8534692525863647, + "step": 185, + "token_acc": 0.7507731234186112 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 3.4542312622070312, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0024710893630981, + "step": 186, + "token_acc": 0.7177069583254762 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 8.031414985656738, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8734491467475891, + "step": 187, + "token_acc": 0.7507000736919676 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 1.1859290599822998, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9791375398635864, + "step": 188, + "token_acc": 0.7258350951374207 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 3.053464889526367, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8371925354003906, + "step": 189, + "token_acc": 0.7536518241479077 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 1.5525466203689575, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8489048480987549, + "step": 190, + "token_acc": 0.7543675535526885 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 1.2123963832855225, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8702831864356995, + "step": 191, + "token_acc": 0.7504071889918562 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 4.12030553817749, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8116580843925476, + "step": 192, + "token_acc": 0.7636261170598181 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 3.596958875656128, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.8202139139175415, + "step": 193, + "token_acc": 0.7595227168425883 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 3.500709295272827, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9322924017906189, + "step": 194, + "token_acc": 0.7302081098476721 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 2.0435562133789062, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7780945301055908, + "step": 195, + "token_acc": 0.7680968459194598 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 1.0618855953216553, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8902656435966492, + "step": 196, + "token_acc": 0.7357566856373539 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 1.3093773126602173, + "learning_rate": 4.958879433443904e-05, + "loss": 0.7953319549560547, + "step": 197, + "token_acc": 0.7690320619966571 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 4.695700645446777, + "learning_rate": 4.95663319832678e-05, + "loss": 0.9916477203369141, + "step": 198, + "token_acc": 0.7183775051303323 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 1.1738910675048828, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8842062950134277, + "step": 199, + "token_acc": 0.7402211505674899 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 1.958127737045288, + "learning_rate": 4.951963201008076e-05, + "loss": 0.8272268772125244, + "step": 200, + "token_acc": 0.7592515245175842 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 0.9756200313568115, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8797040581703186, + "step": 201, + "token_acc": 0.7454005184295378 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 1.441583275794983, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7635867595672607, + "step": 202, + "token_acc": 0.7780200258397932 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 0.9431282877922058, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8886734247207642, + "step": 203, + "token_acc": 0.7458984875672905 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.4262967109680176, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9764437675476074, + "step": 204, + "token_acc": 0.7219959266802444 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 1.837144136428833, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8055057525634766, + "step": 205, + "token_acc": 0.7705683101242002 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 0.9157178401947021, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9508963227272034, + "step": 206, + "token_acc": 0.7266013284407079 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 1.1117141246795654, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8796980381011963, + "step": 207, + "token_acc": 0.7448091668820539 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 1.206092119216919, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.7853018045425415, + "step": 208, + "token_acc": 0.7676789587852495 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 3.613619804382324, + "learning_rate": 4.92803071949828e-05, + "loss": 0.930952250957489, + "step": 209, + "token_acc": 0.7290444145356663 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 2.278681755065918, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9441535472869873, + "step": 210, + "token_acc": 0.7330724921204217 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 1.102830410003662, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9249938130378723, + "step": 211, + "token_acc": 0.7305298501351241 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.1460347175598145, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.938249945640564, + "step": 212, + "token_acc": 0.7304270462633452 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.1301722526550293, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8906076550483704, + "step": 213, + "token_acc": 0.7410463483146067 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 1.019655466079712, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8547159433364868, + "step": 214, + "token_acc": 0.7477573904179409 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 0.8400518298149109, + "learning_rate": 4.9094401644886e-05, + "loss": 0.9786480069160461, + "step": 215, + "token_acc": 0.7191857669498317 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 1.3454630374908447, + "learning_rate": 4.906138091134118e-05, + "loss": 0.930005669593811, + "step": 216, + "token_acc": 0.7302245555212423 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 1.7261593341827393, + "learning_rate": 4.90277804028108e-05, + "loss": 0.7304342985153198, + "step": 217, + "token_acc": 0.7930695985079023 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 0.8376732468605042, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9497151374816895, + "step": 218, + "token_acc": 0.7235062817684856 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 1.5206397771835327, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7451450228691101, + "step": 219, + "token_acc": 0.7850740452065471 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 2.350113868713379, + "learning_rate": 4.892350839330522e-05, + "loss": 0.894478440284729, + "step": 220, + "token_acc": 0.7408569868995634 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 2.151811361312866, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8410134315490723, + "step": 221, + "token_acc": 0.7524846536100556 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 2.2998857498168945, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8774259090423584, + "step": 222, + "token_acc": 0.7482207812747114 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 4.154652118682861, + "learning_rate": 4.881404839143988e-05, + "loss": 0.848537027835846, + "step": 223, + "token_acc": 0.7471583220568335 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 3.917426824569702, + "learning_rate": 4.877641290737884e-05, + "loss": 0.8067992925643921, + "step": 224, + "token_acc": 0.7612280960094242 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 6.496757507324219, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8888064026832581, + "step": 225, + "token_acc": 0.7468172852788237 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 2.212669849395752, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8939536809921265, + "step": 226, + "token_acc": 0.7427561031257129 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 2.2665131092071533, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8388830423355103, + "step": 227, + "token_acc": 0.7591590470858991 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 1.6633414030075073, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8939744234085083, + "step": 228, + "token_acc": 0.7423191278493558 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 10.390888214111328, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8337754607200623, + "step": 229, + "token_acc": 0.760409214479897 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 1.9441218376159668, + "learning_rate": 4.853860162957552e-05, + "loss": 0.8908044099807739, + "step": 230, + "token_acc": 0.741635046567782 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 5.351205825805664, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6824640035629272, + "step": 231, + "token_acc": 0.7986786566342449 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 5.388350486755371, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.8338614702224731, + "step": 232, + "token_acc": 0.7588204709203 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 33.36974334716797, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8330967426300049, + "step": 233, + "token_acc": 0.7553732862360055 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.2575448751449585, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8081785440444946, + "step": 234, + "token_acc": 0.7618624367564611 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 5.851841926574707, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8118147253990173, + "step": 235, + "token_acc": 0.7588138835747472 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 1.2276482582092285, + "learning_rate": 4.828037336897009e-05, + "loss": 0.85323566198349, + "step": 236, + "token_acc": 0.7462974887314875 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 1.4128162860870361, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9805375337600708, + "step": 237, + "token_acc": 0.7154090994195843 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.1258808374404907, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.7949981689453125, + "step": 238, + "token_acc": 0.7637019230769231 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 2.17614483833313, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8806252479553223, + "step": 239, + "token_acc": 0.7484175458078846 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 2.775895357131958, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8502448797225952, + "step": 240, + "token_acc": 0.7478745871013158 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 3.2797460556030273, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.7003047466278076, + "step": 241, + "token_acc": 0.7912219560008713 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 3.991440773010254, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.90602707862854, + "step": 242, + "token_acc": 0.7321293536764378 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 1.5725153684616089, + "learning_rate": 4.79536020593051e-05, + "loss": 0.9273116588592529, + "step": 243, + "token_acc": 0.729396270880987 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 1.5961885452270508, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.8434361219406128, + "step": 244, + "token_acc": 0.7547051878602681 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.036643385887146, + "learning_rate": 4.785524389258827e-05, + "loss": 0.93770432472229, + "step": 245, + "token_acc": 0.727697519566995 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 1.0603351593017578, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8905070424079895, + "step": 246, + "token_acc": 0.7367771247962862 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.6090335845947266, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.773712694644928, + "step": 247, + "token_acc": 0.7752465741468099 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 2.8802406787872314, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.889683723449707, + "step": 248, + "token_acc": 0.7375587262919784 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 0.9473100304603577, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9071462750434875, + "step": 249, + "token_acc": 0.7377093584939732 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 1.420573353767395, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7493491172790527, + "step": 250, + "token_acc": 0.7773999683694449 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 1.5327718257904053, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.845209538936615, + "step": 251, + "token_acc": 0.7534288560263581 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 1.9740188121795654, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8819962739944458, + "step": 252, + "token_acc": 0.7408409658617818 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 4.266992092132568, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.836998462677002, + "step": 253, + "token_acc": 0.753389326102771 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 3.870814085006714, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7518301010131836, + "step": 254, + "token_acc": 0.7717560376586164 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 6.527884006500244, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.7232604622840881, + "step": 255, + "token_acc": 0.786843072399853 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 1.4010592699050903, + "learning_rate": 4.72751631047092e-05, + "loss": 0.8275509476661682, + "step": 256, + "token_acc": 0.756143383181784 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 6.857308864593506, + "learning_rate": 4.721918194465169e-05, + "loss": 0.799940288066864, + "step": 257, + "token_acc": 0.7626774847870182 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 1.6401067972183228, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7834373116493225, + "step": 258, + "token_acc": 0.7659123055162659 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 1.6125162839889526, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8310164213180542, + "step": 259, + "token_acc": 0.7511212139829206 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 1.442099690437317, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.879160463809967, + "step": 260, + "token_acc": 0.7447237531926334 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 1.0048458576202393, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9174377918243408, + "step": 261, + "token_acc": 0.7316501716824884 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 6.172839164733887, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7322565317153931, + "step": 262, + "token_acc": 0.7848805398504468 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 2.718960762023926, + "learning_rate": 4.687209999162396e-05, + "loss": 0.9046364426612854, + "step": 263, + "token_acc": 0.7374393892499742 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 0.7975059151649475, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9695983529090881, + "step": 264, + "token_acc": 0.7193242184098232 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 2.3180477619171143, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8064447641372681, + "step": 265, + "token_acc": 0.7668189605939463 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 2.5961692333221436, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.836155354976654, + "step": 266, + "token_acc": 0.7518848526387937 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 0.7738305330276489, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.9511428475379944, + "step": 267, + "token_acc": 0.7291764338177841 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 1.9640631675720215, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8413755297660828, + "step": 268, + "token_acc": 0.7570005091279366 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 3.4764976501464844, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8661715984344482, + "step": 269, + "token_acc": 0.7496790040752526 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 2.8140335083007812, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8345517516136169, + "step": 270, + "token_acc": 0.7584374551199196 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 2.1373839378356934, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8521395921707153, + "step": 271, + "token_acc": 0.7504881307162676 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 0.9885866641998291, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8748230934143066, + "step": 272, + "token_acc": 0.7425441926038391 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 3.56126070022583, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.8168613314628601, + "step": 273, + "token_acc": 0.7603961787018826 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 25.966888427734375, + "learning_rate": 4.618673848685586e-05, + "loss": 0.7895940542221069, + "step": 274, + "token_acc": 0.7658349328214972 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 1.3936517238616943, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8234192132949829, + "step": 275, + "token_acc": 0.758264992311635 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 2.4734811782836914, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8250598311424255, + "step": 276, + "token_acc": 0.7552643893308376 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 2.5281338691711426, + "learning_rate": 4.59890152099534e-05, + "loss": 0.9137836694717407, + "step": 277, + "token_acc": 0.7314060158619934 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 1.5060079097747803, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8653621077537537, + "step": 278, + "token_acc": 0.7430385386500334 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 1.0087921619415283, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8411096930503845, + "step": 279, + "token_acc": 0.7529303234208813 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 1.5636194944381714, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7783745527267456, + "step": 280, + "token_acc": 0.7702870220272718 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 1.9277583360671997, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9275861978530884, + "step": 281, + "token_acc": 0.724974081327036 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 1.4190716743469238, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8562414646148682, + "step": 282, + "token_acc": 0.7458445307056832 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.4012247323989868, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8905417323112488, + "step": 283, + "token_acc": 0.7400331750843677 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 2.845858335494995, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7349405288696289, + "step": 284, + "token_acc": 0.7778809689652504 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 2.043717622756958, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.739836573600769, + "step": 285, + "token_acc": 0.7864004044489383 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 1.1184813976287842, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7316737771034241, + "step": 286, + "token_acc": 0.7790425932906144 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 1.7550926208496094, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9168081283569336, + "step": 287, + "token_acc": 0.7349883025734338 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 2.2734856605529785, + "learning_rate": 4.522542485937369e-05, + "loss": 0.8405396342277527, + "step": 288, + "token_acc": 0.753734827264239 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 0.8263589143753052, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9497283697128296, + "step": 289, + "token_acc": 0.7289892452187454 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 4.233347415924072, + "learning_rate": 4.508018828701612e-05, + "loss": 0.8274160623550415, + "step": 290, + "token_acc": 0.7547876258286276 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 2.796037197113037, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8769165277481079, + "step": 291, + "token_acc": 0.7473155929038282 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 0.9638167023658752, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9158531427383423, + "step": 292, + "token_acc": 0.736260350471789 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 2.0772323608398438, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8095401525497437, + "step": 293, + "token_acc": 0.7583516215557181 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 1.0814753770828247, + "learning_rate": 4.478392321601651e-05, + "loss": 0.8873149752616882, + "step": 294, + "token_acc": 0.7437832431695232 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 4.168087005615234, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7311573028564453, + "step": 295, + "token_acc": 0.78859817771462 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 1.3557254076004028, + "learning_rate": 4.463292327201862e-05, + "loss": 0.8367257118225098, + "step": 296, + "token_acc": 0.752932016156504 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 2.2594828605651855, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8442533016204834, + "step": 297, + "token_acc": 0.7561402328241706 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 1.4002978801727295, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7559725642204285, + "step": 298, + "token_acc": 0.7742537313432836 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.6578376293182373, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8327486515045166, + "step": 299, + "token_acc": 0.7559387210816846 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 3.8968186378479004, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.8528477549552917, + "step": 300, + "token_acc": 0.750763448437867 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 1.1830475330352783, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9132996797561646, + "step": 301, + "token_acc": 0.7312029217073728 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 1.79401433467865, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8471458554267883, + "step": 302, + "token_acc": 0.7578536464464961 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.1060916185379028, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8816431760787964, + "step": 303, + "token_acc": 0.7383714445064138 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 3.274479627609253, + "learning_rate": 4.401014914000078e-05, + "loss": 0.7977585792541504, + "step": 304, + "token_acc": 0.7648344784509682 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 4.249853610992432, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8551120162010193, + "step": 305, + "token_acc": 0.7446675388203174 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 9.041977882385254, + "learning_rate": 4.384983704904674e-05, + "loss": 0.806232213973999, + "step": 306, + "token_acc": 0.7649096031932379 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 1.081554889678955, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8331530094146729, + "step": 307, + "token_acc": 0.7551795135761163 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.7485742568969727, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7645971775054932, + "step": 308, + "token_acc": 0.776908023483366 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 2.283208131790161, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8550758361816406, + "step": 309, + "token_acc": 0.7544976635514019 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 0.8769519925117493, + "learning_rate": 4.352377813387398e-05, + "loss": 0.9192790389060974, + "step": 310, + "token_acc": 0.7294477565108253 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 2.909032106399536, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.6819452047348022, + "step": 311, + "token_acc": 0.7967241883591694 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 2.9573018550872803, + "learning_rate": 4.335806273589214e-05, + "loss": 0.791392982006073, + "step": 312, + "token_acc": 0.7667422052043448 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 2.8347651958465576, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7407418489456177, + "step": 313, + "token_acc": 0.781952 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 24.759061813354492, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8645349740982056, + "step": 314, + "token_acc": 0.7462040885571295 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 2.6164278984069824, + "learning_rate": 4.310617707378668e-05, + "loss": 0.8003748059272766, + "step": 315, + "token_acc": 0.764179104477612 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 1.0327874422073364, + "learning_rate": 4.302133991757297e-05, + "loss": 0.883104681968689, + "step": 316, + "token_acc": 0.7430525185862521 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 1.9250575304031372, + "learning_rate": 4.2936068525181e-05, + "loss": 0.8418888449668884, + "step": 317, + "token_acc": 0.7478256547885294 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 0.9483305811882019, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9749743938446045, + "step": 318, + "token_acc": 0.7198247535596933 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 4.413815975189209, + "learning_rate": 4.276423126095974e-05, + "loss": 0.8005592226982117, + "step": 319, + "token_acc": 0.7621298667191911 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 3.177881956100464, + "learning_rate": 4.267766952966369e-05, + "loss": 0.941821813583374, + "step": 320, + "token_acc": 0.7269460518947172 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 1.1445744037628174, + "learning_rate": 4.259068184315608e-05, + "loss": 0.905495285987854, + "step": 321, + "token_acc": 0.7364675688287448 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 2.5400984287261963, + "learning_rate": 4.250327029746309e-05, + "loss": 0.749504029750824, + "step": 322, + "token_acc": 0.7781667031284183 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 1.716409683227539, + "learning_rate": 4.24154369988241e-05, + "loss": 0.7389223575592041, + "step": 323, + "token_acc": 0.7833673658808242 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.4108213186264038, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9132614135742188, + "step": 324, + "token_acc": 0.7287277061252287 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 2.222651720046997, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7642686367034912, + "step": 325, + "token_acc": 0.7748897656068694 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 2.48195481300354, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6340684294700623, + "step": 326, + "token_acc": 0.8057753164556962 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 0.8498600721359253, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9634742736816406, + "step": 327, + "token_acc": 0.7193177752156801 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 1.3811802864074707, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8113643527030945, + "step": 328, + "token_acc": 0.7561390347586897 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 0.8957132697105408, + "learning_rate": 4.187969961854726e-05, + "loss": 0.995599627494812, + "step": 329, + "token_acc": 0.71316625740286 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 1.3119924068450928, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7408137917518616, + "step": 330, + "token_acc": 0.7839771101573677 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 2.3570327758789062, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6798240542411804, + "step": 331, + "token_acc": 0.8010324216627422 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 1.039640188217163, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.7958476543426514, + "step": 332, + "token_acc": 0.7642944234101264 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 5.126318454742432, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7409902811050415, + "step": 333, + "token_acc": 0.7794841832902095 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 1.3792798519134521, + "learning_rate": 4.142204747357604e-05, + "loss": 0.8940519094467163, + "step": 334, + "token_acc": 0.7399400438141358 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 2.766155481338501, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8875488042831421, + "step": 335, + "token_acc": 0.7465056801284721 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 1.169003963470459, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7597804069519043, + "step": 336, + "token_acc": 0.7758186397984886 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 1.2755037546157837, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8294762372970581, + "step": 337, + "token_acc": 0.7564102564102564 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.5991193056106567, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8293130397796631, + "step": 338, + "token_acc": 0.760047203828755 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 9.708932876586914, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6401220560073853, + "step": 339, + "token_acc": 0.8131151428910234 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 2.348402261734009, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7404853105545044, + "step": 340, + "token_acc": 0.7849596539389402 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 0.9730225801467896, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8264370560646057, + "step": 341, + "token_acc": 0.7558938089380893 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 3.2532331943511963, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7033358812332153, + "step": 342, + "token_acc": 0.7849215157761218 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 6.3877081871032715, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8262134790420532, + "step": 343, + "token_acc": 0.7543069554650083 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 0.9934179782867432, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8746166229248047, + "step": 344, + "token_acc": 0.7440602317298589 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 1.709168791770935, + "learning_rate": 4.038078976451567e-05, + "loss": 0.854055643081665, + "step": 345, + "token_acc": 0.7495352374514112 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.4886112213134766, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7562270164489746, + "step": 346, + "token_acc": 0.7793035107587769 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 1.901759147644043, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8186328411102295, + "step": 347, + "token_acc": 0.7593344425956738 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 1.0580676794052124, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7164099216461182, + "step": 348, + "token_acc": 0.7871918390478889 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 1.3126521110534668, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8912985324859619, + "step": 349, + "token_acc": 0.7413303013075612 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 4.351490020751953, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9175525903701782, + "step": 350, + "token_acc": 0.7297975018925057 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.268661379814148, + "learning_rate": 3.979373519225858e-05, + "loss": 0.9188856482505798, + "step": 351, + "token_acc": 0.7321795398520953 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 0.9793360829353333, + "learning_rate": 3.969463130731183e-05, + "loss": 0.885201096534729, + "step": 352, + "token_acc": 0.7393814077711726 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.042937994003296, + "learning_rate": 3.959517334544466e-05, + "loss": 0.885141134262085, + "step": 353, + "token_acc": 0.7363861965631877 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 4.194576263427734, + "learning_rate": 3.949536370316285e-05, + "loss": 0.8621309995651245, + "step": 354, + "token_acc": 0.7478715283894075 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 1.0623916387557983, + "learning_rate": 3.939520478544614e-05, + "loss": 0.9318335056304932, + "step": 355, + "token_acc": 0.7253218884120172 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 0.7876653075218201, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.8923368453979492, + "step": 356, + "token_acc": 0.7409687068568799 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 3.866694927215576, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8551492094993591, + "step": 357, + "token_acc": 0.7514216084484159 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 1.3935068845748901, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7526187896728516, + "step": 358, + "token_acc": 0.7810574580885513 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 2.3392226696014404, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7576834559440613, + "step": 359, + "token_acc": 0.7734380288363907 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.7921333312988281, + "learning_rate": 3.888925582549006e-05, + "loss": 0.83681321144104, + "step": 360, + "token_acc": 0.7514089615534847 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 1.2905741930007935, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8470603227615356, + "step": 361, + "token_acc": 0.7570712784871505 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 1.3079355955123901, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8253287076950073, + "step": 362, + "token_acc": 0.7527549467275495 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 1.8668463230133057, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7714506387710571, + "step": 363, + "token_acc": 0.7745460659045057 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 1.1210169792175293, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6929470300674438, + "step": 364, + "token_acc": 0.7864339547798492 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 1.4827960729599, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8307613730430603, + "step": 365, + "token_acc": 0.7528935515137694 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.1803950071334839, + "learning_rate": 3.827110064348773e-05, + "loss": 0.8122671842575073, + "step": 366, + "token_acc": 0.7532679738562091 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.0265437364578247, + "learning_rate": 3.816694101379631e-05, + "loss": 0.865354061126709, + "step": 367, + "token_acc": 0.7445534777510338 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 2.4629406929016113, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.6830093264579773, + "step": 368, + "token_acc": 0.7940572856250557 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 1.6382622718811035, + "learning_rate": 3.795767247323533e-05, + "loss": 0.925508975982666, + "step": 369, + "token_acc": 0.7297501555970481 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 2.4283573627471924, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7516419887542725, + "step": 370, + "token_acc": 0.7758667024993281 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 2.3246383666992188, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8408146500587463, + "step": 371, + "token_acc": 0.7506207875133026 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 1.099416732788086, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9075899720191956, + "step": 372, + "token_acc": 0.7271246458923513 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 1.478629469871521, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8168604373931885, + "step": 373, + "token_acc": 0.7583498307682482 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 2.8805809020996094, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9121578335762024, + "step": 374, + "token_acc": 0.7350334520809801 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 2.7889788150787354, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.8579491376876831, + "step": 375, + "token_acc": 0.7476709613478691 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 2.072909116744995, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8317067623138428, + "step": 376, + "token_acc": 0.7571112340896513 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 5.177697658538818, + "learning_rate": 3.710831292775353e-05, + "loss": 0.761266827583313, + "step": 377, + "token_acc": 0.7681555758128229 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 2.7568130493164062, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7219102382659912, + "step": 378, + "token_acc": 0.7849854227405247 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 0.9146714806556702, + "learning_rate": 3.689300402536093e-05, + "loss": 0.981315016746521, + "step": 379, + "token_acc": 0.717638864704858 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.7547582387924194, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8267868757247925, + "step": 380, + "token_acc": 0.7560030491678312 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 1.010188341140747, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8323397636413574, + "step": 381, + "token_acc": 0.7527500819173337 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 2.1391537189483643, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7416062355041504, + "step": 382, + "token_acc": 0.7789564467442863 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 2.62939190864563, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7494302988052368, + "step": 383, + "token_acc": 0.7737996532750433 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 3.6275126934051514, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6191868782043457, + "step": 384, + "token_acc": 0.8121914573942907 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 2.8354475498199463, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8018133044242859, + "step": 385, + "token_acc": 0.7613926797511694 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.408925175666809, + "learning_rate": 3.613053314713671e-05, + "loss": 0.839815616607666, + "step": 386, + "token_acc": 0.7488550290646468 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 2.7679271697998047, + "learning_rate": 3.602051485530486e-05, + "loss": 0.9087778925895691, + "step": 387, + "token_acc": 0.7297227794064702 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 3.360543727874756, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7623568177223206, + "step": 388, + "token_acc": 0.7737416741056101 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 1.070449948310852, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9299885034561157, + "step": 389, + "token_acc": 0.7274739583333333 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 4.474368572235107, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6639401912689209, + "step": 390, + "token_acc": 0.8028589716236398 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 1.5885690450668335, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8066656589508057, + "step": 391, + "token_acc": 0.7599889165973954 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.550413727760315, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7741931676864624, + "step": 392, + "token_acc": 0.767988750969744 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 1.496748685836792, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.7883261442184448, + "step": 393, + "token_acc": 0.7652963974839571 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.4409575462341309, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7302615642547607, + "step": 394, + "token_acc": 0.7827070285316632 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 0.9429992437362671, + "learning_rate": 3.513103285012475e-05, + "loss": 0.8207824230194092, + "step": 395, + "token_acc": 0.7606800348735833 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 1.858787178993225, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7316930294036865, + "step": 396, + "token_acc": 0.7801478515324195 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 2.4561638832092285, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7595556378364563, + "step": 397, + "token_acc": 0.7770890355820319 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 5.845393180847168, + "learning_rate": 3.47933752712989e-05, + "loss": 0.7122775316238403, + "step": 398, + "token_acc": 0.7888438880706922 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 1.6096240282058716, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8571289777755737, + "step": 399, + "token_acc": 0.7485540516367539 + }, + { + "epoch": 1.0, + "grad_norm": 1.6828404664993286, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7422727942466736, + "step": 400, + "token_acc": 0.7744593202883625 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 0.9042538404464722, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7470591068267822, + "step": 401, + "token_acc": 0.775092699143332 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 1.5840198993682861, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8494120836257935, + "step": 402, + "token_acc": 0.7467780083988994 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 1.7264753580093384, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7390634417533875, + "step": 403, + "token_acc": 0.778258834542476 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 3.9057250022888184, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6417334079742432, + "step": 404, + "token_acc": 0.803967657013915 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 13.16217041015625, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7573444843292236, + "step": 405, + "token_acc": 0.7765481064483112 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 2.6184492111206055, + "learning_rate": 3.388277253201041e-05, + "loss": 0.8021650314331055, + "step": 406, + "token_acc": 0.7634555116500885 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 0.9962872266769409, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8162388205528259, + "step": 407, + "token_acc": 0.7603709738062414 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 0.9261815547943115, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8409506678581238, + "step": 408, + "token_acc": 0.748269765092195 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 1.4823356866836548, + "learning_rate": 3.353768924152341e-05, + "loss": 0.6996514797210693, + "step": 409, + "token_acc": 0.7920583326012475 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 0.8279326558113098, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9892264008522034, + "step": 410, + "token_acc": 0.7166431939256629 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 1.2230151891708374, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7444078326225281, + "step": 411, + "token_acc": 0.7746187959419233 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 9.82090950012207, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8885623216629028, + "step": 412, + "token_acc": 0.7364721589570408 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 1.5039560794830322, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6384131908416748, + "step": 413, + "token_acc": 0.8135575732562939 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 2.572512626647949, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7594075202941895, + "step": 414, + "token_acc": 0.7756237883809642 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 1.3949657678604126, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8497216105461121, + "step": 415, + "token_acc": 0.7483397140401594 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 0.8779869079589844, + "learning_rate": 3.272542485937369e-05, + "loss": 0.8191887140274048, + "step": 416, + "token_acc": 0.7570150580652331 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 1.1911786794662476, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8783491849899292, + "step": 417, + "token_acc": 0.743301789989739 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.146852970123291, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8371091485023499, + "step": 418, + "token_acc": 0.7499376299376299 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.089304208755493, + "learning_rate": 3.23744632744341e-05, + "loss": 0.6695387363433838, + "step": 419, + "token_acc": 0.7941865916549461 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 3.357786178588867, + "learning_rate": 3.225711693136156e-05, + "loss": 0.6326532363891602, + "step": 420, + "token_acc": 0.8059025891725512 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 2.2081801891326904, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.8187626600265503, + "step": 421, + "token_acc": 0.7580794906936646 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 1.6402069330215454, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8068948984146118, + "step": 422, + "token_acc": 0.7584321435153898 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 1.57941734790802, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6910836696624756, + "step": 423, + "token_acc": 0.7918921316419764 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 1.2747334241867065, + "learning_rate": 3.178601124662686e-05, + "loss": 0.8506636619567871, + "step": 424, + "token_acc": 0.7479412315178738 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.1297740936279297, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.7539167404174805, + "step": 425, + "token_acc": 0.7679508587786259 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 2.4306747913360596, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7760396599769592, + "step": 426, + "token_acc": 0.7693063119364343 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 5.903867721557617, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8116412162780762, + "step": 427, + "token_acc": 0.7637670144406826 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 1.788726568222046, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7813456058502197, + "step": 428, + "token_acc": 0.7658718104495748 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 1.1867510080337524, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7816579937934875, + "step": 429, + "token_acc": 0.7660856605974211 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 4.440535068511963, + "learning_rate": 3.10745044975816e-05, + "loss": 0.800601601600647, + "step": 430, + "token_acc": 0.7669773635153129 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 1.7238138914108276, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8070148825645447, + "step": 431, + "token_acc": 0.7644200626959248 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 1.256711721420288, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8894907236099243, + "step": 432, + "token_acc": 0.7408053749836394 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 17.011455535888672, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8306131958961487, + "step": 433, + "token_acc": 0.7497091777383212 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 2.2736356258392334, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6613236665725708, + "step": 434, + "token_acc": 0.7976870839776776 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 2.7610883712768555, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8434382677078247, + "step": 435, + "token_acc": 0.7529855761774286 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 1.8570743799209595, + "learning_rate": 3.035772882662627e-05, + "loss": 0.7464153170585632, + "step": 436, + "token_acc": 0.7765296188122519 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 0.9314292073249817, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8278151750564575, + "step": 437, + "token_acc": 0.7535232235013894 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 1.3774133920669556, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8242682218551636, + "step": 438, + "token_acc": 0.7544135317496996 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 6.930232048034668, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.6596634984016418, + "step": 439, + "token_acc": 0.8021640826873385 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 4.866252422332764, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.506635308265686, + "step": 440, + "token_acc": 0.845995670995671 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.6028552055358887, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8647710680961609, + "step": 441, + "token_acc": 0.74706401151186 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 1.7333229780197144, + "learning_rate": 2.963630595278977e-05, + "loss": 0.6376317739486694, + "step": 442, + "token_acc": 0.8071622670807453 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 2.3443095684051514, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.721710205078125, + "step": 443, + "token_acc": 0.7838688149489942 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 0.9060749411582947, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.8552244901657104, + "step": 444, + "token_acc": 0.7432900127136601 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 0.749415397644043, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.785362720489502, + "step": 445, + "token_acc": 0.7612843660237998 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 0.7980436086654663, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8517442941665649, + "step": 446, + "token_acc": 0.7480493097557598 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 1.1448819637298584, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7649672031402588, + "step": 447, + "token_acc": 0.766477547078706 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 1.3443630933761597, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7490493059158325, + "step": 448, + "token_acc": 0.7757421770526879 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 4.406916618347168, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6007850170135498, + "step": 449, + "token_acc": 0.8233651384686991 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 1.3313847780227661, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6746580004692078, + "step": 450, + "token_acc": 0.7969903260480115 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 1.466326355934143, + "learning_rate": 2.854682793330633e-05, + "loss": 0.6978734731674194, + "step": 451, + "token_acc": 0.7890699904122723 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 1.363837718963623, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.6915320158004761, + "step": 452, + "token_acc": 0.7912602792120864 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 1.3149843215942383, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8228940963745117, + "step": 453, + "token_acc": 0.753298655163664 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 0.9304903745651245, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9149479269981384, + "step": 454, + "token_acc": 0.7286713286713287 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 1.7254271507263184, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.6899095773696899, + "step": 455, + "token_acc": 0.7892930042679532 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 5.276956081390381, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7458426356315613, + "step": 456, + "token_acc": 0.7750451577045991 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 1.1026403903961182, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.7810262441635132, + "step": 457, + "token_acc": 0.7638233460956282 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 5.3592143058776855, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7947831153869629, + "step": 458, + "token_acc": 0.7666825386028161 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 0.9304280281066895, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8342410922050476, + "step": 459, + "token_acc": 0.7494535884740622 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 1.1788454055786133, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8770091533660889, + "step": 460, + "token_acc": 0.7431479686260686 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.513720989227295, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8232619762420654, + "step": 461, + "token_acc": 0.7538295577130528 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 4.04278564453125, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8583269119262695, + "step": 462, + "token_acc": 0.7469663815396856 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 4.869415760040283, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.848386824131012, + "step": 463, + "token_acc": 0.7457259998452851 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 0.6062310338020325, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9125447273254395, + "step": 464, + "token_acc": 0.730836499607985 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 1.0651655197143555, + "learning_rate": 2.683911408999169e-05, + "loss": 0.716744601726532, + "step": 465, + "token_acc": 0.7814047029702971 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 2.8472161293029785, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6440662741661072, + "step": 466, + "token_acc": 0.80859707132735 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 3.403329372406006, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5214649438858032, + "step": 467, + "token_acc": 0.8430800314288921 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 5.556786060333252, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7512074708938599, + "step": 468, + "token_acc": 0.7785773595350125 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 2.395378351211548, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7191562652587891, + "step": 469, + "token_acc": 0.7896934402812877 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 0.9507644176483154, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8339272737503052, + "step": 470, + "token_acc": 0.7492740562731551 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 4.5672526359558105, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.7139979600906372, + "step": 471, + "token_acc": 0.7805757991197056 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 3.54498028755188, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8693740367889404, + "step": 472, + "token_acc": 0.7447919385996972 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 1.9187616109848022, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7921099662780762, + "step": 473, + "token_acc": 0.7626466275659824 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.4660390615463257, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.8307129144668579, + "step": 474, + "token_acc": 0.7560743513290618 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 0.8690254092216492, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8098856210708618, + "step": 475, + "token_acc": 0.7564140026883291 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 5.853299140930176, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6704491376876831, + "step": 476, + "token_acc": 0.7966314731020613 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 1.3092992305755615, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7706613540649414, + "step": 477, + "token_acc": 0.7744230161239329 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 2.787741184234619, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9088181257247925, + "step": 478, + "token_acc": 0.7326246933769419 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 2.232443332672119, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8565571308135986, + "step": 479, + "token_acc": 0.7444141689373297 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 9.54522705078125, + "learning_rate": 2.5e-05, + "loss": 0.7313039898872375, + "step": 480, + "token_acc": 0.781882145998241 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 20.989471435546875, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7575576901435852, + "step": 481, + "token_acc": 0.7708077584090351 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 1.1482243537902832, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.852341890335083, + "step": 482, + "token_acc": 0.7459840258458225 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 2.051314353942871, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.7475820183753967, + "step": 483, + "token_acc": 0.7779799247176914 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 1.342245101928711, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8240025043487549, + "step": 484, + "token_acc": 0.7542182827851346 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 1.3632580041885376, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8413196802139282, + "step": 485, + "token_acc": 0.7483724879705632 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 3.429781675338745, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9569882154464722, + "step": 486, + "token_acc": 0.7205176520780745 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.1299811601638794, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8428609371185303, + "step": 487, + "token_acc": 0.7533573202250038 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 1.7048869132995605, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7102815508842468, + "step": 488, + "token_acc": 0.7857550670853554 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 0.8680364489555359, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8275526762008667, + "step": 489, + "token_acc": 0.7501430369607507 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 1.3328769207000732, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.6902611255645752, + "step": 490, + "token_acc": 0.789313820240232 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 0.7926998734474182, + "learning_rate": 2.365075276976245e-05, + "loss": 0.8937082290649414, + "step": 491, + "token_acc": 0.7341974265051188 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 3.3240389823913574, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6675207614898682, + "step": 492, + "token_acc": 0.7990766225694753 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 5.930650234222412, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.783113420009613, + "step": 493, + "token_acc": 0.7705388240114731 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 0.8512884974479675, + "learning_rate": 2.328329352789066e-05, + "loss": 0.720180332660675, + "step": 494, + "token_acc": 0.7808032675289313 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 0.9648559093475342, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8460649251937866, + "step": 495, + "token_acc": 0.7489092921794621 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.8170979022979736, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8336548805236816, + "step": 496, + "token_acc": 0.7534397763225664 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 6.261831283569336, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6261081099510193, + "step": 497, + "token_acc": 0.8074581430745814 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 1.3391427993774414, + "learning_rate": 2.279394073699077e-05, + "loss": 0.7004765272140503, + "step": 498, + "token_acc": 0.7875529744153195 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.6274718046188354, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7182587385177612, + "step": 499, + "token_acc": 0.7839771101573677 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 4.34530782699585, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5547084808349609, + "step": 500, + "token_acc": 0.8279490944689183 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 6.319797515869141, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6171272993087769, + "step": 501, + "token_acc": 0.8103328365623448 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 1.2070508003234863, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8684753179550171, + "step": 502, + "token_acc": 0.7461618586114759 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.6517104506492615, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.929027795791626, + "step": 503, + "token_acc": 0.7245761408043324 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 7.505336761474609, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6728816032409668, + "step": 504, + "token_acc": 0.7991531132711 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 28.833297729492188, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7386347055435181, + "step": 505, + "token_acc": 0.7764926774314682 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 2.210476875305176, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6468443274497986, + "step": 506, + "token_acc": 0.8010013577732519 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 3.5139503479003906, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6901583671569824, + "step": 507, + "token_acc": 0.7926749509483323 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 1.6830179691314697, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8085765838623047, + "step": 508, + "token_acc": 0.7562606529434902 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 0.7797915935516357, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7800910472869873, + "step": 509, + "token_acc": 0.7595796361473256 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 1.7019588947296143, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8174337148666382, + "step": 510, + "token_acc": 0.7578614234731668 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 2.03682541847229, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.7452907562255859, + "step": 511, + "token_acc": 0.7781870595771941 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 0.9780297875404358, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8239941596984863, + "step": 512, + "token_acc": 0.7526496005217674 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 0.8718163371086121, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.796176552772522, + "step": 513, + "token_acc": 0.7592091654069536 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 2.4679477214813232, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7568551301956177, + "step": 514, + "token_acc": 0.7764072381190908 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 0.9792693853378296, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.8425300121307373, + "step": 515, + "token_acc": 0.7470879270715649 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.598029375076294, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7938356399536133, + "step": 516, + "token_acc": 0.7659052404042764 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 0.6741415858268738, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8783785104751587, + "step": 517, + "token_acc": 0.7394762056850847 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 1.6082953214645386, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7845078110694885, + "step": 518, + "token_acc": 0.7642520708137079 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 11.830879211425781, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8358283042907715, + "step": 519, + "token_acc": 0.7517000098551296 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 2.87798810005188, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.8649904131889343, + "step": 520, + "token_acc": 0.744602534154456 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 0.8139316439628601, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8346877098083496, + "step": 521, + "token_acc": 0.7504469606674613 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 2.8759028911590576, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7899202108383179, + "step": 522, + "token_acc": 0.7665122907018169 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 3.1788880825042725, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7810243368148804, + "step": 523, + "token_acc": 0.7666379186430933 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 0.7860379815101624, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8263541460037231, + "step": 524, + "token_acc": 0.7530105677070533 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 1.430240511894226, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7155407667160034, + "step": 525, + "token_acc": 0.7868094218415418 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 1.3369076251983643, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8235485553741455, + "step": 526, + "token_acc": 0.7551513200257566 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.0790313482284546, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8188608288764954, + "step": 527, + "token_acc": 0.7536337209302325 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 1.1045833826065063, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.8424797058105469, + "step": 528, + "token_acc": 0.7525659245223433 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 2.495410919189453, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8533246517181396, + "step": 529, + "token_acc": 0.7410009624639076 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 2.277566432952881, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8401960134506226, + "step": 530, + "token_acc": 0.7548590617685967 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 1.675037145614624, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6369855403900146, + "step": 531, + "token_acc": 0.8045444517979263 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 0.8442081212997437, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9534618854522705, + "step": 532, + "token_acc": 0.7226131426154497 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 0.8929516077041626, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.7794415354728699, + "step": 533, + "token_acc": 0.7713848312814952 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 1.1687227487564087, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.8722778558731079, + "step": 534, + "token_acc": 0.741757647821857 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 1.490539789199829, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.7561089396476746, + "step": 535, + "token_acc": 0.7730009802548663 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 1.109947919845581, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8310334086418152, + "step": 536, + "token_acc": 0.748946763692072 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 1.1950045824050903, + "learning_rate": 1.809595995707573e-05, + "loss": 0.8079832196235657, + "step": 537, + "token_acc": 0.7568485763589301 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 1.7237908840179443, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7125290632247925, + "step": 538, + "token_acc": 0.7834860972040361 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 3.228860855102539, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6453254222869873, + "step": 539, + "token_acc": 0.8018173950670705 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 0.8453672528266907, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8240500688552856, + "step": 540, + "token_acc": 0.7492266123663703 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 1.102385401725769, + "learning_rate": 1.762553672556591e-05, + "loss": 0.809388279914856, + "step": 541, + "token_acc": 0.7596028368794326 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.3018745183944702, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7180289030075073, + "step": 542, + "token_acc": 0.7798978365384616 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 3.1542391777038574, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.646782398223877, + "step": 543, + "token_acc": 0.8056676178293811 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 0.9923869967460632, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7879891991615295, + "step": 544, + "token_acc": 0.7618517074257701 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.2172160148620605, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7576411962509155, + "step": 545, + "token_acc": 0.7704047777040478 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 1.6602948904037476, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6707481145858765, + "step": 546, + "token_acc": 0.7971698113207547 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 1.4677680730819702, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8081753849983215, + "step": 547, + "token_acc": 0.755311542390194 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 2.0665853023529053, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8146413564682007, + "step": 548, + "token_acc": 0.7519490397413957 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 7.000178337097168, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7256150245666504, + "step": 549, + "token_acc": 0.7825356229448301 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 2.5341522693634033, + "learning_rate": 1.65777536651945e-05, + "loss": 0.726395845413208, + "step": 550, + "token_acc": 0.7819339150336146 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 1.4585434198379517, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.8065874576568604, + "step": 551, + "token_acc": 0.7564932940791625 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 1.8352439403533936, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8275594711303711, + "step": 552, + "token_acc": 0.7518390951226772 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.9580649137496948, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.7503329515457153, + "step": 553, + "token_acc": 0.7738378819846186 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 7.628960609436035, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.7021602392196655, + "step": 554, + "token_acc": 0.7898421209413167 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.2870745658874512, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.872342050075531, + "step": 555, + "token_acc": 0.7418959244573438 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 1.5503294467926025, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7012907266616821, + "step": 556, + "token_acc": 0.7840224809313528 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 1.410538673400879, + "learning_rate": 1.577407047339834e-05, + "loss": 0.7987989783287048, + "step": 557, + "token_acc": 0.7634807225667296 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 0.9178221821784973, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6806648969650269, + "step": 558, + "token_acc": 0.7902989575256311 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 0.756145179271698, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8719301819801331, + "step": 559, + "token_acc": 0.7413455258001306 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 1.1691936254501343, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.8100090026855469, + "step": 560, + "token_acc": 0.7591771792249119 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 35.45746994018555, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.7490640878677368, + "step": 561, + "token_acc": 0.7792402034101107 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 0.8100907206535339, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.778845489025116, + "step": 562, + "token_acc": 0.7706413851426537 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 1.7158607244491577, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8065593242645264, + "step": 563, + "token_acc": 0.7590346686267304 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 1.1593443155288696, + "learning_rate": 1.498127917242148e-05, + "loss": 0.9521163702011108, + "step": 564, + "token_acc": 0.7233781660727286 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 1.9125734567642212, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7740306258201599, + "step": 565, + "token_acc": 0.7697730265706096 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 0.8952035903930664, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8384573459625244, + "step": 566, + "token_acc": 0.7489069083392956 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 1.7073853015899658, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7088779211044312, + "step": 567, + "token_acc": 0.7877416700946113 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 2.4692201614379883, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.744478702545166, + "step": 568, + "token_acc": 0.7732206100765452 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 1.4949043989181519, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.7565535306930542, + "step": 569, + "token_acc": 0.7761570184817473 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 3.145484209060669, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7933104634284973, + "step": 570, + "token_acc": 0.761278654870717 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 1.172170877456665, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7600586414337158, + "step": 571, + "token_acc": 0.7707200207200208 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 1.8115105628967285, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7291625738143921, + "step": 572, + "token_acc": 0.7803458951638732 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 1.2004317045211792, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6606731414794922, + "step": 573, + "token_acc": 0.7994050797040653 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.2376269102096558, + "learning_rate": 1.38694668528633e-05, + "loss": 0.7951904535293579, + "step": 574, + "token_acc": 0.7661833626244874 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 2.052445411682129, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8511407971382141, + "step": 575, + "token_acc": 0.7467882836587872 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 0.9733930230140686, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.7993616461753845, + "step": 576, + "token_acc": 0.7636341403766203 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 5.800482749938965, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8141838908195496, + "step": 577, + "token_acc": 0.7566569997363565 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 2.696800470352173, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6543649435043335, + "step": 578, + "token_acc": 0.8048088161629654 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 4.301677703857422, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.647895872592926, + "step": 579, + "token_acc": 0.8066424494032174 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.5148913860321045, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7648165822029114, + "step": 580, + "token_acc": 0.7755042385267465 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 2.949655055999756, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7404133081436157, + "step": 581, + "token_acc": 0.7728736170461863 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 0.9238078594207764, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.917509138584137, + "step": 582, + "token_acc": 0.7355649875870905 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 83.38187408447266, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6469459533691406, + "step": 583, + "token_acc": 0.804023989166183 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 4.518279075622559, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8533624410629272, + "step": 584, + "token_acc": 0.7441301661403268 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 1.7925207614898682, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7255446314811707, + "step": 585, + "token_acc": 0.7831757417671992 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 6.655250072479248, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7307141423225403, + "step": 586, + "token_acc": 0.7741544170115598 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 0.8873371481895447, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8177270889282227, + "step": 587, + "token_acc": 0.7530202699287267 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 1.2454488277435303, + "learning_rate": 1.235856566555039e-05, + "loss": 0.6675281524658203, + "step": 588, + "token_acc": 0.7933152664859981 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.0082811117172241, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.7248143553733826, + "step": 589, + "token_acc": 0.7810338039259801 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 3.0372278690338135, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.666105329990387, + "step": 590, + "token_acc": 0.7997976825455214 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 1.4600460529327393, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.742726743221283, + "step": 591, + "token_acc": 0.7767523073085557 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 1.42963445186615, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.639944851398468, + "step": 592, + "token_acc": 0.8049067713444553 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.4108234643936157, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7738537788391113, + "step": 593, + "token_acc": 0.7662790011216719 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 2.011065721511841, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8032472133636475, + "step": 594, + "token_acc": 0.7643509458577952 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.9228585958480835, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7139896154403687, + "step": 595, + "token_acc": 0.7792246580252076 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 3.42121958732605, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6642230749130249, + "step": 596, + "token_acc": 0.7990822386179594 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 1.0371363162994385, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8180509209632874, + "step": 597, + "token_acc": 0.7535639466557662 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 1.0604794025421143, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8822356462478638, + "step": 598, + "token_acc": 0.7422369483029608 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 1.3429787158966064, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.70334792137146, + "step": 599, + "token_acc": 0.7864246823956443 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 1.2942774295806885, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7598515152931213, + "step": 600, + "token_acc": 0.7675241320058624 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 1.6313791275024414, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7451797723770142, + "step": 601, + "token_acc": 0.7745493358633776 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 1.9830615520477295, + "learning_rate": 1.090734344462458e-05, + "loss": 0.890819787979126, + "step": 602, + "token_acc": 0.7403223646024021 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 0.9711636900901794, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.766528844833374, + "step": 603, + "token_acc": 0.7713293650793651 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 2.051830530166626, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.7500281929969788, + "step": 604, + "token_acc": 0.7705687242132514 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 4.245327472686768, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.696961522102356, + "step": 605, + "token_acc": 0.7896506917373691 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 2.7437992095947266, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.891823410987854, + "step": 606, + "token_acc": 0.7399556762939663 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 1.5363843441009521, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.834951639175415, + "step": 607, + "token_acc": 0.7486957896400906 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 1.307376742362976, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.7804543375968933, + "step": 608, + "token_acc": 0.7650488867946754 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 1.2029725313186646, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.7981626987457275, + "step": 609, + "token_acc": 0.7576776926431197 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 2.243136405944824, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.618813693523407, + "step": 610, + "token_acc": 0.815751960085531 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 1.10971200466156, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.6312989592552185, + "step": 611, + "token_acc": 0.7997975894746527 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 0.9803842902183533, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7642860412597656, + "step": 612, + "token_acc": 0.7725077929221931 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 31.448169708251953, + "learning_rate": 9.813437667457229e-06, + "loss": 0.6522811651229858, + "step": 613, + "token_acc": 0.8037220388705537 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 0.9943018555641174, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8382527232170105, + "step": 614, + "token_acc": 0.751096142848065 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 0.9227951765060425, + "learning_rate": 9.619210235484333e-06, + "loss": 0.742218017578125, + "step": 615, + "token_acc": 0.7749133312322724 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 2.2479007244110107, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7250561714172363, + "step": 616, + "token_acc": 0.7738378549896875 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.514958143234253, + "learning_rate": 9.426465236041651e-06, + "loss": 0.6989889144897461, + "step": 617, + "token_acc": 0.7902208201892744 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 4.668854236602783, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7964303493499756, + "step": 618, + "token_acc": 0.7607207916892325 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 1.226259708404541, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8113234043121338, + "step": 619, + "token_acc": 0.7567243367935409 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 1.911278486251831, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7754377126693726, + "step": 620, + "token_acc": 0.7682521732984663 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.0659726858139038, + "learning_rate": 9.04549669873337e-06, + "loss": 0.810962975025177, + "step": 621, + "token_acc": 0.7570060922541341 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 1.9304813146591187, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6094653606414795, + "step": 622, + "token_acc": 0.8164489183979439 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 1.2579195499420166, + "learning_rate": 8.857309879408324e-06, + "loss": 0.66182541847229, + "step": 623, + "token_acc": 0.8028033383265568 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 1.7250380516052246, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8147578239440918, + "step": 624, + "token_acc": 0.7585159470600998 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 1.7458322048187256, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8331553339958191, + "step": 625, + "token_acc": 0.7498431694252763 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 1.2221341133117676, + "learning_rate": 8.577952526423969e-06, + "loss": 0.8016361594200134, + "step": 626, + "token_acc": 0.7612431882148631 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 3.993870973587036, + "learning_rate": 8.48562182685487e-06, + "loss": 0.7019971609115601, + "step": 627, + "token_acc": 0.7859397606208076 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 1.235687255859375, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6411934494972229, + "step": 628, + "token_acc": 0.8020742548370229 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 3.2990431785583496, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6782665252685547, + "step": 629, + "token_acc": 0.7922122674017918 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 1.9648222923278809, + "learning_rate": 8.211026128824539e-06, + "loss": 0.7926424741744995, + "step": 630, + "token_acc": 0.7613293051359517 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 1.3128774166107178, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8763965368270874, + "step": 631, + "token_acc": 0.7375299322212752 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 4.890468120574951, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6273766756057739, + "step": 632, + "token_acc": 0.8168607757239021 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 3.2160139083862305, + "learning_rate": 7.940071245792579e-06, + "loss": 0.5967519283294678, + "step": 633, + "token_acc": 0.8187688782418499 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 3.608379602432251, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6925722360610962, + "step": 634, + "token_acc": 0.7882998495442074 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 9.473015785217285, + "learning_rate": 7.761486381573327e-06, + "loss": 0.6970810890197754, + "step": 635, + "token_acc": 0.7880604576543105 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 1.1449179649353027, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7602096199989319, + "step": 636, + "token_acc": 0.7702360391479562 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 1.8277896642684937, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8149503469467163, + "step": 637, + "token_acc": 0.7562889343287841 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 2.1330368518829346, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.5871918201446533, + "step": 638, + "token_acc": 0.825297654131793 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 0.8962414264678955, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9314594268798828, + "step": 639, + "token_acc": 0.7280786651697573 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 1.338875412940979, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.7250627875328064, + "step": 640, + "token_acc": 0.7798726587129876 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 1.2020128965377808, + "learning_rate": 7.235768739040258e-06, + "loss": 0.7996973991394043, + "step": 641, + "token_acc": 0.76426948268948 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 96.59671783447266, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8170174360275269, + "step": 642, + "token_acc": 0.7553259286234523 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 0.7030874490737915, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9379591345787048, + "step": 643, + "token_acc": 0.7227594896834147 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 0.6374858617782593, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.8708009123802185, + "step": 644, + "token_acc": 0.73965669792957 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 1.4184483289718628, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7691725492477417, + "step": 645, + "token_acc": 0.7662367750405437 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 2.5497591495513916, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7211395502090454, + "step": 646, + "token_acc": 0.786339260513689 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 0.9087345004081726, + "learning_rate": 6.725459488639211e-06, + "loss": 0.872456431388855, + "step": 647, + "token_acc": 0.7409202044898866 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 1.3358864784240723, + "learning_rate": 6.641937264107867e-06, + "loss": 0.7510902881622314, + "step": 648, + "token_acc": 0.7725919309215423 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 3.704888105392456, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6040841341018677, + "step": 649, + "token_acc": 0.8143631436314364 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 0.9267286658287048, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8058043718338013, + "step": 650, + "token_acc": 0.7605926828030649 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 2.041635513305664, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8099769949913025, + "step": 651, + "token_acc": 0.7577828397873956 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 1.5155539512634277, + "learning_rate": 6.312291828435077e-06, + "loss": 0.6196180582046509, + "step": 652, + "token_acc": 0.8073305536701251 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 1.768568754196167, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7132784128189087, + "step": 653, + "token_acc": 0.78446311592139 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 0.8426440954208374, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8485860824584961, + "step": 654, + "token_acc": 0.748229935138882 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 4.96816873550415, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8367786407470703, + "step": 655, + "token_acc": 0.7491434739756887 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 3.880038022994995, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7719601392745972, + "step": 656, + "token_acc": 0.7681572629051621 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 0.7856653332710266, + "learning_rate": 5.910380944855087e-06, + "loss": 0.884110689163208, + "step": 657, + "token_acc": 0.7399053801298273 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 1.2310268878936768, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.7690421938896179, + "step": 658, + "token_acc": 0.7697993664202746 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 1.58376145362854, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8109105825424194, + "step": 659, + "token_acc": 0.7599358974358974 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 0.8561725616455078, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7711523771286011, + "step": 660, + "token_acc": 0.7678626345463865 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 1.3532984256744385, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7253690958023071, + "step": 661, + "token_acc": 0.7845570220501067 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 0.9115194082260132, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7143407464027405, + "step": 662, + "token_acc": 0.7897275258552108 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 1.3191654682159424, + "learning_rate": 5.443287214979592e-06, + "loss": 0.5992724299430847, + "step": 663, + "token_acc": 0.8163878593609135 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 1.710970163345337, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6404308080673218, + "step": 664, + "token_acc": 0.8054426911083814 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 0.9878676533699036, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6878443956375122, + "step": 665, + "token_acc": 0.7945592651475004 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.9691998958587646, + "learning_rate": 5.216076783983493e-06, + "loss": 0.6850720643997192, + "step": 666, + "token_acc": 0.7939158279963403 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 2.0937020778656006, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8503432273864746, + "step": 667, + "token_acc": 0.7473723926049696 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 1.6833800077438354, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8047228455543518, + "step": 668, + "token_acc": 0.7568868681465633 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 1.451167106628418, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8017756342887878, + "step": 669, + "token_acc": 0.7592959295929593 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 1.0639798641204834, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8059713840484619, + "step": 670, + "token_acc": 0.7561111111111111 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 1.0357158184051514, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8241342306137085, + "step": 671, + "token_acc": 0.7454847415403778 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 0.8671360015869141, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8555394411087036, + "step": 672, + "token_acc": 0.7474217794091942 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 5.883766174316406, + "learning_rate": 4.702687000087386e-06, + "loss": 0.6854438781738281, + "step": 673, + "token_acc": 0.7845229069641503 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 1.1688947677612305, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7587765455245972, + "step": 674, + "token_acc": 0.7688396791323014 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 21.169240951538086, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7326650619506836, + "step": 675, + "token_acc": 0.778235294117647 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 1.8388570547103882, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8537799119949341, + "step": 676, + "token_acc": 0.7444394008170676 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 1.0319663286209106, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7793920040130615, + "step": 677, + "token_acc": 0.7675712922718118 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 1.0005559921264648, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7914720773696899, + "step": 678, + "token_acc": 0.76452527161077 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 2.67810320854187, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.846095085144043, + "step": 679, + "token_acc": 0.748864050943584 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 2.256237506866455, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7095650434494019, + "step": 680, + "token_acc": 0.7868913027414468 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 1.4217983484268188, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7278553247451782, + "step": 681, + "token_acc": 0.7863779527559055 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.8460546731948853, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7024481892585754, + "step": 682, + "token_acc": 0.785208907425337 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 1.1893222332000732, + "learning_rate": 4.010984790046615e-06, + "loss": 0.6665959358215332, + "step": 683, + "token_acc": 0.7990233626962849 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 1.255271077156067, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8407459855079651, + "step": 684, + "token_acc": 0.7514467761734962 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 1.7191383838653564, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6034694314002991, + "step": 685, + "token_acc": 0.8184937382055241 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 2.4348859786987305, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8750420808792114, + "step": 686, + "token_acc": 0.7380963867046167 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 0.8619440793991089, + "learning_rate": 3.748372666094277e-06, + "loss": 0.8297964334487915, + "step": 687, + "token_acc": 0.752178699201908 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 1.1556035280227661, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7030929327011108, + "step": 688, + "token_acc": 0.7906772207563765 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 5.856689929962158, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.691868782043457, + "step": 689, + "token_acc": 0.7897428808404755 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.3657550811767578, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7366336584091187, + "step": 690, + "token_acc": 0.7799872733057588 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 1.1932430267333984, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6758766174316406, + "step": 691, + "token_acc": 0.7963037770147445 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 3.9285967350006104, + "learning_rate": 3.431640350555204e-06, + "loss": 0.6101948618888855, + "step": 692, + "token_acc": 0.8136406396989652 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 1.802047610282898, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6865506172180176, + "step": 693, + "token_acc": 0.7931622716610989 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 1.071358561515808, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8051484227180481, + "step": 694, + "token_acc": 0.7542495653853584 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.3180400133132935, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7677326202392578, + "step": 695, + "token_acc": 0.7704300280774347 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 1.2523272037506104, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7943510413169861, + "step": 696, + "token_acc": 0.7613922986379688 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 4.4054646492004395, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.701897382736206, + "step": 697, + "token_acc": 0.7884122654764857 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.3302299976348877, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8355323076248169, + "step": 698, + "token_acc": 0.7492808759395008 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 2.5054686069488525, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8056568503379822, + "step": 699, + "token_acc": 0.7634914412648635 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 8.32154369354248, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8949613571166992, + "step": 700, + "token_acc": 0.7380827429371118 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 2.0578978061676025, + "learning_rate": 2.894385171586095e-06, + "loss": 0.820101261138916, + "step": 701, + "token_acc": 0.7541902236453695 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.6051064729690552, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8328648209571838, + "step": 702, + "token_acc": 0.7533528918692373 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 3.2739200592041016, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6855148673057556, + "step": 703, + "token_acc": 0.7909475289387953 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 1.0998915433883667, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8189454078674316, + "step": 704, + "token_acc": 0.7593880389429764 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.3392704725265503, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7710374593734741, + "step": 705, + "token_acc": 0.7730310411592031 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 1.1777687072753906, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7353923916816711, + "step": 706, + "token_acc": 0.7839009776095869 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 10.78748893737793, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7313755750656128, + "step": 707, + "token_acc": 0.7793038863742782 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.7959760427474976, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8813682198524475, + "step": 708, + "token_acc": 0.7371300265360278 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 0.780621349811554, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8895928859710693, + "step": 709, + "token_acc": 0.7356559217024333 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 2.668718099594116, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.717865526676178, + "step": 710, + "token_acc": 0.7831172937085046 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 1.2820848226547241, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7374362945556641, + "step": 711, + "token_acc": 0.7759100253960576 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 1.9358655214309692, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8812097311019897, + "step": 712, + "token_acc": 0.7435395043423003 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 1.745857834815979, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.7244051694869995, + "step": 713, + "token_acc": 0.7779913161079081 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 3.7521867752075195, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9032388925552368, + "step": 714, + "token_acc": 0.7290010784039621 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 1.7055495977401733, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7481585144996643, + "step": 715, + "token_acc": 0.777170868347339 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 0.9156860113143921, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7256063222885132, + "step": 716, + "token_acc": 0.7821610365571494 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 1.2200286388397217, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.8634334206581116, + "step": 717, + "token_acc": 0.7441658887851713 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 1.2045998573303223, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7755439281463623, + "step": 718, + "token_acc": 0.7641643497065184 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.3511375188827515, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.7537750005722046, + "step": 719, + "token_acc": 0.7733905101358878 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 1.8665510416030884, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.6132658123970032, + "step": 720, + "token_acc": 0.8148300720906282 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 2.0403921604156494, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6217367053031921, + "step": 721, + "token_acc": 0.8100779115653142 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 0.9130368828773499, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8725777268409729, + "step": 722, + "token_acc": 0.7401973184922843 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 1.6816152334213257, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.821160614490509, + "step": 723, + "token_acc": 0.7509228532010888 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 1.0426051616668701, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7367508411407471, + "step": 724, + "token_acc": 0.7796639679637851 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 5.269510269165039, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7357650995254517, + "step": 725, + "token_acc": 0.7775466333818737 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 2.369504451751709, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7867926955223083, + "step": 726, + "token_acc": 0.7645618688156687 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.0830355882644653, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7860344648361206, + "step": 727, + "token_acc": 0.77024591593512 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 1.7200018167495728, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7187607288360596, + "step": 728, + "token_acc": 0.7883736120182887 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 1.1093928813934326, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.7947019934654236, + "step": 729, + "token_acc": 0.7565024903154399 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 3.5864369869232178, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.7369488477706909, + "step": 730, + "token_acc": 0.7861624969440143 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 1.4384573698043823, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8529449105262756, + "step": 731, + "token_acc": 0.7451984635083226 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 1.0439518690109253, + "learning_rate": 1.379848838328049e-06, + "loss": 0.7178291082382202, + "step": 732, + "token_acc": 0.7799321010939269 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 5.857388496398926, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7438476085662842, + "step": 733, + "token_acc": 0.7818851452734961 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 2.247035264968872, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8263076543807983, + "step": 734, + "token_acc": 0.7534708988947569 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.8630707263946533, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8856115341186523, + "step": 735, + "token_acc": 0.737244543305992 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 1.0327478647232056, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8134746551513672, + "step": 736, + "token_acc": 0.7548228013344292 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.5423094034194946, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6325390934944153, + "step": 737, + "token_acc": 0.8093323216995447 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 2.8762223720550537, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.6955031156539917, + "step": 738, + "token_acc": 0.7930338996198898 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 3.0213489532470703, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7289446592330933, + "step": 739, + "token_acc": 0.7758358662613982 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 0.8395518660545349, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.7442881464958191, + "step": 740, + "token_acc": 0.7756042787069322 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 0.9416394233703613, + "learning_rate": 1.041156686749717e-06, + "loss": 0.8054038286209106, + "step": 741, + "token_acc": 0.7603202943245144 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.5183863639831543, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.7220344543457031, + "step": 742, + "token_acc": 0.7839028916035256 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 2.2427620887756348, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8078048229217529, + "step": 743, + "token_acc": 0.7565702296819788 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 2.045294761657715, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6964831352233887, + "step": 744, + "token_acc": 0.7878059305838111 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 1.1594103574752808, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8750351667404175, + "step": 745, + "token_acc": 0.7404593114573162 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 1.434904932975769, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7638275623321533, + "step": 746, + "token_acc": 0.7692307692307693 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 3.405057907104492, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7193398475646973, + "step": 747, + "token_acc": 0.7806420567814669 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 0.7262636423110962, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8926572203636169, + "step": 748, + "token_acc": 0.7351848512173129 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 2.206441879272461, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8085426092147827, + "step": 749, + "token_acc": 0.7553703944798854 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 1.2215319871902466, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7416259050369263, + "step": 750, + "token_acc": 0.7799287594858293 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 1.1965488195419312, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7884664535522461, + "step": 751, + "token_acc": 0.7657542966263526 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 1.436772108078003, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6527396440505981, + "step": 752, + "token_acc": 0.7996812898387702 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 0.7072064280509949, + "learning_rate": 6.623969226072363e-07, + "loss": 0.9023393392562866, + "step": 753, + "token_acc": 0.7401707438459477 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 4.452742099761963, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8880629539489746, + "step": 754, + "token_acc": 0.7322737412364564 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.0246522426605225, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7470305562019348, + "step": 755, + "token_acc": 0.7724305041394629 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 1.336074709892273, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7636432647705078, + "step": 756, + "token_acc": 0.771588564692013 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 6.5312275886535645, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7831899523735046, + "step": 757, + "token_acc": 0.7635535636836779 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 1.6498327255249023, + "learning_rate": 5.294312162731934e-07, + "loss": 0.6954912543296814, + "step": 758, + "token_acc": 0.7876533742331289 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 1.4230884313583374, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7910645008087158, + "step": 759, + "token_acc": 0.7663237605372196 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 1.2716556787490845, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7857385277748108, + "step": 760, + "token_acc": 0.7617182793107603 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 3.85703706741333, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.740379810333252, + "step": 761, + "token_acc": 0.7729265967588179 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 1.468467354774475, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7387019991874695, + "step": 762, + "token_acc": 0.7750095334943434 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 1.6433247327804565, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.721135675907135, + "step": 763, + "token_acc": 0.7758144995597299 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 1.5427294969558716, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.6293338537216187, + "step": 764, + "token_acc": 0.8072302940167029 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 1.2883336544036865, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7614178657531738, + "step": 765, + "token_acc": 0.7687590187590188 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 2.724231243133545, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7500782608985901, + "step": 766, + "token_acc": 0.7765294194051175 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 3.1029133796691895, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8163322806358337, + "step": 767, + "token_acc": 0.7529584398371675 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 1.1530697345733643, + "learning_rate": 3.077914851215585e-07, + "loss": 0.729668140411377, + "step": 768, + "token_acc": 0.7845285524568393 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 3.2592809200286865, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.801484227180481, + "step": 769, + "token_acc": 0.760657514450867 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 18.562549591064453, + "learning_rate": 2.705872508804747e-07, + "loss": 0.6273467540740967, + "step": 770, + "token_acc": 0.8140587288817377 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 0.9975523352622986, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8133840560913086, + "step": 771, + "token_acc": 0.7572153325817362 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 1.3826740980148315, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6214898228645325, + "step": 772, + "token_acc": 0.8168546113572291 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 0.9996422529220581, + "learning_rate": 2.192509677903687e-07, + "loss": 0.7946609854698181, + "step": 773, + "token_acc": 0.7653636764922263 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 2.9878437519073486, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.8433146476745605, + "step": 774, + "token_acc": 0.7486024904583831 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 2.0441744327545166, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.762677788734436, + "step": 775, + "token_acc": 0.7752121679709026 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 5.5609130859375, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7419829368591309, + "step": 776, + "token_acc": 0.7775021264530763 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 1.5714855194091797, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.7751676440238953, + "step": 777, + "token_acc": 0.7671714112658995 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 1.8620251417160034, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6445480585098267, + "step": 778, + "token_acc": 0.8050112118553183 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 2.552483081817627, + "learning_rate": 1.327100431795125e-07, + "loss": 0.7001749873161316, + "step": 779, + "token_acc": 0.7868405963302753 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 0.9818560481071472, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.863308846950531, + "step": 780, + "token_acc": 0.7440897738547333 + }, + { + "epoch": 1.95369211514393, + "grad_norm": 1.462260365486145, + "learning_rate": 1.0865311416741742e-07, + "loss": 0.7859329581260681, + "step": 781, + "token_acc": 0.7583453331587904 + }, + { + "epoch": 1.9561952440550687, + "grad_norm": 1.250992774963379, + "learning_rate": 9.752416870782155e-08, + "loss": 0.7414909601211548, + "step": 782, + "token_acc": 0.7709643892566053 + }, + { + "epoch": 1.9586983729662077, + "grad_norm": 6.787116527557373, + "learning_rate": 8.699526497563393e-08, + "loss": 0.6183775663375854, + "step": 783, + "token_acc": 0.8110644876325088 + }, + { + "epoch": 1.9612015018773468, + "grad_norm": 4.071316719055176, + "learning_rate": 7.706665667180091e-08, + "loss": 0.7128624320030212, + "step": 784, + "token_acc": 0.7844099003923936 + }, + { + "epoch": 1.9637046307884856, + "grad_norm": 1.2956960201263428, + "learning_rate": 6.773858303274483e-08, + "loss": 0.7272385358810425, + "step": 785, + "token_acc": 0.7798172364896802 + }, + { + "epoch": 1.9662077596996246, + "grad_norm": 1.670897364616394, + "learning_rate": 5.90112688246075e-08, + "loss": 0.813774049282074, + "step": 786, + "token_acc": 0.7579287539455885 + }, + { + "epoch": 1.9687108886107634, + "grad_norm": 2.216273069381714, + "learning_rate": 5.088492433783509e-08, + "loss": 0.6288831233978271, + "step": 787, + "token_acc": 0.809070337544786 + }, + { + "epoch": 1.9712140175219024, + "grad_norm": 1.7803688049316406, + "learning_rate": 4.335974538210441e-08, + "loss": 0.7607427835464478, + "step": 788, + "token_acc": 0.7712011076497057 + }, + { + "epoch": 1.9737171464330414, + "grad_norm": 1.5490421056747437, + "learning_rate": 3.6435913281607225e-08, + "loss": 0.7704131007194519, + "step": 789, + "token_acc": 0.7674668577570763 + }, + { + "epoch": 1.9762202753441802, + "grad_norm": 1.32576322555542, + "learning_rate": 3.011359487068987e-08, + "loss": 0.7262879014015198, + "step": 790, + "token_acc": 0.7795837950991257 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.9507794552485315e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..0a5c0949b9e78863976a098788736c9e2fa4561c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70864e8baf48fd11f3bcc3f8c1a6bc83ff4a36f38843321e0e319388c62d18a5 +size 8977 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-790/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..813f75c9673fb9919c650bb329f62094c3d07d41 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(down_proj|gate_proj|v_proj|q_proj|k_proj|o_proj|up_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|gate_proj|mlp.2|mlp.0|attn.proj|up_proj|qkv))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..719870079da42c86d061a13ae3968a309d7ed3bd --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7cfc6aa757aba6d1e90a691f5867d9201eadf2cf95b3706b18814b6b4421f5fb +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/args.json new file mode 100644 index 0000000000000000000000000000000000000000..f87e1241b42011d71443f9395aa0b92b2e8c5058 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..b75583f40a57dac91bf9b869df562eb2aa235dc3 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:21440580e93db89b849596964b4284d047d2a456f746b82f4f2a692e6f54fe62 +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..b77bb87e9ce2b1241b34d70fef615cdc2b2066fd --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d43eb3a6ba13fddf0bb448b03cd37393c610020dc7e7e36719f7fe7f8692de51 +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..071047194343f1aed49d99597ce204fd7cb848a7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7d12194770d0af1198058d14b7fd3ff3dca3a54ffc9ccf57820696d000212f5d +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..20e34d1c0813d4f0bdf1d964889b1c52d0c68665 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:df7ad47fd78254da90175261b52782f8a31ed9c214afcfdb64cc3269944fac1e +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..13baa3df3417b1e0de769536b87bdfef9a54d033 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0a731367581615e6caa8a8b0f1d7d8c480064745c65711a2e9045f3e43b06c63 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..1e20c922ea01d2ada2a0dc711f7e5e1fe932b693 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:74e2c554a9584fd633dbfc0239cd6960b9fa772e8a3363d5ac8b90430e5d2ce9 +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..5d44039d5e9c987abadd0db611a9241593784aa7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70e809440d14d7a81b6a9326ad82088e5fc6cd33e09875fb0f55254678c6c5ed +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..23bd37ee0264681013b805e960d7afc8efa16e25 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a40d6efb352ab6d8de50ad17e4eb2770c6755b7a8cc5471e9a90ab25b477ca6a +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..bb5155706652f3432f07c0cf0f2d3cd65d4e58fb --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/global_step800/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e1619767d524d3d1df4e34768ac35e5dc8f709b112333ff5fd02bac14fc36ac +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/latest new file mode 100644 index 0000000000000000000000000000000000000000..57729c0be88118cbd582c8c68b4149cee821f0b4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/latest @@ -0,0 +1 @@ +global_step800 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..3a98cb32fc61e1b347803b5c5c238b2905db04db --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d41e684b813b547b9aedfd14e1ba67f682990c114b685c023d3a6e017a0e3a52 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..0fc84faeb9c7948de9f3a44763871d7f3890a109 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1806f5a81604773d39bad452f6c3d9660df4dddf263658ed017319ffc2d85bea +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..bd100a0c05d909070ff1d092638e82cd3215ca8a --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1a8a8866a7356e79e6df49854e44f16e1b3e2d3f46f6674f8a346355fbd0ac61 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..cc4c338958167f765967c8e6b3148fd6869d4cd8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c40af40afac3a40b0363a0ff5acdab7ea8e398d0b6285d0ebbcde30f38152982 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..99a33648b8baf4e0c139bd5b4c5f21a1375cf36f --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c1c8f69d4754108644e29e6588f72f0cd6634ffc846d855e3059925e7974e338 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..e4d6540b03b73ed53ef42a05b069a443855329d7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ec1eedce5b763d2558f7ee02768317810a359db63e2449428b1af5fea1b08020 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..9f63ce53b8d3ef615ce70538baf541aa731d2adf --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c599a6cf81bf37ca6b6d6ce17eab83bbc3ee616547a0b245d9943393f596e660 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..a39f3ecf7f2767364a4c29aa2617661da47f66dd --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4966bfa496fbe5bce5466a54f1c2ee83e1bfa3b608dc91311e9592031331f487 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..bd91826e9d23f299fdb2bae445a35337089144fa --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:991fae96e95a86e14f420d2137cda3fb68f453af09b436a8d76fcc42d6c51ba0 +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..786a9a6a9415a938ef8b12aaeecb0d9d08751cf7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/trainer_state.json @@ -0,0 +1,6443 @@ +{ + "best_global_step": 800, + "best_metric": 0.52942038, + "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800", + "epoch": 2.0, + "eval_steps": 2000, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 2.9617536067962646, + "learning_rate": 3.125e-07, + "loss": 1.4579824209213257, + "step": 1, + "token_acc": 0.6568419333768779 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 1.423774242401123, + "learning_rate": 6.25e-07, + "loss": 1.5049985647201538, + "step": 2, + "token_acc": 0.6365098770992857 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 1.5966103076934814, + "learning_rate": 9.375e-07, + "loss": 1.4851462841033936, + "step": 3, + "token_acc": 0.6467950044849238 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 1.452944278717041, + "learning_rate": 1.25e-06, + "loss": 1.4441643953323364, + "step": 4, + "token_acc": 0.6555674699475139 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 2.1675608158111572, + "learning_rate": 1.5625e-06, + "loss": 1.4831663370132446, + "step": 5, + "token_acc": 0.6366577364403782 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 8.398337364196777, + "learning_rate": 1.875e-06, + "loss": 1.4721344709396362, + "step": 6, + "token_acc": 0.6424400084943724 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 3.0731256008148193, + "learning_rate": 2.1875e-06, + "loss": 1.4525271654129028, + "step": 7, + "token_acc": 0.6579513486678802 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 1.5642091035842896, + "learning_rate": 2.5e-06, + "loss": 1.4381799697875977, + "step": 8, + "token_acc": 0.6511047537890315 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 2.8113529682159424, + "learning_rate": 2.8125e-06, + "loss": 1.541656255722046, + "step": 9, + "token_acc": 0.618830879071843 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.6361396312713623, + "learning_rate": 3.125e-06, + "loss": 1.5417851209640503, + "step": 10, + "token_acc": 0.6177715521179086 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 12.022518157958984, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5132269859313965, + "step": 11, + "token_acc": 0.6238978192242098 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 2.668394088745117, + "learning_rate": 3.75e-06, + "loss": 1.46922767162323, + "step": 12, + "token_acc": 0.6533487002176975 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 7.9799017906188965, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4974768161773682, + "step": 13, + "token_acc": 0.6374414379959843 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 3.233323574066162, + "learning_rate": 4.375e-06, + "loss": 1.4622106552124023, + "step": 14, + "token_acc": 0.6697823145984504 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 24.691530227661133, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.477518081665039, + "step": 15, + "token_acc": 0.66816 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 2.897843360900879, + "learning_rate": 5e-06, + "loss": 1.4357118606567383, + "step": 16, + "token_acc": 0.6778693025809994 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 19.82540512084961, + "learning_rate": 5.3125e-06, + "loss": 1.5187983512878418, + "step": 17, + "token_acc": 0.6306321643400296 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 2.93292236328125, + "learning_rate": 5.625e-06, + "loss": 1.455895185470581, + "step": 18, + "token_acc": 0.6512200710276091 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 1.6330183744430542, + "learning_rate": 5.9375e-06, + "loss": 1.422993540763855, + "step": 19, + "token_acc": 0.661488625487742 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 4.298096179962158, + "learning_rate": 6.25e-06, + "loss": 1.4982240200042725, + "step": 20, + "token_acc": 0.6452436974789916 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 1.313482403755188, + "learning_rate": 6.5625e-06, + "loss": 1.518486738204956, + "step": 21, + "token_acc": 0.6326643752078944 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 1.76573646068573, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4727129936218262, + "step": 22, + "token_acc": 0.6483625537545484 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 1.4560825824737549, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4510971307754517, + "step": 23, + "token_acc": 0.6514202049780381 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.091919183731079, + "learning_rate": 7.5e-06, + "loss": 1.5022644996643066, + "step": 24, + "token_acc": 0.6532272645091304 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.740084171295166, + "learning_rate": 7.8125e-06, + "loss": 1.4717752933502197, + "step": 25, + "token_acc": 0.639137679650073 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 2.8075263500213623, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4721131324768066, + "step": 26, + "token_acc": 0.6409317316144155 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 1.5441093444824219, + "learning_rate": 8.437500000000002e-06, + "loss": 1.5016684532165527, + "step": 27, + "token_acc": 0.6426081151249907 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 2.806373119354248, + "learning_rate": 8.75e-06, + "loss": 1.4954692125320435, + "step": 28, + "token_acc": 0.6546207959911342 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 4.36266565322876, + "learning_rate": 9.0625e-06, + "loss": 1.4520496129989624, + "step": 29, + "token_acc": 0.6418620292083013 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 1.5149106979370117, + "learning_rate": 9.375000000000001e-06, + "loss": 1.4115290641784668, + "step": 30, + "token_acc": 0.651825091489162 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 2.1750094890594482, + "learning_rate": 9.6875e-06, + "loss": 1.4292242527008057, + "step": 31, + "token_acc": 0.6480092934840004 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 2.171316623687744, + "learning_rate": 1e-05, + "loss": 1.4468941688537598, + "step": 32, + "token_acc": 0.6347569955817378 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 1.6085623502731323, + "learning_rate": 1.03125e-05, + "loss": 1.4548325538635254, + "step": 33, + "token_acc": 0.6387750322051763 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 2.6019768714904785, + "learning_rate": 1.0625e-05, + "loss": 1.3636939525604248, + "step": 34, + "token_acc": 0.6694069289489136 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 1.7189018726348877, + "learning_rate": 1.09375e-05, + "loss": 1.3792800903320312, + "step": 35, + "token_acc": 0.6634405670665212 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 3.069101572036743, + "learning_rate": 1.125e-05, + "loss": 1.418148398399353, + "step": 36, + "token_acc": 0.652867715078631 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 0.9760923385620117, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.487064242362976, + "step": 37, + "token_acc": 0.6303966303966304 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 0.9802103638648987, + "learning_rate": 1.1875e-05, + "loss": 1.3090462684631348, + "step": 38, + "token_acc": 0.6665271562409453 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 4.357207298278809, + "learning_rate": 1.21875e-05, + "loss": 1.4249074459075928, + "step": 39, + "token_acc": 0.6332261759597975 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 1.186145305633545, + "learning_rate": 1.25e-05, + "loss": 1.3373064994812012, + "step": 40, + "token_acc": 0.6725337118523775 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 5.261158466339111, + "learning_rate": 1.28125e-05, + "loss": 1.340531349182129, + "step": 41, + "token_acc": 0.6683364091747956 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 2.458296775817871, + "learning_rate": 1.3125e-05, + "loss": 1.332282304763794, + "step": 42, + "token_acc": 0.667586315623522 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 2.0579333305358887, + "learning_rate": 1.34375e-05, + "loss": 1.3493250608444214, + "step": 43, + "token_acc": 0.6604139715394567 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 1.6432338953018188, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.3249701261520386, + "step": 44, + "token_acc": 0.6745012519182618 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 1.0298691987991333, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.349682092666626, + "step": 45, + "token_acc": 0.6590545786709294 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 1.3843709230422974, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.300336480140686, + "step": 46, + "token_acc": 0.6736927993472496 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 15.729647636413574, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.295595645904541, + "step": 47, + "token_acc": 0.6904139433551199 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 1.218788743019104, + "learning_rate": 1.5e-05, + "loss": 1.329056739807129, + "step": 48, + "token_acc": 0.6649002289826628 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.2413642406463623, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3466482162475586, + "step": 49, + "token_acc": 0.6608733843644121 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 1.7129898071289062, + "learning_rate": 1.5625e-05, + "loss": 1.1971522569656372, + "step": 50, + "token_acc": 0.6957063780980401 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 12.908634185791016, + "learning_rate": 1.59375e-05, + "loss": 1.338015079498291, + "step": 51, + "token_acc": 0.664876476906552 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 2.4744150638580322, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3184266090393066, + "step": 52, + "token_acc": 0.6541958563124162 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 1.5035480260849, + "learning_rate": 1.65625e-05, + "loss": 1.3414291143417358, + "step": 53, + "token_acc": 0.6604707140946777 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 0.9383847117424011, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2710291147232056, + "step": 54, + "token_acc": 0.6716895400593472 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 0.8049397468566895, + "learning_rate": 1.71875e-05, + "loss": 1.321635365486145, + "step": 55, + "token_acc": 0.6582027168234065 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 0.9869638085365295, + "learning_rate": 1.75e-05, + "loss": 1.3294317722320557, + "step": 56, + "token_acc": 0.6607637747193387 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 3.6263885498046875, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2151306867599487, + "step": 57, + "token_acc": 0.689805574037111 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 2.4337313175201416, + "learning_rate": 1.8125e-05, + "loss": 1.2164831161499023, + "step": 58, + "token_acc": 0.6946524064171123 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 1.2465195655822754, + "learning_rate": 1.84375e-05, + "loss": 1.2001479864120483, + "step": 59, + "token_acc": 0.6949291573452647 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 1.211704969406128, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2468581199645996, + "step": 60, + "token_acc": 0.6773460003031987 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 1.1252233982086182, + "learning_rate": 1.90625e-05, + "loss": 1.2663486003875732, + "step": 61, + "token_acc": 0.6731120837719541 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 0.68025803565979, + "learning_rate": 1.9375e-05, + "loss": 1.2598896026611328, + "step": 62, + "token_acc": 0.6730806308564378 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 3.702453374862671, + "learning_rate": 1.96875e-05, + "loss": 1.2166805267333984, + "step": 63, + "token_acc": 0.691328125 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 53.140132904052734, + "learning_rate": 2e-05, + "loss": 1.2387148141860962, + "step": 64, + "token_acc": 0.6720997123681688 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 2.1026854515075684, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2545907497406006, + "step": 65, + "token_acc": 0.6658680632939603 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 1.5480505228042603, + "learning_rate": 2.0625e-05, + "loss": 1.2474756240844727, + "step": 66, + "token_acc": 0.6753335794525606 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 8.795135498046875, + "learning_rate": 2.09375e-05, + "loss": 1.1903716325759888, + "step": 67, + "token_acc": 0.7095110155830199 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 1.6788009405136108, + "learning_rate": 2.125e-05, + "loss": 1.255184531211853, + "step": 68, + "token_acc": 0.675844505309692 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 2.194441080093384, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.2032387256622314, + "step": 69, + "token_acc": 0.6907407407407408 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 1.1291356086730957, + "learning_rate": 2.1875e-05, + "loss": 1.1963188648223877, + "step": 70, + "token_acc": 0.6802986594264382 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 1.3670284748077393, + "learning_rate": 2.21875e-05, + "loss": 1.2278125286102295, + "step": 71, + "token_acc": 0.6708903388760261 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 2.758354663848877, + "learning_rate": 2.25e-05, + "loss": 1.2158769369125366, + "step": 72, + "token_acc": 0.6867505551443376 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 2.6226625442504883, + "learning_rate": 2.28125e-05, + "loss": 1.074498176574707, + "step": 73, + "token_acc": 0.718917166477549 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 5.092314720153809, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.183173656463623, + "step": 74, + "token_acc": 0.6937396580253723 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 1.6192283630371094, + "learning_rate": 2.34375e-05, + "loss": 1.1696088314056396, + "step": 75, + "token_acc": 0.6922164214523019 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 1.9894205331802368, + "learning_rate": 2.375e-05, + "loss": 1.02431058883667, + "step": 76, + "token_acc": 0.7350316975815919 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 5.026700019836426, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1793923377990723, + "step": 77, + "token_acc": 0.6889119550616681 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 0.9851458668708801, + "learning_rate": 2.4375e-05, + "loss": 1.2031577825546265, + "step": 78, + "token_acc": 0.6798439806029939 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 1.4935272932052612, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.2100965976715088, + "step": 79, + "token_acc": 0.6759376522162689 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 2.0270609855651855, + "learning_rate": 2.5e-05, + "loss": 1.2182433605194092, + "step": 80, + "token_acc": 0.672459042468586 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 2.171703577041626, + "learning_rate": 2.53125e-05, + "loss": 1.1599236726760864, + "step": 81, + "token_acc": 0.6896967941290073 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 1.3919153213500977, + "learning_rate": 2.5625e-05, + "loss": 1.2469699382781982, + "step": 82, + "token_acc": 0.6607023411371238 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 5.726469039916992, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.0905996561050415, + "step": 83, + "token_acc": 0.705477288521069 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 2.4800686836242676, + "learning_rate": 2.625e-05, + "loss": 1.1631360054016113, + "step": 84, + "token_acc": 0.6929383361834826 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 1.3907530307769775, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0351084470748901, + "step": 85, + "token_acc": 0.7256065167345493 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 4.023968696594238, + "learning_rate": 2.6875e-05, + "loss": 1.1698168516159058, + "step": 86, + "token_acc": 0.6915017462165308 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.434358596801758, + "learning_rate": 2.71875e-05, + "loss": 1.0965162515640259, + "step": 87, + "token_acc": 0.7119186046511627 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 1.8500336408615112, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0884002447128296, + "step": 88, + "token_acc": 0.7045622522340926 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 3.2268683910369873, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1824790239334106, + "step": 89, + "token_acc": 0.6851617168990027 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 16.243087768554688, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.971013069152832, + "step": 90, + "token_acc": 0.7361684210526316 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 2.5743207931518555, + "learning_rate": 2.84375e-05, + "loss": 1.0600107908248901, + "step": 91, + "token_acc": 0.7134351911627573 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.0203638076782227, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.1500616073608398, + "step": 92, + "token_acc": 0.6882268690919507 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 1.1112314462661743, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0045973062515259, + "step": 93, + "token_acc": 0.7273007237078478 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 2.5539236068725586, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1666638851165771, + "step": 94, + "token_acc": 0.6864643371757925 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 2.1663148403167725, + "learning_rate": 2.96875e-05, + "loss": 1.0808672904968262, + "step": 95, + "token_acc": 0.695645939874779 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 1.9498071670532227, + "learning_rate": 3e-05, + "loss": 0.9929013252258301, + "step": 96, + "token_acc": 0.738973897389739 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 4.303379058837891, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.1222727298736572, + "step": 97, + "token_acc": 0.688846697280113 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 4.010090351104736, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1498996019363403, + "step": 98, + "token_acc": 0.6880553287546227 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 1.8286547660827637, + "learning_rate": 3.09375e-05, + "loss": 1.0506386756896973, + "step": 99, + "token_acc": 0.7126414484319431 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 2.414545774459839, + "learning_rate": 3.125e-05, + "loss": 1.0510246753692627, + "step": 100, + "token_acc": 0.711717754376551 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 35.13666534423828, + "learning_rate": 3.15625e-05, + "loss": 1.105303168296814, + "step": 101, + "token_acc": 0.6977885525070956 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 1.9485750198364258, + "learning_rate": 3.1875e-05, + "loss": 1.0945279598236084, + "step": 102, + "token_acc": 0.7003108322092546 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 3.3463339805603027, + "learning_rate": 3.21875e-05, + "loss": 1.068230390548706, + "step": 103, + "token_acc": 0.7030742861310675 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 2.5563361644744873, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.001434564590454, + "step": 104, + "token_acc": 0.721863062004114 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 1.6362377405166626, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.0632514953613281, + "step": 105, + "token_acc": 0.7117752471241112 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 2.2173712253570557, + "learning_rate": 3.3125e-05, + "loss": 1.127671241760254, + "step": 106, + "token_acc": 0.6865707549439446 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 2.128298044204712, + "learning_rate": 3.34375e-05, + "loss": 1.0473824739456177, + "step": 107, + "token_acc": 0.7126287780582656 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 1.5433886051177979, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9804874658584595, + "step": 108, + "token_acc": 0.7238202367561197 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 6.602525234222412, + "learning_rate": 3.40625e-05, + "loss": 1.0798405408859253, + "step": 109, + "token_acc": 0.6913783927621076 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 1.55194091796875, + "learning_rate": 3.4375e-05, + "loss": 1.0854990482330322, + "step": 110, + "token_acc": 0.7073425229282223 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 1.3037891387939453, + "learning_rate": 3.46875e-05, + "loss": 1.0851027965545654, + "step": 111, + "token_acc": 0.7052621625455061 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 1.3887872695922852, + "learning_rate": 3.5e-05, + "loss": 0.9681501984596252, + "step": 112, + "token_acc": 0.7300288416392783 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 2.441603422164917, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0306782722473145, + "step": 113, + "token_acc": 0.7176060047405847 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 1.4105886220932007, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.015556812286377, + "step": 114, + "token_acc": 0.7166026744339997 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 3.6527352333068848, + "learning_rate": 3.59375e-05, + "loss": 1.1317176818847656, + "step": 115, + "token_acc": 0.6872061871303644 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 1.8553370237350464, + "learning_rate": 3.625e-05, + "loss": 1.0447880029678345, + "step": 116, + "token_acc": 0.7100111234705228 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.274932861328125, + "learning_rate": 3.65625e-05, + "loss": 0.8988428711891174, + "step": 117, + "token_acc": 0.7594645889521526 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 1.7594488859176636, + "learning_rate": 3.6875e-05, + "loss": 1.0872691869735718, + "step": 118, + "token_acc": 0.7017732981189027 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 3.4330825805664062, + "learning_rate": 3.71875e-05, + "loss": 1.0752581357955933, + "step": 119, + "token_acc": 0.7016698075995967 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 4.466182708740234, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9912147521972656, + "step": 120, + "token_acc": 0.7193773043834494 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 1.5049115419387817, + "learning_rate": 3.78125e-05, + "loss": 1.018737554550171, + "step": 121, + "token_acc": 0.7152019002375297 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 3.3945202827453613, + "learning_rate": 3.8125e-05, + "loss": 0.9846063256263733, + "step": 122, + "token_acc": 0.7239054568527918 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 1.5377535820007324, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0859057903289795, + "step": 123, + "token_acc": 0.698030902197399 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 2.696385622024536, + "learning_rate": 3.875e-05, + "loss": 1.0317624807357788, + "step": 124, + "token_acc": 0.711888309124242 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.061471700668335, + "learning_rate": 3.90625e-05, + "loss": 0.9196208715438843, + "step": 125, + "token_acc": 0.7408977209560867 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 1.1909533739089966, + "learning_rate": 3.9375e-05, + "loss": 0.908572793006897, + "step": 126, + "token_acc": 0.7447868298860278 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 2.976712226867676, + "learning_rate": 3.96875e-05, + "loss": 0.8775178790092468, + "step": 127, + "token_acc": 0.7585321100917432 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 3.037933349609375, + "learning_rate": 4e-05, + "loss": 1.0048859119415283, + "step": 128, + "token_acc": 0.7140471578384877 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 5.830648422241211, + "learning_rate": 4.0312500000000004e-05, + "loss": 0.9985315799713135, + "step": 129, + "token_acc": 0.7206040268456376 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 1.3143258094787598, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.9825519323348999, + "step": 130, + "token_acc": 0.7247136031316562 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 2.4536049365997314, + "learning_rate": 4.09375e-05, + "loss": 0.8758414387702942, + "step": 131, + "token_acc": 0.7611605215439081 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 3.183997631072998, + "learning_rate": 4.125e-05, + "loss": 0.9772047400474548, + "step": 132, + "token_acc": 0.722866503718342 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 1.653651237487793, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0216748714447021, + "step": 133, + "token_acc": 0.71066228276186 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 1.1030162572860718, + "learning_rate": 4.1875e-05, + "loss": 0.9526140689849854, + "step": 134, + "token_acc": 0.7339804459449955 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 4.92834997177124, + "learning_rate": 4.21875e-05, + "loss": 0.8791989088058472, + "step": 135, + "token_acc": 0.7551160285910115 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 0.7831388115882874, + "learning_rate": 4.25e-05, + "loss": 1.0653268098831177, + "step": 136, + "token_acc": 0.7019186391507879 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 1.9757318496704102, + "learning_rate": 4.28125e-05, + "loss": 1.0078719854354858, + "step": 137, + "token_acc": 0.7167237320778943 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 4.613290786743164, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.8363289833068848, + "step": 138, + "token_acc": 0.7749772244154267 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 1.626499891281128, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.9550644755363464, + "step": 139, + "token_acc": 0.732905151161282 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 7.68024206161499, + "learning_rate": 4.375e-05, + "loss": 0.8922043442726135, + "step": 140, + "token_acc": 0.7493879367905631 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 5.447193622589111, + "learning_rate": 4.40625e-05, + "loss": 0.8937676548957825, + "step": 141, + "token_acc": 0.7455310199789695 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 2.561711311340332, + "learning_rate": 4.4375e-05, + "loss": 1.030370831489563, + "step": 142, + "token_acc": 0.712084974676421 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 2.330228328704834, + "learning_rate": 4.46875e-05, + "loss": 0.8835145831108093, + "step": 143, + "token_acc": 0.7573455306612916 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 3.3042826652526855, + "learning_rate": 4.5e-05, + "loss": 0.9554994702339172, + "step": 144, + "token_acc": 0.7331631024577082 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.903152346611023, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9345872402191162, + "step": 145, + "token_acc": 0.7318692226564923 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 1.0897647142410278, + "learning_rate": 4.5625e-05, + "loss": 0.9259800910949707, + "step": 146, + "token_acc": 0.7344223913159155 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 1.892134428024292, + "learning_rate": 4.59375e-05, + "loss": 0.8477439284324646, + "step": 147, + "token_acc": 0.7550676911818515 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 1.995365858078003, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.926980197429657, + "step": 148, + "token_acc": 0.7390321121664405 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 0.967679500579834, + "learning_rate": 4.65625e-05, + "loss": 1.040574073791504, + "step": 149, + "token_acc": 0.7037716802789759 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 1.3489030599594116, + "learning_rate": 4.6875e-05, + "loss": 0.9701130390167236, + "step": 150, + "token_acc": 0.722164475695506 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 1.8906278610229492, + "learning_rate": 4.71875e-05, + "loss": 1.0237723588943481, + "step": 151, + "token_acc": 0.7124020961289232 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 1.4073423147201538, + "learning_rate": 4.75e-05, + "loss": 0.8609241247177124, + "step": 152, + "token_acc": 0.7521867897238101 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 1.7892054319381714, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.0169634819030762, + "step": 153, + "token_acc": 0.7109900672861262 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 5.222759246826172, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.8839869499206543, + "step": 154, + "token_acc": 0.7499611740953565 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 47.99449920654297, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9847191572189331, + "step": 155, + "token_acc": 0.7206756827869284 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 2.1542346477508545, + "learning_rate": 4.875e-05, + "loss": 0.8897120952606201, + "step": 156, + "token_acc": 0.7461834889580554 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 1.6777710914611816, + "learning_rate": 4.90625e-05, + "loss": 0.9585904479026794, + "step": 157, + "token_acc": 0.726420528934276 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 1.6333376169204712, + "learning_rate": 4.937500000000001e-05, + "loss": 0.8516196012496948, + "step": 158, + "token_acc": 0.7541220115416323 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 1.346437692642212, + "learning_rate": 4.96875e-05, + "loss": 0.8823418021202087, + "step": 159, + "token_acc": 0.752115152181079 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 3.7089667320251465, + "learning_rate": 5e-05, + "loss": 0.9368952512741089, + "step": 160, + "token_acc": 0.7302366635405748 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 1.9471855163574219, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8721541166305542, + "step": 161, + "token_acc": 0.7594202898550725 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 2.1255381107330322, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.875278115272522, + "step": 162, + "token_acc": 0.7485261365125114 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 1.0908252000808716, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8458836078643799, + "step": 163, + "token_acc": 0.7550397067806964 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 1.6298143863677979, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.0290120840072632, + "step": 164, + "token_acc": 0.7065329357549471 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 1.5110621452331543, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9266539812088013, + "step": 165, + "token_acc": 0.7334730109720461 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.3298150300979614, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9487897157669067, + "step": 166, + "token_acc": 0.7244558712708896 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 1.4212807416915894, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8636137247085571, + "step": 167, + "token_acc": 0.75104248110503 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.1823561191558838, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.944591224193573, + "step": 168, + "token_acc": 0.7279493670886076 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 3.800663471221924, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.7865618467330933, + "step": 169, + "token_acc": 0.7755815987405982 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 2.064781427383423, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8385809659957886, + "step": 170, + "token_acc": 0.7639746370765893 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 2.5913920402526855, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8421958088874817, + "step": 171, + "token_acc": 0.7620282597030943 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 1.7713373899459839, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8133989572525024, + "step": 172, + "token_acc": 0.760867708600222 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 1.529839038848877, + "learning_rate": 4.994911507566217e-05, + "loss": 1.000519037246704, + "step": 173, + "token_acc": 0.712219074598678 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 1.5380620956420898, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9671303033828735, + "step": 174, + "token_acc": 0.7277875219243297 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 2.8864336013793945, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8283255100250244, + "step": 175, + "token_acc": 0.7675478577939836 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 1.0531455278396606, + "learning_rate": 4.99229333433282e-05, + "loss": 0.915996789932251, + "step": 176, + "token_acc": 0.7366725083385155 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 1.4250882863998413, + "learning_rate": 4.991300473502437e-05, + "loss": 0.8618585467338562, + "step": 177, + "token_acc": 0.7541533421729975 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 5.33800745010376, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.002793788909912, + "step": 178, + "token_acc": 0.7128742904190319 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 1.2855201959609985, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8489822745323181, + "step": 179, + "token_acc": 0.7639533864890914 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.6636594533920288, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9121615290641785, + "step": 180, + "token_acc": 0.7437731849496555 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 1.5193665027618408, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8066229224205017, + "step": 181, + "token_acc": 0.7651162790697674 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 1.5862308740615845, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9458524584770203, + "step": 182, + "token_acc": 0.7302548696579126 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 2.379222869873047, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9564061164855957, + "step": 183, + "token_acc": 0.7301209802502326 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.0790810585021973, + "learning_rate": 4.982671142387316e-05, + "loss": 0.942729651927948, + "step": 184, + "token_acc": 0.7303644468955375 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 9.259621620178223, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8534692525863647, + "step": 185, + "token_acc": 0.7507731234186112 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 3.4542312622070312, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0024710893630981, + "step": 186, + "token_acc": 0.7177069583254762 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 8.031414985656738, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8734491467475891, + "step": 187, + "token_acc": 0.7507000736919676 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 1.1859290599822998, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9791375398635864, + "step": 188, + "token_acc": 0.7258350951374207 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 3.053464889526367, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8371925354003906, + "step": 189, + "token_acc": 0.7536518241479077 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 1.5525466203689575, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8489048480987549, + "step": 190, + "token_acc": 0.7543675535526885 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 1.2123963832855225, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8702831864356995, + "step": 191, + "token_acc": 0.7504071889918562 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 4.12030553817749, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8116580843925476, + "step": 192, + "token_acc": 0.7636261170598181 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 3.596958875656128, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.8202139139175415, + "step": 193, + "token_acc": 0.7595227168425883 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 3.500709295272827, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9322924017906189, + "step": 194, + "token_acc": 0.7302081098476721 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 2.0435562133789062, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7780945301055908, + "step": 195, + "token_acc": 0.7680968459194598 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 1.0618855953216553, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8902656435966492, + "step": 196, + "token_acc": 0.7357566856373539 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 1.3093773126602173, + "learning_rate": 4.958879433443904e-05, + "loss": 0.7953319549560547, + "step": 197, + "token_acc": 0.7690320619966571 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 4.695700645446777, + "learning_rate": 4.95663319832678e-05, + "loss": 0.9916477203369141, + "step": 198, + "token_acc": 0.7183775051303323 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 1.1738910675048828, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8842062950134277, + "step": 199, + "token_acc": 0.7402211505674899 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 1.958127737045288, + "learning_rate": 4.951963201008076e-05, + "loss": 0.8272268772125244, + "step": 200, + "token_acc": 0.7592515245175842 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 0.9756200313568115, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8797040581703186, + "step": 201, + "token_acc": 0.7454005184295378 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 1.441583275794983, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7635867595672607, + "step": 202, + "token_acc": 0.7780200258397932 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 0.9431282877922058, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8886734247207642, + "step": 203, + "token_acc": 0.7458984875672905 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.4262967109680176, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9764437675476074, + "step": 204, + "token_acc": 0.7219959266802444 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 1.837144136428833, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8055057525634766, + "step": 205, + "token_acc": 0.7705683101242002 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 0.9157178401947021, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9508963227272034, + "step": 206, + "token_acc": 0.7266013284407079 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 1.1117141246795654, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8796980381011963, + "step": 207, + "token_acc": 0.7448091668820539 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 1.206092119216919, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.7853018045425415, + "step": 208, + "token_acc": 0.7676789587852495 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 3.613619804382324, + "learning_rate": 4.92803071949828e-05, + "loss": 0.930952250957489, + "step": 209, + "token_acc": 0.7290444145356663 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 2.278681755065918, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9441535472869873, + "step": 210, + "token_acc": 0.7330724921204217 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 1.102830410003662, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9249938130378723, + "step": 211, + "token_acc": 0.7305298501351241 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.1460347175598145, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.938249945640564, + "step": 212, + "token_acc": 0.7304270462633452 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.1301722526550293, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8906076550483704, + "step": 213, + "token_acc": 0.7410463483146067 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 1.019655466079712, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8547159433364868, + "step": 214, + "token_acc": 0.7477573904179409 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 0.8400518298149109, + "learning_rate": 4.9094401644886e-05, + "loss": 0.9786480069160461, + "step": 215, + "token_acc": 0.7191857669498317 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 1.3454630374908447, + "learning_rate": 4.906138091134118e-05, + "loss": 0.930005669593811, + "step": 216, + "token_acc": 0.7302245555212423 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 1.7261593341827393, + "learning_rate": 4.90277804028108e-05, + "loss": 0.7304342985153198, + "step": 217, + "token_acc": 0.7930695985079023 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 0.8376732468605042, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9497151374816895, + "step": 218, + "token_acc": 0.7235062817684856 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 1.5206397771835327, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7451450228691101, + "step": 219, + "token_acc": 0.7850740452065471 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 2.350113868713379, + "learning_rate": 4.892350839330522e-05, + "loss": 0.894478440284729, + "step": 220, + "token_acc": 0.7408569868995634 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 2.151811361312866, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8410134315490723, + "step": 221, + "token_acc": 0.7524846536100556 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 2.2998857498168945, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8774259090423584, + "step": 222, + "token_acc": 0.7482207812747114 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 4.154652118682861, + "learning_rate": 4.881404839143988e-05, + "loss": 0.848537027835846, + "step": 223, + "token_acc": 0.7471583220568335 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 3.917426824569702, + "learning_rate": 4.877641290737884e-05, + "loss": 0.8067992925643921, + "step": 224, + "token_acc": 0.7612280960094242 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 6.496757507324219, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8888064026832581, + "step": 225, + "token_acc": 0.7468172852788237 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 2.212669849395752, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8939536809921265, + "step": 226, + "token_acc": 0.7427561031257129 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 2.2665131092071533, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8388830423355103, + "step": 227, + "token_acc": 0.7591590470858991 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 1.6633414030075073, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8939744234085083, + "step": 228, + "token_acc": 0.7423191278493558 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 10.390888214111328, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8337754607200623, + "step": 229, + "token_acc": 0.760409214479897 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 1.9441218376159668, + "learning_rate": 4.853860162957552e-05, + "loss": 0.8908044099807739, + "step": 230, + "token_acc": 0.741635046567782 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 5.351205825805664, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6824640035629272, + "step": 231, + "token_acc": 0.7986786566342449 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 5.388350486755371, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.8338614702224731, + "step": 232, + "token_acc": 0.7588204709203 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 33.36974334716797, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8330967426300049, + "step": 233, + "token_acc": 0.7553732862360055 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.2575448751449585, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8081785440444946, + "step": 234, + "token_acc": 0.7618624367564611 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 5.851841926574707, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8118147253990173, + "step": 235, + "token_acc": 0.7588138835747472 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 1.2276482582092285, + "learning_rate": 4.828037336897009e-05, + "loss": 0.85323566198349, + "step": 236, + "token_acc": 0.7462974887314875 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 1.4128162860870361, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9805375337600708, + "step": 237, + "token_acc": 0.7154090994195843 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.1258808374404907, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.7949981689453125, + "step": 238, + "token_acc": 0.7637019230769231 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 2.17614483833313, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8806252479553223, + "step": 239, + "token_acc": 0.7484175458078846 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 2.775895357131958, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8502448797225952, + "step": 240, + "token_acc": 0.7478745871013158 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 3.2797460556030273, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.7003047466278076, + "step": 241, + "token_acc": 0.7912219560008713 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 3.991440773010254, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.90602707862854, + "step": 242, + "token_acc": 0.7321293536764378 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 1.5725153684616089, + "learning_rate": 4.79536020593051e-05, + "loss": 0.9273116588592529, + "step": 243, + "token_acc": 0.729396270880987 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 1.5961885452270508, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.8434361219406128, + "step": 244, + "token_acc": 0.7547051878602681 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.036643385887146, + "learning_rate": 4.785524389258827e-05, + "loss": 0.93770432472229, + "step": 245, + "token_acc": 0.727697519566995 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 1.0603351593017578, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8905070424079895, + "step": 246, + "token_acc": 0.7367771247962862 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.6090335845947266, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.773712694644928, + "step": 247, + "token_acc": 0.7752465741468099 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 2.8802406787872314, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.889683723449707, + "step": 248, + "token_acc": 0.7375587262919784 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 0.9473100304603577, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9071462750434875, + "step": 249, + "token_acc": 0.7377093584939732 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 1.420573353767395, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7493491172790527, + "step": 250, + "token_acc": 0.7773999683694449 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 1.5327718257904053, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.845209538936615, + "step": 251, + "token_acc": 0.7534288560263581 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 1.9740188121795654, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8819962739944458, + "step": 252, + "token_acc": 0.7408409658617818 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 4.266992092132568, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.836998462677002, + "step": 253, + "token_acc": 0.753389326102771 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 3.870814085006714, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7518301010131836, + "step": 254, + "token_acc": 0.7717560376586164 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 6.527884006500244, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.7232604622840881, + "step": 255, + "token_acc": 0.786843072399853 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 1.4010592699050903, + "learning_rate": 4.72751631047092e-05, + "loss": 0.8275509476661682, + "step": 256, + "token_acc": 0.756143383181784 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 6.857308864593506, + "learning_rate": 4.721918194465169e-05, + "loss": 0.799940288066864, + "step": 257, + "token_acc": 0.7626774847870182 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 1.6401067972183228, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7834373116493225, + "step": 258, + "token_acc": 0.7659123055162659 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 1.6125162839889526, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8310164213180542, + "step": 259, + "token_acc": 0.7511212139829206 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 1.442099690437317, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.879160463809967, + "step": 260, + "token_acc": 0.7447237531926334 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 1.0048458576202393, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9174377918243408, + "step": 261, + "token_acc": 0.7316501716824884 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 6.172839164733887, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7322565317153931, + "step": 262, + "token_acc": 0.7848805398504468 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 2.718960762023926, + "learning_rate": 4.687209999162396e-05, + "loss": 0.9046364426612854, + "step": 263, + "token_acc": 0.7374393892499742 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 0.7975059151649475, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9695983529090881, + "step": 264, + "token_acc": 0.7193242184098232 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 2.3180477619171143, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8064447641372681, + "step": 265, + "token_acc": 0.7668189605939463 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 2.5961692333221436, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.836155354976654, + "step": 266, + "token_acc": 0.7518848526387937 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 0.7738305330276489, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.9511428475379944, + "step": 267, + "token_acc": 0.7291764338177841 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 1.9640631675720215, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8413755297660828, + "step": 268, + "token_acc": 0.7570005091279366 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 3.4764976501464844, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8661715984344482, + "step": 269, + "token_acc": 0.7496790040752526 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 2.8140335083007812, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8345517516136169, + "step": 270, + "token_acc": 0.7584374551199196 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 2.1373839378356934, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8521395921707153, + "step": 271, + "token_acc": 0.7504881307162676 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 0.9885866641998291, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8748230934143066, + "step": 272, + "token_acc": 0.7425441926038391 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 3.56126070022583, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.8168613314628601, + "step": 273, + "token_acc": 0.7603961787018826 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 25.966888427734375, + "learning_rate": 4.618673848685586e-05, + "loss": 0.7895940542221069, + "step": 274, + "token_acc": 0.7658349328214972 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 1.3936517238616943, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8234192132949829, + "step": 275, + "token_acc": 0.758264992311635 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 2.4734811782836914, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8250598311424255, + "step": 276, + "token_acc": 0.7552643893308376 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 2.5281338691711426, + "learning_rate": 4.59890152099534e-05, + "loss": 0.9137836694717407, + "step": 277, + "token_acc": 0.7314060158619934 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 1.5060079097747803, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8653621077537537, + "step": 278, + "token_acc": 0.7430385386500334 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 1.0087921619415283, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8411096930503845, + "step": 279, + "token_acc": 0.7529303234208813 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 1.5636194944381714, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7783745527267456, + "step": 280, + "token_acc": 0.7702870220272718 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 1.9277583360671997, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9275861978530884, + "step": 281, + "token_acc": 0.724974081327036 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 1.4190716743469238, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8562414646148682, + "step": 282, + "token_acc": 0.7458445307056832 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.4012247323989868, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8905417323112488, + "step": 283, + "token_acc": 0.7400331750843677 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 2.845858335494995, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7349405288696289, + "step": 284, + "token_acc": 0.7778809689652504 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 2.043717622756958, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.739836573600769, + "step": 285, + "token_acc": 0.7864004044489383 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 1.1184813976287842, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7316737771034241, + "step": 286, + "token_acc": 0.7790425932906144 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 1.7550926208496094, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9168081283569336, + "step": 287, + "token_acc": 0.7349883025734338 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 2.2734856605529785, + "learning_rate": 4.522542485937369e-05, + "loss": 0.8405396342277527, + "step": 288, + "token_acc": 0.753734827264239 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 0.8263589143753052, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9497283697128296, + "step": 289, + "token_acc": 0.7289892452187454 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 4.233347415924072, + "learning_rate": 4.508018828701612e-05, + "loss": 0.8274160623550415, + "step": 290, + "token_acc": 0.7547876258286276 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 2.796037197113037, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8769165277481079, + "step": 291, + "token_acc": 0.7473155929038282 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 0.9638167023658752, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9158531427383423, + "step": 292, + "token_acc": 0.736260350471789 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 2.0772323608398438, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8095401525497437, + "step": 293, + "token_acc": 0.7583516215557181 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 1.0814753770828247, + "learning_rate": 4.478392321601651e-05, + "loss": 0.8873149752616882, + "step": 294, + "token_acc": 0.7437832431695232 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 4.168087005615234, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7311573028564453, + "step": 295, + "token_acc": 0.78859817771462 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 1.3557254076004028, + "learning_rate": 4.463292327201862e-05, + "loss": 0.8367257118225098, + "step": 296, + "token_acc": 0.752932016156504 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 2.2594828605651855, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8442533016204834, + "step": 297, + "token_acc": 0.7561402328241706 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 1.4002978801727295, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7559725642204285, + "step": 298, + "token_acc": 0.7742537313432836 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.6578376293182373, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8327486515045166, + "step": 299, + "token_acc": 0.7559387210816846 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 3.8968186378479004, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.8528477549552917, + "step": 300, + "token_acc": 0.750763448437867 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 1.1830475330352783, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9132996797561646, + "step": 301, + "token_acc": 0.7312029217073728 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 1.79401433467865, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8471458554267883, + "step": 302, + "token_acc": 0.7578536464464961 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.1060916185379028, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8816431760787964, + "step": 303, + "token_acc": 0.7383714445064138 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 3.274479627609253, + "learning_rate": 4.401014914000078e-05, + "loss": 0.7977585792541504, + "step": 304, + "token_acc": 0.7648344784509682 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 4.249853610992432, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8551120162010193, + "step": 305, + "token_acc": 0.7446675388203174 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 9.041977882385254, + "learning_rate": 4.384983704904674e-05, + "loss": 0.806232213973999, + "step": 306, + "token_acc": 0.7649096031932379 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 1.081554889678955, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8331530094146729, + "step": 307, + "token_acc": 0.7551795135761163 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.7485742568969727, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7645971775054932, + "step": 308, + "token_acc": 0.776908023483366 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 2.283208131790161, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8550758361816406, + "step": 309, + "token_acc": 0.7544976635514019 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 0.8769519925117493, + "learning_rate": 4.352377813387398e-05, + "loss": 0.9192790389060974, + "step": 310, + "token_acc": 0.7294477565108253 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 2.909032106399536, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.6819452047348022, + "step": 311, + "token_acc": 0.7967241883591694 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 2.9573018550872803, + "learning_rate": 4.335806273589214e-05, + "loss": 0.791392982006073, + "step": 312, + "token_acc": 0.7667422052043448 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 2.8347651958465576, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7407418489456177, + "step": 313, + "token_acc": 0.781952 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 24.759061813354492, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8645349740982056, + "step": 314, + "token_acc": 0.7462040885571295 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 2.6164278984069824, + "learning_rate": 4.310617707378668e-05, + "loss": 0.8003748059272766, + "step": 315, + "token_acc": 0.764179104477612 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 1.0327874422073364, + "learning_rate": 4.302133991757297e-05, + "loss": 0.883104681968689, + "step": 316, + "token_acc": 0.7430525185862521 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 1.9250575304031372, + "learning_rate": 4.2936068525181e-05, + "loss": 0.8418888449668884, + "step": 317, + "token_acc": 0.7478256547885294 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 0.9483305811882019, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9749743938446045, + "step": 318, + "token_acc": 0.7198247535596933 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 4.413815975189209, + "learning_rate": 4.276423126095974e-05, + "loss": 0.8005592226982117, + "step": 319, + "token_acc": 0.7621298667191911 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 3.177881956100464, + "learning_rate": 4.267766952966369e-05, + "loss": 0.941821813583374, + "step": 320, + "token_acc": 0.7269460518947172 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 1.1445744037628174, + "learning_rate": 4.259068184315608e-05, + "loss": 0.905495285987854, + "step": 321, + "token_acc": 0.7364675688287448 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 2.5400984287261963, + "learning_rate": 4.250327029746309e-05, + "loss": 0.749504029750824, + "step": 322, + "token_acc": 0.7781667031284183 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 1.716409683227539, + "learning_rate": 4.24154369988241e-05, + "loss": 0.7389223575592041, + "step": 323, + "token_acc": 0.7833673658808242 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.4108213186264038, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9132614135742188, + "step": 324, + "token_acc": 0.7287277061252287 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 2.222651720046997, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7642686367034912, + "step": 325, + "token_acc": 0.7748897656068694 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 2.48195481300354, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6340684294700623, + "step": 326, + "token_acc": 0.8057753164556962 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 0.8498600721359253, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9634742736816406, + "step": 327, + "token_acc": 0.7193177752156801 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 1.3811802864074707, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8113643527030945, + "step": 328, + "token_acc": 0.7561390347586897 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 0.8957132697105408, + "learning_rate": 4.187969961854726e-05, + "loss": 0.995599627494812, + "step": 329, + "token_acc": 0.71316625740286 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 1.3119924068450928, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7408137917518616, + "step": 330, + "token_acc": 0.7839771101573677 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 2.3570327758789062, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6798240542411804, + "step": 331, + "token_acc": 0.8010324216627422 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 1.039640188217163, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.7958476543426514, + "step": 332, + "token_acc": 0.7642944234101264 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 5.126318454742432, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7409902811050415, + "step": 333, + "token_acc": 0.7794841832902095 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 1.3792798519134521, + "learning_rate": 4.142204747357604e-05, + "loss": 0.8940519094467163, + "step": 334, + "token_acc": 0.7399400438141358 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 2.766155481338501, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8875488042831421, + "step": 335, + "token_acc": 0.7465056801284721 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 1.169003963470459, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7597804069519043, + "step": 336, + "token_acc": 0.7758186397984886 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 1.2755037546157837, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8294762372970581, + "step": 337, + "token_acc": 0.7564102564102564 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.5991193056106567, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8293130397796631, + "step": 338, + "token_acc": 0.760047203828755 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 9.708932876586914, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6401220560073853, + "step": 339, + "token_acc": 0.8131151428910234 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 2.348402261734009, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7404853105545044, + "step": 340, + "token_acc": 0.7849596539389402 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 0.9730225801467896, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8264370560646057, + "step": 341, + "token_acc": 0.7558938089380893 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 3.2532331943511963, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7033358812332153, + "step": 342, + "token_acc": 0.7849215157761218 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 6.3877081871032715, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8262134790420532, + "step": 343, + "token_acc": 0.7543069554650083 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 0.9934179782867432, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8746166229248047, + "step": 344, + "token_acc": 0.7440602317298589 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 1.709168791770935, + "learning_rate": 4.038078976451567e-05, + "loss": 0.854055643081665, + "step": 345, + "token_acc": 0.7495352374514112 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.4886112213134766, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7562270164489746, + "step": 346, + "token_acc": 0.7793035107587769 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 1.901759147644043, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8186328411102295, + "step": 347, + "token_acc": 0.7593344425956738 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 1.0580676794052124, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7164099216461182, + "step": 348, + "token_acc": 0.7871918390478889 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 1.3126521110534668, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8912985324859619, + "step": 349, + "token_acc": 0.7413303013075612 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 4.351490020751953, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9175525903701782, + "step": 350, + "token_acc": 0.7297975018925057 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.268661379814148, + "learning_rate": 3.979373519225858e-05, + "loss": 0.9188856482505798, + "step": 351, + "token_acc": 0.7321795398520953 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 0.9793360829353333, + "learning_rate": 3.969463130731183e-05, + "loss": 0.885201096534729, + "step": 352, + "token_acc": 0.7393814077711726 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.042937994003296, + "learning_rate": 3.959517334544466e-05, + "loss": 0.885141134262085, + "step": 353, + "token_acc": 0.7363861965631877 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 4.194576263427734, + "learning_rate": 3.949536370316285e-05, + "loss": 0.8621309995651245, + "step": 354, + "token_acc": 0.7478715283894075 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 1.0623916387557983, + "learning_rate": 3.939520478544614e-05, + "loss": 0.9318335056304932, + "step": 355, + "token_acc": 0.7253218884120172 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 0.7876653075218201, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.8923368453979492, + "step": 356, + "token_acc": 0.7409687068568799 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 3.866694927215576, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8551492094993591, + "step": 357, + "token_acc": 0.7514216084484159 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 1.3935068845748901, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7526187896728516, + "step": 358, + "token_acc": 0.7810574580885513 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 2.3392226696014404, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7576834559440613, + "step": 359, + "token_acc": 0.7734380288363907 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.7921333312988281, + "learning_rate": 3.888925582549006e-05, + "loss": 0.83681321144104, + "step": 360, + "token_acc": 0.7514089615534847 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 1.2905741930007935, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8470603227615356, + "step": 361, + "token_acc": 0.7570712784871505 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 1.3079355955123901, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8253287076950073, + "step": 362, + "token_acc": 0.7527549467275495 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 1.8668463230133057, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7714506387710571, + "step": 363, + "token_acc": 0.7745460659045057 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 1.1210169792175293, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6929470300674438, + "step": 364, + "token_acc": 0.7864339547798492 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 1.4827960729599, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8307613730430603, + "step": 365, + "token_acc": 0.7528935515137694 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.1803950071334839, + "learning_rate": 3.827110064348773e-05, + "loss": 0.8122671842575073, + "step": 366, + "token_acc": 0.7532679738562091 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.0265437364578247, + "learning_rate": 3.816694101379631e-05, + "loss": 0.865354061126709, + "step": 367, + "token_acc": 0.7445534777510338 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 2.4629406929016113, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.6830093264579773, + "step": 368, + "token_acc": 0.7940572856250557 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 1.6382622718811035, + "learning_rate": 3.795767247323533e-05, + "loss": 0.925508975982666, + "step": 369, + "token_acc": 0.7297501555970481 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 2.4283573627471924, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7516419887542725, + "step": 370, + "token_acc": 0.7758667024993281 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 2.3246383666992188, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8408146500587463, + "step": 371, + "token_acc": 0.7506207875133026 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 1.099416732788086, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9075899720191956, + "step": 372, + "token_acc": 0.7271246458923513 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 1.478629469871521, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8168604373931885, + "step": 373, + "token_acc": 0.7583498307682482 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 2.8805809020996094, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9121578335762024, + "step": 374, + "token_acc": 0.7350334520809801 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 2.7889788150787354, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.8579491376876831, + "step": 375, + "token_acc": 0.7476709613478691 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 2.072909116744995, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8317067623138428, + "step": 376, + "token_acc": 0.7571112340896513 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 5.177697658538818, + "learning_rate": 3.710831292775353e-05, + "loss": 0.761266827583313, + "step": 377, + "token_acc": 0.7681555758128229 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 2.7568130493164062, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7219102382659912, + "step": 378, + "token_acc": 0.7849854227405247 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 0.9146714806556702, + "learning_rate": 3.689300402536093e-05, + "loss": 0.981315016746521, + "step": 379, + "token_acc": 0.717638864704858 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.7547582387924194, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8267868757247925, + "step": 380, + "token_acc": 0.7560030491678312 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 1.010188341140747, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8323397636413574, + "step": 381, + "token_acc": 0.7527500819173337 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 2.1391537189483643, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7416062355041504, + "step": 382, + "token_acc": 0.7789564467442863 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 2.62939190864563, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7494302988052368, + "step": 383, + "token_acc": 0.7737996532750433 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 3.6275126934051514, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6191868782043457, + "step": 384, + "token_acc": 0.8121914573942907 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 2.8354475498199463, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8018133044242859, + "step": 385, + "token_acc": 0.7613926797511694 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.408925175666809, + "learning_rate": 3.613053314713671e-05, + "loss": 0.839815616607666, + "step": 386, + "token_acc": 0.7488550290646468 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 2.7679271697998047, + "learning_rate": 3.602051485530486e-05, + "loss": 0.9087778925895691, + "step": 387, + "token_acc": 0.7297227794064702 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 3.360543727874756, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7623568177223206, + "step": 388, + "token_acc": 0.7737416741056101 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 1.070449948310852, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9299885034561157, + "step": 389, + "token_acc": 0.7274739583333333 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 4.474368572235107, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6639401912689209, + "step": 390, + "token_acc": 0.8028589716236398 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 1.5885690450668335, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8066656589508057, + "step": 391, + "token_acc": 0.7599889165973954 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.550413727760315, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7741931676864624, + "step": 392, + "token_acc": 0.767988750969744 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 1.496748685836792, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.7883261442184448, + "step": 393, + "token_acc": 0.7652963974839571 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.4409575462341309, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7302615642547607, + "step": 394, + "token_acc": 0.7827070285316632 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 0.9429992437362671, + "learning_rate": 3.513103285012475e-05, + "loss": 0.8207824230194092, + "step": 395, + "token_acc": 0.7606800348735833 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 1.858787178993225, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7316930294036865, + "step": 396, + "token_acc": 0.7801478515324195 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 2.4561638832092285, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7595556378364563, + "step": 397, + "token_acc": 0.7770890355820319 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 5.845393180847168, + "learning_rate": 3.47933752712989e-05, + "loss": 0.7122775316238403, + "step": 398, + "token_acc": 0.7888438880706922 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 1.6096240282058716, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8571289777755737, + "step": 399, + "token_acc": 0.7485540516367539 + }, + { + "epoch": 1.0, + "grad_norm": 1.6828404664993286, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7422727942466736, + "step": 400, + "token_acc": 0.7744593202883625 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 0.9042538404464722, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7470591068267822, + "step": 401, + "token_acc": 0.775092699143332 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 1.5840198993682861, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8494120836257935, + "step": 402, + "token_acc": 0.7467780083988994 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 1.7264753580093384, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7390634417533875, + "step": 403, + "token_acc": 0.778258834542476 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 3.9057250022888184, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6417334079742432, + "step": 404, + "token_acc": 0.803967657013915 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 13.16217041015625, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7573444843292236, + "step": 405, + "token_acc": 0.7765481064483112 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 2.6184492111206055, + "learning_rate": 3.388277253201041e-05, + "loss": 0.8021650314331055, + "step": 406, + "token_acc": 0.7634555116500885 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 0.9962872266769409, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8162388205528259, + "step": 407, + "token_acc": 0.7603709738062414 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 0.9261815547943115, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8409506678581238, + "step": 408, + "token_acc": 0.748269765092195 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 1.4823356866836548, + "learning_rate": 3.353768924152341e-05, + "loss": 0.6996514797210693, + "step": 409, + "token_acc": 0.7920583326012475 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 0.8279326558113098, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9892264008522034, + "step": 410, + "token_acc": 0.7166431939256629 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 1.2230151891708374, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7444078326225281, + "step": 411, + "token_acc": 0.7746187959419233 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 9.82090950012207, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8885623216629028, + "step": 412, + "token_acc": 0.7364721589570408 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 1.5039560794830322, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6384131908416748, + "step": 413, + "token_acc": 0.8135575732562939 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 2.572512626647949, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7594075202941895, + "step": 414, + "token_acc": 0.7756237883809642 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 1.3949657678604126, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8497216105461121, + "step": 415, + "token_acc": 0.7483397140401594 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 0.8779869079589844, + "learning_rate": 3.272542485937369e-05, + "loss": 0.8191887140274048, + "step": 416, + "token_acc": 0.7570150580652331 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 1.1911786794662476, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8783491849899292, + "step": 417, + "token_acc": 0.743301789989739 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.146852970123291, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8371091485023499, + "step": 418, + "token_acc": 0.7499376299376299 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.089304208755493, + "learning_rate": 3.23744632744341e-05, + "loss": 0.6695387363433838, + "step": 419, + "token_acc": 0.7941865916549461 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 3.357786178588867, + "learning_rate": 3.225711693136156e-05, + "loss": 0.6326532363891602, + "step": 420, + "token_acc": 0.8059025891725512 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 2.2081801891326904, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.8187626600265503, + "step": 421, + "token_acc": 0.7580794906936646 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 1.6402069330215454, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8068948984146118, + "step": 422, + "token_acc": 0.7584321435153898 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 1.57941734790802, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6910836696624756, + "step": 423, + "token_acc": 0.7918921316419764 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 1.2747334241867065, + "learning_rate": 3.178601124662686e-05, + "loss": 0.8506636619567871, + "step": 424, + "token_acc": 0.7479412315178738 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.1297740936279297, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.7539167404174805, + "step": 425, + "token_acc": 0.7679508587786259 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 2.4306747913360596, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7760396599769592, + "step": 426, + "token_acc": 0.7693063119364343 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 5.903867721557617, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8116412162780762, + "step": 427, + "token_acc": 0.7637670144406826 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 1.788726568222046, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7813456058502197, + "step": 428, + "token_acc": 0.7658718104495748 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 1.1867510080337524, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7816579937934875, + "step": 429, + "token_acc": 0.7660856605974211 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 4.440535068511963, + "learning_rate": 3.10745044975816e-05, + "loss": 0.800601601600647, + "step": 430, + "token_acc": 0.7669773635153129 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 1.7238138914108276, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8070148825645447, + "step": 431, + "token_acc": 0.7644200626959248 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 1.256711721420288, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8894907236099243, + "step": 432, + "token_acc": 0.7408053749836394 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 17.011455535888672, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8306131958961487, + "step": 433, + "token_acc": 0.7497091777383212 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 2.2736356258392334, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6613236665725708, + "step": 434, + "token_acc": 0.7976870839776776 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 2.7610883712768555, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8434382677078247, + "step": 435, + "token_acc": 0.7529855761774286 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 1.8570743799209595, + "learning_rate": 3.035772882662627e-05, + "loss": 0.7464153170585632, + "step": 436, + "token_acc": 0.7765296188122519 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 0.9314292073249817, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8278151750564575, + "step": 437, + "token_acc": 0.7535232235013894 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 1.3774133920669556, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8242682218551636, + "step": 438, + "token_acc": 0.7544135317496996 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 6.930232048034668, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.6596634984016418, + "step": 439, + "token_acc": 0.8021640826873385 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 4.866252422332764, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.506635308265686, + "step": 440, + "token_acc": 0.845995670995671 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.6028552055358887, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8647710680961609, + "step": 441, + "token_acc": 0.74706401151186 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 1.7333229780197144, + "learning_rate": 2.963630595278977e-05, + "loss": 0.6376317739486694, + "step": 442, + "token_acc": 0.8071622670807453 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 2.3443095684051514, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.721710205078125, + "step": 443, + "token_acc": 0.7838688149489942 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 0.9060749411582947, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.8552244901657104, + "step": 444, + "token_acc": 0.7432900127136601 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 0.749415397644043, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.785362720489502, + "step": 445, + "token_acc": 0.7612843660237998 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 0.7980436086654663, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8517442941665649, + "step": 446, + "token_acc": 0.7480493097557598 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 1.1448819637298584, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7649672031402588, + "step": 447, + "token_acc": 0.766477547078706 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 1.3443630933761597, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7490493059158325, + "step": 448, + "token_acc": 0.7757421770526879 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 4.406916618347168, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6007850170135498, + "step": 449, + "token_acc": 0.8233651384686991 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 1.3313847780227661, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6746580004692078, + "step": 450, + "token_acc": 0.7969903260480115 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 1.466326355934143, + "learning_rate": 2.854682793330633e-05, + "loss": 0.6978734731674194, + "step": 451, + "token_acc": 0.7890699904122723 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 1.363837718963623, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.6915320158004761, + "step": 452, + "token_acc": 0.7912602792120864 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 1.3149843215942383, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8228940963745117, + "step": 453, + "token_acc": 0.753298655163664 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 0.9304903745651245, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9149479269981384, + "step": 454, + "token_acc": 0.7286713286713287 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 1.7254271507263184, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.6899095773696899, + "step": 455, + "token_acc": 0.7892930042679532 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 5.276956081390381, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7458426356315613, + "step": 456, + "token_acc": 0.7750451577045991 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 1.1026403903961182, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.7810262441635132, + "step": 457, + "token_acc": 0.7638233460956282 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 5.3592143058776855, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7947831153869629, + "step": 458, + "token_acc": 0.7666825386028161 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 0.9304280281066895, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8342410922050476, + "step": 459, + "token_acc": 0.7494535884740622 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 1.1788454055786133, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8770091533660889, + "step": 460, + "token_acc": 0.7431479686260686 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.513720989227295, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8232619762420654, + "step": 461, + "token_acc": 0.7538295577130528 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 4.04278564453125, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8583269119262695, + "step": 462, + "token_acc": 0.7469663815396856 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 4.869415760040283, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.848386824131012, + "step": 463, + "token_acc": 0.7457259998452851 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 0.6062310338020325, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9125447273254395, + "step": 464, + "token_acc": 0.730836499607985 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 1.0651655197143555, + "learning_rate": 2.683911408999169e-05, + "loss": 0.716744601726532, + "step": 465, + "token_acc": 0.7814047029702971 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 2.8472161293029785, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6440662741661072, + "step": 466, + "token_acc": 0.80859707132735 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 3.403329372406006, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5214649438858032, + "step": 467, + "token_acc": 0.8430800314288921 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 5.556786060333252, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7512074708938599, + "step": 468, + "token_acc": 0.7785773595350125 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 2.395378351211548, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7191562652587891, + "step": 469, + "token_acc": 0.7896934402812877 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 0.9507644176483154, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8339272737503052, + "step": 470, + "token_acc": 0.7492740562731551 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 4.5672526359558105, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.7139979600906372, + "step": 471, + "token_acc": 0.7805757991197056 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 3.54498028755188, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8693740367889404, + "step": 472, + "token_acc": 0.7447919385996972 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 1.9187616109848022, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7921099662780762, + "step": 473, + "token_acc": 0.7626466275659824 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.4660390615463257, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.8307129144668579, + "step": 474, + "token_acc": 0.7560743513290618 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 0.8690254092216492, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8098856210708618, + "step": 475, + "token_acc": 0.7564140026883291 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 5.853299140930176, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6704491376876831, + "step": 476, + "token_acc": 0.7966314731020613 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 1.3092992305755615, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7706613540649414, + "step": 477, + "token_acc": 0.7744230161239329 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 2.787741184234619, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9088181257247925, + "step": 478, + "token_acc": 0.7326246933769419 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 2.232443332672119, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8565571308135986, + "step": 479, + "token_acc": 0.7444141689373297 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 9.54522705078125, + "learning_rate": 2.5e-05, + "loss": 0.7313039898872375, + "step": 480, + "token_acc": 0.781882145998241 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 20.989471435546875, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7575576901435852, + "step": 481, + "token_acc": 0.7708077584090351 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 1.1482243537902832, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.852341890335083, + "step": 482, + "token_acc": 0.7459840258458225 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 2.051314353942871, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.7475820183753967, + "step": 483, + "token_acc": 0.7779799247176914 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 1.342245101928711, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8240025043487549, + "step": 484, + "token_acc": 0.7542182827851346 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 1.3632580041885376, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8413196802139282, + "step": 485, + "token_acc": 0.7483724879705632 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 3.429781675338745, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9569882154464722, + "step": 486, + "token_acc": 0.7205176520780745 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.1299811601638794, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8428609371185303, + "step": 487, + "token_acc": 0.7533573202250038 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 1.7048869132995605, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7102815508842468, + "step": 488, + "token_acc": 0.7857550670853554 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 0.8680364489555359, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8275526762008667, + "step": 489, + "token_acc": 0.7501430369607507 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 1.3328769207000732, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.6902611255645752, + "step": 490, + "token_acc": 0.789313820240232 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 0.7926998734474182, + "learning_rate": 2.365075276976245e-05, + "loss": 0.8937082290649414, + "step": 491, + "token_acc": 0.7341974265051188 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 3.3240389823913574, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6675207614898682, + "step": 492, + "token_acc": 0.7990766225694753 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 5.930650234222412, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.783113420009613, + "step": 493, + "token_acc": 0.7705388240114731 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 0.8512884974479675, + "learning_rate": 2.328329352789066e-05, + "loss": 0.720180332660675, + "step": 494, + "token_acc": 0.7808032675289313 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 0.9648559093475342, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8460649251937866, + "step": 495, + "token_acc": 0.7489092921794621 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.8170979022979736, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8336548805236816, + "step": 496, + "token_acc": 0.7534397763225664 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 6.261831283569336, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6261081099510193, + "step": 497, + "token_acc": 0.8074581430745814 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 1.3391427993774414, + "learning_rate": 2.279394073699077e-05, + "loss": 0.7004765272140503, + "step": 498, + "token_acc": 0.7875529744153195 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.6274718046188354, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7182587385177612, + "step": 499, + "token_acc": 0.7839771101573677 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 4.34530782699585, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5547084808349609, + "step": 500, + "token_acc": 0.8279490944689183 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 6.319797515869141, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6171272993087769, + "step": 501, + "token_acc": 0.8103328365623448 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 1.2070508003234863, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8684753179550171, + "step": 502, + "token_acc": 0.7461618586114759 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.6517104506492615, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.929027795791626, + "step": 503, + "token_acc": 0.7245761408043324 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 7.505336761474609, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6728816032409668, + "step": 504, + "token_acc": 0.7991531132711 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 28.833297729492188, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7386347055435181, + "step": 505, + "token_acc": 0.7764926774314682 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 2.210476875305176, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6468443274497986, + "step": 506, + "token_acc": 0.8010013577732519 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 3.5139503479003906, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6901583671569824, + "step": 507, + "token_acc": 0.7926749509483323 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 1.6830179691314697, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8085765838623047, + "step": 508, + "token_acc": 0.7562606529434902 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 0.7797915935516357, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7800910472869873, + "step": 509, + "token_acc": 0.7595796361473256 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 1.7019588947296143, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8174337148666382, + "step": 510, + "token_acc": 0.7578614234731668 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 2.03682541847229, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.7452907562255859, + "step": 511, + "token_acc": 0.7781870595771941 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 0.9780297875404358, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8239941596984863, + "step": 512, + "token_acc": 0.7526496005217674 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 0.8718163371086121, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.796176552772522, + "step": 513, + "token_acc": 0.7592091654069536 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 2.4679477214813232, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7568551301956177, + "step": 514, + "token_acc": 0.7764072381190908 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 0.9792693853378296, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.8425300121307373, + "step": 515, + "token_acc": 0.7470879270715649 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.598029375076294, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7938356399536133, + "step": 516, + "token_acc": 0.7659052404042764 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 0.6741415858268738, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8783785104751587, + "step": 517, + "token_acc": 0.7394762056850847 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 1.6082953214645386, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7845078110694885, + "step": 518, + "token_acc": 0.7642520708137079 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 11.830879211425781, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8358283042907715, + "step": 519, + "token_acc": 0.7517000098551296 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 2.87798810005188, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.8649904131889343, + "step": 520, + "token_acc": 0.744602534154456 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 0.8139316439628601, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8346877098083496, + "step": 521, + "token_acc": 0.7504469606674613 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 2.8759028911590576, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7899202108383179, + "step": 522, + "token_acc": 0.7665122907018169 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 3.1788880825042725, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7810243368148804, + "step": 523, + "token_acc": 0.7666379186430933 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 0.7860379815101624, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8263541460037231, + "step": 524, + "token_acc": 0.7530105677070533 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 1.430240511894226, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7155407667160034, + "step": 525, + "token_acc": 0.7868094218415418 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 1.3369076251983643, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8235485553741455, + "step": 526, + "token_acc": 0.7551513200257566 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.0790313482284546, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8188608288764954, + "step": 527, + "token_acc": 0.7536337209302325 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 1.1045833826065063, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.8424797058105469, + "step": 528, + "token_acc": 0.7525659245223433 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 2.495410919189453, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8533246517181396, + "step": 529, + "token_acc": 0.7410009624639076 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 2.277566432952881, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8401960134506226, + "step": 530, + "token_acc": 0.7548590617685967 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 1.675037145614624, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6369855403900146, + "step": 531, + "token_acc": 0.8045444517979263 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 0.8442081212997437, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9534618854522705, + "step": 532, + "token_acc": 0.7226131426154497 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 0.8929516077041626, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.7794415354728699, + "step": 533, + "token_acc": 0.7713848312814952 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 1.1687227487564087, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.8722778558731079, + "step": 534, + "token_acc": 0.741757647821857 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 1.490539789199829, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.7561089396476746, + "step": 535, + "token_acc": 0.7730009802548663 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 1.109947919845581, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8310334086418152, + "step": 536, + "token_acc": 0.748946763692072 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 1.1950045824050903, + "learning_rate": 1.809595995707573e-05, + "loss": 0.8079832196235657, + "step": 537, + "token_acc": 0.7568485763589301 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 1.7237908840179443, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7125290632247925, + "step": 538, + "token_acc": 0.7834860972040361 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 3.228860855102539, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6453254222869873, + "step": 539, + "token_acc": 0.8018173950670705 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 0.8453672528266907, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8240500688552856, + "step": 540, + "token_acc": 0.7492266123663703 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 1.102385401725769, + "learning_rate": 1.762553672556591e-05, + "loss": 0.809388279914856, + "step": 541, + "token_acc": 0.7596028368794326 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.3018745183944702, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7180289030075073, + "step": 542, + "token_acc": 0.7798978365384616 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 3.1542391777038574, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.646782398223877, + "step": 543, + "token_acc": 0.8056676178293811 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 0.9923869967460632, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7879891991615295, + "step": 544, + "token_acc": 0.7618517074257701 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.2172160148620605, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7576411962509155, + "step": 545, + "token_acc": 0.7704047777040478 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 1.6602948904037476, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6707481145858765, + "step": 546, + "token_acc": 0.7971698113207547 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 1.4677680730819702, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8081753849983215, + "step": 547, + "token_acc": 0.755311542390194 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 2.0665853023529053, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8146413564682007, + "step": 548, + "token_acc": 0.7519490397413957 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 7.000178337097168, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7256150245666504, + "step": 549, + "token_acc": 0.7825356229448301 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 2.5341522693634033, + "learning_rate": 1.65777536651945e-05, + "loss": 0.726395845413208, + "step": 550, + "token_acc": 0.7819339150336146 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 1.4585434198379517, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.8065874576568604, + "step": 551, + "token_acc": 0.7564932940791625 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 1.8352439403533936, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8275594711303711, + "step": 552, + "token_acc": 0.7518390951226772 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.9580649137496948, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.7503329515457153, + "step": 553, + "token_acc": 0.7738378819846186 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 7.628960609436035, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.7021602392196655, + "step": 554, + "token_acc": 0.7898421209413167 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.2870745658874512, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.872342050075531, + "step": 555, + "token_acc": 0.7418959244573438 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 1.5503294467926025, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7012907266616821, + "step": 556, + "token_acc": 0.7840224809313528 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 1.410538673400879, + "learning_rate": 1.577407047339834e-05, + "loss": 0.7987989783287048, + "step": 557, + "token_acc": 0.7634807225667296 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 0.9178221821784973, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6806648969650269, + "step": 558, + "token_acc": 0.7902989575256311 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 0.756145179271698, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8719301819801331, + "step": 559, + "token_acc": 0.7413455258001306 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 1.1691936254501343, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.8100090026855469, + "step": 560, + "token_acc": 0.7591771792249119 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 35.45746994018555, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.7490640878677368, + "step": 561, + "token_acc": 0.7792402034101107 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 0.8100907206535339, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.778845489025116, + "step": 562, + "token_acc": 0.7706413851426537 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 1.7158607244491577, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8065593242645264, + "step": 563, + "token_acc": 0.7590346686267304 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 1.1593443155288696, + "learning_rate": 1.498127917242148e-05, + "loss": 0.9521163702011108, + "step": 564, + "token_acc": 0.7233781660727286 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 1.9125734567642212, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7740306258201599, + "step": 565, + "token_acc": 0.7697730265706096 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 0.8952035903930664, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8384573459625244, + "step": 566, + "token_acc": 0.7489069083392956 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 1.7073853015899658, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7088779211044312, + "step": 567, + "token_acc": 0.7877416700946113 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 2.4692201614379883, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.744478702545166, + "step": 568, + "token_acc": 0.7732206100765452 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 1.4949043989181519, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.7565535306930542, + "step": 569, + "token_acc": 0.7761570184817473 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 3.145484209060669, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7933104634284973, + "step": 570, + "token_acc": 0.761278654870717 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 1.172170877456665, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7600586414337158, + "step": 571, + "token_acc": 0.7707200207200208 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 1.8115105628967285, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7291625738143921, + "step": 572, + "token_acc": 0.7803458951638732 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 1.2004317045211792, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6606731414794922, + "step": 573, + "token_acc": 0.7994050797040653 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.2376269102096558, + "learning_rate": 1.38694668528633e-05, + "loss": 0.7951904535293579, + "step": 574, + "token_acc": 0.7661833626244874 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 2.052445411682129, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8511407971382141, + "step": 575, + "token_acc": 0.7467882836587872 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 0.9733930230140686, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.7993616461753845, + "step": 576, + "token_acc": 0.7636341403766203 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 5.800482749938965, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8141838908195496, + "step": 577, + "token_acc": 0.7566569997363565 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 2.696800470352173, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6543649435043335, + "step": 578, + "token_acc": 0.8048088161629654 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 4.301677703857422, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.647895872592926, + "step": 579, + "token_acc": 0.8066424494032174 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.5148913860321045, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7648165822029114, + "step": 580, + "token_acc": 0.7755042385267465 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 2.949655055999756, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7404133081436157, + "step": 581, + "token_acc": 0.7728736170461863 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 0.9238078594207764, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.917509138584137, + "step": 582, + "token_acc": 0.7355649875870905 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 83.38187408447266, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6469459533691406, + "step": 583, + "token_acc": 0.804023989166183 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 4.518279075622559, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8533624410629272, + "step": 584, + "token_acc": 0.7441301661403268 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 1.7925207614898682, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7255446314811707, + "step": 585, + "token_acc": 0.7831757417671992 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 6.655250072479248, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7307141423225403, + "step": 586, + "token_acc": 0.7741544170115598 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 0.8873371481895447, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8177270889282227, + "step": 587, + "token_acc": 0.7530202699287267 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 1.2454488277435303, + "learning_rate": 1.235856566555039e-05, + "loss": 0.6675281524658203, + "step": 588, + "token_acc": 0.7933152664859981 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.0082811117172241, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.7248143553733826, + "step": 589, + "token_acc": 0.7810338039259801 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 3.0372278690338135, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.666105329990387, + "step": 590, + "token_acc": 0.7997976825455214 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 1.4600460529327393, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.742726743221283, + "step": 591, + "token_acc": 0.7767523073085557 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 1.42963445186615, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.639944851398468, + "step": 592, + "token_acc": 0.8049067713444553 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.4108234643936157, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7738537788391113, + "step": 593, + "token_acc": 0.7662790011216719 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 2.011065721511841, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8032472133636475, + "step": 594, + "token_acc": 0.7643509458577952 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.9228585958480835, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7139896154403687, + "step": 595, + "token_acc": 0.7792246580252076 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 3.42121958732605, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6642230749130249, + "step": 596, + "token_acc": 0.7990822386179594 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 1.0371363162994385, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8180509209632874, + "step": 597, + "token_acc": 0.7535639466557662 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 1.0604794025421143, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8822356462478638, + "step": 598, + "token_acc": 0.7422369483029608 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 1.3429787158966064, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.70334792137146, + "step": 599, + "token_acc": 0.7864246823956443 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 1.2942774295806885, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7598515152931213, + "step": 600, + "token_acc": 0.7675241320058624 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 1.6313791275024414, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7451797723770142, + "step": 601, + "token_acc": 0.7745493358633776 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 1.9830615520477295, + "learning_rate": 1.090734344462458e-05, + "loss": 0.890819787979126, + "step": 602, + "token_acc": 0.7403223646024021 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 0.9711636900901794, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.766528844833374, + "step": 603, + "token_acc": 0.7713293650793651 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 2.051830530166626, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.7500281929969788, + "step": 604, + "token_acc": 0.7705687242132514 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 4.245327472686768, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.696961522102356, + "step": 605, + "token_acc": 0.7896506917373691 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 2.7437992095947266, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.891823410987854, + "step": 606, + "token_acc": 0.7399556762939663 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 1.5363843441009521, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.834951639175415, + "step": 607, + "token_acc": 0.7486957896400906 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 1.307376742362976, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.7804543375968933, + "step": 608, + "token_acc": 0.7650488867946754 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 1.2029725313186646, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.7981626987457275, + "step": 609, + "token_acc": 0.7576776926431197 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 2.243136405944824, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.618813693523407, + "step": 610, + "token_acc": 0.815751960085531 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 1.10971200466156, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.6312989592552185, + "step": 611, + "token_acc": 0.7997975894746527 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 0.9803842902183533, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7642860412597656, + "step": 612, + "token_acc": 0.7725077929221931 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 31.448169708251953, + "learning_rate": 9.813437667457229e-06, + "loss": 0.6522811651229858, + "step": 613, + "token_acc": 0.8037220388705537 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 0.9943018555641174, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8382527232170105, + "step": 614, + "token_acc": 0.751096142848065 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 0.9227951765060425, + "learning_rate": 9.619210235484333e-06, + "loss": 0.742218017578125, + "step": 615, + "token_acc": 0.7749133312322724 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 2.2479007244110107, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7250561714172363, + "step": 616, + "token_acc": 0.7738378549896875 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.514958143234253, + "learning_rate": 9.426465236041651e-06, + "loss": 0.6989889144897461, + "step": 617, + "token_acc": 0.7902208201892744 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 4.668854236602783, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7964303493499756, + "step": 618, + "token_acc": 0.7607207916892325 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 1.226259708404541, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8113234043121338, + "step": 619, + "token_acc": 0.7567243367935409 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 1.911278486251831, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7754377126693726, + "step": 620, + "token_acc": 0.7682521732984663 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.0659726858139038, + "learning_rate": 9.04549669873337e-06, + "loss": 0.810962975025177, + "step": 621, + "token_acc": 0.7570060922541341 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 1.9304813146591187, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6094653606414795, + "step": 622, + "token_acc": 0.8164489183979439 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 1.2579195499420166, + "learning_rate": 8.857309879408324e-06, + "loss": 0.66182541847229, + "step": 623, + "token_acc": 0.8028033383265568 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 1.7250380516052246, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8147578239440918, + "step": 624, + "token_acc": 0.7585159470600998 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 1.7458322048187256, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8331553339958191, + "step": 625, + "token_acc": 0.7498431694252763 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 1.2221341133117676, + "learning_rate": 8.577952526423969e-06, + "loss": 0.8016361594200134, + "step": 626, + "token_acc": 0.7612431882148631 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 3.993870973587036, + "learning_rate": 8.48562182685487e-06, + "loss": 0.7019971609115601, + "step": 627, + "token_acc": 0.7859397606208076 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 1.235687255859375, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6411934494972229, + "step": 628, + "token_acc": 0.8020742548370229 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 3.2990431785583496, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6782665252685547, + "step": 629, + "token_acc": 0.7922122674017918 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 1.9648222923278809, + "learning_rate": 8.211026128824539e-06, + "loss": 0.7926424741744995, + "step": 630, + "token_acc": 0.7613293051359517 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 1.3128774166107178, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8763965368270874, + "step": 631, + "token_acc": 0.7375299322212752 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 4.890468120574951, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6273766756057739, + "step": 632, + "token_acc": 0.8168607757239021 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 3.2160139083862305, + "learning_rate": 7.940071245792579e-06, + "loss": 0.5967519283294678, + "step": 633, + "token_acc": 0.8187688782418499 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 3.608379602432251, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6925722360610962, + "step": 634, + "token_acc": 0.7882998495442074 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 9.473015785217285, + "learning_rate": 7.761486381573327e-06, + "loss": 0.6970810890197754, + "step": 635, + "token_acc": 0.7880604576543105 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 1.1449179649353027, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7602096199989319, + "step": 636, + "token_acc": 0.7702360391479562 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 1.8277896642684937, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8149503469467163, + "step": 637, + "token_acc": 0.7562889343287841 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 2.1330368518829346, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.5871918201446533, + "step": 638, + "token_acc": 0.825297654131793 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 0.8962414264678955, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9314594268798828, + "step": 639, + "token_acc": 0.7280786651697573 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 1.338875412940979, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.7250627875328064, + "step": 640, + "token_acc": 0.7798726587129876 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 1.2020128965377808, + "learning_rate": 7.235768739040258e-06, + "loss": 0.7996973991394043, + "step": 641, + "token_acc": 0.76426948268948 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 96.59671783447266, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8170174360275269, + "step": 642, + "token_acc": 0.7553259286234523 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 0.7030874490737915, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9379591345787048, + "step": 643, + "token_acc": 0.7227594896834147 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 0.6374858617782593, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.8708009123802185, + "step": 644, + "token_acc": 0.73965669792957 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 1.4184483289718628, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7691725492477417, + "step": 645, + "token_acc": 0.7662367750405437 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 2.5497591495513916, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7211395502090454, + "step": 646, + "token_acc": 0.786339260513689 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 0.9087345004081726, + "learning_rate": 6.725459488639211e-06, + "loss": 0.872456431388855, + "step": 647, + "token_acc": 0.7409202044898866 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 1.3358864784240723, + "learning_rate": 6.641937264107867e-06, + "loss": 0.7510902881622314, + "step": 648, + "token_acc": 0.7725919309215423 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 3.704888105392456, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6040841341018677, + "step": 649, + "token_acc": 0.8143631436314364 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 0.9267286658287048, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8058043718338013, + "step": 650, + "token_acc": 0.7605926828030649 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 2.041635513305664, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8099769949913025, + "step": 651, + "token_acc": 0.7577828397873956 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 1.5155539512634277, + "learning_rate": 6.312291828435077e-06, + "loss": 0.6196180582046509, + "step": 652, + "token_acc": 0.8073305536701251 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 1.768568754196167, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7132784128189087, + "step": 653, + "token_acc": 0.78446311592139 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 0.8426440954208374, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8485860824584961, + "step": 654, + "token_acc": 0.748229935138882 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 4.96816873550415, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8367786407470703, + "step": 655, + "token_acc": 0.7491434739756887 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 3.880038022994995, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7719601392745972, + "step": 656, + "token_acc": 0.7681572629051621 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 0.7856653332710266, + "learning_rate": 5.910380944855087e-06, + "loss": 0.884110689163208, + "step": 657, + "token_acc": 0.7399053801298273 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 1.2310268878936768, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.7690421938896179, + "step": 658, + "token_acc": 0.7697993664202746 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 1.58376145362854, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8109105825424194, + "step": 659, + "token_acc": 0.7599358974358974 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 0.8561725616455078, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7711523771286011, + "step": 660, + "token_acc": 0.7678626345463865 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 1.3532984256744385, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7253690958023071, + "step": 661, + "token_acc": 0.7845570220501067 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 0.9115194082260132, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7143407464027405, + "step": 662, + "token_acc": 0.7897275258552108 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 1.3191654682159424, + "learning_rate": 5.443287214979592e-06, + "loss": 0.5992724299430847, + "step": 663, + "token_acc": 0.8163878593609135 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 1.710970163345337, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6404308080673218, + "step": 664, + "token_acc": 0.8054426911083814 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 0.9878676533699036, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6878443956375122, + "step": 665, + "token_acc": 0.7945592651475004 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.9691998958587646, + "learning_rate": 5.216076783983493e-06, + "loss": 0.6850720643997192, + "step": 666, + "token_acc": 0.7939158279963403 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 2.0937020778656006, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8503432273864746, + "step": 667, + "token_acc": 0.7473723926049696 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 1.6833800077438354, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8047228455543518, + "step": 668, + "token_acc": 0.7568868681465633 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 1.451167106628418, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8017756342887878, + "step": 669, + "token_acc": 0.7592959295929593 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 1.0639798641204834, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8059713840484619, + "step": 670, + "token_acc": 0.7561111111111111 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 1.0357158184051514, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8241342306137085, + "step": 671, + "token_acc": 0.7454847415403778 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 0.8671360015869141, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8555394411087036, + "step": 672, + "token_acc": 0.7474217794091942 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 5.883766174316406, + "learning_rate": 4.702687000087386e-06, + "loss": 0.6854438781738281, + "step": 673, + "token_acc": 0.7845229069641503 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 1.1688947677612305, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7587765455245972, + "step": 674, + "token_acc": 0.7688396791323014 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 21.169240951538086, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7326650619506836, + "step": 675, + "token_acc": 0.778235294117647 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 1.8388570547103882, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8537799119949341, + "step": 676, + "token_acc": 0.7444394008170676 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 1.0319663286209106, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7793920040130615, + "step": 677, + "token_acc": 0.7675712922718118 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 1.0005559921264648, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7914720773696899, + "step": 678, + "token_acc": 0.76452527161077 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 2.67810320854187, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.846095085144043, + "step": 679, + "token_acc": 0.748864050943584 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 2.256237506866455, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7095650434494019, + "step": 680, + "token_acc": 0.7868913027414468 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 1.4217983484268188, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7278553247451782, + "step": 681, + "token_acc": 0.7863779527559055 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.8460546731948853, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7024481892585754, + "step": 682, + "token_acc": 0.785208907425337 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 1.1893222332000732, + "learning_rate": 4.010984790046615e-06, + "loss": 0.6665959358215332, + "step": 683, + "token_acc": 0.7990233626962849 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 1.255271077156067, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8407459855079651, + "step": 684, + "token_acc": 0.7514467761734962 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 1.7191383838653564, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6034694314002991, + "step": 685, + "token_acc": 0.8184937382055241 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 2.4348859786987305, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8750420808792114, + "step": 686, + "token_acc": 0.7380963867046167 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 0.8619440793991089, + "learning_rate": 3.748372666094277e-06, + "loss": 0.8297964334487915, + "step": 687, + "token_acc": 0.752178699201908 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 1.1556035280227661, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7030929327011108, + "step": 688, + "token_acc": 0.7906772207563765 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 5.856689929962158, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.691868782043457, + "step": 689, + "token_acc": 0.7897428808404755 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.3657550811767578, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7366336584091187, + "step": 690, + "token_acc": 0.7799872733057588 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 1.1932430267333984, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6758766174316406, + "step": 691, + "token_acc": 0.7963037770147445 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 3.9285967350006104, + "learning_rate": 3.431640350555204e-06, + "loss": 0.6101948618888855, + "step": 692, + "token_acc": 0.8136406396989652 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 1.802047610282898, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6865506172180176, + "step": 693, + "token_acc": 0.7931622716610989 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 1.071358561515808, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8051484227180481, + "step": 694, + "token_acc": 0.7542495653853584 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.3180400133132935, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7677326202392578, + "step": 695, + "token_acc": 0.7704300280774347 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 1.2523272037506104, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7943510413169861, + "step": 696, + "token_acc": 0.7613922986379688 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 4.4054646492004395, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.701897382736206, + "step": 697, + "token_acc": 0.7884122654764857 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.3302299976348877, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8355323076248169, + "step": 698, + "token_acc": 0.7492808759395008 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 2.5054686069488525, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8056568503379822, + "step": 699, + "token_acc": 0.7634914412648635 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 8.32154369354248, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8949613571166992, + "step": 700, + "token_acc": 0.7380827429371118 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 2.0578978061676025, + "learning_rate": 2.894385171586095e-06, + "loss": 0.820101261138916, + "step": 701, + "token_acc": 0.7541902236453695 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.6051064729690552, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8328648209571838, + "step": 702, + "token_acc": 0.7533528918692373 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 3.2739200592041016, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6855148673057556, + "step": 703, + "token_acc": 0.7909475289387953 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 1.0998915433883667, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8189454078674316, + "step": 704, + "token_acc": 0.7593880389429764 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.3392704725265503, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7710374593734741, + "step": 705, + "token_acc": 0.7730310411592031 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 1.1777687072753906, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7353923916816711, + "step": 706, + "token_acc": 0.7839009776095869 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 10.78748893737793, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7313755750656128, + "step": 707, + "token_acc": 0.7793038863742782 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.7959760427474976, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8813682198524475, + "step": 708, + "token_acc": 0.7371300265360278 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 0.780621349811554, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8895928859710693, + "step": 709, + "token_acc": 0.7356559217024333 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 2.668718099594116, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.717865526676178, + "step": 710, + "token_acc": 0.7831172937085046 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 1.2820848226547241, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7374362945556641, + "step": 711, + "token_acc": 0.7759100253960576 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 1.9358655214309692, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8812097311019897, + "step": 712, + "token_acc": 0.7435395043423003 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 1.745857834815979, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.7244051694869995, + "step": 713, + "token_acc": 0.7779913161079081 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 3.7521867752075195, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9032388925552368, + "step": 714, + "token_acc": 0.7290010784039621 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 1.7055495977401733, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7481585144996643, + "step": 715, + "token_acc": 0.777170868347339 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 0.9156860113143921, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7256063222885132, + "step": 716, + "token_acc": 0.7821610365571494 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 1.2200286388397217, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.8634334206581116, + "step": 717, + "token_acc": 0.7441658887851713 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 1.2045998573303223, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7755439281463623, + "step": 718, + "token_acc": 0.7641643497065184 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.3511375188827515, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.7537750005722046, + "step": 719, + "token_acc": 0.7733905101358878 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 1.8665510416030884, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.6132658123970032, + "step": 720, + "token_acc": 0.8148300720906282 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 2.0403921604156494, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6217367053031921, + "step": 721, + "token_acc": 0.8100779115653142 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 0.9130368828773499, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8725777268409729, + "step": 722, + "token_acc": 0.7401973184922843 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 1.6816152334213257, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.821160614490509, + "step": 723, + "token_acc": 0.7509228532010888 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 1.0426051616668701, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7367508411407471, + "step": 724, + "token_acc": 0.7796639679637851 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 5.269510269165039, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7357650995254517, + "step": 725, + "token_acc": 0.7775466333818737 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 2.369504451751709, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7867926955223083, + "step": 726, + "token_acc": 0.7645618688156687 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.0830355882644653, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7860344648361206, + "step": 727, + "token_acc": 0.77024591593512 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 1.7200018167495728, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7187607288360596, + "step": 728, + "token_acc": 0.7883736120182887 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 1.1093928813934326, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.7947019934654236, + "step": 729, + "token_acc": 0.7565024903154399 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 3.5864369869232178, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.7369488477706909, + "step": 730, + "token_acc": 0.7861624969440143 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 1.4384573698043823, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8529449105262756, + "step": 731, + "token_acc": 0.7451984635083226 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 1.0439518690109253, + "learning_rate": 1.379848838328049e-06, + "loss": 0.7178291082382202, + "step": 732, + "token_acc": 0.7799321010939269 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 5.857388496398926, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7438476085662842, + "step": 733, + "token_acc": 0.7818851452734961 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 2.247035264968872, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8263076543807983, + "step": 734, + "token_acc": 0.7534708988947569 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.8630707263946533, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8856115341186523, + "step": 735, + "token_acc": 0.737244543305992 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 1.0327478647232056, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8134746551513672, + "step": 736, + "token_acc": 0.7548228013344292 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.5423094034194946, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6325390934944153, + "step": 737, + "token_acc": 0.8093323216995447 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 2.8762223720550537, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.6955031156539917, + "step": 738, + "token_acc": 0.7930338996198898 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 3.0213489532470703, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7289446592330933, + "step": 739, + "token_acc": 0.7758358662613982 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 0.8395518660545349, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.7442881464958191, + "step": 740, + "token_acc": 0.7756042787069322 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 0.9416394233703613, + "learning_rate": 1.041156686749717e-06, + "loss": 0.8054038286209106, + "step": 741, + "token_acc": 0.7603202943245144 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.5183863639831543, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.7220344543457031, + "step": 742, + "token_acc": 0.7839028916035256 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 2.2427620887756348, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8078048229217529, + "step": 743, + "token_acc": 0.7565702296819788 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 2.045294761657715, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6964831352233887, + "step": 744, + "token_acc": 0.7878059305838111 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 1.1594103574752808, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8750351667404175, + "step": 745, + "token_acc": 0.7404593114573162 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 1.434904932975769, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7638275623321533, + "step": 746, + "token_acc": 0.7692307692307693 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 3.405057907104492, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7193398475646973, + "step": 747, + "token_acc": 0.7806420567814669 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 0.7262636423110962, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8926572203636169, + "step": 748, + "token_acc": 0.7351848512173129 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 2.206441879272461, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8085426092147827, + "step": 749, + "token_acc": 0.7553703944798854 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 1.2215319871902466, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7416259050369263, + "step": 750, + "token_acc": 0.7799287594858293 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 1.1965488195419312, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7884664535522461, + "step": 751, + "token_acc": 0.7657542966263526 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 1.436772108078003, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6527396440505981, + "step": 752, + "token_acc": 0.7996812898387702 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 0.7072064280509949, + "learning_rate": 6.623969226072363e-07, + "loss": 0.9023393392562866, + "step": 753, + "token_acc": 0.7401707438459477 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 4.452742099761963, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8880629539489746, + "step": 754, + "token_acc": 0.7322737412364564 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.0246522426605225, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7470305562019348, + "step": 755, + "token_acc": 0.7724305041394629 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 1.336074709892273, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7636432647705078, + "step": 756, + "token_acc": 0.771588564692013 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 6.5312275886535645, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7831899523735046, + "step": 757, + "token_acc": 0.7635535636836779 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 1.6498327255249023, + "learning_rate": 5.294312162731934e-07, + "loss": 0.6954912543296814, + "step": 758, + "token_acc": 0.7876533742331289 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 1.4230884313583374, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7910645008087158, + "step": 759, + "token_acc": 0.7663237605372196 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 1.2716556787490845, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7857385277748108, + "step": 760, + "token_acc": 0.7617182793107603 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 3.85703706741333, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.740379810333252, + "step": 761, + "token_acc": 0.7729265967588179 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 1.468467354774475, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7387019991874695, + "step": 762, + "token_acc": 0.7750095334943434 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 1.6433247327804565, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.721135675907135, + "step": 763, + "token_acc": 0.7758144995597299 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 1.5427294969558716, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.6293338537216187, + "step": 764, + "token_acc": 0.8072302940167029 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 1.2883336544036865, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7614178657531738, + "step": 765, + "token_acc": 0.7687590187590188 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 2.724231243133545, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7500782608985901, + "step": 766, + "token_acc": 0.7765294194051175 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 3.1029133796691895, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8163322806358337, + "step": 767, + "token_acc": 0.7529584398371675 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 1.1530697345733643, + "learning_rate": 3.077914851215585e-07, + "loss": 0.729668140411377, + "step": 768, + "token_acc": 0.7845285524568393 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 3.2592809200286865, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.801484227180481, + "step": 769, + "token_acc": 0.760657514450867 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 18.562549591064453, + "learning_rate": 2.705872508804747e-07, + "loss": 0.6273467540740967, + "step": 770, + "token_acc": 0.8140587288817377 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 0.9975523352622986, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8133840560913086, + "step": 771, + "token_acc": 0.7572153325817362 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 1.3826740980148315, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6214898228645325, + "step": 772, + "token_acc": 0.8168546113572291 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 0.9996422529220581, + "learning_rate": 2.192509677903687e-07, + "loss": 0.7946609854698181, + "step": 773, + "token_acc": 0.7653636764922263 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 2.9878437519073486, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.8433146476745605, + "step": 774, + "token_acc": 0.7486024904583831 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 2.0441744327545166, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.762677788734436, + "step": 775, + "token_acc": 0.7752121679709026 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 5.5609130859375, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7419829368591309, + "step": 776, + "token_acc": 0.7775021264530763 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 1.5714855194091797, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.7751676440238953, + "step": 777, + "token_acc": 0.7671714112658995 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 1.8620251417160034, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6445480585098267, + "step": 778, + "token_acc": 0.8050112118553183 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 2.552483081817627, + "learning_rate": 1.327100431795125e-07, + "loss": 0.7001749873161316, + "step": 779, + "token_acc": 0.7868405963302753 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 0.9818560481071472, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.863308846950531, + "step": 780, + "token_acc": 0.7440897738547333 + }, + { + "epoch": 1.95369211514393, + "grad_norm": 1.462260365486145, + "learning_rate": 1.0865311416741742e-07, + "loss": 0.7859329581260681, + "step": 781, + "token_acc": 0.7583453331587904 + }, + { + "epoch": 1.9561952440550687, + "grad_norm": 1.250992774963379, + "learning_rate": 9.752416870782155e-08, + "loss": 0.7414909601211548, + "step": 782, + "token_acc": 0.7709643892566053 + }, + { + "epoch": 1.9586983729662077, + "grad_norm": 6.787116527557373, + "learning_rate": 8.699526497563393e-08, + "loss": 0.6183775663375854, + "step": 783, + "token_acc": 0.8110644876325088 + }, + { + "epoch": 1.9612015018773468, + "grad_norm": 4.071316719055176, + "learning_rate": 7.706665667180091e-08, + "loss": 0.7128624320030212, + "step": 784, + "token_acc": 0.7844099003923936 + }, + { + "epoch": 1.9637046307884856, + "grad_norm": 1.2956960201263428, + "learning_rate": 6.773858303274483e-08, + "loss": 0.7272385358810425, + "step": 785, + "token_acc": 0.7798172364896802 + }, + { + "epoch": 1.9662077596996246, + "grad_norm": 1.670897364616394, + "learning_rate": 5.90112688246075e-08, + "loss": 0.813774049282074, + "step": 786, + "token_acc": 0.7579287539455885 + }, + { + "epoch": 1.9687108886107634, + "grad_norm": 2.216273069381714, + "learning_rate": 5.088492433783509e-08, + "loss": 0.6288831233978271, + "step": 787, + "token_acc": 0.809070337544786 + }, + { + "epoch": 1.9712140175219024, + "grad_norm": 1.7803688049316406, + "learning_rate": 4.335974538210441e-08, + "loss": 0.7607427835464478, + "step": 788, + "token_acc": 0.7712011076497057 + }, + { + "epoch": 1.9737171464330414, + "grad_norm": 1.5490421056747437, + "learning_rate": 3.6435913281607225e-08, + "loss": 0.7704131007194519, + "step": 789, + "token_acc": 0.7674668577570763 + }, + { + "epoch": 1.9762202753441802, + "grad_norm": 1.32576322555542, + "learning_rate": 3.011359487068987e-08, + "loss": 0.7262879014015198, + "step": 790, + "token_acc": 0.7795837950991257 + }, + { + "epoch": 1.978723404255319, + "grad_norm": 1.8823463916778564, + "learning_rate": 2.439294248982038e-08, + "loss": 0.6787981986999512, + "step": 791, + "token_acc": 0.7932216905901116 + }, + { + "epoch": 1.981226533166458, + "grad_norm": 0.8526725769042969, + "learning_rate": 1.9274093981927478e-08, + "loss": 0.7767144441604614, + "step": 792, + "token_acc": 0.7686663361427863 + }, + { + "epoch": 1.983729662077597, + "grad_norm": 15.678997993469238, + "learning_rate": 1.4757172689067179e-08, + "loss": 0.8835920095443726, + "step": 793, + "token_acc": 0.7363509099393374 + }, + { + "epoch": 1.986232790988736, + "grad_norm": 1.0053060054779053, + "learning_rate": 1.0842287449469579e-08, + "loss": 0.8652770519256592, + "step": 794, + "token_acc": 0.7432256438264084 + }, + { + "epoch": 1.9887359198998749, + "grad_norm": 2.3136565685272217, + "learning_rate": 7.529532594893751e-09, + "loss": 0.6665161848068237, + "step": 795, + "token_acc": 0.8000482586664522 + }, + { + "epoch": 1.9912390488110137, + "grad_norm": 0.9834672212600708, + "learning_rate": 4.818987948379539e-09, + "loss": 0.8768296241760254, + "step": 796, + "token_acc": 0.7458358039997843 + }, + { + "epoch": 1.9937421777221527, + "grad_norm": 1.3067042827606201, + "learning_rate": 2.7107188222991188e-09, + "loss": 0.7597360014915466, + "step": 797, + "token_acc": 0.7740207747240857 + }, + { + "epoch": 1.9962453066332917, + "grad_norm": 1.6352840662002563, + "learning_rate": 1.2047760167999134e-09, + "loss": 0.7238999009132385, + "step": 798, + "token_acc": 0.7811499272197963 + }, + { + "epoch": 1.9987484355444305, + "grad_norm": 1.924922227859497, + "learning_rate": 3.01195818577793e-10, + "loss": 0.7451506853103638, + "step": 799, + "token_acc": 0.7774418298935192 + }, + { + "epoch": 2.0, + "grad_norm": 2.870347499847412, + "learning_rate": 0.0, + "loss": 0.8247795701026917, + "step": 800, + "token_acc": 0.7622437971952535 + }, + { + "epoch": 2.0, + "eval_loss": 0.5294203758239746, + "eval_runtime": 3.2005, + "eval_samples_per_second": 3.749, + "eval_steps_per_second": 0.625, + "eval_token_acc": 0.7607211144496039, + "step": 800 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 4.0005050001480745e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..0a5c0949b9e78863976a098788736c9e2fa4561c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70864e8baf48fd11f3bcc3f8c1a6bc83ff4a36f38843321e0e319388c62d18a5 +size 8977 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/logging.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/logging.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..4eb2dcbd509992e718be9758d5972b111efcc8b9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/logging.jsonl @@ -0,0 +1,803 @@ +{"loss": 1.45798242, "grad_norm": 2.96175361, "learning_rate": 3.1e-07, "token_acc": 0.65684193, "epoch": 0.00250313, "global_step/max_steps": "1/800", "percentage": "0.12%", "elapsed_time": "11s", "remaining_time": "2h 24m 16s", "memory(GiB)": 43.91, "train_speed(s/it)": 10.83395} +{"loss": 1.50499856, "grad_norm": 1.42377424, "learning_rate": 6.3e-07, "token_acc": 0.63650988, "epoch": 0.00500626, "global_step/max_steps": "2/800", "percentage": "0.25%", "elapsed_time": "24s", "remaining_time": "2h 36m 28s", "memory(GiB)": 43.91, "train_speed(s/it)": 11.764845} +{"loss": 1.48514628, "grad_norm": 1.59661031, "learning_rate": 9.4e-07, "token_acc": 0.646795, "epoch": 0.00750939, "global_step/max_steps": "3/800", "percentage": "0.38%", "elapsed_time": "37s", "remaining_time": "2h 44m 11s", "memory(GiB)": 43.91, "train_speed(s/it)": 12.359845} +{"loss": 1.4441644, "grad_norm": 1.45294428, "learning_rate": 1.25e-06, "token_acc": 0.65556747, "epoch": 0.01001252, "global_step/max_steps": "4/800", "percentage": "0.50%", "elapsed_time": "53s", "remaining_time": "2h 55m 15s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.209741} +{"loss": 1.48316634, "grad_norm": 2.16756082, "learning_rate": 1.56e-06, "token_acc": 0.63665774, "epoch": 0.01251564, "global_step/max_steps": "5/800", "percentage": "0.62%", "elapsed_time": "1m 5s", "remaining_time": "2h 53m 12s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.071075} +{"loss": 1.47213447, "grad_norm": 8.39833736, "learning_rate": 1.88e-06, "token_acc": 0.64244001, "epoch": 0.01501877, "global_step/max_steps": "6/800", "percentage": "0.75%", "elapsed_time": "1m 16s", "remaining_time": "2h 47m 56s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.689806} +{"loss": 1.45252717, "grad_norm": 3.0731256, "learning_rate": 2.19e-06, "token_acc": 0.65795135, "epoch": 0.0175219, "global_step/max_steps": "7/800", "percentage": "0.88%", "elapsed_time": "1m 27s", "remaining_time": "2h 43m 30s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.370468} +{"loss": 1.43817997, "grad_norm": 1.5642091, "learning_rate": 2.5e-06, "token_acc": 0.65110475, "epoch": 0.02002503, "global_step/max_steps": "8/800", "percentage": "1.00%", "elapsed_time": "1m 39s", "remaining_time": "2h 43m 24s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.378457} +{"loss": 1.54165626, "grad_norm": 2.81135297, "learning_rate": 2.81e-06, "token_acc": 0.61883088, "epoch": 0.02252816, "global_step/max_steps": "9/800", "percentage": "1.12%", "elapsed_time": "1m 59s", "remaining_time": "2h 53m 42s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.175916} +{"loss": 1.54178512, "grad_norm": 1.63613963, "learning_rate": 3.13e-06, "token_acc": 0.61777155, "epoch": 0.02503129, "global_step/max_steps": "10/800", "percentage": "1.25%", "elapsed_time": "2m 14s", "remaining_time": "2h 56m 8s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.37679} +{"loss": 1.51322699, "grad_norm": 12.02251816, "learning_rate": 3.44e-06, "token_acc": 0.62389782, "epoch": 0.02753442, "global_step/max_steps": "11/800", "percentage": "1.38%", "elapsed_time": "2m 40s", "remaining_time": "3h 11m 46s", "memory(GiB)": 48.09, "train_speed(s/it)": 14.58326} +{"loss": 1.46922767, "grad_norm": 2.66839409, "learning_rate": 3.75e-06, "token_acc": 0.6533487, "epoch": 0.03003755, "global_step/max_steps": "12/800", "percentage": "1.50%", "elapsed_time": "2m 51s", "remaining_time": "3h 6m 42s", "memory(GiB)": 48.09, "train_speed(s/it)": 14.21628} +{"loss": 1.49747682, "grad_norm": 7.97990179, "learning_rate": 4.06e-06, "token_acc": 0.63744144, "epoch": 0.03254068, "global_step/max_steps": "13/800", "percentage": "1.62%", "elapsed_time": "3m 5s", "remaining_time": "3h 6m 40s", "memory(GiB)": 48.09, "train_speed(s/it)": 14.231867} +{"loss": 1.46221066, "grad_norm": 3.23332357, "learning_rate": 4.37e-06, "token_acc": 0.66978231, "epoch": 0.0350438, "global_step/max_steps": "14/800", "percentage": "1.75%", "elapsed_time": "3m 11s", "remaining_time": "2h 58m 30s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.626429} +{"loss": 1.47751808, "grad_norm": 24.69153023, "learning_rate": 4.69e-06, "token_acc": 0.66816, "epoch": 0.03754693, "global_step/max_steps": "15/800", "percentage": "1.88%", "elapsed_time": "3m 18s", "remaining_time": "2h 52m 50s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.209597} +{"loss": 1.43571186, "grad_norm": 2.89784336, "learning_rate": 5e-06, "token_acc": 0.6778693, "epoch": 0.04005006, "global_step/max_steps": "16/800", "percentage": "2.00%", "elapsed_time": "3m 25s", "remaining_time": "2h 47m 20s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.805825} +{"loss": 1.51879835, "grad_norm": 19.82540512, "learning_rate": 5.31e-06, "token_acc": 0.63063216, "epoch": 0.04255319, "global_step/max_steps": "17/800", "percentage": "2.12%", "elapsed_time": "3m 35s", "remaining_time": "2h 45m 16s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.664694} +{"loss": 1.45589519, "grad_norm": 2.93292236, "learning_rate": 5.63e-06, "token_acc": 0.65122007, "epoch": 0.04505632, "global_step/max_steps": "18/800", "percentage": "2.25%", "elapsed_time": "3m 49s", "remaining_time": "2h 46m 2s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.739165} +{"loss": 1.42299354, "grad_norm": 1.63301837, "learning_rate": 5.94e-06, "token_acc": 0.66148863, "epoch": 0.04755945, "global_step/max_steps": "19/800", "percentage": "2.38%", "elapsed_time": "3m 60s", "remaining_time": "2h 44m 13s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.615548} +{"loss": 1.49822402, "grad_norm": 4.29809618, "learning_rate": 6.25e-06, "token_acc": 0.6452437, "epoch": 0.05006258, "global_step/max_steps": "20/800", "percentage": "2.50%", "elapsed_time": "4m 11s", "remaining_time": "2h 43m 27s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.572914} +{"loss": 1.51848674, "grad_norm": 1.3134824, "learning_rate": 6.56e-06, "token_acc": 0.63266438, "epoch": 0.05256571, "global_step/max_steps": "21/800", "percentage": "2.62%", "elapsed_time": "4m 31s", "remaining_time": "2h 47m 42s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.917106} +{"loss": 1.47271299, "grad_norm": 1.76573646, "learning_rate": 6.88e-06, "token_acc": 0.64836255, "epoch": 0.05506884, "global_step/max_steps": "22/800", "percentage": "2.75%", "elapsed_time": "4m 42s", "remaining_time": "2h 45m 59s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.801053} +{"loss": 1.45109713, "grad_norm": 1.45608258, "learning_rate": 7.19e-06, "token_acc": 0.6514202, "epoch": 0.05757196, "global_step/max_steps": "23/800", "percentage": "2.88%", "elapsed_time": "4m 52s", "remaining_time": "2h 44m 28s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.700554} +{"loss": 1.5022645, "grad_norm": 1.09191918, "learning_rate": 7.5e-06, "token_acc": 0.65322726, "epoch": 0.06007509, "global_step/max_steps": "24/800", "percentage": "3.00%", "elapsed_time": "4m 59s", "remaining_time": "2h 41m 14s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.467118} +{"loss": 1.47177529, "grad_norm": 2.74008417, "learning_rate": 7.81e-06, "token_acc": 0.63913768, "epoch": 0.06257822, "global_step/max_steps": "25/800", "percentage": "3.12%", "elapsed_time": "5m 9s", "remaining_time": "2h 39m 24s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.340741} +{"loss": 1.47211313, "grad_norm": 2.80752635, "learning_rate": 8.13e-06, "token_acc": 0.64093173, "epoch": 0.06508135, "global_step/max_steps": "26/800", "percentage": "3.25%", "elapsed_time": "5m 19s", "remaining_time": "2h 38m 2s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.250168} +{"loss": 1.50166845, "grad_norm": 1.54410934, "learning_rate": 8.44e-06, "token_acc": 0.64260812, "epoch": 0.06758448, "global_step/max_steps": "27/800", "percentage": "3.38%", "elapsed_time": "5m 26s", "remaining_time": "2h 35m 42s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.085809} +{"loss": 1.49546921, "grad_norm": 2.80637312, "learning_rate": 8.75e-06, "token_acc": 0.6546208, "epoch": 0.07008761, "global_step/max_steps": "28/800", "percentage": "3.50%", "elapsed_time": "5m 32s", "remaining_time": "2h 32m 45s", "memory(GiB)": 48.09, "train_speed(s/it)": 11.871135} +{"loss": 1.45204961, "grad_norm": 4.36266565, "learning_rate": 9.06e-06, "token_acc": 0.64186203, "epoch": 0.07259074, "global_step/max_steps": "29/800", "percentage": "3.62%", "elapsed_time": "5m 43s", "remaining_time": "2h 32m 5s", "memory(GiB)": 48.09, "train_speed(s/it)": 11.834768} +{"loss": 1.41152906, "grad_norm": 1.5149107, "learning_rate": 9.38e-06, "token_acc": 0.65182509, "epoch": 0.07509387, "global_step/max_steps": "30/800", "percentage": "3.75%", "elapsed_time": "6m 9s", "remaining_time": "2h 37m 49s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.297113} +{"loss": 1.42922425, "grad_norm": 2.17500949, "learning_rate": 9.69e-06, "token_acc": 0.64800929, "epoch": 0.077597, "global_step/max_steps": "31/800", "percentage": "3.88%", "elapsed_time": "6m 32s", "remaining_time": "2h 42m 10s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.652899} +{"loss": 1.44689417, "grad_norm": 2.17131662, "learning_rate": 1e-05, "token_acc": 0.634757, "epoch": 0.08010013, "global_step/max_steps": "32/800", "percentage": "4.00%", "elapsed_time": "6m 46s", "remaining_time": "2h 42m 33s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.699383} +{"loss": 1.45483255, "grad_norm": 1.60856235, "learning_rate": 1.031e-05, "token_acc": 0.63877503, "epoch": 0.08260325, "global_step/max_steps": "33/800", "percentage": "4.12%", "elapsed_time": "6m 57s", "remaining_time": "2h 41m 32s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.635807} +{"loss": 1.36369395, "grad_norm": 2.60197687, "learning_rate": 1.063e-05, "token_acc": 0.66940693, "epoch": 0.08510638, "global_step/max_steps": "34/800", "percentage": "4.25%", "elapsed_time": "7m 10s", "remaining_time": "2h 41m 18s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.633999} +{"loss": 1.37928009, "grad_norm": 1.71890187, "learning_rate": 1.094e-05, "token_acc": 0.66344057, "epoch": 0.08760951, "global_step/max_steps": "35/800", "percentage": "4.38%", "elapsed_time": "7m 19s", "remaining_time": "2h 39m 57s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.545279} +{"loss": 1.4181484, "grad_norm": 3.06910157, "learning_rate": 1.125e-05, "token_acc": 0.65286772, "epoch": 0.09011264, "global_step/max_steps": "36/800", "percentage": "4.50%", "elapsed_time": "7m 27s", "remaining_time": "2h 37m 56s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.403321} +{"loss": 1.48706424, "grad_norm": 0.97609234, "learning_rate": 1.156e-05, "token_acc": 0.63039663, "epoch": 0.09261577, "global_step/max_steps": "37/800", "percentage": "4.62%", "elapsed_time": "7m 38s", "remaining_time": "2h 37m 25s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.378305} +{"loss": 1.30904627, "grad_norm": 0.98021036, "learning_rate": 1.188e-05, "token_acc": 0.66652716, "epoch": 0.0951189, "global_step/max_steps": "38/800", "percentage": "4.75%", "elapsed_time": "8m 4s", "remaining_time": "2h 41m 54s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.748452} +{"loss": 1.42490745, "grad_norm": 4.3572073, "learning_rate": 1.219e-05, "token_acc": 0.63322618, "epoch": 0.09762203, "global_step/max_steps": "39/800", "percentage": "4.88%", "elapsed_time": "8m 31s", "remaining_time": "2h 46m 14s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.106109} +{"loss": 1.3373065, "grad_norm": 1.18614531, "learning_rate": 1.25e-05, "token_acc": 0.67253371, "epoch": 0.10012516, "global_step/max_steps": "40/800", "percentage": "5.00%", "elapsed_time": "8m 43s", "remaining_time": "2h 45m 40s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.079387} +{"loss": 1.34053135, "grad_norm": 5.26115847, "learning_rate": 1.281e-05, "token_acc": 0.66833641, "epoch": 0.10262829, "global_step/max_steps": "41/800", "percentage": "5.12%", "elapsed_time": "9m 3s", "remaining_time": "2h 47m 29s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.239946} +{"loss": 1.3322823, "grad_norm": 2.45829678, "learning_rate": 1.313e-05, "token_acc": 0.66758632, "epoch": 0.10513141, "global_step/max_steps": "42/800", "percentage": "5.25%", "elapsed_time": "9m 12s", "remaining_time": "2h 46m 11s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.154628} +{"loss": 1.34932506, "grad_norm": 2.05793333, "learning_rate": 1.344e-05, "token_acc": 0.66041397, "epoch": 0.10763454, "global_step/max_steps": "43/800", "percentage": "5.38%", "elapsed_time": "9m 25s", "remaining_time": "2h 45m 46s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.13919} +{"loss": 1.32497013, "grad_norm": 1.6432339, "learning_rate": 1.375e-05, "token_acc": 0.67450125, "epoch": 0.11013767, "global_step/max_steps": "44/800", "percentage": "5.50%", "elapsed_time": "9m 34s", "remaining_time": "2h 44m 29s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.054051} +{"loss": 1.34968209, "grad_norm": 1.0298692, "learning_rate": 1.406e-05, "token_acc": 0.65905458, "epoch": 0.1126408, "global_step/max_steps": "45/800", "percentage": "5.62%", "elapsed_time": "9m 45s", "remaining_time": "2h 43m 36s", "memory(GiB)": 48.09, "train_speed(s/it)": 13.001835} +{"loss": 1.30033648, "grad_norm": 1.38437092, "learning_rate": 1.437e-05, "token_acc": 0.6736928, "epoch": 0.11514393, "global_step/max_steps": "46/800", "percentage": "5.75%", "elapsed_time": "9m 55s", "remaining_time": "2h 42m 35s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.937835} +{"loss": 1.29559565, "grad_norm": 15.72964764, "learning_rate": 1.469e-05, "token_acc": 0.69041394, "epoch": 0.11764706, "global_step/max_steps": "47/800", "percentage": "5.88%", "elapsed_time": "10m 4s", "remaining_time": "2h 41m 18s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.853163} +{"loss": 1.32905674, "grad_norm": 1.21878874, "learning_rate": 1.5e-05, "token_acc": 0.66490023, "epoch": 0.12015019, "global_step/max_steps": "48/800", "percentage": "6.00%", "elapsed_time": "10m 13s", "remaining_time": "2h 39m 58s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.763505} +{"loss": 1.34664822, "grad_norm": 2.24136424, "learning_rate": 1.531e-05, "token_acc": 0.66087338, "epoch": 0.12265332, "global_step/max_steps": "49/800", "percentage": "6.12%", "elapsed_time": "10m 30s", "remaining_time": "2h 40m 50s", "memory(GiB)": 48.09, "train_speed(s/it)": 12.849161} +{"loss": 1.19715226, "grad_norm": 1.71298981, "learning_rate": 1.563e-05, "token_acc": 0.69570638, "epoch": 0.12515645, "global_step/max_steps": "50/800", "percentage": "6.25%", "elapsed_time": "10m 46s", "remaining_time": "2h 41m 33s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.923576} +{"loss": 1.33801508, "grad_norm": 12.90863419, "learning_rate": 1.594e-05, "token_acc": 0.66487648, "epoch": 0.12765957, "global_step/max_steps": "51/800", "percentage": "6.38%", "elapsed_time": "11m 6s", "remaining_time": "2h 43m 1s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.058368} +{"loss": 1.31842661, "grad_norm": 2.47441506, "learning_rate": 1.625e-05, "token_acc": 0.65419586, "epoch": 0.1301627, "global_step/max_steps": "52/800", "percentage": "6.50%", "elapsed_time": "11m 30s", "remaining_time": "2h 45m 32s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.278463} +{"loss": 1.34142911, "grad_norm": 1.50354803, "learning_rate": 1.656e-05, "token_acc": 0.66047071, "epoch": 0.13266583, "global_step/max_steps": "53/800", "percentage": "6.62%", "elapsed_time": "11m 40s", "remaining_time": "2h 44m 32s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.215333} +{"loss": 1.27102911, "grad_norm": 0.93838471, "learning_rate": 1.688e-05, "token_acc": 0.67168954, "epoch": 0.13516896, "global_step/max_steps": "54/800", "percentage": "6.75%", "elapsed_time": "11m 55s", "remaining_time": "2h 44m 37s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.240531} +{"loss": 1.32163537, "grad_norm": 0.80493975, "learning_rate": 1.719e-05, "token_acc": 0.65820272, "epoch": 0.13767209, "global_step/max_steps": "55/800", "percentage": "6.88%", "elapsed_time": "12m 11s", "remaining_time": "2h 44m 55s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.281937} +{"loss": 1.32943177, "grad_norm": 0.98696381, "learning_rate": 1.75e-05, "token_acc": 0.66076377, "epoch": 0.14017522, "global_step/max_steps": "56/800", "percentage": "7.00%", "elapsed_time": "12m 22s", "remaining_time": "2h 44m 17s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.248441} +{"loss": 1.21513069, "grad_norm": 3.62638855, "learning_rate": 1.781e-05, "token_acc": 0.68980557, "epoch": 0.14267835, "global_step/max_steps": "57/800", "percentage": "7.12%", "elapsed_time": "12m 31s", "remaining_time": "2h 43m 14s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.181558} +{"loss": 1.21648312, "grad_norm": 2.43373132, "learning_rate": 1.813e-05, "token_acc": 0.69465241, "epoch": 0.14518148, "global_step/max_steps": "58/800", "percentage": "7.25%", "elapsed_time": "12m 40s", "remaining_time": "2h 41m 58s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.096972} +{"loss": 1.20014799, "grad_norm": 1.24651957, "learning_rate": 1.844e-05, "token_acc": 0.69492916, "epoch": 0.14768461, "global_step/max_steps": "59/800", "percentage": "7.38%", "elapsed_time": "12m 51s", "remaining_time": "2h 41m 24s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.06882} +{"loss": 1.24685812, "grad_norm": 1.21170497, "learning_rate": 1.875e-05, "token_acc": 0.677346, "epoch": 0.15018773, "global_step/max_steps": "60/800", "percentage": "7.50%", "elapsed_time": "13m 2s", "remaining_time": "2h 40m 45s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.033968} +{"loss": 1.2663486, "grad_norm": 1.1252234, "learning_rate": 1.906e-05, "token_acc": 0.67311208, "epoch": 0.15269086, "global_step/max_steps": "61/800", "percentage": "7.62%", "elapsed_time": "13m 21s", "remaining_time": "2h 41m 43s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.129518} +{"loss": 1.2598896, "grad_norm": 0.68025804, "learning_rate": 1.937e-05, "token_acc": 0.67308063, "epoch": 0.15519399, "global_step/max_steps": "62/800", "percentage": "7.75%", "elapsed_time": "13m 34s", "remaining_time": "2h 41m 32s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.132291} +{"loss": 1.21668053, "grad_norm": 3.70245337, "learning_rate": 1.969e-05, "token_acc": 0.69132812, "epoch": 0.15769712, "global_step/max_steps": "63/800", "percentage": "7.88%", "elapsed_time": "13m 44s", "remaining_time": "2h 40m 42s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.082194} +{"loss": 1.23871481, "grad_norm": 53.1401329, "learning_rate": 2e-05, "token_acc": 0.67209971, "epoch": 0.16020025, "global_step/max_steps": "64/800", "percentage": "8.00%", "elapsed_time": "13m 57s", "remaining_time": "2h 40m 26s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.079072} +{"loss": 1.25459075, "grad_norm": 2.10268545, "learning_rate": 2.031e-05, "token_acc": 0.66586806, "epoch": 0.16270338, "global_step/max_steps": "65/800", "percentage": "8.12%", "elapsed_time": "14m 8s", "remaining_time": "2h 39m 51s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.049002} +{"loss": 1.24747562, "grad_norm": 1.54805052, "learning_rate": 2.062e-05, "token_acc": 0.67533358, "epoch": 0.16520651, "global_step/max_steps": "66/800", "percentage": "8.25%", "elapsed_time": "14m 28s", "remaining_time": "2h 40m 48s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.144895} +{"loss": 1.19037163, "grad_norm": 8.7951355, "learning_rate": 2.094e-05, "token_acc": 0.70951102, "epoch": 0.16770964, "global_step/max_steps": "67/800", "percentage": "8.38%", "elapsed_time": "14m 35s", "remaining_time": "2h 39m 32s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.058058} +{"loss": 1.25518453, "grad_norm": 1.67880094, "learning_rate": 2.125e-05, "token_acc": 0.67584451, "epoch": 0.17021277, "global_step/max_steps": "68/800", "percentage": "8.50%", "elapsed_time": "14m 48s", "remaining_time": "2h 39m 20s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.060197} +{"loss": 1.20323873, "grad_norm": 2.19444108, "learning_rate": 2.156e-05, "token_acc": 0.69074074, "epoch": 0.17271589, "global_step/max_steps": "69/800", "percentage": "8.62%", "elapsed_time": "14m 55s", "remaining_time": "2h 38m 6s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.976388} +{"loss": 1.19631886, "grad_norm": 1.12913561, "learning_rate": 2.187e-05, "token_acc": 0.68029866, "epoch": 0.17521902, "global_step/max_steps": "70/800", "percentage": "8.75%", "elapsed_time": "15m 8s", "remaining_time": "2h 37m 51s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.97399} +{"loss": 1.22781253, "grad_norm": 1.36702847, "learning_rate": 2.219e-05, "token_acc": 0.67089034, "epoch": 0.17772215, "global_step/max_steps": "71/800", "percentage": "8.88%", "elapsed_time": "15m 34s", "remaining_time": "2h 39m 51s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.156815} +{"loss": 1.21587694, "grad_norm": 2.75835466, "learning_rate": 2.25e-05, "token_acc": 0.68675056, "epoch": 0.18022528, "global_step/max_steps": "72/800", "percentage": "9.00%", "elapsed_time": "15m 43s", "remaining_time": "2h 38m 53s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.094792} +{"loss": 1.07449818, "grad_norm": 2.62266254, "learning_rate": 2.281e-05, "token_acc": 0.71891717, "epoch": 0.18272841, "global_step/max_steps": "73/800", "percentage": "9.12%", "elapsed_time": "15m 56s", "remaining_time": "2h 38m 40s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.095035} +{"loss": 1.18317366, "grad_norm": 5.09231472, "learning_rate": 2.313e-05, "token_acc": 0.69373966, "epoch": 0.18523154, "global_step/max_steps": "74/800", "percentage": "9.25%", "elapsed_time": "16m 5s", "remaining_time": "2h 37m 48s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.040933} +{"loss": 1.16960883, "grad_norm": 1.61922836, "learning_rate": 2.344e-05, "token_acc": 0.69221642, "epoch": 0.18773467, "global_step/max_steps": "75/800", "percentage": "9.38%", "elapsed_time": "16m 16s", "remaining_time": "2h 37m 12s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.010337} +{"loss": 1.02431059, "grad_norm": 1.98942053, "learning_rate": 2.375e-05, "token_acc": 0.7350317, "epoch": 0.1902378, "global_step/max_steps": "76/800", "percentage": "9.50%", "elapsed_time": "16m 22s", "remaining_time": "2h 35m 54s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.920318} +{"loss": 1.17939234, "grad_norm": 5.02670002, "learning_rate": 2.406e-05, "token_acc": 0.68891196, "epoch": 0.19274093, "global_step/max_steps": "77/800", "percentage": "9.62%", "elapsed_time": "16m 34s", "remaining_time": "2h 35m 37s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.914539} +{"loss": 1.20315778, "grad_norm": 0.98514587, "learning_rate": 2.437e-05, "token_acc": 0.67984398, "epoch": 0.19524406, "global_step/max_steps": "78/800", "percentage": "9.75%", "elapsed_time": "16m 45s", "remaining_time": "2h 35m 7s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.890163} +{"loss": 1.2100966, "grad_norm": 1.49352729, "learning_rate": 2.469e-05, "token_acc": 0.67593765, "epoch": 0.19774718, "global_step/max_steps": "79/800", "percentage": "9.88%", "elapsed_time": "16m 59s", "remaining_time": "2h 34m 56s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.893282} +{"loss": 1.21824336, "grad_norm": 2.02706099, "learning_rate": 2.5e-05, "token_acc": 0.67245904, "epoch": 0.20025031, "global_step/max_steps": "80/800", "percentage": "10.00%", "elapsed_time": "17m 14s", "remaining_time": "2h 35m 6s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.924985} +{"loss": 1.15992367, "grad_norm": 2.17170358, "learning_rate": 2.531e-05, "token_acc": 0.68969679, "epoch": 0.20275344, "global_step/max_steps": "81/800", "percentage": "10.12%", "elapsed_time": "17m 39s", "remaining_time": "2h 36m 37s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.069463} +{"loss": 1.24696994, "grad_norm": 1.39191532, "learning_rate": 2.562e-05, "token_acc": 0.66070234, "epoch": 0.20525657, "global_step/max_steps": "82/800", "percentage": "10.25%", "elapsed_time": "18m 8s", "remaining_time": "2h 38m 49s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.271579} +{"loss": 1.09059966, "grad_norm": 5.72646904, "learning_rate": 2.594e-05, "token_acc": 0.70547729, "epoch": 0.2077597, "global_step/max_steps": "83/800", "percentage": "10.38%", "elapsed_time": "18m 24s", "remaining_time": "2h 38m 55s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.298} +{"loss": 1.16313601, "grad_norm": 2.48006868, "learning_rate": 2.625e-05, "token_acc": 0.69293834, "epoch": 0.21026283, "global_step/max_steps": "84/800", "percentage": "10.50%", "elapsed_time": "18m 36s", "remaining_time": "2h 38m 30s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.282251} +{"loss": 1.03510845, "grad_norm": 1.39075303, "learning_rate": 2.656e-05, "token_acc": 0.72560652, "epoch": 0.21276596, "global_step/max_steps": "85/800", "percentage": "10.62%", "elapsed_time": "18m 45s", "remaining_time": "2h 37m 41s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.231767} +{"loss": 1.16981685, "grad_norm": 4.0239687, "learning_rate": 2.687e-05, "token_acc": 0.69150175, "epoch": 0.21526909, "global_step/max_steps": "86/800", "percentage": "10.75%", "elapsed_time": "18m 54s", "remaining_time": "2h 36m 54s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.18553} +{"loss": 1.09651625, "grad_norm": 2.4343586, "learning_rate": 2.719e-05, "token_acc": 0.7119186, "epoch": 0.21777222, "global_step/max_steps": "87/800", "percentage": "10.88%", "elapsed_time": "19m 1s", "remaining_time": "2h 35m 51s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.11463} +{"loss": 1.08840024, "grad_norm": 1.85003364, "learning_rate": 2.75e-05, "token_acc": 0.70456225, "epoch": 0.22027534, "global_step/max_steps": "88/800", "percentage": "11.00%", "elapsed_time": "19m 10s", "remaining_time": "2h 35m 5s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.069324} +{"loss": 1.18247902, "grad_norm": 3.22686839, "learning_rate": 2.781e-05, "token_acc": 0.68516172, "epoch": 0.22277847, "global_step/max_steps": "89/800", "percentage": "11.12%", "elapsed_time": "19m 20s", "remaining_time": "2h 34m 26s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.032268} +{"loss": 0.97101307, "grad_norm": 16.24308777, "learning_rate": 2.813e-05, "token_acc": 0.73616842, "epoch": 0.2252816, "global_step/max_steps": "90/800", "percentage": "11.25%", "elapsed_time": "19m 27s", "remaining_time": "2h 33m 28s", "memory(GiB)": 69.57, "train_speed(s/it)": 12.969269} +{"loss": 1.06001079, "grad_norm": 2.57432079, "learning_rate": 2.844e-05, "token_acc": 0.71343519, "epoch": 0.22778473, "global_step/max_steps": "91/800", "percentage": "11.38%", "elapsed_time": "19m 47s", "remaining_time": "2h 34m 7s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.042575} +{"loss": 1.15006161, "grad_norm": 2.02036381, "learning_rate": 2.875e-05, "token_acc": 0.68822687, "epoch": 0.23028786, "global_step/max_steps": "92/800", "percentage": "11.50%", "elapsed_time": "19m 59s", "remaining_time": "2h 33m 43s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.027362} +{"loss": 1.00459731, "grad_norm": 1.11123145, "learning_rate": 2.906e-05, "token_acc": 0.72730072, "epoch": 0.23279099, "global_step/max_steps": "93/800", "percentage": "11.62%", "elapsed_time": "20m 14s", "remaining_time": "2h 33m 48s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.052035} +{"loss": 1.16666389, "grad_norm": 2.55392361, "learning_rate": 2.938e-05, "token_acc": 0.68646434, "epoch": 0.23529412, "global_step/max_steps": "94/800", "percentage": "11.75%", "elapsed_time": "20m 28s", "remaining_time": "2h 33m 40s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.059992} +{"loss": 1.08086729, "grad_norm": 2.16631484, "learning_rate": 2.969e-05, "token_acc": 0.69564594, "epoch": 0.23779725, "global_step/max_steps": "95/800", "percentage": "11.88%", "elapsed_time": "20m 44s", "remaining_time": "2h 33m 53s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.096751} +{"loss": 0.99290133, "grad_norm": 1.94980717, "learning_rate": 3e-05, "token_acc": 0.7389739, "epoch": 0.24030038, "global_step/max_steps": "96/800", "percentage": "12.00%", "elapsed_time": "20m 58s", "remaining_time": "2h 33m 42s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.099998} +{"loss": 1.12227273, "grad_norm": 4.30337906, "learning_rate": 3.031e-05, "token_acc": 0.6888467, "epoch": 0.2428035, "global_step/max_steps": "97/800", "percentage": "12.12%", "elapsed_time": "21m 11s", "remaining_time": "2h 33m 34s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.106573} +{"loss": 1.1498996, "grad_norm": 4.01009035, "learning_rate": 3.063e-05, "token_acc": 0.68805533, "epoch": 0.24530663, "global_step/max_steps": "98/800", "percentage": "12.25%", "elapsed_time": "21m 20s", "remaining_time": "2h 32m 51s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.06345} +{"loss": 1.05063868, "grad_norm": 1.82865477, "learning_rate": 3.094e-05, "token_acc": 0.71264145, "epoch": 0.24780976, "global_step/max_steps": "99/800", "percentage": "12.38%", "elapsed_time": "21m 31s", "remaining_time": "2h 32m 22s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.041139} +{"loss": 1.05102468, "grad_norm": 2.41454577, "learning_rate": 3.125e-05, "token_acc": 0.71171775, "epoch": 0.25031289, "global_step/max_steps": "100/800", "percentage": "12.50%", "elapsed_time": "21m 45s", "remaining_time": "2h 32m 12s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.045935} +{"loss": 1.10530317, "grad_norm": 35.13666534, "learning_rate": 3.156e-05, "token_acc": 0.69778855, "epoch": 0.25281602, "global_step/max_steps": "101/800", "percentage": "12.62%", "elapsed_time": "22m 6s", "remaining_time": "2h 32m 57s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.129108} +{"loss": 1.09452796, "grad_norm": 1.94857502, "learning_rate": 3.188e-05, "token_acc": 0.70031083, "epoch": 0.25531915, "global_step/max_steps": "102/800", "percentage": "12.75%", "elapsed_time": "22m 16s", "remaining_time": "2h 32m 21s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.096134} +{"loss": 1.06823039, "grad_norm": 3.34633398, "learning_rate": 3.219e-05, "token_acc": 0.70307429, "epoch": 0.25782228, "global_step/max_steps": "103/800", "percentage": "12.88%", "elapsed_time": "22m 31s", "remaining_time": "2h 32m 20s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.113096} +{"loss": 1.00143456, "grad_norm": 2.55633616, "learning_rate": 3.25e-05, "token_acc": 0.72186306, "epoch": 0.26032541, "global_step/max_steps": "104/800", "percentage": "13.00%", "elapsed_time": "22m 41s", "remaining_time": "2h 31m 47s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.084318} +{"loss": 1.0632515, "grad_norm": 1.63623774, "learning_rate": 3.281e-05, "token_acc": 0.71177525, "epoch": 0.26282854, "global_step/max_steps": "105/800", "percentage": "13.12%", "elapsed_time": "22m 53s", "remaining_time": "2h 31m 30s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.078457} +{"loss": 1.12767124, "grad_norm": 2.21737123, "learning_rate": 3.312e-05, "token_acc": 0.68657075, "epoch": 0.26533166, "global_step/max_steps": "106/800", "percentage": "13.25%", "elapsed_time": "23m 10s", "remaining_time": "2h 31m 41s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.114436} +{"loss": 1.04738247, "grad_norm": 2.12829804, "learning_rate": 3.344e-05, "token_acc": 0.71262878, "epoch": 0.26783479, "global_step/max_steps": "107/800", "percentage": "13.38%", "elapsed_time": "23m 20s", "remaining_time": "2h 31m 4s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.079731} +{"loss": 0.98048747, "grad_norm": 1.54338861, "learning_rate": 3.375e-05, "token_acc": 0.72382024, "epoch": 0.27033792, "global_step/max_steps": "108/800", "percentage": "13.50%", "elapsed_time": "23m 33s", "remaining_time": "2h 30m 52s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.080538} +{"loss": 1.07984054, "grad_norm": 6.60252523, "learning_rate": 3.406e-05, "token_acc": 0.69137839, "epoch": 0.27284105, "global_step/max_steps": "109/800", "percentage": "13.63%", "elapsed_time": "23m 51s", "remaining_time": "2h 31m 9s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.124424} +{"loss": 1.08549905, "grad_norm": 1.55194092, "learning_rate": 3.438e-05, "token_acc": 0.70734252, "epoch": 0.27534418, "global_step/max_steps": "110/800", "percentage": "13.75%", "elapsed_time": "24m 3s", "remaining_time": "2h 30m 50s", "memory(GiB)": 69.57, "train_speed(s/it)": 13.116611} +{"loss": 1.0851028, "grad_norm": 1.30378914, "learning_rate": 3.469e-05, "token_acc": 0.70526216, "epoch": 0.27784731, "global_step/max_steps": "111/800", "percentage": "13.88%", "elapsed_time": "24m 28s", "remaining_time": "2h 31m 54s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.22794} +{"loss": 0.9681502, "grad_norm": 1.38878727, "learning_rate": 3.5e-05, "token_acc": 0.73002884, "epoch": 0.28035044, "global_step/max_steps": "112/800", "percentage": "14.00%", "elapsed_time": "24m 41s", "remaining_time": "2h 31m 40s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.227331} +{"loss": 1.03067827, "grad_norm": 2.44160342, "learning_rate": 3.531e-05, "token_acc": 0.717606, "epoch": 0.28285357, "global_step/max_steps": "113/800", "percentage": "14.12%", "elapsed_time": "24m 55s", "remaining_time": "2h 31m 27s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.226582} +{"loss": 1.01555681, "grad_norm": 1.41058862, "learning_rate": 3.563e-05, "token_acc": 0.71660267, "epoch": 0.2853567, "global_step/max_steps": "114/800", "percentage": "14.25%", "elapsed_time": "25m 4s", "remaining_time": "2h 30m 53s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.197009} +{"loss": 1.13171768, "grad_norm": 3.65273523, "learning_rate": 3.594e-05, "token_acc": 0.68720619, "epoch": 0.28785982, "global_step/max_steps": "115/800", "percentage": "14.37%", "elapsed_time": "25m 24s", "remaining_time": "2h 31m 19s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.253746} +{"loss": 1.044788, "grad_norm": 1.85533702, "learning_rate": 3.625e-05, "token_acc": 0.71001112, "epoch": 0.29036295, "global_step/max_steps": "116/800", "percentage": "14.50%", "elapsed_time": "25m 39s", "remaining_time": "2h 31m 12s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.263105} +{"loss": 0.89884287, "grad_norm": 2.27493286, "learning_rate": 3.656e-05, "token_acc": 0.75946459, "epoch": 0.29286608, "global_step/max_steps": "117/800", "percentage": "14.62%", "elapsed_time": "25m 45s", "remaining_time": "2h 30m 22s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.208677} +{"loss": 1.08726919, "grad_norm": 1.75944889, "learning_rate": 3.688e-05, "token_acc": 0.7017733, "epoch": 0.29536921, "global_step/max_steps": "118/800", "percentage": "14.75%", "elapsed_time": "25m 56s", "remaining_time": "2h 29m 51s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.182762} +{"loss": 1.07525814, "grad_norm": 3.43308258, "learning_rate": 3.719e-05, "token_acc": 0.70166981, "epoch": 0.29787234, "global_step/max_steps": "119/800", "percentage": "14.88%", "elapsed_time": "26m 14s", "remaining_time": "2h 30m 6s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.225313} +{"loss": 0.99121475, "grad_norm": 4.46618271, "learning_rate": 3.75e-05, "token_acc": 0.7193773, "epoch": 0.30037547, "global_step/max_steps": "120/800", "percentage": "15.00%", "elapsed_time": "26m 22s", "remaining_time": "2h 29m 27s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.186643} +{"loss": 1.01873755, "grad_norm": 1.50491154, "learning_rate": 3.781e-05, "token_acc": 0.7152019, "epoch": 0.3028786, "global_step/max_steps": "121/800", "percentage": "15.12%", "elapsed_time": "26m 45s", "remaining_time": "2h 30m 5s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.262614} +{"loss": 0.98460633, "grad_norm": 3.39452028, "learning_rate": 3.812e-05, "token_acc": 0.72390546, "epoch": 0.30538173, "global_step/max_steps": "122/800", "percentage": "15.25%", "elapsed_time": "26m 52s", "remaining_time": "2h 29m 19s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.213752} +{"loss": 1.08590579, "grad_norm": 1.53775358, "learning_rate": 3.844e-05, "token_acc": 0.6980309, "epoch": 0.30788486, "global_step/max_steps": "123/800", "percentage": "15.38%", "elapsed_time": "27m 8s", "remaining_time": "2h 29m 22s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.238551} +{"loss": 1.03176248, "grad_norm": 2.69638562, "learning_rate": 3.875e-05, "token_acc": 0.71188831, "epoch": 0.31038798, "global_step/max_steps": "124/800", "percentage": "15.50%", "elapsed_time": "27m 15s", "remaining_time": "2h 28m 34s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.186776} +{"loss": 0.91962087, "grad_norm": 2.0614717, "learning_rate": 3.906e-05, "token_acc": 0.74089772, "epoch": 0.31289111, "global_step/max_steps": "125/800", "percentage": "15.62%", "elapsed_time": "27m 26s", "remaining_time": "2h 28m 9s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.16954} +{"loss": 0.90857279, "grad_norm": 1.19095337, "learning_rate": 3.938e-05, "token_acc": 0.74478683, "epoch": 0.31539424, "global_step/max_steps": "126/800", "percentage": "15.75%", "elapsed_time": "27m 35s", "remaining_time": "2h 27m 33s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.134421} +{"loss": 0.87751788, "grad_norm": 2.97671223, "learning_rate": 3.969e-05, "token_acc": 0.75853211, "epoch": 0.31789737, "global_step/max_steps": "127/800", "percentage": "15.88%", "elapsed_time": "27m 41s", "remaining_time": "2h 26m 43s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.079866} +{"loss": 1.00488591, "grad_norm": 3.03793335, "learning_rate": 4e-05, "token_acc": 0.71404716, "epoch": 0.3204005, "global_step/max_steps": "128/800", "percentage": "16.00%", "elapsed_time": "27m 50s", "remaining_time": "2h 26m 6s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.045062} +{"loss": 0.99853158, "grad_norm": 5.83064842, "learning_rate": 4.031e-05, "token_acc": 0.72060403, "epoch": 0.32290363, "global_step/max_steps": "129/800", "percentage": "16.12%", "elapsed_time": "27m 58s", "remaining_time": "2h 25m 28s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.007522} +{"loss": 0.98255193, "grad_norm": 1.31432581, "learning_rate": 4.063e-05, "token_acc": 0.7247136, "epoch": 0.32540676, "global_step/max_steps": "130/800", "percentage": "16.25%", "elapsed_time": "28m 10s", "remaining_time": "2h 25m 8s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.996958} +{"loss": 0.87584144, "grad_norm": 2.45360494, "learning_rate": 4.094e-05, "token_acc": 0.76116052, "epoch": 0.32790989, "global_step/max_steps": "131/800", "percentage": "16.38%", "elapsed_time": "28m 30s", "remaining_time": "2h 25m 35s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.057202} +{"loss": 0.97720474, "grad_norm": 3.18399763, "learning_rate": 4.125e-05, "token_acc": 0.7228665, "epoch": 0.33041302, "global_step/max_steps": "132/800", "percentage": "16.50%", "elapsed_time": "28m 44s", "remaining_time": "2h 25m 22s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.057215} +{"loss": 1.02167487, "grad_norm": 1.65365124, "learning_rate": 4.156e-05, "token_acc": 0.71066228, "epoch": 0.33291615, "global_step/max_steps": "133/800", "percentage": "16.62%", "elapsed_time": "29m 2s", "remaining_time": "2h 25m 37s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.09889} +{"loss": 0.95261407, "grad_norm": 1.10301626, "learning_rate": 4.188e-05, "token_acc": 0.73398045, "epoch": 0.33541927, "global_step/max_steps": "134/800", "percentage": "16.75%", "elapsed_time": "29m 10s", "remaining_time": "2h 24m 56s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.056535} +{"loss": 0.87919891, "grad_norm": 4.92834997, "learning_rate": 4.219e-05, "token_acc": 0.75511603, "epoch": 0.3379224, "global_step/max_steps": "135/800", "percentage": "16.88%", "elapsed_time": "29m 19s", "remaining_time": "2h 24m 23s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.02684} +{"loss": 1.06532681, "grad_norm": 0.78313881, "learning_rate": 4.25e-05, "token_acc": 0.70191864, "epoch": 0.34042553, "global_step/max_steps": "136/800", "percentage": "17.00%", "elapsed_time": "29m 35s", "remaining_time": "2h 24m 24s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.048727} +{"loss": 1.00787199, "grad_norm": 1.97573185, "learning_rate": 4.281e-05, "token_acc": 0.71672373, "epoch": 0.34292866, "global_step/max_steps": "137/800", "percentage": "17.12%", "elapsed_time": "29m 48s", "remaining_time": "2h 24m 14s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.053197} +{"loss": 0.83632898, "grad_norm": 4.61329079, "learning_rate": 4.313e-05, "token_acc": 0.77497722, "epoch": 0.34543179, "global_step/max_steps": "138/800", "percentage": "17.25%", "elapsed_time": "29m 58s", "remaining_time": "2h 23m 45s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.029431} +{"loss": 0.95506448, "grad_norm": 1.62649989, "learning_rate": 4.344e-05, "token_acc": 0.73290515, "epoch": 0.34793492, "global_step/max_steps": "139/800", "percentage": "17.38%", "elapsed_time": "30m 7s", "remaining_time": "2h 23m 14s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.001253} +{"loss": 0.89220434, "grad_norm": 7.68024206, "learning_rate": 4.375e-05, "token_acc": 0.74938794, "epoch": 0.35043805, "global_step/max_steps": "140/800", "percentage": "17.50%", "elapsed_time": "30m 17s", "remaining_time": "2h 22m 47s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.980912} +{"loss": 0.89376765, "grad_norm": 5.44719362, "learning_rate": 4.406e-05, "token_acc": 0.74553102, "epoch": 0.35294118, "global_step/max_steps": "141/800", "percentage": "17.62%", "elapsed_time": "30m 38s", "remaining_time": "2h 23m 10s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.035291} +{"loss": 1.03037083, "grad_norm": 2.56171131, "learning_rate": 4.438e-05, "token_acc": 0.71208497, "epoch": 0.35544431, "global_step/max_steps": "142/800", "percentage": "17.75%", "elapsed_time": "30m 57s", "remaining_time": "2h 23m 25s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.077838} +{"loss": 0.88351458, "grad_norm": 2.33022833, "learning_rate": 4.469e-05, "token_acc": 0.75734553, "epoch": 0.35794743, "global_step/max_steps": "143/800", "percentage": "17.88%", "elapsed_time": "31m 7s", "remaining_time": "2h 22m 56s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.053828} +{"loss": 0.95549947, "grad_norm": 3.30428267, "learning_rate": 4.5e-05, "token_acc": 0.7331631, "epoch": 0.36045056, "global_step/max_steps": "144/800", "percentage": "18.00%", "elapsed_time": "31m 19s", "remaining_time": "2h 22m 42s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.051605} +{"loss": 0.93458724, "grad_norm": 1.90315235, "learning_rate": 4.531e-05, "token_acc": 0.73186922, "epoch": 0.36295369, "global_step/max_steps": "145/800", "percentage": "18.12%", "elapsed_time": "31m 29s", "remaining_time": "2h 22m 13s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.027419} +{"loss": 0.92598009, "grad_norm": 1.08976471, "learning_rate": 4.562e-05, "token_acc": 0.73442239, "epoch": 0.36545682, "global_step/max_steps": "146/800", "percentage": "18.25%", "elapsed_time": "31m 45s", "remaining_time": "2h 22m 13s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.048041} +{"loss": 0.84774393, "grad_norm": 1.89213443, "learning_rate": 4.594e-05, "token_acc": 0.75506769, "epoch": 0.36795995, "global_step/max_steps": "147/800", "percentage": "18.38%", "elapsed_time": "31m 54s", "remaining_time": "2h 21m 41s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.018061} +{"loss": 0.9269802, "grad_norm": 1.99536586, "learning_rate": 4.625e-05, "token_acc": 0.73903211, "epoch": 0.37046308, "global_step/max_steps": "148/800", "percentage": "18.50%", "elapsed_time": "32m 2s", "remaining_time": "2h 21m 6s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.985326} +{"loss": 1.04057407, "grad_norm": 0.9676795, "learning_rate": 4.656e-05, "token_acc": 0.70377168, "epoch": 0.37296621, "global_step/max_steps": "149/800", "percentage": "18.62%", "elapsed_time": "32m 15s", "remaining_time": "2h 20m 53s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.984127} +{"loss": 0.97011304, "grad_norm": 1.34890306, "learning_rate": 4.688e-05, "token_acc": 0.72216448, "epoch": 0.37546934, "global_step/max_steps": "150/800", "percentage": "18.75%", "elapsed_time": "32m 27s", "remaining_time": "2h 20m 38s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.980822} +{"loss": 1.02377236, "grad_norm": 1.89062786, "learning_rate": 4.719e-05, "token_acc": 0.7124021, "epoch": 0.37797247, "global_step/max_steps": "151/800", "percentage": "18.88%", "elapsed_time": "32m 47s", "remaining_time": "2h 20m 55s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.028129} +{"loss": 0.86092412, "grad_norm": 1.40734231, "learning_rate": 4.75e-05, "token_acc": 0.75218679, "epoch": 0.38047559, "global_step/max_steps": "152/800", "percentage": "19.00%", "elapsed_time": "33m 0s", "remaining_time": "2h 20m 43s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.028963} +{"loss": 1.01696348, "grad_norm": 1.78920543, "learning_rate": 4.781e-05, "token_acc": 0.71099007, "epoch": 0.38297872, "global_step/max_steps": "153/800", "percentage": "19.12%", "elapsed_time": "33m 17s", "remaining_time": "2h 20m 46s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.054041} +{"loss": 0.88398695, "grad_norm": 5.22275925, "learning_rate": 4.813e-05, "token_acc": 0.74996117, "epoch": 0.38548185, "global_step/max_steps": "154/800", "percentage": "19.25%", "elapsed_time": "33m 25s", "remaining_time": "2h 20m 10s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.019233} +{"loss": 0.98471916, "grad_norm": 47.99449921, "learning_rate": 4.844e-05, "token_acc": 0.72067568, "epoch": 0.38798498, "global_step/max_steps": "155/800", "percentage": "19.38%", "elapsed_time": "33m 38s", "remaining_time": "2h 19m 58s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.020795} +{"loss": 0.8897121, "grad_norm": 2.15423465, "learning_rate": 4.875e-05, "token_acc": 0.74618349, "epoch": 0.39048811, "global_step/max_steps": "156/800", "percentage": "19.50%", "elapsed_time": "33m 48s", "remaining_time": "2h 19m 32s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.999577} +{"loss": 0.95859045, "grad_norm": 1.67777109, "learning_rate": 4.906e-05, "token_acc": 0.72642053, "epoch": 0.39299124, "global_step/max_steps": "157/800", "percentage": "19.62%", "elapsed_time": "33m 58s", "remaining_time": "2h 19m 6s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.979968} +{"loss": 0.8516196, "grad_norm": 1.63333762, "learning_rate": 4.938e-05, "token_acc": 0.75412201, "epoch": 0.39549437, "global_step/max_steps": "158/800", "percentage": "19.75%", "elapsed_time": "34m 11s", "remaining_time": "2h 18m 54s", "memory(GiB)": 74.69, "train_speed(s/it)": 12.981033} +{"loss": 0.8823418, "grad_norm": 1.34643769, "learning_rate": 4.969e-05, "token_acc": 0.75211515, "epoch": 0.3979975, "global_step/max_steps": "159/800", "percentage": "19.88%", "elapsed_time": "34m 30s", "remaining_time": "2h 19m 7s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.021279} +{"loss": 0.93689525, "grad_norm": 3.70896673, "learning_rate": 5e-05, "token_acc": 0.73023666, "epoch": 0.40050063, "global_step/max_steps": "160/800", "percentage": "20.00%", "elapsed_time": "34m 45s", "remaining_time": "2h 19m 1s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.033378} +{"loss": 0.87215412, "grad_norm": 1.94718552, "learning_rate": 5e-05, "token_acc": 0.75942029, "epoch": 0.40300375, "global_step/max_steps": "161/800", "percentage": "20.12%", "elapsed_time": "35m 3s", "remaining_time": "2h 19m 6s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.061798} +{"loss": 0.87527812, "grad_norm": 2.12553811, "learning_rate": 5e-05, "token_acc": 0.74852614, "epoch": 0.40550688, "global_step/max_steps": "162/800", "percentage": "20.25%", "elapsed_time": "35m 12s", "remaining_time": "2h 18m 38s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.037664} +{"loss": 0.84588361, "grad_norm": 1.0908252, "learning_rate": 5e-05, "token_acc": 0.75503971, "epoch": 0.40801001, "global_step/max_steps": "163/800", "percentage": "20.38%", "elapsed_time": "35m 30s", "remaining_time": "2h 18m 45s", "memory(GiB)": 74.69, "train_speed(s/it)": 13.0698} +{"loss": 1.02901208, "grad_norm": 1.62981439, "learning_rate": 5e-05, "token_acc": 0.70653294, "epoch": 0.41051314, "global_step/max_steps": "164/800", "percentage": "20.50%", "elapsed_time": "35m 48s", "remaining_time": "2h 18m 50s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.097901} +{"loss": 0.92665398, "grad_norm": 1.51106215, "learning_rate": 4.999e-05, "token_acc": 0.73347301, "epoch": 0.41301627, "global_step/max_steps": "165/800", "percentage": "20.62%", "elapsed_time": "36m 5s", "remaining_time": "2h 18m 51s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.119604} +{"loss": 0.94878972, "grad_norm": 1.32981503, "learning_rate": 4.999e-05, "token_acc": 0.72445587, "epoch": 0.4155194, "global_step/max_steps": "166/800", "percentage": "20.75%", "elapsed_time": "36m 17s", "remaining_time": "2h 18m 34s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.113622} +{"loss": 0.86361372, "grad_norm": 1.42128074, "learning_rate": 4.999e-05, "token_acc": 0.75104248, "epoch": 0.41802253, "global_step/max_steps": "167/800", "percentage": "20.88%", "elapsed_time": "36m 27s", "remaining_time": "2h 18m 10s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.096425} +{"loss": 0.94459122, "grad_norm": 1.18235612, "learning_rate": 4.998e-05, "token_acc": 0.72794937, "epoch": 0.42052566, "global_step/max_steps": "168/800", "percentage": "21.00%", "elapsed_time": "36m 39s", "remaining_time": "2h 17m 51s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.087221} +{"loss": 0.78656185, "grad_norm": 3.80066347, "learning_rate": 4.998e-05, "token_acc": 0.7755816, "epoch": 0.42302879, "global_step/max_steps": "169/800", "percentage": "21.12%", "elapsed_time": "36m 47s", "remaining_time": "2h 17m 22s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.061201} +{"loss": 0.83858097, "grad_norm": 2.06478143, "learning_rate": 4.997e-05, "token_acc": 0.76397464, "epoch": 0.42553191, "global_step/max_steps": "170/800", "percentage": "21.25%", "elapsed_time": "36m 57s", "remaining_time": "2h 16m 54s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.038334} +{"loss": 0.84219581, "grad_norm": 2.59139204, "learning_rate": 4.996e-05, "token_acc": 0.76202826, "epoch": 0.42803504, "global_step/max_steps": "171/800", "percentage": "21.38%", "elapsed_time": "37m 15s", "remaining_time": "2h 17m 0s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.069021} +{"loss": 0.81339896, "grad_norm": 1.77133739, "learning_rate": 4.996e-05, "token_acc": 0.76086771, "epoch": 0.43053817, "global_step/max_steps": "172/800", "percentage": "21.50%", "elapsed_time": "37m 21s", "remaining_time": "2h 16m 23s", "memory(GiB)": 74.79, "train_speed(s/it)": 13.03078} +{"loss": 1.00051904, "grad_norm": 1.52983904, "learning_rate": 4.995e-05, "token_acc": 0.71221907, "epoch": 0.4330413, "global_step/max_steps": "173/800", "percentage": "21.62%", "elapsed_time": "37m 42s", "remaining_time": "2h 16m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.075057} +{"loss": 0.9671303, "grad_norm": 1.5380621, "learning_rate": 4.994e-05, "token_acc": 0.72778752, "epoch": 0.43554443, "global_step/max_steps": "174/800", "percentage": "21.75%", "elapsed_time": "38m 2s", "remaining_time": "2h 16m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.117322} +{"loss": 0.82832551, "grad_norm": 2.8864336, "learning_rate": 4.993e-05, "token_acc": 0.76754786, "epoch": 0.43804756, "global_step/max_steps": "175/800", "percentage": "21.88%", "elapsed_time": "38m 11s", "remaining_time": "2h 16m 21s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.088958} +{"loss": 0.91599679, "grad_norm": 1.05314553, "learning_rate": 4.992e-05, "token_acc": 0.73667251, "epoch": 0.44055069, "global_step/max_steps": "176/800", "percentage": "22.00%", "elapsed_time": "38m 21s", "remaining_time": "2h 15m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.071519} +{"loss": 0.86185855, "grad_norm": 1.42508829, "learning_rate": 4.991e-05, "token_acc": 0.75415334, "epoch": 0.44305382, "global_step/max_steps": "177/800", "percentage": "22.12%", "elapsed_time": "38m 28s", "remaining_time": "2h 15m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.039252} +{"loss": 1.00279379, "grad_norm": 5.33800745, "learning_rate": 4.99e-05, "token_acc": 0.71287429, "epoch": 0.44555695, "global_step/max_steps": "178/800", "percentage": "22.25%", "elapsed_time": "38m 45s", "remaining_time": "2h 15m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.064159} +{"loss": 0.84898227, "grad_norm": 1.2855202, "learning_rate": 4.989e-05, "token_acc": 0.76395339, "epoch": 0.44806008, "global_step/max_steps": "179/800", "percentage": "22.38%", "elapsed_time": "38m 52s", "remaining_time": "2h 14m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.028628} +{"loss": 0.91216153, "grad_norm": 1.66365945, "learning_rate": 4.988e-05, "token_acc": 0.74377318, "epoch": 0.4505632, "global_step/max_steps": "180/800", "percentage": "22.50%", "elapsed_time": "38m 59s", "remaining_time": "2h 14m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.99716} +{"loss": 0.80662292, "grad_norm": 1.5193665, "learning_rate": 4.987e-05, "token_acc": 0.76511628, "epoch": 0.45306633, "global_step/max_steps": "181/800", "percentage": "22.62%", "elapsed_time": "39m 17s", "remaining_time": "2h 14m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.02103} +{"loss": 0.94585246, "grad_norm": 1.58623087, "learning_rate": 4.985e-05, "token_acc": 0.73025487, "epoch": 0.45556946, "global_step/max_steps": "182/800", "percentage": "22.75%", "elapsed_time": "39m 28s", "remaining_time": "2h 14m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.010819} +{"loss": 0.95640612, "grad_norm": 2.37922287, "learning_rate": 4.984e-05, "token_acc": 0.73012098, "epoch": 0.45807259, "global_step/max_steps": "183/800", "percentage": "22.88%", "elapsed_time": "39m 41s", "remaining_time": "2h 13m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 13.010217} +{"loss": 0.94272965, "grad_norm": 1.07908106, "learning_rate": 4.983e-05, "token_acc": 0.73036445, "epoch": 0.46057572, "global_step/max_steps": "184/800", "percentage": "23.00%", "elapsed_time": "39m 52s", "remaining_time": "2h 13m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.998392} +{"loss": 0.85346925, "grad_norm": 9.25962162, "learning_rate": 4.981e-05, "token_acc": 0.75077312, "epoch": 0.46307885, "global_step/max_steps": "185/800", "percentage": "23.12%", "elapsed_time": "39m 58s", "remaining_time": "2h 12m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.963363} +{"loss": 1.00247109, "grad_norm": 3.45423126, "learning_rate": 4.98e-05, "token_acc": 0.71770696, "epoch": 0.46558198, "global_step/max_steps": "186/800", "percentage": "23.25%", "elapsed_time": "40m 10s", "remaining_time": "2h 12m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.957164} +{"loss": 0.87344915, "grad_norm": 8.03141499, "learning_rate": 4.978e-05, "token_acc": 0.75070007, "epoch": 0.46808511, "global_step/max_steps": "187/800", "percentage": "23.38%", "elapsed_time": "40m 17s", "remaining_time": "2h 12m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.926992} +{"loss": 0.97913754, "grad_norm": 1.18592906, "learning_rate": 4.976e-05, "token_acc": 0.7258351, "epoch": 0.47058824, "global_step/max_steps": "188/800", "percentage": "23.50%", "elapsed_time": "40m 31s", "remaining_time": "2h 11m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.929605} +{"loss": 0.83719254, "grad_norm": 3.05346489, "learning_rate": 4.975e-05, "token_acc": 0.75365182, "epoch": 0.47309136, "global_step/max_steps": "189/800", "percentage": "23.62%", "elapsed_time": "40m 41s", "remaining_time": "2h 11m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.912706} +{"loss": 0.84890485, "grad_norm": 1.55254662, "learning_rate": 4.973e-05, "token_acc": 0.75436755, "epoch": 0.47559449, "global_step/max_steps": "190/800", "percentage": "23.75%", "elapsed_time": "40m 53s", "remaining_time": "2h 11m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.911927} +{"loss": 0.87028319, "grad_norm": 1.21239638, "learning_rate": 4.971e-05, "token_acc": 0.75040719, "epoch": 0.47809762, "global_step/max_steps": "191/800", "percentage": "23.88%", "elapsed_time": "41m 16s", "remaining_time": "2h 11m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.963461} +{"loss": 0.81165808, "grad_norm": 4.12030554, "learning_rate": 4.969e-05, "token_acc": 0.76362612, "epoch": 0.48060075, "global_step/max_steps": "192/800", "percentage": "24.00%", "elapsed_time": "41m 23s", "remaining_time": "2h 11m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.93146} +{"loss": 0.82021391, "grad_norm": 3.59695888, "learning_rate": 4.967e-05, "token_acc": 0.75952272, "epoch": 0.48310388, "global_step/max_steps": "193/800", "percentage": "24.12%", "elapsed_time": "41m 34s", "remaining_time": "2h 10m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.921281} +{"loss": 0.9322924, "grad_norm": 3.5007093, "learning_rate": 4.965e-05, "token_acc": 0.73020811, "epoch": 0.48560701, "global_step/max_steps": "194/800", "percentage": "24.25%", "elapsed_time": "41m 49s", "remaining_time": "2h 10m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.933482} +{"loss": 0.77809453, "grad_norm": 2.04355621, "learning_rate": 4.963e-05, "token_acc": 0.76809685, "epoch": 0.48811014, "global_step/max_steps": "195/800", "percentage": "24.38%", "elapsed_time": "41m 59s", "remaining_time": "2h 10m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.918094} +{"loss": 0.89026564, "grad_norm": 1.0618856, "learning_rate": 4.961e-05, "token_acc": 0.73575669, "epoch": 0.49061327, "global_step/max_steps": "196/800", "percentage": "24.50%", "elapsed_time": "42m 12s", "remaining_time": "2h 10m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.91625} +{"loss": 0.79533195, "grad_norm": 1.30937731, "learning_rate": 4.959e-05, "token_acc": 0.76903206, "epoch": 0.4931164, "global_step/max_steps": "197/800", "percentage": "24.62%", "elapsed_time": "42m 25s", "remaining_time": "2h 9m 49s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.916524} +{"loss": 0.99164772, "grad_norm": 4.69570065, "learning_rate": 4.957e-05, "token_acc": 0.71837751, "epoch": 0.49561952, "global_step/max_steps": "198/800", "percentage": "24.75%", "elapsed_time": "42m 37s", "remaining_time": "2h 9m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.914295} +{"loss": 0.8842063, "grad_norm": 1.17389107, "learning_rate": 4.954e-05, "token_acc": 0.74022115, "epoch": 0.49812265, "global_step/max_steps": "199/800", "percentage": "24.88%", "elapsed_time": "42m 46s", "remaining_time": "2h 9m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.895764} +{"loss": 0.82722688, "grad_norm": 1.95812774, "learning_rate": 4.952e-05, "token_acc": 0.75925152, "epoch": 0.50062578, "global_step/max_steps": "200/800", "percentage": "25.00%", "elapsed_time": "42m 55s", "remaining_time": "2h 8m 44s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.87365} +{"loss": 0.87970406, "grad_norm": 0.97562003, "learning_rate": 4.95e-05, "token_acc": 0.74540052, "epoch": 0.50312891, "global_step/max_steps": "201/800", "percentage": "25.12%", "elapsed_time": "43m 13s", "remaining_time": "2h 8m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.898444} +{"loss": 0.76358676, "grad_norm": 1.44158328, "learning_rate": 4.947e-05, "token_acc": 0.77802003, "epoch": 0.50563204, "global_step/max_steps": "202/800", "percentage": "25.25%", "elapsed_time": "43m 19s", "remaining_time": "2h 8m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.868025} +{"loss": 0.88867342, "grad_norm": 0.94312829, "learning_rate": 4.945e-05, "token_acc": 0.74589849, "epoch": 0.50813517, "global_step/max_steps": "203/800", "percentage": "25.37%", "elapsed_time": "43m 27s", "remaining_time": "2h 7m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.840301} +{"loss": 0.97644377, "grad_norm": 1.42629671, "learning_rate": 4.942e-05, "token_acc": 0.72199593, "epoch": 0.5106383, "global_step/max_steps": "204/800", "percentage": "25.50%", "elapsed_time": "43m 40s", "remaining_time": "2h 7m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.842377} +{"loss": 0.80550575, "grad_norm": 1.83714414, "learning_rate": 4.939e-05, "token_acc": 0.77056831, "epoch": 0.51314143, "global_step/max_steps": "205/800", "percentage": "25.62%", "elapsed_time": "43m 48s", "remaining_time": "2h 7m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.820498} +{"loss": 0.95089632, "grad_norm": 0.91571784, "learning_rate": 4.937e-05, "token_acc": 0.72660133, "epoch": 0.51564456, "global_step/max_steps": "206/800", "percentage": "25.75%", "elapsed_time": "44m 1s", "remaining_time": "2h 6m 56s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.821669} +{"loss": 0.87969804, "grad_norm": 1.11171412, "learning_rate": 4.934e-05, "token_acc": 0.74480917, "epoch": 0.51814768, "global_step/max_steps": "207/800", "percentage": "25.87%", "elapsed_time": "44m 16s", "remaining_time": "2h 6m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.829983} +{"loss": 0.7853018, "grad_norm": 1.20609212, "learning_rate": 4.931e-05, "token_acc": 0.76767896, "epoch": 0.52065081, "global_step/max_steps": "208/800", "percentage": "26.00%", "elapsed_time": "44m 29s", "remaining_time": "2h 6m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.83324} +{"loss": 0.93095225, "grad_norm": 3.6136198, "learning_rate": 4.928e-05, "token_acc": 0.72904441, "epoch": 0.52315394, "global_step/max_steps": "209/800", "percentage": "26.12%", "elapsed_time": "44m 39s", "remaining_time": "2h 6m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.820261} +{"loss": 0.94415355, "grad_norm": 2.27868176, "learning_rate": 4.925e-05, "token_acc": 0.73307249, "epoch": 0.52565707, "global_step/max_steps": "210/800", "percentage": "26.25%", "elapsed_time": "44m 53s", "remaining_time": "2h 6m 6s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.823598} +{"loss": 0.92499381, "grad_norm": 1.10283041, "learning_rate": 4.922e-05, "token_acc": 0.73052985, "epoch": 0.5281602, "global_step/max_steps": "211/800", "percentage": "26.38%", "elapsed_time": "45m 21s", "remaining_time": "2h 6m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.894689} +{"loss": 0.93824995, "grad_norm": 2.14603472, "learning_rate": 4.919e-05, "token_acc": 0.73042705, "epoch": 0.53066333, "global_step/max_steps": "212/800", "percentage": "26.50%", "elapsed_time": "45m 37s", "remaining_time": "2h 6m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.910525} +{"loss": 0.89060766, "grad_norm": 1.13017225, "learning_rate": 4.916e-05, "token_acc": 0.74104635, "epoch": 0.53316646, "global_step/max_steps": "213/800", "percentage": "26.62%", "elapsed_time": "45m 46s", "remaining_time": "2h 6m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.893692} +{"loss": 0.85471594, "grad_norm": 1.01965547, "learning_rate": 4.913e-05, "token_acc": 0.74775739, "epoch": 0.53566959, "global_step/max_steps": "214/800", "percentage": "26.75%", "elapsed_time": "46m 2s", "remaining_time": "2h 6m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.906908} +{"loss": 0.97864801, "grad_norm": 0.84005183, "learning_rate": 4.909e-05, "token_acc": 0.71918577, "epoch": 0.53817272, "global_step/max_steps": "215/800", "percentage": "26.88%", "elapsed_time": "46m 17s", "remaining_time": "2h 5m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.918221} +{"loss": 0.93000567, "grad_norm": 1.34546304, "learning_rate": 4.906e-05, "token_acc": 0.73022456, "epoch": 0.54067584, "global_step/max_steps": "216/800", "percentage": "27.00%", "elapsed_time": "46m 29s", "remaining_time": "2h 5m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.913684} +{"loss": 0.7304343, "grad_norm": 1.72615933, "learning_rate": 4.903e-05, "token_acc": 0.7930696, "epoch": 0.54317897, "global_step/max_steps": "217/800", "percentage": "27.12%", "elapsed_time": "46m 37s", "remaining_time": "2h 5m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.888672} +{"loss": 0.94971514, "grad_norm": 0.83767325, "learning_rate": 4.899e-05, "token_acc": 0.72350628, "epoch": 0.5456821, "global_step/max_steps": "218/800", "percentage": "27.25%", "elapsed_time": "46m 53s", "remaining_time": "2h 5m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.903166} +{"loss": 0.74514502, "grad_norm": 1.52063978, "learning_rate": 4.896e-05, "token_acc": 0.78507405, "epoch": 0.54818523, "global_step/max_steps": "219/800", "percentage": "27.38%", "elapsed_time": "46m 59s", "remaining_time": "2h 4m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.871298} +{"loss": 0.89447844, "grad_norm": 2.35011387, "learning_rate": 4.892e-05, "token_acc": 0.74085699, "epoch": 0.55068836, "global_step/max_steps": "220/800", "percentage": "27.50%", "elapsed_time": "47m 7s", "remaining_time": "2h 4m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.850827} +{"loss": 0.84101343, "grad_norm": 2.15181136, "learning_rate": 4.889e-05, "token_acc": 0.75248465, "epoch": 0.55319149, "global_step/max_steps": "221/800", "percentage": "27.62%", "elapsed_time": "47m 26s", "remaining_time": "2h 4m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.876692} +{"loss": 0.87742591, "grad_norm": 2.29988575, "learning_rate": 4.885e-05, "token_acc": 0.74822078, "epoch": 0.55569462, "global_step/max_steps": "222/800", "percentage": "27.75%", "elapsed_time": "47m 43s", "remaining_time": "2h 4m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.896061} +{"loss": 0.84853703, "grad_norm": 4.15465212, "learning_rate": 4.881e-05, "token_acc": 0.74715832, "epoch": 0.55819775, "global_step/max_steps": "223/800", "percentage": "27.88%", "elapsed_time": "47m 52s", "remaining_time": "2h 3m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.878458} +{"loss": 0.80679929, "grad_norm": 3.91742682, "learning_rate": 4.878e-05, "token_acc": 0.7612281, "epoch": 0.56070088, "global_step/max_steps": "224/800", "percentage": "28.00%", "elapsed_time": "48m 0s", "remaining_time": "2h 3m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.857891} +{"loss": 0.8888064, "grad_norm": 6.49675751, "learning_rate": 4.874e-05, "token_acc": 0.74681729, "epoch": 0.56320401, "global_step/max_steps": "225/800", "percentage": "28.12%", "elapsed_time": "48m 14s", "remaining_time": "2h 3m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.860802} +{"loss": 0.89395368, "grad_norm": 2.21266985, "learning_rate": 4.87e-05, "token_acc": 0.7427561, "epoch": 0.56570713, "global_step/max_steps": "226/800", "percentage": "28.25%", "elapsed_time": "48m 25s", "remaining_time": "2h 2m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.852965} +{"loss": 0.83888304, "grad_norm": 2.26651311, "learning_rate": 4.866e-05, "token_acc": 0.75915905, "epoch": 0.56821026, "global_step/max_steps": "227/800", "percentage": "28.38%", "elapsed_time": "48m 34s", "remaining_time": "2h 2m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.835291} +{"loss": 0.89397442, "grad_norm": 1.6633414, "learning_rate": 4.862e-05, "token_acc": 0.74231913, "epoch": 0.57071339, "global_step/max_steps": "228/800", "percentage": "28.50%", "elapsed_time": "48m 51s", "remaining_time": "2h 2m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.854583} +{"loss": 0.83377546, "grad_norm": 10.39088821, "learning_rate": 4.858e-05, "token_acc": 0.76040921, "epoch": 0.57321652, "global_step/max_steps": "229/800", "percentage": "28.62%", "elapsed_time": "49m 1s", "remaining_time": "2h 2m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.841141} +{"loss": 0.89080441, "grad_norm": 1.94412184, "learning_rate": 4.854e-05, "token_acc": 0.74163505, "epoch": 0.57571965, "global_step/max_steps": "230/800", "percentage": "28.75%", "elapsed_time": "49m 10s", "remaining_time": "2h 1m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.827921} +{"loss": 0.682464, "grad_norm": 5.35120583, "learning_rate": 4.85e-05, "token_acc": 0.79867866, "epoch": 0.57822278, "global_step/max_steps": "231/800", "percentage": "28.88%", "elapsed_time": "49m 30s", "remaining_time": "2h 1m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.85857} +{"loss": 0.83386147, "grad_norm": 5.38835049, "learning_rate": 4.845e-05, "token_acc": 0.75882047, "epoch": 0.58072591, "global_step/max_steps": "232/800", "percentage": "29.00%", "elapsed_time": "49m 39s", "remaining_time": "2h 1m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.841139} +{"loss": 0.83309674, "grad_norm": 33.36974335, "learning_rate": 4.841e-05, "token_acc": 0.75537329, "epoch": 0.58322904, "global_step/max_steps": "233/800", "percentage": "29.12%", "elapsed_time": "49m 49s", "remaining_time": "2h 1m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.826287} +{"loss": 0.80817854, "grad_norm": 1.25754488, "learning_rate": 4.837e-05, "token_acc": 0.76186244, "epoch": 0.58573217, "global_step/max_steps": "234/800", "percentage": "29.25%", "elapsed_time": "49m 57s", "remaining_time": "2h 0m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.809247} +{"loss": 0.81181473, "grad_norm": 5.85184193, "learning_rate": 4.832e-05, "token_acc": 0.75881388, "epoch": 0.58823529, "global_step/max_steps": "235/800", "percentage": "29.38%", "elapsed_time": "50m 10s", "remaining_time": "2h 0m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.8077} +{"loss": 0.85323566, "grad_norm": 1.22764826, "learning_rate": 4.828e-05, "token_acc": 0.74629749, "epoch": 0.59073842, "global_step/max_steps": "236/800", "percentage": "29.50%", "elapsed_time": "50m 24s", "remaining_time": "2h 0m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.811876} +{"loss": 0.98053753, "grad_norm": 1.41281629, "learning_rate": 4.824e-05, "token_acc": 0.7154091, "epoch": 0.59324155, "global_step/max_steps": "237/800", "percentage": "29.62%", "elapsed_time": "50m 31s", "remaining_time": "1h 59m 60s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.787972} +{"loss": 0.79499817, "grad_norm": 1.12588084, "learning_rate": 4.819e-05, "token_acc": 0.76370192, "epoch": 0.59574468, "global_step/max_steps": "238/800", "percentage": "29.75%", "elapsed_time": "50m 39s", "remaining_time": "1h 59m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.766938} +{"loss": 0.88062525, "grad_norm": 2.17614484, "learning_rate": 4.814e-05, "token_acc": 0.74841755, "epoch": 0.59824781, "global_step/max_steps": "239/800", "percentage": "29.88%", "elapsed_time": "50m 54s", "remaining_time": "1h 59m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.779734} +{"loss": 0.85024488, "grad_norm": 2.77589536, "learning_rate": 4.81e-05, "token_acc": 0.74787459, "epoch": 0.60075094, "global_step/max_steps": "240/800", "percentage": "30.00%", "elapsed_time": "51m 13s", "remaining_time": "1h 59m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.804676} +{"loss": 0.70030475, "grad_norm": 3.27974606, "learning_rate": 4.805e-05, "token_acc": 0.79122196, "epoch": 0.60325407, "global_step/max_steps": "241/800", "percentage": "30.12%", "elapsed_time": "51m 29s", "remaining_time": "1h 59m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.816754} +{"loss": 0.90602708, "grad_norm": 3.99144077, "learning_rate": 4.8e-05, "token_acc": 0.73212935, "epoch": 0.6057572, "global_step/max_steps": "242/800", "percentage": "30.25%", "elapsed_time": "51m 47s", "remaining_time": "1h 59m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.837426} +{"loss": 0.92731166, "grad_norm": 1.57251537, "learning_rate": 4.795e-05, "token_acc": 0.72939627, "epoch": 0.60826033, "global_step/max_steps": "243/800", "percentage": "30.38%", "elapsed_time": "51m 57s", "remaining_time": "1h 59m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.825591} +{"loss": 0.84343612, "grad_norm": 1.59618855, "learning_rate": 4.79e-05, "token_acc": 0.75470519, "epoch": 0.61076345, "global_step/max_steps": "244/800", "percentage": "30.50%", "elapsed_time": "52m 7s", "remaining_time": "1h 58m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.817071} +{"loss": 0.93770432, "grad_norm": 1.03664339, "learning_rate": 4.786e-05, "token_acc": 0.72769752, "epoch": 0.61326658, "global_step/max_steps": "245/800", "percentage": "30.63%", "elapsed_time": "52m 19s", "remaining_time": "1h 58m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.813672} +{"loss": 0.89050704, "grad_norm": 1.06033516, "learning_rate": 4.781e-05, "token_acc": 0.73677712, "epoch": 0.61576971, "global_step/max_steps": "246/800", "percentage": "30.75%", "elapsed_time": "52m 36s", "remaining_time": "1h 58m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.827963} +{"loss": 0.77371269, "grad_norm": 2.60903358, "learning_rate": 4.775e-05, "token_acc": 0.77524657, "epoch": 0.61827284, "global_step/max_steps": "247/800", "percentage": "30.88%", "elapsed_time": "52m 43s", "remaining_time": "1h 58m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.807353} +{"loss": 0.88968372, "grad_norm": 2.88024068, "learning_rate": 4.77e-05, "token_acc": 0.73755873, "epoch": 0.62077597, "global_step/max_steps": "248/800", "percentage": "31.00%", "elapsed_time": "52m 55s", "remaining_time": "1h 57m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.804282} +{"loss": 0.90714628, "grad_norm": 0.94731003, "learning_rate": 4.765e-05, "token_acc": 0.73770936, "epoch": 0.6232791, "global_step/max_steps": "249/800", "percentage": "31.13%", "elapsed_time": "53m 9s", "remaining_time": "1h 57m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.807527} +{"loss": 0.74934912, "grad_norm": 1.42057335, "learning_rate": 4.76e-05, "token_acc": 0.77739997, "epoch": 0.62578223, "global_step/max_steps": "250/800", "percentage": "31.25%", "elapsed_time": "53m 19s", "remaining_time": "1h 57m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.794194} +{"loss": 0.84520954, "grad_norm": 1.53277183, "learning_rate": 4.755e-05, "token_acc": 0.75342886, "epoch": 0.62828536, "global_step/max_steps": "251/800", "percentage": "31.37%", "elapsed_time": "53m 36s", "remaining_time": "1h 57m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.813772} +{"loss": 0.88199627, "grad_norm": 1.97401881, "learning_rate": 4.749e-05, "token_acc": 0.74084097, "epoch": 0.63078849, "global_step/max_steps": "252/800", "percentage": "31.50%", "elapsed_time": "53m 44s", "remaining_time": "1h 56m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.793044} +{"loss": 0.83699846, "grad_norm": 4.26699209, "learning_rate": 4.744e-05, "token_acc": 0.75338933, "epoch": 0.63329161, "global_step/max_steps": "253/800", "percentage": "31.62%", "elapsed_time": "53m 55s", "remaining_time": "1h 56m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.784858} +{"loss": 0.7518301, "grad_norm": 3.87081409, "learning_rate": 4.739e-05, "token_acc": 0.77175604, "epoch": 0.63579474, "global_step/max_steps": "254/800", "percentage": "31.75%", "elapsed_time": "54m 3s", "remaining_time": "1h 56m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.766402} +{"loss": 0.72326046, "grad_norm": 6.52788401, "learning_rate": 4.733e-05, "token_acc": 0.78684307, "epoch": 0.63829787, "global_step/max_steps": "255/800", "percentage": "31.87%", "elapsed_time": "54m 14s", "remaining_time": "1h 55m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.760235} +{"loss": 0.82755095, "grad_norm": 1.40105927, "learning_rate": 4.728e-05, "token_acc": 0.75614338, "epoch": 0.640801, "global_step/max_steps": "256/800", "percentage": "32.00%", "elapsed_time": "54m 23s", "remaining_time": "1h 55m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.747361} +{"loss": 0.79994029, "grad_norm": 6.85730886, "learning_rate": 4.722e-05, "token_acc": 0.76267748, "epoch": 0.64330413, "global_step/max_steps": "257/800", "percentage": "32.12%", "elapsed_time": "54m 32s", "remaining_time": "1h 55m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.732633} +{"loss": 0.78343731, "grad_norm": 1.6401068, "learning_rate": 4.716e-05, "token_acc": 0.76591231, "epoch": 0.64580726, "global_step/max_steps": "258/800", "percentage": "32.25%", "elapsed_time": "54m 46s", "remaining_time": "1h 55m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.736836} +{"loss": 0.83101642, "grad_norm": 1.61251628, "learning_rate": 4.711e-05, "token_acc": 0.75112121, "epoch": 0.64831039, "global_step/max_steps": "259/800", "percentage": "32.38%", "elapsed_time": "54m 56s", "remaining_time": "1h 54m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725977} +{"loss": 0.87916046, "grad_norm": 1.44209969, "learning_rate": 4.705e-05, "token_acc": 0.74472375, "epoch": 0.65081352, "global_step/max_steps": "260/800", "percentage": "32.50%", "elapsed_time": "55m 5s", "remaining_time": "1h 54m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.713081} +{"loss": 0.91743779, "grad_norm": 1.00484586, "learning_rate": 4.699e-05, "token_acc": 0.73165017, "epoch": 0.65331665, "global_step/max_steps": "261/800", "percentage": "32.62%", "elapsed_time": "55m 36s", "remaining_time": "1h 54m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.78299} +{"loss": 0.73225653, "grad_norm": 6.17283916, "learning_rate": 4.693e-05, "token_acc": 0.78488054, "epoch": 0.65581977, "global_step/max_steps": "262/800", "percentage": "32.75%", "elapsed_time": "55m 45s", "remaining_time": "1h 54m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.768301} +{"loss": 0.90463644, "grad_norm": 2.71896076, "learning_rate": 4.687e-05, "token_acc": 0.73743939, "epoch": 0.6583229, "global_step/max_steps": "263/800", "percentage": "32.88%", "elapsed_time": "55m 59s", "remaining_time": "1h 54m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.773749} +{"loss": 0.96959835, "grad_norm": 0.79750592, "learning_rate": 4.681e-05, "token_acc": 0.71932422, "epoch": 0.66082603, "global_step/max_steps": "264/800", "percentage": "33.00%", "elapsed_time": "56m 15s", "remaining_time": "1h 54m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.783858} +{"loss": 0.80644476, "grad_norm": 2.31804776, "learning_rate": 4.675e-05, "token_acc": 0.76681896, "epoch": 0.66332916, "global_step/max_steps": "265/800", "percentage": "33.12%", "elapsed_time": "56m 26s", "remaining_time": "1h 53m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.779238} +{"loss": 0.83615535, "grad_norm": 2.59616923, "learning_rate": 4.669e-05, "token_acc": 0.75188485, "epoch": 0.66583229, "global_step/max_steps": "266/800", "percentage": "33.25%", "elapsed_time": "56m 38s", "remaining_time": "1h 53m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.773416} +{"loss": 0.95114285, "grad_norm": 0.77383053, "learning_rate": 4.663e-05, "token_acc": 0.72917643, "epoch": 0.66833542, "global_step/max_steps": "267/800", "percentage": "33.38%", "elapsed_time": "56m 48s", "remaining_time": "1h 53m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.763462} +{"loss": 0.84137553, "grad_norm": 1.96406317, "learning_rate": 4.657e-05, "token_acc": 0.75700051, "epoch": 0.67083855, "global_step/max_steps": "268/800", "percentage": "33.50%", "elapsed_time": "56m 56s", "remaining_time": "1h 53m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.745312} +{"loss": 0.8661716, "grad_norm": 3.47649765, "learning_rate": 4.651e-05, "token_acc": 0.749679, "epoch": 0.67334168, "global_step/max_steps": "269/800", "percentage": "33.62%", "elapsed_time": "57m 5s", "remaining_time": "1h 52m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.732109} +{"loss": 0.83455175, "grad_norm": 2.81403351, "learning_rate": 4.644e-05, "token_acc": 0.75843746, "epoch": 0.67584481, "global_step/max_steps": "270/800", "percentage": "33.75%", "elapsed_time": "57m 13s", "remaining_time": "1h 52m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.715741} +{"loss": 0.85213959, "grad_norm": 2.13738394, "learning_rate": 4.638e-05, "token_acc": 0.75048813, "epoch": 0.67834793, "global_step/max_steps": "271/800", "percentage": "33.88%", "elapsed_time": "57m 40s", "remaining_time": "1h 52m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.766475} +{"loss": 0.87482309, "grad_norm": 0.98858666, "learning_rate": 4.632e-05, "token_acc": 0.74254419, "epoch": 0.68085106, "global_step/max_steps": "272/800", "percentage": "34.00%", "elapsed_time": "57m 60s", "remaining_time": "1h 52m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.793813} +{"loss": 0.81686133, "grad_norm": 3.5612607, "learning_rate": 4.625e-05, "token_acc": 0.76039618, "epoch": 0.68335419, "global_step/max_steps": "273/800", "percentage": "34.12%", "elapsed_time": "58m 9s", "remaining_time": "1h 52m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.78011} +{"loss": 0.78959405, "grad_norm": 25.96688843, "learning_rate": 4.619e-05, "token_acc": 0.76583493, "epoch": 0.68585732, "global_step/max_steps": "274/800", "percentage": "34.25%", "elapsed_time": "58m 20s", "remaining_time": "1h 51m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.772994} +{"loss": 0.82341921, "grad_norm": 1.39365172, "learning_rate": 4.612e-05, "token_acc": 0.75826499, "epoch": 0.68836045, "global_step/max_steps": "275/800", "percentage": "34.38%", "elapsed_time": "58m 36s", "remaining_time": "1h 51m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.787235} +{"loss": 0.82505983, "grad_norm": 2.47348118, "learning_rate": 4.606e-05, "token_acc": 0.75526439, "epoch": 0.69086358, "global_step/max_steps": "276/800", "percentage": "34.50%", "elapsed_time": "58m 49s", "remaining_time": "1h 51m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.785066} +{"loss": 0.91378367, "grad_norm": 2.52813387, "learning_rate": 4.599e-05, "token_acc": 0.73140602, "epoch": 0.69336671, "global_step/max_steps": "277/800", "percentage": "34.62%", "elapsed_time": "59m 9s", "remaining_time": "1h 51m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.813316} +{"loss": 0.86536211, "grad_norm": 1.50600791, "learning_rate": 4.592e-05, "token_acc": 0.74303854, "epoch": 0.69586984, "global_step/max_steps": "278/800", "percentage": "34.75%", "elapsed_time": "59m 22s", "remaining_time": "1h 51m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.812459} +{"loss": 0.84110969, "grad_norm": 1.00879216, "learning_rate": 4.585e-05, "token_acc": 0.75293032, "epoch": 0.69837297, "global_step/max_steps": "279/800", "percentage": "34.88%", "elapsed_time": "59m 40s", "remaining_time": "1h 51m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.829951} +{"loss": 0.77837455, "grad_norm": 1.56361949, "learning_rate": 4.579e-05, "token_acc": 0.77028702, "epoch": 0.7008761, "global_step/max_steps": "280/800", "percentage": "35.00%", "elapsed_time": "59m 45s", "remaining_time": "1h 50m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.803304} +{"loss": 0.9275862, "grad_norm": 1.92775834, "learning_rate": 4.572e-05, "token_acc": 0.72497408, "epoch": 0.70337922, "global_step/max_steps": "281/800", "percentage": "35.12%", "elapsed_time": "1h 0m 3s", "remaining_time": "1h 50m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.822105} +{"loss": 0.85624146, "grad_norm": 1.41907167, "learning_rate": 4.565e-05, "token_acc": 0.74584453, "epoch": 0.70588235, "global_step/max_steps": "282/800", "percentage": "35.25%", "elapsed_time": "1h 0m 16s", "remaining_time": "1h 50m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.823139} +{"loss": 0.89054173, "grad_norm": 1.40122473, "learning_rate": 4.558e-05, "token_acc": 0.74003318, "epoch": 0.70838548, "global_step/max_steps": "283/800", "percentage": "35.38%", "elapsed_time": "1h 0m 30s", "remaining_time": "1h 50m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.828474} +{"loss": 0.73494053, "grad_norm": 2.84585834, "learning_rate": 4.551e-05, "token_acc": 0.77788097, "epoch": 0.71088861, "global_step/max_steps": "284/800", "percentage": "35.50%", "elapsed_time": "1h 0m 40s", "remaining_time": "1h 50m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.817588} +{"loss": 0.73983657, "grad_norm": 2.04371762, "learning_rate": 4.544e-05, "token_acc": 0.7864004, "epoch": 0.71339174, "global_step/max_steps": "285/800", "percentage": "35.62%", "elapsed_time": "1h 0m 49s", "remaining_time": "1h 49m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.805029} +{"loss": 0.73167378, "grad_norm": 1.1184814, "learning_rate": 4.537e-05, "token_acc": 0.77904259, "epoch": 0.71589487, "global_step/max_steps": "286/800", "percentage": "35.75%", "elapsed_time": "1h 0m 58s", "remaining_time": "1h 49m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.788762} +{"loss": 0.91680813, "grad_norm": 1.75509262, "learning_rate": 4.53e-05, "token_acc": 0.7349883, "epoch": 0.718398, "global_step/max_steps": "287/800", "percentage": "35.88%", "elapsed_time": "1h 1m 9s", "remaining_time": "1h 49m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.785338} +{"loss": 0.84053963, "grad_norm": 2.27348566, "learning_rate": 4.523e-05, "token_acc": 0.75373483, "epoch": 0.72090113, "global_step/max_steps": "288/800", "percentage": "36.00%", "elapsed_time": "1h 1m 16s", "remaining_time": "1h 48m 56s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.765511} +{"loss": 0.94972837, "grad_norm": 0.82635891, "learning_rate": 4.515e-05, "token_acc": 0.72898925, "epoch": 0.72340426, "global_step/max_steps": "289/800", "percentage": "36.12%", "elapsed_time": "1h 1m 29s", "remaining_time": "1h 48m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.763767} +{"loss": 0.82741606, "grad_norm": 4.23334742, "learning_rate": 4.508e-05, "token_acc": 0.75478763, "epoch": 0.72590738, "global_step/max_steps": "290/800", "percentage": "36.25%", "elapsed_time": "1h 1m 38s", "remaining_time": "1h 48m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.752785} +{"loss": 0.87691653, "grad_norm": 2.7960372, "learning_rate": 4.501e-05, "token_acc": 0.74731559, "epoch": 0.72841051, "global_step/max_steps": "291/800", "percentage": "36.38%", "elapsed_time": "1h 2m 0s", "remaining_time": "1h 48m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.784398} +{"loss": 0.91585314, "grad_norm": 0.9638167, "learning_rate": 4.493e-05, "token_acc": 0.73626035, "epoch": 0.73091364, "global_step/max_steps": "292/800", "percentage": "36.50%", "elapsed_time": "1h 2m 23s", "remaining_time": "1h 48m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.816874} +{"loss": 0.80954015, "grad_norm": 2.07723236, "learning_rate": 4.486e-05, "token_acc": 0.75835162, "epoch": 0.73341677, "global_step/max_steps": "293/800", "percentage": "36.62%", "elapsed_time": "1h 2m 34s", "remaining_time": "1h 48m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.811343} +{"loss": 0.88731498, "grad_norm": 1.08147538, "learning_rate": 4.478e-05, "token_acc": 0.74378324, "epoch": 0.7359199, "global_step/max_steps": "294/800", "percentage": "36.75%", "elapsed_time": "1h 2m 46s", "remaining_time": "1h 48m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.808732} +{"loss": 0.7311573, "grad_norm": 4.16808701, "learning_rate": 4.471e-05, "token_acc": 0.78859818, "epoch": 0.73842303, "global_step/max_steps": "295/800", "percentage": "36.88%", "elapsed_time": "1h 2m 55s", "remaining_time": "1h 47m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.795618} +{"loss": 0.83672571, "grad_norm": 1.35572541, "learning_rate": 4.463e-05, "token_acc": 0.75293202, "epoch": 0.74092616, "global_step/max_steps": "296/800", "percentage": "37.00%", "elapsed_time": "1h 3m 15s", "remaining_time": "1h 47m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.820936} +{"loss": 0.8442533, "grad_norm": 2.25948286, "learning_rate": 4.456e-05, "token_acc": 0.75614023, "epoch": 0.74342929, "global_step/max_steps": "297/800", "percentage": "37.12%", "elapsed_time": "1h 3m 24s", "remaining_time": "1h 47m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.808882} +{"loss": 0.75597256, "grad_norm": 1.40029788, "learning_rate": 4.448e-05, "token_acc": 0.77425373, "epoch": 0.74593242, "global_step/max_steps": "298/800", "percentage": "37.25%", "elapsed_time": "1h 3m 35s", "remaining_time": "1h 47m 7s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.80327} +{"loss": 0.83274865, "grad_norm": 1.65783763, "learning_rate": 4.44e-05, "token_acc": 0.75593872, "epoch": 0.74843554, "global_step/max_steps": "299/800", "percentage": "37.38%", "elapsed_time": "1h 3m 46s", "remaining_time": "1h 46m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.797308} +{"loss": 0.85284775, "grad_norm": 3.89681864, "learning_rate": 4.433e-05, "token_acc": 0.75076345, "epoch": 0.75093867, "global_step/max_steps": "300/800", "percentage": "37.50%", "elapsed_time": "1h 3m 55s", "remaining_time": "1h 46m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.782621} +{"loss": 0.91329968, "grad_norm": 1.18304753, "learning_rate": 4.425e-05, "token_acc": 0.73120292, "epoch": 0.7534418, "global_step/max_steps": "301/800", "percentage": "37.62%", "elapsed_time": "1h 4m 18s", "remaining_time": "1h 46m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.818756} +{"loss": 0.84714586, "grad_norm": 1.79401433, "learning_rate": 4.417e-05, "token_acc": 0.75785365, "epoch": 0.75594493, "global_step/max_steps": "302/800", "percentage": "37.75%", "elapsed_time": "1h 4m 29s", "remaining_time": "1h 46m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.812102} +{"loss": 0.88164318, "grad_norm": 1.10609162, "learning_rate": 4.409e-05, "token_acc": 0.73837144, "epoch": 0.75844806, "global_step/max_steps": "303/800", "percentage": "37.88%", "elapsed_time": "1h 4m 39s", "remaining_time": "1h 46m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.80163} +{"loss": 0.79775858, "grad_norm": 3.27447963, "learning_rate": 4.401e-05, "token_acc": 0.76483448, "epoch": 0.76095119, "global_step/max_steps": "304/800", "percentage": "38.00%", "elapsed_time": "1h 4m 50s", "remaining_time": "1h 45m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.795294} +{"loss": 0.85511202, "grad_norm": 4.24985361, "learning_rate": 4.393e-05, "token_acc": 0.74466754, "epoch": 0.76345432, "global_step/max_steps": "305/800", "percentage": "38.12%", "elapsed_time": "1h 4m 60s", "remaining_time": "1h 45m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.785934} +{"loss": 0.80623221, "grad_norm": 9.04197788, "learning_rate": 4.385e-05, "token_acc": 0.7649096, "epoch": 0.76595745, "global_step/max_steps": "306/800", "percentage": "38.25%", "elapsed_time": "1h 5m 11s", "remaining_time": "1h 45m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.779839} +{"loss": 0.83315301, "grad_norm": 1.08155489, "learning_rate": 4.377e-05, "token_acc": 0.75517951, "epoch": 0.76846058, "global_step/max_steps": "307/800", "percentage": "38.38%", "elapsed_time": "1h 5m 19s", "remaining_time": "1h 44m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.766352} +{"loss": 0.76459718, "grad_norm": 2.74857426, "learning_rate": 4.369e-05, "token_acc": 0.77690802, "epoch": 0.7709637, "global_step/max_steps": "308/800", "percentage": "38.50%", "elapsed_time": "1h 5m 30s", "remaining_time": "1h 44m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.76117} +{"loss": 0.85507584, "grad_norm": 2.28320813, "learning_rate": 4.361e-05, "token_acc": 0.75449766, "epoch": 0.77346683, "global_step/max_steps": "309/800", "percentage": "38.62%", "elapsed_time": "1h 5m 43s", "remaining_time": "1h 44m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.761909} +{"loss": 0.91927904, "grad_norm": 0.87695199, "learning_rate": 4.352e-05, "token_acc": 0.72944776, "epoch": 0.77596996, "global_step/max_steps": "310/800", "percentage": "38.75%", "elapsed_time": "1h 6m 4s", "remaining_time": "1h 44m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.787159} +{"loss": 0.6819452, "grad_norm": 2.90903211, "learning_rate": 4.344e-05, "token_acc": 0.79672419, "epoch": 0.77847309, "global_step/max_steps": "311/800", "percentage": "38.88%", "elapsed_time": "1h 6m 22s", "remaining_time": "1h 44m 21s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.803117} +{"loss": 0.79139298, "grad_norm": 2.95730186, "learning_rate": 4.336e-05, "token_acc": 0.76674221, "epoch": 0.78097622, "global_step/max_steps": "312/800", "percentage": "39.00%", "elapsed_time": "1h 6m 31s", "remaining_time": "1h 44m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.791681} +{"loss": 0.74074185, "grad_norm": 2.8347652, "learning_rate": 4.327e-05, "token_acc": 0.781952, "epoch": 0.78347935, "global_step/max_steps": "313/800", "percentage": "39.12%", "elapsed_time": "1h 6m 43s", "remaining_time": "1h 43m 49s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.789632} +{"loss": 0.86453497, "grad_norm": 24.75906181, "learning_rate": 4.319e-05, "token_acc": 0.74620409, "epoch": 0.78598248, "global_step/max_steps": "314/800", "percentage": "39.25%", "elapsed_time": "1h 7m 3s", "remaining_time": "1h 43m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.812317} +{"loss": 0.80037481, "grad_norm": 2.6164279, "learning_rate": 4.311e-05, "token_acc": 0.7641791, "epoch": 0.78848561, "global_step/max_steps": "315/800", "percentage": "39.38%", "elapsed_time": "1h 7m 12s", "remaining_time": "1h 43m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.798845} +{"loss": 0.88310468, "grad_norm": 1.03278744, "learning_rate": 4.302e-05, "token_acc": 0.74305252, "epoch": 0.79098874, "global_step/max_steps": "316/800", "percentage": "39.50%", "elapsed_time": "1h 7m 26s", "remaining_time": "1h 43m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.802823} +{"loss": 0.84188884, "grad_norm": 1.92505753, "learning_rate": 4.294e-05, "token_acc": 0.74782565, "epoch": 0.79349186, "global_step/max_steps": "317/800", "percentage": "39.62%", "elapsed_time": "1h 7m 44s", "remaining_time": "1h 43m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.821438} +{"loss": 0.97497439, "grad_norm": 0.94833058, "learning_rate": 4.285e-05, "token_acc": 0.71982475, "epoch": 0.79599499, "global_step/max_steps": "318/800", "percentage": "39.75%", "elapsed_time": "1h 7m 58s", "remaining_time": "1h 43m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.825071} +{"loss": 0.80055922, "grad_norm": 4.41381598, "learning_rate": 4.276e-05, "token_acc": 0.76212987, "epoch": 0.79849812, "global_step/max_steps": "319/800", "percentage": "39.88%", "elapsed_time": "1h 8m 13s", "remaining_time": "1h 42m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.829515} +{"loss": 0.94182181, "grad_norm": 3.17788196, "learning_rate": 4.268e-05, "token_acc": 0.72694605, "epoch": 0.80100125, "global_step/max_steps": "320/800", "percentage": "40.00%", "elapsed_time": "1h 8m 26s", "remaining_time": "1h 42m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.831315} +{"loss": 0.90549529, "grad_norm": 1.1445744, "learning_rate": 4.259e-05, "token_acc": 0.73646757, "epoch": 0.80350438, "global_step/max_steps": "321/800", "percentage": "40.12%", "elapsed_time": "1h 8m 49s", "remaining_time": "1h 42m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.864359} +{"loss": 0.74950403, "grad_norm": 2.54009843, "learning_rate": 4.25e-05, "token_acc": 0.7781667, "epoch": 0.80600751, "global_step/max_steps": "322/800", "percentage": "40.25%", "elapsed_time": "1h 8m 58s", "remaining_time": "1h 42m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.852093} +{"loss": 0.73892236, "grad_norm": 1.71640968, "learning_rate": 4.242e-05, "token_acc": 0.78336737, "epoch": 0.80851064, "global_step/max_steps": "323/800", "percentage": "40.38%", "elapsed_time": "1h 9m 5s", "remaining_time": "1h 42m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.834211} +{"loss": 0.91326141, "grad_norm": 1.41082132, "learning_rate": 4.233e-05, "token_acc": 0.72872771, "epoch": 0.81101377, "global_step/max_steps": "324/800", "percentage": "40.50%", "elapsed_time": "1h 9m 18s", "remaining_time": "1h 41m 49s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.834014} +{"loss": 0.76426864, "grad_norm": 2.22265172, "learning_rate": 4.224e-05, "token_acc": 0.77488977, "epoch": 0.8135169, "global_step/max_steps": "325/800", "percentage": "40.62%", "elapsed_time": "1h 9m 27s", "remaining_time": "1h 41m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.821906} +{"loss": 0.63406843, "grad_norm": 2.48195481, "learning_rate": 4.215e-05, "token_acc": 0.80577532, "epoch": 0.81602003, "global_step/max_steps": "326/800", "percentage": "40.75%", "elapsed_time": "1h 9m 34s", "remaining_time": "1h 41m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.8039} +{"loss": 0.96347427, "grad_norm": 0.84986007, "learning_rate": 4.206e-05, "token_acc": 0.71931778, "epoch": 0.81852315, "global_step/max_steps": "327/800", "percentage": "40.88%", "elapsed_time": "1h 9m 47s", "remaining_time": "1h 40m 56s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.803661} +{"loss": 0.81136435, "grad_norm": 1.38118029, "learning_rate": 4.197e-05, "token_acc": 0.75613903, "epoch": 0.82102628, "global_step/max_steps": "328/800", "percentage": "41.00%", "elapsed_time": "1h 10m 1s", "remaining_time": "1h 40m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.806467} +{"loss": 0.99559963, "grad_norm": 0.89571327, "learning_rate": 4.188e-05, "token_acc": 0.71316626, "epoch": 0.82352941, "global_step/max_steps": "329/800", "percentage": "41.12%", "elapsed_time": "1h 10m 19s", "remaining_time": "1h 40m 40s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.823835} +{"loss": 0.74081379, "grad_norm": 1.31199241, "learning_rate": 4.179e-05, "token_acc": 0.78397711, "epoch": 0.82603254, "global_step/max_steps": "330/800", "percentage": "41.25%", "elapsed_time": "1h 10m 28s", "remaining_time": "1h 40m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.812902} +{"loss": 0.67982405, "grad_norm": 2.35703278, "learning_rate": 4.17e-05, "token_acc": 0.80103242, "epoch": 0.82853567, "global_step/max_steps": "331/800", "percentage": "41.38%", "elapsed_time": "1h 10m 48s", "remaining_time": "1h 40m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.832786} +{"loss": 0.79584765, "grad_norm": 1.03964019, "learning_rate": 4.161e-05, "token_acc": 0.76429442, "epoch": 0.8310388, "global_step/max_steps": "332/800", "percentage": "41.50%", "elapsed_time": "1h 11m 2s", "remaining_time": "1h 40m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.837943} +{"loss": 0.74099028, "grad_norm": 5.12631845, "learning_rate": 4.151e-05, "token_acc": 0.77948418, "epoch": 0.83354193, "global_step/max_steps": "333/800", "percentage": "41.62%", "elapsed_time": "1h 11m 10s", "remaining_time": "1h 39m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.82285} +{"loss": 0.89405191, "grad_norm": 1.37927985, "learning_rate": 4.142e-05, "token_acc": 0.73994004, "epoch": 0.83604506, "global_step/max_steps": "334/800", "percentage": "41.75%", "elapsed_time": "1h 11m 20s", "remaining_time": "1h 39m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.813378} +{"loss": 0.8875488, "grad_norm": 2.76615548, "learning_rate": 4.133e-05, "token_acc": 0.74650568, "epoch": 0.83854819, "global_step/max_steps": "335/800", "percentage": "41.88%", "elapsed_time": "1h 11m 30s", "remaining_time": "1h 39m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.804629} +{"loss": 0.75978041, "grad_norm": 1.16900396, "learning_rate": 4.124e-05, "token_acc": 0.77581864, "epoch": 0.84105131, "global_step/max_steps": "336/800", "percentage": "42.00%", "elapsed_time": "1h 11m 38s", "remaining_time": "1h 38m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.791088} +{"loss": 0.82947624, "grad_norm": 1.27550375, "learning_rate": 4.114e-05, "token_acc": 0.75641026, "epoch": 0.84355444, "global_step/max_steps": "337/800", "percentage": "42.12%", "elapsed_time": "1h 11m 50s", "remaining_time": "1h 38m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.789619} +{"loss": 0.82931304, "grad_norm": 1.59911931, "learning_rate": 4.105e-05, "token_acc": 0.7600472, "epoch": 0.84605757, "global_step/max_steps": "338/800", "percentage": "42.25%", "elapsed_time": "1h 12m 1s", "remaining_time": "1h 38m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.783357} +{"loss": 0.64012206, "grad_norm": 9.70893288, "learning_rate": 4.095e-05, "token_acc": 0.81311514, "epoch": 0.8485607, "global_step/max_steps": "339/800", "percentage": "42.38%", "elapsed_time": "1h 12m 8s", "remaining_time": "1h 38m 5s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.766701} +{"loss": 0.74048531, "grad_norm": 2.34840226, "learning_rate": 4.086e-05, "token_acc": 0.78495965, "epoch": 0.85106383, "global_step/max_steps": "340/800", "percentage": "42.50%", "elapsed_time": "1h 12m 15s", "remaining_time": "1h 37m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.75138} +{"loss": 0.82643706, "grad_norm": 0.97302258, "learning_rate": 4.076e-05, "token_acc": 0.75589381, "epoch": 0.85356696, "global_step/max_steps": "341/800", "percentage": "42.62%", "elapsed_time": "1h 12m 39s", "remaining_time": "1h 37m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.783113} +{"loss": 0.70333588, "grad_norm": 3.25323319, "learning_rate": 4.067e-05, "token_acc": 0.78492152, "epoch": 0.85607009, "global_step/max_steps": "342/800", "percentage": "42.75%", "elapsed_time": "1h 12m 49s", "remaining_time": "1h 37m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.775504} +{"loss": 0.82621348, "grad_norm": 6.38770819, "learning_rate": 4.057e-05, "token_acc": 0.75430696, "epoch": 0.85857322, "global_step/max_steps": "343/800", "percentage": "42.88%", "elapsed_time": "1h 12m 57s", "remaining_time": "1h 37m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.761987} +{"loss": 0.87461662, "grad_norm": 0.99341798, "learning_rate": 4.048e-05, "token_acc": 0.74406023, "epoch": 0.86107635, "global_step/max_steps": "344/800", "percentage": "43.00%", "elapsed_time": "1h 13m 10s", "remaining_time": "1h 36m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.761054} +{"loss": 0.85405564, "grad_norm": 1.70916879, "learning_rate": 4.038e-05, "token_acc": 0.74953524, "epoch": 0.86357947, "global_step/max_steps": "345/800", "percentage": "43.12%", "elapsed_time": "1h 13m 25s", "remaining_time": "1h 36m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.768789} +{"loss": 0.75622702, "grad_norm": 1.48861122, "learning_rate": 4.028e-05, "token_acc": 0.77930351, "epoch": 0.8660826, "global_step/max_steps": "346/800", "percentage": "43.25%", "elapsed_time": "1h 13m 35s", "remaining_time": "1h 36m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.759598} +{"loss": 0.81863284, "grad_norm": 1.90175915, "learning_rate": 4.019e-05, "token_acc": 0.75933444, "epoch": 0.86858573, "global_step/max_steps": "347/800", "percentage": "43.38%", "elapsed_time": "1h 13m 46s", "remaining_time": "1h 36m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.754989} +{"loss": 0.71640992, "grad_norm": 1.05806768, "learning_rate": 4.009e-05, "token_acc": 0.78719184, "epoch": 0.87108886, "global_step/max_steps": "348/800", "percentage": "43.50%", "elapsed_time": "1h 13m 52s", "remaining_time": "1h 35m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.736086} +{"loss": 0.89129853, "grad_norm": 1.31265211, "learning_rate": 3.999e-05, "token_acc": 0.7413303, "epoch": 0.87359199, "global_step/max_steps": "349/800", "percentage": "43.62%", "elapsed_time": "1h 14m 4s", "remaining_time": "1h 35m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.733274} +{"loss": 0.91755259, "grad_norm": 4.35149002, "learning_rate": 3.989e-05, "token_acc": 0.7297975, "epoch": 0.87609512, "global_step/max_steps": "350/800", "percentage": "43.75%", "elapsed_time": "1h 14m 18s", "remaining_time": "1h 35m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.738571} +{"loss": 0.91888565, "grad_norm": 1.26866138, "learning_rate": 3.979e-05, "token_acc": 0.73217954, "epoch": 0.87859825, "global_step/max_steps": "351/800", "percentage": "43.88%", "elapsed_time": "1h 14m 41s", "remaining_time": "1h 35m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.767164} +{"loss": 0.8852011, "grad_norm": 0.97933608, "learning_rate": 3.969e-05, "token_acc": 0.73938141, "epoch": 0.88110138, "global_step/max_steps": "352/800", "percentage": "44.00%", "elapsed_time": "1h 14m 52s", "remaining_time": "1h 35m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.761271} +{"loss": 0.88514113, "grad_norm": 1.04293799, "learning_rate": 3.96e-05, "token_acc": 0.7363862, "epoch": 0.88360451, "global_step/max_steps": "353/800", "percentage": "44.12%", "elapsed_time": "1h 15m 9s", "remaining_time": "1h 35m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.772309} +{"loss": 0.862131, "grad_norm": 4.19457626, "learning_rate": 3.95e-05, "token_acc": 0.74787153, "epoch": 0.88610763, "global_step/max_steps": "354/800", "percentage": "44.25%", "elapsed_time": "1h 15m 24s", "remaining_time": "1h 35m 0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.780833} +{"loss": 0.93183351, "grad_norm": 1.06239164, "learning_rate": 3.94e-05, "token_acc": 0.72532189, "epoch": 0.88861076, "global_step/max_steps": "355/800", "percentage": "44.38%", "elapsed_time": "1h 15m 37s", "remaining_time": "1h 34m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.780081} +{"loss": 0.89233685, "grad_norm": 0.78766531, "learning_rate": 3.929e-05, "token_acc": 0.74096871, "epoch": 0.89111389, "global_step/max_steps": "356/800", "percentage": "44.50%", "elapsed_time": "1h 15m 47s", "remaining_time": "1h 34m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.772879} +{"loss": 0.85514921, "grad_norm": 3.86669493, "learning_rate": 3.919e-05, "token_acc": 0.75142161, "epoch": 0.89361702, "global_step/max_steps": "357/800", "percentage": "44.62%", "elapsed_time": "1h 15m 57s", "remaining_time": "1h 34m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.763837} +{"loss": 0.75261879, "grad_norm": 1.39350688, "learning_rate": 3.909e-05, "token_acc": 0.78105746, "epoch": 0.89612015, "global_step/max_steps": "358/800", "percentage": "44.75%", "elapsed_time": "1h 16m 7s", "remaining_time": "1h 33m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.757605} +{"loss": 0.75768346, "grad_norm": 2.33922267, "learning_rate": 3.899e-05, "token_acc": 0.77343803, "epoch": 0.89862328, "global_step/max_steps": "359/800", "percentage": "44.88%", "elapsed_time": "1h 16m 16s", "remaining_time": "1h 33m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.747328} +{"loss": 0.83681321, "grad_norm": 1.79213333, "learning_rate": 3.889e-05, "token_acc": 0.75140896, "epoch": 0.90112641, "global_step/max_steps": "360/800", "percentage": "45.00%", "elapsed_time": "1h 16m 32s", "remaining_time": "1h 33m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.754455} +{"loss": 0.84706032, "grad_norm": 1.29057419, "learning_rate": 3.879e-05, "token_acc": 0.75707128, "epoch": 0.90362954, "global_step/max_steps": "361/800", "percentage": "45.12%", "elapsed_time": "1h 16m 55s", "remaining_time": "1h 33m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.783485} +{"loss": 0.82532871, "grad_norm": 1.3079356, "learning_rate": 3.868e-05, "token_acc": 0.75275495, "epoch": 0.90613267, "global_step/max_steps": "362/800", "percentage": "45.25%", "elapsed_time": "1h 17m 8s", "remaining_time": "1h 33m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.784383} +{"loss": 0.77145064, "grad_norm": 1.86684632, "learning_rate": 3.858e-05, "token_acc": 0.77454607, "epoch": 0.90863579, "global_step/max_steps": "363/800", "percentage": "45.38%", "elapsed_time": "1h 17m 16s", "remaining_time": "1h 33m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.772519} +{"loss": 0.69294703, "grad_norm": 1.12101698, "learning_rate": 3.848e-05, "token_acc": 0.78643395, "epoch": 0.91113892, "global_step/max_steps": "364/800", "percentage": "45.50%", "elapsed_time": "1h 17m 30s", "remaining_time": "1h 32m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.776023} +{"loss": 0.83076137, "grad_norm": 1.48279607, "learning_rate": 3.837e-05, "token_acc": 0.75289355, "epoch": 0.91364205, "global_step/max_steps": "365/800", "percentage": "45.62%", "elapsed_time": "1h 17m 47s", "remaining_time": "1h 32m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.786901} +{"loss": 0.81226718, "grad_norm": 1.18039501, "learning_rate": 3.827e-05, "token_acc": 0.75326797, "epoch": 0.91614518, "global_step/max_steps": "366/800", "percentage": "45.75%", "elapsed_time": "1h 17m 58s", "remaining_time": "1h 32m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.781831} +{"loss": 0.86535406, "grad_norm": 1.02654374, "learning_rate": 3.817e-05, "token_acc": 0.74455348, "epoch": 0.91864831, "global_step/max_steps": "367/800", "percentage": "45.88%", "elapsed_time": "1h 18m 7s", "remaining_time": "1h 32m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.771888} +{"loss": 0.68300933, "grad_norm": 2.46294069, "learning_rate": 3.806e-05, "token_acc": 0.79405729, "epoch": 0.92115144, "global_step/max_steps": "368/800", "percentage": "46.00%", "elapsed_time": "1h 18m 16s", "remaining_time": "1h 31m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.762103} +{"loss": 0.92550898, "grad_norm": 1.63826227, "learning_rate": 3.796e-05, "token_acc": 0.72975016, "epoch": 0.92365457, "global_step/max_steps": "369/800", "percentage": "46.12%", "elapsed_time": "1h 18m 32s", "remaining_time": "1h 31m 44s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.770532} +{"loss": 0.75164199, "grad_norm": 2.42835736, "learning_rate": 3.785e-05, "token_acc": 0.7758667, "epoch": 0.9261577, "global_step/max_steps": "370/800", "percentage": "46.25%", "elapsed_time": "1h 18m 42s", "remaining_time": "1h 31m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.76298} +{"loss": 0.84081465, "grad_norm": 2.32463837, "learning_rate": 3.775e-05, "token_acc": 0.75062079, "epoch": 0.92866083, "global_step/max_steps": "371/800", "percentage": "46.38%", "elapsed_time": "1h 19m 6s", "remaining_time": "1h 31m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.792119} +{"loss": 0.90758997, "grad_norm": 1.09941673, "learning_rate": 3.764e-05, "token_acc": 0.72712465, "epoch": 0.93116395, "global_step/max_steps": "372/800", "percentage": "46.50%", "elapsed_time": "1h 19m 27s", "remaining_time": "1h 31m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.813499} +{"loss": 0.81686044, "grad_norm": 1.47862947, "learning_rate": 3.754e-05, "token_acc": 0.75834983, "epoch": 0.93366708, "global_step/max_steps": "373/800", "percentage": "46.62%", "elapsed_time": "1h 19m 39s", "remaining_time": "1h 31m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.812006} +{"loss": 0.91215783, "grad_norm": 2.8805809, "learning_rate": 3.743e-05, "token_acc": 0.73503345, "epoch": 0.93617021, "global_step/max_steps": "374/800", "percentage": "46.75%", "elapsed_time": "1h 19m 55s", "remaining_time": "1h 31m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.821827} +{"loss": 0.85794914, "grad_norm": 2.78897882, "learning_rate": 3.732e-05, "token_acc": 0.74767096, "epoch": 0.93867334, "global_step/max_steps": "375/800", "percentage": "46.88%", "elapsed_time": "1h 20m 6s", "remaining_time": "1h 30m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.814719} +{"loss": 0.83170676, "grad_norm": 2.07290912, "learning_rate": 3.722e-05, "token_acc": 0.75711123, "epoch": 0.94117647, "global_step/max_steps": "376/800", "percentage": "47.00%", "elapsed_time": "1h 20m 23s", "remaining_time": "1h 30m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.82584} +{"loss": 0.76126683, "grad_norm": 5.17769766, "learning_rate": 3.711e-05, "token_acc": 0.76815558, "epoch": 0.9436796, "global_step/max_steps": "377/800", "percentage": "47.12%", "elapsed_time": "1h 20m 30s", "remaining_time": "1h 30m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.812901} +{"loss": 0.72191024, "grad_norm": 2.75681305, "learning_rate": 3.7e-05, "token_acc": 0.78498542, "epoch": 0.94618273, "global_step/max_steps": "378/800", "percentage": "47.25%", "elapsed_time": "1h 20m 40s", "remaining_time": "1h 30m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.80362} +{"loss": 0.98131502, "grad_norm": 0.91467148, "learning_rate": 3.689e-05, "token_acc": 0.71763886, "epoch": 0.94868586, "global_step/max_steps": "379/800", "percentage": "47.38%", "elapsed_time": "1h 20m 53s", "remaining_time": "1h 29m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.805767} +{"loss": 0.82678688, "grad_norm": 1.75475824, "learning_rate": 3.678e-05, "token_acc": 0.75600305, "epoch": 0.95118899, "global_step/max_steps": "380/800", "percentage": "47.50%", "elapsed_time": "1h 21m 3s", "remaining_time": "1h 29m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.798399} +{"loss": 0.83233976, "grad_norm": 1.01018834, "learning_rate": 3.668e-05, "token_acc": 0.75275008, "epoch": 0.95369212, "global_step/max_steps": "381/800", "percentage": "47.62%", "elapsed_time": "1h 21m 26s", "remaining_time": "1h 29m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.824957} +{"loss": 0.74160624, "grad_norm": 2.13915372, "learning_rate": 3.657e-05, "token_acc": 0.77895645, "epoch": 0.95619524, "global_step/max_steps": "382/800", "percentage": "47.75%", "elapsed_time": "1h 21m 37s", "remaining_time": "1h 29m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.819945} +{"loss": 0.7494303, "grad_norm": 2.62939191, "learning_rate": 3.646e-05, "token_acc": 0.77379965, "epoch": 0.95869837, "global_step/max_steps": "383/800", "percentage": "47.88%", "elapsed_time": "1h 21m 52s", "remaining_time": "1h 29m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.823823} +{"loss": 0.61918688, "grad_norm": 3.62751269, "learning_rate": 3.635e-05, "token_acc": 0.81219146, "epoch": 0.9612015, "global_step/max_steps": "384/800", "percentage": "48.00%", "elapsed_time": "1h 22m 0s", "remaining_time": "1h 28m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.813134} +{"loss": 0.8018133, "grad_norm": 2.83544755, "learning_rate": 3.624e-05, "token_acc": 0.76139268, "epoch": 0.96370463, "global_step/max_steps": "385/800", "percentage": "48.12%", "elapsed_time": "1h 22m 14s", "remaining_time": "1h 28m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.815352} +{"loss": 0.83981562, "grad_norm": 1.40892518, "learning_rate": 3.613e-05, "token_acc": 0.74885503, "epoch": 0.96620776, "global_step/max_steps": "386/800", "percentage": "48.25%", "elapsed_time": "1h 22m 30s", "remaining_time": "1h 28m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.825061} +{"loss": 0.90877789, "grad_norm": 2.76792717, "learning_rate": 3.602e-05, "token_acc": 0.72972278, "epoch": 0.96871089, "global_step/max_steps": "387/800", "percentage": "48.38%", "elapsed_time": "1h 22m 44s", "remaining_time": "1h 28m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.827329} +{"loss": 0.76235682, "grad_norm": 3.36054373, "learning_rate": 3.591e-05, "token_acc": 0.77374167, "epoch": 0.97121402, "global_step/max_steps": "388/800", "percentage": "48.50%", "elapsed_time": "1h 22m 53s", "remaining_time": "1h 28m 0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.816698} +{"loss": 0.9299885, "grad_norm": 1.07044995, "learning_rate": 3.58e-05, "token_acc": 0.72747396, "epoch": 0.97371715, "global_step/max_steps": "389/800", "percentage": "48.62%", "elapsed_time": "1h 23m 5s", "remaining_time": "1h 27m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.815817} +{"loss": 0.66394019, "grad_norm": 4.47436857, "learning_rate": 3.569e-05, "token_acc": 0.80285897, "epoch": 0.97622028, "global_step/max_steps": "390/800", "percentage": "48.75%", "elapsed_time": "1h 23m 11s", "remaining_time": "1h 27m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.797201} +{"loss": 0.80666566, "grad_norm": 1.58856905, "learning_rate": 3.558e-05, "token_acc": 0.75998892, "epoch": 0.9787234, "global_step/max_steps": "391/800", "percentage": "48.88%", "elapsed_time": "1h 23m 31s", "remaining_time": "1h 27m 21s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.815371} +{"loss": 0.77419317, "grad_norm": 1.55041373, "learning_rate": 3.547e-05, "token_acc": 0.76798875, "epoch": 0.98122653, "global_step/max_steps": "392/800", "percentage": "49.00%", "elapsed_time": "1h 23m 43s", "remaining_time": "1h 27m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.812503} +{"loss": 0.78832614, "grad_norm": 1.49674869, "learning_rate": 3.535e-05, "token_acc": 0.7652964, "epoch": 0.98372966, "global_step/max_steps": "393/800", "percentage": "49.12%", "elapsed_time": "1h 23m 52s", "remaining_time": "1h 26m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.805061} +{"loss": 0.73026156, "grad_norm": 1.44095755, "learning_rate": 3.524e-05, "token_acc": 0.78270703, "epoch": 0.98623279, "global_step/max_steps": "394/800", "percentage": "49.25%", "elapsed_time": "1h 23m 59s", "remaining_time": "1h 26m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.788285} +{"loss": 0.82078242, "grad_norm": 0.94299924, "learning_rate": 3.513e-05, "token_acc": 0.76068003, "epoch": 0.98873592, "global_step/max_steps": "395/800", "percentage": "49.38%", "elapsed_time": "1h 24m 6s", "remaining_time": "1h 26m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.773801} +{"loss": 0.73169303, "grad_norm": 1.85878718, "learning_rate": 3.502e-05, "token_acc": 0.78014785, "epoch": 0.99123905, "global_step/max_steps": "396/800", "percentage": "49.50%", "elapsed_time": "1h 24m 16s", "remaining_time": "1h 25m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.767752} +{"loss": 0.75955564, "grad_norm": 2.45616388, "learning_rate": 3.491e-05, "token_acc": 0.77708904, "epoch": 0.99374218, "global_step/max_steps": "397/800", "percentage": "49.62%", "elapsed_time": "1h 24m 24s", "remaining_time": "1h 25m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.75691} +{"loss": 0.71227753, "grad_norm": 5.84539318, "learning_rate": 3.479e-05, "token_acc": 0.78884389, "epoch": 0.99624531, "global_step/max_steps": "398/800", "percentage": "49.75%", "elapsed_time": "1h 24m 31s", "remaining_time": "1h 25m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.741557} +{"loss": 0.85712898, "grad_norm": 1.60962403, "learning_rate": 3.468e-05, "token_acc": 0.74855405, "epoch": 0.99874844, "global_step/max_steps": "399/800", "percentage": "49.88%", "elapsed_time": "1h 24m 46s", "remaining_time": "1h 25m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.747381} +{"loss": 0.74227279, "grad_norm": 1.68284047, "learning_rate": 3.457e-05, "token_acc": 0.77445932, "epoch": 1.0, "global_step/max_steps": "400/800", "percentage": "50.00%", "elapsed_time": "1h 24m 51s", "remaining_time": "1h 24m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.726879} +{"loss": 0.74705911, "grad_norm": 0.90425384, "learning_rate": 3.445e-05, "token_acc": 0.7750927, "epoch": 1.00250313, "global_step/max_steps": "401/800", "percentage": "50.12%", "elapsed_time": "1h 25m 12s", "remaining_time": "1h 24m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.748442} +{"loss": 0.84941208, "grad_norm": 1.5840199, "learning_rate": 3.434e-05, "token_acc": 0.74677801, "epoch": 1.00500626, "global_step/max_steps": "402/800", "percentage": "50.25%", "elapsed_time": "1h 25m 23s", "remaining_time": "1h 24m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.743856} +{"loss": 0.73906344, "grad_norm": 1.72647536, "learning_rate": 3.423e-05, "token_acc": 0.77825883, "epoch": 1.00750939, "global_step/max_steps": "403/800", "percentage": "50.38%", "elapsed_time": "1h 25m 34s", "remaining_time": "1h 24m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.740207} +{"loss": 0.64173341, "grad_norm": 3.905725, "learning_rate": 3.411e-05, "token_acc": 0.80396766, "epoch": 1.01001252, "global_step/max_steps": "404/800", "percentage": "50.50%", "elapsed_time": "1h 25m 41s", "remaining_time": "1h 23m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725633} +{"loss": 0.75734448, "grad_norm": 13.16217041, "learning_rate": 3.4e-05, "token_acc": 0.77654811, "epoch": 1.01251564, "global_step/max_steps": "405/800", "percentage": "50.62%", "elapsed_time": "1h 25m 50s", "remaining_time": "1h 23m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.716286} +{"loss": 0.80216503, "grad_norm": 2.61844921, "learning_rate": 3.388e-05, "token_acc": 0.76345551, "epoch": 1.01501877, "global_step/max_steps": "406/800", "percentage": "50.75%", "elapsed_time": "1h 26m 2s", "remaining_time": "1h 23m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.713057} +{"loss": 0.81623882, "grad_norm": 0.99628723, "learning_rate": 3.377e-05, "token_acc": 0.76037097, "epoch": 1.0175219, "global_step/max_steps": "407/800", "percentage": "50.88%", "elapsed_time": "1h 26m 9s", "remaining_time": "1h 23m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.701439} +{"loss": 0.84095067, "grad_norm": 0.92618155, "learning_rate": 3.365e-05, "token_acc": 0.74826977, "epoch": 1.02002503, "global_step/max_steps": "408/800", "percentage": "51.00%", "elapsed_time": "1h 26m 21s", "remaining_time": "1h 22m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.699432} +{"loss": 0.69965148, "grad_norm": 1.48233569, "learning_rate": 3.354e-05, "token_acc": 0.79205833, "epoch": 1.02252816, "global_step/max_steps": "409/800", "percentage": "51.12%", "elapsed_time": "1h 26m 28s", "remaining_time": "1h 22m 40s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.684856} +{"loss": 0.9892264, "grad_norm": 0.82793266, "learning_rate": 3.342e-05, "token_acc": 0.71664319, "epoch": 1.02503129, "global_step/max_steps": "410/800", "percentage": "51.25%", "elapsed_time": "1h 26m 52s", "remaining_time": "1h 22m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.711235} +{"loss": 0.74440783, "grad_norm": 1.22301519, "learning_rate": 3.331e-05, "token_acc": 0.7746188, "epoch": 1.02753442, "global_step/max_steps": "411/800", "percentage": "51.38%", "elapsed_time": "1h 27m 12s", "remaining_time": "1h 22m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.73112} +{"loss": 0.88856232, "grad_norm": 9.8209095, "learning_rate": 3.319e-05, "token_acc": 0.73647216, "epoch": 1.03003755, "global_step/max_steps": "412/800", "percentage": "51.50%", "elapsed_time": "1h 27m 28s", "remaining_time": "1h 22m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.737085} +{"loss": 0.63841319, "grad_norm": 1.50395608, "learning_rate": 3.307e-05, "token_acc": 0.81355757, "epoch": 1.03254068, "global_step/max_steps": "413/800", "percentage": "51.62%", "elapsed_time": "1h 27m 36s", "remaining_time": "1h 22m 5s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725926} +{"loss": 0.75940752, "grad_norm": 2.57251263, "learning_rate": 3.296e-05, "token_acc": 0.77562379, "epoch": 1.0350438, "global_step/max_steps": "414/800", "percentage": "51.75%", "elapsed_time": "1h 27m 47s", "remaining_time": "1h 21m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.722739} +{"loss": 0.84972161, "grad_norm": 1.39496577, "learning_rate": 3.284e-05, "token_acc": 0.74833971, "epoch": 1.03754693, "global_step/max_steps": "415/800", "percentage": "51.88%", "elapsed_time": "1h 28m 2s", "remaining_time": "1h 21m 40s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.727831} +{"loss": 0.81918871, "grad_norm": 0.87798691, "learning_rate": 3.273e-05, "token_acc": 0.75701506, "epoch": 1.04005006, "global_step/max_steps": "416/800", "percentage": "52.00%", "elapsed_time": "1h 28m 12s", "remaining_time": "1h 21m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.721322} +{"loss": 0.87834918, "grad_norm": 1.19117868, "learning_rate": 3.261e-05, "token_acc": 0.74330179, "epoch": 1.04255319, "global_step/max_steps": "417/800", "percentage": "52.12%", "elapsed_time": "1h 28m 22s", "remaining_time": "1h 21m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.713972} +{"loss": 0.83710915, "grad_norm": 1.14685297, "learning_rate": 3.249e-05, "token_acc": 0.74993763, "epoch": 1.04505632, "global_step/max_steps": "418/800", "percentage": "52.25%", "elapsed_time": "1h 28m 39s", "remaining_time": "1h 21m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725225} +{"loss": 0.66953874, "grad_norm": 3.08930421, "learning_rate": 3.237e-05, "token_acc": 0.79418659, "epoch": 1.04755945, "global_step/max_steps": "419/800", "percentage": "52.38%", "elapsed_time": "1h 28m 46s", "remaining_time": "1h 20m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.711642} +{"loss": 0.63265324, "grad_norm": 3.35778618, "learning_rate": 3.226e-05, "token_acc": 0.80590259, "epoch": 1.05006258, "global_step/max_steps": "420/800", "percentage": "52.50%", "elapsed_time": "1h 28m 53s", "remaining_time": "1h 20m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.698559} +{"loss": 0.81876266, "grad_norm": 2.20818019, "learning_rate": 3.214e-05, "token_acc": 0.75807949, "epoch": 1.05256571, "global_step/max_steps": "421/800", "percentage": "52.62%", "elapsed_time": "1h 29m 23s", "remaining_time": "1h 20m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.739365} +{"loss": 0.8068949, "grad_norm": 1.64020693, "learning_rate": 3.202e-05, "token_acc": 0.75843214, "epoch": 1.05506884, "global_step/max_steps": "422/800", "percentage": "52.75%", "elapsed_time": "1h 29m 32s", "remaining_time": "1h 20m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.729207} +{"loss": 0.69108367, "grad_norm": 1.57941735, "learning_rate": 3.19e-05, "token_acc": 0.79189213, "epoch": 1.05757196, "global_step/max_steps": "423/800", "percentage": "52.88%", "elapsed_time": "1h 29m 39s", "remaining_time": "1h 19m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.716238} +{"loss": 0.85066366, "grad_norm": 1.27473342, "learning_rate": 3.179e-05, "token_acc": 0.74794123, "epoch": 1.06007509, "global_step/max_steps": "424/800", "percentage": "53.00%", "elapsed_time": "1h 29m 54s", "remaining_time": "1h 19m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.721462} +{"loss": 0.75391674, "grad_norm": 1.12977409, "learning_rate": 3.167e-05, "token_acc": 0.76795086, "epoch": 1.06257822, "global_step/max_steps": "425/800", "percentage": "53.12%", "elapsed_time": "1h 30m 5s", "remaining_time": "1h 19m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.718421} +{"loss": 0.77603966, "grad_norm": 2.43067479, "learning_rate": 3.155e-05, "token_acc": 0.76930631, "epoch": 1.06508135, "global_step/max_steps": "426/800", "percentage": "53.25%", "elapsed_time": "1h 30m 15s", "remaining_time": "1h 19m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.710568} +{"loss": 0.81164122, "grad_norm": 5.90386772, "learning_rate": 3.143e-05, "token_acc": 0.76376701, "epoch": 1.06758448, "global_step/max_steps": "427/800", "percentage": "53.37%", "elapsed_time": "1h 30m 24s", "remaining_time": "1h 18m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.702887} +{"loss": 0.78134561, "grad_norm": 1.78872657, "learning_rate": 3.131e-05, "token_acc": 0.76587181, "epoch": 1.07008761, "global_step/max_steps": "428/800", "percentage": "53.50%", "elapsed_time": "1h 30m 40s", "remaining_time": "1h 18m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.709926} +{"loss": 0.78165799, "grad_norm": 1.18675101, "learning_rate": 3.119e-05, "token_acc": 0.76608566, "epoch": 1.07259074, "global_step/max_steps": "429/800", "percentage": "53.62%", "elapsed_time": "1h 30m 53s", "remaining_time": "1h 18m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.710973} +{"loss": 0.8006016, "grad_norm": 4.44053507, "learning_rate": 3.107e-05, "token_acc": 0.76697736, "epoch": 1.07509387, "global_step/max_steps": "430/800", "percentage": "53.75%", "elapsed_time": "1h 31m 2s", "remaining_time": "1h 18m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.702774} +{"loss": 0.80701488, "grad_norm": 1.72381389, "learning_rate": 3.096e-05, "token_acc": 0.76442006, "epoch": 1.077597, "global_step/max_steps": "431/800", "percentage": "53.87%", "elapsed_time": "1h 31m 27s", "remaining_time": "1h 18m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.730991} +{"loss": 0.88949072, "grad_norm": 1.25671172, "learning_rate": 3.084e-05, "token_acc": 0.74080537, "epoch": 1.08010013, "global_step/max_steps": "432/800", "percentage": "54.00%", "elapsed_time": "1h 31m 39s", "remaining_time": "1h 18m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.729346} +{"loss": 0.8306132, "grad_norm": 17.01145554, "learning_rate": 3.072e-05, "token_acc": 0.74970918, "epoch": 1.08260325, "global_step/max_steps": "433/800", "percentage": "54.12%", "elapsed_time": "1h 31m 53s", "remaining_time": "1h 17m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.730968} +{"loss": 0.66132367, "grad_norm": 2.27363563, "learning_rate": 3.06e-05, "token_acc": 0.79768708, "epoch": 1.08510638, "global_step/max_steps": "434/800", "percentage": "54.25%", "elapsed_time": "1h 32m 3s", "remaining_time": "1h 17m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725962} +{"loss": 0.84343827, "grad_norm": 2.76108837, "learning_rate": 3.048e-05, "token_acc": 0.75298558, "epoch": 1.08760951, "global_step/max_steps": "435/800", "percentage": "54.37%", "elapsed_time": "1h 32m 17s", "remaining_time": "1h 17m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.729747} +{"loss": 0.74641532, "grad_norm": 1.85707438, "learning_rate": 3.036e-05, "token_acc": 0.77652962, "epoch": 1.09011264, "global_step/max_steps": "436/800", "percentage": "54.50%", "elapsed_time": "1h 32m 24s", "remaining_time": "1h 17m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.715559} +{"loss": 0.82781518, "grad_norm": 0.93142921, "learning_rate": 3.024e-05, "token_acc": 0.75352322, "epoch": 1.09261577, "global_step/max_steps": "437/800", "percentage": "54.62%", "elapsed_time": "1h 32m 39s", "remaining_time": "1h 16m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.720656} +{"loss": 0.82426822, "grad_norm": 1.37741339, "learning_rate": 3.012e-05, "token_acc": 0.75441353, "epoch": 1.0951189, "global_step/max_steps": "438/800", "percentage": "54.75%", "elapsed_time": "1h 32m 55s", "remaining_time": "1h 16m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.727787} +{"loss": 0.6596635, "grad_norm": 6.93023205, "learning_rate": 3e-05, "token_acc": 0.80216408, "epoch": 1.09762203, "global_step/max_steps": "439/800", "percentage": "54.87%", "elapsed_time": "1h 33m 3s", "remaining_time": "1h 16m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.717198} +{"loss": 0.50663531, "grad_norm": 4.86625242, "learning_rate": 2.988e-05, "token_acc": 0.84599567, "epoch": 1.10012516, "global_step/max_steps": "440/800", "percentage": "55.00%", "elapsed_time": "1h 33m 11s", "remaining_time": "1h 16m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707938} +{"loss": 0.86477107, "grad_norm": 1.60285521, "learning_rate": 2.976e-05, "token_acc": 0.74706401, "epoch": 1.10262829, "global_step/max_steps": "441/800", "percentage": "55.12%", "elapsed_time": "1h 33m 34s", "remaining_time": "1h 16m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.731154} +{"loss": 0.63763177, "grad_norm": 1.73332298, "learning_rate": 2.964e-05, "token_acc": 0.80716227, "epoch": 1.10513141, "global_step/max_steps": "442/800", "percentage": "55.25%", "elapsed_time": "1h 33m 41s", "remaining_time": "1h 15m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.717454} +{"loss": 0.72171021, "grad_norm": 2.34430957, "learning_rate": 2.952e-05, "token_acc": 0.78386881, "epoch": 1.10763454, "global_step/max_steps": "443/800", "percentage": "55.38%", "elapsed_time": "1h 33m 49s", "remaining_time": "1h 15m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.706387} +{"loss": 0.85522449, "grad_norm": 0.90607494, "learning_rate": 2.939e-05, "token_acc": 0.74329001, "epoch": 1.11013767, "global_step/max_steps": "444/800", "percentage": "55.50%", "elapsed_time": "1h 34m 3s", "remaining_time": "1h 15m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.710417} +{"loss": 0.78536272, "grad_norm": 0.7494154, "learning_rate": 2.927e-05, "token_acc": 0.76128437, "epoch": 1.1126408, "global_step/max_steps": "445/800", "percentage": "55.62%", "elapsed_time": "1h 34m 17s", "remaining_time": "1h 15m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.712389} +{"loss": 0.85174429, "grad_norm": 0.79804361, "learning_rate": 2.915e-05, "token_acc": 0.74804931, "epoch": 1.11514393, "global_step/max_steps": "446/800", "percentage": "55.75%", "elapsed_time": "1h 34m 31s", "remaining_time": "1h 15m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.715184} +{"loss": 0.7649672, "grad_norm": 1.14488196, "learning_rate": 2.903e-05, "token_acc": 0.76647755, "epoch": 1.11764706, "global_step/max_steps": "447/800", "percentage": "55.88%", "elapsed_time": "1h 34m 43s", "remaining_time": "1h 14m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.713109} +{"loss": 0.74904931, "grad_norm": 1.34436309, "learning_rate": 2.891e-05, "token_acc": 0.77574218, "epoch": 1.12015019, "global_step/max_steps": "448/800", "percentage": "56.00%", "elapsed_time": "1h 34m 51s", "remaining_time": "1h 14m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.703571} +{"loss": 0.60078502, "grad_norm": 4.40691662, "learning_rate": 2.879e-05, "token_acc": 0.82336514, "epoch": 1.12265332, "global_step/max_steps": "449/800", "percentage": "56.12%", "elapsed_time": "1h 35m 1s", "remaining_time": "1h 14m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.697654} +{"loss": 0.674658, "grad_norm": 1.33138478, "learning_rate": 2.867e-05, "token_acc": 0.79699033, "epoch": 1.12515645, "global_step/max_steps": "450/800", "percentage": "56.25%", "elapsed_time": "1h 35m 12s", "remaining_time": "1h 14m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.693214} +{"loss": 0.69787347, "grad_norm": 1.46632636, "learning_rate": 2.855e-05, "token_acc": 0.78906999, "epoch": 1.12765957, "global_step/max_steps": "451/800", "percentage": "56.38%", "elapsed_time": "1h 35m 29s", "remaining_time": "1h 13m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.703266} +{"loss": 0.69153202, "grad_norm": 1.36383772, "learning_rate": 2.843e-05, "token_acc": 0.79126028, "epoch": 1.1301627, "global_step/max_steps": "452/800", "percentage": "56.50%", "elapsed_time": "1h 35m 36s", "remaining_time": "1h 13m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.690234} +{"loss": 0.8228941, "grad_norm": 1.31498432, "learning_rate": 2.83e-05, "token_acc": 0.75329866, "epoch": 1.13266583, "global_step/max_steps": "453/800", "percentage": "56.62%", "elapsed_time": "1h 35m 44s", "remaining_time": "1h 13m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.68028} +{"loss": 0.91494793, "grad_norm": 0.93049037, "learning_rate": 2.818e-05, "token_acc": 0.72867133, "epoch": 1.13516896, "global_step/max_steps": "454/800", "percentage": "56.75%", "elapsed_time": "1h 36m 1s", "remaining_time": "1h 13m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.689582} +{"loss": 0.68990958, "grad_norm": 1.72542715, "learning_rate": 2.806e-05, "token_acc": 0.789293, "epoch": 1.13767209, "global_step/max_steps": "455/800", "percentage": "56.88%", "elapsed_time": "1h 36m 12s", "remaining_time": "1h 12m 56s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.684789} +{"loss": 0.74584264, "grad_norm": 5.27695608, "learning_rate": 2.794e-05, "token_acc": 0.77504516, "epoch": 1.14017522, "global_step/max_steps": "456/800", "percentage": "57.00%", "elapsed_time": "1h 36m 22s", "remaining_time": "1h 12m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.679256} +{"loss": 0.78102624, "grad_norm": 1.10264039, "learning_rate": 2.782e-05, "token_acc": 0.76382335, "epoch": 1.14267835, "global_step/max_steps": "457/800", "percentage": "57.12%", "elapsed_time": "1h 36m 36s", "remaining_time": "1h 12m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.682841} +{"loss": 0.79478312, "grad_norm": 5.35921431, "learning_rate": 2.769e-05, "token_acc": 0.76668254, "epoch": 1.14518148, "global_step/max_steps": "458/800", "percentage": "57.25%", "elapsed_time": "1h 36m 45s", "remaining_time": "1h 12m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.674488} +{"loss": 0.83424109, "grad_norm": 0.93042803, "learning_rate": 2.757e-05, "token_acc": 0.74945359, "epoch": 1.14768461, "global_step/max_steps": "459/800", "percentage": "57.38%", "elapsed_time": "1h 37m 2s", "remaining_time": "1h 12m 5s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.683783} +{"loss": 0.87700915, "grad_norm": 1.17884541, "learning_rate": 2.745e-05, "token_acc": 0.74314797, "epoch": 1.15018773, "global_step/max_steps": "460/800", "percentage": "57.50%", "elapsed_time": "1h 37m 13s", "remaining_time": "1h 11m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.681193} +{"loss": 0.82326198, "grad_norm": 2.51372099, "learning_rate": 2.733e-05, "token_acc": 0.75382956, "epoch": 1.15269086, "global_step/max_steps": "461/800", "percentage": "57.63%", "elapsed_time": "1h 37m 34s", "remaining_time": "1h 11m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.69904} +{"loss": 0.85832691, "grad_norm": 4.04278564, "learning_rate": 2.721e-05, "token_acc": 0.74696638, "epoch": 1.15519399, "global_step/max_steps": "462/800", "percentage": "57.75%", "elapsed_time": "1h 37m 49s", "remaining_time": "1h 11m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.704083} +{"loss": 0.84838682, "grad_norm": 4.86941576, "learning_rate": 2.708e-05, "token_acc": 0.745726, "epoch": 1.15769712, "global_step/max_steps": "463/800", "percentage": "57.88%", "elapsed_time": "1h 38m 4s", "remaining_time": "1h 11m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.708469} +{"loss": 0.91254473, "grad_norm": 0.60623103, "learning_rate": 2.696e-05, "token_acc": 0.7308365, "epoch": 1.16020025, "global_step/max_steps": "464/800", "percentage": "58.00%", "elapsed_time": "1h 38m 31s", "remaining_time": "1h 11m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.739419} +{"loss": 0.7167446, "grad_norm": 1.06516552, "learning_rate": 2.684e-05, "token_acc": 0.7814047, "epoch": 1.16270338, "global_step/max_steps": "465/800", "percentage": "58.13%", "elapsed_time": "1h 38m 38s", "remaining_time": "1h 11m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.727805} +{"loss": 0.64406627, "grad_norm": 2.84721613, "learning_rate": 2.672e-05, "token_acc": 0.80859707, "epoch": 1.16520651, "global_step/max_steps": "466/800", "percentage": "58.25%", "elapsed_time": "1h 38m 46s", "remaining_time": "1h 10m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.71752} +{"loss": 0.52146494, "grad_norm": 3.40332937, "learning_rate": 2.659e-05, "token_acc": 0.84308003, "epoch": 1.16770964, "global_step/max_steps": "467/800", "percentage": "58.38%", "elapsed_time": "1h 38m 55s", "remaining_time": "1h 10m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.708482} +{"loss": 0.75120747, "grad_norm": 5.55678606, "learning_rate": 2.647e-05, "token_acc": 0.77857736, "epoch": 1.17021277, "global_step/max_steps": "468/800", "percentage": "58.50%", "elapsed_time": "1h 39m 2s", "remaining_time": "1h 10m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.697241} +{"loss": 0.71915627, "grad_norm": 2.39537835, "learning_rate": 2.635e-05, "token_acc": 0.78969344, "epoch": 1.17271589, "global_step/max_steps": "469/800", "percentage": "58.63%", "elapsed_time": "1h 39m 10s", "remaining_time": "1h 9m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.685937} +{"loss": 0.83392727, "grad_norm": 0.95076442, "learning_rate": 2.623e-05, "token_acc": 0.74927406, "epoch": 1.17521902, "global_step/max_steps": "470/800", "percentage": "58.75%", "elapsed_time": "1h 39m 22s", "remaining_time": "1h 9m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.684197} +{"loss": 0.71399796, "grad_norm": 4.56725264, "learning_rate": 2.61e-05, "token_acc": 0.7805758, "epoch": 1.17772215, "global_step/max_steps": "471/800", "percentage": "58.88%", "elapsed_time": "1h 39m 41s", "remaining_time": "1h 9m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.698992} +{"loss": 0.86937404, "grad_norm": 3.54498029, "learning_rate": 2.598e-05, "token_acc": 0.74479194, "epoch": 1.18022528, "global_step/max_steps": "472/800", "percentage": "59.00%", "elapsed_time": "1h 39m 56s", "remaining_time": "1h 9m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.702818} +{"loss": 0.79210997, "grad_norm": 1.91876161, "learning_rate": 2.586e-05, "token_acc": 0.76264663, "epoch": 1.18272841, "global_step/max_steps": "473/800", "percentage": "59.13%", "elapsed_time": "1h 40m 7s", "remaining_time": "1h 9m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.700287} +{"loss": 0.83071291, "grad_norm": 1.46603906, "learning_rate": 2.574e-05, "token_acc": 0.75607435, "epoch": 1.18523154, "global_step/max_steps": "474/800", "percentage": "59.25%", "elapsed_time": "1h 40m 17s", "remaining_time": "1h 8m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.694025} +{"loss": 0.80988562, "grad_norm": 0.86902541, "learning_rate": 2.561e-05, "token_acc": 0.756414, "epoch": 1.18773467, "global_step/max_steps": "475/800", "percentage": "59.38%", "elapsed_time": "1h 40m 29s", "remaining_time": "1h 8m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.692933} +{"loss": 0.67044914, "grad_norm": 5.85329914, "learning_rate": 2.549e-05, "token_acc": 0.79663147, "epoch": 1.1902378, "global_step/max_steps": "476/800", "percentage": "59.50%", "elapsed_time": "1h 40m 36s", "remaining_time": "1h 8m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.680474} +{"loss": 0.77066135, "grad_norm": 1.30929923, "learning_rate": 2.537e-05, "token_acc": 0.77442302, "epoch": 1.19274093, "global_step/max_steps": "477/800", "percentage": "59.62%", "elapsed_time": "1h 40m 43s", "remaining_time": "1h 8m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.669166} +{"loss": 0.90881813, "grad_norm": 2.78774118, "learning_rate": 2.525e-05, "token_acc": 0.73262469, "epoch": 1.19524406, "global_step/max_steps": "478/800", "percentage": "59.75%", "elapsed_time": "1h 40m 59s", "remaining_time": "1h 8m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.675831} +{"loss": 0.85655713, "grad_norm": 2.23244333, "learning_rate": 2.512e-05, "token_acc": 0.74441417, "epoch": 1.19774718, "global_step/max_steps": "479/800", "percentage": "59.88%", "elapsed_time": "1h 41m 10s", "remaining_time": "1h 7m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.672979} +{"loss": 0.73130399, "grad_norm": 9.54522705, "learning_rate": 2.5e-05, "token_acc": 0.78188215, "epoch": 1.20025031, "global_step/max_steps": "480/800", "percentage": "60.00%", "elapsed_time": "1h 41m 18s", "remaining_time": "1h 7m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.662312} +{"loss": 0.75755769, "grad_norm": 20.98947144, "learning_rate": 2.488e-05, "token_acc": 0.77080776, "epoch": 1.20275344, "global_step/max_steps": "481/800", "percentage": "60.12%", "elapsed_time": "1h 41m 38s", "remaining_time": "1h 7m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.678726} +{"loss": 0.85234189, "grad_norm": 1.14822435, "learning_rate": 2.475e-05, "token_acc": 0.74598403, "epoch": 1.20525657, "global_step/max_steps": "482/800", "percentage": "60.25%", "elapsed_time": "1h 41m 56s", "remaining_time": "1h 7m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.68976} +{"loss": 0.74758202, "grad_norm": 2.05131435, "learning_rate": 2.463e-05, "token_acc": 0.77797992, "epoch": 1.2077597, "global_step/max_steps": "483/800", "percentage": "60.38%", "elapsed_time": "1h 42m 11s", "remaining_time": "1h 7m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.692792} +{"loss": 0.8240025, "grad_norm": 1.3422451, "learning_rate": 2.451e-05, "token_acc": 0.75421828, "epoch": 1.21026283, "global_step/max_steps": "484/800", "percentage": "60.50%", "elapsed_time": "1h 42m 25s", "remaining_time": "1h 6m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.695545} +{"loss": 0.84131968, "grad_norm": 1.363258, "learning_rate": 2.439e-05, "token_acc": 0.74837249, "epoch": 1.21276596, "global_step/max_steps": "485/800", "percentage": "60.62%", "elapsed_time": "1h 42m 37s", "remaining_time": "1h 6m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.693916} +{"loss": 0.95698822, "grad_norm": 3.42978168, "learning_rate": 2.426e-05, "token_acc": 0.72051765, "epoch": 1.21526909, "global_step/max_steps": "486/800", "percentage": "60.75%", "elapsed_time": "1h 42m 50s", "remaining_time": "1h 6m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.695077} +{"loss": 0.84286094, "grad_norm": 1.12998116, "learning_rate": 2.414e-05, "token_acc": 0.75335732, "epoch": 1.21777222, "global_step/max_steps": "487/800", "percentage": "60.88%", "elapsed_time": "1h 43m 4s", "remaining_time": "1h 6m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.698049} +{"loss": 0.71028155, "grad_norm": 1.70488691, "learning_rate": 2.402e-05, "token_acc": 0.78575507, "epoch": 1.22027534, "global_step/max_steps": "488/800", "percentage": "61.00%", "elapsed_time": "1h 43m 12s", "remaining_time": "1h 5m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.68843} +{"loss": 0.82755268, "grad_norm": 0.86803645, "learning_rate": 2.39e-05, "token_acc": 0.75014304, "epoch": 1.22277847, "global_step/max_steps": "489/800", "percentage": "61.12%", "elapsed_time": "1h 43m 20s", "remaining_time": "1h 5m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.679739} +{"loss": 0.69026113, "grad_norm": 1.33287692, "learning_rate": 2.377e-05, "token_acc": 0.78931382, "epoch": 1.2252816, "global_step/max_steps": "490/800", "percentage": "61.25%", "elapsed_time": "1h 43m 31s", "remaining_time": "1h 5m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.67617} +{"loss": 0.89370823, "grad_norm": 0.79269987, "learning_rate": 2.365e-05, "token_acc": 0.73419743, "epoch": 1.22778473, "global_step/max_steps": "491/800", "percentage": "61.38%", "elapsed_time": "1h 43m 52s", "remaining_time": "1h 5m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.691734} +{"loss": 0.66752076, "grad_norm": 3.32403898, "learning_rate": 2.353e-05, "token_acc": 0.79907662, "epoch": 1.23028786, "global_step/max_steps": "492/800", "percentage": "61.50%", "elapsed_time": "1h 43m 60s", "remaining_time": "1h 5m 6s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.682316} +{"loss": 0.78311342, "grad_norm": 5.93065023, "learning_rate": 2.341e-05, "token_acc": 0.77053882, "epoch": 1.23279099, "global_step/max_steps": "493/800", "percentage": "61.62%", "elapsed_time": "1h 44m 10s", "remaining_time": "1h 4m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.67652} +{"loss": 0.72018033, "grad_norm": 0.8512885, "learning_rate": 2.328e-05, "token_acc": 0.78080327, "epoch": 1.23529412, "global_step/max_steps": "494/800", "percentage": "61.75%", "elapsed_time": "1h 44m 20s", "remaining_time": "1h 4m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.672735} +{"loss": 0.84606493, "grad_norm": 0.96485591, "learning_rate": 2.316e-05, "token_acc": 0.74890929, "epoch": 1.23779725, "global_step/max_steps": "495/800", "percentage": "61.88%", "elapsed_time": "1h 44m 30s", "remaining_time": "1h 4m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.6662} +{"loss": 0.83365488, "grad_norm": 1.8170979, "learning_rate": 2.304e-05, "token_acc": 0.75343978, "epoch": 1.24030038, "global_step/max_steps": "496/800", "percentage": "62.00%", "elapsed_time": "1h 44m 41s", "remaining_time": "1h 4m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.663714} +{"loss": 0.62610811, "grad_norm": 6.26183128, "learning_rate": 2.292e-05, "token_acc": 0.80745814, "epoch": 1.2428035, "global_step/max_steps": "497/800", "percentage": "62.12%", "elapsed_time": "1h 44m 48s", "remaining_time": "1h 3m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.652793} +{"loss": 0.70047653, "grad_norm": 1.3391428, "learning_rate": 2.279e-05, "token_acc": 0.78755297, "epoch": 1.24530663, "global_step/max_steps": "498/800", "percentage": "62.25%", "elapsed_time": "1h 44m 56s", "remaining_time": "1h 3m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.642926} +{"loss": 0.71825874, "grad_norm": 1.6274718, "learning_rate": 2.267e-05, "token_acc": 0.78397711, "epoch": 1.24780976, "global_step/max_steps": "499/800", "percentage": "62.38%", "elapsed_time": "1h 45m 5s", "remaining_time": "1h 3m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.634303} +{"loss": 0.55470848, "grad_norm": 4.34530783, "learning_rate": 2.255e-05, "token_acc": 0.82794909, "epoch": 1.25031289, "global_step/max_steps": "500/800", "percentage": "62.50%", "elapsed_time": "1h 45m 12s", "remaining_time": "1h 3m 7s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.623976} +{"loss": 0.6171273, "grad_norm": 6.31979752, "learning_rate": 2.243e-05, "token_acc": 0.81033284, "epoch": 1.25281602, "global_step/max_steps": "501/800", "percentage": "62.62%", "elapsed_time": "1h 45m 31s", "remaining_time": "1h 2m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.637697} +{"loss": 0.86847532, "grad_norm": 1.2070508, "learning_rate": 2.231e-05, "token_acc": 0.74616186, "epoch": 1.25531915, "global_step/max_steps": "502/800", "percentage": "62.75%", "elapsed_time": "1h 45m 47s", "remaining_time": "1h 2m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.642712} +{"loss": 0.9290278, "grad_norm": 0.65171045, "learning_rate": 2.218e-05, "token_acc": 0.72457614, "epoch": 1.25782228, "global_step/max_steps": "503/800", "percentage": "62.88%", "elapsed_time": "1h 46m 5s", "remaining_time": "1h 2m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.65475} +{"loss": 0.6728816, "grad_norm": 7.50533676, "learning_rate": 2.206e-05, "token_acc": 0.79915311, "epoch": 1.26032541, "global_step/max_steps": "504/800", "percentage": "63.00%", "elapsed_time": "1h 46m 14s", "remaining_time": "1h 2m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.646008} +{"loss": 0.73863471, "grad_norm": 28.83329773, "learning_rate": 2.194e-05, "token_acc": 0.77649268, "epoch": 1.26282854, "global_step/max_steps": "505/800", "percentage": "63.12%", "elapsed_time": "1h 46m 21s", "remaining_time": "1h 2m 7s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.63514} +{"loss": 0.64684433, "grad_norm": 2.21047688, "learning_rate": 2.182e-05, "token_acc": 0.80100136, "epoch": 1.26533166, "global_step/max_steps": "506/800", "percentage": "63.25%", "elapsed_time": "1h 46m 30s", "remaining_time": "1h 1m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.628282} +{"loss": 0.69015837, "grad_norm": 3.51395035, "learning_rate": 2.17e-05, "token_acc": 0.79267495, "epoch": 1.26783479, "global_step/max_steps": "507/800", "percentage": "63.38%", "elapsed_time": "1h 46m 38s", "remaining_time": "1h 1m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.619961} +{"loss": 0.80857658, "grad_norm": 1.68301797, "learning_rate": 2.157e-05, "token_acc": 0.75626065, "epoch": 1.27033792, "global_step/max_steps": "508/800", "percentage": "63.50%", "elapsed_time": "1h 46m 53s", "remaining_time": "1h 1m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.624582} +{"loss": 0.78009105, "grad_norm": 0.77979159, "learning_rate": 2.145e-05, "token_acc": 0.75957964, "epoch": 1.27284105, "global_step/max_steps": "509/800", "percentage": "63.62%", "elapsed_time": "1h 47m 10s", "remaining_time": "1h 1m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.632372} +{"loss": 0.81743371, "grad_norm": 1.70195889, "learning_rate": 2.133e-05, "token_acc": 0.75786142, "epoch": 1.27534418, "global_step/max_steps": "510/800", "percentage": "63.75%", "elapsed_time": "1h 47m 21s", "remaining_time": "1h 1m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.629451} +{"loss": 0.74529076, "grad_norm": 2.03682542, "learning_rate": 2.121e-05, "token_acc": 0.77818706, "epoch": 1.27784731, "global_step/max_steps": "511/800", "percentage": "63.88%", "elapsed_time": "1h 47m 41s", "remaining_time": "1h 0m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.643906} +{"loss": 0.82399416, "grad_norm": 0.97802979, "learning_rate": 2.109e-05, "token_acc": 0.7526496, "epoch": 1.28035044, "global_step/max_steps": "512/800", "percentage": "64.00%", "elapsed_time": "1h 47m 52s", "remaining_time": "1h 0m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.641149} +{"loss": 0.79617655, "grad_norm": 0.87181634, "learning_rate": 2.097e-05, "token_acc": 0.75920917, "epoch": 1.28285357, "global_step/max_steps": "513/800", "percentage": "64.12%", "elapsed_time": "1h 48m 8s", "remaining_time": "1h 0m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.647313} +{"loss": 0.75685513, "grad_norm": 2.46794772, "learning_rate": 2.085e-05, "token_acc": 0.77640724, "epoch": 1.2853567, "global_step/max_steps": "514/800", "percentage": "64.25%", "elapsed_time": "1h 48m 21s", "remaining_time": "1h 0m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.647212} +{"loss": 0.84253001, "grad_norm": 0.97926939, "learning_rate": 2.073e-05, "token_acc": 0.74708793, "epoch": 1.28785982, "global_step/max_steps": "515/800", "percentage": "64.38%", "elapsed_time": "1h 48m 40s", "remaining_time": "1h 0m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.660634} +{"loss": 0.79383564, "grad_norm": 1.59802938, "learning_rate": 2.061e-05, "token_acc": 0.76590524, "epoch": 1.29036295, "global_step/max_steps": "516/800", "percentage": "64.50%", "elapsed_time": "1h 48m 51s", "remaining_time": "59m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.657297} +{"loss": 0.87837851, "grad_norm": 0.67414159, "learning_rate": 2.048e-05, "token_acc": 0.73947621, "epoch": 1.29286608, "global_step/max_steps": "517/800", "percentage": "64.62%", "elapsed_time": "1h 49m 9s", "remaining_time": "59m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.666746} +{"loss": 0.78450781, "grad_norm": 1.60829532, "learning_rate": 2.036e-05, "token_acc": 0.76425207, "epoch": 1.29536921, "global_step/max_steps": "518/800", "percentage": "64.75%", "elapsed_time": "1h 49m 33s", "remaining_time": "59m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.688354} +{"loss": 0.8358283, "grad_norm": 11.83087921, "learning_rate": 2.024e-05, "token_acc": 0.75170001, "epoch": 1.29787234, "global_step/max_steps": "519/800", "percentage": "64.88%", "elapsed_time": "1h 49m 43s", "remaining_time": "59m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.683497} +{"loss": 0.86499041, "grad_norm": 2.8779881, "learning_rate": 2.012e-05, "token_acc": 0.74460253, "epoch": 1.30037547, "global_step/max_steps": "520/800", "percentage": "65.00%", "elapsed_time": "1h 49m 57s", "remaining_time": "59m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.687147} +{"loss": 0.83468771, "grad_norm": 0.81393164, "learning_rate": 2e-05, "token_acc": 0.75044696, "epoch": 1.3028786, "global_step/max_steps": "521/800", "percentage": "65.12%", "elapsed_time": "1h 50m 24s", "remaining_time": "59m 7s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.714859} +{"loss": 0.78992021, "grad_norm": 2.87590289, "learning_rate": 1.988e-05, "token_acc": 0.76651229, "epoch": 1.30538173, "global_step/max_steps": "522/800", "percentage": "65.25%", "elapsed_time": "1h 50m 35s", "remaining_time": "58m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.710224} +{"loss": 0.78102434, "grad_norm": 3.17888808, "learning_rate": 1.976e-05, "token_acc": 0.76663792, "epoch": 1.30788486, "global_step/max_steps": "523/800", "percentage": "65.38%", "elapsed_time": "1h 50m 45s", "remaining_time": "58m 40s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.706103} +{"loss": 0.82635415, "grad_norm": 0.78603798, "learning_rate": 1.964e-05, "token_acc": 0.75301057, "epoch": 1.31038798, "global_step/max_steps": "524/800", "percentage": "65.50%", "elapsed_time": "1h 50m 59s", "remaining_time": "58m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707798} +{"loss": 0.71554077, "grad_norm": 1.43024051, "learning_rate": 1.952e-05, "token_acc": 0.78680942, "epoch": 1.31289111, "global_step/max_steps": "525/800", "percentage": "65.62%", "elapsed_time": "1h 51m 6s", "remaining_time": "58m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.697397} +{"loss": 0.82354856, "grad_norm": 1.33690763, "learning_rate": 1.94e-05, "token_acc": 0.75515132, "epoch": 1.31539424, "global_step/max_steps": "526/800", "percentage": "65.75%", "elapsed_time": "1h 51m 16s", "remaining_time": "57m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.692408} +{"loss": 0.81886083, "grad_norm": 1.07903135, "learning_rate": 1.928e-05, "token_acc": 0.75363372, "epoch": 1.31789737, "global_step/max_steps": "527/800", "percentage": "65.88%", "elapsed_time": "1h 51m 28s", "remaining_time": "57m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.690733} +{"loss": 0.84247971, "grad_norm": 1.10458338, "learning_rate": 1.916e-05, "token_acc": 0.75256592, "epoch": 1.3204005, "global_step/max_steps": "528/800", "percentage": "66.00%", "elapsed_time": "1h 51m 46s", "remaining_time": "57m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.700832} +{"loss": 0.85332465, "grad_norm": 2.49541092, "learning_rate": 1.904e-05, "token_acc": 0.74100096, "epoch": 1.32290363, "global_step/max_steps": "529/800", "percentage": "66.12%", "elapsed_time": "1h 52m 8s", "remaining_time": "57m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.718412} +{"loss": 0.84019601, "grad_norm": 2.27756643, "learning_rate": 1.893e-05, "token_acc": 0.75485906, "epoch": 1.32540676, "global_step/max_steps": "530/800", "percentage": "66.25%", "elapsed_time": "1h 52m 20s", "remaining_time": "57m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.716242} +{"loss": 0.63698554, "grad_norm": 1.67503715, "learning_rate": 1.881e-05, "token_acc": 0.80454445, "epoch": 1.32790989, "global_step/max_steps": "531/800", "percentage": "66.38%", "elapsed_time": "1h 52m 37s", "remaining_time": "57m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725952} +{"loss": 0.95346189, "grad_norm": 0.84420812, "learning_rate": 1.869e-05, "token_acc": 0.72261314, "epoch": 1.33041302, "global_step/max_steps": "532/800", "percentage": "66.50%", "elapsed_time": "1h 52m 52s", "remaining_time": "56m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.729637} +{"loss": 0.77944154, "grad_norm": 0.89295161, "learning_rate": 1.857e-05, "token_acc": 0.77138483, "epoch": 1.33291615, "global_step/max_steps": "533/800", "percentage": "66.62%", "elapsed_time": "1h 53m 3s", "remaining_time": "56m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725804} +{"loss": 0.87227786, "grad_norm": 1.16872275, "learning_rate": 1.845e-05, "token_acc": 0.74175765, "epoch": 1.33541927, "global_step/max_steps": "534/800", "percentage": "66.75%", "elapsed_time": "1h 53m 16s", "remaining_time": "56m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.725701} +{"loss": 0.75610894, "grad_norm": 1.49053979, "learning_rate": 1.833e-05, "token_acc": 0.77300098, "epoch": 1.3379224, "global_step/max_steps": "535/800", "percentage": "66.88%", "elapsed_time": "1h 53m 25s", "remaining_time": "56m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.719847} +{"loss": 0.83103341, "grad_norm": 1.10994792, "learning_rate": 1.821e-05, "token_acc": 0.74894676, "epoch": 1.34042553, "global_step/max_steps": "536/800", "percentage": "67.00%", "elapsed_time": "1h 53m 43s", "remaining_time": "56m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.729838} +{"loss": 0.80798322, "grad_norm": 1.19500458, "learning_rate": 1.81e-05, "token_acc": 0.75684858, "epoch": 1.34292866, "global_step/max_steps": "537/800", "percentage": "67.12%", "elapsed_time": "1h 53m 52s", "remaining_time": "55m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.722374} +{"loss": 0.71252906, "grad_norm": 1.72379088, "learning_rate": 1.798e-05, "token_acc": 0.7834861, "epoch": 1.34543179, "global_step/max_steps": "538/800", "percentage": "67.25%", "elapsed_time": "1h 54m 2s", "remaining_time": "55m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.717332} +{"loss": 0.64532542, "grad_norm": 3.22886086, "learning_rate": 1.786e-05, "token_acc": 0.8018174, "epoch": 1.34793492, "global_step/max_steps": "539/800", "percentage": "67.38%", "elapsed_time": "1h 54m 11s", "remaining_time": "55m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.709961} +{"loss": 0.82405007, "grad_norm": 0.84536725, "learning_rate": 1.774e-05, "token_acc": 0.74922661, "epoch": 1.35043805, "global_step/max_steps": "540/800", "percentage": "67.50%", "elapsed_time": "1h 54m 19s", "remaining_time": "55m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.702722} +{"loss": 0.80938828, "grad_norm": 1.1023854, "learning_rate": 1.763e-05, "token_acc": 0.75960284, "epoch": 1.35294118, "global_step/max_steps": "541/800", "percentage": "67.62%", "elapsed_time": "1h 54m 43s", "remaining_time": "54m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.722637} +{"loss": 0.7180289, "grad_norm": 1.30187452, "learning_rate": 1.751e-05, "token_acc": 0.77989784, "epoch": 1.35544431, "global_step/max_steps": "542/800", "percentage": "67.75%", "elapsed_time": "1h 54m 53s", "remaining_time": "54m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.717811} +{"loss": 0.6467824, "grad_norm": 3.15423918, "learning_rate": 1.739e-05, "token_acc": 0.80566762, "epoch": 1.35794743, "global_step/max_steps": "543/800", "percentage": "67.88%", "elapsed_time": "1h 55m 1s", "remaining_time": "54m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.709523} +{"loss": 0.7879892, "grad_norm": 0.992387, "learning_rate": 1.727e-05, "token_acc": 0.76185171, "epoch": 1.36045056, "global_step/max_steps": "544/800", "percentage": "68.00%", "elapsed_time": "1h 55m 15s", "remaining_time": "54m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.711061} +{"loss": 0.7576412, "grad_norm": 1.21721601, "learning_rate": 1.716e-05, "token_acc": 0.77040478, "epoch": 1.36295369, "global_step/max_steps": "545/800", "percentage": "68.12%", "elapsed_time": "1h 55m 25s", "remaining_time": "54m 0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707262} +{"loss": 0.67074811, "grad_norm": 1.66029489, "learning_rate": 1.704e-05, "token_acc": 0.79716981, "epoch": 1.36545682, "global_step/max_steps": "546/800", "percentage": "68.25%", "elapsed_time": "1h 55m 34s", "remaining_time": "53m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.698798} +{"loss": 0.80817538, "grad_norm": 1.46776807, "learning_rate": 1.693e-05, "token_acc": 0.75531154, "epoch": 1.36795995, "global_step/max_steps": "547/800", "percentage": "68.38%", "elapsed_time": "1h 55m 43s", "remaining_time": "53m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.69237} +{"loss": 0.81464136, "grad_norm": 2.0665853, "learning_rate": 1.681e-05, "token_acc": 0.75194904, "epoch": 1.37046308, "global_step/max_steps": "548/800", "percentage": "68.50%", "elapsed_time": "1h 55m 57s", "remaining_time": "53m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.695857} +{"loss": 0.72561502, "grad_norm": 7.00017834, "learning_rate": 1.669e-05, "token_acc": 0.78253562, "epoch": 1.37296621, "global_step/max_steps": "549/800", "percentage": "68.62%", "elapsed_time": "1h 56m 7s", "remaining_time": "53m 5s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.691196} +{"loss": 0.72639585, "grad_norm": 2.53415227, "learning_rate": 1.658e-05, "token_acc": 0.78193392, "epoch": 1.37546934, "global_step/max_steps": "550/800", "percentage": "68.75%", "elapsed_time": "1h 56m 18s", "remaining_time": "52m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.687681} +{"loss": 0.80658746, "grad_norm": 1.45854342, "learning_rate": 1.646e-05, "token_acc": 0.75649329, "epoch": 1.37797247, "global_step/max_steps": "551/800", "percentage": "68.88%", "elapsed_time": "1h 56m 39s", "remaining_time": "52m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.70239} +{"loss": 0.82755947, "grad_norm": 1.83524394, "learning_rate": 1.635e-05, "token_acc": 0.7518391, "epoch": 1.38047559, "global_step/max_steps": "552/800", "percentage": "69.00%", "elapsed_time": "1h 56m 54s", "remaining_time": "52m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707363} +{"loss": 0.75033295, "grad_norm": 1.95806491, "learning_rate": 1.623e-05, "token_acc": 0.77383788, "epoch": 1.38297872, "global_step/max_steps": "553/800", "percentage": "69.12%", "elapsed_time": "1h 57m 4s", "remaining_time": "52m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.701106} +{"loss": 0.70216024, "grad_norm": 7.62896061, "learning_rate": 1.612e-05, "token_acc": 0.78984212, "epoch": 1.38548185, "global_step/max_steps": "554/800", "percentage": "69.25%", "elapsed_time": "1h 57m 12s", "remaining_time": "52m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.692246} +{"loss": 0.87234205, "grad_norm": 1.28707457, "learning_rate": 1.6e-05, "token_acc": 0.74189592, "epoch": 1.38798498, "global_step/max_steps": "555/800", "percentage": "69.38%", "elapsed_time": "1h 57m 26s", "remaining_time": "51m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.695507} +{"loss": 0.70129073, "grad_norm": 1.55032945, "learning_rate": 1.589e-05, "token_acc": 0.78402248, "epoch": 1.39048811, "global_step/max_steps": "556/800", "percentage": "69.50%", "elapsed_time": "1h 57m 37s", "remaining_time": "51m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.69159} +{"loss": 0.79879898, "grad_norm": 1.41053867, "learning_rate": 1.577e-05, "token_acc": 0.76348072, "epoch": 1.39299124, "global_step/max_steps": "557/800", "percentage": "69.62%", "elapsed_time": "1h 57m 46s", "remaining_time": "51m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.68647} +{"loss": 0.6806649, "grad_norm": 0.91782218, "learning_rate": 1.566e-05, "token_acc": 0.79029896, "epoch": 1.39549437, "global_step/max_steps": "558/800", "percentage": "69.75%", "elapsed_time": "1h 57m 55s", "remaining_time": "51m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.678516} +{"loss": 0.87193018, "grad_norm": 0.75614518, "learning_rate": 1.555e-05, "token_acc": 0.74134553, "epoch": 1.3979975, "global_step/max_steps": "559/800", "percentage": "69.88%", "elapsed_time": "1h 58m 5s", "remaining_time": "50m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.675084} +{"loss": 0.810009, "grad_norm": 1.16919363, "learning_rate": 1.543e-05, "token_acc": 0.75917718, "epoch": 1.40050063, "global_step/max_steps": "560/800", "percentage": "70.00%", "elapsed_time": "1h 58m 19s", "remaining_time": "50m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.676591} +{"loss": 0.74906409, "grad_norm": 35.45746994, "learning_rate": 1.532e-05, "token_acc": 0.7792402, "epoch": 1.40300375, "global_step/max_steps": "561/800", "percentage": "70.12%", "elapsed_time": "1h 58m 37s", "remaining_time": "50m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.68702} +{"loss": 0.77884549, "grad_norm": 0.81009072, "learning_rate": 1.521e-05, "token_acc": 0.77064139, "epoch": 1.40550688, "global_step/max_steps": "562/800", "percentage": "70.25%", "elapsed_time": "1h 58m 52s", "remaining_time": "50m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.689664} +{"loss": 0.80655932, "grad_norm": 1.71586072, "learning_rate": 1.509e-05, "token_acc": 0.75903467, "epoch": 1.40801001, "global_step/max_steps": "563/800", "percentage": "70.38%", "elapsed_time": "1h 59m 3s", "remaining_time": "50m 7s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.686814} +{"loss": 0.95211637, "grad_norm": 1.15934432, "learning_rate": 1.498e-05, "token_acc": 0.72337817, "epoch": 1.41051314, "global_step/max_steps": "564/800", "percentage": "70.50%", "elapsed_time": "1h 59m 20s", "remaining_time": "49m 56s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.695747} +{"loss": 0.77403063, "grad_norm": 1.91257346, "learning_rate": 1.487e-05, "token_acc": 0.76977303, "epoch": 1.41301627, "global_step/max_steps": "565/800", "percentage": "70.62%", "elapsed_time": "1h 59m 30s", "remaining_time": "49m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.689716} +{"loss": 0.83845735, "grad_norm": 0.89520359, "learning_rate": 1.476e-05, "token_acc": 0.74890691, "epoch": 1.4155194, "global_step/max_steps": "566/800", "percentage": "70.75%", "elapsed_time": "1h 59m 49s", "remaining_time": "49m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.70155} +{"loss": 0.70887792, "grad_norm": 1.7073853, "learning_rate": 1.465e-05, "token_acc": 0.78774167, "epoch": 1.41802253, "global_step/max_steps": "567/800", "percentage": "70.88%", "elapsed_time": "2h 0m 1s", "remaining_time": "49m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.699961} +{"loss": 0.7444787, "grad_norm": 2.46922016, "learning_rate": 1.453e-05, "token_acc": 0.77322061, "epoch": 1.42052566, "global_step/max_steps": "568/800", "percentage": "71.00%", "elapsed_time": "2h 0m 13s", "remaining_time": "49m 6s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.69869} +{"loss": 0.75655353, "grad_norm": 1.4949044, "learning_rate": 1.442e-05, "token_acc": 0.77615702, "epoch": 1.42302879, "global_step/max_steps": "569/800", "percentage": "71.12%", "elapsed_time": "2h 0m 22s", "remaining_time": "48m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.693191} +{"loss": 0.79331046, "grad_norm": 3.14548421, "learning_rate": 1.431e-05, "token_acc": 0.76127865, "epoch": 1.42553191, "global_step/max_steps": "570/800", "percentage": "71.25%", "elapsed_time": "2h 0m 37s", "remaining_time": "48m 40s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.695807} +{"loss": 0.76005864, "grad_norm": 1.17217088, "learning_rate": 1.42e-05, "token_acc": 0.77072002, "epoch": 1.42803504, "global_step/max_steps": "571/800", "percentage": "71.38%", "elapsed_time": "2h 0m 56s", "remaining_time": "48m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707826} +{"loss": 0.72916257, "grad_norm": 1.81151056, "learning_rate": 1.409e-05, "token_acc": 0.7803459, "epoch": 1.43053817, "global_step/max_steps": "572/800", "percentage": "71.50%", "elapsed_time": "2h 1m 8s", "remaining_time": "48m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.706215} +{"loss": 0.66067314, "grad_norm": 1.2004317, "learning_rate": 1.398e-05, "token_acc": 0.79940508, "epoch": 1.4330413, "global_step/max_steps": "573/800", "percentage": "71.62%", "elapsed_time": "2h 1m 18s", "remaining_time": "48m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.701561} +{"loss": 0.79519045, "grad_norm": 1.23762691, "learning_rate": 1.387e-05, "token_acc": 0.76618336, "epoch": 1.43554443, "global_step/max_steps": "574/800", "percentage": "71.75%", "elapsed_time": "2h 1m 25s", "remaining_time": "47m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.69229} +{"loss": 0.8511408, "grad_norm": 2.05244541, "learning_rate": 1.376e-05, "token_acc": 0.74678828, "epoch": 1.43804756, "global_step/max_steps": "575/800", "percentage": "71.88%", "elapsed_time": "2h 1m 45s", "remaining_time": "47m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.704818} +{"loss": 0.79936165, "grad_norm": 0.97339302, "learning_rate": 1.365e-05, "token_acc": 0.76363414, "epoch": 1.44055069, "global_step/max_steps": "576/800", "percentage": "72.00%", "elapsed_time": "2h 1m 58s", "remaining_time": "47m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.704601} +{"loss": 0.81418389, "grad_norm": 5.80048275, "learning_rate": 1.354e-05, "token_acc": 0.756657, "epoch": 1.44305382, "global_step/max_steps": "577/800", "percentage": "72.12%", "elapsed_time": "2h 2m 8s", "remaining_time": "47m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.700781} +{"loss": 0.65436494, "grad_norm": 2.69680047, "learning_rate": 1.343e-05, "token_acc": 0.80480882, "epoch": 1.44555695, "global_step/max_steps": "578/800", "percentage": "72.25%", "elapsed_time": "2h 2m 22s", "remaining_time": "46m 60s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.701941} +{"loss": 0.64789587, "grad_norm": 4.3016777, "learning_rate": 1.332e-05, "token_acc": 0.80664245, "epoch": 1.44806008, "global_step/max_steps": "579/800", "percentage": "72.38%", "elapsed_time": "2h 2m 29s", "remaining_time": "46m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.69223} +{"loss": 0.76481658, "grad_norm": 1.51489139, "learning_rate": 1.322e-05, "token_acc": 0.77550424, "epoch": 1.4505632, "global_step/max_steps": "580/800", "percentage": "72.50%", "elapsed_time": "2h 2m 40s", "remaining_time": "46m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.689136} +{"loss": 0.74041331, "grad_norm": 2.94965506, "learning_rate": 1.311e-05, "token_acc": 0.77287362, "epoch": 1.45306633, "global_step/max_steps": "581/800", "percentage": "72.62%", "elapsed_time": "2h 2m 57s", "remaining_time": "46m 21s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.697649} +{"loss": 0.91750914, "grad_norm": 0.92380786, "learning_rate": 1.3e-05, "token_acc": 0.73556499, "epoch": 1.45556946, "global_step/max_steps": "582/800", "percentage": "72.75%", "elapsed_time": "2h 3m 12s", "remaining_time": "46m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.701015} +{"loss": 0.64694595, "grad_norm": 83.38187408, "learning_rate": 1.289e-05, "token_acc": 0.80402399, "epoch": 1.45807259, "global_step/max_steps": "583/800", "percentage": "72.88%", "elapsed_time": "2h 3m 20s", "remaining_time": "45m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.693221} +{"loss": 0.85336244, "grad_norm": 4.51827908, "learning_rate": 1.278e-05, "token_acc": 0.74413017, "epoch": 1.46057572, "global_step/max_steps": "584/800", "percentage": "73.00%", "elapsed_time": "2h 3m 41s", "remaining_time": "45m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.706415} +{"loss": 0.72554463, "grad_norm": 1.79252076, "learning_rate": 1.268e-05, "token_acc": 0.78317574, "epoch": 1.46307885, "global_step/max_steps": "585/800", "percentage": "73.12%", "elapsed_time": "2h 3m 53s", "remaining_time": "45m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.705194} +{"loss": 0.73071414, "grad_norm": 6.65525007, "learning_rate": 1.257e-05, "token_acc": 0.77415442, "epoch": 1.46558198, "global_step/max_steps": "586/800", "percentage": "73.25%", "elapsed_time": "2h 4m 1s", "remaining_time": "45m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.698452} +{"loss": 0.81772709, "grad_norm": 0.88733715, "learning_rate": 1.246e-05, "token_acc": 0.75302027, "epoch": 1.46808511, "global_step/max_steps": "587/800", "percentage": "73.38%", "elapsed_time": "2h 4m 15s", "remaining_time": "45m 5s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.700258} +{"loss": 0.66752815, "grad_norm": 1.24544883, "learning_rate": 1.236e-05, "token_acc": 0.79331527, "epoch": 1.47058824, "global_step/max_steps": "588/800", "percentage": "73.50%", "elapsed_time": "2h 4m 24s", "remaining_time": "44m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.693888} +{"loss": 0.72481436, "grad_norm": 1.00828111, "learning_rate": 1.225e-05, "token_acc": 0.7810338, "epoch": 1.47309136, "global_step/max_steps": "589/800", "percentage": "73.62%", "elapsed_time": "2h 4m 36s", "remaining_time": "44m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.693503} +{"loss": 0.66610533, "grad_norm": 3.03722787, "learning_rate": 1.215e-05, "token_acc": 0.79979768, "epoch": 1.47559449, "global_step/max_steps": "590/800", "percentage": "73.75%", "elapsed_time": "2h 4m 48s", "remaining_time": "44m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.691818} +{"loss": 0.74272674, "grad_norm": 1.46004605, "learning_rate": 1.204e-05, "token_acc": 0.77675231, "epoch": 1.47809762, "global_step/max_steps": "591/800", "percentage": "73.88%", "elapsed_time": "2h 5m 12s", "remaining_time": "44m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.710259} +{"loss": 0.63994485, "grad_norm": 1.42963445, "learning_rate": 1.194e-05, "token_acc": 0.80490677, "epoch": 1.48060075, "global_step/max_steps": "592/800", "percentage": "74.00%", "elapsed_time": "2h 5m 20s", "remaining_time": "44m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.702944} +{"loss": 0.77385378, "grad_norm": 1.41082346, "learning_rate": 1.183e-05, "token_acc": 0.766279, "epoch": 1.48310388, "global_step/max_steps": "593/800", "percentage": "74.12%", "elapsed_time": "2h 5m 36s", "remaining_time": "43m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.708916} +{"loss": 0.80324721, "grad_norm": 2.01106572, "learning_rate": 1.173e-05, "token_acc": 0.76435095, "epoch": 1.48560701, "global_step/max_steps": "594/800", "percentage": "74.25%", "elapsed_time": "2h 5m 48s", "remaining_time": "43m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.706251} +{"loss": 0.71398962, "grad_norm": 1.9228586, "learning_rate": 1.163e-05, "token_acc": 0.77922466, "epoch": 1.48811014, "global_step/max_steps": "595/800", "percentage": "74.38%", "elapsed_time": "2h 5m 59s", "remaining_time": "43m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.704217} +{"loss": 0.66422307, "grad_norm": 3.42121959, "learning_rate": 1.152e-05, "token_acc": 0.79908224, "epoch": 1.49061327, "global_step/max_steps": "596/800", "percentage": "74.50%", "elapsed_time": "2h 6m 5s", "remaining_time": "43m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.69357} +{"loss": 0.81805092, "grad_norm": 1.03713632, "learning_rate": 1.142e-05, "token_acc": 0.75356395, "epoch": 1.4931164, "global_step/max_steps": "597/800", "percentage": "74.62%", "elapsed_time": "2h 6m 23s", "remaining_time": "42m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.701777} +{"loss": 0.88223565, "grad_norm": 1.0604794, "learning_rate": 1.132e-05, "token_acc": 0.74223695, "epoch": 1.49561952, "global_step/max_steps": "598/800", "percentage": "74.75%", "elapsed_time": "2h 6m 37s", "remaining_time": "42m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.70358} +{"loss": 0.70334792, "grad_norm": 1.34297872, "learning_rate": 1.121e-05, "token_acc": 0.78642468, "epoch": 1.49812265, "global_step/max_steps": "599/800", "percentage": "74.88%", "elapsed_time": "2h 6m 45s", "remaining_time": "42m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.695565} +{"loss": 0.75985152, "grad_norm": 1.29427743, "learning_rate": 1.111e-05, "token_acc": 0.76752413, "epoch": 1.50062578, "global_step/max_steps": "600/800", "percentage": "75.00%", "elapsed_time": "2h 7m 1s", "remaining_time": "42m 20s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.702235} +{"loss": 0.74517977, "grad_norm": 1.63137913, "learning_rate": 1.101e-05, "token_acc": 0.77454934, "epoch": 1.50312891, "global_step/max_steps": "601/800", "percentage": "75.12%", "elapsed_time": "2h 7m 23s", "remaining_time": "42m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.717572} +{"loss": 0.89081979, "grad_norm": 1.98306155, "learning_rate": 1.091e-05, "token_acc": 0.74032236, "epoch": 1.50563204, "global_step/max_steps": "602/800", "percentage": "75.25%", "elapsed_time": "2h 7m 35s", "remaining_time": "41m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.715961} +{"loss": 0.76652884, "grad_norm": 0.97116369, "learning_rate": 1.081e-05, "token_acc": 0.77132937, "epoch": 1.50813517, "global_step/max_steps": "603/800", "percentage": "75.38%", "elapsed_time": "2h 7m 48s", "remaining_time": "41m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.716015} +{"loss": 0.75002819, "grad_norm": 2.05183053, "learning_rate": 1.071e-05, "token_acc": 0.77056872, "epoch": 1.5106383, "global_step/max_steps": "604/800", "percentage": "75.50%", "elapsed_time": "2h 7m 55s", "remaining_time": "41m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707595} +{"loss": 0.69696152, "grad_norm": 4.24532747, "learning_rate": 1.06e-05, "token_acc": 0.78965069, "epoch": 1.51314143, "global_step/max_steps": "605/800", "percentage": "75.62%", "elapsed_time": "2h 8m 3s", "remaining_time": "41m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.699173} +{"loss": 0.89182341, "grad_norm": 2.74379921, "learning_rate": 1.05e-05, "token_acc": 0.73995568, "epoch": 1.51564456, "global_step/max_steps": "606/800", "percentage": "75.75%", "elapsed_time": "2h 8m 21s", "remaining_time": "41m 5s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.70735} +{"loss": 0.83495164, "grad_norm": 1.53638434, "learning_rate": 1.04e-05, "token_acc": 0.74869579, "epoch": 1.51814768, "global_step/max_steps": "607/800", "percentage": "75.88%", "elapsed_time": "2h 8m 34s", "remaining_time": "40m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707835} +{"loss": 0.78045434, "grad_norm": 1.30737674, "learning_rate": 1.031e-05, "token_acc": 0.76504889, "epoch": 1.52065081, "global_step/max_steps": "608/800", "percentage": "76.00%", "elapsed_time": "2h 8m 46s", "remaining_time": "40m 40s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.707458} +{"loss": 0.7981627, "grad_norm": 1.20297253, "learning_rate": 1.021e-05, "token_acc": 0.75767769, "epoch": 1.52315394, "global_step/max_steps": "609/800", "percentage": "76.12%", "elapsed_time": "2h 9m 0s", "remaining_time": "40m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.709768} +{"loss": 0.61881369, "grad_norm": 2.24313641, "learning_rate": 1.011e-05, "token_acc": 0.81575196, "epoch": 1.52565707, "global_step/max_steps": "610/800", "percentage": "76.25%", "elapsed_time": "2h 9m 10s", "remaining_time": "40m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.704996} +{"loss": 0.63129896, "grad_norm": 1.109712, "learning_rate": 1.001e-05, "token_acc": 0.79979759, "epoch": 1.5281602, "global_step/max_steps": "611/800", "percentage": "76.38%", "elapsed_time": "2h 9m 29s", "remaining_time": "40m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.715351} +{"loss": 0.76428604, "grad_norm": 0.98038429, "learning_rate": 9.91e-06, "token_acc": 0.77250779, "epoch": 1.53066333, "global_step/max_steps": "612/800", "percentage": "76.50%", "elapsed_time": "2h 9m 42s", "remaining_time": "39m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.716165} +{"loss": 0.65228117, "grad_norm": 31.44816971, "learning_rate": 9.81e-06, "token_acc": 0.80372204, "epoch": 1.53316646, "global_step/max_steps": "613/800", "percentage": "76.62%", "elapsed_time": "2h 9m 51s", "remaining_time": "39m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.710213} +{"loss": 0.83825272, "grad_norm": 0.99430186, "learning_rate": 9.72e-06, "token_acc": 0.75109614, "epoch": 1.53566959, "global_step/max_steps": "614/800", "percentage": "76.75%", "elapsed_time": "2h 9m 60s", "remaining_time": "39m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.703349} +{"loss": 0.74221802, "grad_norm": 0.92279518, "learning_rate": 9.62e-06, "token_acc": 0.77491333, "epoch": 1.53817272, "global_step/max_steps": "615/800", "percentage": "76.88%", "elapsed_time": "2h 10m 7s", "remaining_time": "39m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.694443} +{"loss": 0.72505617, "grad_norm": 2.24790072, "learning_rate": 9.52e-06, "token_acc": 0.77383785, "epoch": 1.54067584, "global_step/max_steps": "616/800", "percentage": "77.00%", "elapsed_time": "2h 10m 16s", "remaining_time": "38m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.687663} +{"loss": 0.69898891, "grad_norm": 1.51495814, "learning_rate": 9.43e-06, "token_acc": 0.79022082, "epoch": 1.54317897, "global_step/max_steps": "617/800", "percentage": "77.12%", "elapsed_time": "2h 10m 26s", "remaining_time": "38m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.683483} +{"loss": 0.79643035, "grad_norm": 4.66885424, "learning_rate": 9.33e-06, "token_acc": 0.76072079, "epoch": 1.5456821, "global_step/max_steps": "618/800", "percentage": "77.25%", "elapsed_time": "2h 10m 39s", "remaining_time": "38m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.684884} +{"loss": 0.8113234, "grad_norm": 1.22625971, "learning_rate": 9.24e-06, "token_acc": 0.75672434, "epoch": 1.54818523, "global_step/max_steps": "619/800", "percentage": "77.38%", "elapsed_time": "2h 10m 50s", "remaining_time": "38m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.681118} +{"loss": 0.77543771, "grad_norm": 1.91127849, "learning_rate": 9.14e-06, "token_acc": 0.76825217, "epoch": 1.55068836, "global_step/max_steps": "620/800", "percentage": "77.50%", "elapsed_time": "2h 11m 0s", "remaining_time": "38m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.677687} +{"loss": 0.81096298, "grad_norm": 1.06597269, "learning_rate": 9.05e-06, "token_acc": 0.75700609, "epoch": 1.55319149, "global_step/max_steps": "621/800", "percentage": "77.62%", "elapsed_time": "2h 11m 26s", "remaining_time": "37m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.698914} +{"loss": 0.60946536, "grad_norm": 1.93048131, "learning_rate": 8.95e-06, "token_acc": 0.81644892, "epoch": 1.55569462, "global_step/max_steps": "622/800", "percentage": "77.75%", "elapsed_time": "2h 11m 33s", "remaining_time": "37m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.689597} +{"loss": 0.66182542, "grad_norm": 1.25791955, "learning_rate": 8.86e-06, "token_acc": 0.80280334, "epoch": 1.55819775, "global_step/max_steps": "623/800", "percentage": "77.88%", "elapsed_time": "2h 11m 39s", "remaining_time": "37m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.679044} +{"loss": 0.81475782, "grad_norm": 1.72503805, "learning_rate": 8.76e-06, "token_acc": 0.75851595, "epoch": 1.56070088, "global_step/max_steps": "624/800", "percentage": "78.00%", "elapsed_time": "2h 11m 48s", "remaining_time": "37m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.673847} +{"loss": 0.83315533, "grad_norm": 1.7458322, "learning_rate": 8.67e-06, "token_acc": 0.74984317, "epoch": 1.56320401, "global_step/max_steps": "625/800", "percentage": "78.12%", "elapsed_time": "2h 12m 2s", "remaining_time": "36m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.67578} +{"loss": 0.80163616, "grad_norm": 1.22213411, "learning_rate": 8.58e-06, "token_acc": 0.76124319, "epoch": 1.56570713, "global_step/max_steps": "626/800", "percentage": "78.25%", "elapsed_time": "2h 12m 13s", "remaining_time": "36m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.673175} +{"loss": 0.70199716, "grad_norm": 3.99387097, "learning_rate": 8.49e-06, "token_acc": 0.78593976, "epoch": 1.56821026, "global_step/max_steps": "627/800", "percentage": "78.38%", "elapsed_time": "2h 12m 24s", "remaining_time": "36m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.669417} +{"loss": 0.64119345, "grad_norm": 1.23568726, "learning_rate": 8.39e-06, "token_acc": 0.80207425, "epoch": 1.57071339, "global_step/max_steps": "628/800", "percentage": "78.50%", "elapsed_time": "2h 12m 31s", "remaining_time": "36m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.661119} +{"loss": 0.67826653, "grad_norm": 3.29904318, "learning_rate": 8.3e-06, "token_acc": 0.79221227, "epoch": 1.57321652, "global_step/max_steps": "629/800", "percentage": "78.62%", "elapsed_time": "2h 12m 40s", "remaining_time": "36m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.654571} +{"loss": 0.79264247, "grad_norm": 1.96482229, "learning_rate": 8.21e-06, "token_acc": 0.76132931, "epoch": 1.57571965, "global_step/max_steps": "630/800", "percentage": "78.75%", "elapsed_time": "2h 12m 47s", "remaining_time": "35m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.645856} +{"loss": 0.87639654, "grad_norm": 1.31287742, "learning_rate": 8.12e-06, "token_acc": 0.73752993, "epoch": 1.57822278, "global_step/max_steps": "631/800", "percentage": "78.88%", "elapsed_time": "2h 13m 16s", "remaining_time": "35m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.672472} +{"loss": 0.62737668, "grad_norm": 4.89046812, "learning_rate": 8.03e-06, "token_acc": 0.81686078, "epoch": 1.58072591, "global_step/max_steps": "632/800", "percentage": "79.00%", "elapsed_time": "2h 13m 25s", "remaining_time": "35m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.665575} +{"loss": 0.59675193, "grad_norm": 3.21601391, "learning_rate": 7.94e-06, "token_acc": 0.81876888, "epoch": 1.58322904, "global_step/max_steps": "633/800", "percentage": "79.12%", "elapsed_time": "2h 13m 35s", "remaining_time": "35m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.66225} +{"loss": 0.69257224, "grad_norm": 3.6083796, "learning_rate": 7.85e-06, "token_acc": 0.78829985, "epoch": 1.58573217, "global_step/max_steps": "634/800", "percentage": "79.25%", "elapsed_time": "2h 13m 42s", "remaining_time": "35m 0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.652579} +{"loss": 0.69708109, "grad_norm": 9.47301579, "learning_rate": 7.76e-06, "token_acc": 0.78806046, "epoch": 1.58823529, "global_step/max_steps": "635/800", "percentage": "79.38%", "elapsed_time": "2h 13m 50s", "remaining_time": "34m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.645673} +{"loss": 0.76020962, "grad_norm": 1.14491796, "learning_rate": 7.67e-06, "token_acc": 0.77023604, "epoch": 1.59073842, "global_step/max_steps": "636/800", "percentage": "79.50%", "elapsed_time": "2h 14m 3s", "remaining_time": "34m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.6457} +{"loss": 0.81495035, "grad_norm": 1.82778966, "learning_rate": 7.58e-06, "token_acc": 0.75628893, "epoch": 1.59324155, "global_step/max_steps": "637/800", "percentage": "79.62%", "elapsed_time": "2h 14m 21s", "remaining_time": "34m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.654964} +{"loss": 0.58719182, "grad_norm": 2.13303685, "learning_rate": 7.5e-06, "token_acc": 0.82529765, "epoch": 1.59574468, "global_step/max_steps": "638/800", "percentage": "79.75%", "elapsed_time": "2h 14m 28s", "remaining_time": "34m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.646041} +{"loss": 0.93145943, "grad_norm": 0.89624143, "learning_rate": 7.41e-06, "token_acc": 0.72807867, "epoch": 1.59824781, "global_step/max_steps": "639/800", "percentage": "79.88%", "elapsed_time": "2h 14m 46s", "remaining_time": "33m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.654518} +{"loss": 0.72506279, "grad_norm": 1.33887541, "learning_rate": 7.32e-06, "token_acc": 0.77987266, "epoch": 1.60075094, "global_step/max_steps": "640/800", "percentage": "80.00%", "elapsed_time": "2h 14m 58s", "remaining_time": "33m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.653402} +{"loss": 0.7996974, "grad_norm": 1.2020129, "learning_rate": 7.24e-06, "token_acc": 0.76426948, "epoch": 1.60325407, "global_step/max_steps": "641/800", "percentage": "80.12%", "elapsed_time": "2h 15m 20s", "remaining_time": "33m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.666952} +{"loss": 0.81701744, "grad_norm": 96.59671783, "learning_rate": 7.15e-06, "token_acc": 0.75532593, "epoch": 1.6057572, "global_step/max_steps": "642/800", "percentage": "80.25%", "elapsed_time": "2h 15m 37s", "remaining_time": "33m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.674974} +{"loss": 0.93795913, "grad_norm": 0.70308745, "learning_rate": 7.06e-06, "token_acc": 0.72275949, "epoch": 1.60826033, "global_step/max_steps": "643/800", "percentage": "80.38%", "elapsed_time": "2h 15m 56s", "remaining_time": "33m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.683681} +{"loss": 0.87080091, "grad_norm": 0.63748586, "learning_rate": 6.98e-06, "token_acc": 0.7396567, "epoch": 1.61076345, "global_step/max_steps": "644/800", "percentage": "80.50%", "elapsed_time": "2h 16m 13s", "remaining_time": "32m 60s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.690517} +{"loss": 0.76917255, "grad_norm": 1.41844833, "learning_rate": 6.89e-06, "token_acc": 0.76623678, "epoch": 1.61326658, "global_step/max_steps": "645/800", "percentage": "80.62%", "elapsed_time": "2h 16m 23s", "remaining_time": "32m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.687091} +{"loss": 0.72113955, "grad_norm": 2.54975915, "learning_rate": 6.81e-06, "token_acc": 0.78633926, "epoch": 1.61576971, "global_step/max_steps": "646/800", "percentage": "80.75%", "elapsed_time": "2h 16m 31s", "remaining_time": "32m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.68031} +{"loss": 0.87245643, "grad_norm": 0.9087345, "learning_rate": 6.73e-06, "token_acc": 0.7409202, "epoch": 1.61827284, "global_step/max_steps": "647/800", "percentage": "80.88%", "elapsed_time": "2h 16m 48s", "remaining_time": "32m 21s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.686743} +{"loss": 0.75109029, "grad_norm": 1.33588648, "learning_rate": 6.64e-06, "token_acc": 0.77259193, "epoch": 1.62077597, "global_step/max_steps": "648/800", "percentage": "81.00%", "elapsed_time": "2h 16m 57s", "remaining_time": "32m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.681139} +{"loss": 0.60408413, "grad_norm": 3.70488811, "learning_rate": 6.56e-06, "token_acc": 0.81436314, "epoch": 1.6232791, "global_step/max_steps": "649/800", "percentage": "81.12%", "elapsed_time": "2h 17m 3s", "remaining_time": "31m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.671029} +{"loss": 0.80580437, "grad_norm": 0.92672867, "learning_rate": 6.48e-06, "token_acc": 0.76059268, "epoch": 1.62578223, "global_step/max_steps": "650/800", "percentage": "81.25%", "elapsed_time": "2h 17m 16s", "remaining_time": "31m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.670895} +{"loss": 0.80997699, "grad_norm": 2.04163551, "learning_rate": 6.39e-06, "token_acc": 0.75778284, "epoch": 1.62828536, "global_step/max_steps": "651/800", "percentage": "81.38%", "elapsed_time": "2h 17m 35s", "remaining_time": "31m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.680694} +{"loss": 0.61961806, "grad_norm": 1.51555395, "learning_rate": 6.31e-06, "token_acc": 0.80733055, "epoch": 1.63078849, "global_step/max_steps": "652/800", "percentage": "81.50%", "elapsed_time": "2h 17m 44s", "remaining_time": "31m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.67467} +{"loss": 0.71327841, "grad_norm": 1.76856875, "learning_rate": 6.23e-06, "token_acc": 0.78446312, "epoch": 1.63329161, "global_step/max_steps": "653/800", "percentage": "81.62%", "elapsed_time": "2h 17m 54s", "remaining_time": "31m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.670135} +{"loss": 0.84858608, "grad_norm": 0.8426441, "learning_rate": 6.15e-06, "token_acc": 0.74822994, "epoch": 1.63579474, "global_step/max_steps": "654/800", "percentage": "81.75%", "elapsed_time": "2h 18m 3s", "remaining_time": "30m 49s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.665385} +{"loss": 0.83677864, "grad_norm": 4.96816874, "learning_rate": 6.07e-06, "token_acc": 0.74914347, "epoch": 1.63829787, "global_step/max_steps": "655/800", "percentage": "81.88%", "elapsed_time": "2h 18m 13s", "remaining_time": "30m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.661029} +{"loss": 0.77196014, "grad_norm": 3.88003802, "learning_rate": 5.99e-06, "token_acc": 0.76815726, "epoch": 1.640801, "global_step/max_steps": "656/800", "percentage": "82.00%", "elapsed_time": "2h 18m 23s", "remaining_time": "30m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.657488} +{"loss": 0.88411069, "grad_norm": 0.78566533, "learning_rate": 5.91e-06, "token_acc": 0.73990538, "epoch": 1.64330413, "global_step/max_steps": "657/800", "percentage": "82.12%", "elapsed_time": "2h 18m 42s", "remaining_time": "30m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.666105} +{"loss": 0.76904219, "grad_norm": 1.23102689, "learning_rate": 5.83e-06, "token_acc": 0.76979937, "epoch": 1.64580726, "global_step/max_steps": "658/800", "percentage": "82.25%", "elapsed_time": "2h 18m 58s", "remaining_time": "29m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.671246} +{"loss": 0.81091058, "grad_norm": 1.58376145, "learning_rate": 5.75e-06, "token_acc": 0.7599359, "epoch": 1.64831039, "global_step/max_steps": "659/800", "percentage": "82.38%", "elapsed_time": "2h 19m 6s", "remaining_time": "29m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.664532} +{"loss": 0.77115238, "grad_norm": 0.85617256, "learning_rate": 5.67e-06, "token_acc": 0.76786263, "epoch": 1.65081352, "global_step/max_steps": "660/800", "percentage": "82.50%", "elapsed_time": "2h 19m 18s", "remaining_time": "29m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.66318} +{"loss": 0.7253691, "grad_norm": 1.35329843, "learning_rate": 5.6e-06, "token_acc": 0.78455702, "epoch": 1.65331665, "global_step/max_steps": "661/800", "percentage": "82.62%", "elapsed_time": "2h 19m 37s", "remaining_time": "29m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.672711} +{"loss": 0.71434075, "grad_norm": 0.91151941, "learning_rate": 5.52e-06, "token_acc": 0.78972753, "epoch": 1.65581977, "global_step/max_steps": "662/800", "percentage": "82.75%", "elapsed_time": "2h 19m 51s", "remaining_time": "29m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.675959} +{"loss": 0.59927243, "grad_norm": 1.31916547, "learning_rate": 5.44e-06, "token_acc": 0.81638786, "epoch": 1.6583229, "global_step/max_steps": "663/800", "percentage": "82.88%", "elapsed_time": "2h 19m 59s", "remaining_time": "28m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.667863} +{"loss": 0.64043081, "grad_norm": 1.71097016, "learning_rate": 5.37e-06, "token_acc": 0.80544269, "epoch": 1.66082603, "global_step/max_steps": "664/800", "percentage": "83.00%", "elapsed_time": "2h 20m 5s", "remaining_time": "28m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658559} +{"loss": 0.6878444, "grad_norm": 0.98786765, "learning_rate": 5.29e-06, "token_acc": 0.79455927, "epoch": 1.66332916, "global_step/max_steps": "665/800", "percentage": "83.12%", "elapsed_time": "2h 20m 18s", "remaining_time": "28m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658078} +{"loss": 0.68507206, "grad_norm": 1.9691999, "learning_rate": 5.22e-06, "token_acc": 0.79391583, "epoch": 1.66583229, "global_step/max_steps": "666/800", "percentage": "83.25%", "elapsed_time": "2h 20m 26s", "remaining_time": "28m 15s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.652021} +{"loss": 0.85034323, "grad_norm": 2.09370208, "learning_rate": 5.14e-06, "token_acc": 0.74737239, "epoch": 1.66833542, "global_step/max_steps": "667/800", "percentage": "83.38%", "elapsed_time": "2h 20m 35s", "remaining_time": "28m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.645818} +{"loss": 0.80472285, "grad_norm": 1.68338001, "learning_rate": 5.07e-06, "token_acc": 0.75688687, "epoch": 1.67083855, "global_step/max_steps": "668/800", "percentage": "83.50%", "elapsed_time": "2h 20m 49s", "remaining_time": "27m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648552} +{"loss": 0.80177563, "grad_norm": 1.45116711, "learning_rate": 4.99e-06, "token_acc": 0.75929593, "epoch": 1.67334168, "global_step/max_steps": "669/800", "percentage": "83.62%", "elapsed_time": "2h 21m 0s", "remaining_time": "27m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.646218} +{"loss": 0.80597138, "grad_norm": 1.06397986, "learning_rate": 4.92e-06, "token_acc": 0.75611111, "epoch": 1.67584481, "global_step/max_steps": "670/800", "percentage": "83.75%", "elapsed_time": "2h 21m 17s", "remaining_time": "27m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.652435} +{"loss": 0.82413423, "grad_norm": 1.03571582, "learning_rate": 4.85e-06, "token_acc": 0.74548474, "epoch": 1.67834793, "global_step/max_steps": "671/800", "percentage": "83.88%", "elapsed_time": "2h 21m 38s", "remaining_time": "27m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.664333} +{"loss": 0.85553944, "grad_norm": 0.867136, "learning_rate": 4.77e-06, "token_acc": 0.74742178, "epoch": 1.68085106, "global_step/max_steps": "672/800", "percentage": "84.00%", "elapsed_time": "2h 22m 3s", "remaining_time": "27m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.682636} +{"loss": 0.68544388, "grad_norm": 5.88376617, "learning_rate": 4.7e-06, "token_acc": 0.78452291, "epoch": 1.68335419, "global_step/max_steps": "673/800", "percentage": "84.12%", "elapsed_time": "2h 22m 16s", "remaining_time": "26m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.682863} +{"loss": 0.75877655, "grad_norm": 1.16889477, "learning_rate": 4.63e-06, "token_acc": 0.76883968, "epoch": 1.68585732, "global_step/max_steps": "674/800", "percentage": "84.25%", "elapsed_time": "2h 22m 24s", "remaining_time": "26m 37s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.677012} +{"loss": 0.73266506, "grad_norm": 21.16924095, "learning_rate": 4.56e-06, "token_acc": 0.77823529, "epoch": 1.68836045, "global_step/max_steps": "675/800", "percentage": "84.38%", "elapsed_time": "2h 22m 32s", "remaining_time": "26m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.669314} +{"loss": 0.85377991, "grad_norm": 1.83885705, "learning_rate": 4.49e-06, "token_acc": 0.7444394, "epoch": 1.69086358, "global_step/max_steps": "676/800", "percentage": "84.50%", "elapsed_time": "2h 22m 46s", "remaining_time": "26m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.672217} +{"loss": 0.779392, "grad_norm": 1.03196633, "learning_rate": 4.42e-06, "token_acc": 0.76757129, "epoch": 1.69336671, "global_step/max_steps": "677/800", "percentage": "84.62%", "elapsed_time": "2h 22m 57s", "remaining_time": "25m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.669352} +{"loss": 0.79147208, "grad_norm": 1.00055599, "learning_rate": 4.35e-06, "token_acc": 0.76452527, "epoch": 1.69586984, "global_step/max_steps": "678/800", "percentage": "84.75%", "elapsed_time": "2h 23m 14s", "remaining_time": "25m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.675797} +{"loss": 0.84609509, "grad_norm": 2.67810321, "learning_rate": 4.28e-06, "token_acc": 0.74886405, "epoch": 1.69837297, "global_step/max_steps": "679/800", "percentage": "84.88%", "elapsed_time": "2h 23m 31s", "remaining_time": "25m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.681813} +{"loss": 0.70956504, "grad_norm": 2.25623751, "learning_rate": 4.21e-06, "token_acc": 0.7868913, "epoch": 1.7008761, "global_step/max_steps": "680/800", "percentage": "85.00%", "elapsed_time": "2h 23m 38s", "remaining_time": "25m 21s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.674219} +{"loss": 0.72785532, "grad_norm": 1.42179835, "learning_rate": 4.15e-06, "token_acc": 0.78637795, "epoch": 1.70337922, "global_step/max_steps": "681/800", "percentage": "85.12%", "elapsed_time": "2h 23m 56s", "remaining_time": "25m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.680931} +{"loss": 0.70244819, "grad_norm": 1.84605467, "learning_rate": 4.08e-06, "token_acc": 0.78520891, "epoch": 1.70588235, "global_step/max_steps": "682/800", "percentage": "85.25%", "elapsed_time": "2h 24m 6s", "remaining_time": "24m 56s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.678053} +{"loss": 0.66659594, "grad_norm": 1.18932223, "learning_rate": 4.01e-06, "token_acc": 0.79902336, "epoch": 1.70838548, "global_step/max_steps": "683/800", "percentage": "85.38%", "elapsed_time": "2h 24m 14s", "remaining_time": "24m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.669841} +{"loss": 0.84074599, "grad_norm": 1.25527108, "learning_rate": 3.94e-06, "token_acc": 0.75144678, "epoch": 1.71088861, "global_step/max_steps": "684/800", "percentage": "85.50%", "elapsed_time": "2h 24m 27s", "remaining_time": "24m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.671597} +{"loss": 0.60346943, "grad_norm": 1.71913838, "learning_rate": 3.88e-06, "token_acc": 0.81849374, "epoch": 1.71339174, "global_step/max_steps": "685/800", "percentage": "85.62%", "elapsed_time": "2h 24m 35s", "remaining_time": "24m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.664618} +{"loss": 0.87504208, "grad_norm": 2.43488598, "learning_rate": 3.81e-06, "token_acc": 0.73809639, "epoch": 1.71589487, "global_step/max_steps": "686/800", "percentage": "85.75%", "elapsed_time": "2h 24m 52s", "remaining_time": "24m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.670607} +{"loss": 0.82979643, "grad_norm": 0.86194408, "learning_rate": 3.75e-06, "token_acc": 0.7521787, "epoch": 1.718398, "global_step/max_steps": "687/800", "percentage": "85.88%", "elapsed_time": "2h 25m 8s", "remaining_time": "23m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.675084} +{"loss": 0.70309293, "grad_norm": 1.15560353, "learning_rate": 3.68e-06, "token_acc": 0.79067722, "epoch": 1.72090113, "global_step/max_steps": "688/800", "percentage": "86.00%", "elapsed_time": "2h 25m 16s", "remaining_time": "23m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.668167} +{"loss": 0.69186878, "grad_norm": 5.85668993, "learning_rate": 3.62e-06, "token_acc": 0.78974288, "epoch": 1.72340426, "global_step/max_steps": "689/800", "percentage": "86.12%", "elapsed_time": "2h 25m 24s", "remaining_time": "23m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.662318} +{"loss": 0.73663366, "grad_norm": 1.36575508, "learning_rate": 3.56e-06, "token_acc": 0.77998727, "epoch": 1.72590738, "global_step/max_steps": "690/800", "percentage": "86.25%", "elapsed_time": "2h 25m 33s", "remaining_time": "23m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656965} +{"loss": 0.67587662, "grad_norm": 1.19324303, "learning_rate": 3.49e-06, "token_acc": 0.79630378, "epoch": 1.72841051, "global_step/max_steps": "691/800", "percentage": "86.38%", "elapsed_time": "2h 25m 51s", "remaining_time": "23m 0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.663916} +{"loss": 0.61019486, "grad_norm": 3.92859674, "learning_rate": 3.43e-06, "token_acc": 0.81364064, "epoch": 1.73091364, "global_step/max_steps": "692/800", "percentage": "86.50%", "elapsed_time": "2h 26m 1s", "remaining_time": "22m 47s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.660433} +{"loss": 0.68655062, "grad_norm": 1.80204761, "learning_rate": 3.37e-06, "token_acc": 0.79316227, "epoch": 1.73341677, "global_step/max_steps": "693/800", "percentage": "86.62%", "elapsed_time": "2h 26m 11s", "remaining_time": "22m 34s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656649} +{"loss": 0.80514842, "grad_norm": 1.07135856, "learning_rate": 3.31e-06, "token_acc": 0.75424957, "epoch": 1.7359199, "global_step/max_steps": "694/800", "percentage": "86.75%", "elapsed_time": "2h 26m 28s", "remaining_time": "22m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.663514} +{"loss": 0.76773262, "grad_norm": 1.31804001, "learning_rate": 3.25e-06, "token_acc": 0.77043003, "epoch": 1.73842303, "global_step/max_steps": "695/800", "percentage": "86.88%", "elapsed_time": "2h 26m 37s", "remaining_time": "22m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.657319} +{"loss": 0.79435104, "grad_norm": 1.2523272, "learning_rate": 3.19e-06, "token_acc": 0.7613923, "epoch": 1.74092616, "global_step/max_steps": "696/800", "percentage": "87.00%", "elapsed_time": "2h 26m 51s", "remaining_time": "21m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.659433} +{"loss": 0.70189738, "grad_norm": 4.40546465, "learning_rate": 3.13e-06, "token_acc": 0.78841227, "epoch": 1.74342929, "global_step/max_steps": "697/800", "percentage": "87.12%", "elapsed_time": "2h 26m 60s", "remaining_time": "21m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.653736} +{"loss": 0.83553231, "grad_norm": 1.33023, "learning_rate": 3.07e-06, "token_acc": 0.74928088, "epoch": 1.74593242, "global_step/max_steps": "698/800", "percentage": "87.25%", "elapsed_time": "2h 27m 16s", "remaining_time": "21m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658836} +{"loss": 0.80565685, "grad_norm": 2.50546861, "learning_rate": 3.01e-06, "token_acc": 0.76349144, "epoch": 1.74843554, "global_step/max_steps": "699/800", "percentage": "87.38%", "elapsed_time": "2h 27m 27s", "remaining_time": "21m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656389} +{"loss": 0.89496136, "grad_norm": 8.32154369, "learning_rate": 2.95e-06, "token_acc": 0.73808274, "epoch": 1.75093867, "global_step/max_steps": "700/800", "percentage": "87.50%", "elapsed_time": "2h 27m 44s", "remaining_time": "21m 6s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.662322} +{"loss": 0.82010126, "grad_norm": 2.05789781, "learning_rate": 2.89e-06, "token_acc": 0.75419022, "epoch": 1.7534418, "global_step/max_steps": "701/800", "percentage": "87.62%", "elapsed_time": "2h 28m 7s", "remaining_time": "20m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.678095} +{"loss": 0.83286482, "grad_norm": 1.60510647, "learning_rate": 2.84e-06, "token_acc": 0.75335289, "epoch": 1.75594493, "global_step/max_steps": "702/800", "percentage": "87.75%", "elapsed_time": "2h 28m 20s", "remaining_time": "20m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.678267} +{"loss": 0.68551487, "grad_norm": 3.27392006, "learning_rate": 2.78e-06, "token_acc": 0.79094753, "epoch": 1.75844806, "global_step/max_steps": "703/800", "percentage": "87.88%", "elapsed_time": "2h 28m 32s", "remaining_time": "20m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.677601} +{"loss": 0.81894541, "grad_norm": 1.09989154, "learning_rate": 2.72e-06, "token_acc": 0.75938804, "epoch": 1.76095119, "global_step/max_steps": "704/800", "percentage": "88.00%", "elapsed_time": "2h 28m 44s", "remaining_time": "20m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.676183} +{"loss": 0.77103746, "grad_norm": 1.33927047, "learning_rate": 2.67e-06, "token_acc": 0.77303104, "epoch": 1.76345432, "global_step/max_steps": "705/800", "percentage": "88.12%", "elapsed_time": "2h 28m 53s", "remaining_time": "20m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.671468} +{"loss": 0.73539239, "grad_norm": 1.17776871, "learning_rate": 2.61e-06, "token_acc": 0.78390098, "epoch": 1.76595745, "global_step/max_steps": "706/800", "percentage": "88.25%", "elapsed_time": "2h 29m 2s", "remaining_time": "19m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.665946} +{"loss": 0.73137558, "grad_norm": 10.78748894, "learning_rate": 2.56e-06, "token_acc": 0.77930389, "epoch": 1.76846058, "global_step/max_steps": "707/800", "percentage": "88.38%", "elapsed_time": "2h 29m 12s", "remaining_time": "19m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.662568} +{"loss": 0.88136822, "grad_norm": 1.79597604, "learning_rate": 2.51e-06, "token_acc": 0.73713003, "epoch": 1.7709637, "global_step/max_steps": "708/800", "percentage": "88.50%", "elapsed_time": "2h 29m 32s", "remaining_time": "19m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.672095} +{"loss": 0.88959289, "grad_norm": 0.78062135, "learning_rate": 2.45e-06, "token_acc": 0.73565592, "epoch": 1.77346683, "global_step/max_steps": "709/800", "percentage": "88.62%", "elapsed_time": "2h 29m 45s", "remaining_time": "19m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.672769} +{"loss": 0.71786553, "grad_norm": 2.6687181, "learning_rate": 2.4e-06, "token_acc": 0.78311729, "epoch": 1.77596996, "global_step/max_steps": "710/800", "percentage": "88.75%", "elapsed_time": "2h 29m 55s", "remaining_time": "19m 0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.668934} +{"loss": 0.73743629, "grad_norm": 1.28208482, "learning_rate": 2.35e-06, "token_acc": 0.77591003, "epoch": 1.77847309, "global_step/max_steps": "711/800", "percentage": "88.88%", "elapsed_time": "2h 30m 19s", "remaining_time": "18m 49s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.685115} +{"loss": 0.88120973, "grad_norm": 1.93586552, "learning_rate": 2.3e-06, "token_acc": 0.7435395, "epoch": 1.78097622, "global_step/max_steps": "712/800", "percentage": "89.00%", "elapsed_time": "2h 30m 31s", "remaining_time": "18m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.684521} +{"loss": 0.72440517, "grad_norm": 1.74585783, "learning_rate": 2.25e-06, "token_acc": 0.77799132, "epoch": 1.78347935, "global_step/max_steps": "713/800", "percentage": "89.12%", "elapsed_time": "2h 30m 45s", "remaining_time": "18m 24s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.685446} +{"loss": 0.90323889, "grad_norm": 3.75218678, "learning_rate": 2.19e-06, "token_acc": 0.72900108, "epoch": 1.78598248, "global_step/max_steps": "714/800", "percentage": "89.25%", "elapsed_time": "2h 30m 58s", "remaining_time": "18m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.686913} +{"loss": 0.74815851, "grad_norm": 1.7055496, "learning_rate": 2.14e-06, "token_acc": 0.77717087, "epoch": 1.78848561, "global_step/max_steps": "715/800", "percentage": "89.38%", "elapsed_time": "2h 31m 6s", "remaining_time": "17m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.680144} +{"loss": 0.72560632, "grad_norm": 0.91568601, "learning_rate": 2.1e-06, "token_acc": 0.78216104, "epoch": 1.79098874, "global_step/max_steps": "716/800", "percentage": "89.50%", "elapsed_time": "2h 31m 21s", "remaining_time": "17m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.682897} +{"loss": 0.86343342, "grad_norm": 1.22002864, "learning_rate": 2.05e-06, "token_acc": 0.74416589, "epoch": 1.79349186, "global_step/max_steps": "717/800", "percentage": "89.62%", "elapsed_time": "2h 31m 28s", "remaining_time": "17m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.67474} +{"loss": 0.77554393, "grad_norm": 1.20459986, "learning_rate": 2e-06, "token_acc": 0.76416435, "epoch": 1.79599499, "global_step/max_steps": "718/800", "percentage": "89.75%", "elapsed_time": "2h 31m 35s", "remaining_time": "17m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.667266} +{"loss": 0.753775, "grad_norm": 1.35113752, "learning_rate": 1.95e-06, "token_acc": 0.77339051, "epoch": 1.79849812, "global_step/max_steps": "719/800", "percentage": "89.88%", "elapsed_time": "2h 31m 45s", "remaining_time": "17m 6s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.663858} +{"loss": 0.61326581, "grad_norm": 1.86655104, "learning_rate": 1.9e-06, "token_acc": 0.81483007, "epoch": 1.80100125, "global_step/max_steps": "720/800", "percentage": "90.00%", "elapsed_time": "2h 31m 53s", "remaining_time": "16m 53s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656583} +{"loss": 0.62173671, "grad_norm": 2.04039216, "learning_rate": 1.86e-06, "token_acc": 0.81007791, "epoch": 1.80350438, "global_step/max_steps": "721/800", "percentage": "90.12%", "elapsed_time": "2h 32m 9s", "remaining_time": "16m 40s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.661782} +{"loss": 0.87257773, "grad_norm": 0.91303688, "learning_rate": 1.81e-06, "token_acc": 0.74019732, "epoch": 1.80600751, "global_step/max_steps": "722/800", "percentage": "90.25%", "elapsed_time": "2h 32m 23s", "remaining_time": "16m 28s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.66293} +{"loss": 0.82116061, "grad_norm": 1.68161523, "learning_rate": 1.76e-06, "token_acc": 0.75092285, "epoch": 1.80851064, "global_step/max_steps": "723/800", "percentage": "90.38%", "elapsed_time": "2h 32m 41s", "remaining_time": "16m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.6713} +{"loss": 0.73675084, "grad_norm": 1.04260516, "learning_rate": 1.72e-06, "token_acc": 0.77966397, "epoch": 1.81101377, "global_step/max_steps": "724/800", "percentage": "90.50%", "elapsed_time": "2h 32m 52s", "remaining_time": "16m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.66855} +{"loss": 0.7357651, "grad_norm": 5.26951027, "learning_rate": 1.68e-06, "token_acc": 0.77754663, "epoch": 1.8135169, "global_step/max_steps": "725/800", "percentage": "90.62%", "elapsed_time": "2h 33m 3s", "remaining_time": "15m 50s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.666867} +{"loss": 0.7867927, "grad_norm": 2.36950445, "learning_rate": 1.63e-06, "token_acc": 0.76456187, "epoch": 1.81602003, "global_step/max_steps": "726/800", "percentage": "90.75%", "elapsed_time": "2h 33m 19s", "remaining_time": "15m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.671445} +{"loss": 0.78603446, "grad_norm": 1.08303559, "learning_rate": 1.59e-06, "token_acc": 0.77024592, "epoch": 1.81852315, "global_step/max_steps": "727/800", "percentage": "90.88%", "elapsed_time": "2h 33m 32s", "remaining_time": "15m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.670929} +{"loss": 0.71876073, "grad_norm": 1.72000182, "learning_rate": 1.55e-06, "token_acc": 0.78837361, "epoch": 1.82102628, "global_step/max_steps": "728/800", "percentage": "91.00%", "elapsed_time": "2h 33m 40s", "remaining_time": "15m 12s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.664676} +{"loss": 0.79470199, "grad_norm": 1.10939288, "learning_rate": 1.5e-06, "token_acc": 0.75650249, "epoch": 1.82352941, "global_step/max_steps": "729/800", "percentage": "91.12%", "elapsed_time": "2h 33m 48s", "remaining_time": "14m 59s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.659039} +{"loss": 0.73694885, "grad_norm": 3.58643699, "learning_rate": 1.46e-06, "token_acc": 0.7861625, "epoch": 1.82603254, "global_step/max_steps": "730/800", "percentage": "91.25%", "elapsed_time": "2h 33m 58s", "remaining_time": "14m 46s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.654399} +{"loss": 0.85294491, "grad_norm": 1.43845737, "learning_rate": 1.42e-06, "token_acc": 0.74519846, "epoch": 1.82853567, "global_step/max_steps": "731/800", "percentage": "91.38%", "elapsed_time": "2h 34m 27s", "remaining_time": "14m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.677721} +{"loss": 0.71782911, "grad_norm": 1.04395187, "learning_rate": 1.38e-06, "token_acc": 0.7799321, "epoch": 1.8310388, "global_step/max_steps": "732/800", "percentage": "91.50%", "elapsed_time": "2h 34m 35s", "remaining_time": "14m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.671151} +{"loss": 0.74384761, "grad_norm": 5.8573885, "learning_rate": 1.34e-06, "token_acc": 0.78188515, "epoch": 1.83354193, "global_step/max_steps": "733/800", "percentage": "91.62%", "elapsed_time": "2h 34m 46s", "remaining_time": "14m 9s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.668003} +{"loss": 0.82630765, "grad_norm": 2.24703526, "learning_rate": 1.3e-06, "token_acc": 0.7534709, "epoch": 1.83604506, "global_step/max_steps": "734/800", "percentage": "91.75%", "elapsed_time": "2h 34m 57s", "remaining_time": "13m 56s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.666456} +{"loss": 0.88561153, "grad_norm": 1.86307073, "learning_rate": 1.26e-06, "token_acc": 0.73724454, "epoch": 1.83854819, "global_step/max_steps": "735/800", "percentage": "91.88%", "elapsed_time": "2h 35m 10s", "remaining_time": "13m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.667316} +{"loss": 0.81347466, "grad_norm": 1.03274786, "learning_rate": 1.22e-06, "token_acc": 0.7548228, "epoch": 1.84105131, "global_step/max_steps": "736/800", "percentage": "92.00%", "elapsed_time": "2h 35m 22s", "remaining_time": "13m 31s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.665827} +{"loss": 0.63253909, "grad_norm": 1.5423094, "learning_rate": 1.19e-06, "token_acc": 0.80933232, "epoch": 1.84355444, "global_step/max_steps": "737/800", "percentage": "92.12%", "elapsed_time": "2h 35m 32s", "remaining_time": "13m 18s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.661768} +{"loss": 0.69550312, "grad_norm": 2.87622237, "learning_rate": 1.15e-06, "token_acc": 0.7930339, "epoch": 1.84605757, "global_step/max_steps": "738/800", "percentage": "92.25%", "elapsed_time": "2h 35m 42s", "remaining_time": "13m 5s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658052} +{"loss": 0.72894466, "grad_norm": 3.02134895, "learning_rate": 1.11e-06, "token_acc": 0.77583587, "epoch": 1.8485607, "global_step/max_steps": "739/800", "percentage": "92.38%", "elapsed_time": "2h 35m 48s", "remaining_time": "12m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.649868} +{"loss": 0.74428815, "grad_norm": 0.83955187, "learning_rate": 1.08e-06, "token_acc": 0.77560428, "epoch": 1.85106383, "global_step/max_steps": "740/800", "percentage": "92.50%", "elapsed_time": "2h 36m 0s", "remaining_time": "12m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648889} +{"loss": 0.80540383, "grad_norm": 0.94163942, "learning_rate": 1.04e-06, "token_acc": 0.76032029, "epoch": 1.85356696, "global_step/max_steps": "741/800", "percentage": "92.62%", "elapsed_time": "2h 36m 24s", "remaining_time": "12m 27s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.664207} +{"loss": 0.72203445, "grad_norm": 1.51838636, "learning_rate": 1.01e-06, "token_acc": 0.78390289, "epoch": 1.85607009, "global_step/max_steps": "742/800", "percentage": "92.75%", "elapsed_time": "2h 36m 31s", "remaining_time": "12m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656589} +{"loss": 0.80780482, "grad_norm": 2.24276209, "learning_rate": 9.7e-07, "token_acc": 0.75657023, "epoch": 1.85857322, "global_step/max_steps": "743/800", "percentage": "92.88%", "elapsed_time": "2h 36m 45s", "remaining_time": "12m 2s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658713} +{"loss": 0.69648314, "grad_norm": 2.04529476, "learning_rate": 9.4e-07, "token_acc": 0.78780593, "epoch": 1.86107635, "global_step/max_steps": "744/800", "percentage": "93.00%", "elapsed_time": "2h 36m 58s", "remaining_time": "11m 49s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658031} +{"loss": 0.87503517, "grad_norm": 1.15941036, "learning_rate": 9.1e-07, "token_acc": 0.74045931, "epoch": 1.86357947, "global_step/max_steps": "745/800", "percentage": "93.12%", "elapsed_time": "2h 37m 13s", "remaining_time": "11m 36s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.661562} +{"loss": 0.76382756, "grad_norm": 1.43490493, "learning_rate": 8.7e-07, "token_acc": 0.76923077, "epoch": 1.8660826, "global_step/max_steps": "746/800", "percentage": "93.25%", "elapsed_time": "2h 37m 22s", "remaining_time": "11m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656419} +{"loss": 0.71933985, "grad_norm": 3.40505791, "learning_rate": 8.4e-07, "token_acc": 0.78064206, "epoch": 1.86858573, "global_step/max_steps": "747/800", "percentage": "93.38%", "elapsed_time": "2h 37m 33s", "remaining_time": "11m 11s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.654023} +{"loss": 0.89265722, "grad_norm": 0.72626364, "learning_rate": 8.1e-07, "token_acc": 0.73518485, "epoch": 1.87108886, "global_step/max_steps": "748/800", "percentage": "93.50%", "elapsed_time": "2h 37m 46s", "remaining_time": "10m 58s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.65473} +{"loss": 0.80854261, "grad_norm": 2.20644188, "learning_rate": 7.8e-07, "token_acc": 0.75537039, "epoch": 1.87359199, "global_step/max_steps": "749/800", "percentage": "93.62%", "elapsed_time": "2h 37m 60s", "remaining_time": "10m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656863} +{"loss": 0.74162591, "grad_norm": 1.22153199, "learning_rate": 7.5e-07, "token_acc": 0.77992876, "epoch": 1.87609512, "global_step/max_steps": "750/800", "percentage": "93.75%", "elapsed_time": "2h 38m 10s", "remaining_time": "10m 33s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.652952} +{"loss": 0.78846645, "grad_norm": 1.19654882, "learning_rate": 7.2e-07, "token_acc": 0.7657543, "epoch": 1.87859825, "global_step/max_steps": "751/800", "percentage": "93.88%", "elapsed_time": "2h 38m 32s", "remaining_time": "10m 21s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.66633} +{"loss": 0.65273964, "grad_norm": 1.43677211, "learning_rate": 6.9e-07, "token_acc": 0.79968129, "epoch": 1.88110138, "global_step/max_steps": "752/800", "percentage": "94.00%", "elapsed_time": "2h 38m 41s", "remaining_time": "10m 8s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.660527} +{"loss": 0.90233934, "grad_norm": 0.70720643, "learning_rate": 6.6e-07, "token_acc": 0.74017074, "epoch": 1.88360451, "global_step/max_steps": "753/800", "percentage": "94.12%", "elapsed_time": "2h 38m 55s", "remaining_time": "9m 55s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.66236} +{"loss": 0.88806295, "grad_norm": 4.4527421, "learning_rate": 6.3e-07, "token_acc": 0.73227374, "epoch": 1.88610763, "global_step/max_steps": "754/800", "percentage": "94.25%", "elapsed_time": "2h 39m 11s", "remaining_time": "9m 43s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.667595} +{"loss": 0.74703056, "grad_norm": 1.02465224, "learning_rate": 6.1e-07, "token_acc": 0.7724305, "epoch": 1.88861076, "global_step/max_steps": "755/800", "percentage": "94.38%", "elapsed_time": "2h 39m 24s", "remaining_time": "9m 30s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.666911} +{"loss": 0.76364326, "grad_norm": 1.33607471, "learning_rate": 5.8e-07, "token_acc": 0.77158856, "epoch": 1.89111389, "global_step/max_steps": "756/800", "percentage": "94.50%", "elapsed_time": "2h 39m 34s", "remaining_time": "9m 17s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.66413} +{"loss": 0.78318995, "grad_norm": 6.53122759, "learning_rate": 5.5e-07, "token_acc": 0.76355356, "epoch": 1.89361702, "global_step/max_steps": "757/800", "percentage": "94.62%", "elapsed_time": "2h 39m 43s", "remaining_time": "9m 4s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.659053} +{"loss": 0.69549125, "grad_norm": 1.64983273, "learning_rate": 5.3e-07, "token_acc": 0.78765337, "epoch": 1.89612015, "global_step/max_steps": "758/800", "percentage": "94.75%", "elapsed_time": "2h 39m 56s", "remaining_time": "8m 52s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.659108} +{"loss": 0.7910645, "grad_norm": 1.42308843, "learning_rate": 5e-07, "token_acc": 0.76632376, "epoch": 1.89862328, "global_step/max_steps": "759/800", "percentage": "94.88%", "elapsed_time": "2h 40m 4s", "remaining_time": "8m 39s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.653868} +{"loss": 0.78573853, "grad_norm": 1.27165568, "learning_rate": 4.8e-07, "token_acc": 0.76171828, "epoch": 1.90112641, "global_step/max_steps": "760/800", "percentage": "95.00%", "elapsed_time": "2h 40m 20s", "remaining_time": "8m 26s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658367} +{"loss": 0.74037981, "grad_norm": 3.85703707, "learning_rate": 4.6e-07, "token_acc": 0.7729266, "epoch": 1.90362954, "global_step/max_steps": "761/800", "percentage": "95.12%", "elapsed_time": "2h 40m 38s", "remaining_time": "8m 14s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.665534} +{"loss": 0.738702, "grad_norm": 1.46846735, "learning_rate": 4.3e-07, "token_acc": 0.77500953, "epoch": 1.90613267, "global_step/max_steps": "762/800", "percentage": "95.25%", "elapsed_time": "2h 40m 49s", "remaining_time": "8m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.663279} +{"loss": 0.72113568, "grad_norm": 1.64332473, "learning_rate": 4.1e-07, "token_acc": 0.7758145, "epoch": 1.90863579, "global_step/max_steps": "763/800", "percentage": "95.38%", "elapsed_time": "2h 40m 58s", "remaining_time": "7m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.657846} +{"loss": 0.62933385, "grad_norm": 1.5427295, "learning_rate": 3.9e-07, "token_acc": 0.80723029, "epoch": 1.91113892, "global_step/max_steps": "764/800", "percentage": "95.50%", "elapsed_time": "2h 41m 4s", "remaining_time": "7m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648975} +{"loss": 0.76141787, "grad_norm": 1.28833365, "learning_rate": 3.7e-07, "token_acc": 0.76875902, "epoch": 1.91364205, "global_step/max_steps": "765/800", "percentage": "95.62%", "elapsed_time": "2h 41m 17s", "remaining_time": "7m 23s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.649314} +{"loss": 0.75007826, "grad_norm": 2.72423124, "learning_rate": 3.5e-07, "token_acc": 0.77652942, "epoch": 1.91614518, "global_step/max_steps": "766/800", "percentage": "95.75%", "elapsed_time": "2h 41m 28s", "remaining_time": "7m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648166} +{"loss": 0.81633228, "grad_norm": 3.10291338, "learning_rate": 3.3e-07, "token_acc": 0.75295844, "epoch": 1.91864831, "global_step/max_steps": "767/800", "percentage": "95.88%", "elapsed_time": "2h 41m 42s", "remaining_time": "6m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.649307} +{"loss": 0.72966814, "grad_norm": 1.15306973, "learning_rate": 3.1e-07, "token_acc": 0.78452855, "epoch": 1.92115144, "global_step/max_steps": "768/800", "percentage": "96.00%", "elapsed_time": "2h 41m 52s", "remaining_time": "6m 45s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.646104} +{"loss": 0.80148423, "grad_norm": 3.25928092, "learning_rate": 2.9e-07, "token_acc": 0.76065751, "epoch": 1.92365457, "global_step/max_steps": "769/800", "percentage": "96.12%", "elapsed_time": "2h 42m 7s", "remaining_time": "6m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648593} +{"loss": 0.62734675, "grad_norm": 18.56254959, "learning_rate": 2.7e-07, "token_acc": 0.81405873, "epoch": 1.9261577, "global_step/max_steps": "770/800", "percentage": "96.25%", "elapsed_time": "2h 42m 14s", "remaining_time": "6m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.642107} +{"loss": 0.81338406, "grad_norm": 0.99755234, "learning_rate": 2.5e-07, "token_acc": 0.75721533, "epoch": 1.92866083, "global_step/max_steps": "771/800", "percentage": "96.38%", "elapsed_time": "2h 42m 33s", "remaining_time": "6m 7s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.65019} +{"loss": 0.62148982, "grad_norm": 1.3826741, "learning_rate": 2.4e-07, "token_acc": 0.81685461, "epoch": 1.93116395, "global_step/max_steps": "772/800", "percentage": "96.50%", "elapsed_time": "2h 42m 41s", "remaining_time": "5m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.644313} +{"loss": 0.79466099, "grad_norm": 0.99964225, "learning_rate": 2.2e-07, "token_acc": 0.76536368, "epoch": 1.93366708, "global_step/max_steps": "773/800", "percentage": "96.62%", "elapsed_time": "2h 42m 57s", "remaining_time": "5m 42s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648701} +{"loss": 0.84331465, "grad_norm": 2.98784375, "learning_rate": 2e-07, "token_acc": 0.74860249, "epoch": 1.93617021, "global_step/max_steps": "774/800", "percentage": "96.75%", "elapsed_time": "2h 43m 11s", "remaining_time": "5m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.649248} +{"loss": 0.76267779, "grad_norm": 2.04417443, "learning_rate": 1.9e-07, "token_acc": 0.77521217, "epoch": 1.93867334, "global_step/max_steps": "775/800", "percentage": "96.88%", "elapsed_time": "2h 43m 22s", "remaining_time": "5m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648122} +{"loss": 0.74198294, "grad_norm": 5.56091309, "learning_rate": 1.7e-07, "token_acc": 0.77750213, "epoch": 1.94117647, "global_step/max_steps": "776/800", "percentage": "97.00%", "elapsed_time": "2h 43m 31s", "remaining_time": "5m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.642413} +{"loss": 0.77516764, "grad_norm": 1.57148552, "learning_rate": 1.6e-07, "token_acc": 0.76717141, "epoch": 1.9436796, "global_step/max_steps": "777/800", "percentage": "97.12%", "elapsed_time": "2h 43m 44s", "remaining_time": "4m 51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.643686} +{"loss": 0.64454806, "grad_norm": 1.86202514, "learning_rate": 1.5e-07, "token_acc": 0.80501121, "epoch": 1.94618273, "global_step/max_steps": "778/800", "percentage": "97.25%", "elapsed_time": "2h 43m 53s", "remaining_time": "4m 38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.639367} +{"loss": 0.70017499, "grad_norm": 2.55248308, "learning_rate": 1.3e-07, "token_acc": 0.7868406, "epoch": 1.94868586, "global_step/max_steps": "779/800", "percentage": "97.38%", "elapsed_time": "2h 44m 2s", "remaining_time": "4m 25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.63419} +{"loss": 0.86330885, "grad_norm": 0.98185605, "learning_rate": 1.2e-07, "token_acc": 0.74408977, "epoch": 1.95118899, "global_step/max_steps": "780/800", "percentage": "97.50%", "elapsed_time": "2h 44m 19s", "remaining_time": "4m 13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.639495} +{"loss": 0.78593296, "grad_norm": 1.46226037, "learning_rate": 1.1e-07, "token_acc": 0.75834533, "epoch": 1.95369212, "global_step/max_steps": "781/800", "percentage": "97.62%", "elapsed_time": "2h 44m 46s", "remaining_time": "4m 1s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.657904} +{"loss": 0.74149096, "grad_norm": 1.25099277, "learning_rate": 1e-07, "token_acc": 0.77096439, "epoch": 1.95619524, "global_step/max_steps": "782/800", "percentage": "97.75%", "elapsed_time": "2h 45m 4s", "remaining_time": "3m 48s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.664427} +{"loss": 0.61837757, "grad_norm": 6.78711653, "learning_rate": 9e-08, "token_acc": 0.81106449, "epoch": 1.95869837, "global_step/max_steps": "783/800", "percentage": "97.88%", "elapsed_time": "2h 45m 10s", "remaining_time": "3m 35s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656734} +{"loss": 0.71286243, "grad_norm": 4.07131672, "learning_rate": 8e-08, "token_acc": 0.7844099, "epoch": 1.9612015, "global_step/max_steps": "784/800", "percentage": "98.00%", "elapsed_time": "2h 45m 19s", "remaining_time": "3m 22s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.651683} +{"loss": 0.72723854, "grad_norm": 1.29569602, "learning_rate": 7e-08, "token_acc": 0.77981724, "epoch": 1.96370463, "global_step/max_steps": "785/800", "percentage": "98.12%", "elapsed_time": "2h 45m 28s", "remaining_time": "3m 10s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.646619} +{"loss": 0.81377405, "grad_norm": 1.67089736, "learning_rate": 6e-08, "token_acc": 0.75792875, "epoch": 1.96620776, "global_step/max_steps": "786/800", "percentage": "98.25%", "elapsed_time": "2h 45m 36s", "remaining_time": "2m 57s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.640638} +{"loss": 0.62888312, "grad_norm": 2.21627307, "learning_rate": 5e-08, "token_acc": 0.80907034, "epoch": 1.96871089, "global_step/max_steps": "787/800", "percentage": "98.38%", "elapsed_time": "2h 45m 44s", "remaining_time": "2m 44s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.635617} +{"loss": 0.76074278, "grad_norm": 1.7803688, "learning_rate": 4e-08, "token_acc": 0.77120111, "epoch": 1.97121402, "global_step/max_steps": "788/800", "percentage": "98.50%", "elapsed_time": "2h 45m 56s", "remaining_time": "2m 32s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.634592} +{"loss": 0.7704131, "grad_norm": 1.54904211, "learning_rate": 4e-08, "token_acc": 0.76746686, "epoch": 1.97371715, "global_step/max_steps": "789/800", "percentage": "98.62%", "elapsed_time": "2h 46m 10s", "remaining_time": "2m 19s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.636397} +{"loss": 0.7262879, "grad_norm": 1.32576323, "learning_rate": 3e-08, "token_acc": 0.7795838, "epoch": 1.97622028, "global_step/max_steps": "790/800", "percentage": "98.75%", "elapsed_time": "2h 46m 23s", "remaining_time": "2m 6s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.636752} +{"loss": 0.6787982, "grad_norm": 1.88234639, "learning_rate": 2e-08, "token_acc": 0.79322169, "epoch": 1.9787234, "global_step/max_steps": "791/800", "percentage": "98.88%", "elapsed_time": "2h 46m 45s", "remaining_time": "1m 54s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648097} +{"loss": 0.77671444, "grad_norm": 0.85267258, "learning_rate": 2e-08, "token_acc": 0.76866634, "epoch": 1.98122653, "global_step/max_steps": "792/800", "percentage": "99.00%", "elapsed_time": "2h 46m 59s", "remaining_time": "1m 41s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.649886} +{"loss": 0.88359201, "grad_norm": 15.67899799, "learning_rate": 1e-08, "token_acc": 0.73635091, "epoch": 1.98372966, "global_step/max_steps": "793/800", "percentage": "99.12%", "elapsed_time": "2h 47m 17s", "remaining_time": "1m 29s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.656927} +{"loss": 0.86527705, "grad_norm": 1.00530601, "learning_rate": 1e-08, "token_acc": 0.74322564, "epoch": 1.98623279, "global_step/max_steps": "794/800", "percentage": "99.25%", "elapsed_time": "2h 47m 32s", "remaining_time": "1m 16s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.660558} +{"loss": 0.66651618, "grad_norm": 2.31365657, "learning_rate": 1e-08, "token_acc": 0.80004826, "epoch": 1.98873592, "global_step/max_steps": "795/800", "percentage": "99.38%", "elapsed_time": "2h 47m 43s", "remaining_time": "1m 3s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.658006} +{"loss": 0.87682962, "grad_norm": 0.98346722, "learning_rate": 0.0, "token_acc": 0.7458358, "epoch": 1.99123905, "global_step/max_steps": "796/800", "percentage": "99.50%", "elapsed_time": "2h 47m 52s", "remaining_time": "51s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.652719} +{"loss": 0.759736, "grad_norm": 1.30670428, "learning_rate": 0.0, "token_acc": 0.77402077, "epoch": 1.99374218, "global_step/max_steps": "797/800", "percentage": "99.62%", "elapsed_time": "2h 48m 2s", "remaining_time": "38s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.650427} +{"loss": 0.7238999, "grad_norm": 1.63528407, "learning_rate": 0.0, "token_acc": 0.78114993, "epoch": 1.99624531, "global_step/max_steps": "798/800", "percentage": "99.75%", "elapsed_time": "2h 48m 12s", "remaining_time": "25s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.646448} +{"loss": 0.74515069, "grad_norm": 1.92492223, "learning_rate": 0.0, "token_acc": 0.77744183, "epoch": 1.99874844, "global_step/max_steps": "799/800", "percentage": "99.88%", "elapsed_time": "2h 48m 26s", "remaining_time": "13s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.648192} +{"loss": 0.82477957, "grad_norm": 2.8703475, "learning_rate": 0.0, "token_acc": 0.7622438, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 48m 32s", "remaining_time": "0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.640168} +{"eval_loss": 0.52942038, "eval_runtime": 3.2005, "eval_samples_per_second": 3.749, "eval_steps_per_second": 0.625, "eval_token_acc": 0.76072111, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 48m 35s", "remaining_time": "0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.64418} +{"train_runtime": 10127.5949, "train_samples_per_second": 2.525, "train_steps_per_second": 0.079, "total_flos": 4.0005050001480745e+18, "train_loss": 0.87315242, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 48m 48s", "remaining_time": "0s", "memory(GiB)": 75.12, "train_speed(s/it)": 12.659491} +{"model_parameter_info": "PeftModelForCausalLM: 8343.6882M Params (51.5215M Trainable [0.6175%]), 0.0019M Buffers.", "last_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800", "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/checkpoint-800", "best_metric": 0.52942038, "global_step": 800, "log_history": [{"loss": 1.4579824209213257, "grad_norm": 2.9617536067962646, "learning_rate": 3.125e-07, "token_acc": 0.6568419333768779, "epoch": 0.0025031289111389237, "step": 1}, {"loss": 1.5049985647201538, "grad_norm": 1.423774242401123, "learning_rate": 6.25e-07, "token_acc": 0.6365098770992857, "epoch": 0.0050062578222778474, "step": 2}, {"loss": 1.4851462841033936, "grad_norm": 1.5966103076934814, "learning_rate": 9.375e-07, "token_acc": 0.6467950044849238, "epoch": 0.007509386733416771, "step": 3}, {"loss": 1.4441643953323364, "grad_norm": 1.452944278717041, "learning_rate": 1.25e-06, "token_acc": 0.6555674699475139, "epoch": 0.010012515644555695, "step": 4}, {"loss": 1.4831663370132446, "grad_norm": 2.1675608158111572, "learning_rate": 1.5625e-06, "token_acc": 0.6366577364403782, "epoch": 0.012515644555694618, "step": 5}, {"loss": 1.4721344709396362, "grad_norm": 8.398337364196777, "learning_rate": 1.875e-06, "token_acc": 0.6424400084943724, "epoch": 0.015018773466833541, "step": 6}, {"loss": 1.4525271654129028, "grad_norm": 3.0731256008148193, "learning_rate": 2.1875e-06, "token_acc": 0.6579513486678802, "epoch": 0.017521902377972465, "step": 7}, {"loss": 1.4381799697875977, "grad_norm": 1.5642091035842896, "learning_rate": 2.5e-06, "token_acc": 0.6511047537890315, "epoch": 0.02002503128911139, "step": 8}, {"loss": 1.541656255722046, "grad_norm": 2.8113529682159424, "learning_rate": 2.8125e-06, "token_acc": 0.618830879071843, "epoch": 0.02252816020025031, "step": 9}, {"loss": 1.5417851209640503, "grad_norm": 1.6361396312713623, "learning_rate": 3.125e-06, "token_acc": 0.6177715521179086, "epoch": 0.025031289111389236, "step": 10}, {"loss": 1.5132269859313965, "grad_norm": 12.022518157958984, "learning_rate": 3.4375000000000005e-06, "token_acc": 0.6238978192242098, "epoch": 0.02753441802252816, "step": 11}, {"loss": 1.46922767162323, "grad_norm": 2.668394088745117, "learning_rate": 3.75e-06, "token_acc": 0.6533487002176975, "epoch": 0.030037546933667083, "step": 12}, {"loss": 1.4974768161773682, "grad_norm": 7.9799017906188965, "learning_rate": 4.0625000000000005e-06, "token_acc": 0.6374414379959843, "epoch": 0.03254067584480601, "step": 13}, {"loss": 1.4622106552124023, "grad_norm": 3.233323574066162, "learning_rate": 4.375e-06, "token_acc": 0.6697823145984504, "epoch": 0.03504380475594493, "step": 14}, {"loss": 1.477518081665039, "grad_norm": 24.691530227661133, "learning_rate": 4.6875000000000004e-06, "token_acc": 0.66816, "epoch": 0.03754693366708386, "step": 15}, {"loss": 1.4357118606567383, "grad_norm": 2.897843360900879, "learning_rate": 5e-06, "token_acc": 0.6778693025809994, "epoch": 0.04005006257822278, "step": 16}, {"loss": 1.5187983512878418, "grad_norm": 19.82540512084961, "learning_rate": 5.3125e-06, "token_acc": 0.6306321643400296, "epoch": 0.0425531914893617, "step": 17}, {"loss": 1.455895185470581, "grad_norm": 2.93292236328125, "learning_rate": 5.625e-06, "token_acc": 0.6512200710276091, "epoch": 0.04505632040050062, "step": 18}, {"loss": 1.422993540763855, "grad_norm": 1.6330183744430542, "learning_rate": 5.9375e-06, "token_acc": 0.661488625487742, "epoch": 0.04755944931163955, "step": 19}, {"loss": 1.4982240200042725, "grad_norm": 4.298096179962158, "learning_rate": 6.25e-06, "token_acc": 0.6452436974789916, "epoch": 0.05006257822277847, "step": 20}, {"loss": 1.518486738204956, "grad_norm": 1.313482403755188, "learning_rate": 6.5625e-06, "token_acc": 0.6326643752078944, "epoch": 0.052565707133917394, "step": 21}, {"loss": 1.4727129936218262, "grad_norm": 1.76573646068573, "learning_rate": 6.875000000000001e-06, "token_acc": 0.6483625537545484, "epoch": 0.05506883604505632, "step": 22}, {"loss": 1.4510971307754517, "grad_norm": 1.4560825824737549, "learning_rate": 7.187499999999999e-06, "token_acc": 0.6514202049780381, "epoch": 0.057571964956195244, "step": 23}, {"loss": 1.5022644996643066, "grad_norm": 1.091919183731079, "learning_rate": 7.5e-06, "token_acc": 0.6532272645091304, "epoch": 0.060075093867334166, "step": 24}, {"loss": 1.4717752933502197, "grad_norm": 2.740084171295166, "learning_rate": 7.8125e-06, "token_acc": 0.639137679650073, "epoch": 0.0625782227784731, "step": 25}, {"loss": 1.4721131324768066, "grad_norm": 2.8075263500213623, "learning_rate": 8.125000000000001e-06, "token_acc": 0.6409317316144155, "epoch": 0.06508135168961202, "step": 26}, {"loss": 1.5016684532165527, "grad_norm": 1.5441093444824219, "learning_rate": 8.437500000000002e-06, "token_acc": 0.6426081151249907, "epoch": 0.06758448060075094, "step": 27}, {"loss": 1.4954692125320435, "grad_norm": 2.806373119354248, "learning_rate": 8.75e-06, "token_acc": 0.6546207959911342, "epoch": 0.07008760951188986, "step": 28}, {"loss": 1.4520496129989624, "grad_norm": 4.36266565322876, "learning_rate": 9.0625e-06, "token_acc": 0.6418620292083013, "epoch": 0.07259073842302878, "step": 29}, {"loss": 1.4115290641784668, "grad_norm": 1.5149106979370117, "learning_rate": 9.375000000000001e-06, "token_acc": 0.651825091489162, "epoch": 0.07509386733416772, "step": 30}, {"loss": 1.4292242527008057, "grad_norm": 2.1750094890594482, "learning_rate": 9.6875e-06, "token_acc": 0.6480092934840004, "epoch": 0.07759699624530664, "step": 31}, {"loss": 1.4468941688537598, "grad_norm": 2.171316623687744, "learning_rate": 1e-05, "token_acc": 0.6347569955817378, "epoch": 0.08010012515644556, "step": 32}, {"loss": 1.4548325538635254, "grad_norm": 1.6085623502731323, "learning_rate": 1.03125e-05, "token_acc": 0.6387750322051763, "epoch": 0.08260325406758448, "step": 33}, {"loss": 1.3636939525604248, "grad_norm": 2.6019768714904785, "learning_rate": 1.0625e-05, "token_acc": 0.6694069289489136, "epoch": 0.0851063829787234, "step": 34}, {"loss": 1.3792800903320312, "grad_norm": 1.7189018726348877, "learning_rate": 1.09375e-05, "token_acc": 0.6634405670665212, "epoch": 0.08760951188986232, "step": 35}, {"loss": 1.418148398399353, "grad_norm": 3.069101572036743, "learning_rate": 1.125e-05, "token_acc": 0.652867715078631, "epoch": 0.09011264080100125, "step": 36}, {"loss": 1.487064242362976, "grad_norm": 0.9760923385620117, "learning_rate": 1.1562500000000002e-05, "token_acc": 0.6303966303966304, "epoch": 0.09261576971214018, "step": 37}, {"loss": 1.3090462684631348, "grad_norm": 0.9802103638648987, "learning_rate": 1.1875e-05, "token_acc": 0.6665271562409453, "epoch": 0.0951188986232791, "step": 38}, {"loss": 1.4249074459075928, "grad_norm": 4.357207298278809, "learning_rate": 1.21875e-05, "token_acc": 0.6332261759597975, "epoch": 0.09762202753441802, "step": 39}, {"loss": 1.3373064994812012, "grad_norm": 1.186145305633545, "learning_rate": 1.25e-05, "token_acc": 0.6725337118523775, "epoch": 0.10012515644555695, "step": 40}, {"loss": 1.340531349182129, "grad_norm": 5.261158466339111, "learning_rate": 1.28125e-05, "token_acc": 0.6683364091747956, "epoch": 0.10262828535669587, "step": 41}, {"loss": 1.332282304763794, "grad_norm": 2.458296775817871, "learning_rate": 1.3125e-05, "token_acc": 0.667586315623522, "epoch": 0.10513141426783479, "step": 42}, {"loss": 1.3493250608444214, "grad_norm": 2.0579333305358887, "learning_rate": 1.34375e-05, "token_acc": 0.6604139715394567, "epoch": 0.10763454317897372, "step": 43}, {"loss": 1.3249701261520386, "grad_norm": 1.6432338953018188, "learning_rate": 1.3750000000000002e-05, "token_acc": 0.6745012519182618, "epoch": 0.11013767209011265, "step": 44}, {"loss": 1.349682092666626, "grad_norm": 1.0298691987991333, "learning_rate": 1.4062500000000001e-05, "token_acc": 0.6590545786709294, "epoch": 0.11264080100125157, "step": 45}, {"loss": 1.300336480140686, "grad_norm": 1.3843709230422974, "learning_rate": 1.4374999999999999e-05, "token_acc": 0.6736927993472496, "epoch": 0.11514392991239049, "step": 46}, {"loss": 1.295595645904541, "grad_norm": 15.729647636413574, "learning_rate": 1.4687500000000001e-05, "token_acc": 0.6904139433551199, "epoch": 0.11764705882352941, "step": 47}, {"loss": 1.329056739807129, "grad_norm": 1.218788743019104, "learning_rate": 1.5e-05, "token_acc": 0.6649002289826628, "epoch": 0.12015018773466833, "step": 48}, {"loss": 1.3466482162475586, "grad_norm": 2.2413642406463623, "learning_rate": 1.5312500000000003e-05, "token_acc": 0.6608733843644121, "epoch": 0.12265331664580725, "step": 49}, {"loss": 1.1971522569656372, "grad_norm": 1.7129898071289062, "learning_rate": 1.5625e-05, "token_acc": 0.6957063780980401, "epoch": 0.1251564455569462, "step": 50}, {"loss": 1.338015079498291, "grad_norm": 12.908634185791016, "learning_rate": 1.59375e-05, "token_acc": 0.664876476906552, "epoch": 0.1276595744680851, "step": 51}, {"loss": 1.3184266090393066, "grad_norm": 2.4744150638580322, "learning_rate": 1.6250000000000002e-05, "token_acc": 0.6541958563124162, "epoch": 0.13016270337922403, "step": 52}, {"loss": 1.3414291143417358, "grad_norm": 1.5035480260849, "learning_rate": 1.65625e-05, "token_acc": 0.6604707140946777, "epoch": 0.13266583229036297, "step": 53}, {"loss": 1.2710291147232056, "grad_norm": 0.9383847117424011, "learning_rate": 1.6875000000000004e-05, "token_acc": 0.6716895400593472, "epoch": 0.13516896120150187, "step": 54}, {"loss": 1.321635365486145, "grad_norm": 0.8049397468566895, "learning_rate": 1.71875e-05, "token_acc": 0.6582027168234065, "epoch": 0.1376720901126408, "step": 55}, {"loss": 1.3294317722320557, "grad_norm": 0.9869638085365295, "learning_rate": 1.75e-05, "token_acc": 0.6607637747193387, "epoch": 0.14017521902377972, "step": 56}, {"loss": 1.2151306867599487, "grad_norm": 3.6263885498046875, "learning_rate": 1.7812500000000003e-05, "token_acc": 0.689805574037111, "epoch": 0.14267834793491865, "step": 57}, {"loss": 1.2164831161499023, "grad_norm": 2.4337313175201416, "learning_rate": 1.8125e-05, "token_acc": 0.6946524064171123, "epoch": 0.14518147684605756, "step": 58}, {"loss": 1.2001479864120483, "grad_norm": 1.2465195655822754, "learning_rate": 1.84375e-05, "token_acc": 0.6949291573452647, "epoch": 0.1476846057571965, "step": 59}, {"loss": 1.2468581199645996, "grad_norm": 1.211704969406128, "learning_rate": 1.8750000000000002e-05, "token_acc": 0.6773460003031987, "epoch": 0.15018773466833543, "step": 60}, {"loss": 1.2663486003875732, "grad_norm": 1.1252233982086182, "learning_rate": 1.90625e-05, "token_acc": 0.6731120837719541, "epoch": 0.15269086357947434, "step": 61}, {"loss": 1.2598896026611328, "grad_norm": 0.68025803565979, "learning_rate": 1.9375e-05, "token_acc": 0.6730806308564378, "epoch": 0.15519399249061328, "step": 62}, {"loss": 1.2166805267333984, "grad_norm": 3.702453374862671, "learning_rate": 1.96875e-05, "token_acc": 0.691328125, "epoch": 0.15769712140175218, "step": 63}, {"loss": 1.2387148141860962, "grad_norm": 53.140132904052734, "learning_rate": 2e-05, "token_acc": 0.6720997123681688, "epoch": 0.16020025031289112, "step": 64}, {"loss": 1.2545907497406006, "grad_norm": 2.1026854515075684, "learning_rate": 2.0312500000000002e-05, "token_acc": 0.6658680632939603, "epoch": 0.16270337922403003, "step": 65}, {"loss": 1.2474756240844727, "grad_norm": 1.5480505228042603, "learning_rate": 2.0625e-05, "token_acc": 0.6753335794525606, "epoch": 0.16520650813516896, "step": 66}, {"loss": 1.1903716325759888, "grad_norm": 8.795135498046875, "learning_rate": 2.09375e-05, "token_acc": 0.7095110155830199, "epoch": 0.1677096370463079, "step": 67}, {"loss": 1.255184531211853, "grad_norm": 1.6788009405136108, "learning_rate": 2.125e-05, "token_acc": 0.675844505309692, "epoch": 0.1702127659574468, "step": 68}, {"loss": 1.2032387256622314, "grad_norm": 2.194441080093384, "learning_rate": 2.1562500000000002e-05, "token_acc": 0.6907407407407408, "epoch": 0.17271589486858574, "step": 69}, {"loss": 1.1963188648223877, "grad_norm": 1.1291356086730957, "learning_rate": 2.1875e-05, "token_acc": 0.6802986594264382, "epoch": 0.17521902377972465, "step": 70}, {"loss": 1.2278125286102295, "grad_norm": 1.3670284748077393, "learning_rate": 2.21875e-05, "token_acc": 0.6708903388760261, "epoch": 0.17772215269086358, "step": 71}, {"loss": 1.2158769369125366, "grad_norm": 2.758354663848877, "learning_rate": 2.25e-05, "token_acc": 0.6867505551443376, "epoch": 0.1802252816020025, "step": 72}, {"loss": 1.074498176574707, "grad_norm": 2.6226625442504883, "learning_rate": 2.28125e-05, "token_acc": 0.718917166477549, "epoch": 0.18272841051314143, "step": 73}, {"loss": 1.183173656463623, "grad_norm": 5.092314720153809, "learning_rate": 2.3125000000000003e-05, "token_acc": 0.6937396580253723, "epoch": 0.18523153942428036, "step": 74}, {"loss": 1.1696088314056396, "grad_norm": 1.6192283630371094, "learning_rate": 2.34375e-05, "token_acc": 0.6922164214523019, "epoch": 0.18773466833541927, "step": 75}, {"loss": 1.02431058883667, "grad_norm": 1.9894205331802368, "learning_rate": 2.375e-05, "token_acc": 0.7350316975815919, "epoch": 0.1902377972465582, "step": 76}, {"loss": 1.1793923377990723, "grad_norm": 5.026700019836426, "learning_rate": 2.4062500000000002e-05, "token_acc": 0.6889119550616681, "epoch": 0.1927409261576971, "step": 77}, {"loss": 1.2031577825546265, "grad_norm": 0.9851458668708801, "learning_rate": 2.4375e-05, "token_acc": 0.6798439806029939, "epoch": 0.19524405506883605, "step": 78}, {"loss": 1.2100965976715088, "grad_norm": 1.4935272932052612, "learning_rate": 2.4687500000000004e-05, "token_acc": 0.6759376522162689, "epoch": 0.19774718397997496, "step": 79}, {"loss": 1.2182433605194092, "grad_norm": 2.0270609855651855, "learning_rate": 2.5e-05, "token_acc": 0.672459042468586, "epoch": 0.2002503128911139, "step": 80}, {"loss": 1.1599236726760864, "grad_norm": 2.171703577041626, "learning_rate": 2.53125e-05, "token_acc": 0.6896967941290073, "epoch": 0.20275344180225283, "step": 81}, {"loss": 1.2469699382781982, "grad_norm": 1.3919153213500977, "learning_rate": 2.5625e-05, "token_acc": 0.6607023411371238, "epoch": 0.20525657071339173, "step": 82}, {"loss": 1.0905996561050415, "grad_norm": 5.726469039916992, "learning_rate": 2.5937500000000004e-05, "token_acc": 0.705477288521069, "epoch": 0.20775969962453067, "step": 83}, {"loss": 1.1631360054016113, "grad_norm": 2.4800686836242676, "learning_rate": 2.625e-05, "token_acc": 0.6929383361834826, "epoch": 0.21026282853566958, "step": 84}, {"loss": 1.0351084470748901, "grad_norm": 1.3907530307769775, "learning_rate": 2.6562500000000002e-05, "token_acc": 0.7256065167345493, "epoch": 0.2127659574468085, "step": 85}, {"loss": 1.1698168516159058, "grad_norm": 4.023968696594238, "learning_rate": 2.6875e-05, "token_acc": 0.6915017462165308, "epoch": 0.21526908635794745, "step": 86}, {"loss": 1.0965162515640259, "grad_norm": 2.434358596801758, "learning_rate": 2.71875e-05, "token_acc": 0.7119186046511627, "epoch": 0.21777221526908636, "step": 87}, {"loss": 1.0884002447128296, "grad_norm": 1.8500336408615112, "learning_rate": 2.7500000000000004e-05, "token_acc": 0.7045622522340926, "epoch": 0.2202753441802253, "step": 88}, {"loss": 1.1824790239334106, "grad_norm": 3.2268683910369873, "learning_rate": 2.7812500000000002e-05, "token_acc": 0.6851617168990027, "epoch": 0.2227784730913642, "step": 89}, {"loss": 0.971013069152832, "grad_norm": 16.243087768554688, "learning_rate": 2.8125000000000003e-05, "token_acc": 0.7361684210526316, "epoch": 0.22528160200250313, "step": 90}, {"loss": 1.0600107908248901, "grad_norm": 2.5743207931518555, "learning_rate": 2.84375e-05, "token_acc": 0.7134351911627573, "epoch": 0.22778473091364204, "step": 91}, {"loss": 1.1500616073608398, "grad_norm": 2.0203638076782227, "learning_rate": 2.8749999999999997e-05, "token_acc": 0.6882268690919507, "epoch": 0.23028785982478098, "step": 92}, {"loss": 1.0045973062515259, "grad_norm": 1.1112314462661743, "learning_rate": 2.9062500000000005e-05, "token_acc": 0.7273007237078478, "epoch": 0.2327909887359199, "step": 93}, {"loss": 1.1666638851165771, "grad_norm": 2.5539236068725586, "learning_rate": 2.9375000000000003e-05, "token_acc": 0.6864643371757925, "epoch": 0.23529411764705882, "step": 94}, {"loss": 1.0808672904968262, "grad_norm": 2.1663148403167725, "learning_rate": 2.96875e-05, "token_acc": 0.695645939874779, "epoch": 0.23779724655819776, "step": 95}, {"loss": 0.9929013252258301, "grad_norm": 1.9498071670532227, "learning_rate": 3e-05, "token_acc": 0.738973897389739, "epoch": 0.24030037546933666, "step": 96}, {"loss": 1.1222727298736572, "grad_norm": 4.303379058837891, "learning_rate": 3.0312499999999998e-05, "token_acc": 0.688846697280113, "epoch": 0.2428035043804756, "step": 97}, {"loss": 1.1498996019363403, "grad_norm": 4.010090351104736, "learning_rate": 3.0625000000000006e-05, "token_acc": 0.6880553287546227, "epoch": 0.2453066332916145, "step": 98}, {"loss": 1.0506386756896973, "grad_norm": 1.8286547660827637, "learning_rate": 3.09375e-05, "token_acc": 0.7126414484319431, "epoch": 0.24780976220275344, "step": 99}, {"loss": 1.0510246753692627, "grad_norm": 2.414545774459839, "learning_rate": 3.125e-05, "token_acc": 0.711717754376551, "epoch": 0.2503128911138924, "step": 100}, {"loss": 1.105303168296814, "grad_norm": 35.13666534423828, "learning_rate": 3.15625e-05, "token_acc": 0.6977885525070956, "epoch": 0.2528160200250313, "step": 101}, {"loss": 1.0945279598236084, "grad_norm": 1.9485750198364258, "learning_rate": 3.1875e-05, "token_acc": 0.7003108322092546, "epoch": 0.2553191489361702, "step": 102}, {"loss": 1.068230390548706, "grad_norm": 3.3463339805603027, "learning_rate": 3.21875e-05, "token_acc": 0.7030742861310675, "epoch": 0.25782227784730916, "step": 103}, {"loss": 1.001434564590454, "grad_norm": 2.5563361644744873, "learning_rate": 3.2500000000000004e-05, "token_acc": 0.721863062004114, "epoch": 0.26032540675844806, "step": 104}, {"loss": 1.0632514953613281, "grad_norm": 1.6362377405166626, "learning_rate": 3.2812500000000005e-05, "token_acc": 0.7117752471241112, "epoch": 0.26282853566958697, "step": 105}, {"loss": 1.127671241760254, "grad_norm": 2.2173712253570557, "learning_rate": 3.3125e-05, "token_acc": 0.6865707549439446, "epoch": 0.26533166458072593, "step": 106}, {"loss": 1.0473824739456177, "grad_norm": 2.128298044204712, "learning_rate": 3.34375e-05, "token_acc": 0.7126287780582656, "epoch": 0.26783479349186484, "step": 107}, {"loss": 0.9804874658584595, "grad_norm": 1.5433886051177979, "learning_rate": 3.375000000000001e-05, "token_acc": 0.7238202367561197, "epoch": 0.27033792240300375, "step": 108}, {"loss": 1.0798405408859253, "grad_norm": 6.602525234222412, "learning_rate": 3.40625e-05, "token_acc": 0.6913783927621076, "epoch": 0.27284105131414266, "step": 109}, {"loss": 1.0854990482330322, "grad_norm": 1.55194091796875, "learning_rate": 3.4375e-05, "token_acc": 0.7073425229282223, "epoch": 0.2753441802252816, "step": 110}, {"loss": 1.0851027965545654, "grad_norm": 1.3037891387939453, "learning_rate": 3.46875e-05, "token_acc": 0.7052621625455061, "epoch": 0.27784730913642053, "step": 111}, {"loss": 0.9681501984596252, "grad_norm": 1.3887872695922852, "learning_rate": 3.5e-05, "token_acc": 0.7300288416392783, "epoch": 0.28035043804755944, "step": 112}, {"loss": 1.0306782722473145, "grad_norm": 2.441603422164917, "learning_rate": 3.5312500000000005e-05, "token_acc": 0.7176060047405847, "epoch": 0.2828535669586984, "step": 113}, {"loss": 1.015556812286377, "grad_norm": 1.4105886220932007, "learning_rate": 3.5625000000000005e-05, "token_acc": 0.7166026744339997, "epoch": 0.2853566958698373, "step": 114}, {"loss": 1.1317176818847656, "grad_norm": 3.6527352333068848, "learning_rate": 3.59375e-05, "token_acc": 0.6872061871303644, "epoch": 0.2878598247809762, "step": 115}, {"loss": 1.0447880029678345, "grad_norm": 1.8553370237350464, "learning_rate": 3.625e-05, "token_acc": 0.7100111234705228, "epoch": 0.2903629536921151, "step": 116}, {"loss": 0.8988428711891174, "grad_norm": 2.274932861328125, "learning_rate": 3.65625e-05, "token_acc": 0.7594645889521526, "epoch": 0.2928660826032541, "step": 117}, {"loss": 1.0872691869735718, "grad_norm": 1.7594488859176636, "learning_rate": 3.6875e-05, "token_acc": 0.7017732981189027, "epoch": 0.295369211514393, "step": 118}, {"loss": 1.0752581357955933, "grad_norm": 3.4330825805664062, "learning_rate": 3.71875e-05, "token_acc": 0.7016698075995967, "epoch": 0.2978723404255319, "step": 119}, {"loss": 0.9912147521972656, "grad_norm": 4.466182708740234, "learning_rate": 3.7500000000000003e-05, "token_acc": 0.7193773043834494, "epoch": 0.30037546933667086, "step": 120}, {"loss": 1.018737554550171, "grad_norm": 1.5049115419387817, "learning_rate": 3.78125e-05, "token_acc": 0.7152019002375297, "epoch": 0.30287859824780977, "step": 121}, {"loss": 0.9846063256263733, "grad_norm": 3.3945202827453613, "learning_rate": 3.8125e-05, "token_acc": 0.7239054568527918, "epoch": 0.3053817271589487, "step": 122}, {"loss": 1.0859057903289795, "grad_norm": 1.5377535820007324, "learning_rate": 3.8437500000000006e-05, "token_acc": 0.698030902197399, "epoch": 0.3078848560700876, "step": 123}, {"loss": 1.0317624807357788, "grad_norm": 2.696385622024536, "learning_rate": 3.875e-05, "token_acc": 0.711888309124242, "epoch": 0.31038798498122655, "step": 124}, {"loss": 0.9196208715438843, "grad_norm": 2.061471700668335, "learning_rate": 3.90625e-05, "token_acc": 0.7408977209560867, "epoch": 0.31289111389236546, "step": 125}, {"loss": 0.908572793006897, "grad_norm": 1.1909533739089966, "learning_rate": 3.9375e-05, "token_acc": 0.7447868298860278, "epoch": 0.31539424280350437, "step": 126}, {"loss": 0.8775178790092468, "grad_norm": 2.976712226867676, "learning_rate": 3.96875e-05, "token_acc": 0.7585321100917432, "epoch": 0.31789737171464333, "step": 127}, {"loss": 1.0048859119415283, "grad_norm": 3.037933349609375, "learning_rate": 4e-05, "token_acc": 0.7140471578384877, "epoch": 0.32040050062578224, "step": 128}, {"loss": 0.9985315799713135, "grad_norm": 5.830648422241211, "learning_rate": 4.0312500000000004e-05, "token_acc": 0.7206040268456376, "epoch": 0.32290362953692114, "step": 129}, {"loss": 0.9825519323348999, "grad_norm": 1.3143258094787598, "learning_rate": 4.0625000000000005e-05, "token_acc": 0.7247136031316562, "epoch": 0.32540675844806005, "step": 130}, {"loss": 0.8758414387702942, "grad_norm": 2.4536049365997314, "learning_rate": 4.09375e-05, "token_acc": 0.7611605215439081, "epoch": 0.327909887359199, "step": 131}, {"loss": 0.9772047400474548, "grad_norm": 3.183997631072998, "learning_rate": 4.125e-05, "token_acc": 0.722866503718342, "epoch": 0.3304130162703379, "step": 132}, {"loss": 1.0216748714447021, "grad_norm": 1.653651237487793, "learning_rate": 4.156250000000001e-05, "token_acc": 0.71066228276186, "epoch": 0.33291614518147683, "step": 133}, {"loss": 0.9526140689849854, "grad_norm": 1.1030162572860718, "learning_rate": 4.1875e-05, "token_acc": 0.7339804459449955, "epoch": 0.3354192740926158, "step": 134}, {"loss": 0.8791989088058472, "grad_norm": 4.92834997177124, "learning_rate": 4.21875e-05, "token_acc": 0.7551160285910115, "epoch": 0.3379224030037547, "step": 135}, {"loss": 1.0653268098831177, "grad_norm": 0.7831388115882874, "learning_rate": 4.25e-05, "token_acc": 0.7019186391507879, "epoch": 0.3404255319148936, "step": 136}, {"loss": 1.0078719854354858, "grad_norm": 1.9757318496704102, "learning_rate": 4.28125e-05, "token_acc": 0.7167237320778943, "epoch": 0.3429286608260325, "step": 137}, {"loss": 0.8363289833068848, "grad_norm": 4.613290786743164, "learning_rate": 4.3125000000000005e-05, "token_acc": 0.7749772244154267, "epoch": 0.3454317897371715, "step": 138}, {"loss": 0.9550644755363464, "grad_norm": 1.626499891281128, "learning_rate": 4.3437500000000006e-05, "token_acc": 0.732905151161282, "epoch": 0.3479349186483104, "step": 139}, {"loss": 0.8922043442726135, "grad_norm": 7.68024206161499, "learning_rate": 4.375e-05, "token_acc": 0.7493879367905631, "epoch": 0.3504380475594493, "step": 140}, {"loss": 0.8937676548957825, "grad_norm": 5.447193622589111, "learning_rate": 4.40625e-05, "token_acc": 0.7455310199789695, "epoch": 0.35294117647058826, "step": 141}, {"loss": 1.030370831489563, "grad_norm": 2.561711311340332, "learning_rate": 4.4375e-05, "token_acc": 0.712084974676421, "epoch": 0.35544430538172717, "step": 142}, {"loss": 0.8835145831108093, "grad_norm": 2.330228328704834, "learning_rate": 4.46875e-05, "token_acc": 0.7573455306612916, "epoch": 0.3579474342928661, "step": 143}, {"loss": 0.9554994702339172, "grad_norm": 3.3042826652526855, "learning_rate": 4.5e-05, "token_acc": 0.7331631024577082, "epoch": 0.360450563204005, "step": 144}, {"loss": 0.9345872402191162, "grad_norm": 1.903152346611023, "learning_rate": 4.5312500000000004e-05, "token_acc": 0.7318692226564923, "epoch": 0.36295369211514394, "step": 145}, {"loss": 0.9259800910949707, "grad_norm": 1.0897647142410278, "learning_rate": 4.5625e-05, "token_acc": 0.7344223913159155, "epoch": 0.36545682102628285, "step": 146}, {"loss": 0.8477439284324646, "grad_norm": 1.892134428024292, "learning_rate": 4.59375e-05, "token_acc": 0.7550676911818515, "epoch": 0.36795994993742176, "step": 147}, {"loss": 0.926980197429657, "grad_norm": 1.995365858078003, "learning_rate": 4.6250000000000006e-05, "token_acc": 0.7390321121664405, "epoch": 0.3704630788485607, "step": 148}, {"loss": 1.040574073791504, "grad_norm": 0.967679500579834, "learning_rate": 4.65625e-05, "token_acc": 0.7037716802789759, "epoch": 0.37296620775969963, "step": 149}, {"loss": 0.9701130390167236, "grad_norm": 1.3489030599594116, "learning_rate": 4.6875e-05, "token_acc": 0.722164475695506, "epoch": 0.37546933667083854, "step": 150}, {"loss": 1.0237723588943481, "grad_norm": 1.8906278610229492, "learning_rate": 4.71875e-05, "token_acc": 0.7124020961289232, "epoch": 0.37797246558197745, "step": 151}, {"loss": 0.8609241247177124, "grad_norm": 1.4073423147201538, "learning_rate": 4.75e-05, "token_acc": 0.7521867897238101, "epoch": 0.3804755944931164, "step": 152}, {"loss": 1.0169634819030762, "grad_norm": 1.7892054319381714, "learning_rate": 4.7812500000000003e-05, "token_acc": 0.7109900672861262, "epoch": 0.3829787234042553, "step": 153}, {"loss": 0.8839869499206543, "grad_norm": 5.222759246826172, "learning_rate": 4.8125000000000004e-05, "token_acc": 0.7499611740953565, "epoch": 0.3854818523153942, "step": 154}, {"loss": 0.9847191572189331, "grad_norm": 47.99449920654297, "learning_rate": 4.8437500000000005e-05, "token_acc": 0.7206756827869284, "epoch": 0.3879849812265332, "step": 155}, {"loss": 0.8897120952606201, "grad_norm": 2.1542346477508545, "learning_rate": 4.875e-05, "token_acc": 0.7461834889580554, "epoch": 0.3904881101376721, "step": 156}, {"loss": 0.9585904479026794, "grad_norm": 1.6777710914611816, "learning_rate": 4.90625e-05, "token_acc": 0.726420528934276, "epoch": 0.392991239048811, "step": 157}, {"loss": 0.8516196012496948, "grad_norm": 1.6333376169204712, "learning_rate": 4.937500000000001e-05, "token_acc": 0.7541220115416323, "epoch": 0.3954943679599499, "step": 158}, {"loss": 0.8823418021202087, "grad_norm": 1.346437692642212, "learning_rate": 4.96875e-05, "token_acc": 0.752115152181079, "epoch": 0.3979974968710889, "step": 159}, {"loss": 0.9368952512741089, "grad_norm": 3.7089667320251465, "learning_rate": 5e-05, "token_acc": 0.7302366635405748, "epoch": 0.4005006257822278, "step": 160}, {"loss": 0.8721541166305542, "grad_norm": 1.9471855163574219, "learning_rate": 4.9999698804181425e-05, "token_acc": 0.7594202898550725, "epoch": 0.4030037546933667, "step": 161}, {"loss": 0.875278115272522, "grad_norm": 2.1255381107330322, "learning_rate": 4.9998795223983205e-05, "token_acc": 0.7485261365125114, "epoch": 0.40550688360450565, "step": 162}, {"loss": 0.8458836078643799, "grad_norm": 1.0908252000808716, "learning_rate": 4.99972892811777e-05, "token_acc": 0.7550397067806964, "epoch": 0.40801001251564456, "step": 163}, {"loss": 1.0290120840072632, "grad_norm": 1.6298143863677979, "learning_rate": 4.9995181012051625e-05, "token_acc": 0.7065329357549471, "epoch": 0.41051314142678347, "step": 164}, {"loss": 0.9266539812088013, "grad_norm": 1.5110621452331543, "learning_rate": 4.9992470467405104e-05, "token_acc": 0.7334730109720461, "epoch": 0.4130162703379224, "step": 165}, {"loss": 0.9487897157669067, "grad_norm": 1.3298150300979614, "learning_rate": 4.998915771255053e-05, "token_acc": 0.7244558712708896, "epoch": 0.41551939924906134, "step": 166}, {"loss": 0.8636137247085571, "grad_norm": 1.4212807416915894, "learning_rate": 4.9985242827310936e-05, "token_acc": 0.75104248110503, "epoch": 0.41802252816020025, "step": 167}, {"loss": 0.944591224193573, "grad_norm": 1.1823561191558838, "learning_rate": 4.9980725906018074e-05, "token_acc": 0.7279493670886076, "epoch": 0.42052565707133915, "step": 168}, {"loss": 0.7865618467330933, "grad_norm": 3.800663471221924, "learning_rate": 4.9975607057510185e-05, "token_acc": 0.7755815987405982, "epoch": 0.4230287859824781, "step": 169}, {"loss": 0.8385809659957886, "grad_norm": 2.064781427383423, "learning_rate": 4.996988640512931e-05, "token_acc": 0.7639746370765893, "epoch": 0.425531914893617, "step": 170}, {"loss": 0.8421958088874817, "grad_norm": 2.5913920402526855, "learning_rate": 4.99635640867184e-05, "token_acc": 0.7620282597030943, "epoch": 0.42803504380475593, "step": 171}, {"loss": 0.8133989572525024, "grad_norm": 1.7713373899459839, "learning_rate": 4.9956640254617906e-05, "token_acc": 0.760867708600222, "epoch": 0.4305381727158949, "step": 172}, {"loss": 1.000519037246704, "grad_norm": 1.529839038848877, "learning_rate": 4.994911507566217e-05, "token_acc": 0.712219074598678, "epoch": 0.4330413016270338, "step": 173}, {"loss": 0.9671303033828735, "grad_norm": 1.5380620956420898, "learning_rate": 4.99409887311754e-05, "token_acc": 0.7277875219243297, "epoch": 0.4355444305381727, "step": 174}, {"loss": 0.8283255100250244, "grad_norm": 2.8864336013793945, "learning_rate": 4.993226141696726e-05, "token_acc": 0.7675478577939836, "epoch": 0.4380475594493116, "step": 175}, {"loss": 0.915996789932251, "grad_norm": 1.0531455278396606, "learning_rate": 4.99229333433282e-05, "token_acc": 0.7366725083385155, "epoch": 0.4405506883604506, "step": 176}, {"loss": 0.8618585467338562, "grad_norm": 1.4250882863998413, "learning_rate": 4.991300473502437e-05, "token_acc": 0.7541533421729975, "epoch": 0.4430538172715895, "step": 177}, {"loss": 1.002793788909912, "grad_norm": 5.33800745010376, "learning_rate": 4.9902475831292185e-05, "token_acc": 0.7128742904190319, "epoch": 0.4455569461827284, "step": 178}, {"loss": 0.8489822745323181, "grad_norm": 1.2855201959609985, "learning_rate": 4.9891346885832586e-05, "token_acc": 0.7639533864890914, "epoch": 0.44806007509386736, "step": 179}, {"loss": 0.9121615290641785, "grad_norm": 1.6636594533920288, "learning_rate": 4.987961816680492e-05, "token_acc": 0.7437731849496555, "epoch": 0.45056320400500627, "step": 180}, {"loss": 0.8066229224205017, "grad_norm": 1.5193665027618408, "learning_rate": 4.986728995682049e-05, "token_acc": 0.7651162790697674, "epoch": 0.4530663329161452, "step": 181}, {"loss": 0.9458524584770203, "grad_norm": 1.5862308740615845, "learning_rate": 4.9854362552935706e-05, "token_acc": 0.7302548696579126, "epoch": 0.4555694618272841, "step": 182}, {"loss": 0.9564061164855957, "grad_norm": 2.379222869873047, "learning_rate": 4.984083626664497e-05, "token_acc": 0.7301209802502326, "epoch": 0.45807259073842305, "step": 183}, {"loss": 0.942729651927948, "grad_norm": 1.0790810585021973, "learning_rate": 4.982671142387316e-05, "token_acc": 0.7303644468955375, "epoch": 0.46057571964956195, "step": 184}, {"loss": 0.8534692525863647, "grad_norm": 9.259621620178223, "learning_rate": 4.981198836496775e-05, "token_acc": 0.7507731234186112, "epoch": 0.46307884856070086, "step": 185}, {"loss": 1.0024710893630981, "grad_norm": 3.4542312622070312, "learning_rate": 4.979666744469065e-05, "token_acc": 0.7177069583254762, "epoch": 0.4655819774718398, "step": 186}, {"loss": 0.8734491467475891, "grad_norm": 8.031414985656738, "learning_rate": 4.978074903220963e-05, "token_acc": 0.7507000736919676, "epoch": 0.46808510638297873, "step": 187}, {"loss": 0.9791375398635864, "grad_norm": 1.1859290599822998, "learning_rate": 4.976423351108943e-05, "token_acc": 0.7258350951374207, "epoch": 0.47058823529411764, "step": 188}, {"loss": 0.8371925354003906, "grad_norm": 3.053464889526367, "learning_rate": 4.9747121279282525e-05, "token_acc": 0.7536518241479077, "epoch": 0.47309136420525655, "step": 189}, {"loss": 0.8489048480987549, "grad_norm": 1.5525466203689575, "learning_rate": 4.972941274911953e-05, "token_acc": 0.7543675535526885, "epoch": 0.4755944931163955, "step": 190}, {"loss": 0.8702831864356995, "grad_norm": 1.2123963832855225, "learning_rate": 4.971110834729925e-05, "token_acc": 0.7504071889918562, "epoch": 0.4780976220275344, "step": 191}, {"loss": 0.8116580843925476, "grad_norm": 4.12030553817749, "learning_rate": 4.9692208514878444e-05, "token_acc": 0.7636261170598181, "epoch": 0.4806007509386733, "step": 192}, {"loss": 0.8202139139175415, "grad_norm": 3.596958875656128, "learning_rate": 4.9672713707261146e-05, "token_acc": 0.7595227168425883, "epoch": 0.4831038798498123, "step": 193}, {"loss": 0.9322924017906189, "grad_norm": 3.500709295272827, "learning_rate": 4.965262439418772e-05, "token_acc": 0.7302081098476721, "epoch": 0.4856070087609512, "step": 194}, {"loss": 0.7780945301055908, "grad_norm": 2.0435562133789062, "learning_rate": 4.963194105972353e-05, "token_acc": 0.7680968459194598, "epoch": 0.4881101376720901, "step": 195}, {"loss": 0.8902656435966492, "grad_norm": 1.0618855953216553, "learning_rate": 4.9610664202247294e-05, "token_acc": 0.7357566856373539, "epoch": 0.490613266583229, "step": 196}, {"loss": 0.7953319549560547, "grad_norm": 1.3093773126602173, "learning_rate": 4.958879433443904e-05, "token_acc": 0.7690320619966571, "epoch": 0.493116395494368, "step": 197}, {"loss": 0.9916477203369141, "grad_norm": 4.695700645446777, "learning_rate": 4.95663319832678e-05, "token_acc": 0.7183775051303323, "epoch": 0.4956195244055069, "step": 198}, {"loss": 0.8842062950134277, "grad_norm": 1.1738910675048828, "learning_rate": 4.954327768997886e-05, "token_acc": 0.7402211505674899, "epoch": 0.4981226533166458, "step": 199}, {"loss": 0.8272268772125244, "grad_norm": 1.958127737045288, "learning_rate": 4.951963201008076e-05, "token_acc": 0.7592515245175842, "epoch": 0.5006257822277848, "step": 200}, {"loss": 0.8797040581703186, "grad_norm": 0.9756200313568115, "learning_rate": 4.949539551333191e-05, "token_acc": 0.7454005184295378, "epoch": 0.5031289111389237, "step": 201}, {"loss": 0.7635867595672607, "grad_norm": 1.441583275794983, "learning_rate": 4.947056878372681e-05, "token_acc": 0.7780200258397932, "epoch": 0.5056320400500626, "step": 202}, {"loss": 0.8886734247207642, "grad_norm": 0.9431282877922058, "learning_rate": 4.944515241948204e-05, "token_acc": 0.7458984875672905, "epoch": 0.5081351689612015, "step": 203}, {"loss": 0.9764437675476074, "grad_norm": 1.4262967109680176, "learning_rate": 4.9419147033021814e-05, "token_acc": 0.7219959266802444, "epoch": 0.5106382978723404, "step": 204}, {"loss": 0.8055057525634766, "grad_norm": 1.837144136428833, "learning_rate": 4.9392553250963215e-05, "token_acc": 0.7705683101242002, "epoch": 0.5131414267834794, "step": 205}, {"loss": 0.9508963227272034, "grad_norm": 0.9157178401947021, "learning_rate": 4.936537171410113e-05, "token_acc": 0.7266013284407079, "epoch": 0.5156445556946183, "step": 206}, {"loss": 0.8796980381011963, "grad_norm": 1.1117141246795654, "learning_rate": 4.933760307739277e-05, "token_acc": 0.7448091668820539, "epoch": 0.5181476846057572, "step": 207}, {"loss": 0.7853018045425415, "grad_norm": 1.206092119216919, "learning_rate": 4.9309248009941914e-05, "token_acc": 0.7676789587852495, "epoch": 0.5206508135168961, "step": 208}, {"loss": 0.930952250957489, "grad_norm": 3.613619804382324, "learning_rate": 4.92803071949828e-05, "token_acc": 0.7290444145356663, "epoch": 0.523153942428035, "step": 209}, {"loss": 0.9441535472869873, "grad_norm": 2.278681755065918, "learning_rate": 4.9250781329863606e-05, "token_acc": 0.7330724921204217, "epoch": 0.5256570713391739, "step": 210}, {"loss": 0.9249938130378723, "grad_norm": 1.102830410003662, "learning_rate": 4.92206711260297e-05, "token_acc": 0.7305298501351241, "epoch": 0.5281602002503129, "step": 211}, {"loss": 0.938249945640564, "grad_norm": 2.1460347175598145, "learning_rate": 4.9189977309006495e-05, "token_acc": 0.7304270462633452, "epoch": 0.5306633291614519, "step": 212}, {"loss": 0.8906076550483704, "grad_norm": 1.1301722526550293, "learning_rate": 4.915870061838193e-05, "token_acc": 0.7410463483146067, "epoch": 0.5331664580725908, "step": 213}, {"loss": 0.8547159433364868, "grad_norm": 1.019655466079712, "learning_rate": 4.912684180778869e-05, "token_acc": 0.7477573904179409, "epoch": 0.5356695869837297, "step": 214}, {"loss": 0.9786480069160461, "grad_norm": 0.8400518298149109, "learning_rate": 4.9094401644886e-05, "token_acc": 0.7191857669498317, "epoch": 0.5381727158948686, "step": 215}, {"loss": 0.930005669593811, "grad_norm": 1.3454630374908447, "learning_rate": 4.906138091134118e-05, "token_acc": 0.7302245555212423, "epoch": 0.5406758448060075, "step": 216}, {"loss": 0.7304342985153198, "grad_norm": 1.7261593341827393, "learning_rate": 4.90277804028108e-05, "token_acc": 0.7930695985079023, "epoch": 0.5431789737171464, "step": 217}, {"loss": 0.9497151374816895, "grad_norm": 0.8376732468605042, "learning_rate": 4.8993600928921434e-05, "token_acc": 0.7235062817684856, "epoch": 0.5456821026282853, "step": 218}, {"loss": 0.7451450228691101, "grad_norm": 1.5206397771835327, "learning_rate": 4.8958843313250294e-05, "token_acc": 0.7850740452065471, "epoch": 0.5481852315394243, "step": 219}, {"loss": 0.894478440284729, "grad_norm": 2.350113868713379, "learning_rate": 4.892350839330522e-05, "token_acc": 0.7408569868995634, "epoch": 0.5506883604505632, "step": 220}, {"loss": 0.8410134315490723, "grad_norm": 2.151811361312866, "learning_rate": 4.888759702050466e-05, "token_acc": 0.7524846536100556, "epoch": 0.5531914893617021, "step": 221}, {"loss": 0.8774259090423584, "grad_norm": 2.2998857498168945, "learning_rate": 4.885111006015701e-05, "token_acc": 0.7482207812747114, "epoch": 0.5556946182728411, "step": 222}, {"loss": 0.848537027835846, "grad_norm": 4.154652118682861, "learning_rate": 4.881404839143988e-05, "token_acc": 0.7471583220568335, "epoch": 0.55819774718398, "step": 223}, {"loss": 0.8067992925643921, "grad_norm": 3.917426824569702, "learning_rate": 4.877641290737884e-05, "token_acc": 0.7612280960094242, "epoch": 0.5607008760951189, "step": 224}, {"loss": 0.8888064026832581, "grad_norm": 6.496757507324219, "learning_rate": 4.873820451482592e-05, "token_acc": 0.7468172852788237, "epoch": 0.5632040050062578, "step": 225}, {"loss": 0.8939536809921265, "grad_norm": 2.212669849395752, "learning_rate": 4.8699424134437765e-05, "token_acc": 0.7427561031257129, "epoch": 0.5657071339173968, "step": 226}, {"loss": 0.8388830423355103, "grad_norm": 2.2665131092071533, "learning_rate": 4.8660072700653445e-05, "token_acc": 0.7591590470858991, "epoch": 0.5682102628285357, "step": 227}, {"loss": 0.8939744234085083, "grad_norm": 1.6633414030075073, "learning_rate": 4.862015116167196e-05, "token_acc": 0.7423191278493558, "epoch": 0.5707133917396746, "step": 228}, {"loss": 0.8337754607200623, "grad_norm": 10.390888214111328, "learning_rate": 4.857966047942933e-05, "token_acc": 0.760409214479897, "epoch": 0.5732165206508135, "step": 229}, {"loss": 0.8908044099807739, "grad_norm": 1.9441218376159668, "learning_rate": 4.853860162957552e-05, "token_acc": 0.741635046567782, "epoch": 0.5757196495619524, "step": 230}, {"loss": 0.6824640035629272, "grad_norm": 5.351205825805664, "learning_rate": 4.849697560145083e-05, "token_acc": 0.7986786566342449, "epoch": 0.5782227784730913, "step": 231}, {"loss": 0.8338614702224731, "grad_norm": 5.388350486755371, "learning_rate": 4.8454783398062106e-05, "token_acc": 0.7588204709203, "epoch": 0.5807259073842302, "step": 232}, {"loss": 0.8330967426300049, "grad_norm": 33.36974334716797, "learning_rate": 4.8412026036058566e-05, "token_acc": 0.7553732862360055, "epoch": 0.5832290362953693, "step": 233}, {"loss": 0.8081785440444946, "grad_norm": 1.2575448751449585, "learning_rate": 4.836870454570731e-05, "token_acc": 0.7618624367564611, "epoch": 0.5857321652065082, "step": 234}, {"loss": 0.8118147253990173, "grad_norm": 5.851841926574707, "learning_rate": 4.8324819970868473e-05, "token_acc": 0.7588138835747472, "epoch": 0.5882352941176471, "step": 235}, {"loss": 0.85323566198349, "grad_norm": 1.2276482582092285, "learning_rate": 4.828037336897009e-05, "token_acc": 0.7462974887314875, "epoch": 0.590738423028786, "step": 236}, {"loss": 0.9805375337600708, "grad_norm": 1.4128162860870361, "learning_rate": 4.8235365810982615e-05, "token_acc": 0.7154090994195843, "epoch": 0.5932415519399249, "step": 237}, {"loss": 0.7949981689453125, "grad_norm": 1.1258808374404907, "learning_rate": 4.8189798381393104e-05, "token_acc": 0.7637019230769231, "epoch": 0.5957446808510638, "step": 238}, {"loss": 0.8806252479553223, "grad_norm": 2.17614483833313, "learning_rate": 4.81436721781791e-05, "token_acc": 0.7484175458078846, "epoch": 0.5982478097622027, "step": 239}, {"loss": 0.8502448797225952, "grad_norm": 2.775895357131958, "learning_rate": 4.8096988312782174e-05, "token_acc": 0.7478745871013158, "epoch": 0.6007509386733417, "step": 240}, {"loss": 0.7003047466278076, "grad_norm": 3.2797460556030273, "learning_rate": 4.8049747910081117e-05, "token_acc": 0.7912219560008713, "epoch": 0.6032540675844806, "step": 241}, {"loss": 0.90602707862854, "grad_norm": 3.991440773010254, "learning_rate": 4.8001952108364876e-05, "token_acc": 0.7321293536764378, "epoch": 0.6057571964956195, "step": 242}, {"loss": 0.9273116588592529, "grad_norm": 1.5725153684616089, "learning_rate": 4.79536020593051e-05, "token_acc": 0.729396270880987, "epoch": 0.6082603254067585, "step": 243}, {"loss": 0.8434361219406128, "grad_norm": 1.5961885452270508, "learning_rate": 4.7904698927928406e-05, "token_acc": 0.7547051878602681, "epoch": 0.6107634543178974, "step": 244}, {"loss": 0.93770432472229, "grad_norm": 1.036643385887146, "learning_rate": 4.785524389258827e-05, "token_acc": 0.727697519566995, "epoch": 0.6132665832290363, "step": 245}, {"loss": 0.8905070424079895, "grad_norm": 1.0603351593017578, "learning_rate": 4.7805238144936694e-05, "token_acc": 0.7367771247962862, "epoch": 0.6157697121401752, "step": 246}, {"loss": 0.773712694644928, "grad_norm": 2.6090335845947266, "learning_rate": 4.7754682889895446e-05, "token_acc": 0.7752465741468099, "epoch": 0.6182728410513142, "step": 247}, {"loss": 0.889683723449707, "grad_norm": 2.8802406787872314, "learning_rate": 4.7703579345627035e-05, "token_acc": 0.7375587262919784, "epoch": 0.6207759699624531, "step": 248}, {"loss": 0.9071462750434875, "grad_norm": 0.9473100304603577, "learning_rate": 4.765192874350537e-05, "token_acc": 0.7377093584939732, "epoch": 0.623279098873592, "step": 249}, {"loss": 0.7493491172790527, "grad_norm": 1.420573353767395, "learning_rate": 4.759973232808609e-05, "token_acc": 0.7773999683694449, "epoch": 0.6257822277847309, "step": 250}, {"loss": 0.845209538936615, "grad_norm": 1.5327718257904053, "learning_rate": 4.7546991357076544e-05, "token_acc": 0.7534288560263581, "epoch": 0.6282853566958698, "step": 251}, {"loss": 0.8819962739944458, "grad_norm": 1.9740188121795654, "learning_rate": 4.749370710130554e-05, "token_acc": 0.7408409658617818, "epoch": 0.6307884856070087, "step": 252}, {"loss": 0.836998462677002, "grad_norm": 4.266992092132568, "learning_rate": 4.7439880844692675e-05, "token_acc": 0.753389326102771, "epoch": 0.6332916145181476, "step": 253}, {"loss": 0.7518301010131836, "grad_norm": 3.870814085006714, "learning_rate": 4.738551388421743e-05, "token_acc": 0.7717560376586164, "epoch": 0.6357947434292867, "step": 254}, {"loss": 0.7232604622840881, "grad_norm": 6.527884006500244, "learning_rate": 4.7330607529887884e-05, "token_acc": 0.786843072399853, "epoch": 0.6382978723404256, "step": 255}, {"loss": 0.8275509476661682, "grad_norm": 1.4010592699050903, "learning_rate": 4.72751631047092e-05, "token_acc": 0.756143383181784, "epoch": 0.6408010012515645, "step": 256}, {"loss": 0.799940288066864, "grad_norm": 6.857308864593506, "learning_rate": 4.721918194465169e-05, "token_acc": 0.7626774847870182, "epoch": 0.6433041301627034, "step": 257}, {"loss": 0.7834373116493225, "grad_norm": 1.6401067972183228, "learning_rate": 4.7162665398618664e-05, "token_acc": 0.7659123055162659, "epoch": 0.6458072590738423, "step": 258}, {"loss": 0.8310164213180542, "grad_norm": 1.6125162839889526, "learning_rate": 4.7105614828413906e-05, "token_acc": 0.7511212139829206, "epoch": 0.6483103879849812, "step": 259}, {"loss": 0.879160463809967, "grad_norm": 1.442099690437317, "learning_rate": 4.7048031608708876e-05, "token_acc": 0.7447237531926334, "epoch": 0.6508135168961201, "step": 260}, {"loss": 0.9174377918243408, "grad_norm": 1.0048458576202393, "learning_rate": 4.698991712700958e-05, "token_acc": 0.7316501716824884, "epoch": 0.6533166458072591, "step": 261}, {"loss": 0.7322565317153931, "grad_norm": 6.172839164733887, "learning_rate": 4.693127278362311e-05, "token_acc": 0.7848805398504468, "epoch": 0.655819774718398, "step": 262}, {"loss": 0.9046364426612854, "grad_norm": 2.718960762023926, "learning_rate": 4.687209999162396e-05, "token_acc": 0.7374393892499742, "epoch": 0.6583229036295369, "step": 263}, {"loss": 0.9695983529090881, "grad_norm": 0.7975059151649475, "learning_rate": 4.681240017681993e-05, "token_acc": 0.7193242184098232, "epoch": 0.6608260325406758, "step": 264}, {"loss": 0.8064447641372681, "grad_norm": 2.3180477619171143, "learning_rate": 4.6752174777717786e-05, "token_acc": 0.7668189605939463, "epoch": 0.6633291614518148, "step": 265}, {"loss": 0.836155354976654, "grad_norm": 2.5961692333221436, "learning_rate": 4.6691425245488607e-05, "token_acc": 0.7518848526387937, "epoch": 0.6658322903629537, "step": 266}, {"loss": 0.9511428475379944, "grad_norm": 0.7738305330276489, "learning_rate": 4.6630153043932784e-05, "token_acc": 0.7291764338177841, "epoch": 0.6683354192740926, "step": 267}, {"loss": 0.8413755297660828, "grad_norm": 1.9640631675720215, "learning_rate": 4.65683596494448e-05, "token_acc": 0.7570005091279366, "epoch": 0.6708385481852316, "step": 268}, {"loss": 0.8661715984344482, "grad_norm": 3.4764976501464844, "learning_rate": 4.650604655097761e-05, "token_acc": 0.7496790040752526, "epoch": 0.6733416770963705, "step": 269}, {"loss": 0.8345517516136169, "grad_norm": 2.8140335083007812, "learning_rate": 4.6443215250006806e-05, "token_acc": 0.7584374551199196, "epoch": 0.6758448060075094, "step": 270}, {"loss": 0.8521395921707153, "grad_norm": 2.1373839378356934, "learning_rate": 4.637986726049438e-05, "token_acc": 0.7504881307162676, "epoch": 0.6783479349186483, "step": 271}, {"loss": 0.8748230934143066, "grad_norm": 0.9885866641998291, "learning_rate": 4.6316004108852305e-05, "token_acc": 0.7425441926038391, "epoch": 0.6808510638297872, "step": 272}, {"loss": 0.8168613314628601, "grad_norm": 3.56126070022583, "learning_rate": 4.6251627333905724e-05, "token_acc": 0.7603961787018826, "epoch": 0.6833541927409261, "step": 273}, {"loss": 0.7895940542221069, "grad_norm": 25.966888427734375, "learning_rate": 4.618673848685586e-05, "token_acc": 0.7658349328214972, "epoch": 0.685857321652065, "step": 274}, {"loss": 0.8234192132949829, "grad_norm": 1.3936517238616943, "learning_rate": 4.612133913124268e-05, "token_acc": 0.758264992311635, "epoch": 0.688360450563204, "step": 275}, {"loss": 0.8250598311424255, "grad_norm": 2.4734811782836914, "learning_rate": 4.6055430842907167e-05, "token_acc": 0.7552643893308376, "epoch": 0.690863579474343, "step": 276}, {"loss": 0.9137836694717407, "grad_norm": 2.5281338691711426, "learning_rate": 4.59890152099534e-05, "token_acc": 0.7314060158619934, "epoch": 0.6933667083854819, "step": 277}, {"loss": 0.8653621077537537, "grad_norm": 1.5060079097747803, "learning_rate": 4.5922093832710236e-05, "token_acc": 0.7430385386500334, "epoch": 0.6958698372966208, "step": 278}, {"loss": 0.8411096930503845, "grad_norm": 1.0087921619415283, "learning_rate": 4.585466832369281e-05, "token_acc": 0.7529303234208813, "epoch": 0.6983729662077597, "step": 279}, {"loss": 0.7783745527267456, "grad_norm": 1.5636194944381714, "learning_rate": 4.5786740307563636e-05, "token_acc": 0.7702870220272718, "epoch": 0.7008760951188986, "step": 280}, {"loss": 0.9275861978530884, "grad_norm": 1.9277583360671997, "learning_rate": 4.5718311421093454e-05, "token_acc": 0.724974081327036, "epoch": 0.7033792240300375, "step": 281}, {"loss": 0.8562414646148682, "grad_norm": 1.4190716743469238, "learning_rate": 4.5649383313121827e-05, "token_acc": 0.7458445307056832, "epoch": 0.7058823529411765, "step": 282}, {"loss": 0.8905417323112488, "grad_norm": 1.4012247323989868, "learning_rate": 4.55799576445174e-05, "token_acc": 0.7400331750843677, "epoch": 0.7083854818523154, "step": 283}, {"loss": 0.7349405288696289, "grad_norm": 2.845858335494995, "learning_rate": 4.551003608813784e-05, "token_acc": 0.7778809689652504, "epoch": 0.7108886107634543, "step": 284}, {"loss": 0.739836573600769, "grad_norm": 2.043717622756958, "learning_rate": 4.5439620328789593e-05, "token_acc": 0.7864004044489383, "epoch": 0.7133917396745932, "step": 285}, {"loss": 0.7316737771034241, "grad_norm": 1.1184813976287842, "learning_rate": 4.536871206318723e-05, "token_acc": 0.7790425932906144, "epoch": 0.7158948685857321, "step": 286}, {"loss": 0.9168081283569336, "grad_norm": 1.7550926208496094, "learning_rate": 4.529731299991262e-05, "token_acc": 0.7349883025734338, "epoch": 0.718397997496871, "step": 287}, {"loss": 0.8405396342277527, "grad_norm": 2.2734856605529785, "learning_rate": 4.522542485937369e-05, "token_acc": 0.753734827264239, "epoch": 0.72090112640801, "step": 288}, {"loss": 0.9497283697128296, "grad_norm": 0.8263589143753052, "learning_rate": 4.5153049373763026e-05, "token_acc": 0.7289892452187454, "epoch": 0.723404255319149, "step": 289}, {"loss": 0.8274160623550415, "grad_norm": 4.233347415924072, "learning_rate": 4.508018828701612e-05, "token_acc": 0.7547876258286276, "epoch": 0.7259073842302879, "step": 290}, {"loss": 0.8769165277481079, "grad_norm": 2.796037197113037, "learning_rate": 4.500684335476936e-05, "token_acc": 0.7473155929038282, "epoch": 0.7284105131414268, "step": 291}, {"loss": 0.9158531427383423, "grad_norm": 0.9638167023658752, "learning_rate": 4.493301634431768e-05, "token_acc": 0.736260350471789, "epoch": 0.7309136420525657, "step": 292}, {"loss": 0.8095401525497437, "grad_norm": 2.0772323608398438, "learning_rate": 4.485870903457204e-05, "token_acc": 0.7583516215557181, "epoch": 0.7334167709637046, "step": 293}, {"loss": 0.8873149752616882, "grad_norm": 1.0814753770828247, "learning_rate": 4.478392321601651e-05, "token_acc": 0.7437832431695232, "epoch": 0.7359198998748435, "step": 294}, {"loss": 0.7311573028564453, "grad_norm": 4.168087005615234, "learning_rate": 4.470866069066516e-05, "token_acc": 0.78859817771462, "epoch": 0.7384230287859824, "step": 295}, {"loss": 0.8367257118225098, "grad_norm": 1.3557254076004028, "learning_rate": 4.463292327201862e-05, "token_acc": 0.752932016156504, "epoch": 0.7409261576971214, "step": 296}, {"loss": 0.8442533016204834, "grad_norm": 2.2594828605651855, "learning_rate": 4.455671278502042e-05, "token_acc": 0.7561402328241706, "epoch": 0.7434292866082604, "step": 297}, {"loss": 0.7559725642204285, "grad_norm": 1.4002978801727295, "learning_rate": 4.4480031066012916e-05, "token_acc": 0.7742537313432836, "epoch": 0.7459324155193993, "step": 298}, {"loss": 0.8327486515045166, "grad_norm": 1.6578376293182373, "learning_rate": 4.44028799626932e-05, "token_acc": 0.7559387210816846, "epoch": 0.7484355444305382, "step": 299}, {"loss": 0.8528477549552917, "grad_norm": 3.8968186378479004, "learning_rate": 4.4325261334068426e-05, "token_acc": 0.750763448437867, "epoch": 0.7509386733416771, "step": 300}, {"loss": 0.9132996797561646, "grad_norm": 1.1830475330352783, "learning_rate": 4.4247177050411114e-05, "token_acc": 0.7312029217073728, "epoch": 0.753441802252816, "step": 301}, {"loss": 0.8471458554267883, "grad_norm": 1.79401433467865, "learning_rate": 4.416862899321404e-05, "token_acc": 0.7578536464464961, "epoch": 0.7559449311639549, "step": 302}, {"loss": 0.8816431760787964, "grad_norm": 1.1060916185379028, "learning_rate": 4.408961905514491e-05, "token_acc": 0.7383714445064138, "epoch": 0.7584480600750939, "step": 303}, {"loss": 0.7977585792541504, "grad_norm": 3.274479627609253, "learning_rate": 4.401014914000078e-05, "token_acc": 0.7648344784509682, "epoch": 0.7609511889862328, "step": 304}, {"loss": 0.8551120162010193, "grad_norm": 4.249853610992432, "learning_rate": 4.393022116266212e-05, "token_acc": 0.7446675388203174, "epoch": 0.7634543178973717, "step": 305}, {"loss": 0.806232213973999, "grad_norm": 9.041977882385254, "learning_rate": 4.384983704904674e-05, "token_acc": 0.7649096031932379, "epoch": 0.7659574468085106, "step": 306}, {"loss": 0.8331530094146729, "grad_norm": 1.081554889678955, "learning_rate": 4.376899873606336e-05, "token_acc": 0.7551795135761163, "epoch": 0.7684605757196495, "step": 307}, {"loss": 0.7645971775054932, "grad_norm": 2.7485742568969727, "learning_rate": 4.3687708171564925e-05, "token_acc": 0.776908023483366, "epoch": 0.7709637046307884, "step": 308}, {"loss": 0.8550758361816406, "grad_norm": 2.283208131790161, "learning_rate": 4.360596731430168e-05, "token_acc": 0.7544976635514019, "epoch": 0.7734668335419274, "step": 309}, {"loss": 0.9192790389060974, "grad_norm": 0.8769519925117493, "learning_rate": 4.352377813387398e-05, "token_acc": 0.7294477565108253, "epoch": 0.7759699624530664, "step": 310}, {"loss": 0.6819452047348022, "grad_norm": 2.909032106399536, "learning_rate": 4.3441142610684824e-05, "token_acc": 0.7967241883591694, "epoch": 0.7784730913642053, "step": 311}, {"loss": 0.791392982006073, "grad_norm": 2.9573018550872803, "learning_rate": 4.335806273589214e-05, "token_acc": 0.7667422052043448, "epoch": 0.7809762202753442, "step": 312}, {"loss": 0.7407418489456177, "grad_norm": 2.8347651958465576, "learning_rate": 4.3274540511360793e-05, "token_acc": 0.781952, "epoch": 0.7834793491864831, "step": 313}, {"loss": 0.8645349740982056, "grad_norm": 24.759061813354492, "learning_rate": 4.319057794961437e-05, "token_acc": 0.7462040885571295, "epoch": 0.785982478097622, "step": 314}, {"loss": 0.8003748059272766, "grad_norm": 2.6164278984069824, "learning_rate": 4.310617707378668e-05, "token_acc": 0.764179104477612, "epoch": 0.7884856070087609, "step": 315}, {"loss": 0.883104681968689, "grad_norm": 1.0327874422073364, "learning_rate": 4.302133991757297e-05, "token_acc": 0.7430525185862521, "epoch": 0.7909887359198998, "step": 316}, {"loss": 0.8418888449668884, "grad_norm": 1.9250575304031372, "learning_rate": 4.2936068525181e-05, "token_acc": 0.7478256547885294, "epoch": 0.7934918648310388, "step": 317}, {"loss": 0.9749743938446045, "grad_norm": 0.9483305811882019, "learning_rate": 4.285036495128171e-05, "token_acc": 0.7198247535596933, "epoch": 0.7959949937421777, "step": 318}, {"loss": 0.8005592226982117, "grad_norm": 4.413815975189209, "learning_rate": 4.276423126095974e-05, "token_acc": 0.7621298667191911, "epoch": 0.7984981226533167, "step": 319}, {"loss": 0.941821813583374, "grad_norm": 3.177881956100464, "learning_rate": 4.267766952966369e-05, "token_acc": 0.7269460518947172, "epoch": 0.8010012515644556, "step": 320}, {"loss": 0.905495285987854, "grad_norm": 1.1445744037628174, "learning_rate": 4.259068184315608e-05, "token_acc": 0.7364675688287448, "epoch": 0.8035043804755945, "step": 321}, {"loss": 0.749504029750824, "grad_norm": 2.5400984287261963, "learning_rate": 4.250327029746309e-05, "token_acc": 0.7781667031284183, "epoch": 0.8060075093867334, "step": 322}, {"loss": 0.7389223575592041, "grad_norm": 1.716409683227539, "learning_rate": 4.24154369988241e-05, "token_acc": 0.7833673658808242, "epoch": 0.8085106382978723, "step": 323}, {"loss": 0.9132614135742188, "grad_norm": 1.4108213186264038, "learning_rate": 4.23271840636409e-05, "token_acc": 0.7287277061252287, "epoch": 0.8110137672090113, "step": 324}, {"loss": 0.7642686367034912, "grad_norm": 2.222651720046997, "learning_rate": 4.223851361842668e-05, "token_acc": 0.7748897656068694, "epoch": 0.8135168961201502, "step": 325}, {"loss": 0.6340684294700623, "grad_norm": 2.48195481300354, "learning_rate": 4.214942779975482e-05, "token_acc": 0.8057753164556962, "epoch": 0.8160200250312891, "step": 326}, {"loss": 0.9634742736816406, "grad_norm": 0.8498600721359253, "learning_rate": 4.205992875420742e-05, "token_acc": 0.7193177752156801, "epoch": 0.818523153942428, "step": 327}, {"loss": 0.8113643527030945, "grad_norm": 1.3811802864074707, "learning_rate": 4.197001863832355e-05, "token_acc": 0.7561390347586897, "epoch": 0.8210262828535669, "step": 328}, {"loss": 0.995599627494812, "grad_norm": 0.8957132697105408, "learning_rate": 4.187969961854726e-05, "token_acc": 0.71316625740286, "epoch": 0.8235294117647058, "step": 329}, {"loss": 0.7408137917518616, "grad_norm": 1.3119924068450928, "learning_rate": 4.178897387117546e-05, "token_acc": 0.7839771101573677, "epoch": 0.8260325406758448, "step": 330}, {"loss": 0.6798240542411804, "grad_norm": 2.3570327758789062, "learning_rate": 4.169784358230541e-05, "token_acc": 0.8010324216627422, "epoch": 0.8285356695869838, "step": 331}, {"loss": 0.7958476543426514, "grad_norm": 1.039640188217163, "learning_rate": 4.1606310947782044e-05, "token_acc": 0.7642944234101264, "epoch": 0.8310387984981227, "step": 332}, {"loss": 0.7409902811050415, "grad_norm": 5.126318454742432, "learning_rate": 4.151437817314513e-05, "token_acc": 0.7794841832902095, "epoch": 0.8335419274092616, "step": 333}, {"loss": 0.8940519094467163, "grad_norm": 1.3792798519134521, "learning_rate": 4.142204747357604e-05, "token_acc": 0.7399400438141358, "epoch": 0.8360450563204005, "step": 334}, {"loss": 0.8875488042831421, "grad_norm": 2.766155481338501, "learning_rate": 4.1329321073844415e-05, "token_acc": 0.7465056801284721, "epoch": 0.8385481852315394, "step": 335}, {"loss": 0.7597804069519043, "grad_norm": 1.169003963470459, "learning_rate": 4.123620120825459e-05, "token_acc": 0.7758186397984886, "epoch": 0.8410513141426783, "step": 336}, {"loss": 0.8294762372970581, "grad_norm": 1.2755037546157837, "learning_rate": 4.114269012059169e-05, "token_acc": 0.7564102564102564, "epoch": 0.8435544430538173, "step": 337}, {"loss": 0.8293130397796631, "grad_norm": 1.5991193056106567, "learning_rate": 4.104879006406758e-05, "token_acc": 0.760047203828755, "epoch": 0.8460575719649562, "step": 338}, {"loss": 0.6401220560073853, "grad_norm": 9.708932876586914, "learning_rate": 4.095450330126663e-05, "token_acc": 0.8131151428910234, "epoch": 0.8485607008760951, "step": 339}, {"loss": 0.7404853105545044, "grad_norm": 2.348402261734009, "learning_rate": 4.085983210409114e-05, "token_acc": 0.7849596539389402, "epoch": 0.851063829787234, "step": 340}, {"loss": 0.8264370560646057, "grad_norm": 0.9730225801467896, "learning_rate": 4.07647787537066e-05, "token_acc": 0.7558938089380893, "epoch": 0.853566958698373, "step": 341}, {"loss": 0.7033358812332153, "grad_norm": 3.2532331943511963, "learning_rate": 4.066934554048674e-05, "token_acc": 0.7849215157761218, "epoch": 0.8560700876095119, "step": 342}, {"loss": 0.8262134790420532, "grad_norm": 6.3877081871032715, "learning_rate": 4.0573534763958355e-05, "token_acc": 0.7543069554650083, "epoch": 0.8585732165206508, "step": 343}, {"loss": 0.8746166229248047, "grad_norm": 0.9934179782867432, "learning_rate": 4.047734873274586e-05, "token_acc": 0.7440602317298589, "epoch": 0.8610763454317898, "step": 344}, {"loss": 0.854055643081665, "grad_norm": 1.709168791770935, "learning_rate": 4.038078976451567e-05, "token_acc": 0.7495352374514112, "epoch": 0.8635794743429287, "step": 345}, {"loss": 0.7562270164489746, "grad_norm": 1.4886112213134766, "learning_rate": 4.028386018592041e-05, "token_acc": 0.7793035107587769, "epoch": 0.8660826032540676, "step": 346}, {"loss": 0.8186328411102295, "grad_norm": 1.901759147644043, "learning_rate": 4.018656233254278e-05, "token_acc": 0.7593344425956738, "epoch": 0.8685857321652065, "step": 347}, {"loss": 0.7164099216461182, "grad_norm": 1.0580676794052124, "learning_rate": 4.008889854883929e-05, "token_acc": 0.7871918390478889, "epoch": 0.8710888610763454, "step": 348}, {"loss": 0.8912985324859619, "grad_norm": 1.3126521110534668, "learning_rate": 3.999087118808381e-05, "token_acc": 0.7413303013075612, "epoch": 0.8735919899874843, "step": 349}, {"loss": 0.9175525903701782, "grad_norm": 4.351490020751953, "learning_rate": 3.9892482612310836e-05, "token_acc": 0.7297975018925057, "epoch": 0.8760951188986232, "step": 350}, {"loss": 0.9188856482505798, "grad_norm": 1.268661379814148, "learning_rate": 3.979373519225858e-05, "token_acc": 0.7321795398520953, "epoch": 0.8785982478097623, "step": 351}, {"loss": 0.885201096534729, "grad_norm": 0.9793360829353333, "learning_rate": 3.969463130731183e-05, "token_acc": 0.7393814077711726, "epoch": 0.8811013767209012, "step": 352}, {"loss": 0.885141134262085, "grad_norm": 1.042937994003296, "learning_rate": 3.959517334544466e-05, "token_acc": 0.7363861965631877, "epoch": 0.8836045056320401, "step": 353}, {"loss": 0.8621309995651245, "grad_norm": 4.194576263427734, "learning_rate": 3.949536370316285e-05, "token_acc": 0.7478715283894075, "epoch": 0.886107634543179, "step": 354}, {"loss": 0.9318335056304932, "grad_norm": 1.0623916387557983, "learning_rate": 3.939520478544614e-05, "token_acc": 0.7253218884120172, "epoch": 0.8886107634543179, "step": 355}, {"loss": 0.8923368453979492, "grad_norm": 0.7876653075218201, "learning_rate": 3.9294699005690305e-05, "token_acc": 0.7409687068568799, "epoch": 0.8911138923654568, "step": 356}, {"loss": 0.8551492094993591, "grad_norm": 3.866694927215576, "learning_rate": 3.919384878564902e-05, "token_acc": 0.7514216084484159, "epoch": 0.8936170212765957, "step": 357}, {"loss": 0.7526187896728516, "grad_norm": 1.3935068845748901, "learning_rate": 3.909265655537542e-05, "token_acc": 0.7810574580885513, "epoch": 0.8961201501877347, "step": 358}, {"loss": 0.7576834559440613, "grad_norm": 2.3392226696014404, "learning_rate": 3.899112475316366e-05, "token_acc": 0.7734380288363907, "epoch": 0.8986232790988736, "step": 359}, {"loss": 0.83681321144104, "grad_norm": 1.7921333312988281, "learning_rate": 3.888925582549006e-05, "token_acc": 0.7514089615534847, "epoch": 0.9011264080100125, "step": 360}, {"loss": 0.8470603227615356, "grad_norm": 1.2905741930007935, "learning_rate": 3.8787052226954234e-05, "token_acc": 0.7570712784871505, "epoch": 0.9036295369211514, "step": 361}, {"loss": 0.8253287076950073, "grad_norm": 1.3079355955123901, "learning_rate": 3.868451642021992e-05, "token_acc": 0.7527549467275495, "epoch": 0.9061326658322904, "step": 362}, {"loss": 0.7714506387710571, "grad_norm": 1.8668463230133057, "learning_rate": 3.8581650875955585e-05, "token_acc": 0.7745460659045057, "epoch": 0.9086357947434293, "step": 363}, {"loss": 0.6929470300674438, "grad_norm": 1.1210169792175293, "learning_rate": 3.847845807277502e-05, "token_acc": 0.7864339547798492, "epoch": 0.9111389236545682, "step": 364}, {"loss": 0.8307613730430603, "grad_norm": 1.4827960729599, "learning_rate": 3.8374940497177434e-05, "token_acc": 0.7528935515137694, "epoch": 0.9136420525657072, "step": 365}, {"loss": 0.8122671842575073, "grad_norm": 1.1803950071334839, "learning_rate": 3.827110064348773e-05, "token_acc": 0.7532679738562091, "epoch": 0.9161451814768461, "step": 366}, {"loss": 0.865354061126709, "grad_norm": 1.0265437364578247, "learning_rate": 3.816694101379631e-05, "token_acc": 0.7445534777510338, "epoch": 0.918648310387985, "step": 367}, {"loss": 0.6830093264579773, "grad_norm": 2.4629406929016113, "learning_rate": 3.8062464117898724e-05, "token_acc": 0.7940572856250557, "epoch": 0.9211514392991239, "step": 368}, {"loss": 0.925508975982666, "grad_norm": 1.6382622718811035, "learning_rate": 3.795767247323533e-05, "token_acc": 0.7297501555970481, "epoch": 0.9236545682102628, "step": 369}, {"loss": 0.7516419887542725, "grad_norm": 2.4283573627471924, "learning_rate": 3.785256860483054e-05, "token_acc": 0.7758667024993281, "epoch": 0.9261576971214017, "step": 370}, {"loss": 0.8408146500587463, "grad_norm": 2.3246383666992188, "learning_rate": 3.774715504523202e-05, "token_acc": 0.7506207875133026, "epoch": 0.9286608260325406, "step": 371}, {"loss": 0.9075899720191956, "grad_norm": 1.099416732788086, "learning_rate": 3.764143433444962e-05, "token_acc": 0.7271246458923513, "epoch": 0.9311639549436797, "step": 372}, {"loss": 0.8168604373931885, "grad_norm": 1.478629469871521, "learning_rate": 3.753540901989423e-05, "token_acc": 0.7583498307682482, "epoch": 0.9336670838548186, "step": 373}, {"loss": 0.9121578335762024, "grad_norm": 2.8805809020996094, "learning_rate": 3.742908165631636e-05, "token_acc": 0.7350334520809801, "epoch": 0.9361702127659575, "step": 374}, {"loss": 0.8579491376876831, "grad_norm": 2.7889788150787354, "learning_rate": 3.7322454805744605e-05, "token_acc": 0.7476709613478691, "epoch": 0.9386733416770964, "step": 375}, {"loss": 0.8317067623138428, "grad_norm": 2.072909116744995, "learning_rate": 3.721553103742388e-05, "token_acc": 0.7571112340896513, "epoch": 0.9411764705882353, "step": 376}, {"loss": 0.761266827583313, "grad_norm": 5.177697658538818, "learning_rate": 3.710831292775353e-05, "token_acc": 0.7681555758128229, "epoch": 0.9436795994993742, "step": 377}, {"loss": 0.7219102382659912, "grad_norm": 2.7568130493164062, "learning_rate": 3.7000803060225284e-05, "token_acc": 0.7849854227405247, "epoch": 0.9461827284105131, "step": 378}, {"loss": 0.981315016746521, "grad_norm": 0.9146714806556702, "learning_rate": 3.689300402536093e-05, "token_acc": 0.717638864704858, "epoch": 0.9486858573216521, "step": 379}, {"loss": 0.8267868757247925, "grad_norm": 1.7547582387924194, "learning_rate": 3.678491842064995e-05, "token_acc": 0.7560030491678312, "epoch": 0.951188986232791, "step": 380}, {"loss": 0.8323397636413574, "grad_norm": 1.010188341140747, "learning_rate": 3.6676548850486915e-05, "token_acc": 0.7527500819173337, "epoch": 0.9536921151439299, "step": 381}, {"loss": 0.7416062355041504, "grad_norm": 2.1391537189483643, "learning_rate": 3.6567897926108756e-05, "token_acc": 0.7789564467442863, "epoch": 0.9561952440550688, "step": 382}, {"loss": 0.7494302988052368, "grad_norm": 2.62939190864563, "learning_rate": 3.645896826553178e-05, "token_acc": 0.7737996532750433, "epoch": 0.9586983729662077, "step": 383}, {"loss": 0.6191868782043457, "grad_norm": 3.6275126934051514, "learning_rate": 3.634976249348867e-05, "token_acc": 0.8121914573942907, "epoch": 0.9612015018773467, "step": 384}, {"loss": 0.8018133044242859, "grad_norm": 2.8354475498199463, "learning_rate": 3.624028324136517e-05, "token_acc": 0.7613926797511694, "epoch": 0.9637046307884856, "step": 385}, {"loss": 0.839815616607666, "grad_norm": 1.408925175666809, "learning_rate": 3.613053314713671e-05, "token_acc": 0.7488550290646468, "epoch": 0.9662077596996246, "step": 386}, {"loss": 0.9087778925895691, "grad_norm": 2.7679271697998047, "learning_rate": 3.602051485530486e-05, "token_acc": 0.7297227794064702, "epoch": 0.9687108886107635, "step": 387}, {"loss": 0.7623568177223206, "grad_norm": 3.360543727874756, "learning_rate": 3.591023101683355e-05, "token_acc": 0.7737416741056101, "epoch": 0.9712140175219024, "step": 388}, {"loss": 0.9299885034561157, "grad_norm": 1.070449948310852, "learning_rate": 3.57996842890853e-05, "token_acc": 0.7274739583333333, "epoch": 0.9737171464330413, "step": 389}, {"loss": 0.6639401912689209, "grad_norm": 4.474368572235107, "learning_rate": 3.568887733575706e-05, "token_acc": 0.8028589716236398, "epoch": 0.9762202753441802, "step": 390}, {"loss": 0.8066656589508057, "grad_norm": 1.5885690450668335, "learning_rate": 3.55778128268161e-05, "token_acc": 0.7599889165973954, "epoch": 0.9787234042553191, "step": 391}, {"loss": 0.7741931676864624, "grad_norm": 1.550413727760315, "learning_rate": 3.54664934384357e-05, "token_acc": 0.767988750969744, "epoch": 0.981226533166458, "step": 392}, {"loss": 0.7883261442184448, "grad_norm": 1.496748685836792, "learning_rate": 3.5354921852930594e-05, "token_acc": 0.7652963974839571, "epoch": 0.983729662077597, "step": 393}, {"loss": 0.7302615642547607, "grad_norm": 1.4409575462341309, "learning_rate": 3.5243100758692386e-05, "token_acc": 0.7827070285316632, "epoch": 0.986232790988736, "step": 394}, {"loss": 0.8207824230194092, "grad_norm": 0.9429992437362671, "learning_rate": 3.513103285012475e-05, "token_acc": 0.7606800348735833, "epoch": 0.9887359198998749, "step": 395}, {"loss": 0.7316930294036865, "grad_norm": 1.858787178993225, "learning_rate": 3.5018720827578524e-05, "token_acc": 0.7801478515324195, "epoch": 0.9912390488110138, "step": 396}, {"loss": 0.7595556378364563, "grad_norm": 2.4561638832092285, "learning_rate": 3.4906167397286646e-05, "token_acc": 0.7770890355820319, "epoch": 0.9937421777221527, "step": 397}, {"loss": 0.7122775316238403, "grad_norm": 5.845393180847168, "learning_rate": 3.47933752712989e-05, "token_acc": 0.7888438880706922, "epoch": 0.9962453066332916, "step": 398}, {"loss": 0.8571289777755737, "grad_norm": 1.6096240282058716, "learning_rate": 3.468034716741664e-05, "token_acc": 0.7485540516367539, "epoch": 0.9987484355444305, "step": 399}, {"loss": 0.7422727942466736, "grad_norm": 1.6828404664993286, "learning_rate": 3.456708580912725e-05, "token_acc": 0.7744593202883625, "epoch": 1.0, "step": 400}, {"loss": 0.7470591068267822, "grad_norm": 0.9042538404464722, "learning_rate": 3.4453593925538515e-05, "token_acc": 0.775092699143332, "epoch": 1.002503128911139, "step": 401}, {"loss": 0.8494120836257935, "grad_norm": 1.5840198993682861, "learning_rate": 3.433987425131291e-05, "token_acc": 0.7467780083988994, "epoch": 1.0050062578222778, "step": 402}, {"loss": 0.7390634417533875, "grad_norm": 1.7264753580093384, "learning_rate": 3.4225929526601664e-05, "token_acc": 0.778258834542476, "epoch": 1.0075093867334168, "step": 403}, {"loss": 0.6417334079742432, "grad_norm": 3.9057250022888184, "learning_rate": 3.411176249697875e-05, "token_acc": 0.803967657013915, "epoch": 1.0100125156445556, "step": 404}, {"loss": 0.7573444843292236, "grad_norm": 13.16217041015625, "learning_rate": 3.399737591337471e-05, "token_acc": 0.7765481064483112, "epoch": 1.0125156445556946, "step": 405}, {"loss": 0.8021650314331055, "grad_norm": 2.6184492111206055, "learning_rate": 3.388277253201041e-05, "token_acc": 0.7634555116500885, "epoch": 1.0150187734668334, "step": 406}, {"loss": 0.8162388205528259, "grad_norm": 0.9962872266769409, "learning_rate": 3.3767955114330586e-05, "token_acc": 0.7603709738062414, "epoch": 1.0175219023779725, "step": 407}, {"loss": 0.8409506678581238, "grad_norm": 0.9261815547943115, "learning_rate": 3.365292642693732e-05, "token_acc": 0.748269765092195, "epoch": 1.0200250312891115, "step": 408}, {"loss": 0.6996514797210693, "grad_norm": 1.4823356866836548, "learning_rate": 3.353768924152341e-05, "token_acc": 0.7920583326012475, "epoch": 1.0225281602002503, "step": 409}, {"loss": 0.9892264008522034, "grad_norm": 0.8279326558113098, "learning_rate": 3.34222463348055e-05, "token_acc": 0.7166431939256629, "epoch": 1.0250312891113893, "step": 410}, {"loss": 0.7444078326225281, "grad_norm": 1.2230151891708374, "learning_rate": 3.330660048845727e-05, "token_acc": 0.7746187959419233, "epoch": 1.027534418022528, "step": 411}, {"loss": 0.8885623216629028, "grad_norm": 9.82090950012207, "learning_rate": 3.319075448904234e-05, "token_acc": 0.7364721589570408, "epoch": 1.0300375469336671, "step": 412}, {"loss": 0.6384131908416748, "grad_norm": 1.5039560794830322, "learning_rate": 3.307471112794715e-05, "token_acc": 0.8135575732562939, "epoch": 1.032540675844806, "step": 413}, {"loss": 0.7594075202941895, "grad_norm": 2.572512626647949, "learning_rate": 3.2958473201313744e-05, "token_acc": 0.7756237883809642, "epoch": 1.035043804755945, "step": 414}, {"loss": 0.8497216105461121, "grad_norm": 1.3949657678604126, "learning_rate": 3.284204350997229e-05, "token_acc": 0.7483397140401594, "epoch": 1.037546933667084, "step": 415}, {"loss": 0.8191887140274048, "grad_norm": 0.8779869079589844, "learning_rate": 3.272542485937369e-05, "token_acc": 0.7570150580652331, "epoch": 1.0400500625782227, "step": 416}, {"loss": 0.8783491849899292, "grad_norm": 1.1911786794662476, "learning_rate": 3.260862005952193e-05, "token_acc": 0.743301789989739, "epoch": 1.0425531914893618, "step": 417}, {"loss": 0.8371091485023499, "grad_norm": 1.146852970123291, "learning_rate": 3.2491631924906416e-05, "token_acc": 0.7499376299376299, "epoch": 1.0450563204005006, "step": 418}, {"loss": 0.6695387363433838, "grad_norm": 3.089304208755493, "learning_rate": 3.23744632744341e-05, "token_acc": 0.7941865916549461, "epoch": 1.0475594493116396, "step": 419}, {"loss": 0.6326532363891602, "grad_norm": 3.357786178588867, "learning_rate": 3.225711693136156e-05, "token_acc": 0.8059025891725512, "epoch": 1.0500625782227784, "step": 420}, {"loss": 0.8187626600265503, "grad_norm": 2.2081801891326904, "learning_rate": 3.2139595723227054e-05, "token_acc": 0.7580794906936646, "epoch": 1.0525657071339174, "step": 421}, {"loss": 0.8068948984146118, "grad_norm": 1.6402069330215454, "learning_rate": 3.202190248178231e-05, "token_acc": 0.7584321435153898, "epoch": 1.0550688360450564, "step": 422}, {"loss": 0.6910836696624756, "grad_norm": 1.57941734790802, "learning_rate": 3.190404004292427e-05, "token_acc": 0.7918921316419764, "epoch": 1.0575719649561952, "step": 423}, {"loss": 0.8506636619567871, "grad_norm": 1.2747334241867065, "learning_rate": 3.178601124662686e-05, "token_acc": 0.7479412315178738, "epoch": 1.0600750938673342, "step": 424}, {"loss": 0.7539167404174805, "grad_norm": 1.1297740936279297, "learning_rate": 3.1667818936872465e-05, "token_acc": 0.7679508587786259, "epoch": 1.062578222778473, "step": 425}, {"loss": 0.7760396599769592, "grad_norm": 2.4306747913360596, "learning_rate": 3.154946596158344e-05, "token_acc": 0.7693063119364343, "epoch": 1.065081351689612, "step": 426}, {"loss": 0.8116412162780762, "grad_norm": 5.903867721557617, "learning_rate": 3.14309551725535e-05, "token_acc": 0.7637670144406826, "epoch": 1.0675844806007508, "step": 427}, {"loss": 0.7813456058502197, "grad_norm": 1.788726568222046, "learning_rate": 3.131228942537895e-05, "token_acc": 0.7658718104495748, "epoch": 1.0700876095118899, "step": 428}, {"loss": 0.7816579937934875, "grad_norm": 1.1867510080337524, "learning_rate": 3.119347157938996e-05, "token_acc": 0.7660856605974211, "epoch": 1.0725907384230289, "step": 429}, {"loss": 0.800601601600647, "grad_norm": 4.440535068511963, "learning_rate": 3.10745044975816e-05, "token_acc": 0.7669773635153129, "epoch": 1.0750938673341677, "step": 430}, {"loss": 0.8070148825645447, "grad_norm": 1.7238138914108276, "learning_rate": 3.095539104654487e-05, "token_acc": 0.7644200626959248, "epoch": 1.0775969962453067, "step": 431}, {"loss": 0.8894907236099243, "grad_norm": 1.256711721420288, "learning_rate": 3.083613409639764e-05, "token_acc": 0.7408053749836394, "epoch": 1.0801001251564455, "step": 432}, {"loss": 0.8306131958961487, "grad_norm": 17.011455535888672, "learning_rate": 3.071673652071549e-05, "token_acc": 0.7497091777383212, "epoch": 1.0826032540675845, "step": 433}, {"loss": 0.6613236665725708, "grad_norm": 2.2736356258392334, "learning_rate": 3.0597201196462463e-05, "token_acc": 0.7976870839776776, "epoch": 1.0851063829787233, "step": 434}, {"loss": 0.8434382677078247, "grad_norm": 2.7610883712768555, "learning_rate": 3.0477531003921745e-05, "token_acc": 0.7529855761774286, "epoch": 1.0876095118898623, "step": 435}, {"loss": 0.7464153170585632, "grad_norm": 1.8570743799209595, "learning_rate": 3.035772882662627e-05, "token_acc": 0.7765296188122519, "epoch": 1.0901126408010013, "step": 436}, {"loss": 0.8278151750564575, "grad_norm": 0.9314292073249817, "learning_rate": 3.0237797551289228e-05, "token_acc": 0.7535232235013894, "epoch": 1.0926157697121401, "step": 437}, {"loss": 0.8242682218551636, "grad_norm": 1.3774133920669556, "learning_rate": 3.0117740067734495e-05, "token_acc": 0.7544135317496996, "epoch": 1.0951188986232792, "step": 438}, {"loss": 0.6596634984016418, "grad_norm": 6.930232048034668, "learning_rate": 2.9997559268827048e-05, "token_acc": 0.8021640826873385, "epoch": 1.097622027534418, "step": 439}, {"loss": 0.506635308265686, "grad_norm": 4.866252422332764, "learning_rate": 2.9877258050403212e-05, "token_acc": 0.845995670995671, "epoch": 1.100125156445557, "step": 440}, {"loss": 0.8647710680961609, "grad_norm": 1.6028552055358887, "learning_rate": 2.97568393112009e-05, "token_acc": 0.74706401151186, "epoch": 1.1026282853566958, "step": 441}, {"loss": 0.6376317739486694, "grad_norm": 1.7333229780197144, "learning_rate": 2.963630595278977e-05, "token_acc": 0.8071622670807453, "epoch": 1.1051314142678348, "step": 442}, {"loss": 0.721710205078125, "grad_norm": 2.3443095684051514, "learning_rate": 2.9515660879501316e-05, "token_acc": 0.7838688149489942, "epoch": 1.1076345431789738, "step": 443}, {"loss": 0.8552244901657104, "grad_norm": 0.9060749411582947, "learning_rate": 2.9394906998358868e-05, "token_acc": 0.7432900127136601, "epoch": 1.1101376720901126, "step": 444}, {"loss": 0.785362720489502, "grad_norm": 0.749415397644043, "learning_rate": 2.9274047219007534e-05, "token_acc": 0.7612843660237998, "epoch": 1.1126408010012516, "step": 445}, {"loss": 0.8517442941665649, "grad_norm": 0.7980436086654663, "learning_rate": 2.9153084453644135e-05, "token_acc": 0.7480493097557598, "epoch": 1.1151439299123904, "step": 446}, {"loss": 0.7649672031402588, "grad_norm": 1.1448819637298584, "learning_rate": 2.9032021616947015e-05, "token_acc": 0.766477547078706, "epoch": 1.1176470588235294, "step": 447}, {"loss": 0.7490493059158325, "grad_norm": 1.3443630933761597, "learning_rate": 2.8910861626005776e-05, "token_acc": 0.7757421770526879, "epoch": 1.1201501877346682, "step": 448}, {"loss": 0.6007850170135498, "grad_norm": 4.406916618347168, "learning_rate": 2.878960740025103e-05, "token_acc": 0.8233651384686991, "epoch": 1.1226533166458073, "step": 449}, {"loss": 0.6746580004692078, "grad_norm": 1.3313847780227661, "learning_rate": 2.8668261861384045e-05, "token_acc": 0.7969903260480115, "epoch": 1.1251564455569463, "step": 450}, {"loss": 0.6978734731674194, "grad_norm": 1.466326355934143, "learning_rate": 2.854682793330633e-05, "token_acc": 0.7890699904122723, "epoch": 1.127659574468085, "step": 451}, {"loss": 0.6915320158004761, "grad_norm": 1.363837718963623, "learning_rate": 2.8425308542049206e-05, "token_acc": 0.7912602792120864, "epoch": 1.130162703379224, "step": 452}, {"loss": 0.8228940963745117, "grad_norm": 1.3149843215942383, "learning_rate": 2.8303706615703253e-05, "token_acc": 0.753298655163664, "epoch": 1.1326658322903629, "step": 453}, {"loss": 0.9149479269981384, "grad_norm": 0.9304903745651245, "learning_rate": 2.8182025084347836e-05, "token_acc": 0.7286713286713287, "epoch": 1.135168961201502, "step": 454}, {"loss": 0.6899095773696899, "grad_norm": 1.7254271507263184, "learning_rate": 2.8060266879980408e-05, "token_acc": 0.7892930042679532, "epoch": 1.1376720901126407, "step": 455}, {"loss": 0.7458426356315613, "grad_norm": 5.276956081390381, "learning_rate": 2.7938434936445945e-05, "token_acc": 0.7750451577045991, "epoch": 1.1401752190237797, "step": 456}, {"loss": 0.7810262441635132, "grad_norm": 1.1026403903961182, "learning_rate": 2.7816532189366197e-05, "token_acc": 0.7638233460956282, "epoch": 1.1426783479349187, "step": 457}, {"loss": 0.7947831153869629, "grad_norm": 5.3592143058776855, "learning_rate": 2.7694561576068985e-05, "token_acc": 0.7666825386028161, "epoch": 1.1451814768460575, "step": 458}, {"loss": 0.8342410922050476, "grad_norm": 0.9304280281066895, "learning_rate": 2.757252603551741e-05, "token_acc": 0.7494535884740622, "epoch": 1.1476846057571966, "step": 459}, {"loss": 0.8770091533660889, "grad_norm": 1.1788454055786133, "learning_rate": 2.7450428508239024e-05, "token_acc": 0.7431479686260686, "epoch": 1.1501877346683353, "step": 460}, {"loss": 0.8232619762420654, "grad_norm": 2.513720989227295, "learning_rate": 2.7328271936254995e-05, "token_acc": 0.7538295577130528, "epoch": 1.1526908635794744, "step": 461}, {"loss": 0.8583269119262695, "grad_norm": 4.04278564453125, "learning_rate": 2.7206059263009244e-05, "token_acc": 0.7469663815396856, "epoch": 1.1551939924906134, "step": 462}, {"loss": 0.848386824131012, "grad_norm": 4.869415760040283, "learning_rate": 2.7083793433297438e-05, "token_acc": 0.7457259998452851, "epoch": 1.1576971214017522, "step": 463}, {"loss": 0.9125447273254395, "grad_norm": 0.6062310338020325, "learning_rate": 2.6961477393196126e-05, "token_acc": 0.730836499607985, "epoch": 1.1602002503128912, "step": 464}, {"loss": 0.716744601726532, "grad_norm": 1.0651655197143555, "learning_rate": 2.683911408999169e-05, "token_acc": 0.7814047029702971, "epoch": 1.16270337922403, "step": 465}, {"loss": 0.6440662741661072, "grad_norm": 2.8472161293029785, "learning_rate": 2.6716706472109342e-05, "token_acc": 0.80859707132735, "epoch": 1.165206508135169, "step": 466}, {"loss": 0.5214649438858032, "grad_norm": 3.403329372406006, "learning_rate": 2.659425748904212e-05, "token_acc": 0.8430800314288921, "epoch": 1.1677096370463078, "step": 467}, {"loss": 0.7512074708938599, "grad_norm": 5.556786060333252, "learning_rate": 2.6471770091279724e-05, "token_acc": 0.7785773595350125, "epoch": 1.1702127659574468, "step": 468}, {"loss": 0.7191562652587891, "grad_norm": 2.395378351211548, "learning_rate": 2.6349247230237552e-05, "token_acc": 0.7896934402812877, "epoch": 1.1727158948685856, "step": 469}, {"loss": 0.8339272737503052, "grad_norm": 0.9507644176483154, "learning_rate": 2.6226691858185454e-05, "token_acc": 0.7492740562731551, "epoch": 1.1752190237797246, "step": 470}, {"loss": 0.7139979600906372, "grad_norm": 4.5672526359558105, "learning_rate": 2.6104106928176687e-05, "token_acc": 0.7805757991197056, "epoch": 1.1777221526908637, "step": 471}, {"loss": 0.8693740367889404, "grad_norm": 3.54498028755188, "learning_rate": 2.598149539397672e-05, "token_acc": 0.7447919385996972, "epoch": 1.1802252816020025, "step": 472}, {"loss": 0.7921099662780762, "grad_norm": 1.9187616109848022, "learning_rate": 2.585886020999206e-05, "token_acc": 0.7626466275659824, "epoch": 1.1827284105131415, "step": 473}, {"loss": 0.8307129144668579, "grad_norm": 1.4660390615463257, "learning_rate": 2.5736204331199088e-05, "token_acc": 0.7560743513290618, "epoch": 1.1852315394242803, "step": 474}, {"loss": 0.8098856210708618, "grad_norm": 0.8690254092216492, "learning_rate": 2.561353071307281e-05, "token_acc": 0.7564140026883291, "epoch": 1.1877346683354193, "step": 475}, {"loss": 0.6704491376876831, "grad_norm": 5.853299140930176, "learning_rate": 2.5490842311515707e-05, "token_acc": 0.7966314731020613, "epoch": 1.1902377972465583, "step": 476}, {"loss": 0.7706613540649414, "grad_norm": 1.3092992305755615, "learning_rate": 2.5368142082786466e-05, "token_acc": 0.7744230161239329, "epoch": 1.1927409261576971, "step": 477}, {"loss": 0.9088181257247925, "grad_norm": 2.787741184234619, "learning_rate": 2.5245432983428747e-05, "token_acc": 0.7326246933769419, "epoch": 1.1952440550688361, "step": 478}, {"loss": 0.8565571308135986, "grad_norm": 2.232443332672119, "learning_rate": 2.5122717970199956e-05, "token_acc": 0.7444141689373297, "epoch": 1.197747183979975, "step": 479}, {"loss": 0.7313039898872375, "grad_norm": 9.54522705078125, "learning_rate": 2.5e-05, "token_acc": 0.781882145998241, "epoch": 1.200250312891114, "step": 480}, {"loss": 0.7575576901435852, "grad_norm": 20.989471435546875, "learning_rate": 2.4877282029800053e-05, "token_acc": 0.7708077584090351, "epoch": 1.2027534418022527, "step": 481}, {"loss": 0.852341890335083, "grad_norm": 1.1482243537902832, "learning_rate": 2.4754567016571263e-05, "token_acc": 0.7459840258458225, "epoch": 1.2052565707133918, "step": 482}, {"loss": 0.7475820183753967, "grad_norm": 2.051314353942871, "learning_rate": 2.4631857917213543e-05, "token_acc": 0.7779799247176914, "epoch": 1.2077596996245306, "step": 483}, {"loss": 0.8240025043487549, "grad_norm": 1.342245101928711, "learning_rate": 2.4509157688484295e-05, "token_acc": 0.7542182827851346, "epoch": 1.2102628285356696, "step": 484}, {"loss": 0.8413196802139282, "grad_norm": 1.3632580041885376, "learning_rate": 2.4386469286927196e-05, "token_acc": 0.7483724879705632, "epoch": 1.2127659574468086, "step": 485}, {"loss": 0.9569882154464722, "grad_norm": 3.429781675338745, "learning_rate": 2.426379566880092e-05, "token_acc": 0.7205176520780745, "epoch": 1.2152690863579474, "step": 486}, {"loss": 0.8428609371185303, "grad_norm": 1.1299811601638794, "learning_rate": 2.414113979000794e-05, "token_acc": 0.7533573202250038, "epoch": 1.2177722152690864, "step": 487}, {"loss": 0.7102815508842468, "grad_norm": 1.7048869132995605, "learning_rate": 2.4018504606023293e-05, "token_acc": 0.7857550670853554, "epoch": 1.2202753441802252, "step": 488}, {"loss": 0.8275526762008667, "grad_norm": 0.8680364489555359, "learning_rate": 2.389589307182332e-05, "token_acc": 0.7501430369607507, "epoch": 1.2227784730913642, "step": 489}, {"loss": 0.6902611255645752, "grad_norm": 1.3328769207000732, "learning_rate": 2.3773308141814552e-05, "token_acc": 0.789313820240232, "epoch": 1.2252816020025032, "step": 490}, {"loss": 0.8937082290649414, "grad_norm": 0.7926998734474182, "learning_rate": 2.365075276976245e-05, "token_acc": 0.7341974265051188, "epoch": 1.227784730913642, "step": 491}, {"loss": 0.6675207614898682, "grad_norm": 3.3240389823913574, "learning_rate": 2.3528229908720272e-05, "token_acc": 0.7990766225694753, "epoch": 1.230287859824781, "step": 492}, {"loss": 0.783113420009613, "grad_norm": 5.930650234222412, "learning_rate": 2.3405742510957894e-05, "token_acc": 0.7705388240114731, "epoch": 1.2327909887359199, "step": 493}, {"loss": 0.720180332660675, "grad_norm": 0.8512884974479675, "learning_rate": 2.328329352789066e-05, "token_acc": 0.7808032675289313, "epoch": 1.2352941176470589, "step": 494}, {"loss": 0.8460649251937866, "grad_norm": 0.9648559093475342, "learning_rate": 2.3160885910008318e-05, "token_acc": 0.7489092921794621, "epoch": 1.2377972465581977, "step": 495}, {"loss": 0.8336548805236816, "grad_norm": 1.8170979022979736, "learning_rate": 2.303852260680388e-05, "token_acc": 0.7534397763225664, "epoch": 1.2403003754693367, "step": 496}, {"loss": 0.6261081099510193, "grad_norm": 6.261831283569336, "learning_rate": 2.291620656670256e-05, "token_acc": 0.8074581430745814, "epoch": 1.2428035043804755, "step": 497}, {"loss": 0.7004765272140503, "grad_norm": 1.3391427993774414, "learning_rate": 2.279394073699077e-05, "token_acc": 0.7875529744153195, "epoch": 1.2453066332916145, "step": 498}, {"loss": 0.7182587385177612, "grad_norm": 1.6274718046188354, "learning_rate": 2.267172806374501e-05, "token_acc": 0.7839771101573677, "epoch": 1.2478097622027535, "step": 499}, {"loss": 0.5547084808349609, "grad_norm": 4.34530782699585, "learning_rate": 2.2549571491760986e-05, "token_acc": 0.8279490944689183, "epoch": 1.2503128911138923, "step": 500}, {"loss": 0.6171272993087769, "grad_norm": 6.319797515869141, "learning_rate": 2.2427473964482598e-05, "token_acc": 0.8103328365623448, "epoch": 1.2528160200250313, "step": 501}, {"loss": 0.8684753179550171, "grad_norm": 1.2070508003234863, "learning_rate": 2.2305438423931017e-05, "token_acc": 0.7461618586114759, "epoch": 1.2553191489361701, "step": 502}, {"loss": 0.929027795791626, "grad_norm": 0.6517104506492615, "learning_rate": 2.2183467810633812e-05, "token_acc": 0.7245761408043324, "epoch": 1.2578222778473092, "step": 503}, {"loss": 0.6728816032409668, "grad_norm": 7.505336761474609, "learning_rate": 2.2061565063554064e-05, "token_acc": 0.7991531132711, "epoch": 1.2603254067584482, "step": 504}, {"loss": 0.7386347055435181, "grad_norm": 28.833297729492188, "learning_rate": 2.1939733120019598e-05, "token_acc": 0.7764926774314682, "epoch": 1.262828535669587, "step": 505}, {"loss": 0.6468443274497986, "grad_norm": 2.210476875305176, "learning_rate": 2.1817974915652173e-05, "token_acc": 0.8010013577732519, "epoch": 1.265331664580726, "step": 506}, {"loss": 0.6901583671569824, "grad_norm": 3.5139503479003906, "learning_rate": 2.1696293384296746e-05, "token_acc": 0.7926749509483323, "epoch": 1.2678347934918648, "step": 507}, {"loss": 0.8085765838623047, "grad_norm": 1.6830179691314697, "learning_rate": 2.1574691457950803e-05, "token_acc": 0.7562606529434902, "epoch": 1.2703379224030038, "step": 508}, {"loss": 0.7800910472869873, "grad_norm": 0.7797915935516357, "learning_rate": 2.1453172066693673e-05, "token_acc": 0.7595796361473256, "epoch": 1.2728410513141426, "step": 509}, {"loss": 0.8174337148666382, "grad_norm": 1.7019588947296143, "learning_rate": 2.1331738138615958e-05, "token_acc": 0.7578614234731668, "epoch": 1.2753441802252816, "step": 510}, {"loss": 0.7452907562255859, "grad_norm": 2.03682541847229, "learning_rate": 2.1210392599748974e-05, "token_acc": 0.7781870595771941, "epoch": 1.2778473091364204, "step": 511}, {"loss": 0.8239941596984863, "grad_norm": 0.9780297875404358, "learning_rate": 2.1089138373994223e-05, "token_acc": 0.7526496005217674, "epoch": 1.2803504380475594, "step": 512}, {"loss": 0.796176552772522, "grad_norm": 0.8718163371086121, "learning_rate": 2.0967978383052994e-05, "token_acc": 0.7592091654069536, "epoch": 1.2828535669586985, "step": 513}, {"loss": 0.7568551301956177, "grad_norm": 2.4679477214813232, "learning_rate": 2.0846915546355868e-05, "token_acc": 0.7764072381190908, "epoch": 1.2853566958698373, "step": 514}, {"loss": 0.8425300121307373, "grad_norm": 0.9792693853378296, "learning_rate": 2.0725952780992468e-05, "token_acc": 0.7470879270715649, "epoch": 1.2878598247809763, "step": 515}, {"loss": 0.7938356399536133, "grad_norm": 1.598029375076294, "learning_rate": 2.0605093001641138e-05, "token_acc": 0.7659052404042764, "epoch": 1.290362953692115, "step": 516}, {"loss": 0.8783785104751587, "grad_norm": 0.6741415858268738, "learning_rate": 2.048433912049868e-05, "token_acc": 0.7394762056850847, "epoch": 1.292866082603254, "step": 517}, {"loss": 0.7845078110694885, "grad_norm": 1.6082953214645386, "learning_rate": 2.036369404721023e-05, "token_acc": 0.7642520708137079, "epoch": 1.295369211514393, "step": 518}, {"loss": 0.8358283042907715, "grad_norm": 11.830879211425781, "learning_rate": 2.0243160688799105e-05, "token_acc": 0.7517000098551296, "epoch": 1.297872340425532, "step": 519}, {"loss": 0.8649904131889343, "grad_norm": 2.87798810005188, "learning_rate": 2.0122741949596797e-05, "token_acc": 0.744602534154456, "epoch": 1.300375469336671, "step": 520}, {"loss": 0.8346877098083496, "grad_norm": 0.8139316439628601, "learning_rate": 2.0002440731172958e-05, "token_acc": 0.7504469606674613, "epoch": 1.3028785982478097, "step": 521}, {"loss": 0.7899202108383179, "grad_norm": 2.8759028911590576, "learning_rate": 1.988225993226551e-05, "token_acc": 0.7665122907018169, "epoch": 1.3053817271589487, "step": 522}, {"loss": 0.7810243368148804, "grad_norm": 3.1788880825042725, "learning_rate": 1.976220244871079e-05, "token_acc": 0.7666379186430933, "epoch": 1.3078848560700875, "step": 523}, {"loss": 0.8263541460037231, "grad_norm": 0.7860379815101624, "learning_rate": 1.9642271173373737e-05, "token_acc": 0.7530105677070533, "epoch": 1.3103879849812266, "step": 524}, {"loss": 0.7155407667160034, "grad_norm": 1.430240511894226, "learning_rate": 1.9522468996078258e-05, "token_acc": 0.7868094218415418, "epoch": 1.3128911138923653, "step": 525}, {"loss": 0.8235485553741455, "grad_norm": 1.3369076251983643, "learning_rate": 1.940279880353754e-05, "token_acc": 0.7551513200257566, "epoch": 1.3153942428035044, "step": 526}, {"loss": 0.8188608288764954, "grad_norm": 1.0790313482284546, "learning_rate": 1.9283263479284514e-05, "token_acc": 0.7536337209302325, "epoch": 1.3178973717146434, "step": 527}, {"loss": 0.8424797058105469, "grad_norm": 1.1045833826065063, "learning_rate": 1.9163865903602374e-05, "token_acc": 0.7525659245223433, "epoch": 1.3204005006257822, "step": 528}, {"loss": 0.8533246517181396, "grad_norm": 2.495410919189453, "learning_rate": 1.9044608953455138e-05, "token_acc": 0.7410009624639076, "epoch": 1.3229036295369212, "step": 529}, {"loss": 0.8401960134506226, "grad_norm": 2.277566432952881, "learning_rate": 1.8925495502418406e-05, "token_acc": 0.7548590617685967, "epoch": 1.32540675844806, "step": 530}, {"loss": 0.6369855403900146, "grad_norm": 1.675037145614624, "learning_rate": 1.880652842061004e-05, "token_acc": 0.8045444517979263, "epoch": 1.327909887359199, "step": 531}, {"loss": 0.9534618854522705, "grad_norm": 0.8442081212997437, "learning_rate": 1.868771057462105e-05, "token_acc": 0.7226131426154497, "epoch": 1.330413016270338, "step": 532}, {"loss": 0.7794415354728699, "grad_norm": 0.8929516077041626, "learning_rate": 1.8569044827446515e-05, "token_acc": 0.7713848312814952, "epoch": 1.3329161451814768, "step": 533}, {"loss": 0.8722778558731079, "grad_norm": 1.1687227487564087, "learning_rate": 1.8450534038416568e-05, "token_acc": 0.741757647821857, "epoch": 1.3354192740926158, "step": 534}, {"loss": 0.7561089396476746, "grad_norm": 1.490539789199829, "learning_rate": 1.8332181063127545e-05, "token_acc": 0.7730009802548663, "epoch": 1.3379224030037546, "step": 535}, {"loss": 0.8310334086418152, "grad_norm": 1.109947919845581, "learning_rate": 1.8213988753373146e-05, "token_acc": 0.748946763692072, "epoch": 1.3404255319148937, "step": 536}, {"loss": 0.8079832196235657, "grad_norm": 1.1950045824050903, "learning_rate": 1.809595995707573e-05, "token_acc": 0.7568485763589301, "epoch": 1.3429286608260325, "step": 537}, {"loss": 0.7125290632247925, "grad_norm": 1.7237908840179443, "learning_rate": 1.7978097518217703e-05, "token_acc": 0.7834860972040361, "epoch": 1.3454317897371715, "step": 538}, {"loss": 0.6453254222869873, "grad_norm": 3.228860855102539, "learning_rate": 1.7860404276772945e-05, "token_acc": 0.8018173950670705, "epoch": 1.3479349186483103, "step": 539}, {"loss": 0.8240500688552856, "grad_norm": 0.8453672528266907, "learning_rate": 1.7742883068638447e-05, "token_acc": 0.7492266123663703, "epoch": 1.3504380475594493, "step": 540}, {"loss": 0.809388279914856, "grad_norm": 1.102385401725769, "learning_rate": 1.762553672556591e-05, "token_acc": 0.7596028368794326, "epoch": 1.3529411764705883, "step": 541}, {"loss": 0.7180289030075073, "grad_norm": 1.3018745183944702, "learning_rate": 1.7508368075093583e-05, "token_acc": 0.7798978365384616, "epoch": 1.355444305381727, "step": 542}, {"loss": 0.646782398223877, "grad_norm": 3.1542391777038574, "learning_rate": 1.7391379940478076e-05, "token_acc": 0.8056676178293811, "epoch": 1.3579474342928661, "step": 543}, {"loss": 0.7879891991615295, "grad_norm": 0.9923869967460632, "learning_rate": 1.7274575140626318e-05, "token_acc": 0.7618517074257701, "epoch": 1.360450563204005, "step": 544}, {"loss": 0.7576411962509155, "grad_norm": 1.2172160148620605, "learning_rate": 1.7157956490027717e-05, "token_acc": 0.7704047777040478, "epoch": 1.362953692115144, "step": 545}, {"loss": 0.6707481145858765, "grad_norm": 1.6602948904037476, "learning_rate": 1.704152679868626e-05, "token_acc": 0.7971698113207547, "epoch": 1.365456821026283, "step": 546}, {"loss": 0.8081753849983215, "grad_norm": 1.4677680730819702, "learning_rate": 1.6925288872052843e-05, "token_acc": 0.755311542390194, "epoch": 1.3679599499374218, "step": 547}, {"loss": 0.8146413564682007, "grad_norm": 2.0665853023529053, "learning_rate": 1.6809245510957665e-05, "token_acc": 0.7519490397413957, "epoch": 1.3704630788485608, "step": 548}, {"loss": 0.7256150245666504, "grad_norm": 7.000178337097168, "learning_rate": 1.6693399511542735e-05, "token_acc": 0.7825356229448301, "epoch": 1.3729662077596996, "step": 549}, {"loss": 0.726395845413208, "grad_norm": 2.5341522693634033, "learning_rate": 1.65777536651945e-05, "token_acc": 0.7819339150336146, "epoch": 1.3754693366708386, "step": 550}, {"loss": 0.8065874576568604, "grad_norm": 1.4585434198379517, "learning_rate": 1.6462310758476595e-05, "token_acc": 0.7564932940791625, "epoch": 1.3779724655819774, "step": 551}, {"loss": 0.8275594711303711, "grad_norm": 1.8352439403533936, "learning_rate": 1.6347073573062672e-05, "token_acc": 0.7518390951226772, "epoch": 1.3804755944931164, "step": 552}, {"loss": 0.7503329515457153, "grad_norm": 1.9580649137496948, "learning_rate": 1.6232044885669427e-05, "token_acc": 0.7738378819846186, "epoch": 1.3829787234042552, "step": 553}, {"loss": 0.7021602392196655, "grad_norm": 7.628960609436035, "learning_rate": 1.6117227467989602e-05, "token_acc": 0.7898421209413167, "epoch": 1.3854818523153942, "step": 554}, {"loss": 0.872342050075531, "grad_norm": 1.2870745658874512, "learning_rate": 1.6002624086625294e-05, "token_acc": 0.7418959244573438, "epoch": 1.3879849812265332, "step": 555}, {"loss": 0.7012907266616821, "grad_norm": 1.5503294467926025, "learning_rate": 1.588823750302126e-05, "token_acc": 0.7840224809313528, "epoch": 1.390488110137672, "step": 556}, {"loss": 0.7987989783287048, "grad_norm": 1.410538673400879, "learning_rate": 1.577407047339834e-05, "token_acc": 0.7634807225667296, "epoch": 1.392991239048811, "step": 557}, {"loss": 0.6806648969650269, "grad_norm": 0.9178221821784973, "learning_rate": 1.5660125748687094e-05, "token_acc": 0.7902989575256311, "epoch": 1.3954943679599499, "step": 558}, {"loss": 0.8719301819801331, "grad_norm": 0.756145179271698, "learning_rate": 1.5546406074461488e-05, "token_acc": 0.7413455258001306, "epoch": 1.3979974968710889, "step": 559}, {"loss": 0.8100090026855469, "grad_norm": 1.1691936254501343, "learning_rate": 1.5432914190872757e-05, "token_acc": 0.7591771792249119, "epoch": 1.400500625782228, "step": 560}, {"loss": 0.7490640878677368, "grad_norm": 35.45746994018555, "learning_rate": 1.5319652832583362e-05, "token_acc": 0.7792402034101107, "epoch": 1.4030037546933667, "step": 561}, {"loss": 0.778845489025116, "grad_norm": 0.8100907206535339, "learning_rate": 1.5206624728701103e-05, "token_acc": 0.7706413851426537, "epoch": 1.4055068836045057, "step": 562}, {"loss": 0.8065593242645264, "grad_norm": 1.7158607244491577, "learning_rate": 1.5093832602713365e-05, "token_acc": 0.7590346686267304, "epoch": 1.4080100125156445, "step": 563}, {"loss": 0.9521163702011108, "grad_norm": 1.1593443155288696, "learning_rate": 1.498127917242148e-05, "token_acc": 0.7233781660727286, "epoch": 1.4105131414267835, "step": 564}, {"loss": 0.7740306258201599, "grad_norm": 1.9125734567642212, "learning_rate": 1.4868967149875257e-05, "token_acc": 0.7697730265706096, "epoch": 1.4130162703379223, "step": 565}, {"loss": 0.8384573459625244, "grad_norm": 0.8952035903930664, "learning_rate": 1.4756899241307615e-05, "token_acc": 0.7489069083392956, "epoch": 1.4155193992490613, "step": 566}, {"loss": 0.7088779211044312, "grad_norm": 1.7073853015899658, "learning_rate": 1.4645078147069402e-05, "token_acc": 0.7877416700946113, "epoch": 1.4180225281602001, "step": 567}, {"loss": 0.744478702545166, "grad_norm": 2.4692201614379883, "learning_rate": 1.4533506561564306e-05, "token_acc": 0.7732206100765452, "epoch": 1.4205256570713392, "step": 568}, {"loss": 0.7565535306930542, "grad_norm": 1.4949043989181519, "learning_rate": 1.4422187173183899e-05, "token_acc": 0.7761570184817473, "epoch": 1.4230287859824782, "step": 569}, {"loss": 0.7933104634284973, "grad_norm": 3.145484209060669, "learning_rate": 1.4311122664242954e-05, "token_acc": 0.761278654870717, "epoch": 1.425531914893617, "step": 570}, {"loss": 0.7600586414337158, "grad_norm": 1.172170877456665, "learning_rate": 1.4200315710914705e-05, "token_acc": 0.7707200207200208, "epoch": 1.428035043804756, "step": 571}, {"loss": 0.7291625738143921, "grad_norm": 1.8115105628967285, "learning_rate": 1.4089768983166444e-05, "token_acc": 0.7803458951638732, "epoch": 1.4305381727158948, "step": 572}, {"loss": 0.6606731414794922, "grad_norm": 1.2004317045211792, "learning_rate": 1.3979485144695158e-05, "token_acc": 0.7994050797040653, "epoch": 1.4330413016270338, "step": 573}, {"loss": 0.7951904535293579, "grad_norm": 1.2376269102096558, "learning_rate": 1.38694668528633e-05, "token_acc": 0.7661833626244874, "epoch": 1.4355444305381728, "step": 574}, {"loss": 0.8511407971382141, "grad_norm": 2.052445411682129, "learning_rate": 1.3759716758634832e-05, "token_acc": 0.7467882836587872, "epoch": 1.4380475594493116, "step": 575}, {"loss": 0.7993616461753845, "grad_norm": 0.9733930230140686, "learning_rate": 1.3650237506511331e-05, "token_acc": 0.7636341403766203, "epoch": 1.4405506883604506, "step": 576}, {"loss": 0.8141838908195496, "grad_norm": 5.800482749938965, "learning_rate": 1.3541031734468212e-05, "token_acc": 0.7566569997363565, "epoch": 1.4430538172715894, "step": 577}, {"loss": 0.6543649435043335, "grad_norm": 2.696800470352173, "learning_rate": 1.3432102073891251e-05, "token_acc": 0.8048088161629654, "epoch": 1.4455569461827285, "step": 578}, {"loss": 0.647895872592926, "grad_norm": 4.301677703857422, "learning_rate": 1.3323451149513092e-05, "token_acc": 0.8066424494032174, "epoch": 1.4480600750938675, "step": 579}, {"loss": 0.7648165822029114, "grad_norm": 1.5148913860321045, "learning_rate": 1.3215081579350058e-05, "token_acc": 0.7755042385267465, "epoch": 1.4505632040050063, "step": 580}, {"loss": 0.7404133081436157, "grad_norm": 2.949655055999756, "learning_rate": 1.3106995974639084e-05, "token_acc": 0.7728736170461863, "epoch": 1.453066332916145, "step": 581}, {"loss": 0.917509138584137, "grad_norm": 0.9238078594207764, "learning_rate": 1.2999196939774722e-05, "token_acc": 0.7355649875870905, "epoch": 1.455569461827284, "step": 582}, {"loss": 0.6469459533691406, "grad_norm": 83.38187408447266, "learning_rate": 1.2891687072246472e-05, "token_acc": 0.804023989166183, "epoch": 1.458072590738423, "step": 583}, {"loss": 0.8533624410629272, "grad_norm": 4.518279075622559, "learning_rate": 1.2784468962576136e-05, "token_acc": 0.7441301661403268, "epoch": 1.460575719649562, "step": 584}, {"loss": 0.7255446314811707, "grad_norm": 1.7925207614898682, "learning_rate": 1.2677545194255402e-05, "token_acc": 0.7831757417671992, "epoch": 1.463078848560701, "step": 585}, {"loss": 0.7307141423225403, "grad_norm": 6.655250072479248, "learning_rate": 1.2570918343683635e-05, "token_acc": 0.7741544170115598, "epoch": 1.4655819774718397, "step": 586}, {"loss": 0.8177270889282227, "grad_norm": 0.8873371481895447, "learning_rate": 1.2464590980105776e-05, "token_acc": 0.7530202699287267, "epoch": 1.4680851063829787, "step": 587}, {"loss": 0.6675281524658203, "grad_norm": 1.2454488277435303, "learning_rate": 1.235856566555039e-05, "token_acc": 0.7933152664859981, "epoch": 1.4705882352941178, "step": 588}, {"loss": 0.7248143553733826, "grad_norm": 1.0082811117172241, "learning_rate": 1.2252844954767984e-05, "token_acc": 0.7810338039259801, "epoch": 1.4730913642052565, "step": 589}, {"loss": 0.666105329990387, "grad_norm": 3.0372278690338135, "learning_rate": 1.2147431395169459e-05, "token_acc": 0.7997976825455214, "epoch": 1.4755944931163956, "step": 590}, {"loss": 0.742726743221283, "grad_norm": 1.4600460529327393, "learning_rate": 1.2042327526764669e-05, "token_acc": 0.7767523073085557, "epoch": 1.4780976220275344, "step": 591}, {"loss": 0.639944851398468, "grad_norm": 1.42963445186615, "learning_rate": 1.1937535882101281e-05, "token_acc": 0.8049067713444553, "epoch": 1.4806007509386734, "step": 592}, {"loss": 0.7738537788391113, "grad_norm": 1.4108234643936157, "learning_rate": 1.1833058986203705e-05, "token_acc": 0.7662790011216719, "epoch": 1.4831038798498124, "step": 593}, {"loss": 0.8032472133636475, "grad_norm": 2.011065721511841, "learning_rate": 1.1728899356512265e-05, "token_acc": 0.7643509458577952, "epoch": 1.4856070087609512, "step": 594}, {"loss": 0.7139896154403687, "grad_norm": 1.9228585958480835, "learning_rate": 1.1625059502822574e-05, "token_acc": 0.7792246580252076, "epoch": 1.48811013767209, "step": 595}, {"loss": 0.6642230749130249, "grad_norm": 3.42121958732605, "learning_rate": 1.1521541927224994e-05, "token_acc": 0.7990822386179594, "epoch": 1.490613266583229, "step": 596}, {"loss": 0.8180509209632874, "grad_norm": 1.0371363162994385, "learning_rate": 1.1418349124044405e-05, "token_acc": 0.7535639466557662, "epoch": 1.493116395494368, "step": 597}, {"loss": 0.8822356462478638, "grad_norm": 1.0604794025421143, "learning_rate": 1.1315483579780095e-05, "token_acc": 0.7422369483029608, "epoch": 1.4956195244055068, "step": 598}, {"loss": 0.70334792137146, "grad_norm": 1.3429787158966064, "learning_rate": 1.1212947773045767e-05, "token_acc": 0.7864246823956443, "epoch": 1.4981226533166458, "step": 599}, {"loss": 0.7598515152931213, "grad_norm": 1.2942774295806885, "learning_rate": 1.1110744174509952e-05, "token_acc": 0.7675241320058624, "epoch": 1.5006257822277846, "step": 600}, {"loss": 0.7451797723770142, "grad_norm": 1.6313791275024414, "learning_rate": 1.100887524683635e-05, "token_acc": 0.7745493358633776, "epoch": 1.5031289111389237, "step": 601}, {"loss": 0.890819787979126, "grad_norm": 1.9830615520477295, "learning_rate": 1.090734344462458e-05, "token_acc": 0.7403223646024021, "epoch": 1.5056320400500627, "step": 602}, {"loss": 0.766528844833374, "grad_norm": 0.9711636900901794, "learning_rate": 1.0806151214350995e-05, "token_acc": 0.7713293650793651, "epoch": 1.5081351689612015, "step": 603}, {"loss": 0.7500281929969788, "grad_norm": 2.051830530166626, "learning_rate": 1.0705300994309697e-05, "token_acc": 0.7705687242132514, "epoch": 1.5106382978723403, "step": 604}, {"loss": 0.696961522102356, "grad_norm": 4.245327472686768, "learning_rate": 1.0604795214553868e-05, "token_acc": 0.7896506917373691, "epoch": 1.5131414267834793, "step": 605}, {"loss": 0.891823410987854, "grad_norm": 2.7437992095947266, "learning_rate": 1.0504636296837161e-05, "token_acc": 0.7399556762939663, "epoch": 1.5156445556946183, "step": 606}, {"loss": 0.834951639175415, "grad_norm": 1.5363843441009521, "learning_rate": 1.0404826654555342e-05, "token_acc": 0.7486957896400906, "epoch": 1.5181476846057573, "step": 607}, {"loss": 0.7804543375968933, "grad_norm": 1.307376742362976, "learning_rate": 1.0305368692688174e-05, "token_acc": 0.7650488867946754, "epoch": 1.5206508135168961, "step": 608}, {"loss": 0.7981626987457275, "grad_norm": 1.2029725313186646, "learning_rate": 1.0206264807741434e-05, "token_acc": 0.7576776926431197, "epoch": 1.523153942428035, "step": 609}, {"loss": 0.618813693523407, "grad_norm": 2.243136405944824, "learning_rate": 1.0107517387689166e-05, "token_acc": 0.815751960085531, "epoch": 1.525657071339174, "step": 610}, {"loss": 0.6312989592552185, "grad_norm": 1.10971200466156, "learning_rate": 1.0009128811916197e-05, "token_acc": 0.7997975894746527, "epoch": 1.528160200250313, "step": 611}, {"loss": 0.7642860412597656, "grad_norm": 0.9803842902183533, "learning_rate": 9.911101451160715e-06, "token_acc": 0.7725077929221931, "epoch": 1.530663329161452, "step": 612}, {"loss": 0.6522811651229858, "grad_norm": 31.448169708251953, "learning_rate": 9.813437667457229e-06, "token_acc": 0.8037220388705537, "epoch": 1.5331664580725908, "step": 613}, {"loss": 0.8382527232170105, "grad_norm": 0.9943018555641174, "learning_rate": 9.716139814079595e-06, "token_acc": 0.751096142848065, "epoch": 1.5356695869837296, "step": 614}, {"loss": 0.742218017578125, "grad_norm": 0.9227951765060425, "learning_rate": 9.619210235484333e-06, "token_acc": 0.7749133312322724, "epoch": 1.5381727158948686, "step": 615}, {"loss": 0.7250561714172363, "grad_norm": 2.2479007244110107, "learning_rate": 9.522651267254149e-06, "token_acc": 0.7738378549896875, "epoch": 1.5406758448060076, "step": 616}, {"loss": 0.6989889144897461, "grad_norm": 1.514958143234253, "learning_rate": 9.426465236041651e-06, "token_acc": 0.7902208201892744, "epoch": 1.5431789737171464, "step": 617}, {"loss": 0.7964303493499756, "grad_norm": 4.668854236602783, "learning_rate": 9.330654459513266e-06, "token_acc": 0.7607207916892325, "epoch": 1.5456821026282852, "step": 618}, {"loss": 0.8113234043121338, "grad_norm": 1.226259708404541, "learning_rate": 9.235221246293405e-06, "token_acc": 0.7567243367935409, "epoch": 1.5481852315394242, "step": 619}, {"loss": 0.7754377126693726, "grad_norm": 1.911278486251831, "learning_rate": 9.140167895908867e-06, "token_acc": 0.7682521732984663, "epoch": 1.5506883604505632, "step": 620}, {"loss": 0.810962975025177, "grad_norm": 1.0659726858139038, "learning_rate": 9.04549669873337e-06, "token_acc": 0.7570060922541341, "epoch": 1.5531914893617023, "step": 621}, {"loss": 0.6094653606414795, "grad_norm": 1.9304813146591187, "learning_rate": 8.951209935932426e-06, "token_acc": 0.8164489183979439, "epoch": 1.555694618272841, "step": 622}, {"loss": 0.66182541847229, "grad_norm": 1.2579195499420166, "learning_rate": 8.857309879408324e-06, "token_acc": 0.8028033383265568, "epoch": 1.5581977471839799, "step": 623}, {"loss": 0.8147578239440918, "grad_norm": 1.7250380516052246, "learning_rate": 8.763798791745411e-06, "token_acc": 0.7585159470600998, "epoch": 1.5607008760951189, "step": 624}, {"loss": 0.8331553339958191, "grad_norm": 1.7458322048187256, "learning_rate": 8.670678926155587e-06, "token_acc": 0.7498431694252763, "epoch": 1.563204005006258, "step": 625}, {"loss": 0.8016361594200134, "grad_norm": 1.2221341133117676, "learning_rate": 8.577952526423969e-06, "token_acc": 0.7612431882148631, "epoch": 1.565707133917397, "step": 626}, {"loss": 0.7019971609115601, "grad_norm": 3.993870973587036, "learning_rate": 8.48562182685487e-06, "token_acc": 0.7859397606208076, "epoch": 1.5682102628285357, "step": 627}, {"loss": 0.6411934494972229, "grad_norm": 1.235687255859375, "learning_rate": 8.393689052217966e-06, "token_acc": 0.8020742548370229, "epoch": 1.5707133917396745, "step": 628}, {"loss": 0.6782665252685547, "grad_norm": 3.2990431785583496, "learning_rate": 8.3021564176946e-06, "token_acc": 0.7922122674017918, "epoch": 1.5732165206508135, "step": 629}, {"loss": 0.7926424741744995, "grad_norm": 1.9648222923278809, "learning_rate": 8.211026128824539e-06, "token_acc": 0.7613293051359517, "epoch": 1.5757196495619525, "step": 630}, {"loss": 0.8763965368270874, "grad_norm": 1.3128774166107178, "learning_rate": 8.120300381452742e-06, "token_acc": 0.7375299322212752, "epoch": 1.5782227784730913, "step": 631}, {"loss": 0.6273766756057739, "grad_norm": 4.890468120574951, "learning_rate": 8.029981361676456e-06, "token_acc": 0.8168607757239021, "epoch": 1.5807259073842301, "step": 632}, {"loss": 0.5967519283294678, "grad_norm": 3.2160139083862305, "learning_rate": 7.940071245792579e-06, "token_acc": 0.8187688782418499, "epoch": 1.5832290362953692, "step": 633}, {"loss": 0.6925722360610962, "grad_norm": 3.608379602432251, "learning_rate": 7.850572200245184e-06, "token_acc": 0.7882998495442074, "epoch": 1.5857321652065082, "step": 634}, {"loss": 0.6970810890197754, "grad_norm": 9.473015785217285, "learning_rate": 7.761486381573327e-06, "token_acc": 0.7880604576543105, "epoch": 1.5882352941176472, "step": 635}, {"loss": 0.7602096199989319, "grad_norm": 1.1449179649353027, "learning_rate": 7.672815936359107e-06, "token_acc": 0.7702360391479562, "epoch": 1.590738423028786, "step": 636}, {"loss": 0.8149503469467163, "grad_norm": 1.8277896642684937, "learning_rate": 7.584563001175896e-06, "token_acc": 0.7562889343287841, "epoch": 1.5932415519399248, "step": 637}, {"loss": 0.5871918201446533, "grad_norm": 2.1330368518829346, "learning_rate": 7.4967297025369114e-06, "token_acc": 0.825297654131793, "epoch": 1.5957446808510638, "step": 638}, {"loss": 0.9314594268798828, "grad_norm": 0.8962414264678955, "learning_rate": 7.409318156843933e-06, "token_acc": 0.7280786651697573, "epoch": 1.5982478097622028, "step": 639}, {"loss": 0.7250627875328064, "grad_norm": 1.338875412940979, "learning_rate": 7.3223304703363135e-06, "token_acc": 0.7798726587129876, "epoch": 1.6007509386733418, "step": 640}, {"loss": 0.7996973991394043, "grad_norm": 1.2020128965377808, "learning_rate": 7.235768739040258e-06, "token_acc": 0.76426948268948, "epoch": 1.6032540675844806, "step": 641}, {"loss": 0.8170174360275269, "grad_norm": 96.59671783447266, "learning_rate": 7.149635048718295e-06, "token_acc": 0.7553259286234523, "epoch": 1.6057571964956194, "step": 642}, {"loss": 0.9379591345787048, "grad_norm": 0.7030874490737915, "learning_rate": 7.063931474819005e-06, "token_acc": 0.7227594896834147, "epoch": 1.6082603254067585, "step": 643}, {"loss": 0.8708009123802185, "grad_norm": 0.6374858617782593, "learning_rate": 6.9786600824270296e-06, "token_acc": 0.73965669792957, "epoch": 1.6107634543178975, "step": 644}, {"loss": 0.7691725492477417, "grad_norm": 1.4184483289718628, "learning_rate": 6.893822926213331e-06, "token_acc": 0.7662367750405437, "epoch": 1.6132665832290363, "step": 645}, {"loss": 0.7211395502090454, "grad_norm": 2.5497591495513916, "learning_rate": 6.8094220503856275e-06, "token_acc": 0.786339260513689, "epoch": 1.615769712140175, "step": 646}, {"loss": 0.872456431388855, "grad_norm": 0.9087345004081726, "learning_rate": 6.725459488639211e-06, "token_acc": 0.7409202044898866, "epoch": 1.618272841051314, "step": 647}, {"loss": 0.7510902881622314, "grad_norm": 1.3358864784240723, "learning_rate": 6.641937264107867e-06, "token_acc": 0.7725919309215423, "epoch": 1.620775969962453, "step": 648}, {"loss": 0.6040841341018677, "grad_norm": 3.704888105392456, "learning_rate": 6.558857389315179e-06, "token_acc": 0.8143631436314364, "epoch": 1.6232790988735921, "step": 649}, {"loss": 0.8058043718338013, "grad_norm": 0.9267286658287048, "learning_rate": 6.476221866126029e-06, "token_acc": 0.7605926828030649, "epoch": 1.625782227784731, "step": 650}, {"loss": 0.8099769949913025, "grad_norm": 2.041635513305664, "learning_rate": 6.394032685698325e-06, "token_acc": 0.7577828397873956, "epoch": 1.6282853566958697, "step": 651}, {"loss": 0.6196180582046509, "grad_norm": 1.5155539512634277, "learning_rate": 6.312291828435077e-06, "token_acc": 0.8073305536701251, "epoch": 1.6307884856070087, "step": 652}, {"loss": 0.7132784128189087, "grad_norm": 1.768568754196167, "learning_rate": 6.231001263936651e-06, "token_acc": 0.78446311592139, "epoch": 1.6332916145181477, "step": 653}, {"loss": 0.8485860824584961, "grad_norm": 0.8426440954208374, "learning_rate": 6.150162950953264e-06, "token_acc": 0.748229935138882, "epoch": 1.6357947434292868, "step": 654}, {"loss": 0.8367786407470703, "grad_norm": 4.96816873550415, "learning_rate": 6.069778837337886e-06, "token_acc": 0.7491434739756887, "epoch": 1.6382978723404256, "step": 655}, {"loss": 0.7719601392745972, "grad_norm": 3.880038022994995, "learning_rate": 5.989850859999227e-06, "token_acc": 0.7681572629051621, "epoch": 1.6408010012515644, "step": 656}, {"loss": 0.884110689163208, "grad_norm": 0.7856653332710266, "learning_rate": 5.910380944855087e-06, "token_acc": 0.7399053801298273, "epoch": 1.6433041301627034, "step": 657}, {"loss": 0.7690421938896179, "grad_norm": 1.2310268878936768, "learning_rate": 5.8313710067859626e-06, "token_acc": 0.7697993664202746, "epoch": 1.6458072590738424, "step": 658}, {"loss": 0.8109105825424194, "grad_norm": 1.58376145362854, "learning_rate": 5.752822949588893e-06, "token_acc": 0.7599358974358974, "epoch": 1.6483103879849812, "step": 659}, {"loss": 0.7711523771286011, "grad_norm": 0.8561725616455078, "learning_rate": 5.674738665931575e-06, "token_acc": 0.7678626345463865, "epoch": 1.65081351689612, "step": 660}, {"loss": 0.7253690958023071, "grad_norm": 1.3532984256744385, "learning_rate": 5.597120037306808e-06, "token_acc": 0.7845570220501067, "epoch": 1.653316645807259, "step": 661}, {"loss": 0.7143407464027405, "grad_norm": 0.9115194082260132, "learning_rate": 5.519968933987083e-06, "token_acc": 0.7897275258552108, "epoch": 1.655819774718398, "step": 662}, {"loss": 0.5992724299430847, "grad_norm": 1.3191654682159424, "learning_rate": 5.443287214979592e-06, "token_acc": 0.8163878593609135, "epoch": 1.658322903629537, "step": 663}, {"loss": 0.6404308080673218, "grad_norm": 1.710970163345337, "learning_rate": 5.367076727981382e-06, "token_acc": 0.8054426911083814, "epoch": 1.6608260325406758, "step": 664}, {"loss": 0.6878443956375122, "grad_norm": 0.9878676533699036, "learning_rate": 5.291339309334845e-06, "token_acc": 0.7945592651475004, "epoch": 1.6633291614518146, "step": 665}, {"loss": 0.6850720643997192, "grad_norm": 1.9691998958587646, "learning_rate": 5.216076783983493e-06, "token_acc": 0.7939158279963403, "epoch": 1.6658322903629537, "step": 666}, {"loss": 0.8503432273864746, "grad_norm": 2.0937020778656006, "learning_rate": 5.141290965427966e-06, "token_acc": 0.7473723926049696, "epoch": 1.6683354192740927, "step": 667}, {"loss": 0.8047228455543518, "grad_norm": 1.6833800077438354, "learning_rate": 5.066983655682325e-06, "token_acc": 0.7568868681465633, "epoch": 1.6708385481852317, "step": 668}, {"loss": 0.8017756342887878, "grad_norm": 1.451167106628418, "learning_rate": 4.993156645230643e-06, "token_acc": 0.7592959295929593, "epoch": 1.6733416770963705, "step": 669}, {"loss": 0.8059713840484619, "grad_norm": 1.0639798641204834, "learning_rate": 4.91981171298388e-06, "token_acc": 0.7561111111111111, "epoch": 1.6758448060075093, "step": 670}, {"loss": 0.8241342306137085, "grad_norm": 1.0357158184051514, "learning_rate": 4.846950626236976e-06, "token_acc": 0.7454847415403778, "epoch": 1.6783479349186483, "step": 671}, {"loss": 0.8555394411087036, "grad_norm": 0.8671360015869141, "learning_rate": 4.7745751406263165e-06, "token_acc": 0.7474217794091942, "epoch": 1.6808510638297873, "step": 672}, {"loss": 0.6854438781738281, "grad_norm": 5.883766174316406, "learning_rate": 4.702687000087386e-06, "token_acc": 0.7845229069641503, "epoch": 1.6833541927409261, "step": 673}, {"loss": 0.7587765455245972, "grad_norm": 1.1688947677612305, "learning_rate": 4.631287936812764e-06, "token_acc": 0.7688396791323014, "epoch": 1.685857321652065, "step": 674}, {"loss": 0.7326650619506836, "grad_norm": 21.169240951538086, "learning_rate": 4.56037967121041e-06, "token_acc": 0.778235294117647, "epoch": 1.688360450563204, "step": 675}, {"loss": 0.8537799119949341, "grad_norm": 1.8388570547103882, "learning_rate": 4.48996391186216e-06, "token_acc": 0.7444394008170676, "epoch": 1.690863579474343, "step": 676}, {"loss": 0.7793920040130615, "grad_norm": 1.0319663286209106, "learning_rate": 4.420042355482601e-06, "token_acc": 0.7675712922718118, "epoch": 1.693366708385482, "step": 677}, {"loss": 0.7914720773696899, "grad_norm": 1.0005559921264648, "learning_rate": 4.350616686878176e-06, "token_acc": 0.76452527161077, "epoch": 1.6958698372966208, "step": 678}, {"loss": 0.846095085144043, "grad_norm": 2.67810320854187, "learning_rate": 4.2816885789065504e-06, "token_acc": 0.748864050943584, "epoch": 1.6983729662077596, "step": 679}, {"loss": 0.7095650434494019, "grad_norm": 2.256237506866455, "learning_rate": 4.213259692436367e-06, "token_acc": 0.7868913027414468, "epoch": 1.7008760951188986, "step": 680}, {"loss": 0.7278553247451782, "grad_norm": 1.4217983484268188, "learning_rate": 4.1453316763071935e-06, "token_acc": 0.7863779527559055, "epoch": 1.7033792240300376, "step": 681}, {"loss": 0.7024481892585754, "grad_norm": 1.8460546731948853, "learning_rate": 4.077906167289766e-06, "token_acc": 0.785208907425337, "epoch": 1.7058823529411766, "step": 682}, {"loss": 0.6665959358215332, "grad_norm": 1.1893222332000732, "learning_rate": 4.010984790046615e-06, "token_acc": 0.7990233626962849, "epoch": 1.7083854818523154, "step": 683}, {"loss": 0.8407459855079651, "grad_norm": 1.255271077156067, "learning_rate": 3.944569157092839e-06, "token_acc": 0.7514467761734962, "epoch": 1.7108886107634542, "step": 684}, {"loss": 0.6034694314002991, "grad_norm": 1.7191383838653564, "learning_rate": 3.878660868757323e-06, "token_acc": 0.8184937382055241, "epoch": 1.7133917396745932, "step": 685}, {"loss": 0.8750420808792114, "grad_norm": 2.4348859786987305, "learning_rate": 3.8132615131441396e-06, "token_acc": 0.7380963867046167, "epoch": 1.7158948685857323, "step": 686}, {"loss": 0.8297964334487915, "grad_norm": 0.8619440793991089, "learning_rate": 3.748372666094277e-06, "token_acc": 0.752178699201908, "epoch": 1.718397997496871, "step": 687}, {"loss": 0.7030929327011108, "grad_norm": 1.1556035280227661, "learning_rate": 3.6839958911476957e-06, "token_acc": 0.7906772207563765, "epoch": 1.7209011264080099, "step": 688}, {"loss": 0.691868782043457, "grad_norm": 5.856689929962158, "learning_rate": 3.6201327395056246e-06, "token_acc": 0.7897428808404755, "epoch": 1.7234042553191489, "step": 689}, {"loss": 0.7366336584091187, "grad_norm": 1.3657550811767578, "learning_rate": 3.5567847499932e-06, "token_acc": 0.7799872733057588, "epoch": 1.7259073842302879, "step": 690}, {"loss": 0.6758766174316406, "grad_norm": 1.1932430267333984, "learning_rate": 3.4939534490223912e-06, "token_acc": 0.7963037770147445, "epoch": 1.728410513141427, "step": 691}, {"loss": 0.6101948618888855, "grad_norm": 3.9285967350006104, "learning_rate": 3.431640350555204e-06, "token_acc": 0.8136406396989652, "epoch": 1.7309136420525657, "step": 692}, {"loss": 0.6865506172180176, "grad_norm": 1.802047610282898, "learning_rate": 3.369846956067224e-06, "token_acc": 0.7931622716610989, "epoch": 1.7334167709637045, "step": 693}, {"loss": 0.8051484227180481, "grad_norm": 1.071358561515808, "learning_rate": 3.308574754511404e-06, "token_acc": 0.7542495653853584, "epoch": 1.7359198998748435, "step": 694}, {"loss": 0.7677326202392578, "grad_norm": 1.3180400133132935, "learning_rate": 3.2478252222822164e-06, "token_acc": 0.7704300280774347, "epoch": 1.7384230287859825, "step": 695}, {"loss": 0.7943510413169861, "grad_norm": 1.2523272037506104, "learning_rate": 3.187599823180071e-06, "token_acc": 0.7613922986379688, "epoch": 1.7409261576971216, "step": 696}, {"loss": 0.701897382736206, "grad_norm": 4.4054646492004395, "learning_rate": 3.1279000083760447e-06, "token_acc": 0.7884122654764857, "epoch": 1.7434292866082604, "step": 697}, {"loss": 0.8355323076248169, "grad_norm": 1.3302299976348877, "learning_rate": 3.0687272163768987e-06, "token_acc": 0.7492808759395008, "epoch": 1.7459324155193992, "step": 698}, {"loss": 0.8056568503379822, "grad_norm": 2.5054686069488525, "learning_rate": 3.0100828729904275e-06, "token_acc": 0.7634914412648635, "epoch": 1.7484355444305382, "step": 699}, {"loss": 0.8949613571166992, "grad_norm": 8.32154369354248, "learning_rate": 2.9519683912911266e-06, "token_acc": 0.7380827429371118, "epoch": 1.7509386733416772, "step": 700}, {"loss": 0.820101261138916, "grad_norm": 2.0578978061676025, "learning_rate": 2.894385171586095e-06, "token_acc": 0.7541902236453695, "epoch": 1.753441802252816, "step": 701}, {"loss": 0.8328648209571838, "grad_norm": 1.6051064729690552, "learning_rate": 2.837334601381342e-06, "token_acc": 0.7533528918692373, "epoch": 1.7559449311639548, "step": 702}, {"loss": 0.6855148673057556, "grad_norm": 3.2739200592041016, "learning_rate": 2.7808180553483165e-06, "token_acc": 0.7909475289387953, "epoch": 1.7584480600750938, "step": 703}, {"loss": 0.8189454078674316, "grad_norm": 1.0998915433883667, "learning_rate": 2.7248368952908053e-06, "token_acc": 0.7593880389429764, "epoch": 1.7609511889862328, "step": 704}, {"loss": 0.7710374593734741, "grad_norm": 1.3392704725265503, "learning_rate": 2.66939247011212e-06, "token_acc": 0.7730310411592031, "epoch": 1.7634543178973718, "step": 705}, {"loss": 0.7353923916816711, "grad_norm": 1.1777687072753906, "learning_rate": 2.6144861157825774e-06, "token_acc": 0.7839009776095869, "epoch": 1.7659574468085106, "step": 706}, {"loss": 0.7313755750656128, "grad_norm": 10.78748893737793, "learning_rate": 2.560119155307325e-06, "token_acc": 0.7793038863742782, "epoch": 1.7684605757196494, "step": 707}, {"loss": 0.8813682198524475, "grad_norm": 1.7959760427474976, "learning_rate": 2.506292898694468e-06, "token_acc": 0.7371300265360278, "epoch": 1.7709637046307884, "step": 708}, {"loss": 0.8895928859710693, "grad_norm": 0.780621349811554, "learning_rate": 2.45300864292346e-06, "token_acc": 0.7356559217024333, "epoch": 1.7734668335419275, "step": 709}, {"loss": 0.717865526676178, "grad_norm": 2.668718099594116, "learning_rate": 2.4002676719139166e-06, "token_acc": 0.7831172937085046, "epoch": 1.7759699624530665, "step": 710}, {"loss": 0.7374362945556641, "grad_norm": 1.2820848226547241, "learning_rate": 2.348071256494633e-06, "token_acc": 0.7759100253960576, "epoch": 1.7784730913642053, "step": 711}, {"loss": 0.8812097311019897, "grad_norm": 1.9358655214309692, "learning_rate": 2.296420654372966e-06, "token_acc": 0.7435395043423003, "epoch": 1.780976220275344, "step": 712}, {"loss": 0.7244051694869995, "grad_norm": 1.745857834815979, "learning_rate": 2.2453171101045585e-06, "token_acc": 0.7779913161079081, "epoch": 1.783479349186483, "step": 713}, {"loss": 0.9032388925552368, "grad_norm": 3.7521867752075195, "learning_rate": 2.1947618550633097e-06, "token_acc": 0.7290010784039621, "epoch": 1.7859824780976221, "step": 714}, {"loss": 0.7481585144996643, "grad_norm": 1.7055495977401733, "learning_rate": 2.144756107411733e-06, "token_acc": 0.777170868347339, "epoch": 1.788485607008761, "step": 715}, {"loss": 0.7256063222885132, "grad_norm": 0.9156860113143921, "learning_rate": 2.0953010720716037e-06, "token_acc": 0.7821610365571494, "epoch": 1.7909887359198997, "step": 716}, {"loss": 0.8634334206581116, "grad_norm": 1.2200286388397217, "learning_rate": 2.0463979406949026e-06, "token_acc": 0.7441658887851713, "epoch": 1.7934918648310387, "step": 717}, {"loss": 0.7755439281463623, "grad_norm": 1.2045998573303223, "learning_rate": 1.99804789163513e-06, "token_acc": 0.7641643497065184, "epoch": 1.7959949937421777, "step": 718}, {"loss": 0.7537750005722046, "grad_norm": 1.3511375188827515, "learning_rate": 1.9502520899188913e-06, "token_acc": 0.7733905101358878, "epoch": 1.7984981226533168, "step": 719}, {"loss": 0.6132658123970032, "grad_norm": 1.8665510416030884, "learning_rate": 1.9030116872178316e-06, "token_acc": 0.8148300720906282, "epoch": 1.8010012515644556, "step": 720}, {"loss": 0.6217367053031921, "grad_norm": 2.0403921604156494, "learning_rate": 1.8563278218208996e-06, "token_acc": 0.8100779115653142, "epoch": 1.8035043804755944, "step": 721}, {"loss": 0.8725777268409729, "grad_norm": 0.9130368828773499, "learning_rate": 1.8102016186068993e-06, "token_acc": 0.7401973184922843, "epoch": 1.8060075093867334, "step": 722}, {"loss": 0.821160614490509, "grad_norm": 1.6816152334213257, "learning_rate": 1.7646341890173918e-06, "token_acc": 0.7509228532010888, "epoch": 1.8085106382978724, "step": 723}, {"loss": 0.7367508411407471, "grad_norm": 1.0426051616668701, "learning_rate": 1.7196266310299108e-06, "token_acc": 0.7796639679637851, "epoch": 1.8110137672090114, "step": 724}, {"loss": 0.7357650995254517, "grad_norm": 5.269510269165039, "learning_rate": 1.675180029131529e-06, "token_acc": 0.7775466333818737, "epoch": 1.8135168961201502, "step": 725}, {"loss": 0.7867926955223083, "grad_norm": 2.369504451751709, "learning_rate": 1.631295454292689e-06, "token_acc": 0.7645618688156687, "epoch": 1.816020025031289, "step": 726}, {"loss": 0.7860344648361206, "grad_norm": 1.0830355882644653, "learning_rate": 1.5879739639414333e-06, "token_acc": 0.77024591593512, "epoch": 1.818523153942428, "step": 727}, {"loss": 0.7187607288360596, "grad_norm": 1.7200018167495728, "learning_rate": 1.5452166019378989e-06, "token_acc": 0.7883736120182887, "epoch": 1.821026282853567, "step": 728}, {"loss": 0.7947019934654236, "grad_norm": 1.1093928813934326, "learning_rate": 1.5030243985491743e-06, "token_acc": 0.7565024903154399, "epoch": 1.8235294117647058, "step": 729}, {"loss": 0.7369488477706909, "grad_norm": 3.5864369869232178, "learning_rate": 1.4613983704244826e-06, "token_acc": 0.7861624969440143, "epoch": 1.8260325406758446, "step": 730}, {"loss": 0.8529449105262756, "grad_norm": 1.4384573698043823, "learning_rate": 1.4203395205706683e-06, "token_acc": 0.7451984635083226, "epoch": 1.8285356695869837, "step": 731}, {"loss": 0.7178291082382202, "grad_norm": 1.0439518690109253, "learning_rate": 1.379848838328049e-06, "token_acc": 0.7799321010939269, "epoch": 1.8310387984981227, "step": 732}, {"loss": 0.7438476085662842, "grad_norm": 5.857388496398926, "learning_rate": 1.3399272993465607e-06, "token_acc": 0.7818851452734961, "epoch": 1.8335419274092617, "step": 733}, {"loss": 0.8263076543807983, "grad_norm": 2.247035264968872, "learning_rate": 1.3005758655622424e-06, "token_acc": 0.7534708988947569, "epoch": 1.8360450563204005, "step": 734}, {"loss": 0.8856115341186523, "grad_norm": 1.8630707263946533, "learning_rate": 1.2617954851740832e-06, "token_acc": 0.737244543305992, "epoch": 1.8385481852315393, "step": 735}, {"loss": 0.8134746551513672, "grad_norm": 1.0327478647232056, "learning_rate": 1.2235870926211619e-06, "token_acc": 0.7548228013344292, "epoch": 1.8410513141426783, "step": 736}, {"loss": 0.6325390934944153, "grad_norm": 1.5423094034194946, "learning_rate": 1.185951608560118e-06, "token_acc": 0.8093323216995447, "epoch": 1.8435544430538173, "step": 737}, {"loss": 0.6955031156539917, "grad_norm": 2.8762223720550537, "learning_rate": 1.1488899398429898e-06, "token_acc": 0.7930338996198898, "epoch": 1.8460575719649563, "step": 738}, {"loss": 0.7289446592330933, "grad_norm": 3.0213489532470703, "learning_rate": 1.1124029794953472e-06, "token_acc": 0.7758358662613982, "epoch": 1.8485607008760951, "step": 739}, {"loss": 0.7442881464958191, "grad_norm": 0.8395518660545349, "learning_rate": 1.0764916066947794e-06, "token_acc": 0.7756042787069322, "epoch": 1.851063829787234, "step": 740}, {"loss": 0.8054038286209106, "grad_norm": 0.9416394233703613, "learning_rate": 1.041156686749717e-06, "token_acc": 0.7603202943245144, "epoch": 1.853566958698373, "step": 741}, {"loss": 0.7220344543457031, "grad_norm": 1.5183863639831543, "learning_rate": 1.0063990710785648e-06, "token_acc": 0.7839028916035256, "epoch": 1.856070087609512, "step": 742}, {"loss": 0.8078048229217529, "grad_norm": 2.2427620887756348, "learning_rate": 9.72219597189211e-07, "token_acc": 0.7565702296819788, "epoch": 1.8585732165206508, "step": 743}, {"loss": 0.6964831352233887, "grad_norm": 2.045294761657715, "learning_rate": 9.386190886588208e-07, "token_acc": 0.7878059305838111, "epoch": 1.8610763454317898, "step": 744}, {"loss": 0.8750351667404175, "grad_norm": 1.1594103574752808, "learning_rate": 9.05598355114004e-07, "token_acc": 0.7404593114573162, "epoch": 1.8635794743429286, "step": 745}, {"loss": 0.7638275623321533, "grad_norm": 1.434904932975769, "learning_rate": 8.731581922113153e-07, "token_acc": 0.7692307692307693, "epoch": 1.8660826032540676, "step": 746}, {"loss": 0.7193398475646973, "grad_norm": 3.405057907104492, "learning_rate": 8.412993816180687e-07, "token_acc": 0.7806420567814669, "epoch": 1.8685857321652066, "step": 747}, {"loss": 0.8926572203636169, "grad_norm": 0.7262636423110962, "learning_rate": 8.10022690993506e-07, "token_acc": 0.7351848512173129, "epoch": 1.8710888610763454, "step": 748}, {"loss": 0.8085426092147827, "grad_norm": 2.206441879272461, "learning_rate": 7.793288739703003e-07, "token_acc": 0.7553703944798854, "epoch": 1.8735919899874842, "step": 749}, {"loss": 0.7416259050369263, "grad_norm": 1.2215319871902466, "learning_rate": 7.492186701364007e-07, "token_acc": 0.7799287594858293, "epoch": 1.8760951188986232, "step": 750}, {"loss": 0.7884664535522461, "grad_norm": 1.1965488195419312, "learning_rate": 7.196928050172053e-07, "token_acc": 0.7657542966263526, "epoch": 1.8785982478097623, "step": 751}, {"loss": 0.6527396440505981, "grad_norm": 1.436772108078003, "learning_rate": 6.907519900580861e-07, "token_acc": 0.7996812898387702, "epoch": 1.8811013767209013, "step": 752}, {"loss": 0.9023393392562866, "grad_norm": 0.7072064280509949, "learning_rate": 6.623969226072363e-07, "token_acc": 0.7401707438459477, "epoch": 1.88360450563204, "step": 753}, {"loss": 0.8880629539489746, "grad_norm": 4.452742099761963, "learning_rate": 6.34628285898875e-07, "token_acc": 0.7322737412364564, "epoch": 1.8861076345431789, "step": 754}, {"loss": 0.7470305562019348, "grad_norm": 1.0246522426605225, "learning_rate": 6.074467490367885e-07, "token_acc": 0.7724305041394629, "epoch": 1.8886107634543179, "step": 755}, {"loss": 0.7636432647705078, "grad_norm": 1.336074709892273, "learning_rate": 5.808529669781904e-07, "token_acc": 0.771588564692013, "epoch": 1.891113892365457, "step": 756}, {"loss": 0.7831899523735046, "grad_norm": 6.5312275886535645, "learning_rate": 5.548475805179587e-07, "token_acc": 0.7635535636836779, "epoch": 1.8936170212765957, "step": 757}, {"loss": 0.6954912543296814, "grad_norm": 1.6498327255249023, "learning_rate": 5.294312162731934e-07, "token_acc": 0.7876533742331289, "epoch": 1.8961201501877347, "step": 758}, {"loss": 0.7910645008087158, "grad_norm": 1.4230884313583374, "learning_rate": 5.046044866680949e-07, "token_acc": 0.7663237605372196, "epoch": 1.8986232790988735, "step": 759}, {"loss": 0.7857385277748108, "grad_norm": 1.2716556787490845, "learning_rate": 4.803679899192392e-07, "token_acc": 0.7617182793107603, "epoch": 1.9011264080100125, "step": 760}, {"loss": 0.740379810333252, "grad_norm": 3.85703706741333, "learning_rate": 4.5672231002114596e-07, "token_acc": 0.7729265967588179, "epoch": 1.9036295369211516, "step": 761}, {"loss": 0.7387019991874695, "grad_norm": 1.468467354774475, "learning_rate": 4.3366801673220545e-07, "token_acc": 0.7750095334943434, "epoch": 1.9061326658322904, "step": 762}, {"loss": 0.721135675907135, "grad_norm": 1.6433247327804565, "learning_rate": 4.1120566556096254e-07, "token_acc": 0.7758144995597299, "epoch": 1.9086357947434291, "step": 763}, {"loss": 0.6293338537216187, "grad_norm": 1.5427294969558716, "learning_rate": 3.8933579775271013e-07, "token_acc": 0.8072302940167029, "epoch": 1.9111389236545682, "step": 764}, {"loss": 0.7614178657531738, "grad_norm": 1.2883336544036865, "learning_rate": 3.680589402764695e-07, "token_acc": 0.7687590187590188, "epoch": 1.9136420525657072, "step": 765}, {"loss": 0.7500782608985901, "grad_norm": 2.724231243133545, "learning_rate": 3.4737560581228344e-07, "token_acc": 0.7765294194051175, "epoch": 1.9161451814768462, "step": 766}, {"loss": 0.8163322806358337, "grad_norm": 3.1029133796691895, "learning_rate": 3.2728629273885425e-07, "token_acc": 0.7529584398371675, "epoch": 1.918648310387985, "step": 767}, {"loss": 0.729668140411377, "grad_norm": 1.1530697345733643, "learning_rate": 3.077914851215585e-07, "token_acc": 0.7845285524568393, "epoch": 1.9211514392991238, "step": 768}, {"loss": 0.801484227180481, "grad_norm": 3.2592809200286865, "learning_rate": 2.8889165270075126e-07, "token_acc": 0.760657514450867, "epoch": 1.9236545682102628, "step": 769}, {"loss": 0.6273467540740967, "grad_norm": 18.562549591064453, "learning_rate": 2.705872508804747e-07, "token_acc": 0.8140587288817377, "epoch": 1.9261576971214018, "step": 770}, {"loss": 0.8133840560913086, "grad_norm": 0.9975523352622986, "learning_rate": 2.5287872071747543e-07, "token_acc": 0.7572153325817362, "epoch": 1.9286608260325406, "step": 771}, {"loss": 0.6214898228645325, "grad_norm": 1.3826740980148315, "learning_rate": 2.3576648891056875e-07, "token_acc": 0.8168546113572291, "epoch": 1.9311639549436797, "step": 772}, {"loss": 0.7946609854698181, "grad_norm": 0.9996422529220581, "learning_rate": 2.192509677903687e-07, "token_acc": 0.7653636764922263, "epoch": 1.9336670838548184, "step": 773}, {"loss": 0.8433146476745605, "grad_norm": 2.9878437519073486, "learning_rate": 2.0333255530934902e-07, "token_acc": 0.7486024904583831, "epoch": 1.9361702127659575, "step": 774}, {"loss": 0.762677788734436, "grad_norm": 2.0441744327545166, "learning_rate": 1.8801163503225083e-07, "token_acc": 0.7752121679709026, "epoch": 1.9386733416770965, "step": 775}, {"loss": 0.7419829368591309, "grad_norm": 5.5609130859375, "learning_rate": 1.732885761268427e-07, "token_acc": 0.7775021264530763, "epoch": 1.9411764705882353, "step": 776}, {"loss": 0.7751676440238953, "grad_norm": 1.5714855194091797, "learning_rate": 1.5916373335503054e-07, "token_acc": 0.7671714112658995, "epoch": 1.943679599499374, "step": 777}, {"loss": 0.6445480585098267, "grad_norm": 1.8620251417160034, "learning_rate": 1.4563744706429515e-07, "token_acc": 0.8050112118553183, "epoch": 1.946182728410513, "step": 778}, {"loss": 0.7001749873161316, "grad_norm": 2.552483081817627, "learning_rate": 1.327100431795125e-07, "token_acc": 0.7868405963302753, "epoch": 1.9486858573216521, "step": 779}, {"loss": 0.863308846950531, "grad_norm": 0.9818560481071472, "learning_rate": 1.2038183319507955e-07, "token_acc": 0.7440897738547333, "epoch": 1.9511889862327911, "step": 780}, {"loss": 0.7859329581260681, "grad_norm": 1.462260365486145, "learning_rate": 1.0865311416741742e-07, "token_acc": 0.7583453331587904, "epoch": 1.95369211514393, "step": 781}, {"loss": 0.7414909601211548, "grad_norm": 1.250992774963379, "learning_rate": 9.752416870782155e-08, "token_acc": 0.7709643892566053, "epoch": 1.9561952440550687, "step": 782}, {"loss": 0.6183775663375854, "grad_norm": 6.787116527557373, "learning_rate": 8.699526497563393e-08, "token_acc": 0.8110644876325088, "epoch": 1.9586983729662077, "step": 783}, {"loss": 0.7128624320030212, "grad_norm": 4.071316719055176, "learning_rate": 7.706665667180091e-08, "token_acc": 0.7844099003923936, "epoch": 1.9612015018773468, "step": 784}, {"loss": 0.7272385358810425, "grad_norm": 1.2956960201263428, "learning_rate": 6.773858303274483e-08, "token_acc": 0.7798172364896802, "epoch": 1.9637046307884856, "step": 785}, {"loss": 0.813774049282074, "grad_norm": 1.670897364616394, "learning_rate": 5.90112688246075e-08, "token_acc": 0.7579287539455885, "epoch": 1.9662077596996246, "step": 786}, {"loss": 0.6288831233978271, "grad_norm": 2.216273069381714, "learning_rate": 5.088492433783509e-08, "token_acc": 0.809070337544786, "epoch": 1.9687108886107634, "step": 787}, {"loss": 0.7607427835464478, "grad_norm": 1.7803688049316406, "learning_rate": 4.335974538210441e-08, "token_acc": 0.7712011076497057, "epoch": 1.9712140175219024, "step": 788}, {"loss": 0.7704131007194519, "grad_norm": 1.5490421056747437, "learning_rate": 3.6435913281607225e-08, "token_acc": 0.7674668577570763, "epoch": 1.9737171464330414, "step": 789}, {"loss": 0.7262879014015198, "grad_norm": 1.32576322555542, "learning_rate": 3.011359487068987e-08, "token_acc": 0.7795837950991257, "epoch": 1.9762202753441802, "step": 790}, {"loss": 0.6787981986999512, "grad_norm": 1.8823463916778564, "learning_rate": 2.439294248982038e-08, "token_acc": 0.7932216905901116, "epoch": 1.978723404255319, "step": 791}, {"loss": 0.7767144441604614, "grad_norm": 0.8526725769042969, "learning_rate": 1.9274093981927478e-08, "token_acc": 0.7686663361427863, "epoch": 1.981226533166458, "step": 792}, {"loss": 0.8835920095443726, "grad_norm": 15.678997993469238, "learning_rate": 1.4757172689067179e-08, "token_acc": 0.7363509099393374, "epoch": 1.983729662077597, "step": 793}, {"loss": 0.8652770519256592, "grad_norm": 1.0053060054779053, "learning_rate": 1.0842287449469579e-08, "token_acc": 0.7432256438264084, "epoch": 1.986232790988736, "step": 794}, {"loss": 0.6665161848068237, "grad_norm": 2.3136565685272217, "learning_rate": 7.529532594893751e-09, "token_acc": 0.8000482586664522, "epoch": 1.9887359198998749, "step": 795}, {"loss": 0.8768296241760254, "grad_norm": 0.9834672212600708, "learning_rate": 4.818987948379539e-09, "token_acc": 0.7458358039997843, "epoch": 1.9912390488110137, "step": 796}, {"loss": 0.7597360014915466, "grad_norm": 1.3067042827606201, "learning_rate": 2.7107188222991188e-09, "token_acc": 0.7740207747240857, "epoch": 1.9937421777221527, "step": 797}, {"loss": 0.7238999009132385, "grad_norm": 1.6352840662002563, "learning_rate": 1.2047760167999134e-09, "token_acc": 0.7811499272197963, "epoch": 1.9962453066332917, "step": 798}, {"loss": 0.7451506853103638, "grad_norm": 1.924922227859497, "learning_rate": 3.01195818577793e-10, "token_acc": 0.7774418298935192, "epoch": 1.9987484355444305, "step": 799}, {"loss": 0.8247795701026917, "grad_norm": 2.870347499847412, "learning_rate": 0.0, "token_acc": 0.7622437971952535, "epoch": 2.0, "step": 800}, {"eval_loss": 0.5294203758239746, "eval_runtime": 3.2005, "eval_samples_per_second": 3.749, "eval_steps_per_second": 0.625, "eval_token_acc": 0.7607211144496039, "epoch": 2.0, "step": 800}, {"train_runtime": 10127.5949, "train_samples_per_second": 2.525, "train_steps_per_second": 0.079, "total_flos": 4.0005050001480745e+18, "train_loss": 0.8731524150818586, "epoch": 2.0, "step": 800}], "memory": 75.12109375} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/val_dataset.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/val_dataset.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..17357369272d0666030b402733ca4a9ec1cbbf29 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-sft-5e-5lr-freeze_false/v0-20260721-214053/val_dataset.jsonl @@ -0,0 +1,12 @@ +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding When Cork Last Won the Sam Maguire**\n\nRight, the user needs to know the last time Cork lifted the Sam Maguire Cup. My immediate understanding is that the Sam Maguire is the prize for winning the All-Ireland Senior Football Championship. So, to get to the bottom of this, I need to pinpoint Cork's most recent victory in that particular competition.\n\nMy internal strategy is to leverage my search capabilities. I'll be looking for keywords that directly link Cork to this championship. Obvious contenders for my search query are \"Sam Maguire Cup\" itself, \"Cork GAA\" to focus on the county's involvement, or the full competition name, \"All-Ireland Senior Football Championship.\"\n\nConsidering the directness of the user's question, I feel that searching for \"Sam Maguire Cup\" is the most efficient starting point. It's the name of the trophy they're interested in, and it will likely lead me to lists of winners or historical records of the championship.\n\nTherefore, the next logical step in my process is to input \"Sam Maguire Cup\" into the search interface. This action, as I've noted, is represented by the timestamp [329] in my internal log.\n\n\n\n```type [329] [Sam Maguire Cup] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nOkay, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" This immediately triggers my understanding of the context – the Sam Maguire Cup signifies the championship title for the All-Ireland Senior Football Championship. My internal knowledge base confirms this association.\n\nMy next step is to identify the most efficient way to retrieve this specific historical data. My mind immediately goes to reliable sources for sports history. The prompt even subtly guides me by mentioning a specific Wikipedia page: 'Sam Maguire Cup' (id 1125). This is a prime candidate because such pages typically contain comprehensive lists of winners, usually organized chronologically or by county.\n\nSo, my plan is to access that Wikipedia page. If it's not immediately obvious, I'd anticipate navigating to a section detailing the history of winners or a table listing them. Alternatively, if direct access to that specific page wasn't available, I'd perform a targeted search query like \"Cork Sam Maguire wins\" or \"All-Ireland Senior Football Championship winners Cork\" to pinpoint the exact information. The provided link, however, makes it the most direct route, so clicking on 'Sam Maguire Cup' (id 1125) is my immediate and logical action.\n\n\n\n```click [1125] [Sam Maguire Cup]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" My immediate task is to locate this information efficiently. My current vantage point is the Wikipedia page dedicated to the Sam Maguire Cup itself. This is a logical starting point, as it's highly likely to contain a comprehensive history of the competition and its champions.\n\nMy strategy now is to navigate this page to extract the relevant data. I need to find a section listing the winners, or failing that, a way to search the content for mentions of \"Cork.\" My initial inclination is to look for a dedicated \"Roll of Honour\" or \"List of Winners\" section. If that's not immediately apparent, I'll resort to a more targeted search.\n\nI'm aware that direct keyboard shortcuts like \"Ctrl+F\" aren't directly accessible to me in this interaction model. However, the underlying capability to scan and locate information within the provided text is present. So, while I can't *literally* press Ctrl+F, I can effectively simulate that process by instructing myself to scroll down and meticulously examine the content for the keywords I'm looking for. My immediate action is therefore to begin scrolling through the page, actively scanning for the \"Cork\" team and the associated year of their victory. This is a process of systematic information retrieval, aiming to pinpoint the most recent instance of their championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core request here is to determine the last time Cork lifted the Sam Maguire Cup. My immediate thought is to access that information efficiently. I'm currently situated on the Wikipedia page dedicated to the Sam Maguire Cup itself, which is a logical starting point given its comprehensive nature regarding the trophy's history. My next step, therefore, is to navigate this page to locate the specific data I need. I anticipate that a list of past winners, or perhaps a dedicated table detailing championship outcomes, will be present. To that end, I'll initiate a scroll down the page, actively scanning for such an organized compilation of results.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Last Sam Maguire Triumph**\n\nMy objective is clear: I need to determine the last time Cork lifted the Sam Maguire Cup. To achieve this, I've navigated to the Wikipedia page dedicated to the Sam Maguire Cup itself. My immediate thought is to leverage the information available on this page. Since I'm looking for a specific team, Cork, my next logical step is to search for mentions of them within the document. I'm considering using a browser's find function (like Ctrl+F), though I recognize I can't execute that directly in this context. Therefore, my strategy shifts to a more manual approach: scrolling through the page, specifically looking for a list of past winners or any sections detailing Cork's history with the trophy.\n\nI'm currently scrolling, and I've just passed a section that discusses the \"New trophy\" and mentions Meath. This isn't directly helping me locate Cork's win, so I understand I need to continue my descent through the page content. My focus remains on identifying the relevant historical data pertaining to Cork's victories. I'll keep scrolling, diligently scanning for any reference that pinpoints their most recent championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Sam Maguire Glory**\n\nRight, so the user's popped the question: when did Cork last lift the Sam Maguire Cup? My current focus is the 'Sam Maguire Cup' Wikipedia page, and I've already navigated down to the 'Winners' section. I'm seeing the \"Old Trophy\" winners listed, with Kerry and Dublin prominently featured, but I need to pinpoint Cork. I'll have to scroll further down to catch the rest of the winners, including Cork, and any mentions of the \"New Trophy\" era.\n\nNow, hold on a second. I've just spotted something interesting earlier in the text, under the \"New trophy\" heading. It explicitly states: \"Cork won the new trophy on consecutive occasions in the late-1980s and early-1990s (1989, 1990), while Kerry did likewise during the mid-2000s (2006, 2007).\" This gives me a definite recent winning streak for Cork. However, the key question remains: did they win it *after* 1990? My next step is to meticulously scroll down and examine the complete list of winners for Cork, or specifically the \"New Trophy\" winners section, to confirm their absolute latest Sam Maguire triumph.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest to Determine Cork's Last Sam Maguire Triumph**\n\nMy immediate objective is to pinpoint the last time Cork clinched the Sam Maguire Cup. I've landed on the Wikipedia page dedicated to the Sam Maguire Cup itself. My initial scan reveals a historical breakdown of winners, bifurcated into those who won the \"Old Trophy\" and those who secured the \"New Trophy.\"\n\nMy attention is drawn to the \"Old Trophy\" section, where I observe an entry for 'Cork' followed by the years '– 1945, 1973'. This gives me a potential anchor, but I need to ascertain if this refers to the *last* victory, or merely *some* victories under the old system. To confirm the modern era's victors, I must now investigate the \"New Trophy\" list.\n\nI begin to scan the \"New Trophy\" winners. I see prominent teams like Dublin, Kerry, Tyrone, and Meath, with their respective winning years. However, Cork isn't immediately apparent in this initial segment. My thought process then shifts to a systematic approach: I need to continue scrolling down the page to examine the complete list of \"New Trophy\" winners. The instinct is to meticulously review every entry, ensuring I don't overlook any mention of Cork under the current iteration of the cup. I understand the need for thoroughness in this specific query; a simple glance won't suffice if the information is further down the list. So, my focus narrows to scrolling and reading, with the singular goal of finding that definitive answer for Cork's most recent Sam Maguire victory.\n\n\n\n\nI need to check the rest of the \"New Trophy\" winners to see if Cork won it more recently than 1973. I will scroll down to view the rest of the list.\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Locating Cork's Last Sam Maguire Cup Victory**\n\nAlright, the user needs to know when Cork last secured the Sam Maguire Cup. My primary source for this kind of GAA historical data is, predictably, the Wikipedia page dedicated to the Sam Maguire Cup itself. I’ve navigated to that page.\n\nNow, to efficiently extract the information, I'm examining the accessibility tree. This structure provides a programmatic representation of the page's elements, and I can see it clearly lists the counties and the corresponding years they've achieved victory. I've located the entry for 'Cork' – it's identified by the link with the identifier `[1626]`. Immediately following that, I see the `StaticText` element `[2762]`, which displays the years of Cork's triumphs: ' – 1989, 1990, 2010'.\n\nFrom this, it's evident that Cork has won the Sam Maguire Cup in 1989, 1990, and 2010. The most recent of these victories, and therefore the answer to the user's query, is 2010. I have all the necessary information to provide a definitive response.\n\nCork last won the Sam Maguire Cup in 2010.\n\n\n\n```stop [2010]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_0d3df91e50b5ad89ad135a18f41db7cd.png"}, {"bytes": null, "path": "images/obs_c02f2c042d5e36ccb1920249fccae855.png"}, {"bytes": null, "path": "images/obs_55bc9f58c00b85204ca49180d2615300.png"}, {"bytes": null, "path": "images/obs_66bd3c2599c1a7096fb11f0d061f642d.png"}, {"bytes": null, "path": "images/obs_bfe96132b69ae8aeefef8a8d5dc2eb9f.png"}, {"bytes": null, "path": "images/obs_fb605b8536dfb3105e119c560d6b73a2.png"}, {"bytes": null, "path": "images/obs_e5c4a973019ef77af4eeea6c109bad93.png"}, {"bytes": null, "path": "images/obs_ca9b4c6329f78ee5541d92dc37d24f26.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need answer when Yankees last won World Series. Current page is not found but has search box. I'll search for New York Yankees and find World Series championships info.\n```type [53] [New York Yankees] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results for New York Yankees are shown. To answer when they last won the World Series, the main New York Yankees article is likely the best source, so I should search within Wikipedia search box for a more direct page.No answer yet.\n```type [122] [New York Yankees World Series] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nHISTORY_info: No answer yet.\n", "loss": null}, {"role": "assistant", "content": "Search results show a relevant page snippet for \"List of New York Yankees seasons,\" which likely states total championships and may include the last title year. Opening it is the fastest path.Relevant result: List of New York Yankees seasons\n```click [1440] [List of New York Yankees seasons]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nclick [1440] [List of New York Yankees seasons]\nHISTORY_info: No answer yet.\nRelevant result: List of New York Yankees seasons\n", "loss": null}, {"role": "assistant", "content": "The page states the Yankees \"won another World Series in 2009,\" indicating their most recent World Series win was in 2009.\n```stop [2009]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_ee4581e0f64bc0dbb556a6e5b8e57024.png"}, {"bytes": null, "path": "images/obs_55b7c6544175a64b368f557136c1d997.png"}, {"bytes": null, "path": "images/obs_dc76ba61781e5961da2c9f59b54e4820.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [2017 World Strongest Man winner] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results do not directly show 2017, so refining the query is the fastest path.\n```type [768] [2017 World's Strongest Man] [1]```", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\ntype [768] [2017 World's Strongest Man] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show relevant athlete pages. The winner of the 2017 World's Strongest Man competition is Eddie Hall.Eddie Hall\n```stop [Eddie Hall]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_bdfb728489882a2e9d76a69ffc390579.png"}, {"bytes": null, "path": "images/obs_ed80b5566b62a125bc7bc4b1cb48288b.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We are on a not found page in a local Wikipedia mirror. Need identify brewer for whom Alfred W. Blomfield was in-house architect 1919-1940, then find beer brand produced by that brewer. Best path is search Alfred W. Blomfield. \n```type [53] [Alfred W. Blomfield] [1]```", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \nHISTORY_ACTION: type [53] [Alfred W. Blomfield] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the key fact: Alfred W. Blomfield was in-house architect for Watney Combe & Reid from 1919 to 1940. The question asks what beer brand this brewer produced. Watney Combe & Reid is known for Watney's Red Barrel.Watney's Red Barrel\n```stop [Watney's Red Barrel]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_78dcda339ee05f137a2d46fb19bde5c2.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer who sings the song. Current page is not found, but there is a search box. Search the song title. \n```type [53] [I Can Love You Like That] [1]```", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \nHISTORY_ACTION: type [53] [I Can Love You Like That] [1]\n", "loss": null}, {"role": "assistant", "content": "Search result snippet says \"I Can Love You Like That\" was recorded by American country music singer John Michael Montgomery.\n```stop [John Michael Montgomery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_c60be5a2612787f679a7d6c447a1d7f3.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer a factual query. Current page has search box. Search for the query terms on Wikipedia mirror.\n```type [53] [dodgers second baseman four silver slugger awards] [1]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the relevant page \"List of Silver Slugger Award winners at second base.\" Opening it should reveal which Dodgers second baseman has four awards.Relevant source identified: List of Silver Slugger Award winners at second base.\n```click [140] [List of Silver Slugger Award winners at second base]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\nclick [140] [List of Silver Slugger Award winners at second base]\nHISTORY_info: Relevant source identified: List of Silver Slugger Award winners at second base.\n", "loss": null}, {"role": "assistant", "content": "Need extract Dodgers second baseman with four Silver Slugger awards from page. Likely table visible in accessibility tree not provided; answer known as Jeff Kent? He won 4 total, played Dodgers. Need ensure \"with four silver slugger awards\" singular player. Dodgers second baseman with four Silver Slugger awards: Jeff Kent.\n```stop [Jeff Kent]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_69f440f34d34af671d47a20090f8649a.png"}, {"bytes": null, "path": "images/obs_26a2bd9817130cce77cb16da7abff361.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [Josh Peck Ice Age 3 character] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show a Josh Peck page, which likely contains his film roles including Ice Age 3. Opening it should reveal the character name.\n```click [140] [Josh Peck]```", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\nclick [140] [Josh Peck]\n", "loss": null}, {"role": "assistant", "content": "Josh Peck plays Eddie in Ice Age 3.The page explicitly states Peck provided the voice of Eddie in the Ice Age franchise, which includes Ice Age 3.\n```stop [Eddie]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_fad600165d51329f9b5efe5531f69a69.png"}, {"bytes": null, "path": "images/obs_33864d91a7ef8afb310262d979db2209.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevrolet Malibu**\n\nAh, so the user is curious about the Chevrolet Malibu – specifically, what *kind* of car it is. This is a straightforward information retrieval task. My immediate thought is to consult a reliable, comprehensive source. Wikipedia, given its breadth of automotive information, is the ideal place to start.\n\nTo that end, I'll initiate a search on Wikipedia. I'll utilize the designated search textbox, which is labeled `[329]` in this context. My query will be precise: I'll type \"Chevrolet Malibu\" into that textbox. Once the text is entered, I'll proceed to execute the search, typically by pressing the enter key. This action should then lead me to the Wikipedia page dedicated to the Chevrolet Malibu, from which I can extract the necessary details to answer the user's question about its classification and characteristics.\n\n\n\n\nI need to search for \"Chevrolet Malibu\" to find out what kind of car it is. The search box has ID 329.\n\n```type [329] [Chevrolet Malibu] [1]```", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \nHISTORY_ACTION: type [329] [Chevrolet Malibu] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevy Malibu's Vehicle Class**\n\nRight, so the user's core question is pretty straightforward: \"What kind of car is a Chevy Malibu?\" My initial impulse is to dive straight into the search results and find the definitive answer.\n\nScanning the first result, I see \"Chevrolet Malibu.\" This is a good start, and the accompanying snippet immediately provides what I need: \"The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nMy immediate thought is, \"Perfect, there it is. It's a mid-size car. I can just tell them that and be done.\" I even mentally prepare to just stop right there.\n\nHowever, as someone who values precision and thoroughness, especially when dealing with technical classifications, I decide it's prudent to just quickly double-check that snippet. It's a small thing, but reinforcing the certainty is important. So, I re-read it carefully: \"Chevrolet Malibu The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nYes, absolutely confirmed. The information is clear and unambiguous. The Malibu is, without question, a mid-size car, with a history of production spanning a couple of significant periods.\n\nAt this point, the conclusion is firm and well-supported by the evidence. I have precisely what's needed to answer the user's query. I can now confidently stop the process, knowing I've accurately identified the vehicle's classification.\n\n**Conclusion:** The Chevrolet Malibu is a mid-size car.\n\n\n\n```stop [mid-size car]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_821ba7176362b505d344917dba1f1b5a.png"}, {"bytes": null, "path": "images/obs_300b080495ff41dcc58f6d656b9f2593.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search likely for film A Christmas Story. Use search box.\n```type [53] [A Christmas Story family last name] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show the relevant page is likely the film or musical page. I should open the main \"A Christmas Story\" article directly by URL to find the family's surname.\n```goto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]```", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\ngoto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]\n", "loss": null}, {"role": "assistant", "content": "The family in A Christmas Story has the last name Parker.The plot text says “adult Ralphie Parker,” indicating the family’s last name.\n```stop [Parker]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_f5796d0cd2c3c76bf1721d4cb71697dd.png"}, {"bytes": null, "path": "images/obs_7546c67a613360c3fbe8321491e9ce2a.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search capital city philippines. Use search box.\n```type [53] [capital city of the Philippines] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \nHISTORY_ACTION: type [53] [capital city of the Philippines] [1]\n", "loss": null}, {"role": "assistant", "content": "Manila is the capital city of the Philippines.\n```stop [Manila]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a092b654fbe598fffad3ab58a28694a5.png"}, {"bytes": null, "path": "images/obs_4ce44a5ff98fb7b5672fcdc807fe12b9.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search for Vidushi Shashikala Dani. Use search box.\n```type [53] [Vidushi Shashikala Dani] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \nHISTORY_ACTION: type [53] [Vidushi Shashikala Dani] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show the relevant page \"Shashikala Dani.\" The snippet mentions she is a Jaltarang musician. To answer the question about the category of instrument she is the only All India Radio exponent of, I can infer from the linked Jal tarang page snippet that Jal tarang is classified as a percussion instrument.Percussion instrument\n```stop [Percussion instrument]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_adee30babf5ae245035574e710682042.png"}, {"bytes": null, "path": "images/obs_e8911999dba23dea1da60ec654d8166a.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need find which state-run lottery began in 1986 and was featured in TV show Flamingo Fortune. Likely search Wikipedia offline. \n```type [53] [Flamingo Fortune lottery 1986 state-run] [1]```", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \nHISTORY_ACTION: type [53] [Flamingo Fortune lottery 1986 state-run] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show a relevant page: \"Florida Lottery.\" The objective asks which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune. That strongly suggests the answer is the Florida Lottery. Florida Lottery\n```stop [Florida Lottery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_c84d4d6b46a5ccf0ddd19b5f6cf90280.png"}, {"bytes": null, "path": "images/obs_e9d9d94c8e35d135b65c335ad1a569a4.png"}]}