diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/TRAINING_COMPLETED b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/TRAINING_COMPLETED new file mode 100644 index 0000000000000000000000000000000000000000..e69de29bb2d1d6434b8b29ae775ad8c2e48c5391 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/args.json new file mode 100644 index 0000000000000000000000000000000000000000..9b753b9c8e377ab5e62ab9a96bbb206e688a8b12 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..cd3083a2f9ca37f7fc284335aadba7cc853e4df3 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(k_proj|down_proj|v_proj|gate_proj|o_proj|up_proj|q_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|mlp.2|gate_proj|up_proj|qkv|attn.proj|mlp.0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..fa8c66fd31cd7d7836e578dbf1b220b52c335adb --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1716db99eaec17f3975a270b002805ba697d9565010907eadf00dcd4fac0a5e9 +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/args.json new file mode 100644 index 0000000000000000000000000000000000000000..9b753b9c8e377ab5e62ab9a96bbb206e688a8b12 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..190df505cff94ad0ecc4d54f1c48d395fab6fc0c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:23a27e2bc41ec98657f3dd9d810d5c457784e959c6209b13fcbbad4afb8e4b6e +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a452d1bc4a566c8d21450568856fc8734259bb4c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bdcf84e1ebf34324d41bf1c6df155087232fbff4dc3cfa91b262dfcf3e0a52c9 +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..9eaad4ddc39285f37e142f3208d4491ca81519d2 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d523642b4d8fdab65c56bc27c7821fc5822ffc98e2fd67be0579f844254c73b6 +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..fd44502c5e57a6897c0ccf4cff1aa84c9d5ab353 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0d0d76b8083078b4b1481fabdab8c3f40e9fbc9af8eea27b2ee1811721e1169c +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..d834e76e1f6f83d391e7e9f082738c17938a5305 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b0a39674d948c527b09a0f63fec7a89a047eb5ff1efdb6f39edf66eeb0f8791b +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..81ad409750bb1738751359caa100c284264ff3ea --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:170ccba837a7ba9801cdfa1cedf508cc8002ac94e20a71d5c2e4410ef4af835e +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..34bd0b84781ec8f0f78b5a89454a4bd8572a2260 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:96d38f6149707e8ed51bbfe782b55e30821de420461689dc5710567db6400d2b +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..ba7197853f7483b6c93fa4356a2075e78879edf9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8f9b5e58fab054f9df597630a7f681f719c8791f74fe083c7de5f45573d5c0df +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..df40c1d8bc10ece55297139b4d76c3cbf034d9a4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/global_step780/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dedaec532d004facec51a900c034a25af0041737976fc9d6c432984194733a3a +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/latest new file mode 100644 index 0000000000000000000000000000000000000000..1ec3dad1fcdbec2feb24a2594f56f8ac93ca6ae6 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/latest @@ -0,0 +1 @@ +global_step780 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..0f2b84d48aec5bfb2184441e96285b38334b0855 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5fb095da0079bfcda0c5cff3ba797375f9bb558138022eab200ef75caaa1208b +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..db5e8719b5f7eb134ef5d44b98c04c8dc9e705fe --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1b020e9f960adef710d7f840be559bda11d446df112ba34ac90111ee444b0a8b +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..162090741063b8192c0d10b5c4c56501132246a9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9e4cba7dd33a668d7473d1a38c663c2120dec7fc0f183a47e1e37ca0d6a447f3 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..6111fef38c57dd5c14666dca595a2b1dfa0acc02 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:12511aaae9ba837a92496038716634ba468104a7b3799724b7b2cbd809582f09 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..07a17019259f95dcbeded288936b889de786d6e4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:37f541273cc2b3cb4a09e01eca6c5b9664e9b04eb8791493967cd322ca53ebf7 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..18c44f7e0ae2187ca8b93d6661b178c9246130b0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:11cad046bce7a6ac6a28138db9a0077200d2926a7172cc4bdcc3a90188df124a +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..88107d7420ec451aac967fb325539410699ee267 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:da68732e7e5861f4d24414fb40aa7edce549250b302a52f0f672663f8f4616d6 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..9a919a97e231397e77dbf7490748eccac5205200 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:621da99294c2c68911bfad23333623c9d37c138b6c52627ebe6cb5f6d2abecef +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..372669d5d6117ac9bc43efff9bc091a403d26fbc --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fbb84c2c585c8df368024c404ab725c0b20622db0462431267332163768c002e +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..99c40c7da48d5e7fe2515fea85c0caf32b297035 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/trainer_state.json @@ -0,0 +1,6274 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9511889862327911, + "eval_steps": 2000, + "global_step": 780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 1.8141324520111084, + "learning_rate": 3.125e-07, + "loss": 1.4558331966400146, + "step": 1, + "token_acc": 0.6587197909862835 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 2.7097065448760986, + "learning_rate": 6.25e-07, + "loss": 1.5102750062942505, + "step": 2, + "token_acc": 0.6374107200308861 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 3.731478452682495, + "learning_rate": 9.375e-07, + "loss": 1.4846917390823364, + "step": 3, + "token_acc": 0.6467950044849238 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 1.8039724826812744, + "learning_rate": 1.25e-06, + "loss": 1.4477494955062866, + "step": 4, + "token_acc": 0.6551159771996162 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 4.494865417480469, + "learning_rate": 1.5625e-06, + "loss": 1.4835330247879028, + "step": 5, + "token_acc": 0.636961027144518 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 3.468430995941162, + "learning_rate": 1.875e-06, + "loss": 1.476511001586914, + "step": 6, + "token_acc": 0.6395731577829687 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 1.6436569690704346, + "learning_rate": 2.1875e-06, + "loss": 1.445321798324585, + "step": 7, + "token_acc": 0.6609300016548072 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 5.7237958908081055, + "learning_rate": 2.5e-06, + "loss": 1.4368172883987427, + "step": 8, + "token_acc": 0.6518960374946741 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 1.0010274648666382, + "learning_rate": 2.8125e-06, + "loss": 1.5469402074813843, + "step": 9, + "token_acc": 0.61862263870296 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.2346174716949463, + "learning_rate": 3.125e-06, + "loss": 1.5444755554199219, + "step": 10, + "token_acc": 0.6183196808672615 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 1.349374532699585, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5128525495529175, + "step": 11, + "token_acc": 0.6263652527305055 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 3.90444016456604, + "learning_rate": 3.75e-06, + "loss": 1.468747615814209, + "step": 12, + "token_acc": 0.6539249583813549 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 3.8990912437438965, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4974875450134277, + "step": 13, + "token_acc": 0.6396883067214839 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 4.560666084289551, + "learning_rate": 4.375e-06, + "loss": 1.4603385925292969, + "step": 14, + "token_acc": 0.673594883778133 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 2.1652066707611084, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.4672789573669434, + "step": 15, + "token_acc": 0.67072 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 28.565114974975586, + "learning_rate": 5e-06, + "loss": 1.4323251247406006, + "step": 16, + "token_acc": 0.6802855573860516 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 1.2191154956817627, + "learning_rate": 5.3125e-06, + "loss": 1.5201783180236816, + "step": 17, + "token_acc": 0.6302349336057201 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 3.823606252670288, + "learning_rate": 5.625e-06, + "loss": 1.4549026489257812, + "step": 18, + "token_acc": 0.6533967235651278 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 3.615473508834839, + "learning_rate": 5.9375e-06, + "loss": 1.4218157529830933, + "step": 19, + "token_acc": 0.6625929470661857 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 6.056225776672363, + "learning_rate": 6.25e-06, + "loss": 1.5040549039840698, + "step": 20, + "token_acc": 0.6463865546218487 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 1.1101607084274292, + "learning_rate": 6.5625e-06, + "loss": 1.5186512470245361, + "step": 21, + "token_acc": 0.6336622685441845 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 3.4688284397125244, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4710779190063477, + "step": 22, + "token_acc": 0.649603043334436 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 2.945401906967163, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4556055068969727, + "step": 23, + "token_acc": 0.6511273792093705 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.7959648370742798, + "learning_rate": 7.5e-06, + "loss": 1.4981625080108643, + "step": 24, + "token_acc": 0.6581992406436449 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.836989641189575, + "learning_rate": 7.8125e-06, + "loss": 1.4692087173461914, + "step": 25, + "token_acc": 0.6400229118933556 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 4.335150241851807, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4672834873199463, + "step": 26, + "token_acc": 0.6426897157925578 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 2.6187744140625, + "learning_rate": 8.437500000000002e-06, + "loss": 1.5053527355194092, + "step": 27, + "token_acc": 0.6411245456568504 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 4.596649169921875, + "learning_rate": 8.75e-06, + "loss": 1.495232105255127, + "step": 28, + "token_acc": 0.6582827406764961 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 2.2826857566833496, + "learning_rate": 9.0625e-06, + "loss": 1.4520742893218994, + "step": 29, + "token_acc": 0.6422463489623367 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 1.2480427026748657, + "learning_rate": 9.375000000000001e-06, + "loss": 1.413942575454712, + "step": 30, + "token_acc": 0.6513089987801445 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 1.5732747316360474, + "learning_rate": 9.6875e-06, + "loss": 1.4269421100616455, + "step": 31, + "token_acc": 0.6511775266659626 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 1.305902123451233, + "learning_rate": 1e-05, + "loss": 1.4499857425689697, + "step": 32, + "token_acc": 0.6362675125561723 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 2.718529462814331, + "learning_rate": 1.03125e-05, + "loss": 1.449812412261963, + "step": 33, + "token_acc": 0.6403560135847289 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 1.5598729848861694, + "learning_rate": 1.0625e-05, + "loss": 1.3601875305175781, + "step": 34, + "token_acc": 0.6700675278919553 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 9.867480278015137, + "learning_rate": 1.09375e-05, + "loss": 1.3765363693237305, + "step": 35, + "token_acc": 0.6669165757906216 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 2.136289596557617, + "learning_rate": 1.125e-05, + "loss": 1.410968542098999, + "step": 36, + "token_acc": 0.6567221708294789 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 4.079403400421143, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.488232135772705, + "step": 37, + "token_acc": 0.6309482023767738 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 0.7997560501098633, + "learning_rate": 1.1875e-05, + "loss": 1.313117265701294, + "step": 38, + "token_acc": 0.6665271562409453 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 3.2652623653411865, + "learning_rate": 1.21875e-05, + "loss": 1.4282214641571045, + "step": 39, + "token_acc": 0.6325610612275062 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 3.6540777683258057, + "learning_rate": 1.25e-05, + "loss": 1.3395355939865112, + "step": 40, + "token_acc": 0.6717530163236338 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 5.248533248901367, + "learning_rate": 1.28125e-05, + "loss": 1.3371840715408325, + "step": 41, + "token_acc": 0.6693909833904561 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 3.778581380844116, + "learning_rate": 1.3125e-05, + "loss": 1.3400944471359253, + "step": 42, + "token_acc": 0.6653791581270692 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 1.4495247602462769, + "learning_rate": 1.34375e-05, + "loss": 1.3555524349212646, + "step": 43, + "token_acc": 0.6599288486416559 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 3.1733644008636475, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.323427677154541, + "step": 44, + "token_acc": 0.6751474032792182 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 2.605138063430786, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.344847559928894, + "step": 45, + "token_acc": 0.6617188094694375 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 4.86713981628418, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.306713581085205, + "step": 46, + "token_acc": 0.6737607941796423 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 4.361069202423096, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.2949577569961548, + "step": 47, + "token_acc": 0.6895424836601307 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 1.5775742530822754, + "learning_rate": 1.5e-05, + "loss": 1.3317584991455078, + "step": 48, + "token_acc": 0.6644422636571803 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.20259428024292, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3528285026550293, + "step": 49, + "token_acc": 0.6621909900865856 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 2.1786444187164307, + "learning_rate": 1.5625e-05, + "loss": 1.1999170780181885, + "step": 50, + "token_acc": 0.6959557173490251 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 2.961524248123169, + "learning_rate": 1.59375e-05, + "loss": 1.3457515239715576, + "step": 51, + "token_acc": 0.6627879221864185 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 13.192907333374023, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3237392902374268, + "step": 52, + "token_acc": 0.6542852884185423 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 3.6055777072906494, + "learning_rate": 1.65625e-05, + "loss": 1.3433442115783691, + "step": 53, + "token_acc": 0.6624097352233217 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 1.7857606410980225, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2789276838302612, + "step": 54, + "token_acc": 0.672338649851632 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 2.1665122509002686, + "learning_rate": 1.71875e-05, + "loss": 1.3222646713256836, + "step": 55, + "token_acc": 0.6588819226750261 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 1.7462254762649536, + "learning_rate": 1.75e-05, + "loss": 1.3362858295440674, + "step": 56, + "token_acc": 0.6613744187138898 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 1.2184135913848877, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2202270030975342, + "step": 57, + "token_acc": 0.6888445331559104 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 2.862990379333496, + "learning_rate": 1.8125e-05, + "loss": 1.224043846130371, + "step": 58, + "token_acc": 0.6924242424242424 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 4.461820602416992, + "learning_rate": 1.84375e-05, + "loss": 1.1999526023864746, + "step": 59, + "token_acc": 0.6939597315436241 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 1.0866032838821411, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2586383819580078, + "step": 60, + "token_acc": 0.6740108140886351 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 1.9648689031600952, + "learning_rate": 1.90625e-05, + "loss": 1.2699849605560303, + "step": 61, + "token_acc": 0.6729458695772619 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 0.9302283525466919, + "learning_rate": 1.9375e-05, + "loss": 1.26922607421875, + "step": 62, + "token_acc": 0.6693402228820422 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 1.6925781965255737, + "learning_rate": 1.96875e-05, + "loss": 1.2230749130249023, + "step": 63, + "token_acc": 0.69140625 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 3.138141393661499, + "learning_rate": 2e-05, + "loss": 1.2473464012145996, + "step": 64, + "token_acc": 0.671907957813998 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 84.18292236328125, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2626996040344238, + "step": 65, + "token_acc": 0.6641408513483397 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 1.1837621927261353, + "learning_rate": 2.0625e-05, + "loss": 1.2514493465423584, + "step": 66, + "token_acc": 0.6728548072359053 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 2.1558518409729004, + "learning_rate": 2.09375e-05, + "loss": 1.1905746459960938, + "step": 67, + "token_acc": 0.707898979043525 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 2.1352062225341797, + "learning_rate": 2.125e-05, + "loss": 1.2563612461090088, + "step": 68, + "token_acc": 0.6748354235740714 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 4.160109996795654, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.2178868055343628, + "step": 69, + "token_acc": 0.6880837359098229 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 2.219675064086914, + "learning_rate": 2.1875e-05, + "loss": 1.201242208480835, + "step": 70, + "token_acc": 0.6804117879970587 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 4.043488502502441, + "learning_rate": 2.21875e-05, + "loss": 1.2328397035598755, + "step": 71, + "token_acc": 0.6700484108608714 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 1.675660490989685, + "learning_rate": 2.25e-05, + "loss": 1.2181830406188965, + "step": 72, + "token_acc": 0.6850481125092525 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 3.0427443981170654, + "learning_rate": 2.28125e-05, + "loss": 1.0783236026763916, + "step": 73, + "token_acc": 0.7167288053169071 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 11.553773880004883, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.1844292879104614, + "step": 74, + "token_acc": 0.6924296745725317 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 1.2728339433670044, + "learning_rate": 2.34375e-05, + "loss": 1.1743783950805664, + "step": 75, + "token_acc": 0.6912672045562411 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 2.9700307846069336, + "learning_rate": 2.375e-05, + "loss": 1.0269439220428467, + "step": 76, + "token_acc": 0.7346795022305705 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 2.9078361988067627, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1813220977783203, + "step": 77, + "token_acc": 0.6883013798998657 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 3.9725077152252197, + "learning_rate": 2.4375e-05, + "loss": 1.203944444656372, + "step": 78, + "token_acc": 0.6775247733502003 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 1.538577914237976, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.216745138168335, + "step": 79, + "token_acc": 0.6754992693619094 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 1.9446707963943481, + "learning_rate": 2.5e-05, + "loss": 1.2227823734283447, + "step": 80, + "token_acc": 0.6712661046604104 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 1.4078911542892456, + "learning_rate": 2.53125e-05, + "loss": 1.1703464984893799, + "step": 81, + "token_acc": 0.6871378910776361 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 0.8193759918212891, + "learning_rate": 2.5625e-05, + "loss": 1.2597627639770508, + "step": 82, + "token_acc": 0.6600334448160535 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 1.5110586881637573, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.147017240524292, + "step": 83, + "token_acc": 0.6880786212790201 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 2.4486095905303955, + "learning_rate": 2.625e-05, + "loss": 1.1736788749694824, + "step": 84, + "token_acc": 0.6902223116386681 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 15.185917854309082, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0476911067962646, + "step": 85, + "token_acc": 0.7218877279971666 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 1.7706151008605957, + "learning_rate": 2.6875e-05, + "loss": 1.1720056533813477, + "step": 86, + "token_acc": 0.6911136980985643 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.432227849960327, + "learning_rate": 2.71875e-05, + "loss": 1.1003440618515015, + "step": 87, + "token_acc": 0.7121124031007752 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 3.5543625354766846, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0957496166229248, + "step": 88, + "token_acc": 0.70509977827051 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 6.43117094039917, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1858711242675781, + "step": 89, + "token_acc": 0.6840046283541793 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 2.4569075107574463, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.9773006439208984, + "step": 90, + "token_acc": 0.7344842105263157 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 11.663007736206055, + "learning_rate": 2.84375e-05, + "loss": 1.064300298690796, + "step": 91, + "token_acc": 0.7109963417258446 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.8894364833831787, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.1586850881576538, + "step": 92, + "token_acc": 0.6858779719278144 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 1.7159028053283691, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0098645687103271, + "step": 93, + "token_acc": 0.7275060308987322 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 1.5333527326583862, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1714340448379517, + "step": 94, + "token_acc": 0.6860140489913544 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 3.671557903289795, + "learning_rate": 2.96875e-05, + "loss": 1.0821294784545898, + "step": 95, + "token_acc": 0.6963150599818382 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 5.295556545257568, + "learning_rate": 3e-05, + "loss": 0.9997302889823914, + "step": 96, + "token_acc": 0.7385238523852385 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 2.397625207901001, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.130357265472412, + "step": 97, + "token_acc": 0.6882726951607206 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 2.037938356399536, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1520730257034302, + "step": 98, + "token_acc": 0.6894481533067576 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 3.0218756198883057, + "learning_rate": 3.09375e-05, + "loss": 1.0573893785476685, + "step": 99, + "token_acc": 0.7125121241513094 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 3.04327654838562, + "learning_rate": 3.125e-05, + "loss": 1.0620324611663818, + "step": 100, + "token_acc": 0.707827486752968 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 5.125799655914307, + "learning_rate": 3.15625e-05, + "loss": 1.1085580587387085, + "step": 101, + "token_acc": 0.6982024597918638 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 4.365977764129639, + "learning_rate": 3.1875e-05, + "loss": 1.1006660461425781, + "step": 102, + "token_acc": 0.6985514046097003 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 2.454066514968872, + "learning_rate": 3.21875e-05, + "loss": 1.0711305141448975, + "step": 103, + "token_acc": 0.7023084497283104 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 1.7535096406936646, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.0082716941833496, + "step": 104, + "token_acc": 0.7191448721716133 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 3.075683116912842, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.0638121366500854, + "step": 105, + "token_acc": 0.7095207815480664 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 2.3826944828033447, + "learning_rate": 3.3125e-05, + "loss": 1.1353557109832764, + "step": 106, + "token_acc": 0.6854159649713708 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 1.8979523181915283, + "learning_rate": 3.34375e-05, + "loss": 1.0470201969146729, + "step": 107, + "token_acc": 0.7149484887766937 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 1.8144444227218628, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9918816089630127, + "step": 108, + "token_acc": 0.722106165300766 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 3.806840419769287, + "learning_rate": 3.40625e-05, + "loss": 1.0785143375396729, + "step": 109, + "token_acc": 0.6924427887174028 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 2.5378105640411377, + "learning_rate": 3.4375e-05, + "loss": 1.0899507999420166, + "step": 110, + "token_acc": 0.7045417101433357 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 1.9893940687179565, + "learning_rate": 3.46875e-05, + "loss": 1.0884394645690918, + "step": 111, + "token_acc": 0.7042693016878635 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 5.139678001403809, + "learning_rate": 3.5e-05, + "loss": 0.9752957820892334, + "step": 112, + "token_acc": 0.7288215172043732 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 3.4846577644348145, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0316904783248901, + "step": 113, + "token_acc": 0.7174084803792468 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 3.4321818351745605, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.022270917892456, + "step": 114, + "token_acc": 0.7156758903746856 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 2.8689022064208984, + "learning_rate": 3.59375e-05, + "loss": 1.1368576288223267, + "step": 115, + "token_acc": 0.6861952181165647 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 1.8734346628189087, + "learning_rate": 3.625e-05, + "loss": 1.0494530200958252, + "step": 116, + "token_acc": 0.7091768631813126 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.329326629638672, + "learning_rate": 3.65625e-05, + "loss": 0.9063711166381836, + "step": 117, + "token_acc": 0.7585655778643492 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 1.9864639043807983, + "learning_rate": 3.6875e-05, + "loss": 1.0875568389892578, + "step": 118, + "token_acc": 0.7017193984800302 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 3.4826865196228027, + "learning_rate": 3.71875e-05, + "loss": 1.0767862796783447, + "step": 119, + "token_acc": 0.7015383266862427 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 3.474165201187134, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9985078573226929, + "step": 120, + "token_acc": 0.7192602563352256 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 15.018126487731934, + "learning_rate": 3.78125e-05, + "loss": 1.0274770259857178, + "step": 121, + "token_acc": 0.716270783847981 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 2.6608524322509766, + "learning_rate": 3.8125e-05, + "loss": 0.9960276484489441, + "step": 122, + "token_acc": 0.7227157360406091 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 3.8320107460021973, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0952248573303223, + "step": 123, + "token_acc": 0.6966855558726406 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 3.4052140712738037, + "learning_rate": 3.875e-05, + "loss": 1.0360908508300781, + "step": 124, + "token_acc": 0.7139331547031448 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.294705390930176, + "learning_rate": 3.90625e-05, + "loss": 0.9304947853088379, + "step": 125, + "token_acc": 0.7381878821567538 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 5.569668769836426, + "learning_rate": 3.9375e-05, + "loss": 0.9146929383277893, + "step": 126, + "token_acc": 0.7442802870409455 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 4.5205397605896, + "learning_rate": 3.96875e-05, + "loss": 0.8794465661048889, + "step": 127, + "token_acc": 0.7579816513761468 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 3.539724588394165, + "learning_rate": 4e-05, + "loss": 1.015094518661499, + "step": 128, + "token_acc": 0.7137131788123706 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 3.903836965560913, + "learning_rate": 4.0312500000000004e-05, + "loss": 1.0014472007751465, + "step": 129, + "token_acc": 0.7209395973154362 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 2.7150936126708984, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.984825074672699, + "step": 130, + "token_acc": 0.7249438719705256 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 3.824404716491699, + "learning_rate": 4.09375e-05, + "loss": 0.8905125856399536, + "step": 131, + "token_acc": 0.7577065883775149 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 4.411902904510498, + "learning_rate": 4.125e-05, + "loss": 0.980827271938324, + "step": 132, + "token_acc": 0.7225544750117011 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 5.346670150756836, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0253760814666748, + "step": 133, + "token_acc": 0.7098936760749819 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 2.1438992023468018, + "learning_rate": 4.1875e-05, + "loss": 0.9548345804214478, + "step": 134, + "token_acc": 0.7338397692902863 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 4.1644606590271, + "learning_rate": 4.21875e-05, + "loss": 0.8847500681877136, + "step": 135, + "token_acc": 0.7524723391755606 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 2.005262613296509, + "learning_rate": 4.25e-05, + "loss": 1.073623538017273, + "step": 136, + "token_acc": 0.6994131997098965 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 2.246750593185425, + "learning_rate": 4.28125e-05, + "loss": 1.0128499269485474, + "step": 137, + "token_acc": 0.7144232826877809 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 3.925265073776245, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.83775395154953, + "step": 138, + "token_acc": 0.772547828727604 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 12.726314544677734, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.9593348503112793, + "step": 139, + "token_acc": 0.7316725055144674 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 2.6994714736938477, + "learning_rate": 4.375e-05, + "loss": 0.9028947949409485, + "step": 140, + "token_acc": 0.7460494101936346 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 3.9808058738708496, + "learning_rate": 4.40625e-05, + "loss": 0.8996214270591736, + "step": 141, + "token_acc": 0.7425867507886436 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 1.2212865352630615, + "learning_rate": 4.4375e-05, + "loss": 1.0384089946746826, + "step": 142, + "token_acc": 0.7121201463140123 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 3.9611852169036865, + "learning_rate": 4.46875e-05, + "loss": 0.9263251423835754, + "step": 143, + "token_acc": 0.740031723458951 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 5.350156307220459, + "learning_rate": 4.5e-05, + "loss": 0.9607938528060913, + "step": 144, + "token_acc": 0.7303436535801681 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.4106866121292114, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9440912008285522, + "step": 145, + "token_acc": 0.7313729139524784 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 3.6181912422180176, + "learning_rate": 4.5625e-05, + "loss": 0.9318268299102783, + "step": 146, + "token_acc": 0.7333581652743043 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 2.850383758544922, + "learning_rate": 4.59375e-05, + "loss": 0.8572186231613159, + "step": 147, + "token_acc": 0.7507500914745701 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 3.677313804626465, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.9332783818244934, + "step": 148, + "token_acc": 0.7401175938489372 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 1.3261946439743042, + "learning_rate": 4.65625e-05, + "loss": 1.0429058074951172, + "step": 149, + "token_acc": 0.7028539965128017 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 3.0652029514312744, + "learning_rate": 4.6875e-05, + "loss": 0.977657675743103, + "step": 150, + "token_acc": 0.7199633139712626 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 20.230405807495117, + "learning_rate": 4.71875e-05, + "loss": 1.027328610420227, + "step": 151, + "token_acc": 0.7118949681636333 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 3.0481197834014893, + "learning_rate": 4.75e-05, + "loss": 0.8688861727714539, + "step": 152, + "token_acc": 0.7510847854535436 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 5.976290225982666, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.033332347869873, + "step": 153, + "token_acc": 0.7093079141300865 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 3.429054021835327, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.9014919996261597, + "step": 154, + "token_acc": 0.7435937257338096 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 1.6205755472183228, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9900403022766113, + "step": 155, + "token_acc": 0.7184128821764985 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 10.175098419189453, + "learning_rate": 4.875e-05, + "loss": 0.8962844610214233, + "step": 156, + "token_acc": 0.7435897435897436 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 1.2148970365524292, + "learning_rate": 4.90625e-05, + "loss": 0.9664689302444458, + "step": 157, + "token_acc": 0.7256873527101335 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 1.4516433477401733, + "learning_rate": 4.937500000000001e-05, + "loss": 0.857364296913147, + "step": 158, + "token_acc": 0.751648804616653 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 2.4918766021728516, + "learning_rate": 4.96875e-05, + "loss": 0.8872854709625244, + "step": 159, + "token_acc": 0.7495879573673223 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 1.7210731506347656, + "learning_rate": 5e-05, + "loss": 0.9493648409843445, + "step": 160, + "token_acc": 0.7264301870138468 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 6.053183555603027, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8796491622924805, + "step": 161, + "token_acc": 0.7541715628672151 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 2.3308753967285156, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.8858709335327148, + "step": 162, + "token_acc": 0.7452508843180925 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 2.514087200164795, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8514291644096375, + "step": 163, + "token_acc": 0.7531689065363469 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 3.979966878890991, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.0399848222732544, + "step": 164, + "token_acc": 0.7055028462998102 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 1.8825353384017944, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9388617277145386, + "step": 165, + "token_acc": 0.7314329823013729 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.460411787033081, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9585274457931519, + "step": 166, + "token_acc": 0.7233919943259897 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 2.5048015117645264, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8713458776473999, + "step": 167, + "token_acc": 0.7487620536877769 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.3289780616760254, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.9545108079910278, + "step": 168, + "token_acc": 0.7243544303797468 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 8.591806411743164, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.8003573417663574, + "step": 169, + "token_acc": 0.7734825957670106 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 2.1393492221832275, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8462347984313965, + "step": 170, + "token_acc": 0.7583013515768396 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 2.350606679916382, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8536550998687744, + "step": 171, + "token_acc": 0.7583616526560544 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 2.1374306678771973, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8206404447555542, + "step": 172, + "token_acc": 0.7580493637372961 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 1.5408402681350708, + "learning_rate": 4.994911507566217e-05, + "loss": 1.0032633543014526, + "step": 173, + "token_acc": 0.7122946175637394 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 7.398180961608887, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9755508303642273, + "step": 174, + "token_acc": 0.72718616887998 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 34.215980529785156, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8316116333007812, + "step": 175, + "token_acc": 0.7651929504709815 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 1.1946734189987183, + "learning_rate": 4.99229333433282e-05, + "loss": 0.9263297319412231, + "step": 176, + "token_acc": 0.7333371021538809 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 3.4196677207946777, + "learning_rate": 4.991300473502437e-05, + "loss": 0.865764856338501, + "step": 177, + "token_acc": 0.7536853599563217 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 0.84961998462677, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.0150288343429565, + "step": 178, + "token_acc": 0.7088443038523204 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 3.249678611755371, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8582470417022705, + "step": 179, + "token_acc": 0.7626390957679838 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.03476881980896, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9166827201843262, + "step": 180, + "token_acc": 0.7448330683624801 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 3.3579049110412598, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8242158889770508, + "step": 181, + "token_acc": 0.763468992248062 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 2.1550583839416504, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9542834758758545, + "step": 182, + "token_acc": 0.7280744258164551 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 1.229475975036621, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9628951549530029, + "step": 183, + "token_acc": 0.7275876331299762 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.3542944192886353, + "learning_rate": 4.982671142387316e-05, + "loss": 0.9437664151191711, + "step": 184, + "token_acc": 0.7304563628843237 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 2.5428855419158936, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8541402816772461, + "step": 185, + "token_acc": 0.7521788023615407 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 2.5485925674438477, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0094258785247803, + "step": 186, + "token_acc": 0.7157740901376579 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 1.8278656005859375, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8787280917167664, + "step": 187, + "token_acc": 0.7516580692704495 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 4.457269191741943, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9875797033309937, + "step": 188, + "token_acc": 0.7228752642706131 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 3.185421943664551, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8471859693527222, + "step": 189, + "token_acc": 0.7519582245430809 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 6.704853534698486, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8586404323577881, + "step": 190, + "token_acc": 0.7541206247299216 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 1.5821382999420166, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8798616528511047, + "step": 191, + "token_acc": 0.7469811850603763 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 10.706079483032227, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8191840648651123, + "step": 192, + "token_acc": 0.763384590612672 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 5.072082996368408, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.833245575428009, + "step": 193, + "token_acc": 0.7563102340523176 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 1.3364410400390625, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9354732036590576, + "step": 194, + "token_acc": 0.7303690195237074 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 8.606874465942383, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7941551208496094, + "step": 195, + "token_acc": 0.766449806472865 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 2.6359663009643555, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8962496519088745, + "step": 196, + "token_acc": 0.7337984211492564 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 4.913934707641602, + "learning_rate": 4.958879433443904e-05, + "loss": 0.8074665069580078, + "step": 197, + "token_acc": 0.766220939067011 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 14.050993919372559, + "learning_rate": 4.95663319832678e-05, + "loss": 1.0043327808380127, + "step": 198, + "token_acc": 0.7157577609920098 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 1.2029297351837158, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8978754281997681, + "step": 199, + "token_acc": 0.7365190705830776 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 1.6810232400894165, + "learning_rate": 4.951963201008076e-05, + "loss": 0.837005078792572, + "step": 200, + "token_acc": 0.7567454682148526 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 1.762834072113037, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8861300945281982, + "step": 201, + "token_acc": 0.745210849086426 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 2.8837828636169434, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7754945158958435, + "step": 202, + "token_acc": 0.7765665374677002 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 4.415988922119141, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8974159359931946, + "step": 203, + "token_acc": 0.7422455780569085 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.2022016048431396, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9800943732261658, + "step": 204, + "token_acc": 0.7206211812627291 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 3.1489412784576416, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8181082010269165, + "step": 205, + "token_acc": 0.7677832141512985 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 2.7361836433410645, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9568559527397156, + "step": 206, + "token_acc": 0.725022063263505 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 1.2395085096359253, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8899260759353638, + "step": 207, + "token_acc": 0.7444645472559662 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 11.254620552062988, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.793695330619812, + "step": 208, + "token_acc": 0.7653651482284888 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 1.9917453527450562, + "learning_rate": 4.92803071949828e-05, + "loss": 0.9342561960220337, + "step": 209, + "token_acc": 0.7262987886944818 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 1.3936560153961182, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9557225704193115, + "step": 210, + "token_acc": 0.7319856537332898 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 1.602947473526001, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9270342588424683, + "step": 211, + "token_acc": 0.730816476947015 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.341012477874756, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.9432080388069153, + "step": 212, + "token_acc": 0.7277580071174378 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.3441163301467896, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8968133330345154, + "step": 213, + "token_acc": 0.7424508426966292 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 4.8920722007751465, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8623098134994507, + "step": 214, + "token_acc": 0.7460244648318043 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 2.7736644744873047, + "learning_rate": 4.9094401644886e-05, + "loss": 0.9887412190437317, + "step": 215, + "token_acc": 0.7158999839717903 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 1.6230074167251587, + "learning_rate": 4.906138091134118e-05, + "loss": 0.9436683058738708, + "step": 216, + "token_acc": 0.7280187056072704 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 3.8004024028778076, + "learning_rate": 4.90277804028108e-05, + "loss": 0.7515861988067627, + "step": 217, + "token_acc": 0.7878668891724747 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 1.2686784267425537, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9568852186203003, + "step": 218, + "token_acc": 0.722643138007097 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 2.203845500946045, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7561929225921631, + "step": 219, + "token_acc": 0.7821512081060016 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 60.95647048950195, + "learning_rate": 4.892350839330522e-05, + "loss": 0.9007571935653687, + "step": 220, + "token_acc": 0.7362854803493449 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 1.3951096534729004, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8568707704544067, + "step": 221, + "token_acc": 0.7503653902367728 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 4.732699871063232, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8863348960876465, + "step": 222, + "token_acc": 0.7456376192735515 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 1.9262758493423462, + "learning_rate": 4.881404839143988e-05, + "loss": 0.8580335974693298, + "step": 223, + "token_acc": 0.7447225981055481 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 2.428048610687256, + "learning_rate": 4.877641290737884e-05, + "loss": 0.816256046295166, + "step": 224, + "token_acc": 0.7594610513915476 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 1.8479973077774048, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8992019295692444, + "step": 225, + "token_acc": 0.747414978184209 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 1.2170461416244507, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8981590270996094, + "step": 226, + "token_acc": 0.7403604836869724 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 1.4078121185302734, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8538397550582886, + "step": 227, + "token_acc": 0.7566088200534926 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 1.7292224168777466, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8955122828483582, + "step": 228, + "token_acc": 0.7407333994053519 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 1.772873878479004, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8418647646903992, + "step": 229, + "token_acc": 0.7579768207182715 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 2.3586251735687256, + "learning_rate": 4.853860162957552e-05, + "loss": 0.9011165499687195, + "step": 230, + "token_acc": 0.7370127630217316 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 1.4242304563522339, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6907041668891907, + "step": 231, + "token_acc": 0.7974857772068269 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 2.375168561935425, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.838218092918396, + "step": 232, + "token_acc": 0.756889252024066 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 2.9053637981414795, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8434799313545227, + "step": 233, + "token_acc": 0.7536370711848172 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.854264259338379, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8246455788612366, + "step": 234, + "token_acc": 0.7580336387255572 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 4.344927787780762, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8148558139801025, + "step": 235, + "token_acc": 0.757310740639519 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 8.028459548950195, + "learning_rate": 4.828037336897009e-05, + "loss": 0.8641375303268433, + "step": 236, + "token_acc": 0.7445998946320904 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 10.524628639221191, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9830830693244934, + "step": 237, + "token_acc": 0.7152842788491544 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.7903722524642944, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.8133025765419006, + "step": 238, + "token_acc": 0.7577724358974359 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 1.2249422073364258, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8893339037895203, + "step": 239, + "token_acc": 0.745752359800111 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 15.711007118225098, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8640246391296387, + "step": 240, + "token_acc": 0.7455461092760058 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 17.570682525634766, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.7105808258056641, + "step": 241, + "token_acc": 0.7925288608146374 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 3.0752291679382324, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.9153680205345154, + "step": 242, + "token_acc": 0.7310617855077621 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 1.167055606842041, + "learning_rate": 4.79536020593051e-05, + "loss": 0.938827633857727, + "step": 243, + "token_acc": 0.7255839744922714 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 1.852413535118103, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.853781521320343, + "step": 244, + "token_acc": 0.7508854781582054 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.5053846836090088, + "learning_rate": 4.785524389258827e-05, + "loss": 0.9472495317459106, + "step": 245, + "token_acc": 0.7277364588606363 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 3.108750820159912, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8951740860939026, + "step": 246, + "token_acc": 0.7357894216998371 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.4686100482940674, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.7866122722625732, + "step": 247, + "token_acc": 0.7723662389805359 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 1.967427372932434, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.8967963457107544, + "step": 248, + "token_acc": 0.7343396554724204 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 3.1070291996002197, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9204596877098083, + "step": 249, + "token_acc": 0.7327885874226897 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 1.856003761291504, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7575951814651489, + "step": 250, + "token_acc": 0.7788233433496757 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 1.840150237083435, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.8490856289863586, + "step": 251, + "token_acc": 0.7549613056470769 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 1.0170334577560425, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8861610293388367, + "step": 252, + "token_acc": 0.7378573411046351 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 1.2947522401809692, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.8459495902061462, + "step": 253, + "token_acc": 0.7514053303352953 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 1.4557151794433594, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7556009888648987, + "step": 254, + "token_acc": 0.7733115022513304 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 5.058238983154297, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.7291783094406128, + "step": 255, + "token_acc": 0.7859242925395076 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 1.114750623703003, + "learning_rate": 4.72751631047092e-05, + "loss": 0.8316564559936523, + "step": 256, + "token_acc": 0.7554670474186518 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 2.487441301345825, + "learning_rate": 4.721918194465169e-05, + "loss": 0.8008612394332886, + "step": 257, + "token_acc": 0.7658649666763258 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 3.9729726314544678, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7932621240615845, + "step": 258, + "token_acc": 0.7653622505107653 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 1.7285813093185425, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8352819085121155, + "step": 259, + "token_acc": 0.7518584505744301 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 1.6816480159759521, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.8903557658195496, + "step": 260, + "token_acc": 0.7417663664471031 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 2.6574323177337646, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9234253168106079, + "step": 261, + "token_acc": 0.7320945263583114 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 2.6559009552001953, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7536015510559082, + "step": 262, + "token_acc": 0.7836038664964435 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 1.3639440536499023, + "learning_rate": 4.687209999162396e-05, + "loss": 0.9138115048408508, + "step": 263, + "token_acc": 0.73465387392964 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 1.4643888473510742, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9767469763755798, + "step": 264, + "token_acc": 0.7182791953322303 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 1.210517168045044, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8130522966384888, + "step": 265, + "token_acc": 0.7663620788121074 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 2.5332179069519043, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.8405072093009949, + "step": 266, + "token_acc": 0.750514050719671 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 0.8559168577194214, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.9550877809524536, + "step": 267, + "token_acc": 0.7296061884669479 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 1.4378278255462646, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8482018113136292, + "step": 268, + "token_acc": 0.756345916066623 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 11.279638290405273, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8772472143173218, + "step": 269, + "token_acc": 0.7447105454139452 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 1.9061810970306396, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8368943929672241, + "step": 270, + "token_acc": 0.7592273445354014 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 1.9233216047286987, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8612409234046936, + "step": 271, + "token_acc": 0.7476107285993218 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 4.400722980499268, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8825200796127319, + "step": 272, + "token_acc": 0.7407547988287604 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 1.9921467304229736, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.827918529510498, + "step": 273, + "token_acc": 0.7584293340826075 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 1.7633479833602905, + "learning_rate": 4.618673848685586e-05, + "loss": 0.8006143569946289, + "step": 274, + "token_acc": 0.7614477652865369 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 2.8810698986053467, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8252323865890503, + "step": 275, + "token_acc": 0.757303946694003 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 3.151297092437744, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8325484991073608, + "step": 276, + "token_acc": 0.7542700046794572 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 2.637824535369873, + "learning_rate": 4.59890152099534e-05, + "loss": 0.916891872882843, + "step": 277, + "token_acc": 0.7303461130806622 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 3.002065896987915, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8716385364532471, + "step": 278, + "token_acc": 0.744375139229227 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 4.198055267333984, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8470830917358398, + "step": 279, + "token_acc": 0.75168222270458 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 1.8871791362762451, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7896092534065247, + "step": 280, + "token_acc": 0.7681891866119958 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 1.5660463571548462, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9307687282562256, + "step": 281, + "token_acc": 0.7255500518373459 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 5.349212169647217, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8658042550086975, + "step": 282, + "token_acc": 0.7448989748183538 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.4808748960494995, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8970195651054382, + "step": 283, + "token_acc": 0.7391180003431905 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 2.455500364303589, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7446900606155396, + "step": 284, + "token_acc": 0.779041869824317 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 4.634961128234863, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.7530452013015747, + "step": 285, + "token_acc": 0.7835355578024941 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 2.1206021308898926, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7370263338088989, + "step": 286, + "token_acc": 0.778288729739917 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 1.4169611930847168, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9229286313056946, + "step": 287, + "token_acc": 0.7339485313231089 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 1.9929263591766357, + "learning_rate": 4.522542485937369e-05, + "loss": 0.852091372013092, + "step": 288, + "token_acc": 0.7514005602240896 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 3.4453070163726807, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9559416174888611, + "step": 289, + "token_acc": 0.7264587084529661 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 1.336920976638794, + "learning_rate": 4.508018828701612e-05, + "loss": 0.8340522050857544, + "step": 290, + "token_acc": 0.7536214092806285 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 3.4118199348449707, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8833523392677307, + "step": 291, + "token_acc": 0.7454481792717087 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 3.5416605472564697, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9197189807891846, + "step": 292, + "token_acc": 0.7341421143847487 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 2.6148929595947266, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8156468868255615, + "step": 293, + "token_acc": 0.7572543282126311 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 2.203497886657715, + "learning_rate": 4.478392321601651e-05, + "loss": 0.892130434513092, + "step": 294, + "token_acc": 0.7416920489157612 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 2.1712839603424072, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7399520874023438, + "step": 295, + "token_acc": 0.7850873526707348 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 1.8004732131958008, + "learning_rate": 4.463292327201862e-05, + "loss": 0.8421741724014282, + "step": 296, + "token_acc": 0.7520073969536231 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 1.4337384700775146, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8471038341522217, + "step": 297, + "token_acc": 0.757553327501514 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 1.6089038848876953, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7584915161132812, + "step": 298, + "token_acc": 0.771377487562189 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.462379813194275, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8365672826766968, + "step": 299, + "token_acc": 0.7544501643614712 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 8.664839744567871, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.857391357421875, + "step": 300, + "token_acc": 0.749980424399029 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 1.634519100189209, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9205117225646973, + "step": 301, + "token_acc": 0.7280529559461311 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 6.171248435974121, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8554207682609558, + "step": 302, + "token_acc": 0.7522151310490117 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.0984041690826416, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8889010548591614, + "step": 303, + "token_acc": 0.7385387618516452 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 2.31172776222229, + "learning_rate": 4.401014914000078e-05, + "loss": 0.8025680780410767, + "step": 304, + "token_acc": 0.7657713928794504 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 1.0633413791656494, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8589308261871338, + "step": 305, + "token_acc": 0.7430749104146522 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 2.115835428237915, + "learning_rate": 4.384983704904674e-05, + "loss": 0.8085026144981384, + "step": 306, + "token_acc": 0.7655552946701104 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 1.1347414255142212, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8337522745132446, + "step": 307, + "token_acc": 0.7556942478445503 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.038212299346924, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7678971290588379, + "step": 308, + "token_acc": 0.7758904109589041 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 1.3275516033172607, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8638439774513245, + "step": 309, + "token_acc": 0.7517523364485982 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 2.3478550910949707, + "learning_rate": 4.352377813387398e-05, + "loss": 0.929733395576477, + "step": 310, + "token_acc": 0.7266237841229997 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 44.539588928222656, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.6898671388626099, + "step": 311, + "token_acc": 0.7947743004777226 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 30.594491958618164, + "learning_rate": 4.335806273589214e-05, + "loss": 0.7981156706809998, + "step": 312, + "token_acc": 0.7670547784637024 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 4.215977191925049, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7518867254257202, + "step": 313, + "token_acc": 0.779008 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 3.641622543334961, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8727045059204102, + "step": 314, + "token_acc": 0.7429807447620663 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 1.9243735074996948, + "learning_rate": 4.310617707378668e-05, + "loss": 0.8108093738555908, + "step": 315, + "token_acc": 0.7594791997459511 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 0.8778403401374817, + "learning_rate": 4.302133991757297e-05, + "loss": 0.8932883739471436, + "step": 316, + "token_acc": 0.7411044408221683 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 1.0130997896194458, + "learning_rate": 4.2936068525181e-05, + "loss": 0.8487477898597717, + "step": 317, + "token_acc": 0.7464837731723075 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 1.079648494720459, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9818820357322693, + "step": 318, + "token_acc": 0.7180284775465499 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 1.9027600288391113, + "learning_rate": 4.276423126095974e-05, + "loss": 0.808303952217102, + "step": 319, + "token_acc": 0.7607510997308121 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 1.5247927904129028, + "learning_rate": 4.267766952966369e-05, + "loss": 0.9470866918563843, + "step": 320, + "token_acc": 0.7265260406944185 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 1.369870662689209, + "learning_rate": 4.259068184315608e-05, + "loss": 0.9087713956832886, + "step": 321, + "token_acc": 0.7350676621558563 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 6.133328914642334, + "learning_rate": 4.250327029746309e-05, + "loss": 0.7461989521980286, + "step": 322, + "token_acc": 0.7807190257419967 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 1.9726554155349731, + "learning_rate": 4.24154369988241e-05, + "loss": 0.7489862442016602, + "step": 323, + "token_acc": 0.7799331724521997 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.3422818183898926, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9204419851303101, + "step": 324, + "token_acc": 0.7276635593581067 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 5.088674068450928, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7810251712799072, + "step": 325, + "token_acc": 0.7680823083468709 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 3.301347255706787, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6452058553695679, + "step": 326, + "token_acc": 0.8035996835443038 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 1.5935312509536743, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9706965088844299, + "step": 327, + "token_acc": 0.7185623981234843 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 3.254168748855591, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8170771598815918, + "step": 328, + "token_acc": 0.7567391847961991 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 1.6932677030563354, + "learning_rate": 4.187969961854726e-05, + "loss": 1.0035200119018555, + "step": 329, + "token_acc": 0.710241224902499 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 3.9655134677886963, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7571268081665039, + "step": 330, + "token_acc": 0.7816722301700842 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 1.8478268384933472, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6960297226905823, + "step": 331, + "token_acc": 0.797862706031516 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 4.037573337554932, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.8032216429710388, + "step": 332, + "token_acc": 0.7642302509144581 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 1.7107889652252197, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7450529336929321, + "step": 333, + "token_acc": 0.7807361655955263 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 2.1832103729248047, + "learning_rate": 4.142204747357604e-05, + "loss": 0.9057133197784424, + "step": 334, + "token_acc": 0.7387870402398248 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 1.6151518821716309, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8928775191307068, + "step": 335, + "token_acc": 0.7462082912032356 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 14.127095222473145, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7594292163848877, + "step": 336, + "token_acc": 0.7754250629722922 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 1.6860201358795166, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8408955335617065, + "step": 337, + "token_acc": 0.7568825910931174 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.581010341644287, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8329792022705078, + "step": 338, + "token_acc": 0.7593260342227759 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 1.9535971879959106, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6480681896209717, + "step": 339, + "token_acc": 0.8122850705561485 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 1.9793946743011475, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7445608377456665, + "step": 340, + "token_acc": 0.7827135845603527 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 4.794119834899902, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8328458070755005, + "step": 341, + "token_acc": 0.7548175481754817 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 1.6560248136520386, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7087723016738892, + "step": 342, + "token_acc": 0.7858705845576742 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 2.5469024181365967, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8401075005531311, + "step": 343, + "token_acc": 0.7521624133247552 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 1.101097822189331, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8827832937240601, + "step": 344, + "token_acc": 0.7426626391957081 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 0.9751433730125427, + "learning_rate": 4.038078976451567e-05, + "loss": 0.8690142035484314, + "step": 345, + "token_acc": 0.7447467748295871 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.7000588178634644, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7611054182052612, + "step": 346, + "token_acc": 0.7782417893544734 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 1.2874529361724854, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8283425569534302, + "step": 347, + "token_acc": 0.7594009983361065 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 2.1631717681884766, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7190766930580139, + "step": 348, + "token_acc": 0.7870029281193917 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 1.429532766342163, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8946720361709595, + "step": 349, + "token_acc": 0.7392836839113133 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 3.1684229373931885, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9295719861984253, + "step": 350, + "token_acc": 0.7288985616956851 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.7300114631652832, + "learning_rate": 3.979373519225858e-05, + "loss": 0.92355877161026, + "step": 351, + "token_acc": 0.7324363188167625 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 2.299527406692505, + "learning_rate": 3.969463130731183e-05, + "loss": 0.8874197006225586, + "step": 352, + "token_acc": 0.7404152666494357 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.4366137981414795, + "learning_rate": 3.959517334544466e-05, + "loss": 0.8959657549858093, + "step": 353, + "token_acc": 0.732359413775343 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 1.7419233322143555, + "learning_rate": 3.949536370316285e-05, + "loss": 0.870617151260376, + "step": 354, + "token_acc": 0.7478128119311843 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 2.7980542182922363, + "learning_rate": 3.939520478544614e-05, + "loss": 0.938357412815094, + "step": 355, + "token_acc": 0.723624015469509 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 1.4998390674591064, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.9020789265632629, + "step": 356, + "token_acc": 0.7391279337321676 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 7.364425182342529, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8625916242599487, + "step": 357, + "token_acc": 0.7521179064639666 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 3.1867001056671143, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7600144147872925, + "step": 358, + "token_acc": 0.7793380140421263 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 1.8029720783233643, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7643027305603027, + "step": 359, + "token_acc": 0.7712042239220199 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.355663776397705, + "learning_rate": 3.888925582549006e-05, + "loss": 0.8453084230422974, + "step": 360, + "token_acc": 0.7502929524022097 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 1.006208062171936, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8521932363510132, + "step": 361, + "token_acc": 0.756155379559291 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 1.4199978113174438, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8347768783569336, + "step": 362, + "token_acc": 0.7501978691019787 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 1.349457025527954, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7749630808830261, + "step": 363, + "token_acc": 0.7748823133826497 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 5.823076248168945, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6983618140220642, + "step": 364, + "token_acc": 0.7871479571598572 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 8.135080337524414, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8401281833648682, + "step": 365, + "token_acc": 0.7508409829522777 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.687354564666748, + "learning_rate": 3.827110064348773e-05, + "loss": 0.8170597553253174, + "step": 366, + "token_acc": 0.7552287581699346 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.9633206129074097, + "learning_rate": 3.816694101379631e-05, + "loss": 0.8735244274139404, + "step": 367, + "token_acc": 0.7437511571931124 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 4.996685981750488, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.693369448184967, + "step": 368, + "token_acc": 0.7922726867136611 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 1.0713677406311035, + "learning_rate": 3.795767247323533e-05, + "loss": 0.9313665628433228, + "step": 369, + "token_acc": 0.7287721170089801 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 4.217531681060791, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7590094804763794, + "step": 370, + "token_acc": 0.773895906118427 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 1.6878818273544312, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8483130931854248, + "step": 371, + "token_acc": 0.7492018446257538 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 0.8570557832717896, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9103615283966064, + "step": 372, + "token_acc": 0.7282932011331444 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 2.5253098011016846, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8272509574890137, + "step": 373, + "token_acc": 0.7556038061178875 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 1.4744120836257935, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9171687364578247, + "step": 374, + "token_acc": 0.7330784603353897 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 1.189939260482788, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.861799955368042, + "step": 375, + "token_acc": 0.7455566567558639 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 1.3322968482971191, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8449103832244873, + "step": 376, + "token_acc": 0.7524626452684007 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 1.3432042598724365, + "learning_rate": 3.710831292775353e-05, + "loss": 0.7643551826477051, + "step": 377, + "token_acc": 0.7682315405651777 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 1.8385838270187378, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7325477004051208, + "step": 378, + "token_acc": 0.7822782174094127 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 1.7004828453063965, + "learning_rate": 3.689300402536093e-05, + "loss": 0.9835074543952942, + "step": 379, + "token_acc": 0.715375239421905 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.2685455083847046, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8341811895370483, + "step": 380, + "token_acc": 0.7532715029856435 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 0.9319852590560913, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8452165126800537, + "step": 381, + "token_acc": 0.7504095866685391 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 1.6068520545959473, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7542648911476135, + "step": 382, + "token_acc": 0.776282880551962 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 2.165843963623047, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7548285126686096, + "step": 383, + "token_acc": 0.7744026531996684 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 1.8156840801239014, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6292520761489868, + "step": 384, + "token_acc": 0.8097231165486156 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 0.9236544370651245, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8094581365585327, + "step": 385, + "token_acc": 0.7608140039542846 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.497694969177246, + "learning_rate": 3.613053314713671e-05, + "loss": 0.8500128984451294, + "step": 386, + "token_acc": 0.7480623568786331 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 3.220353364944458, + "learning_rate": 3.602051485530486e-05, + "loss": 0.917942225933075, + "step": 387, + "token_acc": 0.7284884019955769 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 4.521829605102539, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7702268362045288, + "step": 388, + "token_acc": 0.7716129918286068 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 0.9622291922569275, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9329461455345154, + "step": 389, + "token_acc": 0.7276041666666667 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 1.7155946493148804, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6712834239006042, + "step": 390, + "token_acc": 0.8011521228931086 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 1.6805239915847778, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8204821348190308, + "step": 391, + "token_acc": 0.7557218065946245 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.821913719177246, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7822115421295166, + "step": 392, + "token_acc": 0.7652249806051202 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 0.9204578399658203, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.7939423322677612, + "step": 393, + "token_acc": 0.7637715229684224 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.6548840999603271, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7488706111907959, + "step": 394, + "token_acc": 0.7780097425191371 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 1.4144301414489746, + "learning_rate": 3.513103285012475e-05, + "loss": 0.8302121758460999, + "step": 395, + "token_acc": 0.7556669572798606 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 1.2530573606491089, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7473949790000916, + "step": 396, + "token_acc": 0.7778376713383643 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 1.3626383543014526, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7733973860740662, + "step": 397, + "token_acc": 0.7717758815005635 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 1.8561214208602905, + "learning_rate": 3.47933752712989e-05, + "loss": 0.717442512512207, + "step": 398, + "token_acc": 0.7897643593519882 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 1.4010168313980103, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8622786402702332, + "step": 399, + "token_acc": 0.746109355434977 + }, + { + "epoch": 1.0, + "grad_norm": 3.488276720046997, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7453683614730835, + "step": 400, + "token_acc": 0.7741160315825609 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 1.1606934070587158, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7595579028129578, + "step": 401, + "token_acc": 0.7722797596215317 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 7.119320392608643, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8560916185379028, + "step": 402, + "token_acc": 0.7451851136747598 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 2.264742612838745, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7480262517929077, + "step": 403, + "token_acc": 0.7768546688509244 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 2.638277053833008, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6516366600990295, + "step": 404, + "token_acc": 0.8008649868371568 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 10.03870964050293, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7640280723571777, + "step": 405, + "token_acc": 0.7745649948822927 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 1.4635159969329834, + "learning_rate": 3.388277253201041e-05, + "loss": 0.8078231811523438, + "step": 406, + "token_acc": 0.7627060907480583 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 1.8901174068450928, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8164265155792236, + "step": 407, + "token_acc": 0.7621255796465722 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 2.5771090984344482, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8471720218658447, + "step": 408, + "token_acc": 0.7479161404395049 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 1.9842844009399414, + "learning_rate": 3.353768924152341e-05, + "loss": 0.705992579460144, + "step": 409, + "token_acc": 0.7897742247210753 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 1.8455222845077515, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9950985908508301, + "step": 410, + "token_acc": 0.7158471618394464 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 2.81369948387146, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7523729801177979, + "step": 411, + "token_acc": 0.7738898001336493 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 0.9068171381950378, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8897726535797119, + "step": 412, + "token_acc": 0.7371789837430299 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 2.705150604248047, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6471114158630371, + "step": 413, + "token_acc": 0.8097399917457697 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 1.5322827100753784, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7631367444992065, + "step": 414, + "token_acc": 0.7776249140141329 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 0.8264560699462891, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8537945747375488, + "step": 415, + "token_acc": 0.7472068130322681 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 1.2941429615020752, + "learning_rate": 3.272542485937369e-05, + "loss": 0.8233134746551514, + "step": 416, + "token_acc": 0.7573484469633828 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 0.9657873511314392, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8734332323074341, + "step": 417, + "token_acc": 0.7438148443735035 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.698813796043396, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8446903824806213, + "step": 418, + "token_acc": 0.7472349272349272 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.7393252849578857, + "learning_rate": 3.23744632744341e-05, + "loss": 0.6763110160827637, + "step": 419, + "token_acc": 0.7926863572433193 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 1.9159985780715942, + "learning_rate": 3.225711693136156e-05, + "loss": 0.635500431060791, + "step": 420, + "token_acc": 0.8037298569617961 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 1.2441291809082031, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.828086256980896, + "step": 421, + "token_acc": 0.7563552765374243 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 2.318335771560669, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8139811754226685, + "step": 422, + "token_acc": 0.7583092707501382 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 1.2812583446502686, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6982682943344116, + "step": 423, + "token_acc": 0.7941985274549809 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 1.2541266679763794, + "learning_rate": 3.178601124662686e-05, + "loss": 0.865225613117218, + "step": 424, + "token_acc": 0.7453209807224406 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.2426998615264893, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.7594386339187622, + "step": 425, + "token_acc": 0.7677123091603053 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 3.8673322200775146, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7875864505767822, + "step": 426, + "token_acc": 0.7661815909293813 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 1.1603846549987793, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8166364431381226, + "step": 427, + "token_acc": 0.7610032474262419 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 2.748734712600708, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7897321581840515, + "step": 428, + "token_acc": 0.7664034021871203 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 4.712365627288818, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7913838624954224, + "step": 429, + "token_acc": 0.7640121816885894 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 1.5520957708358765, + "learning_rate": 3.10745044975816e-05, + "loss": 0.799659252166748, + "step": 430, + "token_acc": 0.767484623676368 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 2.1518683433532715, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8150660395622253, + "step": 431, + "token_acc": 0.762330198537095 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 1.1168107986450195, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8917897939682007, + "step": 432, + "token_acc": 0.7390166223114175 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 2.890058755874634, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8356524705886841, + "step": 433, + "token_acc": 0.7508724667850364 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 1.5636504888534546, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6680396199226379, + "step": 434, + "token_acc": 0.7951321186041821 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 1.5193849802017212, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8508872985839844, + "step": 435, + "token_acc": 0.7515897223801892 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 2.8505938053131104, + "learning_rate": 3.035772882662627e-05, + "loss": 0.7488077878952026, + "step": 436, + "token_acc": 0.7749569385156894 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 1.3607008457183838, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8307385444641113, + "step": 437, + "token_acc": 0.7534736006351727 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 0.8386856317520142, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8256966471672058, + "step": 438, + "token_acc": 0.7536278768832609 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 1.4726793766021729, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.671474039554596, + "step": 439, + "token_acc": 0.7985303617571059 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 1.5878239870071411, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.6621131300926208, + "step": 440, + "token_acc": 0.8018326039387309 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.060871958732605, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8641493320465088, + "step": 441, + "token_acc": 0.74706401151186 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 1.7958430051803589, + "learning_rate": 2.963630595278977e-05, + "loss": 0.6422966718673706, + "step": 442, + "token_acc": 0.8062888198757764 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 2.897059917449951, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.730861485004425, + "step": 443, + "token_acc": 0.7823434073791591 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 1.9405778646469116, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.863489031791687, + "step": 444, + "token_acc": 0.7414182794179969 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 1.0297330617904663, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.7957867383956909, + "step": 445, + "token_acc": 0.7574887156339762 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 1.080908179283142, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8564661145210266, + "step": 446, + "token_acc": 0.7462025024239346 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 2.1639764308929443, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7737131714820862, + "step": 447, + "token_acc": 0.7662964751327861 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 1.6361067295074463, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7582350969314575, + "step": 448, + "token_acc": 0.773669430328965 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 2.3244810104370117, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6141003370285034, + "step": 449, + "token_acc": 0.8189434489178496 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 2.4419093132019043, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6784725785255432, + "step": 450, + "token_acc": 0.7944106055177356 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 2.702949047088623, + "learning_rate": 2.854682793330633e-05, + "loss": 0.6986773014068604, + "step": 451, + "token_acc": 0.7902205177372963 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 1.953333854675293, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.7032589912414551, + "step": 452, + "token_acc": 0.7920252438324727 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 2.284067153930664, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8273622989654541, + "step": 453, + "token_acc": 0.7528546054300939 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 1.595000147819519, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9244086742401123, + "step": 454, + "token_acc": 0.7275905912269549 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 1.6957809925079346, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.6975402235984802, + "step": 455, + "token_acc": 0.7869734644646502 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 2.092339038848877, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7530581951141357, + "step": 456, + "token_acc": 0.7761567319716548 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 1.3622016906738281, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.787225604057312, + "step": 457, + "token_acc": 0.7615973644377171 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 1.3467158079147339, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7957576513290405, + "step": 458, + "token_acc": 0.7672947418542956 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 1.4943625926971436, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8363101482391357, + "step": 459, + "token_acc": 0.7491413533163834 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 1.0831845998764038, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8885717988014221, + "step": 460, + "token_acc": 0.7409447431039041 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.542517900466919, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8255709409713745, + "step": 461, + "token_acc": 0.7530204962243797 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 1.334511637687683, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8665659427642822, + "step": 462, + "token_acc": 0.7449273920827532 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 1.208848237991333, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.8557275533676147, + "step": 463, + "token_acc": 0.7444496016090354 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 2.0628461837768555, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9177385568618774, + "step": 464, + "token_acc": 0.7293287497738375 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 2.4950785636901855, + "learning_rate": 2.683911408999169e-05, + "loss": 0.723082959651947, + "step": 465, + "token_acc": 0.7769183168316832 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 2.308980941772461, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6471742987632751, + "step": 466, + "token_acc": 0.8040623523854511 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 1.521958827972412, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5249975323677063, + "step": 467, + "token_acc": 0.8463351666853743 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 3.039774179458618, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7578822374343872, + "step": 468, + "token_acc": 0.7744256850262939 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 1.9503605365753174, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7234141826629639, + "step": 469, + "token_acc": 0.7862872211844852 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 1.0008007287979126, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8409122228622437, + "step": 470, + "token_acc": 0.7482727545809552 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 1.5808378458023071, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.724835991859436, + "step": 471, + "token_acc": 0.7787719171657407 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 1.2275604009628296, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8796378970146179, + "step": 472, + "token_acc": 0.7436432934788284 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 5.61031436920166, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7971165180206299, + "step": 473, + "token_acc": 0.7616080156402737 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.6030521392822266, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.836396336555481, + "step": 474, + "token_acc": 0.7549324367188986 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 1.1238839626312256, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8152873516082764, + "step": 475, + "token_acc": 0.7558295833089825 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 2.533327102661133, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6784950494766235, + "step": 476, + "token_acc": 0.7988939165409754 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 2.931954860687256, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7702056169509888, + "step": 477, + "token_acc": 0.7747391716724629 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 1.1211943626403809, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9144121408462524, + "step": 478, + "token_acc": 0.7323793949304988 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 1.1485220193862915, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8556366562843323, + "step": 479, + "token_acc": 0.7465940054495913 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 1.1166046857833862, + "learning_rate": 2.5e-05, + "loss": 0.7300997972488403, + "step": 480, + "token_acc": 0.7833213400495722 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 1.2781999111175537, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7646458745002747, + "step": 481, + "token_acc": 0.7700712005892463 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 0.9656017422676086, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.8519848585128784, + "step": 482, + "token_acc": 0.746612222920219 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 2.7804577350616455, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.749862790107727, + "step": 483, + "token_acc": 0.7760351317440402 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 2.4027388095855713, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8318485021591187, + "step": 484, + "token_acc": 0.7504805638615976 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 3.0088815689086914, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8486036062240601, + "step": 485, + "token_acc": 0.7461552976695914 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 1.2995445728302002, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9670998454093933, + "step": 486, + "token_acc": 0.7201265687773314 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.1181038618087769, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8590025305747986, + "step": 487, + "token_acc": 0.747782901738205 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 2.26283597946167, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7187557220458984, + "step": 488, + "token_acc": 0.7850413930916358 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 1.03593909740448, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8461419939994812, + "step": 489, + "token_acc": 0.7481977342945417 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 2.398747444152832, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.698701024055481, + "step": 490, + "token_acc": 0.7867596299875742 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 1.4672415256500244, + "learning_rate": 2.365075276976245e-05, + "loss": 0.9008340239524841, + "step": 491, + "token_acc": 0.7327416173570019 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 3.996742010116577, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6810827255249023, + "step": 492, + "token_acc": 0.7924176507147297 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 1.1854064464569092, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.7924419045448303, + "step": 493, + "token_acc": 0.7695827357781875 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 1.384638786315918, + "learning_rate": 2.328329352789066e-05, + "loss": 0.7272655367851257, + "step": 494, + "token_acc": 0.7785135218763537 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 1.6975595951080322, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8528483510017395, + "step": 495, + "token_acc": 0.7481278895617633 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.2870354652404785, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8342181444168091, + "step": 496, + "token_acc": 0.7528511514973144 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 1.530961036682129, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6387697458267212, + "step": 497, + "token_acc": 0.8062214611872146 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 1.8430241346359253, + "learning_rate": 2.279394073699077e-05, + "loss": 0.7026108503341675, + "step": 498, + "token_acc": 0.785983362109559 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.2643704414367676, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7243825197219849, + "step": 499, + "token_acc": 0.7818732643271901 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 2.194952964782715, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5638291835784912, + "step": 500, + "token_acc": 0.8303964757709251 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 1.3642157316207886, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6388370394706726, + "step": 501, + "token_acc": 0.8047690014903129 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 1.4096916913986206, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8699530363082886, + "step": 502, + "token_acc": 0.7426746977039084 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.6735522150993347, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.9338130950927734, + "step": 503, + "token_acc": 0.7246069109818764 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 3.0893852710723877, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6764394044876099, + "step": 504, + "token_acc": 0.7987681647579636 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 1.2103800773620605, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7435534596443176, + "step": 505, + "token_acc": 0.7749155088246339 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 1.6574653387069702, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6575552225112915, + "step": 506, + "token_acc": 0.7954854039375424 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 3.2512946128845215, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6957029104232788, + "step": 507, + "token_acc": 0.790222367560497 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 1.6446380615234375, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8102457523345947, + "step": 508, + "token_acc": 0.7554084174642717 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 2.266608715057373, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7922036051750183, + "step": 509, + "token_acc": 0.7567540772319437 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 1.3823511600494385, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8182840943336487, + "step": 510, + "token_acc": 0.7597468183960676 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 2.875134229660034, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.758751392364502, + "step": 511, + "token_acc": 0.7762652146060218 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 0.9661290049552917, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8285502791404724, + "step": 512, + "token_acc": 0.7517256372628948 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 0.8895630240440369, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.8042497038841248, + "step": 513, + "token_acc": 0.7564245365581987 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 1.1554466485977173, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7614545226097107, + "step": 514, + "token_acc": 0.7749671279193538 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 2.6851818561553955, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.852085530757904, + "step": 515, + "token_acc": 0.7448673497214539 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.071006178855896, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7973021268844604, + "step": 516, + "token_acc": 0.7651457615236315 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 1.7251087427139282, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8796536326408386, + "step": 517, + "token_acc": 0.7393803896518684 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 0.8552775979042053, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7860521078109741, + "step": 518, + "token_acc": 0.7619782361539711 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 1.719724178314209, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8427704572677612, + "step": 519, + "token_acc": 0.7528826254065241 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 0.9758151173591614, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.8721702098846436, + "step": 520, + "token_acc": 0.7431514121894245 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 1.168480396270752, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8419342637062073, + "step": 521, + "token_acc": 0.7471320023837902 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 1.2203398942947388, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7959424257278442, + "step": 522, + "token_acc": 0.7663697898111863 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 1.0408990383148193, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7919071912765503, + "step": 523, + "token_acc": 0.7651286474054909 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 1.310434103012085, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8253304958343506, + "step": 524, + "token_acc": 0.75065126566724 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 1.0451242923736572, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7233434915542603, + "step": 525, + "token_acc": 0.7851820128479657 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 2.0899829864501953, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8267189264297485, + "step": 526, + "token_acc": 0.7562781712813909 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.255731225013733, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8266547322273254, + "step": 527, + "token_acc": 0.7522840531561462 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 1.7167625427246094, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.8521392941474915, + "step": 528, + "token_acc": 0.7510395283962313 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 1.0622138977050781, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8637402653694153, + "step": 529, + "token_acc": 0.7384504331087585 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 0.9813028573989868, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8480241894721985, + "step": 530, + "token_acc": 0.7536379362979546 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 4.28452730178833, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6397439241409302, + "step": 531, + "token_acc": 0.803735568791823 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 1.437615990638733, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9618914127349854, + "step": 532, + "token_acc": 0.7202291690698658 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 1.5095962285995483, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.7862619161605835, + "step": 533, + "token_acc": 0.7709383172800919 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 1.4545536041259766, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.877753496170044, + "step": 534, + "token_acc": 0.7414333585558318 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 3.5752525329589844, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.754334568977356, + "step": 535, + "token_acc": 0.7730709984595995 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 0.9353688955307007, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8347004055976868, + "step": 536, + "token_acc": 0.7475584067407124 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 4.231163501739502, + "learning_rate": 1.809595995707573e-05, + "loss": 0.8207680583000183, + "step": 537, + "token_acc": 0.7532355478861087 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 6.469966411590576, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7109387516975403, + "step": 538, + "token_acc": 0.7860278826157283 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 3.1630420684814453, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6461949348449707, + "step": 539, + "token_acc": 0.8017308524448291 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 1.0982550382614136, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8327257633209229, + "step": 540, + "token_acc": 0.7495007244390492 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 3.802609443664551, + "learning_rate": 1.762553672556591e-05, + "loss": 0.8171138763427734, + "step": 541, + "token_acc": 0.7566524822695035 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.0654925107955933, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7269375324249268, + "step": 542, + "token_acc": 0.7761418269230769 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 4.295766353607178, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.6608070731163025, + "step": 543, + "token_acc": 0.800157433828594 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 8.248258590698242, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7909623980522156, + "step": 544, + "token_acc": 0.7613503425992981 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.1179834604263306, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7602176666259766, + "step": 545, + "token_acc": 0.7709024552090246 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 2.3431406021118164, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6769133806228638, + "step": 546, + "token_acc": 0.7952830188679245 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 4.3784613609313965, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8144751787185669, + "step": 547, + "token_acc": 0.7544433094994892 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 1.7156646251678467, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8162662386894226, + "step": 548, + "token_acc": 0.7523768777334094 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 1.510075330734253, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7336026430130005, + "step": 549, + "token_acc": 0.7803434417245159 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 1.9461703300476074, + "learning_rate": 1.65777536651945e-05, + "loss": 0.7254256010055542, + "step": 550, + "token_acc": 0.7800743813474467 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 1.164979338645935, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.805265486240387, + "step": 551, + "token_acc": 0.7578671900556101 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 1.0273913145065308, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8320894241333008, + "step": 552, + "token_acc": 0.7525619764425735 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.8113181591033936, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.7513222694396973, + "step": 553, + "token_acc": 0.7729531069216634 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 2.532973527908325, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.706010103225708, + "step": 554, + "token_acc": 0.7890974084003575 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.9803953170776367, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.8844308257102966, + "step": 555, + "token_acc": 0.7387483137799943 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 3.6705994606018066, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7106630206108093, + "step": 556, + "token_acc": 0.7811320754716982 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 4.300747394561768, + "learning_rate": 1.577407047339834e-05, + "loss": 0.8109298944473267, + "step": 557, + "token_acc": 0.7626044755998922 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 1.2714130878448486, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6885141134262085, + "step": 558, + "token_acc": 0.7883173946756268 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 1.7359731197357178, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8751633167266846, + "step": 559, + "token_acc": 0.740814826910516 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 1.4216480255126953, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.820943295955658, + "step": 560, + "token_acc": 0.7575292646891693 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 4.9061760902404785, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.748153567314148, + "step": 561, + "token_acc": 0.7805115166018546 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 1.267930030822754, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.7889722585678101, + "step": 562, + "token_acc": 0.7689055058530289 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 0.9083903431892395, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8080474138259888, + "step": 563, + "token_acc": 0.7599738658173057 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 0.7936918139457703, + "learning_rate": 1.498127917242148e-05, + "loss": 0.9597259759902954, + "step": 564, + "token_acc": 0.720810821167184 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 2.1689324378967285, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7804182767868042, + "step": 565, + "token_acc": 0.7724068479355488 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 2.234748601913452, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8393502831459045, + "step": 566, + "token_acc": 0.7503378646951268 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 1.605635404586792, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7155381441116333, + "step": 567, + "token_acc": 0.7872617578499932 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 1.4522089958190918, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.7572216987609863, + "step": 568, + "token_acc": 0.7713926653718725 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 1.9692518711090088, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.8563569784164429, + "step": 569, + "token_acc": 0.7470536883457005 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 10.908825874328613, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7974921464920044, + "step": 570, + "token_acc": 0.7605943594506085 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 1.1746379137039185, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7666845321655273, + "step": 571, + "token_acc": 0.7709790209790209 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 1.0229063034057617, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7350344061851501, + "step": 572, + "token_acc": 0.7786911497811466 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 0.9891268610954285, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6754674315452576, + "step": 573, + "token_acc": 0.7943711387384639 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.231886386871338, + "learning_rate": 1.38694668528633e-05, + "loss": 0.8030673265457153, + "step": 574, + "token_acc": 0.7635471587580551 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 1.0724684000015259, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8548064827919006, + "step": 575, + "token_acc": 0.7461031175059952 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 1.5738338232040405, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.8126094341278076, + "step": 576, + "token_acc": 0.7611274150158963 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 1.4901602268218994, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8209086656570435, + "step": 577, + "token_acc": 0.7550751384128658 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 1.6848169565200806, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6577416658401489, + "step": 578, + "token_acc": 0.8033895475037569 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 3.016223907470703, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.6531224846839905, + "step": 579, + "token_acc": 0.8058121432278152 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.9795825481414795, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7647002339363098, + "step": 580, + "token_acc": 0.7752119263373283 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 2.140911817550659, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7398731708526611, + "step": 581, + "token_acc": 0.7717614002224433 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 1.2959418296813965, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.9219870567321777, + "step": 582, + "token_acc": 0.735004404580764 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 3.881425619125366, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6551182866096497, + "step": 583, + "token_acc": 0.800154768814084 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 0.6841437220573425, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8579003214836121, + "step": 584, + "token_acc": 0.7427914321021557 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 2.339364528656006, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7305861711502075, + "step": 585, + "token_acc": 0.7815454841865015 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 1.287462592124939, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7356473207473755, + "step": 586, + "token_acc": 0.7739403453689168 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 1.0997488498687744, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8273265361785889, + "step": 587, + "token_acc": 0.7510488803518173 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 2.9153354167938232, + "learning_rate": 1.235856566555039e-05, + "loss": 0.6755957007408142, + "step": 588, + "token_acc": 0.7906052393857272 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.6633471250534058, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.730632483959198, + "step": 589, + "token_acc": 0.7806400809944316 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 2.127331495285034, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.6703206300735474, + "step": 590, + "token_acc": 0.7975905830421188 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 1.4636554718017578, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.7496579885482788, + "step": 591, + "token_acc": 0.7742579196807183 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 2.0527307987213135, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.6405739188194275, + "step": 592, + "token_acc": 0.80549558390579 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.2344170808792114, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7799682021141052, + "step": 593, + "token_acc": 0.7664561072082178 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 5.459070205688477, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8071370124816895, + "step": 594, + "token_acc": 0.7617416829745597 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.069473147392273, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7295643091201782, + "step": 595, + "token_acc": 0.776476912968162 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 3.8844616413116455, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6706807017326355, + "step": 596, + "token_acc": 0.7991722152240418 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 5.004199028015137, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8247233033180237, + "step": 597, + "token_acc": 0.7518777783455112 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 3.0730934143066406, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8894381523132324, + "step": 598, + "token_acc": 0.7409200968523002 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 1.2874910831451416, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.71524977684021, + "step": 599, + "token_acc": 0.7803266787658802 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 1.2464348077774048, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7700718641281128, + "step": 600, + "token_acc": 0.7670187496841361 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 3.6714982986450195, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7547957897186279, + "step": 601, + "token_acc": 0.7734226755218216 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 0.8484803438186646, + "learning_rate": 1.090734344462458e-05, + "loss": 0.8919792175292969, + "step": 602, + "token_acc": 0.7393400901906505 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 13.488743782043457, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.7702862620353699, + "step": 603, + "token_acc": 0.7727465986394558 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 1.961902141571045, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.7595404386520386, + "step": 604, + "token_acc": 0.7702451257988836 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 27.53681755065918, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.6995214223861694, + "step": 605, + "token_acc": 0.787663379958725 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 0.8332082629203796, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.9005197286605835, + "step": 606, + "token_acc": 0.737596511295396 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 0.8233015537261963, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.8386024832725525, + "step": 607, + "token_acc": 0.7470095378616219 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 1.1943548917770386, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.7929884791374207, + "step": 608, + "token_acc": 0.7622805984214867 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 0.8096246719360352, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.80124831199646, + "step": 609, + "token_acc": 0.7553728275088768 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 1.0610454082489014, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.6171380281448364, + "step": 610, + "token_acc": 0.8159301496792587 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 18.28238296508789, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.650100588798523, + "step": 611, + "token_acc": 0.7978654890054283 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 3.4466676712036133, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7620124220848083, + "step": 612, + "token_acc": 0.7711020108795306 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 1.2529813051223755, + "learning_rate": 9.813437667457229e-06, + "loss": 0.6602888703346252, + "step": 613, + "token_acc": 0.8008800880088008 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 1.17232346534729, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8434534072875977, + "step": 614, + "token_acc": 0.7494439855118511 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 1.747151494026184, + "learning_rate": 9.619210235484333e-06, + "loss": 0.7442387938499451, + "step": 615, + "token_acc": 0.7745351402458241 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 1.0021146535873413, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7317293882369995, + "step": 616, + "token_acc": 0.7734412184673964 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.3337068557739258, + "learning_rate": 9.426465236041651e-06, + "loss": 0.7032402753829956, + "step": 617, + "token_acc": 0.7877114998566103 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 1.3676468133926392, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7973721027374268, + "step": 618, + "token_acc": 0.760376150854217 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 3.2059834003448486, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8150185346603394, + "step": 619, + "token_acc": 0.7556632064590542 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 4.086306571960449, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7822086811065674, + "step": 620, + "token_acc": 0.7675454095695808 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.2040249109268188, + "learning_rate": 9.04549669873337e-06, + "loss": 0.8220715522766113, + "step": 621, + "token_acc": 0.7524804177545692 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 1.4175060987472534, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6137598752975464, + "step": 622, + "token_acc": 0.8119511672735061 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 1.2992089986801147, + "learning_rate": 8.857309879408324e-06, + "loss": 0.6729296445846558, + "step": 623, + "token_acc": 0.7988444254226407 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 1.4079190492630005, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8189102411270142, + "step": 624, + "token_acc": 0.7577023215448037 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 1.279236078262329, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8362364172935486, + "step": 625, + "token_acc": 0.7482024803358587 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 1.2863163948059082, + "learning_rate": 8.577952526423969e-06, + "loss": 0.8098462820053101, + "step": 626, + "token_acc": 0.7593269058027426 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 27.66785430908203, + "learning_rate": 8.48562182685487e-06, + "loss": 0.7063795328140259, + "step": 627, + "token_acc": 0.7867946863080363 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 4.928782939910889, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6462287902832031, + "step": 628, + "token_acc": 0.8011155656266341 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 1.9602354764938354, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6783524751663208, + "step": 629, + "token_acc": 0.7902308752584425 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 16.4473876953125, + "learning_rate": 8.211026128824539e-06, + "loss": 0.804925799369812, + "step": 630, + "token_acc": 0.7570687117514912 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 1.3788988590240479, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8883236646652222, + "step": 631, + "token_acc": 0.7334713259466699 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 1.8335654735565186, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6375362873077393, + "step": 632, + "token_acc": 0.8153648894112618 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 1.9014967679977417, + "learning_rate": 7.940071245792579e-06, + "loss": 0.6049902439117432, + "step": 633, + "token_acc": 0.8161649828142902 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 1.3713113069534302, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6988447904586792, + "step": 634, + "token_acc": 0.7880343393220639 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 2.0989935398101807, + "learning_rate": 7.761486381573327e-06, + "loss": 0.7015566229820251, + "step": 635, + "token_acc": 0.7867938866841172 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 2.8194093704223633, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7713178992271423, + "step": 636, + "token_acc": 0.7664939550949914 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 2.2756409645080566, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8152978420257568, + "step": 637, + "token_acc": 0.7565742546007894 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 2.1602797508239746, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.6049292087554932, + "step": 638, + "token_acc": 0.8249440056583756 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 11.161283493041992, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9276903867721558, + "step": 639, + "token_acc": 0.7289690681738996 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 1.107016921043396, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.7289862632751465, + "step": 640, + "token_acc": 0.7762255053470978 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 1.384218692779541, + "learning_rate": 7.235768739040258e-06, + "loss": 0.8030155897140503, + "step": 641, + "token_acc": 0.7603261596043309 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 2.4319992065429688, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8239895105361938, + "step": 642, + "token_acc": 0.7537327021121631 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 1.7713115215301514, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9458705186843872, + "step": 643, + "token_acc": 0.7223184753504489 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 1.1825437545776367, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.8767014145851135, + "step": 644, + "token_acc": 0.7381348433905504 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 9.377113342285156, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7727670669555664, + "step": 645, + "token_acc": 0.7667001312842691 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 1.6212266683578491, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7251728177070618, + "step": 646, + "token_acc": 0.7853043560071502 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 1.0910215377807617, + "learning_rate": 6.725459488639211e-06, + "loss": 0.8785561919212341, + "step": 647, + "token_acc": 0.7388308513002889 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 2.236516237258911, + "learning_rate": 6.641937264107867e-06, + "loss": 0.7488150596618652, + "step": 648, + "token_acc": 0.7735017626321974 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 2.128631114959717, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6163979768753052, + "step": 649, + "token_acc": 0.810862691960253 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 1.3468025922775269, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8207809329032898, + "step": 650, + "token_acc": 0.7570913888466028 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 3.4600303173065186, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8186502456665039, + "step": 651, + "token_acc": 0.7548624496232696 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 3.5918667316436768, + "learning_rate": 6.312291828435077e-06, + "loss": 0.6305141448974609, + "step": 652, + "token_acc": 0.8072335886744885 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 1.0806105136871338, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7253304719924927, + "step": 653, + "token_acc": 0.7833950441469667 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 1.2885851860046387, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8548451066017151, + "step": 654, + "token_acc": 0.7464474922018122 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 1.0645694732666016, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8382260799407959, + "step": 655, + "token_acc": 0.7489557422443328 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 1.9353832006454468, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7723536491394043, + "step": 656, + "token_acc": 0.7694327731092437 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 4.828452110290527, + "learning_rate": 5.910380944855087e-06, + "loss": 0.8856979608535767, + "step": 657, + "token_acc": 0.738218359188763 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 1.8781278133392334, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.7738165259361267, + "step": 658, + "token_acc": 0.768805515870551 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 3.0246331691741943, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8133803606033325, + "step": 659, + "token_acc": 0.7611378205128205 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 1.3994319438934326, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7647578120231628, + "step": 660, + "token_acc": 0.7703229113275244 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 2.361185312271118, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7304031252861023, + "step": 661, + "token_acc": 0.7841618588477041 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 0.8526070713996887, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7237846255302429, + "step": 662, + "token_acc": 0.7868933969769292 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 1.588171362876892, + "learning_rate": 5.443287214979592e-06, + "loss": 0.6091185212135315, + "step": 663, + "token_acc": 0.8140839427025944 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 5.0973029136657715, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6413316130638123, + "step": 664, + "token_acc": 0.804970235283001 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 1.4185309410095215, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6981616020202637, + "step": 665, + "token_acc": 0.7925278219395866 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.9851809740066528, + "learning_rate": 5.216076783983493e-06, + "loss": 0.690722644329071, + "step": 666, + "token_acc": 0.7912854528819762 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 0.9478880763053894, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8563956022262573, + "step": 667, + "token_acc": 0.7468872958551178 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 3.0436248779296875, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8058983683586121, + "step": 668, + "token_acc": 0.7552821610056165 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 0.8428975939750671, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8022825717926025, + "step": 669, + "token_acc": 0.7613861386138614 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 4.840924263000488, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8100841641426086, + "step": 670, + "token_acc": 0.7554166666666666 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 1.1505413055419922, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8260376453399658, + "step": 671, + "token_acc": 0.7448619472700851 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 0.9072193503379822, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8600703477859497, + "step": 672, + "token_acc": 0.7444852298549205 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 1.7683610916137695, + "learning_rate": 4.702687000087386e-06, + "loss": 0.692681610584259, + "step": 673, + "token_acc": 0.7806238492364346 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 1.461195468902588, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7662481069564819, + "step": 674, + "token_acc": 0.7671449553722743 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 3.3718554973602295, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7405479550361633, + "step": 675, + "token_acc": 0.7750420168067227 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 2.9479410648345947, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8610312938690186, + "step": 676, + "token_acc": 0.7424875170222424 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 13.503181457519531, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7888531684875488, + "step": 677, + "token_acc": 0.765451076009753 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 0.7887119054794312, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7960864305496216, + "step": 678, + "token_acc": 0.7637773578963942 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 0.7959216237068176, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.8545209169387817, + "step": 679, + "token_acc": 0.7468409007993101 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 2.6820693016052246, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7095437049865723, + "step": 680, + "token_acc": 0.7877780240892632 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 1.3040446043014526, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7295015454292297, + "step": 681, + "token_acc": 0.7838582677165354 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.168471336364746, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7117878794670105, + "step": 682, + "token_acc": 0.7835704178148507 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 4.244610786437988, + "learning_rate": 4.010984790046615e-06, + "loss": 0.677824079990387, + "step": 683, + "token_acc": 0.7980658751436231 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 2.731039047241211, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8463807702064514, + "step": 684, + "token_acc": 0.7515052317764658 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 1.8785216808319092, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6157097816467285, + "step": 685, + "token_acc": 0.8154915079773546 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 0.865153431892395, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8836787939071655, + "step": 686, + "token_acc": 0.7380481451107145 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 0.8936150074005127, + "learning_rate": 3.748372666094277e-06, + "loss": 0.8360207676887512, + "step": 687, + "token_acc": 0.7508485460049537 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 2.322671890258789, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7108975052833557, + "step": 688, + "token_acc": 0.7858799072519389 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 3.3480117321014404, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.6993001699447632, + "step": 689, + "token_acc": 0.7873237489632292 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.8085229396820068, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7427332997322083, + "step": 690, + "token_acc": 0.7776805599745467 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 1.3708637952804565, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6952468752861023, + "step": 691, + "token_acc": 0.794788931528984 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 3.7617907524108887, + "learning_rate": 3.431640350555204e-06, + "loss": 0.6230769157409668, + "step": 692, + "token_acc": 0.8099717779868297 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 1.36726713180542, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6950256824493408, + "step": 693, + "token_acc": 0.7924514890894875 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 0.9996148943901062, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8100589513778687, + "step": 694, + "token_acc": 0.7537666602279313 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.661024570465088, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7753657102584839, + "step": 695, + "token_acc": 0.7681395005172159 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 2.1857688426971436, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7994472980499268, + "step": 696, + "token_acc": 0.759318423855165 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 3.475571870803833, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.7001972198486328, + "step": 697, + "token_acc": 0.7877510538060997 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.2787102460861206, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8403792977333069, + "step": 698, + "token_acc": 0.747796232717825 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 4.386336326599121, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8107684850692749, + "step": 699, + "token_acc": 0.7630341042728341 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 2.2676963806152344, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8950088024139404, + "step": 700, + "token_acc": 0.7388262048456223 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 1.0399364233016968, + "learning_rate": 2.894385171586095e-06, + "loss": 0.8310389518737793, + "step": 701, + "token_acc": 0.7524891179266523 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.593347191810608, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8382736444473267, + "step": 702, + "token_acc": 0.7514249790444258 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 1.2109148502349854, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6921058893203735, + "step": 703, + "token_acc": 0.787412490469259 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 0.9180388450622559, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8293173313140869, + "step": 704, + "token_acc": 0.757765414928141 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.0169309377670288, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7837424278259277, + "step": 705, + "token_acc": 0.7702204734245206 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 2.0241503715515137, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7397447824478149, + "step": 706, + "token_acc": 0.782954903815831 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 3.890124559402466, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7422389984130859, + "step": 707, + "token_acc": 0.7778991727797722 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.0221773386001587, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8820300698280334, + "step": 708, + "token_acc": 0.7368034292712798 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 1.0830367803573608, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8977921009063721, + "step": 709, + "token_acc": 0.7326030349286163 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 1.0371887683868408, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.7248738408088684, + "step": 710, + "token_acc": 0.7812835915270313 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 1.263805866241455, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7425920963287354, + "step": 711, + "token_acc": 0.7737332204619664 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 14.53322696685791, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8866590261459351, + "step": 712, + "token_acc": 0.7439101885193815 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 1.5575921535491943, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.7303316593170166, + "step": 713, + "token_acc": 0.7762118300234893 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 1.711562156677246, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9044393301010132, + "step": 714, + "token_acc": 0.729759955266206 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 1.9925239086151123, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7561551928520203, + "step": 715, + "token_acc": 0.775 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 1.4626455307006836, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7318213582038879, + "step": 716, + "token_acc": 0.7775335492827394 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 1.060317039489746, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.8696292638778687, + "step": 717, + "token_acc": 0.7421656220829443 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 0.9130681157112122, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7886737585067749, + "step": 718, + "token_acc": 0.7600247142415817 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.1878103017807007, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.762123703956604, + "step": 719, + "token_acc": 0.7682668745823124 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 1.7159684896469116, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.615555465221405, + "step": 720, + "token_acc": 0.8126673532440782 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 1.6527683734893799, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6307755708694458, + "step": 721, + "token_acc": 0.8067388444804209 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 3.193925619125366, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8727781176567078, + "step": 722, + "token_acc": 0.7392866177586643 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 0.9598880410194397, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.8311202526092529, + "step": 723, + "token_acc": 0.7487229203176852 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 2.1851632595062256, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7448897957801819, + "step": 724, + "token_acc": 0.7755723861756768 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 1.598838448524475, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7494593858718872, + "step": 725, + "token_acc": 0.7767838568753901 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 2.4717111587524414, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7850619554519653, + "step": 726, + "token_acc": 0.7650719167601755 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.356717586517334, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7940848469734192, + "step": 727, + "token_acc": 0.768211150514505 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 10.029845237731934, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7329187393188477, + "step": 728, + "token_acc": 0.7865592568401191 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 0.8495982885360718, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.8017995953559875, + "step": 729, + "token_acc": 0.7568345323741007 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 1.0362679958343506, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.7437936663627625, + "step": 730, + "token_acc": 0.7828212859587645 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 0.9663056135177612, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8609859943389893, + "step": 731, + "token_acc": 0.7439180537772087 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 1.3956825733184814, + "learning_rate": 1.379848838328049e-06, + "loss": 0.7277930378913879, + "step": 732, + "token_acc": 0.7791022255752547 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 3.7636775970458984, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7486779093742371, + "step": 733, + "token_acc": 0.7818169417541945 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 1.315354347229004, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8382982611656189, + "step": 734, + "token_acc": 0.7525453258561551 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.1111931800842285, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8941514492034912, + "step": 735, + "token_acc": 0.7349274757866444 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 1.297447919845581, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8244005441665649, + "step": 736, + "token_acc": 0.7516801237731471 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.0711147785186768, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6347471475601196, + "step": 737, + "token_acc": 0.8084218512898331 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 1.7543067932128906, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.7033067941665649, + "step": 738, + "token_acc": 0.7927236056163215 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 1.6257784366607666, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7322490215301514, + "step": 739, + "token_acc": 0.776595744680851 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 1.1702452898025513, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.748277485370636, + "step": 740, + "token_acc": 0.7742450209798475 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 1.2065194845199585, + "learning_rate": 1.041156686749717e-06, + "loss": 0.814299464225769, + "step": 741, + "token_acc": 0.7569658605204783 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.3025304079055786, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.723736047744751, + "step": 742, + "token_acc": 0.7832843667852173 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 1.5178861618041992, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8111813068389893, + "step": 743, + "token_acc": 0.7574536219081273 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 1.1835012435913086, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6973958015441895, + "step": 744, + "token_acc": 0.7883607669070958 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 1.0553349256515503, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8839579224586487, + "step": 745, + "token_acc": 0.7393556055524897 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 2.3524389266967773, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7688311338424683, + "step": 746, + "token_acc": 0.770196330865787 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 2.358461380004883, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7249113321304321, + "step": 747, + "token_acc": 0.7800233725166701 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 0.9818371534347534, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8962013721466064, + "step": 748, + "token_acc": 0.7347520288548242 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 1.4014264345169067, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8181411027908325, + "step": 749, + "token_acc": 0.7530269496159354 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 2.099468469619751, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7440256476402283, + "step": 750, + "token_acc": 0.7781477466315626 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 1.3900328874588013, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7947307229042053, + "step": 751, + "token_acc": 0.763049013367282 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 1.937106966972351, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6677680611610413, + "step": 752, + "token_acc": 0.7976190476190477 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 2.1338562965393066, + "learning_rate": 6.623969226072363e-07, + "loss": 0.912758469581604, + "step": 753, + "token_acc": 0.7364955399869837 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 1.8719439506530762, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8942464590072632, + "step": 754, + "token_acc": 0.7314372211599746 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.125182032585144, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7492611408233643, + "step": 755, + "token_acc": 0.7720939624419465 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 5.945156097412109, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7720708847045898, + "step": 756, + "token_acc": 0.7700412614205717 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 1.3858574628829956, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7861109972000122, + "step": 757, + "token_acc": 0.7625415642619633 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 3.03468656539917, + "learning_rate": 5.294312162731934e-07, + "loss": 0.7062956094741821, + "step": 758, + "token_acc": 0.7871165644171779 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 1.1258817911148071, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7970366477966309, + "step": 759, + "token_acc": 0.7655379339905701 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 1.3906890153884888, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7870966196060181, + "step": 760, + "token_acc": 0.7596698397397277 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 1.0741008520126343, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.7451232671737671, + "step": 761, + "token_acc": 0.7724817286304417 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 1.251846194267273, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7417510151863098, + "step": 762, + "token_acc": 0.773992627431041 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 2.0354645252227783, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.738898515701294, + "step": 763, + "token_acc": 0.7741708247725272 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 3.412504196166992, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.635358452796936, + "step": 764, + "token_acc": 0.8070014872440224 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 2.2815067768096924, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7735419273376465, + "step": 765, + "token_acc": 0.7652030509173366 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 2.218057870864868, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7568934559822083, + "step": 766, + "token_acc": 0.7767891934017405 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 1.2979291677474976, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8270889520645142, + "step": 767, + "token_acc": 0.7507336930796176 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 1.37172269821167, + "learning_rate": 3.077914851215585e-07, + "loss": 0.7350165247917175, + "step": 768, + "token_acc": 0.7841965471447543 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 5.036166667938232, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.8009260892868042, + "step": 769, + "token_acc": 0.7600553949903661 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 7.4999775886535645, + "learning_rate": 2.705872508804747e-07, + "loss": 0.6270233392715454, + "step": 770, + "token_acc": 0.8136564762670957 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 1.1216583251953125, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8184903860092163, + "step": 771, + "token_acc": 0.7551860202931229 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 3.301800489425659, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6371257305145264, + "step": 772, + "token_acc": 0.8157470801449859 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 3.2778139114379883, + "learning_rate": 2.192509677903687e-07, + "loss": 0.8046694993972778, + "step": 773, + "token_acc": 0.7623718671832851 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 1.263893485069275, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.84852534532547, + "step": 774, + "token_acc": 0.74725317090096 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 0.9263530969619751, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.7684552073478699, + "step": 775, + "token_acc": 0.7751570594070318 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 1.1419495344161987, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7462726831436157, + "step": 776, + "token_acc": 0.7782109441451659 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 3.4947397708892822, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.7795302271842957, + "step": 777, + "token_acc": 0.7635372501514234 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 2.087082862854004, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6606072783470154, + "step": 778, + "token_acc": 0.801208930486497 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 1.6553760766983032, + "learning_rate": 1.327100431795125e-07, + "loss": 0.7052230834960938, + "step": 779, + "token_acc": 0.7852637614678899 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 1.1143925189971924, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.8552008867263794, + "step": 780, + "token_acc": 0.7460056792911149 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.807852003065856e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..0bfcdf27206e894a799c26b9eb6965d540f808ed --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:49bbae92e24511cb6a61f553f51f6da390fae05a846251b575d4676e27bb1834 +size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-780/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..cd3083a2f9ca37f7fc284335aadba7cc853e4df3 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(k_proj|down_proj|v_proj|gate_proj|o_proj|up_proj|q_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|mlp.2|gate_proj|up_proj|qkv|attn.proj|mlp.0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f24359b1a8f7a86342b7b6087f96a0b6b8a18a84 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0122dd8138cc754541e615f868f0aca5ab2c9d52d9eab4f1910870de4e70d7fc +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/args.json new file mode 100644 index 0000000000000000000000000000000000000000..9b753b9c8e377ab5e62ab9a96bbb206e688a8b12 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..460ef7fdaf806d61f25fcf6007ec5d36b7072fd1 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3ec33cc33208e5607ba536ccbf2ef0aaf308ba164a85170595c5ed3480d5320f +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..9486e8de80f17d431f856c69439070ffdcd38a0f --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:96363245e980ebb7ade52839e3ba86d916cbda423e029391232a746b0772a0d9 +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..d501cf23132be6b25aa5f6265ff95ac9a6ffcabe --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:66344533912c3d9130bbe7189f43653c6b88fbb55d9dec7b1accb83d36c006a7 +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..f4fff9f84019cae1b1d6a4ebc4b06e5fd0fb1bbe --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:34276d5efc64baf4a8527602e33af10d19bf25251253c2efb6253741f9113c6b +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a5e450433ed24e34c92da0e2c4c3410bd556f6f5 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c69f77dcb52b577eb4a280c993f3f8d99629d68b10bd8b33c3a709243cd7868a +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..0fcae1a049968d02645cf35a2c568734e291fbf9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1b9a4b997dd202c3e44ed73117f7a191dfa59ad7f23d565f3be680251e23ba52 +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..7d23c2186679512a0104d2f448ab65ab464c17b7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bb35c05c3b78cfcb8b86e0c86572cb8515cd4ea7bc189c65b50d203b5fd73e40 +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..841dd8a8e78627b93c6abf159a5860d89199d4b0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aa9afe98725df4da47d403d045c9d6ab5985ba165fb0f3f34833bf0a62361364 +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..5863776df9be42f1dd67b8448dffa6da56b29678 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/global_step790/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:60063874c244874aaf2165addc00527bb0e37da8697b0e2ac7156e6811c7dc27 +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/latest new file mode 100644 index 0000000000000000000000000000000000000000..4063e09c8e977daac7183734788b33f1e7c57532 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/latest @@ -0,0 +1 @@ +global_step790 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..ce6cc4b09f484858b3793b366f51a83dc1da84b1 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7acf76ad4f3b16e03ef2f9a9b6838c1523cabf9988e7f03618b2018484c0aea0 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..3e8bba29664449a44713a42b211aa1bb0dfafd15 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5df4fd54c6897f414f1b20952e291bd132d49916eabf76377fc4c3ee639db094 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..9840216e13e3d1b3cf048a9ff22713d791192f8a --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7ab19accec25ab29f744f6fa1420d7e8fb8ff1dfdce889b8eff44727f2a38c92 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..6ca363dc6e1e792a78bc43d05966bf0e08ddde56 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3a3d2d95bd557a2e353872bb36ea2b9313d0e15c7bd64e130e0fc5929e97e0c3 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..d903ec7881e4bd34b69839b2d58e402ed0dd6790 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d5984411a7ad76b25078bab85bc0192c0eca6540da7ca2f0340fdd6ec88e260b +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..b85db304cad2beb0d8c8a1043c252888cae5b961 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b3e15e4766650c74a467d3ee15ff2bee47162b6b694f88f9959d3fd21981e209 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..b8fb3d2975381d87c5a9f2e7ed5564d57af174ee --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e096023bc1983346acfbdc222296700ec8b2184dcafac5f72f65c546e0b51523 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..8166d0a1f72511b39d7dac1e48ae717c921cfd45 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d0289c21285fcc7b8c8d14df1b915f20610e9de2baa5107acc141a5242c6acab +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..a9a2d9bb4e829f08f192e2dd4d91dc944579ace9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d41f6995235eb5427339d2fc8cc042254d91f00a2b7526717fd1bc7cec9e2ada +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..5542fecb97f3723474b51a66f86664c065b032a4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/trainer_state.json @@ -0,0 +1,6354 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9762202753441802, + "eval_steps": 2000, + "global_step": 790, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 1.8141324520111084, + "learning_rate": 3.125e-07, + "loss": 1.4558331966400146, + "step": 1, + "token_acc": 0.6587197909862835 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 2.7097065448760986, + "learning_rate": 6.25e-07, + "loss": 1.5102750062942505, + "step": 2, + "token_acc": 0.6374107200308861 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 3.731478452682495, + "learning_rate": 9.375e-07, + "loss": 1.4846917390823364, + "step": 3, + "token_acc": 0.6467950044849238 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 1.8039724826812744, + "learning_rate": 1.25e-06, + "loss": 1.4477494955062866, + "step": 4, + "token_acc": 0.6551159771996162 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 4.494865417480469, + "learning_rate": 1.5625e-06, + "loss": 1.4835330247879028, + "step": 5, + "token_acc": 0.636961027144518 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 3.468430995941162, + "learning_rate": 1.875e-06, + "loss": 1.476511001586914, + "step": 6, + "token_acc": 0.6395731577829687 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 1.6436569690704346, + "learning_rate": 2.1875e-06, + "loss": 1.445321798324585, + "step": 7, + "token_acc": 0.6609300016548072 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 5.7237958908081055, + "learning_rate": 2.5e-06, + "loss": 1.4368172883987427, + "step": 8, + "token_acc": 0.6518960374946741 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 1.0010274648666382, + "learning_rate": 2.8125e-06, + "loss": 1.5469402074813843, + "step": 9, + "token_acc": 0.61862263870296 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.2346174716949463, + "learning_rate": 3.125e-06, + "loss": 1.5444755554199219, + "step": 10, + "token_acc": 0.6183196808672615 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 1.349374532699585, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5128525495529175, + "step": 11, + "token_acc": 0.6263652527305055 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 3.90444016456604, + "learning_rate": 3.75e-06, + "loss": 1.468747615814209, + "step": 12, + "token_acc": 0.6539249583813549 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 3.8990912437438965, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4974875450134277, + "step": 13, + "token_acc": 0.6396883067214839 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 4.560666084289551, + "learning_rate": 4.375e-06, + "loss": 1.4603385925292969, + "step": 14, + "token_acc": 0.673594883778133 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 2.1652066707611084, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.4672789573669434, + "step": 15, + "token_acc": 0.67072 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 28.565114974975586, + "learning_rate": 5e-06, + "loss": 1.4323251247406006, + "step": 16, + "token_acc": 0.6802855573860516 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 1.2191154956817627, + "learning_rate": 5.3125e-06, + "loss": 1.5201783180236816, + "step": 17, + "token_acc": 0.6302349336057201 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 3.823606252670288, + "learning_rate": 5.625e-06, + "loss": 1.4549026489257812, + "step": 18, + "token_acc": 0.6533967235651278 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 3.615473508834839, + "learning_rate": 5.9375e-06, + "loss": 1.4218157529830933, + "step": 19, + "token_acc": 0.6625929470661857 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 6.056225776672363, + "learning_rate": 6.25e-06, + "loss": 1.5040549039840698, + "step": 20, + "token_acc": 0.6463865546218487 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 1.1101607084274292, + "learning_rate": 6.5625e-06, + "loss": 1.5186512470245361, + "step": 21, + "token_acc": 0.6336622685441845 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 3.4688284397125244, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4710779190063477, + "step": 22, + "token_acc": 0.649603043334436 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 2.945401906967163, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4556055068969727, + "step": 23, + "token_acc": 0.6511273792093705 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.7959648370742798, + "learning_rate": 7.5e-06, + "loss": 1.4981625080108643, + "step": 24, + "token_acc": 0.6581992406436449 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.836989641189575, + "learning_rate": 7.8125e-06, + "loss": 1.4692087173461914, + "step": 25, + "token_acc": 0.6400229118933556 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 4.335150241851807, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4672834873199463, + "step": 26, + "token_acc": 0.6426897157925578 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 2.6187744140625, + "learning_rate": 8.437500000000002e-06, + "loss": 1.5053527355194092, + "step": 27, + "token_acc": 0.6411245456568504 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 4.596649169921875, + "learning_rate": 8.75e-06, + "loss": 1.495232105255127, + "step": 28, + "token_acc": 0.6582827406764961 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 2.2826857566833496, + "learning_rate": 9.0625e-06, + "loss": 1.4520742893218994, + "step": 29, + "token_acc": 0.6422463489623367 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 1.2480427026748657, + "learning_rate": 9.375000000000001e-06, + "loss": 1.413942575454712, + "step": 30, + "token_acc": 0.6513089987801445 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 1.5732747316360474, + "learning_rate": 9.6875e-06, + "loss": 1.4269421100616455, + "step": 31, + "token_acc": 0.6511775266659626 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 1.305902123451233, + "learning_rate": 1e-05, + "loss": 1.4499857425689697, + "step": 32, + "token_acc": 0.6362675125561723 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 2.718529462814331, + "learning_rate": 1.03125e-05, + "loss": 1.449812412261963, + "step": 33, + "token_acc": 0.6403560135847289 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 1.5598729848861694, + "learning_rate": 1.0625e-05, + "loss": 1.3601875305175781, + "step": 34, + "token_acc": 0.6700675278919553 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 9.867480278015137, + "learning_rate": 1.09375e-05, + "loss": 1.3765363693237305, + "step": 35, + "token_acc": 0.6669165757906216 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 2.136289596557617, + "learning_rate": 1.125e-05, + "loss": 1.410968542098999, + "step": 36, + "token_acc": 0.6567221708294789 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 4.079403400421143, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.488232135772705, + "step": 37, + "token_acc": 0.6309482023767738 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 0.7997560501098633, + "learning_rate": 1.1875e-05, + "loss": 1.313117265701294, + "step": 38, + "token_acc": 0.6665271562409453 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 3.2652623653411865, + "learning_rate": 1.21875e-05, + "loss": 1.4282214641571045, + "step": 39, + "token_acc": 0.6325610612275062 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 3.6540777683258057, + "learning_rate": 1.25e-05, + "loss": 1.3395355939865112, + "step": 40, + "token_acc": 0.6717530163236338 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 5.248533248901367, + "learning_rate": 1.28125e-05, + "loss": 1.3371840715408325, + "step": 41, + "token_acc": 0.6693909833904561 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 3.778581380844116, + "learning_rate": 1.3125e-05, + "loss": 1.3400944471359253, + "step": 42, + "token_acc": 0.6653791581270692 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 1.4495247602462769, + "learning_rate": 1.34375e-05, + "loss": 1.3555524349212646, + "step": 43, + "token_acc": 0.6599288486416559 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 3.1733644008636475, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.323427677154541, + "step": 44, + "token_acc": 0.6751474032792182 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 2.605138063430786, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.344847559928894, + "step": 45, + "token_acc": 0.6617188094694375 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 4.86713981628418, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.306713581085205, + "step": 46, + "token_acc": 0.6737607941796423 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 4.361069202423096, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.2949577569961548, + "step": 47, + "token_acc": 0.6895424836601307 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 1.5775742530822754, + "learning_rate": 1.5e-05, + "loss": 1.3317584991455078, + "step": 48, + "token_acc": 0.6644422636571803 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.20259428024292, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3528285026550293, + "step": 49, + "token_acc": 0.6621909900865856 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 2.1786444187164307, + "learning_rate": 1.5625e-05, + "loss": 1.1999170780181885, + "step": 50, + "token_acc": 0.6959557173490251 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 2.961524248123169, + "learning_rate": 1.59375e-05, + "loss": 1.3457515239715576, + "step": 51, + "token_acc": 0.6627879221864185 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 13.192907333374023, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3237392902374268, + "step": 52, + "token_acc": 0.6542852884185423 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 3.6055777072906494, + "learning_rate": 1.65625e-05, + "loss": 1.3433442115783691, + "step": 53, + "token_acc": 0.6624097352233217 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 1.7857606410980225, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2789276838302612, + "step": 54, + "token_acc": 0.672338649851632 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 2.1665122509002686, + "learning_rate": 1.71875e-05, + "loss": 1.3222646713256836, + "step": 55, + "token_acc": 0.6588819226750261 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 1.7462254762649536, + "learning_rate": 1.75e-05, + "loss": 1.3362858295440674, + "step": 56, + "token_acc": 0.6613744187138898 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 1.2184135913848877, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2202270030975342, + "step": 57, + "token_acc": 0.6888445331559104 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 2.862990379333496, + "learning_rate": 1.8125e-05, + "loss": 1.224043846130371, + "step": 58, + "token_acc": 0.6924242424242424 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 4.461820602416992, + "learning_rate": 1.84375e-05, + "loss": 1.1999526023864746, + "step": 59, + "token_acc": 0.6939597315436241 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 1.0866032838821411, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2586383819580078, + "step": 60, + "token_acc": 0.6740108140886351 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 1.9648689031600952, + "learning_rate": 1.90625e-05, + "loss": 1.2699849605560303, + "step": 61, + "token_acc": 0.6729458695772619 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 0.9302283525466919, + "learning_rate": 1.9375e-05, + "loss": 1.26922607421875, + "step": 62, + "token_acc": 0.6693402228820422 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 1.6925781965255737, + "learning_rate": 1.96875e-05, + "loss": 1.2230749130249023, + "step": 63, + "token_acc": 0.69140625 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 3.138141393661499, + "learning_rate": 2e-05, + "loss": 1.2473464012145996, + "step": 64, + "token_acc": 0.671907957813998 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 84.18292236328125, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2626996040344238, + "step": 65, + "token_acc": 0.6641408513483397 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 1.1837621927261353, + "learning_rate": 2.0625e-05, + "loss": 1.2514493465423584, + "step": 66, + "token_acc": 0.6728548072359053 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 2.1558518409729004, + "learning_rate": 2.09375e-05, + "loss": 1.1905746459960938, + "step": 67, + "token_acc": 0.707898979043525 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 2.1352062225341797, + "learning_rate": 2.125e-05, + "loss": 1.2563612461090088, + "step": 68, + "token_acc": 0.6748354235740714 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 4.160109996795654, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.2178868055343628, + "step": 69, + "token_acc": 0.6880837359098229 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 2.219675064086914, + "learning_rate": 2.1875e-05, + "loss": 1.201242208480835, + "step": 70, + "token_acc": 0.6804117879970587 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 4.043488502502441, + "learning_rate": 2.21875e-05, + "loss": 1.2328397035598755, + "step": 71, + "token_acc": 0.6700484108608714 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 1.675660490989685, + "learning_rate": 2.25e-05, + "loss": 1.2181830406188965, + "step": 72, + "token_acc": 0.6850481125092525 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 3.0427443981170654, + "learning_rate": 2.28125e-05, + "loss": 1.0783236026763916, + "step": 73, + "token_acc": 0.7167288053169071 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 11.553773880004883, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.1844292879104614, + "step": 74, + "token_acc": 0.6924296745725317 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 1.2728339433670044, + "learning_rate": 2.34375e-05, + "loss": 1.1743783950805664, + "step": 75, + "token_acc": 0.6912672045562411 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 2.9700307846069336, + "learning_rate": 2.375e-05, + "loss": 1.0269439220428467, + "step": 76, + "token_acc": 0.7346795022305705 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 2.9078361988067627, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1813220977783203, + "step": 77, + "token_acc": 0.6883013798998657 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 3.9725077152252197, + "learning_rate": 2.4375e-05, + "loss": 1.203944444656372, + "step": 78, + "token_acc": 0.6775247733502003 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 1.538577914237976, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.216745138168335, + "step": 79, + "token_acc": 0.6754992693619094 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 1.9446707963943481, + "learning_rate": 2.5e-05, + "loss": 1.2227823734283447, + "step": 80, + "token_acc": 0.6712661046604104 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 1.4078911542892456, + "learning_rate": 2.53125e-05, + "loss": 1.1703464984893799, + "step": 81, + "token_acc": 0.6871378910776361 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 0.8193759918212891, + "learning_rate": 2.5625e-05, + "loss": 1.2597627639770508, + "step": 82, + "token_acc": 0.6600334448160535 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 1.5110586881637573, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.147017240524292, + "step": 83, + "token_acc": 0.6880786212790201 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 2.4486095905303955, + "learning_rate": 2.625e-05, + "loss": 1.1736788749694824, + "step": 84, + "token_acc": 0.6902223116386681 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 15.185917854309082, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0476911067962646, + "step": 85, + "token_acc": 0.7218877279971666 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 1.7706151008605957, + "learning_rate": 2.6875e-05, + "loss": 1.1720056533813477, + "step": 86, + "token_acc": 0.6911136980985643 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.432227849960327, + "learning_rate": 2.71875e-05, + "loss": 1.1003440618515015, + "step": 87, + "token_acc": 0.7121124031007752 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 3.5543625354766846, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0957496166229248, + "step": 88, + "token_acc": 0.70509977827051 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 6.43117094039917, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1858711242675781, + "step": 89, + "token_acc": 0.6840046283541793 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 2.4569075107574463, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.9773006439208984, + "step": 90, + "token_acc": 0.7344842105263157 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 11.663007736206055, + "learning_rate": 2.84375e-05, + "loss": 1.064300298690796, + "step": 91, + "token_acc": 0.7109963417258446 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.8894364833831787, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.1586850881576538, + "step": 92, + "token_acc": 0.6858779719278144 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 1.7159028053283691, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0098645687103271, + "step": 93, + "token_acc": 0.7275060308987322 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 1.5333527326583862, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1714340448379517, + "step": 94, + "token_acc": 0.6860140489913544 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 3.671557903289795, + "learning_rate": 2.96875e-05, + "loss": 1.0821294784545898, + "step": 95, + "token_acc": 0.6963150599818382 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 5.295556545257568, + "learning_rate": 3e-05, + "loss": 0.9997302889823914, + "step": 96, + "token_acc": 0.7385238523852385 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 2.397625207901001, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.130357265472412, + "step": 97, + "token_acc": 0.6882726951607206 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 2.037938356399536, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1520730257034302, + "step": 98, + "token_acc": 0.6894481533067576 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 3.0218756198883057, + "learning_rate": 3.09375e-05, + "loss": 1.0573893785476685, + "step": 99, + "token_acc": 0.7125121241513094 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 3.04327654838562, + "learning_rate": 3.125e-05, + "loss": 1.0620324611663818, + "step": 100, + "token_acc": 0.707827486752968 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 5.125799655914307, + "learning_rate": 3.15625e-05, + "loss": 1.1085580587387085, + "step": 101, + "token_acc": 0.6982024597918638 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 4.365977764129639, + "learning_rate": 3.1875e-05, + "loss": 1.1006660461425781, + "step": 102, + "token_acc": 0.6985514046097003 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 2.454066514968872, + "learning_rate": 3.21875e-05, + "loss": 1.0711305141448975, + "step": 103, + "token_acc": 0.7023084497283104 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 1.7535096406936646, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.0082716941833496, + "step": 104, + "token_acc": 0.7191448721716133 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 3.075683116912842, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.0638121366500854, + "step": 105, + "token_acc": 0.7095207815480664 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 2.3826944828033447, + "learning_rate": 3.3125e-05, + "loss": 1.1353557109832764, + "step": 106, + "token_acc": 0.6854159649713708 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 1.8979523181915283, + "learning_rate": 3.34375e-05, + "loss": 1.0470201969146729, + "step": 107, + "token_acc": 0.7149484887766937 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 1.8144444227218628, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9918816089630127, + "step": 108, + "token_acc": 0.722106165300766 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 3.806840419769287, + "learning_rate": 3.40625e-05, + "loss": 1.0785143375396729, + "step": 109, + "token_acc": 0.6924427887174028 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 2.5378105640411377, + "learning_rate": 3.4375e-05, + "loss": 1.0899507999420166, + "step": 110, + "token_acc": 0.7045417101433357 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 1.9893940687179565, + "learning_rate": 3.46875e-05, + "loss": 1.0884394645690918, + "step": 111, + "token_acc": 0.7042693016878635 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 5.139678001403809, + "learning_rate": 3.5e-05, + "loss": 0.9752957820892334, + "step": 112, + "token_acc": 0.7288215172043732 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 3.4846577644348145, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0316904783248901, + "step": 113, + "token_acc": 0.7174084803792468 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 3.4321818351745605, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.022270917892456, + "step": 114, + "token_acc": 0.7156758903746856 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 2.8689022064208984, + "learning_rate": 3.59375e-05, + "loss": 1.1368576288223267, + "step": 115, + "token_acc": 0.6861952181165647 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 1.8734346628189087, + "learning_rate": 3.625e-05, + "loss": 1.0494530200958252, + "step": 116, + "token_acc": 0.7091768631813126 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.329326629638672, + "learning_rate": 3.65625e-05, + "loss": 0.9063711166381836, + "step": 117, + "token_acc": 0.7585655778643492 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 1.9864639043807983, + "learning_rate": 3.6875e-05, + "loss": 1.0875568389892578, + "step": 118, + "token_acc": 0.7017193984800302 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 3.4826865196228027, + "learning_rate": 3.71875e-05, + "loss": 1.0767862796783447, + "step": 119, + "token_acc": 0.7015383266862427 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 3.474165201187134, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9985078573226929, + "step": 120, + "token_acc": 0.7192602563352256 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 15.018126487731934, + "learning_rate": 3.78125e-05, + "loss": 1.0274770259857178, + "step": 121, + "token_acc": 0.716270783847981 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 2.6608524322509766, + "learning_rate": 3.8125e-05, + "loss": 0.9960276484489441, + "step": 122, + "token_acc": 0.7227157360406091 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 3.8320107460021973, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0952248573303223, + "step": 123, + "token_acc": 0.6966855558726406 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 3.4052140712738037, + "learning_rate": 3.875e-05, + "loss": 1.0360908508300781, + "step": 124, + "token_acc": 0.7139331547031448 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.294705390930176, + "learning_rate": 3.90625e-05, + "loss": 0.9304947853088379, + "step": 125, + "token_acc": 0.7381878821567538 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 5.569668769836426, + "learning_rate": 3.9375e-05, + "loss": 0.9146929383277893, + "step": 126, + "token_acc": 0.7442802870409455 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 4.5205397605896, + "learning_rate": 3.96875e-05, + "loss": 0.8794465661048889, + "step": 127, + "token_acc": 0.7579816513761468 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 3.539724588394165, + "learning_rate": 4e-05, + "loss": 1.015094518661499, + "step": 128, + "token_acc": 0.7137131788123706 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 3.903836965560913, + "learning_rate": 4.0312500000000004e-05, + "loss": 1.0014472007751465, + "step": 129, + "token_acc": 0.7209395973154362 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 2.7150936126708984, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.984825074672699, + "step": 130, + "token_acc": 0.7249438719705256 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 3.824404716491699, + "learning_rate": 4.09375e-05, + "loss": 0.8905125856399536, + "step": 131, + "token_acc": 0.7577065883775149 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 4.411902904510498, + "learning_rate": 4.125e-05, + "loss": 0.980827271938324, + "step": 132, + "token_acc": 0.7225544750117011 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 5.346670150756836, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0253760814666748, + "step": 133, + "token_acc": 0.7098936760749819 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 2.1438992023468018, + "learning_rate": 4.1875e-05, + "loss": 0.9548345804214478, + "step": 134, + "token_acc": 0.7338397692902863 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 4.1644606590271, + "learning_rate": 4.21875e-05, + "loss": 0.8847500681877136, + "step": 135, + "token_acc": 0.7524723391755606 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 2.005262613296509, + "learning_rate": 4.25e-05, + "loss": 1.073623538017273, + "step": 136, + "token_acc": 0.6994131997098965 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 2.246750593185425, + "learning_rate": 4.28125e-05, + "loss": 1.0128499269485474, + "step": 137, + "token_acc": 0.7144232826877809 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 3.925265073776245, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.83775395154953, + "step": 138, + "token_acc": 0.772547828727604 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 12.726314544677734, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.9593348503112793, + "step": 139, + "token_acc": 0.7316725055144674 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 2.6994714736938477, + "learning_rate": 4.375e-05, + "loss": 0.9028947949409485, + "step": 140, + "token_acc": 0.7460494101936346 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 3.9808058738708496, + "learning_rate": 4.40625e-05, + "loss": 0.8996214270591736, + "step": 141, + "token_acc": 0.7425867507886436 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 1.2212865352630615, + "learning_rate": 4.4375e-05, + "loss": 1.0384089946746826, + "step": 142, + "token_acc": 0.7121201463140123 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 3.9611852169036865, + "learning_rate": 4.46875e-05, + "loss": 0.9263251423835754, + "step": 143, + "token_acc": 0.740031723458951 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 5.350156307220459, + "learning_rate": 4.5e-05, + "loss": 0.9607938528060913, + "step": 144, + "token_acc": 0.7303436535801681 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.4106866121292114, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9440912008285522, + "step": 145, + "token_acc": 0.7313729139524784 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 3.6181912422180176, + "learning_rate": 4.5625e-05, + "loss": 0.9318268299102783, + "step": 146, + "token_acc": 0.7333581652743043 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 2.850383758544922, + "learning_rate": 4.59375e-05, + "loss": 0.8572186231613159, + "step": 147, + "token_acc": 0.7507500914745701 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 3.677313804626465, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.9332783818244934, + "step": 148, + "token_acc": 0.7401175938489372 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 1.3261946439743042, + "learning_rate": 4.65625e-05, + "loss": 1.0429058074951172, + "step": 149, + "token_acc": 0.7028539965128017 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 3.0652029514312744, + "learning_rate": 4.6875e-05, + "loss": 0.977657675743103, + "step": 150, + "token_acc": 0.7199633139712626 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 20.230405807495117, + "learning_rate": 4.71875e-05, + "loss": 1.027328610420227, + "step": 151, + "token_acc": 0.7118949681636333 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 3.0481197834014893, + "learning_rate": 4.75e-05, + "loss": 0.8688861727714539, + "step": 152, + "token_acc": 0.7510847854535436 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 5.976290225982666, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.033332347869873, + "step": 153, + "token_acc": 0.7093079141300865 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 3.429054021835327, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.9014919996261597, + "step": 154, + "token_acc": 0.7435937257338096 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 1.6205755472183228, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9900403022766113, + "step": 155, + "token_acc": 0.7184128821764985 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 10.175098419189453, + "learning_rate": 4.875e-05, + "loss": 0.8962844610214233, + "step": 156, + "token_acc": 0.7435897435897436 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 1.2148970365524292, + "learning_rate": 4.90625e-05, + "loss": 0.9664689302444458, + "step": 157, + "token_acc": 0.7256873527101335 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 1.4516433477401733, + "learning_rate": 4.937500000000001e-05, + "loss": 0.857364296913147, + "step": 158, + "token_acc": 0.751648804616653 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 2.4918766021728516, + "learning_rate": 4.96875e-05, + "loss": 0.8872854709625244, + "step": 159, + "token_acc": 0.7495879573673223 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 1.7210731506347656, + "learning_rate": 5e-05, + "loss": 0.9493648409843445, + "step": 160, + "token_acc": 0.7264301870138468 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 6.053183555603027, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8796491622924805, + "step": 161, + "token_acc": 0.7541715628672151 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 2.3308753967285156, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.8858709335327148, + "step": 162, + "token_acc": 0.7452508843180925 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 2.514087200164795, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8514291644096375, + "step": 163, + "token_acc": 0.7531689065363469 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 3.979966878890991, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.0399848222732544, + "step": 164, + "token_acc": 0.7055028462998102 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 1.8825353384017944, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9388617277145386, + "step": 165, + "token_acc": 0.7314329823013729 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.460411787033081, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9585274457931519, + "step": 166, + "token_acc": 0.7233919943259897 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 2.5048015117645264, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8713458776473999, + "step": 167, + "token_acc": 0.7487620536877769 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.3289780616760254, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.9545108079910278, + "step": 168, + "token_acc": 0.7243544303797468 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 8.591806411743164, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.8003573417663574, + "step": 169, + "token_acc": 0.7734825957670106 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 2.1393492221832275, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8462347984313965, + "step": 170, + "token_acc": 0.7583013515768396 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 2.350606679916382, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8536550998687744, + "step": 171, + "token_acc": 0.7583616526560544 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 2.1374306678771973, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8206404447555542, + "step": 172, + "token_acc": 0.7580493637372961 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 1.5408402681350708, + "learning_rate": 4.994911507566217e-05, + "loss": 1.0032633543014526, + "step": 173, + "token_acc": 0.7122946175637394 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 7.398180961608887, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9755508303642273, + "step": 174, + "token_acc": 0.72718616887998 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 34.215980529785156, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8316116333007812, + "step": 175, + "token_acc": 0.7651929504709815 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 1.1946734189987183, + "learning_rate": 4.99229333433282e-05, + "loss": 0.9263297319412231, + "step": 176, + "token_acc": 0.7333371021538809 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 3.4196677207946777, + "learning_rate": 4.991300473502437e-05, + "loss": 0.865764856338501, + "step": 177, + "token_acc": 0.7536853599563217 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 0.84961998462677, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.0150288343429565, + "step": 178, + "token_acc": 0.7088443038523204 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 3.249678611755371, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8582470417022705, + "step": 179, + "token_acc": 0.7626390957679838 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.03476881980896, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9166827201843262, + "step": 180, + "token_acc": 0.7448330683624801 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 3.3579049110412598, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8242158889770508, + "step": 181, + "token_acc": 0.763468992248062 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 2.1550583839416504, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9542834758758545, + "step": 182, + "token_acc": 0.7280744258164551 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 1.229475975036621, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9628951549530029, + "step": 183, + "token_acc": 0.7275876331299762 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.3542944192886353, + "learning_rate": 4.982671142387316e-05, + "loss": 0.9437664151191711, + "step": 184, + "token_acc": 0.7304563628843237 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 2.5428855419158936, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8541402816772461, + "step": 185, + "token_acc": 0.7521788023615407 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 2.5485925674438477, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0094258785247803, + "step": 186, + "token_acc": 0.7157740901376579 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 1.8278656005859375, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8787280917167664, + "step": 187, + "token_acc": 0.7516580692704495 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 4.457269191741943, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9875797033309937, + "step": 188, + "token_acc": 0.7228752642706131 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 3.185421943664551, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8471859693527222, + "step": 189, + "token_acc": 0.7519582245430809 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 6.704853534698486, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8586404323577881, + "step": 190, + "token_acc": 0.7541206247299216 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 1.5821382999420166, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8798616528511047, + "step": 191, + "token_acc": 0.7469811850603763 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 10.706079483032227, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8191840648651123, + "step": 192, + "token_acc": 0.763384590612672 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 5.072082996368408, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.833245575428009, + "step": 193, + "token_acc": 0.7563102340523176 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 1.3364410400390625, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9354732036590576, + "step": 194, + "token_acc": 0.7303690195237074 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 8.606874465942383, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7941551208496094, + "step": 195, + "token_acc": 0.766449806472865 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 2.6359663009643555, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8962496519088745, + "step": 196, + "token_acc": 0.7337984211492564 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 4.913934707641602, + "learning_rate": 4.958879433443904e-05, + "loss": 0.8074665069580078, + "step": 197, + "token_acc": 0.766220939067011 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 14.050993919372559, + "learning_rate": 4.95663319832678e-05, + "loss": 1.0043327808380127, + "step": 198, + "token_acc": 0.7157577609920098 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 1.2029297351837158, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8978754281997681, + "step": 199, + "token_acc": 0.7365190705830776 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 1.6810232400894165, + "learning_rate": 4.951963201008076e-05, + "loss": 0.837005078792572, + "step": 200, + "token_acc": 0.7567454682148526 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 1.762834072113037, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8861300945281982, + "step": 201, + "token_acc": 0.745210849086426 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 2.8837828636169434, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7754945158958435, + "step": 202, + "token_acc": 0.7765665374677002 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 4.415988922119141, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8974159359931946, + "step": 203, + "token_acc": 0.7422455780569085 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.2022016048431396, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9800943732261658, + "step": 204, + "token_acc": 0.7206211812627291 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 3.1489412784576416, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8181082010269165, + "step": 205, + "token_acc": 0.7677832141512985 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 2.7361836433410645, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9568559527397156, + "step": 206, + "token_acc": 0.725022063263505 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 1.2395085096359253, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8899260759353638, + "step": 207, + "token_acc": 0.7444645472559662 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 11.254620552062988, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.793695330619812, + "step": 208, + "token_acc": 0.7653651482284888 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 1.9917453527450562, + "learning_rate": 4.92803071949828e-05, + "loss": 0.9342561960220337, + "step": 209, + "token_acc": 0.7262987886944818 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 1.3936560153961182, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9557225704193115, + "step": 210, + "token_acc": 0.7319856537332898 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 1.602947473526001, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9270342588424683, + "step": 211, + "token_acc": 0.730816476947015 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.341012477874756, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.9432080388069153, + "step": 212, + "token_acc": 0.7277580071174378 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.3441163301467896, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8968133330345154, + "step": 213, + "token_acc": 0.7424508426966292 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 4.8920722007751465, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8623098134994507, + "step": 214, + "token_acc": 0.7460244648318043 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 2.7736644744873047, + "learning_rate": 4.9094401644886e-05, + "loss": 0.9887412190437317, + "step": 215, + "token_acc": 0.7158999839717903 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 1.6230074167251587, + "learning_rate": 4.906138091134118e-05, + "loss": 0.9436683058738708, + "step": 216, + "token_acc": 0.7280187056072704 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 3.8004024028778076, + "learning_rate": 4.90277804028108e-05, + "loss": 0.7515861988067627, + "step": 217, + "token_acc": 0.7878668891724747 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 1.2686784267425537, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9568852186203003, + "step": 218, + "token_acc": 0.722643138007097 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 2.203845500946045, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7561929225921631, + "step": 219, + "token_acc": 0.7821512081060016 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 60.95647048950195, + "learning_rate": 4.892350839330522e-05, + "loss": 0.9007571935653687, + "step": 220, + "token_acc": 0.7362854803493449 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 1.3951096534729004, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8568707704544067, + "step": 221, + "token_acc": 0.7503653902367728 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 4.732699871063232, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8863348960876465, + "step": 222, + "token_acc": 0.7456376192735515 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 1.9262758493423462, + "learning_rate": 4.881404839143988e-05, + "loss": 0.8580335974693298, + "step": 223, + "token_acc": 0.7447225981055481 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 2.428048610687256, + "learning_rate": 4.877641290737884e-05, + "loss": 0.816256046295166, + "step": 224, + "token_acc": 0.7594610513915476 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 1.8479973077774048, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8992019295692444, + "step": 225, + "token_acc": 0.747414978184209 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 1.2170461416244507, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8981590270996094, + "step": 226, + "token_acc": 0.7403604836869724 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 1.4078121185302734, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8538397550582886, + "step": 227, + "token_acc": 0.7566088200534926 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 1.7292224168777466, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8955122828483582, + "step": 228, + "token_acc": 0.7407333994053519 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 1.772873878479004, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8418647646903992, + "step": 229, + "token_acc": 0.7579768207182715 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 2.3586251735687256, + "learning_rate": 4.853860162957552e-05, + "loss": 0.9011165499687195, + "step": 230, + "token_acc": 0.7370127630217316 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 1.4242304563522339, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6907041668891907, + "step": 231, + "token_acc": 0.7974857772068269 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 2.375168561935425, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.838218092918396, + "step": 232, + "token_acc": 0.756889252024066 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 2.9053637981414795, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8434799313545227, + "step": 233, + "token_acc": 0.7536370711848172 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.854264259338379, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8246455788612366, + "step": 234, + "token_acc": 0.7580336387255572 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 4.344927787780762, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8148558139801025, + "step": 235, + "token_acc": 0.757310740639519 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 8.028459548950195, + "learning_rate": 4.828037336897009e-05, + "loss": 0.8641375303268433, + "step": 236, + "token_acc": 0.7445998946320904 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 10.524628639221191, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9830830693244934, + "step": 237, + "token_acc": 0.7152842788491544 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.7903722524642944, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.8133025765419006, + "step": 238, + "token_acc": 0.7577724358974359 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 1.2249422073364258, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8893339037895203, + "step": 239, + "token_acc": 0.745752359800111 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 15.711007118225098, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8640246391296387, + "step": 240, + "token_acc": 0.7455461092760058 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 17.570682525634766, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.7105808258056641, + "step": 241, + "token_acc": 0.7925288608146374 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 3.0752291679382324, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.9153680205345154, + "step": 242, + "token_acc": 0.7310617855077621 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 1.167055606842041, + "learning_rate": 4.79536020593051e-05, + "loss": 0.938827633857727, + "step": 243, + "token_acc": 0.7255839744922714 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 1.852413535118103, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.853781521320343, + "step": 244, + "token_acc": 0.7508854781582054 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.5053846836090088, + "learning_rate": 4.785524389258827e-05, + "loss": 0.9472495317459106, + "step": 245, + "token_acc": 0.7277364588606363 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 3.108750820159912, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8951740860939026, + "step": 246, + "token_acc": 0.7357894216998371 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.4686100482940674, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.7866122722625732, + "step": 247, + "token_acc": 0.7723662389805359 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 1.967427372932434, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.8967963457107544, + "step": 248, + "token_acc": 0.7343396554724204 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 3.1070291996002197, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9204596877098083, + "step": 249, + "token_acc": 0.7327885874226897 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 1.856003761291504, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7575951814651489, + "step": 250, + "token_acc": 0.7788233433496757 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 1.840150237083435, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.8490856289863586, + "step": 251, + "token_acc": 0.7549613056470769 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 1.0170334577560425, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8861610293388367, + "step": 252, + "token_acc": 0.7378573411046351 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 1.2947522401809692, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.8459495902061462, + "step": 253, + "token_acc": 0.7514053303352953 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 1.4557151794433594, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7556009888648987, + "step": 254, + "token_acc": 0.7733115022513304 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 5.058238983154297, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.7291783094406128, + "step": 255, + "token_acc": 0.7859242925395076 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 1.114750623703003, + "learning_rate": 4.72751631047092e-05, + "loss": 0.8316564559936523, + "step": 256, + "token_acc": 0.7554670474186518 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 2.487441301345825, + "learning_rate": 4.721918194465169e-05, + "loss": 0.8008612394332886, + "step": 257, + "token_acc": 0.7658649666763258 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 3.9729726314544678, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7932621240615845, + "step": 258, + "token_acc": 0.7653622505107653 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 1.7285813093185425, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8352819085121155, + "step": 259, + "token_acc": 0.7518584505744301 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 1.6816480159759521, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.8903557658195496, + "step": 260, + "token_acc": 0.7417663664471031 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 2.6574323177337646, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9234253168106079, + "step": 261, + "token_acc": 0.7320945263583114 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 2.6559009552001953, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7536015510559082, + "step": 262, + "token_acc": 0.7836038664964435 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 1.3639440536499023, + "learning_rate": 4.687209999162396e-05, + "loss": 0.9138115048408508, + "step": 263, + "token_acc": 0.73465387392964 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 1.4643888473510742, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9767469763755798, + "step": 264, + "token_acc": 0.7182791953322303 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 1.210517168045044, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8130522966384888, + "step": 265, + "token_acc": 0.7663620788121074 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 2.5332179069519043, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.8405072093009949, + "step": 266, + "token_acc": 0.750514050719671 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 0.8559168577194214, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.9550877809524536, + "step": 267, + "token_acc": 0.7296061884669479 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 1.4378278255462646, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8482018113136292, + "step": 268, + "token_acc": 0.756345916066623 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 11.279638290405273, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8772472143173218, + "step": 269, + "token_acc": 0.7447105454139452 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 1.9061810970306396, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8368943929672241, + "step": 270, + "token_acc": 0.7592273445354014 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 1.9233216047286987, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8612409234046936, + "step": 271, + "token_acc": 0.7476107285993218 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 4.400722980499268, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8825200796127319, + "step": 272, + "token_acc": 0.7407547988287604 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 1.9921467304229736, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.827918529510498, + "step": 273, + "token_acc": 0.7584293340826075 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 1.7633479833602905, + "learning_rate": 4.618673848685586e-05, + "loss": 0.8006143569946289, + "step": 274, + "token_acc": 0.7614477652865369 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 2.8810698986053467, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8252323865890503, + "step": 275, + "token_acc": 0.757303946694003 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 3.151297092437744, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8325484991073608, + "step": 276, + "token_acc": 0.7542700046794572 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 2.637824535369873, + "learning_rate": 4.59890152099534e-05, + "loss": 0.916891872882843, + "step": 277, + "token_acc": 0.7303461130806622 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 3.002065896987915, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8716385364532471, + "step": 278, + "token_acc": 0.744375139229227 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 4.198055267333984, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8470830917358398, + "step": 279, + "token_acc": 0.75168222270458 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 1.8871791362762451, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7896092534065247, + "step": 280, + "token_acc": 0.7681891866119958 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 1.5660463571548462, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9307687282562256, + "step": 281, + "token_acc": 0.7255500518373459 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 5.349212169647217, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8658042550086975, + "step": 282, + "token_acc": 0.7448989748183538 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.4808748960494995, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8970195651054382, + "step": 283, + "token_acc": 0.7391180003431905 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 2.455500364303589, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7446900606155396, + "step": 284, + "token_acc": 0.779041869824317 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 4.634961128234863, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.7530452013015747, + "step": 285, + "token_acc": 0.7835355578024941 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 2.1206021308898926, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7370263338088989, + "step": 286, + "token_acc": 0.778288729739917 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 1.4169611930847168, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9229286313056946, + "step": 287, + "token_acc": 0.7339485313231089 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 1.9929263591766357, + "learning_rate": 4.522542485937369e-05, + "loss": 0.852091372013092, + "step": 288, + "token_acc": 0.7514005602240896 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 3.4453070163726807, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9559416174888611, + "step": 289, + "token_acc": 0.7264587084529661 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 1.336920976638794, + "learning_rate": 4.508018828701612e-05, + "loss": 0.8340522050857544, + "step": 290, + "token_acc": 0.7536214092806285 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 3.4118199348449707, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8833523392677307, + "step": 291, + "token_acc": 0.7454481792717087 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 3.5416605472564697, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9197189807891846, + "step": 292, + "token_acc": 0.7341421143847487 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 2.6148929595947266, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8156468868255615, + "step": 293, + "token_acc": 0.7572543282126311 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 2.203497886657715, + "learning_rate": 4.478392321601651e-05, + "loss": 0.892130434513092, + "step": 294, + "token_acc": 0.7416920489157612 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 2.1712839603424072, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7399520874023438, + "step": 295, + "token_acc": 0.7850873526707348 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 1.8004732131958008, + "learning_rate": 4.463292327201862e-05, + "loss": 0.8421741724014282, + "step": 296, + "token_acc": 0.7520073969536231 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 1.4337384700775146, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8471038341522217, + "step": 297, + "token_acc": 0.757553327501514 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 1.6089038848876953, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7584915161132812, + "step": 298, + "token_acc": 0.771377487562189 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.462379813194275, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8365672826766968, + "step": 299, + "token_acc": 0.7544501643614712 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 8.664839744567871, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.857391357421875, + "step": 300, + "token_acc": 0.749980424399029 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 1.634519100189209, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9205117225646973, + "step": 301, + "token_acc": 0.7280529559461311 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 6.171248435974121, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8554207682609558, + "step": 302, + "token_acc": 0.7522151310490117 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.0984041690826416, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8889010548591614, + "step": 303, + "token_acc": 0.7385387618516452 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 2.31172776222229, + "learning_rate": 4.401014914000078e-05, + "loss": 0.8025680780410767, + "step": 304, + "token_acc": 0.7657713928794504 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 1.0633413791656494, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8589308261871338, + "step": 305, + "token_acc": 0.7430749104146522 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 2.115835428237915, + "learning_rate": 4.384983704904674e-05, + "loss": 0.8085026144981384, + "step": 306, + "token_acc": 0.7655552946701104 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 1.1347414255142212, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8337522745132446, + "step": 307, + "token_acc": 0.7556942478445503 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.038212299346924, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7678971290588379, + "step": 308, + "token_acc": 0.7758904109589041 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 1.3275516033172607, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8638439774513245, + "step": 309, + "token_acc": 0.7517523364485982 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 2.3478550910949707, + "learning_rate": 4.352377813387398e-05, + "loss": 0.929733395576477, + "step": 310, + "token_acc": 0.7266237841229997 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 44.539588928222656, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.6898671388626099, + "step": 311, + "token_acc": 0.7947743004777226 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 30.594491958618164, + "learning_rate": 4.335806273589214e-05, + "loss": 0.7981156706809998, + "step": 312, + "token_acc": 0.7670547784637024 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 4.215977191925049, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7518867254257202, + "step": 313, + "token_acc": 0.779008 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 3.641622543334961, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8727045059204102, + "step": 314, + "token_acc": 0.7429807447620663 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 1.9243735074996948, + "learning_rate": 4.310617707378668e-05, + "loss": 0.8108093738555908, + "step": 315, + "token_acc": 0.7594791997459511 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 0.8778403401374817, + "learning_rate": 4.302133991757297e-05, + "loss": 0.8932883739471436, + "step": 316, + "token_acc": 0.7411044408221683 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 1.0130997896194458, + "learning_rate": 4.2936068525181e-05, + "loss": 0.8487477898597717, + "step": 317, + "token_acc": 0.7464837731723075 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 1.079648494720459, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9818820357322693, + "step": 318, + "token_acc": 0.7180284775465499 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 1.9027600288391113, + "learning_rate": 4.276423126095974e-05, + "loss": 0.808303952217102, + "step": 319, + "token_acc": 0.7607510997308121 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 1.5247927904129028, + "learning_rate": 4.267766952966369e-05, + "loss": 0.9470866918563843, + "step": 320, + "token_acc": 0.7265260406944185 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 1.369870662689209, + "learning_rate": 4.259068184315608e-05, + "loss": 0.9087713956832886, + "step": 321, + "token_acc": 0.7350676621558563 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 6.133328914642334, + "learning_rate": 4.250327029746309e-05, + "loss": 0.7461989521980286, + "step": 322, + "token_acc": 0.7807190257419967 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 1.9726554155349731, + "learning_rate": 4.24154369988241e-05, + "loss": 0.7489862442016602, + "step": 323, + "token_acc": 0.7799331724521997 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.3422818183898926, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9204419851303101, + "step": 324, + "token_acc": 0.7276635593581067 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 5.088674068450928, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7810251712799072, + "step": 325, + "token_acc": 0.7680823083468709 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 3.301347255706787, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6452058553695679, + "step": 326, + "token_acc": 0.8035996835443038 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 1.5935312509536743, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9706965088844299, + "step": 327, + "token_acc": 0.7185623981234843 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 3.254168748855591, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8170771598815918, + "step": 328, + "token_acc": 0.7567391847961991 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 1.6932677030563354, + "learning_rate": 4.187969961854726e-05, + "loss": 1.0035200119018555, + "step": 329, + "token_acc": 0.710241224902499 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 3.9655134677886963, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7571268081665039, + "step": 330, + "token_acc": 0.7816722301700842 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 1.8478268384933472, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6960297226905823, + "step": 331, + "token_acc": 0.797862706031516 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 4.037573337554932, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.8032216429710388, + "step": 332, + "token_acc": 0.7642302509144581 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 1.7107889652252197, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7450529336929321, + "step": 333, + "token_acc": 0.7807361655955263 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 2.1832103729248047, + "learning_rate": 4.142204747357604e-05, + "loss": 0.9057133197784424, + "step": 334, + "token_acc": 0.7387870402398248 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 1.6151518821716309, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8928775191307068, + "step": 335, + "token_acc": 0.7462082912032356 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 14.127095222473145, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7594292163848877, + "step": 336, + "token_acc": 0.7754250629722922 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 1.6860201358795166, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8408955335617065, + "step": 337, + "token_acc": 0.7568825910931174 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.581010341644287, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8329792022705078, + "step": 338, + "token_acc": 0.7593260342227759 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 1.9535971879959106, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6480681896209717, + "step": 339, + "token_acc": 0.8122850705561485 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 1.9793946743011475, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7445608377456665, + "step": 340, + "token_acc": 0.7827135845603527 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 4.794119834899902, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8328458070755005, + "step": 341, + "token_acc": 0.7548175481754817 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 1.6560248136520386, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7087723016738892, + "step": 342, + "token_acc": 0.7858705845576742 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 2.5469024181365967, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8401075005531311, + "step": 343, + "token_acc": 0.7521624133247552 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 1.101097822189331, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8827832937240601, + "step": 344, + "token_acc": 0.7426626391957081 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 0.9751433730125427, + "learning_rate": 4.038078976451567e-05, + "loss": 0.8690142035484314, + "step": 345, + "token_acc": 0.7447467748295871 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.7000588178634644, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7611054182052612, + "step": 346, + "token_acc": 0.7782417893544734 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 1.2874529361724854, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8283425569534302, + "step": 347, + "token_acc": 0.7594009983361065 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 2.1631717681884766, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7190766930580139, + "step": 348, + "token_acc": 0.7870029281193917 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 1.429532766342163, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8946720361709595, + "step": 349, + "token_acc": 0.7392836839113133 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 3.1684229373931885, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9295719861984253, + "step": 350, + "token_acc": 0.7288985616956851 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.7300114631652832, + "learning_rate": 3.979373519225858e-05, + "loss": 0.92355877161026, + "step": 351, + "token_acc": 0.7324363188167625 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 2.299527406692505, + "learning_rate": 3.969463130731183e-05, + "loss": 0.8874197006225586, + "step": 352, + "token_acc": 0.7404152666494357 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.4366137981414795, + "learning_rate": 3.959517334544466e-05, + "loss": 0.8959657549858093, + "step": 353, + "token_acc": 0.732359413775343 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 1.7419233322143555, + "learning_rate": 3.949536370316285e-05, + "loss": 0.870617151260376, + "step": 354, + "token_acc": 0.7478128119311843 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 2.7980542182922363, + "learning_rate": 3.939520478544614e-05, + "loss": 0.938357412815094, + "step": 355, + "token_acc": 0.723624015469509 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 1.4998390674591064, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.9020789265632629, + "step": 356, + "token_acc": 0.7391279337321676 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 7.364425182342529, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8625916242599487, + "step": 357, + "token_acc": 0.7521179064639666 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 3.1867001056671143, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7600144147872925, + "step": 358, + "token_acc": 0.7793380140421263 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 1.8029720783233643, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7643027305603027, + "step": 359, + "token_acc": 0.7712042239220199 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.355663776397705, + "learning_rate": 3.888925582549006e-05, + "loss": 0.8453084230422974, + "step": 360, + "token_acc": 0.7502929524022097 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 1.006208062171936, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8521932363510132, + "step": 361, + "token_acc": 0.756155379559291 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 1.4199978113174438, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8347768783569336, + "step": 362, + "token_acc": 0.7501978691019787 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 1.349457025527954, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7749630808830261, + "step": 363, + "token_acc": 0.7748823133826497 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 5.823076248168945, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6983618140220642, + "step": 364, + "token_acc": 0.7871479571598572 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 8.135080337524414, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8401281833648682, + "step": 365, + "token_acc": 0.7508409829522777 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.687354564666748, + "learning_rate": 3.827110064348773e-05, + "loss": 0.8170597553253174, + "step": 366, + "token_acc": 0.7552287581699346 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.9633206129074097, + "learning_rate": 3.816694101379631e-05, + "loss": 0.8735244274139404, + "step": 367, + "token_acc": 0.7437511571931124 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 4.996685981750488, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.693369448184967, + "step": 368, + "token_acc": 0.7922726867136611 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 1.0713677406311035, + "learning_rate": 3.795767247323533e-05, + "loss": 0.9313665628433228, + "step": 369, + "token_acc": 0.7287721170089801 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 4.217531681060791, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7590094804763794, + "step": 370, + "token_acc": 0.773895906118427 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 1.6878818273544312, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8483130931854248, + "step": 371, + "token_acc": 0.7492018446257538 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 0.8570557832717896, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9103615283966064, + "step": 372, + "token_acc": 0.7282932011331444 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 2.5253098011016846, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8272509574890137, + "step": 373, + "token_acc": 0.7556038061178875 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 1.4744120836257935, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9171687364578247, + "step": 374, + "token_acc": 0.7330784603353897 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 1.189939260482788, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.861799955368042, + "step": 375, + "token_acc": 0.7455566567558639 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 1.3322968482971191, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8449103832244873, + "step": 376, + "token_acc": 0.7524626452684007 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 1.3432042598724365, + "learning_rate": 3.710831292775353e-05, + "loss": 0.7643551826477051, + "step": 377, + "token_acc": 0.7682315405651777 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 1.8385838270187378, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7325477004051208, + "step": 378, + "token_acc": 0.7822782174094127 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 1.7004828453063965, + "learning_rate": 3.689300402536093e-05, + "loss": 0.9835074543952942, + "step": 379, + "token_acc": 0.715375239421905 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.2685455083847046, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8341811895370483, + "step": 380, + "token_acc": 0.7532715029856435 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 0.9319852590560913, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8452165126800537, + "step": 381, + "token_acc": 0.7504095866685391 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 1.6068520545959473, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7542648911476135, + "step": 382, + "token_acc": 0.776282880551962 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 2.165843963623047, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7548285126686096, + "step": 383, + "token_acc": 0.7744026531996684 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 1.8156840801239014, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6292520761489868, + "step": 384, + "token_acc": 0.8097231165486156 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 0.9236544370651245, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8094581365585327, + "step": 385, + "token_acc": 0.7608140039542846 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.497694969177246, + "learning_rate": 3.613053314713671e-05, + "loss": 0.8500128984451294, + "step": 386, + "token_acc": 0.7480623568786331 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 3.220353364944458, + "learning_rate": 3.602051485530486e-05, + "loss": 0.917942225933075, + "step": 387, + "token_acc": 0.7284884019955769 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 4.521829605102539, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7702268362045288, + "step": 388, + "token_acc": 0.7716129918286068 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 0.9622291922569275, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9329461455345154, + "step": 389, + "token_acc": 0.7276041666666667 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 1.7155946493148804, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6712834239006042, + "step": 390, + "token_acc": 0.8011521228931086 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 1.6805239915847778, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8204821348190308, + "step": 391, + "token_acc": 0.7557218065946245 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.821913719177246, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7822115421295166, + "step": 392, + "token_acc": 0.7652249806051202 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 0.9204578399658203, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.7939423322677612, + "step": 393, + "token_acc": 0.7637715229684224 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.6548840999603271, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7488706111907959, + "step": 394, + "token_acc": 0.7780097425191371 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 1.4144301414489746, + "learning_rate": 3.513103285012475e-05, + "loss": 0.8302121758460999, + "step": 395, + "token_acc": 0.7556669572798606 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 1.2530573606491089, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7473949790000916, + "step": 396, + "token_acc": 0.7778376713383643 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 1.3626383543014526, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7733973860740662, + "step": 397, + "token_acc": 0.7717758815005635 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 1.8561214208602905, + "learning_rate": 3.47933752712989e-05, + "loss": 0.717442512512207, + "step": 398, + "token_acc": 0.7897643593519882 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 1.4010168313980103, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8622786402702332, + "step": 399, + "token_acc": 0.746109355434977 + }, + { + "epoch": 1.0, + "grad_norm": 3.488276720046997, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7453683614730835, + "step": 400, + "token_acc": 0.7741160315825609 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 1.1606934070587158, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7595579028129578, + "step": 401, + "token_acc": 0.7722797596215317 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 7.119320392608643, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8560916185379028, + "step": 402, + "token_acc": 0.7451851136747598 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 2.264742612838745, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7480262517929077, + "step": 403, + "token_acc": 0.7768546688509244 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 2.638277053833008, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6516366600990295, + "step": 404, + "token_acc": 0.8008649868371568 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 10.03870964050293, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7640280723571777, + "step": 405, + "token_acc": 0.7745649948822927 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 1.4635159969329834, + "learning_rate": 3.388277253201041e-05, + "loss": 0.8078231811523438, + "step": 406, + "token_acc": 0.7627060907480583 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 1.8901174068450928, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8164265155792236, + "step": 407, + "token_acc": 0.7621255796465722 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 2.5771090984344482, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8471720218658447, + "step": 408, + "token_acc": 0.7479161404395049 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 1.9842844009399414, + "learning_rate": 3.353768924152341e-05, + "loss": 0.705992579460144, + "step": 409, + "token_acc": 0.7897742247210753 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 1.8455222845077515, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9950985908508301, + "step": 410, + "token_acc": 0.7158471618394464 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 2.81369948387146, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7523729801177979, + "step": 411, + "token_acc": 0.7738898001336493 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 0.9068171381950378, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8897726535797119, + "step": 412, + "token_acc": 0.7371789837430299 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 2.705150604248047, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6471114158630371, + "step": 413, + "token_acc": 0.8097399917457697 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 1.5322827100753784, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7631367444992065, + "step": 414, + "token_acc": 0.7776249140141329 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 0.8264560699462891, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8537945747375488, + "step": 415, + "token_acc": 0.7472068130322681 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 1.2941429615020752, + "learning_rate": 3.272542485937369e-05, + "loss": 0.8233134746551514, + "step": 416, + "token_acc": 0.7573484469633828 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 0.9657873511314392, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8734332323074341, + "step": 417, + "token_acc": 0.7438148443735035 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.698813796043396, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8446903824806213, + "step": 418, + "token_acc": 0.7472349272349272 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.7393252849578857, + "learning_rate": 3.23744632744341e-05, + "loss": 0.6763110160827637, + "step": 419, + "token_acc": 0.7926863572433193 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 1.9159985780715942, + "learning_rate": 3.225711693136156e-05, + "loss": 0.635500431060791, + "step": 420, + "token_acc": 0.8037298569617961 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 1.2441291809082031, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.828086256980896, + "step": 421, + "token_acc": 0.7563552765374243 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 2.318335771560669, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8139811754226685, + "step": 422, + "token_acc": 0.7583092707501382 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 1.2812583446502686, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6982682943344116, + "step": 423, + "token_acc": 0.7941985274549809 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 1.2541266679763794, + "learning_rate": 3.178601124662686e-05, + "loss": 0.865225613117218, + "step": 424, + "token_acc": 0.7453209807224406 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.2426998615264893, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.7594386339187622, + "step": 425, + "token_acc": 0.7677123091603053 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 3.8673322200775146, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7875864505767822, + "step": 426, + "token_acc": 0.7661815909293813 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 1.1603846549987793, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8166364431381226, + "step": 427, + "token_acc": 0.7610032474262419 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 2.748734712600708, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7897321581840515, + "step": 428, + "token_acc": 0.7664034021871203 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 4.712365627288818, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7913838624954224, + "step": 429, + "token_acc": 0.7640121816885894 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 1.5520957708358765, + "learning_rate": 3.10745044975816e-05, + "loss": 0.799659252166748, + "step": 430, + "token_acc": 0.767484623676368 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 2.1518683433532715, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8150660395622253, + "step": 431, + "token_acc": 0.762330198537095 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 1.1168107986450195, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8917897939682007, + "step": 432, + "token_acc": 0.7390166223114175 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 2.890058755874634, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8356524705886841, + "step": 433, + "token_acc": 0.7508724667850364 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 1.5636504888534546, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6680396199226379, + "step": 434, + "token_acc": 0.7951321186041821 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 1.5193849802017212, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8508872985839844, + "step": 435, + "token_acc": 0.7515897223801892 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 2.8505938053131104, + "learning_rate": 3.035772882662627e-05, + "loss": 0.7488077878952026, + "step": 436, + "token_acc": 0.7749569385156894 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 1.3607008457183838, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8307385444641113, + "step": 437, + "token_acc": 0.7534736006351727 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 0.8386856317520142, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8256966471672058, + "step": 438, + "token_acc": 0.7536278768832609 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 1.4726793766021729, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.671474039554596, + "step": 439, + "token_acc": 0.7985303617571059 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 1.5878239870071411, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.6621131300926208, + "step": 440, + "token_acc": 0.8018326039387309 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.060871958732605, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8641493320465088, + "step": 441, + "token_acc": 0.74706401151186 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 1.7958430051803589, + "learning_rate": 2.963630595278977e-05, + "loss": 0.6422966718673706, + "step": 442, + "token_acc": 0.8062888198757764 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 2.897059917449951, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.730861485004425, + "step": 443, + "token_acc": 0.7823434073791591 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 1.9405778646469116, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.863489031791687, + "step": 444, + "token_acc": 0.7414182794179969 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 1.0297330617904663, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.7957867383956909, + "step": 445, + "token_acc": 0.7574887156339762 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 1.080908179283142, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8564661145210266, + "step": 446, + "token_acc": 0.7462025024239346 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 2.1639764308929443, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7737131714820862, + "step": 447, + "token_acc": 0.7662964751327861 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 1.6361067295074463, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7582350969314575, + "step": 448, + "token_acc": 0.773669430328965 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 2.3244810104370117, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6141003370285034, + "step": 449, + "token_acc": 0.8189434489178496 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 2.4419093132019043, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6784725785255432, + "step": 450, + "token_acc": 0.7944106055177356 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 2.702949047088623, + "learning_rate": 2.854682793330633e-05, + "loss": 0.6986773014068604, + "step": 451, + "token_acc": 0.7902205177372963 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 1.953333854675293, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.7032589912414551, + "step": 452, + "token_acc": 0.7920252438324727 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 2.284067153930664, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8273622989654541, + "step": 453, + "token_acc": 0.7528546054300939 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 1.595000147819519, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9244086742401123, + "step": 454, + "token_acc": 0.7275905912269549 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 1.6957809925079346, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.6975402235984802, + "step": 455, + "token_acc": 0.7869734644646502 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 2.092339038848877, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7530581951141357, + "step": 456, + "token_acc": 0.7761567319716548 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 1.3622016906738281, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.787225604057312, + "step": 457, + "token_acc": 0.7615973644377171 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 1.3467158079147339, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7957576513290405, + "step": 458, + "token_acc": 0.7672947418542956 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 1.4943625926971436, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8363101482391357, + "step": 459, + "token_acc": 0.7491413533163834 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 1.0831845998764038, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8885717988014221, + "step": 460, + "token_acc": 0.7409447431039041 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.542517900466919, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8255709409713745, + "step": 461, + "token_acc": 0.7530204962243797 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 1.334511637687683, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8665659427642822, + "step": 462, + "token_acc": 0.7449273920827532 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 1.208848237991333, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.8557275533676147, + "step": 463, + "token_acc": 0.7444496016090354 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 2.0628461837768555, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9177385568618774, + "step": 464, + "token_acc": 0.7293287497738375 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 2.4950785636901855, + "learning_rate": 2.683911408999169e-05, + "loss": 0.723082959651947, + "step": 465, + "token_acc": 0.7769183168316832 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 2.308980941772461, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6471742987632751, + "step": 466, + "token_acc": 0.8040623523854511 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 1.521958827972412, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5249975323677063, + "step": 467, + "token_acc": 0.8463351666853743 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 3.039774179458618, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7578822374343872, + "step": 468, + "token_acc": 0.7744256850262939 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 1.9503605365753174, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7234141826629639, + "step": 469, + "token_acc": 0.7862872211844852 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 1.0008007287979126, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8409122228622437, + "step": 470, + "token_acc": 0.7482727545809552 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 1.5808378458023071, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.724835991859436, + "step": 471, + "token_acc": 0.7787719171657407 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 1.2275604009628296, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8796378970146179, + "step": 472, + "token_acc": 0.7436432934788284 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 5.61031436920166, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7971165180206299, + "step": 473, + "token_acc": 0.7616080156402737 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.6030521392822266, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.836396336555481, + "step": 474, + "token_acc": 0.7549324367188986 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 1.1238839626312256, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8152873516082764, + "step": 475, + "token_acc": 0.7558295833089825 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 2.533327102661133, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6784950494766235, + "step": 476, + "token_acc": 0.7988939165409754 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 2.931954860687256, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7702056169509888, + "step": 477, + "token_acc": 0.7747391716724629 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 1.1211943626403809, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9144121408462524, + "step": 478, + "token_acc": 0.7323793949304988 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 1.1485220193862915, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8556366562843323, + "step": 479, + "token_acc": 0.7465940054495913 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 1.1166046857833862, + "learning_rate": 2.5e-05, + "loss": 0.7300997972488403, + "step": 480, + "token_acc": 0.7833213400495722 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 1.2781999111175537, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7646458745002747, + "step": 481, + "token_acc": 0.7700712005892463 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 0.9656017422676086, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.8519848585128784, + "step": 482, + "token_acc": 0.746612222920219 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 2.7804577350616455, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.749862790107727, + "step": 483, + "token_acc": 0.7760351317440402 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 2.4027388095855713, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8318485021591187, + "step": 484, + "token_acc": 0.7504805638615976 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 3.0088815689086914, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8486036062240601, + "step": 485, + "token_acc": 0.7461552976695914 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 1.2995445728302002, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9670998454093933, + "step": 486, + "token_acc": 0.7201265687773314 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.1181038618087769, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8590025305747986, + "step": 487, + "token_acc": 0.747782901738205 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 2.26283597946167, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7187557220458984, + "step": 488, + "token_acc": 0.7850413930916358 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 1.03593909740448, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8461419939994812, + "step": 489, + "token_acc": 0.7481977342945417 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 2.398747444152832, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.698701024055481, + "step": 490, + "token_acc": 0.7867596299875742 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 1.4672415256500244, + "learning_rate": 2.365075276976245e-05, + "loss": 0.9008340239524841, + "step": 491, + "token_acc": 0.7327416173570019 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 3.996742010116577, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6810827255249023, + "step": 492, + "token_acc": 0.7924176507147297 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 1.1854064464569092, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.7924419045448303, + "step": 493, + "token_acc": 0.7695827357781875 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 1.384638786315918, + "learning_rate": 2.328329352789066e-05, + "loss": 0.7272655367851257, + "step": 494, + "token_acc": 0.7785135218763537 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 1.6975595951080322, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8528483510017395, + "step": 495, + "token_acc": 0.7481278895617633 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.2870354652404785, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8342181444168091, + "step": 496, + "token_acc": 0.7528511514973144 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 1.530961036682129, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6387697458267212, + "step": 497, + "token_acc": 0.8062214611872146 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 1.8430241346359253, + "learning_rate": 2.279394073699077e-05, + "loss": 0.7026108503341675, + "step": 498, + "token_acc": 0.785983362109559 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.2643704414367676, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7243825197219849, + "step": 499, + "token_acc": 0.7818732643271901 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 2.194952964782715, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5638291835784912, + "step": 500, + "token_acc": 0.8303964757709251 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 1.3642157316207886, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6388370394706726, + "step": 501, + "token_acc": 0.8047690014903129 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 1.4096916913986206, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8699530363082886, + "step": 502, + "token_acc": 0.7426746977039084 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.6735522150993347, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.9338130950927734, + "step": 503, + "token_acc": 0.7246069109818764 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 3.0893852710723877, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6764394044876099, + "step": 504, + "token_acc": 0.7987681647579636 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 1.2103800773620605, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7435534596443176, + "step": 505, + "token_acc": 0.7749155088246339 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 1.6574653387069702, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6575552225112915, + "step": 506, + "token_acc": 0.7954854039375424 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 3.2512946128845215, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6957029104232788, + "step": 507, + "token_acc": 0.790222367560497 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 1.6446380615234375, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8102457523345947, + "step": 508, + "token_acc": 0.7554084174642717 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 2.266608715057373, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7922036051750183, + "step": 509, + "token_acc": 0.7567540772319437 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 1.3823511600494385, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8182840943336487, + "step": 510, + "token_acc": 0.7597468183960676 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 2.875134229660034, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.758751392364502, + "step": 511, + "token_acc": 0.7762652146060218 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 0.9661290049552917, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8285502791404724, + "step": 512, + "token_acc": 0.7517256372628948 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 0.8895630240440369, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.8042497038841248, + "step": 513, + "token_acc": 0.7564245365581987 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 1.1554466485977173, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7614545226097107, + "step": 514, + "token_acc": 0.7749671279193538 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 2.6851818561553955, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.852085530757904, + "step": 515, + "token_acc": 0.7448673497214539 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.071006178855896, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7973021268844604, + "step": 516, + "token_acc": 0.7651457615236315 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 1.7251087427139282, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8796536326408386, + "step": 517, + "token_acc": 0.7393803896518684 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 0.8552775979042053, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7860521078109741, + "step": 518, + "token_acc": 0.7619782361539711 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 1.719724178314209, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8427704572677612, + "step": 519, + "token_acc": 0.7528826254065241 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 0.9758151173591614, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.8721702098846436, + "step": 520, + "token_acc": 0.7431514121894245 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 1.168480396270752, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8419342637062073, + "step": 521, + "token_acc": 0.7471320023837902 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 1.2203398942947388, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7959424257278442, + "step": 522, + "token_acc": 0.7663697898111863 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 1.0408990383148193, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7919071912765503, + "step": 523, + "token_acc": 0.7651286474054909 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 1.310434103012085, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8253304958343506, + "step": 524, + "token_acc": 0.75065126566724 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 1.0451242923736572, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7233434915542603, + "step": 525, + "token_acc": 0.7851820128479657 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 2.0899829864501953, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8267189264297485, + "step": 526, + "token_acc": 0.7562781712813909 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.255731225013733, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8266547322273254, + "step": 527, + "token_acc": 0.7522840531561462 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 1.7167625427246094, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.8521392941474915, + "step": 528, + "token_acc": 0.7510395283962313 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 1.0622138977050781, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8637402653694153, + "step": 529, + "token_acc": 0.7384504331087585 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 0.9813028573989868, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8480241894721985, + "step": 530, + "token_acc": 0.7536379362979546 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 4.28452730178833, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6397439241409302, + "step": 531, + "token_acc": 0.803735568791823 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 1.437615990638733, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9618914127349854, + "step": 532, + "token_acc": 0.7202291690698658 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 1.5095962285995483, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.7862619161605835, + "step": 533, + "token_acc": 0.7709383172800919 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 1.4545536041259766, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.877753496170044, + "step": 534, + "token_acc": 0.7414333585558318 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 3.5752525329589844, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.754334568977356, + "step": 535, + "token_acc": 0.7730709984595995 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 0.9353688955307007, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8347004055976868, + "step": 536, + "token_acc": 0.7475584067407124 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 4.231163501739502, + "learning_rate": 1.809595995707573e-05, + "loss": 0.8207680583000183, + "step": 537, + "token_acc": 0.7532355478861087 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 6.469966411590576, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7109387516975403, + "step": 538, + "token_acc": 0.7860278826157283 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 3.1630420684814453, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6461949348449707, + "step": 539, + "token_acc": 0.8017308524448291 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 1.0982550382614136, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8327257633209229, + "step": 540, + "token_acc": 0.7495007244390492 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 3.802609443664551, + "learning_rate": 1.762553672556591e-05, + "loss": 0.8171138763427734, + "step": 541, + "token_acc": 0.7566524822695035 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.0654925107955933, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7269375324249268, + "step": 542, + "token_acc": 0.7761418269230769 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 4.295766353607178, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.6608070731163025, + "step": 543, + "token_acc": 0.800157433828594 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 8.248258590698242, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7909623980522156, + "step": 544, + "token_acc": 0.7613503425992981 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.1179834604263306, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7602176666259766, + "step": 545, + "token_acc": 0.7709024552090246 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 2.3431406021118164, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6769133806228638, + "step": 546, + "token_acc": 0.7952830188679245 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 4.3784613609313965, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8144751787185669, + "step": 547, + "token_acc": 0.7544433094994892 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 1.7156646251678467, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8162662386894226, + "step": 548, + "token_acc": 0.7523768777334094 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 1.510075330734253, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7336026430130005, + "step": 549, + "token_acc": 0.7803434417245159 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 1.9461703300476074, + "learning_rate": 1.65777536651945e-05, + "loss": 0.7254256010055542, + "step": 550, + "token_acc": 0.7800743813474467 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 1.164979338645935, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.805265486240387, + "step": 551, + "token_acc": 0.7578671900556101 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 1.0273913145065308, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8320894241333008, + "step": 552, + "token_acc": 0.7525619764425735 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.8113181591033936, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.7513222694396973, + "step": 553, + "token_acc": 0.7729531069216634 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 2.532973527908325, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.706010103225708, + "step": 554, + "token_acc": 0.7890974084003575 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.9803953170776367, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.8844308257102966, + "step": 555, + "token_acc": 0.7387483137799943 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 3.6705994606018066, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7106630206108093, + "step": 556, + "token_acc": 0.7811320754716982 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 4.300747394561768, + "learning_rate": 1.577407047339834e-05, + "loss": 0.8109298944473267, + "step": 557, + "token_acc": 0.7626044755998922 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 1.2714130878448486, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6885141134262085, + "step": 558, + "token_acc": 0.7883173946756268 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 1.7359731197357178, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8751633167266846, + "step": 559, + "token_acc": 0.740814826910516 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 1.4216480255126953, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.820943295955658, + "step": 560, + "token_acc": 0.7575292646891693 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 4.9061760902404785, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.748153567314148, + "step": 561, + "token_acc": 0.7805115166018546 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 1.267930030822754, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.7889722585678101, + "step": 562, + "token_acc": 0.7689055058530289 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 0.9083903431892395, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8080474138259888, + "step": 563, + "token_acc": 0.7599738658173057 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 0.7936918139457703, + "learning_rate": 1.498127917242148e-05, + "loss": 0.9597259759902954, + "step": 564, + "token_acc": 0.720810821167184 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 2.1689324378967285, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7804182767868042, + "step": 565, + "token_acc": 0.7724068479355488 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 2.234748601913452, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8393502831459045, + "step": 566, + "token_acc": 0.7503378646951268 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 1.605635404586792, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7155381441116333, + "step": 567, + "token_acc": 0.7872617578499932 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 1.4522089958190918, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.7572216987609863, + "step": 568, + "token_acc": 0.7713926653718725 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 1.9692518711090088, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.8563569784164429, + "step": 569, + "token_acc": 0.7470536883457005 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 10.908825874328613, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7974921464920044, + "step": 570, + "token_acc": 0.7605943594506085 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 1.1746379137039185, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7666845321655273, + "step": 571, + "token_acc": 0.7709790209790209 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 1.0229063034057617, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7350344061851501, + "step": 572, + "token_acc": 0.7786911497811466 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 0.9891268610954285, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6754674315452576, + "step": 573, + "token_acc": 0.7943711387384639 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.231886386871338, + "learning_rate": 1.38694668528633e-05, + "loss": 0.8030673265457153, + "step": 574, + "token_acc": 0.7635471587580551 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 1.0724684000015259, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8548064827919006, + "step": 575, + "token_acc": 0.7461031175059952 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 1.5738338232040405, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.8126094341278076, + "step": 576, + "token_acc": 0.7611274150158963 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 1.4901602268218994, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8209086656570435, + "step": 577, + "token_acc": 0.7550751384128658 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 1.6848169565200806, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6577416658401489, + "step": 578, + "token_acc": 0.8033895475037569 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 3.016223907470703, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.6531224846839905, + "step": 579, + "token_acc": 0.8058121432278152 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.9795825481414795, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7647002339363098, + "step": 580, + "token_acc": 0.7752119263373283 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 2.140911817550659, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7398731708526611, + "step": 581, + "token_acc": 0.7717614002224433 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 1.2959418296813965, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.9219870567321777, + "step": 582, + "token_acc": 0.735004404580764 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 3.881425619125366, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6551182866096497, + "step": 583, + "token_acc": 0.800154768814084 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 0.6841437220573425, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8579003214836121, + "step": 584, + "token_acc": 0.7427914321021557 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 2.339364528656006, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7305861711502075, + "step": 585, + "token_acc": 0.7815454841865015 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 1.287462592124939, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7356473207473755, + "step": 586, + "token_acc": 0.7739403453689168 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 1.0997488498687744, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8273265361785889, + "step": 587, + "token_acc": 0.7510488803518173 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 2.9153354167938232, + "learning_rate": 1.235856566555039e-05, + "loss": 0.6755957007408142, + "step": 588, + "token_acc": 0.7906052393857272 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.6633471250534058, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.730632483959198, + "step": 589, + "token_acc": 0.7806400809944316 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 2.127331495285034, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.6703206300735474, + "step": 590, + "token_acc": 0.7975905830421188 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 1.4636554718017578, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.7496579885482788, + "step": 591, + "token_acc": 0.7742579196807183 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 2.0527307987213135, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.6405739188194275, + "step": 592, + "token_acc": 0.80549558390579 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.2344170808792114, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7799682021141052, + "step": 593, + "token_acc": 0.7664561072082178 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 5.459070205688477, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8071370124816895, + "step": 594, + "token_acc": 0.7617416829745597 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.069473147392273, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7295643091201782, + "step": 595, + "token_acc": 0.776476912968162 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 3.8844616413116455, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6706807017326355, + "step": 596, + "token_acc": 0.7991722152240418 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 5.004199028015137, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8247233033180237, + "step": 597, + "token_acc": 0.7518777783455112 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 3.0730934143066406, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8894381523132324, + "step": 598, + "token_acc": 0.7409200968523002 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 1.2874910831451416, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.71524977684021, + "step": 599, + "token_acc": 0.7803266787658802 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 1.2464348077774048, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7700718641281128, + "step": 600, + "token_acc": 0.7670187496841361 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 3.6714982986450195, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7547957897186279, + "step": 601, + "token_acc": 0.7734226755218216 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 0.8484803438186646, + "learning_rate": 1.090734344462458e-05, + "loss": 0.8919792175292969, + "step": 602, + "token_acc": 0.7393400901906505 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 13.488743782043457, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.7702862620353699, + "step": 603, + "token_acc": 0.7727465986394558 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 1.961902141571045, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.7595404386520386, + "step": 604, + "token_acc": 0.7702451257988836 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 27.53681755065918, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.6995214223861694, + "step": 605, + "token_acc": 0.787663379958725 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 0.8332082629203796, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.9005197286605835, + "step": 606, + "token_acc": 0.737596511295396 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 0.8233015537261963, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.8386024832725525, + "step": 607, + "token_acc": 0.7470095378616219 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 1.1943548917770386, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.7929884791374207, + "step": 608, + "token_acc": 0.7622805984214867 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 0.8096246719360352, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.80124831199646, + "step": 609, + "token_acc": 0.7553728275088768 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 1.0610454082489014, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.6171380281448364, + "step": 610, + "token_acc": 0.8159301496792587 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 18.28238296508789, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.650100588798523, + "step": 611, + "token_acc": 0.7978654890054283 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 3.4466676712036133, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7620124220848083, + "step": 612, + "token_acc": 0.7711020108795306 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 1.2529813051223755, + "learning_rate": 9.813437667457229e-06, + "loss": 0.6602888703346252, + "step": 613, + "token_acc": 0.8008800880088008 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 1.17232346534729, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8434534072875977, + "step": 614, + "token_acc": 0.7494439855118511 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 1.747151494026184, + "learning_rate": 9.619210235484333e-06, + "loss": 0.7442387938499451, + "step": 615, + "token_acc": 0.7745351402458241 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 1.0021146535873413, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7317293882369995, + "step": 616, + "token_acc": 0.7734412184673964 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.3337068557739258, + "learning_rate": 9.426465236041651e-06, + "loss": 0.7032402753829956, + "step": 617, + "token_acc": 0.7877114998566103 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 1.3676468133926392, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7973721027374268, + "step": 618, + "token_acc": 0.760376150854217 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 3.2059834003448486, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8150185346603394, + "step": 619, + "token_acc": 0.7556632064590542 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 4.086306571960449, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7822086811065674, + "step": 620, + "token_acc": 0.7675454095695808 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.2040249109268188, + "learning_rate": 9.04549669873337e-06, + "loss": 0.8220715522766113, + "step": 621, + "token_acc": 0.7524804177545692 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 1.4175060987472534, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6137598752975464, + "step": 622, + "token_acc": 0.8119511672735061 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 1.2992089986801147, + "learning_rate": 8.857309879408324e-06, + "loss": 0.6729296445846558, + "step": 623, + "token_acc": 0.7988444254226407 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 1.4079190492630005, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8189102411270142, + "step": 624, + "token_acc": 0.7577023215448037 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 1.279236078262329, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8362364172935486, + "step": 625, + "token_acc": 0.7482024803358587 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 1.2863163948059082, + "learning_rate": 8.577952526423969e-06, + "loss": 0.8098462820053101, + "step": 626, + "token_acc": 0.7593269058027426 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 27.66785430908203, + "learning_rate": 8.48562182685487e-06, + "loss": 0.7063795328140259, + "step": 627, + "token_acc": 0.7867946863080363 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 4.928782939910889, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6462287902832031, + "step": 628, + "token_acc": 0.8011155656266341 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 1.9602354764938354, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6783524751663208, + "step": 629, + "token_acc": 0.7902308752584425 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 16.4473876953125, + "learning_rate": 8.211026128824539e-06, + "loss": 0.804925799369812, + "step": 630, + "token_acc": 0.7570687117514912 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 1.3788988590240479, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8883236646652222, + "step": 631, + "token_acc": 0.7334713259466699 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 1.8335654735565186, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6375362873077393, + "step": 632, + "token_acc": 0.8153648894112618 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 1.9014967679977417, + "learning_rate": 7.940071245792579e-06, + "loss": 0.6049902439117432, + "step": 633, + "token_acc": 0.8161649828142902 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 1.3713113069534302, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6988447904586792, + "step": 634, + "token_acc": 0.7880343393220639 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 2.0989935398101807, + "learning_rate": 7.761486381573327e-06, + "loss": 0.7015566229820251, + "step": 635, + "token_acc": 0.7867938866841172 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 2.8194093704223633, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7713178992271423, + "step": 636, + "token_acc": 0.7664939550949914 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 2.2756409645080566, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8152978420257568, + "step": 637, + "token_acc": 0.7565742546007894 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 2.1602797508239746, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.6049292087554932, + "step": 638, + "token_acc": 0.8249440056583756 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 11.161283493041992, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9276903867721558, + "step": 639, + "token_acc": 0.7289690681738996 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 1.107016921043396, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.7289862632751465, + "step": 640, + "token_acc": 0.7762255053470978 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 1.384218692779541, + "learning_rate": 7.235768739040258e-06, + "loss": 0.8030155897140503, + "step": 641, + "token_acc": 0.7603261596043309 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 2.4319992065429688, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8239895105361938, + "step": 642, + "token_acc": 0.7537327021121631 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 1.7713115215301514, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9458705186843872, + "step": 643, + "token_acc": 0.7223184753504489 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 1.1825437545776367, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.8767014145851135, + "step": 644, + "token_acc": 0.7381348433905504 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 9.377113342285156, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7727670669555664, + "step": 645, + "token_acc": 0.7667001312842691 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 1.6212266683578491, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7251728177070618, + "step": 646, + "token_acc": 0.7853043560071502 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 1.0910215377807617, + "learning_rate": 6.725459488639211e-06, + "loss": 0.8785561919212341, + "step": 647, + "token_acc": 0.7388308513002889 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 2.236516237258911, + "learning_rate": 6.641937264107867e-06, + "loss": 0.7488150596618652, + "step": 648, + "token_acc": 0.7735017626321974 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 2.128631114959717, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6163979768753052, + "step": 649, + "token_acc": 0.810862691960253 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 1.3468025922775269, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8207809329032898, + "step": 650, + "token_acc": 0.7570913888466028 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 3.4600303173065186, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8186502456665039, + "step": 651, + "token_acc": 0.7548624496232696 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 3.5918667316436768, + "learning_rate": 6.312291828435077e-06, + "loss": 0.6305141448974609, + "step": 652, + "token_acc": 0.8072335886744885 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 1.0806105136871338, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7253304719924927, + "step": 653, + "token_acc": 0.7833950441469667 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 1.2885851860046387, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8548451066017151, + "step": 654, + "token_acc": 0.7464474922018122 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 1.0645694732666016, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8382260799407959, + "step": 655, + "token_acc": 0.7489557422443328 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 1.9353832006454468, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7723536491394043, + "step": 656, + "token_acc": 0.7694327731092437 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 4.828452110290527, + "learning_rate": 5.910380944855087e-06, + "loss": 0.8856979608535767, + "step": 657, + "token_acc": 0.738218359188763 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 1.8781278133392334, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.7738165259361267, + "step": 658, + "token_acc": 0.768805515870551 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 3.0246331691741943, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8133803606033325, + "step": 659, + "token_acc": 0.7611378205128205 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 1.3994319438934326, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7647578120231628, + "step": 660, + "token_acc": 0.7703229113275244 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 2.361185312271118, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7304031252861023, + "step": 661, + "token_acc": 0.7841618588477041 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 0.8526070713996887, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7237846255302429, + "step": 662, + "token_acc": 0.7868933969769292 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 1.588171362876892, + "learning_rate": 5.443287214979592e-06, + "loss": 0.6091185212135315, + "step": 663, + "token_acc": 0.8140839427025944 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 5.0973029136657715, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6413316130638123, + "step": 664, + "token_acc": 0.804970235283001 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 1.4185309410095215, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6981616020202637, + "step": 665, + "token_acc": 0.7925278219395866 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.9851809740066528, + "learning_rate": 5.216076783983493e-06, + "loss": 0.690722644329071, + "step": 666, + "token_acc": 0.7912854528819762 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 0.9478880763053894, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8563956022262573, + "step": 667, + "token_acc": 0.7468872958551178 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 3.0436248779296875, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8058983683586121, + "step": 668, + "token_acc": 0.7552821610056165 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 0.8428975939750671, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8022825717926025, + "step": 669, + "token_acc": 0.7613861386138614 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 4.840924263000488, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8100841641426086, + "step": 670, + "token_acc": 0.7554166666666666 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 1.1505413055419922, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8260376453399658, + "step": 671, + "token_acc": 0.7448619472700851 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 0.9072193503379822, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8600703477859497, + "step": 672, + "token_acc": 0.7444852298549205 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 1.7683610916137695, + "learning_rate": 4.702687000087386e-06, + "loss": 0.692681610584259, + "step": 673, + "token_acc": 0.7806238492364346 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 1.461195468902588, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7662481069564819, + "step": 674, + "token_acc": 0.7671449553722743 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 3.3718554973602295, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7405479550361633, + "step": 675, + "token_acc": 0.7750420168067227 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 2.9479410648345947, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8610312938690186, + "step": 676, + "token_acc": 0.7424875170222424 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 13.503181457519531, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7888531684875488, + "step": 677, + "token_acc": 0.765451076009753 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 0.7887119054794312, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7960864305496216, + "step": 678, + "token_acc": 0.7637773578963942 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 0.7959216237068176, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.8545209169387817, + "step": 679, + "token_acc": 0.7468409007993101 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 2.6820693016052246, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7095437049865723, + "step": 680, + "token_acc": 0.7877780240892632 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 1.3040446043014526, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7295015454292297, + "step": 681, + "token_acc": 0.7838582677165354 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.168471336364746, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7117878794670105, + "step": 682, + "token_acc": 0.7835704178148507 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 4.244610786437988, + "learning_rate": 4.010984790046615e-06, + "loss": 0.677824079990387, + "step": 683, + "token_acc": 0.7980658751436231 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 2.731039047241211, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8463807702064514, + "step": 684, + "token_acc": 0.7515052317764658 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 1.8785216808319092, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6157097816467285, + "step": 685, + "token_acc": 0.8154915079773546 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 0.865153431892395, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8836787939071655, + "step": 686, + "token_acc": 0.7380481451107145 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 0.8936150074005127, + "learning_rate": 3.748372666094277e-06, + "loss": 0.8360207676887512, + "step": 687, + "token_acc": 0.7508485460049537 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 2.322671890258789, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7108975052833557, + "step": 688, + "token_acc": 0.7858799072519389 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 3.3480117321014404, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.6993001699447632, + "step": 689, + "token_acc": 0.7873237489632292 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.8085229396820068, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7427332997322083, + "step": 690, + "token_acc": 0.7776805599745467 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 1.3708637952804565, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6952468752861023, + "step": 691, + "token_acc": 0.794788931528984 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 3.7617907524108887, + "learning_rate": 3.431640350555204e-06, + "loss": 0.6230769157409668, + "step": 692, + "token_acc": 0.8099717779868297 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 1.36726713180542, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6950256824493408, + "step": 693, + "token_acc": 0.7924514890894875 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 0.9996148943901062, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8100589513778687, + "step": 694, + "token_acc": 0.7537666602279313 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.661024570465088, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7753657102584839, + "step": 695, + "token_acc": 0.7681395005172159 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 2.1857688426971436, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7994472980499268, + "step": 696, + "token_acc": 0.759318423855165 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 3.475571870803833, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.7001972198486328, + "step": 697, + "token_acc": 0.7877510538060997 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.2787102460861206, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8403792977333069, + "step": 698, + "token_acc": 0.747796232717825 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 4.386336326599121, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8107684850692749, + "step": 699, + "token_acc": 0.7630341042728341 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 2.2676963806152344, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8950088024139404, + "step": 700, + "token_acc": 0.7388262048456223 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 1.0399364233016968, + "learning_rate": 2.894385171586095e-06, + "loss": 0.8310389518737793, + "step": 701, + "token_acc": 0.7524891179266523 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.593347191810608, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8382736444473267, + "step": 702, + "token_acc": 0.7514249790444258 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 1.2109148502349854, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6921058893203735, + "step": 703, + "token_acc": 0.787412490469259 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 0.9180388450622559, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8293173313140869, + "step": 704, + "token_acc": 0.757765414928141 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.0169309377670288, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7837424278259277, + "step": 705, + "token_acc": 0.7702204734245206 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 2.0241503715515137, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7397447824478149, + "step": 706, + "token_acc": 0.782954903815831 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 3.890124559402466, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7422389984130859, + "step": 707, + "token_acc": 0.7778991727797722 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.0221773386001587, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8820300698280334, + "step": 708, + "token_acc": 0.7368034292712798 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 1.0830367803573608, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8977921009063721, + "step": 709, + "token_acc": 0.7326030349286163 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 1.0371887683868408, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.7248738408088684, + "step": 710, + "token_acc": 0.7812835915270313 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 1.263805866241455, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7425920963287354, + "step": 711, + "token_acc": 0.7737332204619664 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 14.53322696685791, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8866590261459351, + "step": 712, + "token_acc": 0.7439101885193815 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 1.5575921535491943, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.7303316593170166, + "step": 713, + "token_acc": 0.7762118300234893 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 1.711562156677246, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9044393301010132, + "step": 714, + "token_acc": 0.729759955266206 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 1.9925239086151123, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7561551928520203, + "step": 715, + "token_acc": 0.775 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 1.4626455307006836, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7318213582038879, + "step": 716, + "token_acc": 0.7775335492827394 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 1.060317039489746, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.8696292638778687, + "step": 717, + "token_acc": 0.7421656220829443 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 0.9130681157112122, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7886737585067749, + "step": 718, + "token_acc": 0.7600247142415817 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.1878103017807007, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.762123703956604, + "step": 719, + "token_acc": 0.7682668745823124 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 1.7159684896469116, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.615555465221405, + "step": 720, + "token_acc": 0.8126673532440782 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 1.6527683734893799, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6307755708694458, + "step": 721, + "token_acc": 0.8067388444804209 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 3.193925619125366, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8727781176567078, + "step": 722, + "token_acc": 0.7392866177586643 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 0.9598880410194397, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.8311202526092529, + "step": 723, + "token_acc": 0.7487229203176852 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 2.1851632595062256, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7448897957801819, + "step": 724, + "token_acc": 0.7755723861756768 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 1.598838448524475, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7494593858718872, + "step": 725, + "token_acc": 0.7767838568753901 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 2.4717111587524414, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7850619554519653, + "step": 726, + "token_acc": 0.7650719167601755 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.356717586517334, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7940848469734192, + "step": 727, + "token_acc": 0.768211150514505 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 10.029845237731934, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7329187393188477, + "step": 728, + "token_acc": 0.7865592568401191 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 0.8495982885360718, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.8017995953559875, + "step": 729, + "token_acc": 0.7568345323741007 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 1.0362679958343506, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.7437936663627625, + "step": 730, + "token_acc": 0.7828212859587645 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 0.9663056135177612, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8609859943389893, + "step": 731, + "token_acc": 0.7439180537772087 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 1.3956825733184814, + "learning_rate": 1.379848838328049e-06, + "loss": 0.7277930378913879, + "step": 732, + "token_acc": 0.7791022255752547 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 3.7636775970458984, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7486779093742371, + "step": 733, + "token_acc": 0.7818169417541945 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 1.315354347229004, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8382982611656189, + "step": 734, + "token_acc": 0.7525453258561551 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.1111931800842285, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8941514492034912, + "step": 735, + "token_acc": 0.7349274757866444 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 1.297447919845581, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8244005441665649, + "step": 736, + "token_acc": 0.7516801237731471 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.0711147785186768, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6347471475601196, + "step": 737, + "token_acc": 0.8084218512898331 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 1.7543067932128906, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.7033067941665649, + "step": 738, + "token_acc": 0.7927236056163215 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 1.6257784366607666, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7322490215301514, + "step": 739, + "token_acc": 0.776595744680851 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 1.1702452898025513, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.748277485370636, + "step": 740, + "token_acc": 0.7742450209798475 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 1.2065194845199585, + "learning_rate": 1.041156686749717e-06, + "loss": 0.814299464225769, + "step": 741, + "token_acc": 0.7569658605204783 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.3025304079055786, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.723736047744751, + "step": 742, + "token_acc": 0.7832843667852173 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 1.5178861618041992, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8111813068389893, + "step": 743, + "token_acc": 0.7574536219081273 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 1.1835012435913086, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6973958015441895, + "step": 744, + "token_acc": 0.7883607669070958 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 1.0553349256515503, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8839579224586487, + "step": 745, + "token_acc": 0.7393556055524897 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 2.3524389266967773, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7688311338424683, + "step": 746, + "token_acc": 0.770196330865787 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 2.358461380004883, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7249113321304321, + "step": 747, + "token_acc": 0.7800233725166701 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 0.9818371534347534, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8962013721466064, + "step": 748, + "token_acc": 0.7347520288548242 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 1.4014264345169067, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8181411027908325, + "step": 749, + "token_acc": 0.7530269496159354 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 2.099468469619751, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7440256476402283, + "step": 750, + "token_acc": 0.7781477466315626 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 1.3900328874588013, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7947307229042053, + "step": 751, + "token_acc": 0.763049013367282 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 1.937106966972351, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6677680611610413, + "step": 752, + "token_acc": 0.7976190476190477 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 2.1338562965393066, + "learning_rate": 6.623969226072363e-07, + "loss": 0.912758469581604, + "step": 753, + "token_acc": 0.7364955399869837 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 1.8719439506530762, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8942464590072632, + "step": 754, + "token_acc": 0.7314372211599746 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.125182032585144, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7492611408233643, + "step": 755, + "token_acc": 0.7720939624419465 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 5.945156097412109, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7720708847045898, + "step": 756, + "token_acc": 0.7700412614205717 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 1.3858574628829956, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7861109972000122, + "step": 757, + "token_acc": 0.7625415642619633 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 3.03468656539917, + "learning_rate": 5.294312162731934e-07, + "loss": 0.7062956094741821, + "step": 758, + "token_acc": 0.7871165644171779 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 1.1258817911148071, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7970366477966309, + "step": 759, + "token_acc": 0.7655379339905701 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 1.3906890153884888, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7870966196060181, + "step": 760, + "token_acc": 0.7596698397397277 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 1.0741008520126343, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.7451232671737671, + "step": 761, + "token_acc": 0.7724817286304417 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 1.251846194267273, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7417510151863098, + "step": 762, + "token_acc": 0.773992627431041 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 2.0354645252227783, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.738898515701294, + "step": 763, + "token_acc": 0.7741708247725272 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 3.412504196166992, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.635358452796936, + "step": 764, + "token_acc": 0.8070014872440224 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 2.2815067768096924, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7735419273376465, + "step": 765, + "token_acc": 0.7652030509173366 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 2.218057870864868, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7568934559822083, + "step": 766, + "token_acc": 0.7767891934017405 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 1.2979291677474976, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8270889520645142, + "step": 767, + "token_acc": 0.7507336930796176 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 1.37172269821167, + "learning_rate": 3.077914851215585e-07, + "loss": 0.7350165247917175, + "step": 768, + "token_acc": 0.7841965471447543 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 5.036166667938232, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.8009260892868042, + "step": 769, + "token_acc": 0.7600553949903661 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 7.4999775886535645, + "learning_rate": 2.705872508804747e-07, + "loss": 0.6270233392715454, + "step": 770, + "token_acc": 0.8136564762670957 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 1.1216583251953125, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8184903860092163, + "step": 771, + "token_acc": 0.7551860202931229 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 3.301800489425659, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6371257305145264, + "step": 772, + "token_acc": 0.8157470801449859 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 3.2778139114379883, + "learning_rate": 2.192509677903687e-07, + "loss": 0.8046694993972778, + "step": 773, + "token_acc": 0.7623718671832851 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 1.263893485069275, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.84852534532547, + "step": 774, + "token_acc": 0.74725317090096 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 0.9263530969619751, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.7684552073478699, + "step": 775, + "token_acc": 0.7751570594070318 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 1.1419495344161987, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7462726831436157, + "step": 776, + "token_acc": 0.7782109441451659 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 3.4947397708892822, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.7795302271842957, + "step": 777, + "token_acc": 0.7635372501514234 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 2.087082862854004, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6606072783470154, + "step": 778, + "token_acc": 0.801208930486497 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 1.6553760766983032, + "learning_rate": 1.327100431795125e-07, + "loss": 0.7052230834960938, + "step": 779, + "token_acc": 0.7852637614678899 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 1.1143925189971924, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.8552008867263794, + "step": 780, + "token_acc": 0.7460056792911149 + }, + { + "epoch": 1.95369211514393, + "grad_norm": 1.6910258531570435, + "learning_rate": 1.0865311416741742e-07, + "loss": 0.787244975566864, + "step": 781, + "token_acc": 0.7597416764847057 + }, + { + "epoch": 1.9561952440550687, + "grad_norm": 0.9978480935096741, + "learning_rate": 9.752416870782155e-08, + "loss": 0.7427728176116943, + "step": 782, + "token_acc": 0.7691592363656256 + }, + { + "epoch": 1.9586983729662077, + "grad_norm": 3.087968587875366, + "learning_rate": 8.699526497563393e-08, + "loss": 0.6246906518936157, + "step": 783, + "token_acc": 0.8059849823321554 + }, + { + "epoch": 1.9612015018773468, + "grad_norm": 1.87112557888031, + "learning_rate": 7.706665667180091e-08, + "loss": 0.7229409217834473, + "step": 784, + "token_acc": 0.7798822819197102 + }, + { + "epoch": 1.9637046307884856, + "grad_norm": 4.381481170654297, + "learning_rate": 6.773858303274483e-08, + "loss": 0.7285189032554626, + "step": 785, + "token_acc": 0.7791870174885773 + }, + { + "epoch": 1.9662077596996246, + "grad_norm": 1.4539693593978882, + "learning_rate": 5.90112688246075e-08, + "loss": 0.8223809599876404, + "step": 786, + "token_acc": 0.7561250563655494 + }, + { + "epoch": 1.9687108886107634, + "grad_norm": 1.4071216583251953, + "learning_rate": 5.088492433783509e-08, + "loss": 0.6294353008270264, + "step": 787, + "token_acc": 0.8072788987365642 + }, + { + "epoch": 1.9712140175219024, + "grad_norm": 13.996487617492676, + "learning_rate": 4.335974538210441e-08, + "loss": 0.772925853729248, + "step": 788, + "token_acc": 0.7683742932964117 + }, + { + "epoch": 1.9737171464330414, + "grad_norm": 1.589355707168579, + "learning_rate": 3.6435913281607225e-08, + "loss": 0.7730788588523865, + "step": 789, + "token_acc": 0.7694374776065926 + }, + { + "epoch": 1.9762202753441802, + "grad_norm": 1.9809443950653076, + "learning_rate": 3.011359487068987e-08, + "loss": 0.7273301482200623, + "step": 790, + "token_acc": 0.7792143824652137 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.85566833380216e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..0bfcdf27206e894a799c26b9eb6965d540f808ed --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:49bbae92e24511cb6a61f553f51f6da390fae05a846251b575d4676e27bb1834 +size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-790/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..cd3083a2f9ca37f7fc284335aadba7cc853e4df3 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(k_proj|down_proj|v_proj|gate_proj|o_proj|up_proj|q_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|mlp.2|gate_proj|up_proj|qkv|attn.proj|mlp.0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4d6859aa28d7517526a3899d9c1385006db38fc0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6793d4aad441bf34c8604d0ab3990de489725f7190849ce72095281ebf0eb86d +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/args.json new file mode 100644 index 0000000000000000000000000000000000000000..9b753b9c8e377ab5e62ab9a96bbb206e688a8b12 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..d4c138dfadf353bfc0d07db49676e5071726de5e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:96a0d77daa5b154542aad2e0539a8a3aa46ddfda5afb9c010d117ac893b6e3e6 +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..55a4b67f66d78fd8a560ccf6730a0b7d71a0c5b9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:613137e1237642d5eb2b23f77ecd3a53cdadd8291c0c120165cdde8510ecbbc8 +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..444d108a2a6f4ef713c201519d70c08361c396e4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d960dcec30ab17eab1094c536b088f371de7c3a1105eee16b9d4888991fcf1f4 +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..fbbc80f1820c1953eab91f203a2362ac673e5b96 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:77e4769f330c7e72b8fb08e965c4b99a2594f629efdc7adb82d2c73bbcdea011 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..6d5e083cf126314ed976cae1c8a52bed9bf2d3b7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:00ac01cb94496cd2d822ac585bcb96b89d5993dcfc772442f224bcc74e9375a3 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..9711c242b7de75926521c1393725bd67aab15dc7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3f62f6e93ca40d5cb77758589ed769055a7d13737dec7612b5f32e6d0affede6 +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..23ef0438e267fdc520736bbb1e65f14d44caf2a9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b5d41f667b6e06e9a6977a55775fbb73adf86abb55f6ac0911aa229779196bff +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..5c2010e7439a61b362d9b5410d9bf10b29379e41 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e7b942f5947a33d4ec577b91a740d8e872f41b3ac72a488bd2d1d878f63e0b71 +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..087664a403572eb963a0d16f69f6cb33ba92a948 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/global_step800/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b988f4ffc48c080c5f88d01e94840ee7b7c776ca0467cb87a846965dd4692cea +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/latest new file mode 100644 index 0000000000000000000000000000000000000000..57729c0be88118cbd582c8c68b4149cee821f0b4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/latest @@ -0,0 +1 @@ +global_step800 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..9fea1f650ebd83d543706c56bea8a40d8ae639b8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:01348eb796c59a97134e33110d52353bfc065891bdd3330bfbe3bc27c79be50c +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..87569a138425129dde22e8e8f33298a98f267c6e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4c2ba393c79f9d6120925e9ed94136472da42c9de68026d66019ca90b3caba04 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..9094b4c577a319c920a45c1b8fc66a8e3352b252 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:759cbc56164fa915ffb0628e8f25d1c68d7cb63c2f97ad3a9a4e6ee564e024e8 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..ee6676fc80ca3fa524ab0e81ae7eb68d8808c223 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c9b260ae266a395525148c33b9a630b55919e61afd92b8fa020ccf871d3395d7 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..12f5a4a7c4aa60f933d62e83efb480f0fae1275b --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d0436f2e1def04a0f11fb1b333bd3b974c300f88ed65df5f9074497f51b4d3d0 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..f9f31a761c075b4ec3fc0d2b7df9d58c4101ad46 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:90b1d17ece9e5f970ba5a68b1a27a50ebe943f27938030ac92cbb85a085e74e8 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..682077bd3824f3068288c4cd57c666b188dac927 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:78d5a287ceb805475f44350e423c9e6bd689e1bf8c7d470473d0a9e29a16f65a +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..5fd0f729444fd9baa37e01a45a95ff34ca5126ef --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5ba608776f6fe6bc1a9295fdc39592b6f973ed50c7e7b35417c7d743a88e781c +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..bd91826e9d23f299fdb2bae445a35337089144fa --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:991fae96e95a86e14f420d2137cda3fb68f453af09b436a8d76fcc42d6c51ba0 +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..f1e99b99f673bc3f10aef04f09a0ecd8a8cf0048 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/trainer_state.json @@ -0,0 +1,6443 @@ +{ + "best_global_step": 800, + "best_metric": 0.53543162, + "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800", + "epoch": 2.0, + "eval_steps": 2000, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 1.8141324520111084, + "learning_rate": 3.125e-07, + "loss": 1.4558331966400146, + "step": 1, + "token_acc": 0.6587197909862835 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 2.7097065448760986, + "learning_rate": 6.25e-07, + "loss": 1.5102750062942505, + "step": 2, + "token_acc": 0.6374107200308861 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 3.731478452682495, + "learning_rate": 9.375e-07, + "loss": 1.4846917390823364, + "step": 3, + "token_acc": 0.6467950044849238 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 1.8039724826812744, + "learning_rate": 1.25e-06, + "loss": 1.4477494955062866, + "step": 4, + "token_acc": 0.6551159771996162 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 4.494865417480469, + "learning_rate": 1.5625e-06, + "loss": 1.4835330247879028, + "step": 5, + "token_acc": 0.636961027144518 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 3.468430995941162, + "learning_rate": 1.875e-06, + "loss": 1.476511001586914, + "step": 6, + "token_acc": 0.6395731577829687 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 1.6436569690704346, + "learning_rate": 2.1875e-06, + "loss": 1.445321798324585, + "step": 7, + "token_acc": 0.6609300016548072 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 5.7237958908081055, + "learning_rate": 2.5e-06, + "loss": 1.4368172883987427, + "step": 8, + "token_acc": 0.6518960374946741 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 1.0010274648666382, + "learning_rate": 2.8125e-06, + "loss": 1.5469402074813843, + "step": 9, + "token_acc": 0.61862263870296 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.2346174716949463, + "learning_rate": 3.125e-06, + "loss": 1.5444755554199219, + "step": 10, + "token_acc": 0.6183196808672615 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 1.349374532699585, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5128525495529175, + "step": 11, + "token_acc": 0.6263652527305055 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 3.90444016456604, + "learning_rate": 3.75e-06, + "loss": 1.468747615814209, + "step": 12, + "token_acc": 0.6539249583813549 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 3.8990912437438965, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4974875450134277, + "step": 13, + "token_acc": 0.6396883067214839 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 4.560666084289551, + "learning_rate": 4.375e-06, + "loss": 1.4603385925292969, + "step": 14, + "token_acc": 0.673594883778133 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 2.1652066707611084, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.4672789573669434, + "step": 15, + "token_acc": 0.67072 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 28.565114974975586, + "learning_rate": 5e-06, + "loss": 1.4323251247406006, + "step": 16, + "token_acc": 0.6802855573860516 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 1.2191154956817627, + "learning_rate": 5.3125e-06, + "loss": 1.5201783180236816, + "step": 17, + "token_acc": 0.6302349336057201 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 3.823606252670288, + "learning_rate": 5.625e-06, + "loss": 1.4549026489257812, + "step": 18, + "token_acc": 0.6533967235651278 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 3.615473508834839, + "learning_rate": 5.9375e-06, + "loss": 1.4218157529830933, + "step": 19, + "token_acc": 0.6625929470661857 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 6.056225776672363, + "learning_rate": 6.25e-06, + "loss": 1.5040549039840698, + "step": 20, + "token_acc": 0.6463865546218487 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 1.1101607084274292, + "learning_rate": 6.5625e-06, + "loss": 1.5186512470245361, + "step": 21, + "token_acc": 0.6336622685441845 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 3.4688284397125244, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4710779190063477, + "step": 22, + "token_acc": 0.649603043334436 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 2.945401906967163, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4556055068969727, + "step": 23, + "token_acc": 0.6511273792093705 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.7959648370742798, + "learning_rate": 7.5e-06, + "loss": 1.4981625080108643, + "step": 24, + "token_acc": 0.6581992406436449 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.836989641189575, + "learning_rate": 7.8125e-06, + "loss": 1.4692087173461914, + "step": 25, + "token_acc": 0.6400229118933556 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 4.335150241851807, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4672834873199463, + "step": 26, + "token_acc": 0.6426897157925578 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 2.6187744140625, + "learning_rate": 8.437500000000002e-06, + "loss": 1.5053527355194092, + "step": 27, + "token_acc": 0.6411245456568504 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 4.596649169921875, + "learning_rate": 8.75e-06, + "loss": 1.495232105255127, + "step": 28, + "token_acc": 0.6582827406764961 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 2.2826857566833496, + "learning_rate": 9.0625e-06, + "loss": 1.4520742893218994, + "step": 29, + "token_acc": 0.6422463489623367 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 1.2480427026748657, + "learning_rate": 9.375000000000001e-06, + "loss": 1.413942575454712, + "step": 30, + "token_acc": 0.6513089987801445 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 1.5732747316360474, + "learning_rate": 9.6875e-06, + "loss": 1.4269421100616455, + "step": 31, + "token_acc": 0.6511775266659626 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 1.305902123451233, + "learning_rate": 1e-05, + "loss": 1.4499857425689697, + "step": 32, + "token_acc": 0.6362675125561723 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 2.718529462814331, + "learning_rate": 1.03125e-05, + "loss": 1.449812412261963, + "step": 33, + "token_acc": 0.6403560135847289 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 1.5598729848861694, + "learning_rate": 1.0625e-05, + "loss": 1.3601875305175781, + "step": 34, + "token_acc": 0.6700675278919553 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 9.867480278015137, + "learning_rate": 1.09375e-05, + "loss": 1.3765363693237305, + "step": 35, + "token_acc": 0.6669165757906216 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 2.136289596557617, + "learning_rate": 1.125e-05, + "loss": 1.410968542098999, + "step": 36, + "token_acc": 0.6567221708294789 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 4.079403400421143, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.488232135772705, + "step": 37, + "token_acc": 0.6309482023767738 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 0.7997560501098633, + "learning_rate": 1.1875e-05, + "loss": 1.313117265701294, + "step": 38, + "token_acc": 0.6665271562409453 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 3.2652623653411865, + "learning_rate": 1.21875e-05, + "loss": 1.4282214641571045, + "step": 39, + "token_acc": 0.6325610612275062 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 3.6540777683258057, + "learning_rate": 1.25e-05, + "loss": 1.3395355939865112, + "step": 40, + "token_acc": 0.6717530163236338 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 5.248533248901367, + "learning_rate": 1.28125e-05, + "loss": 1.3371840715408325, + "step": 41, + "token_acc": 0.6693909833904561 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 3.778581380844116, + "learning_rate": 1.3125e-05, + "loss": 1.3400944471359253, + "step": 42, + "token_acc": 0.6653791581270692 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 1.4495247602462769, + "learning_rate": 1.34375e-05, + "loss": 1.3555524349212646, + "step": 43, + "token_acc": 0.6599288486416559 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 3.1733644008636475, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.323427677154541, + "step": 44, + "token_acc": 0.6751474032792182 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 2.605138063430786, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.344847559928894, + "step": 45, + "token_acc": 0.6617188094694375 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 4.86713981628418, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.306713581085205, + "step": 46, + "token_acc": 0.6737607941796423 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 4.361069202423096, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.2949577569961548, + "step": 47, + "token_acc": 0.6895424836601307 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 1.5775742530822754, + "learning_rate": 1.5e-05, + "loss": 1.3317584991455078, + "step": 48, + "token_acc": 0.6644422636571803 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.20259428024292, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3528285026550293, + "step": 49, + "token_acc": 0.6621909900865856 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 2.1786444187164307, + "learning_rate": 1.5625e-05, + "loss": 1.1999170780181885, + "step": 50, + "token_acc": 0.6959557173490251 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 2.961524248123169, + "learning_rate": 1.59375e-05, + "loss": 1.3457515239715576, + "step": 51, + "token_acc": 0.6627879221864185 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 13.192907333374023, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3237392902374268, + "step": 52, + "token_acc": 0.6542852884185423 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 3.6055777072906494, + "learning_rate": 1.65625e-05, + "loss": 1.3433442115783691, + "step": 53, + "token_acc": 0.6624097352233217 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 1.7857606410980225, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2789276838302612, + "step": 54, + "token_acc": 0.672338649851632 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 2.1665122509002686, + "learning_rate": 1.71875e-05, + "loss": 1.3222646713256836, + "step": 55, + "token_acc": 0.6588819226750261 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 1.7462254762649536, + "learning_rate": 1.75e-05, + "loss": 1.3362858295440674, + "step": 56, + "token_acc": 0.6613744187138898 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 1.2184135913848877, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2202270030975342, + "step": 57, + "token_acc": 0.6888445331559104 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 2.862990379333496, + "learning_rate": 1.8125e-05, + "loss": 1.224043846130371, + "step": 58, + "token_acc": 0.6924242424242424 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 4.461820602416992, + "learning_rate": 1.84375e-05, + "loss": 1.1999526023864746, + "step": 59, + "token_acc": 0.6939597315436241 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 1.0866032838821411, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2586383819580078, + "step": 60, + "token_acc": 0.6740108140886351 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 1.9648689031600952, + "learning_rate": 1.90625e-05, + "loss": 1.2699849605560303, + "step": 61, + "token_acc": 0.6729458695772619 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 0.9302283525466919, + "learning_rate": 1.9375e-05, + "loss": 1.26922607421875, + "step": 62, + "token_acc": 0.6693402228820422 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 1.6925781965255737, + "learning_rate": 1.96875e-05, + "loss": 1.2230749130249023, + "step": 63, + "token_acc": 0.69140625 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 3.138141393661499, + "learning_rate": 2e-05, + "loss": 1.2473464012145996, + "step": 64, + "token_acc": 0.671907957813998 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 84.18292236328125, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2626996040344238, + "step": 65, + "token_acc": 0.6641408513483397 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 1.1837621927261353, + "learning_rate": 2.0625e-05, + "loss": 1.2514493465423584, + "step": 66, + "token_acc": 0.6728548072359053 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 2.1558518409729004, + "learning_rate": 2.09375e-05, + "loss": 1.1905746459960938, + "step": 67, + "token_acc": 0.707898979043525 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 2.1352062225341797, + "learning_rate": 2.125e-05, + "loss": 1.2563612461090088, + "step": 68, + "token_acc": 0.6748354235740714 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 4.160109996795654, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.2178868055343628, + "step": 69, + "token_acc": 0.6880837359098229 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 2.219675064086914, + "learning_rate": 2.1875e-05, + "loss": 1.201242208480835, + "step": 70, + "token_acc": 0.6804117879970587 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 4.043488502502441, + "learning_rate": 2.21875e-05, + "loss": 1.2328397035598755, + "step": 71, + "token_acc": 0.6700484108608714 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 1.675660490989685, + "learning_rate": 2.25e-05, + "loss": 1.2181830406188965, + "step": 72, + "token_acc": 0.6850481125092525 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 3.0427443981170654, + "learning_rate": 2.28125e-05, + "loss": 1.0783236026763916, + "step": 73, + "token_acc": 0.7167288053169071 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 11.553773880004883, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.1844292879104614, + "step": 74, + "token_acc": 0.6924296745725317 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 1.2728339433670044, + "learning_rate": 2.34375e-05, + "loss": 1.1743783950805664, + "step": 75, + "token_acc": 0.6912672045562411 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 2.9700307846069336, + "learning_rate": 2.375e-05, + "loss": 1.0269439220428467, + "step": 76, + "token_acc": 0.7346795022305705 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 2.9078361988067627, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1813220977783203, + "step": 77, + "token_acc": 0.6883013798998657 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 3.9725077152252197, + "learning_rate": 2.4375e-05, + "loss": 1.203944444656372, + "step": 78, + "token_acc": 0.6775247733502003 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 1.538577914237976, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.216745138168335, + "step": 79, + "token_acc": 0.6754992693619094 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 1.9446707963943481, + "learning_rate": 2.5e-05, + "loss": 1.2227823734283447, + "step": 80, + "token_acc": 0.6712661046604104 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 1.4078911542892456, + "learning_rate": 2.53125e-05, + "loss": 1.1703464984893799, + "step": 81, + "token_acc": 0.6871378910776361 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 0.8193759918212891, + "learning_rate": 2.5625e-05, + "loss": 1.2597627639770508, + "step": 82, + "token_acc": 0.6600334448160535 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 1.5110586881637573, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.147017240524292, + "step": 83, + "token_acc": 0.6880786212790201 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 2.4486095905303955, + "learning_rate": 2.625e-05, + "loss": 1.1736788749694824, + "step": 84, + "token_acc": 0.6902223116386681 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 15.185917854309082, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0476911067962646, + "step": 85, + "token_acc": 0.7218877279971666 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 1.7706151008605957, + "learning_rate": 2.6875e-05, + "loss": 1.1720056533813477, + "step": 86, + "token_acc": 0.6911136980985643 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.432227849960327, + "learning_rate": 2.71875e-05, + "loss": 1.1003440618515015, + "step": 87, + "token_acc": 0.7121124031007752 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 3.5543625354766846, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0957496166229248, + "step": 88, + "token_acc": 0.70509977827051 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 6.43117094039917, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1858711242675781, + "step": 89, + "token_acc": 0.6840046283541793 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 2.4569075107574463, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.9773006439208984, + "step": 90, + "token_acc": 0.7344842105263157 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 11.663007736206055, + "learning_rate": 2.84375e-05, + "loss": 1.064300298690796, + "step": 91, + "token_acc": 0.7109963417258446 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.8894364833831787, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.1586850881576538, + "step": 92, + "token_acc": 0.6858779719278144 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 1.7159028053283691, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0098645687103271, + "step": 93, + "token_acc": 0.7275060308987322 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 1.5333527326583862, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1714340448379517, + "step": 94, + "token_acc": 0.6860140489913544 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 3.671557903289795, + "learning_rate": 2.96875e-05, + "loss": 1.0821294784545898, + "step": 95, + "token_acc": 0.6963150599818382 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 5.295556545257568, + "learning_rate": 3e-05, + "loss": 0.9997302889823914, + "step": 96, + "token_acc": 0.7385238523852385 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 2.397625207901001, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.130357265472412, + "step": 97, + "token_acc": 0.6882726951607206 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 2.037938356399536, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1520730257034302, + "step": 98, + "token_acc": 0.6894481533067576 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 3.0218756198883057, + "learning_rate": 3.09375e-05, + "loss": 1.0573893785476685, + "step": 99, + "token_acc": 0.7125121241513094 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 3.04327654838562, + "learning_rate": 3.125e-05, + "loss": 1.0620324611663818, + "step": 100, + "token_acc": 0.707827486752968 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 5.125799655914307, + "learning_rate": 3.15625e-05, + "loss": 1.1085580587387085, + "step": 101, + "token_acc": 0.6982024597918638 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 4.365977764129639, + "learning_rate": 3.1875e-05, + "loss": 1.1006660461425781, + "step": 102, + "token_acc": 0.6985514046097003 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 2.454066514968872, + "learning_rate": 3.21875e-05, + "loss": 1.0711305141448975, + "step": 103, + "token_acc": 0.7023084497283104 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 1.7535096406936646, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.0082716941833496, + "step": 104, + "token_acc": 0.7191448721716133 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 3.075683116912842, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.0638121366500854, + "step": 105, + "token_acc": 0.7095207815480664 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 2.3826944828033447, + "learning_rate": 3.3125e-05, + "loss": 1.1353557109832764, + "step": 106, + "token_acc": 0.6854159649713708 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 1.8979523181915283, + "learning_rate": 3.34375e-05, + "loss": 1.0470201969146729, + "step": 107, + "token_acc": 0.7149484887766937 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 1.8144444227218628, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9918816089630127, + "step": 108, + "token_acc": 0.722106165300766 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 3.806840419769287, + "learning_rate": 3.40625e-05, + "loss": 1.0785143375396729, + "step": 109, + "token_acc": 0.6924427887174028 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 2.5378105640411377, + "learning_rate": 3.4375e-05, + "loss": 1.0899507999420166, + "step": 110, + "token_acc": 0.7045417101433357 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 1.9893940687179565, + "learning_rate": 3.46875e-05, + "loss": 1.0884394645690918, + "step": 111, + "token_acc": 0.7042693016878635 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 5.139678001403809, + "learning_rate": 3.5e-05, + "loss": 0.9752957820892334, + "step": 112, + "token_acc": 0.7288215172043732 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 3.4846577644348145, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0316904783248901, + "step": 113, + "token_acc": 0.7174084803792468 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 3.4321818351745605, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.022270917892456, + "step": 114, + "token_acc": 0.7156758903746856 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 2.8689022064208984, + "learning_rate": 3.59375e-05, + "loss": 1.1368576288223267, + "step": 115, + "token_acc": 0.6861952181165647 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 1.8734346628189087, + "learning_rate": 3.625e-05, + "loss": 1.0494530200958252, + "step": 116, + "token_acc": 0.7091768631813126 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.329326629638672, + "learning_rate": 3.65625e-05, + "loss": 0.9063711166381836, + "step": 117, + "token_acc": 0.7585655778643492 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 1.9864639043807983, + "learning_rate": 3.6875e-05, + "loss": 1.0875568389892578, + "step": 118, + "token_acc": 0.7017193984800302 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 3.4826865196228027, + "learning_rate": 3.71875e-05, + "loss": 1.0767862796783447, + "step": 119, + "token_acc": 0.7015383266862427 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 3.474165201187134, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9985078573226929, + "step": 120, + "token_acc": 0.7192602563352256 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 15.018126487731934, + "learning_rate": 3.78125e-05, + "loss": 1.0274770259857178, + "step": 121, + "token_acc": 0.716270783847981 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 2.6608524322509766, + "learning_rate": 3.8125e-05, + "loss": 0.9960276484489441, + "step": 122, + "token_acc": 0.7227157360406091 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 3.8320107460021973, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0952248573303223, + "step": 123, + "token_acc": 0.6966855558726406 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 3.4052140712738037, + "learning_rate": 3.875e-05, + "loss": 1.0360908508300781, + "step": 124, + "token_acc": 0.7139331547031448 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.294705390930176, + "learning_rate": 3.90625e-05, + "loss": 0.9304947853088379, + "step": 125, + "token_acc": 0.7381878821567538 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 5.569668769836426, + "learning_rate": 3.9375e-05, + "loss": 0.9146929383277893, + "step": 126, + "token_acc": 0.7442802870409455 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 4.5205397605896, + "learning_rate": 3.96875e-05, + "loss": 0.8794465661048889, + "step": 127, + "token_acc": 0.7579816513761468 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 3.539724588394165, + "learning_rate": 4e-05, + "loss": 1.015094518661499, + "step": 128, + "token_acc": 0.7137131788123706 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 3.903836965560913, + "learning_rate": 4.0312500000000004e-05, + "loss": 1.0014472007751465, + "step": 129, + "token_acc": 0.7209395973154362 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 2.7150936126708984, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.984825074672699, + "step": 130, + "token_acc": 0.7249438719705256 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 3.824404716491699, + "learning_rate": 4.09375e-05, + "loss": 0.8905125856399536, + "step": 131, + "token_acc": 0.7577065883775149 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 4.411902904510498, + "learning_rate": 4.125e-05, + "loss": 0.980827271938324, + "step": 132, + "token_acc": 0.7225544750117011 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 5.346670150756836, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0253760814666748, + "step": 133, + "token_acc": 0.7098936760749819 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 2.1438992023468018, + "learning_rate": 4.1875e-05, + "loss": 0.9548345804214478, + "step": 134, + "token_acc": 0.7338397692902863 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 4.1644606590271, + "learning_rate": 4.21875e-05, + "loss": 0.8847500681877136, + "step": 135, + "token_acc": 0.7524723391755606 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 2.005262613296509, + "learning_rate": 4.25e-05, + "loss": 1.073623538017273, + "step": 136, + "token_acc": 0.6994131997098965 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 2.246750593185425, + "learning_rate": 4.28125e-05, + "loss": 1.0128499269485474, + "step": 137, + "token_acc": 0.7144232826877809 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 3.925265073776245, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.83775395154953, + "step": 138, + "token_acc": 0.772547828727604 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 12.726314544677734, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.9593348503112793, + "step": 139, + "token_acc": 0.7316725055144674 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 2.6994714736938477, + "learning_rate": 4.375e-05, + "loss": 0.9028947949409485, + "step": 140, + "token_acc": 0.7460494101936346 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 3.9808058738708496, + "learning_rate": 4.40625e-05, + "loss": 0.8996214270591736, + "step": 141, + "token_acc": 0.7425867507886436 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 1.2212865352630615, + "learning_rate": 4.4375e-05, + "loss": 1.0384089946746826, + "step": 142, + "token_acc": 0.7121201463140123 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 3.9611852169036865, + "learning_rate": 4.46875e-05, + "loss": 0.9263251423835754, + "step": 143, + "token_acc": 0.740031723458951 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 5.350156307220459, + "learning_rate": 4.5e-05, + "loss": 0.9607938528060913, + "step": 144, + "token_acc": 0.7303436535801681 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.4106866121292114, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9440912008285522, + "step": 145, + "token_acc": 0.7313729139524784 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 3.6181912422180176, + "learning_rate": 4.5625e-05, + "loss": 0.9318268299102783, + "step": 146, + "token_acc": 0.7333581652743043 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 2.850383758544922, + "learning_rate": 4.59375e-05, + "loss": 0.8572186231613159, + "step": 147, + "token_acc": 0.7507500914745701 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 3.677313804626465, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.9332783818244934, + "step": 148, + "token_acc": 0.7401175938489372 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 1.3261946439743042, + "learning_rate": 4.65625e-05, + "loss": 1.0429058074951172, + "step": 149, + "token_acc": 0.7028539965128017 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 3.0652029514312744, + "learning_rate": 4.6875e-05, + "loss": 0.977657675743103, + "step": 150, + "token_acc": 0.7199633139712626 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 20.230405807495117, + "learning_rate": 4.71875e-05, + "loss": 1.027328610420227, + "step": 151, + "token_acc": 0.7118949681636333 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 3.0481197834014893, + "learning_rate": 4.75e-05, + "loss": 0.8688861727714539, + "step": 152, + "token_acc": 0.7510847854535436 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 5.976290225982666, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.033332347869873, + "step": 153, + "token_acc": 0.7093079141300865 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 3.429054021835327, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.9014919996261597, + "step": 154, + "token_acc": 0.7435937257338096 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 1.6205755472183228, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9900403022766113, + "step": 155, + "token_acc": 0.7184128821764985 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 10.175098419189453, + "learning_rate": 4.875e-05, + "loss": 0.8962844610214233, + "step": 156, + "token_acc": 0.7435897435897436 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 1.2148970365524292, + "learning_rate": 4.90625e-05, + "loss": 0.9664689302444458, + "step": 157, + "token_acc": 0.7256873527101335 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 1.4516433477401733, + "learning_rate": 4.937500000000001e-05, + "loss": 0.857364296913147, + "step": 158, + "token_acc": 0.751648804616653 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 2.4918766021728516, + "learning_rate": 4.96875e-05, + "loss": 0.8872854709625244, + "step": 159, + "token_acc": 0.7495879573673223 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 1.7210731506347656, + "learning_rate": 5e-05, + "loss": 0.9493648409843445, + "step": 160, + "token_acc": 0.7264301870138468 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 6.053183555603027, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8796491622924805, + "step": 161, + "token_acc": 0.7541715628672151 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 2.3308753967285156, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.8858709335327148, + "step": 162, + "token_acc": 0.7452508843180925 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 2.514087200164795, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8514291644096375, + "step": 163, + "token_acc": 0.7531689065363469 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 3.979966878890991, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.0399848222732544, + "step": 164, + "token_acc": 0.7055028462998102 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 1.8825353384017944, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9388617277145386, + "step": 165, + "token_acc": 0.7314329823013729 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.460411787033081, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9585274457931519, + "step": 166, + "token_acc": 0.7233919943259897 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 2.5048015117645264, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8713458776473999, + "step": 167, + "token_acc": 0.7487620536877769 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.3289780616760254, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.9545108079910278, + "step": 168, + "token_acc": 0.7243544303797468 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 8.591806411743164, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.8003573417663574, + "step": 169, + "token_acc": 0.7734825957670106 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 2.1393492221832275, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8462347984313965, + "step": 170, + "token_acc": 0.7583013515768396 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 2.350606679916382, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8536550998687744, + "step": 171, + "token_acc": 0.7583616526560544 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 2.1374306678771973, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8206404447555542, + "step": 172, + "token_acc": 0.7580493637372961 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 1.5408402681350708, + "learning_rate": 4.994911507566217e-05, + "loss": 1.0032633543014526, + "step": 173, + "token_acc": 0.7122946175637394 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 7.398180961608887, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9755508303642273, + "step": 174, + "token_acc": 0.72718616887998 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 34.215980529785156, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8316116333007812, + "step": 175, + "token_acc": 0.7651929504709815 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 1.1946734189987183, + "learning_rate": 4.99229333433282e-05, + "loss": 0.9263297319412231, + "step": 176, + "token_acc": 0.7333371021538809 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 3.4196677207946777, + "learning_rate": 4.991300473502437e-05, + "loss": 0.865764856338501, + "step": 177, + "token_acc": 0.7536853599563217 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 0.84961998462677, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.0150288343429565, + "step": 178, + "token_acc": 0.7088443038523204 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 3.249678611755371, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8582470417022705, + "step": 179, + "token_acc": 0.7626390957679838 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.03476881980896, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9166827201843262, + "step": 180, + "token_acc": 0.7448330683624801 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 3.3579049110412598, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8242158889770508, + "step": 181, + "token_acc": 0.763468992248062 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 2.1550583839416504, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9542834758758545, + "step": 182, + "token_acc": 0.7280744258164551 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 1.229475975036621, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9628951549530029, + "step": 183, + "token_acc": 0.7275876331299762 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.3542944192886353, + "learning_rate": 4.982671142387316e-05, + "loss": 0.9437664151191711, + "step": 184, + "token_acc": 0.7304563628843237 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 2.5428855419158936, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8541402816772461, + "step": 185, + "token_acc": 0.7521788023615407 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 2.5485925674438477, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0094258785247803, + "step": 186, + "token_acc": 0.7157740901376579 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 1.8278656005859375, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8787280917167664, + "step": 187, + "token_acc": 0.7516580692704495 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 4.457269191741943, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9875797033309937, + "step": 188, + "token_acc": 0.7228752642706131 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 3.185421943664551, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8471859693527222, + "step": 189, + "token_acc": 0.7519582245430809 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 6.704853534698486, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8586404323577881, + "step": 190, + "token_acc": 0.7541206247299216 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 1.5821382999420166, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8798616528511047, + "step": 191, + "token_acc": 0.7469811850603763 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 10.706079483032227, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8191840648651123, + "step": 192, + "token_acc": 0.763384590612672 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 5.072082996368408, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.833245575428009, + "step": 193, + "token_acc": 0.7563102340523176 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 1.3364410400390625, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9354732036590576, + "step": 194, + "token_acc": 0.7303690195237074 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 8.606874465942383, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7941551208496094, + "step": 195, + "token_acc": 0.766449806472865 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 2.6359663009643555, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8962496519088745, + "step": 196, + "token_acc": 0.7337984211492564 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 4.913934707641602, + "learning_rate": 4.958879433443904e-05, + "loss": 0.8074665069580078, + "step": 197, + "token_acc": 0.766220939067011 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 14.050993919372559, + "learning_rate": 4.95663319832678e-05, + "loss": 1.0043327808380127, + "step": 198, + "token_acc": 0.7157577609920098 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 1.2029297351837158, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8978754281997681, + "step": 199, + "token_acc": 0.7365190705830776 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 1.6810232400894165, + "learning_rate": 4.951963201008076e-05, + "loss": 0.837005078792572, + "step": 200, + "token_acc": 0.7567454682148526 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 1.762834072113037, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8861300945281982, + "step": 201, + "token_acc": 0.745210849086426 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 2.8837828636169434, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7754945158958435, + "step": 202, + "token_acc": 0.7765665374677002 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 4.415988922119141, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8974159359931946, + "step": 203, + "token_acc": 0.7422455780569085 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.2022016048431396, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9800943732261658, + "step": 204, + "token_acc": 0.7206211812627291 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 3.1489412784576416, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8181082010269165, + "step": 205, + "token_acc": 0.7677832141512985 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 2.7361836433410645, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9568559527397156, + "step": 206, + "token_acc": 0.725022063263505 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 1.2395085096359253, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8899260759353638, + "step": 207, + "token_acc": 0.7444645472559662 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 11.254620552062988, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.793695330619812, + "step": 208, + "token_acc": 0.7653651482284888 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 1.9917453527450562, + "learning_rate": 4.92803071949828e-05, + "loss": 0.9342561960220337, + "step": 209, + "token_acc": 0.7262987886944818 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 1.3936560153961182, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9557225704193115, + "step": 210, + "token_acc": 0.7319856537332898 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 1.602947473526001, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9270342588424683, + "step": 211, + "token_acc": 0.730816476947015 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.341012477874756, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.9432080388069153, + "step": 212, + "token_acc": 0.7277580071174378 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.3441163301467896, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8968133330345154, + "step": 213, + "token_acc": 0.7424508426966292 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 4.8920722007751465, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8623098134994507, + "step": 214, + "token_acc": 0.7460244648318043 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 2.7736644744873047, + "learning_rate": 4.9094401644886e-05, + "loss": 0.9887412190437317, + "step": 215, + "token_acc": 0.7158999839717903 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 1.6230074167251587, + "learning_rate": 4.906138091134118e-05, + "loss": 0.9436683058738708, + "step": 216, + "token_acc": 0.7280187056072704 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 3.8004024028778076, + "learning_rate": 4.90277804028108e-05, + "loss": 0.7515861988067627, + "step": 217, + "token_acc": 0.7878668891724747 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 1.2686784267425537, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9568852186203003, + "step": 218, + "token_acc": 0.722643138007097 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 2.203845500946045, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7561929225921631, + "step": 219, + "token_acc": 0.7821512081060016 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 60.95647048950195, + "learning_rate": 4.892350839330522e-05, + "loss": 0.9007571935653687, + "step": 220, + "token_acc": 0.7362854803493449 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 1.3951096534729004, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8568707704544067, + "step": 221, + "token_acc": 0.7503653902367728 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 4.732699871063232, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8863348960876465, + "step": 222, + "token_acc": 0.7456376192735515 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 1.9262758493423462, + "learning_rate": 4.881404839143988e-05, + "loss": 0.8580335974693298, + "step": 223, + "token_acc": 0.7447225981055481 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 2.428048610687256, + "learning_rate": 4.877641290737884e-05, + "loss": 0.816256046295166, + "step": 224, + "token_acc": 0.7594610513915476 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 1.8479973077774048, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8992019295692444, + "step": 225, + "token_acc": 0.747414978184209 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 1.2170461416244507, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8981590270996094, + "step": 226, + "token_acc": 0.7403604836869724 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 1.4078121185302734, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8538397550582886, + "step": 227, + "token_acc": 0.7566088200534926 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 1.7292224168777466, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8955122828483582, + "step": 228, + "token_acc": 0.7407333994053519 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 1.772873878479004, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8418647646903992, + "step": 229, + "token_acc": 0.7579768207182715 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 2.3586251735687256, + "learning_rate": 4.853860162957552e-05, + "loss": 0.9011165499687195, + "step": 230, + "token_acc": 0.7370127630217316 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 1.4242304563522339, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6907041668891907, + "step": 231, + "token_acc": 0.7974857772068269 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 2.375168561935425, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.838218092918396, + "step": 232, + "token_acc": 0.756889252024066 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 2.9053637981414795, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8434799313545227, + "step": 233, + "token_acc": 0.7536370711848172 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.854264259338379, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8246455788612366, + "step": 234, + "token_acc": 0.7580336387255572 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 4.344927787780762, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8148558139801025, + "step": 235, + "token_acc": 0.757310740639519 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 8.028459548950195, + "learning_rate": 4.828037336897009e-05, + "loss": 0.8641375303268433, + "step": 236, + "token_acc": 0.7445998946320904 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 10.524628639221191, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9830830693244934, + "step": 237, + "token_acc": 0.7152842788491544 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.7903722524642944, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.8133025765419006, + "step": 238, + "token_acc": 0.7577724358974359 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 1.2249422073364258, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8893339037895203, + "step": 239, + "token_acc": 0.745752359800111 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 15.711007118225098, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8640246391296387, + "step": 240, + "token_acc": 0.7455461092760058 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 17.570682525634766, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.7105808258056641, + "step": 241, + "token_acc": 0.7925288608146374 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 3.0752291679382324, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.9153680205345154, + "step": 242, + "token_acc": 0.7310617855077621 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 1.167055606842041, + "learning_rate": 4.79536020593051e-05, + "loss": 0.938827633857727, + "step": 243, + "token_acc": 0.7255839744922714 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 1.852413535118103, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.853781521320343, + "step": 244, + "token_acc": 0.7508854781582054 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.5053846836090088, + "learning_rate": 4.785524389258827e-05, + "loss": 0.9472495317459106, + "step": 245, + "token_acc": 0.7277364588606363 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 3.108750820159912, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8951740860939026, + "step": 246, + "token_acc": 0.7357894216998371 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.4686100482940674, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.7866122722625732, + "step": 247, + "token_acc": 0.7723662389805359 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 1.967427372932434, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.8967963457107544, + "step": 248, + "token_acc": 0.7343396554724204 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 3.1070291996002197, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9204596877098083, + "step": 249, + "token_acc": 0.7327885874226897 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 1.856003761291504, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7575951814651489, + "step": 250, + "token_acc": 0.7788233433496757 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 1.840150237083435, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.8490856289863586, + "step": 251, + "token_acc": 0.7549613056470769 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 1.0170334577560425, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8861610293388367, + "step": 252, + "token_acc": 0.7378573411046351 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 1.2947522401809692, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.8459495902061462, + "step": 253, + "token_acc": 0.7514053303352953 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 1.4557151794433594, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7556009888648987, + "step": 254, + "token_acc": 0.7733115022513304 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 5.058238983154297, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.7291783094406128, + "step": 255, + "token_acc": 0.7859242925395076 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 1.114750623703003, + "learning_rate": 4.72751631047092e-05, + "loss": 0.8316564559936523, + "step": 256, + "token_acc": 0.7554670474186518 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 2.487441301345825, + "learning_rate": 4.721918194465169e-05, + "loss": 0.8008612394332886, + "step": 257, + "token_acc": 0.7658649666763258 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 3.9729726314544678, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7932621240615845, + "step": 258, + "token_acc": 0.7653622505107653 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 1.7285813093185425, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8352819085121155, + "step": 259, + "token_acc": 0.7518584505744301 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 1.6816480159759521, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.8903557658195496, + "step": 260, + "token_acc": 0.7417663664471031 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 2.6574323177337646, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9234253168106079, + "step": 261, + "token_acc": 0.7320945263583114 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 2.6559009552001953, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7536015510559082, + "step": 262, + "token_acc": 0.7836038664964435 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 1.3639440536499023, + "learning_rate": 4.687209999162396e-05, + "loss": 0.9138115048408508, + "step": 263, + "token_acc": 0.73465387392964 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 1.4643888473510742, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9767469763755798, + "step": 264, + "token_acc": 0.7182791953322303 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 1.210517168045044, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8130522966384888, + "step": 265, + "token_acc": 0.7663620788121074 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 2.5332179069519043, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.8405072093009949, + "step": 266, + "token_acc": 0.750514050719671 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 0.8559168577194214, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.9550877809524536, + "step": 267, + "token_acc": 0.7296061884669479 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 1.4378278255462646, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8482018113136292, + "step": 268, + "token_acc": 0.756345916066623 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 11.279638290405273, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8772472143173218, + "step": 269, + "token_acc": 0.7447105454139452 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 1.9061810970306396, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8368943929672241, + "step": 270, + "token_acc": 0.7592273445354014 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 1.9233216047286987, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8612409234046936, + "step": 271, + "token_acc": 0.7476107285993218 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 4.400722980499268, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8825200796127319, + "step": 272, + "token_acc": 0.7407547988287604 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 1.9921467304229736, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.827918529510498, + "step": 273, + "token_acc": 0.7584293340826075 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 1.7633479833602905, + "learning_rate": 4.618673848685586e-05, + "loss": 0.8006143569946289, + "step": 274, + "token_acc": 0.7614477652865369 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 2.8810698986053467, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8252323865890503, + "step": 275, + "token_acc": 0.757303946694003 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 3.151297092437744, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8325484991073608, + "step": 276, + "token_acc": 0.7542700046794572 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 2.637824535369873, + "learning_rate": 4.59890152099534e-05, + "loss": 0.916891872882843, + "step": 277, + "token_acc": 0.7303461130806622 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 3.002065896987915, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8716385364532471, + "step": 278, + "token_acc": 0.744375139229227 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 4.198055267333984, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8470830917358398, + "step": 279, + "token_acc": 0.75168222270458 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 1.8871791362762451, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7896092534065247, + "step": 280, + "token_acc": 0.7681891866119958 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 1.5660463571548462, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9307687282562256, + "step": 281, + "token_acc": 0.7255500518373459 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 5.349212169647217, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8658042550086975, + "step": 282, + "token_acc": 0.7448989748183538 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.4808748960494995, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8970195651054382, + "step": 283, + "token_acc": 0.7391180003431905 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 2.455500364303589, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7446900606155396, + "step": 284, + "token_acc": 0.779041869824317 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 4.634961128234863, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.7530452013015747, + "step": 285, + "token_acc": 0.7835355578024941 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 2.1206021308898926, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7370263338088989, + "step": 286, + "token_acc": 0.778288729739917 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 1.4169611930847168, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9229286313056946, + "step": 287, + "token_acc": 0.7339485313231089 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 1.9929263591766357, + "learning_rate": 4.522542485937369e-05, + "loss": 0.852091372013092, + "step": 288, + "token_acc": 0.7514005602240896 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 3.4453070163726807, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9559416174888611, + "step": 289, + "token_acc": 0.7264587084529661 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 1.336920976638794, + "learning_rate": 4.508018828701612e-05, + "loss": 0.8340522050857544, + "step": 290, + "token_acc": 0.7536214092806285 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 3.4118199348449707, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8833523392677307, + "step": 291, + "token_acc": 0.7454481792717087 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 3.5416605472564697, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9197189807891846, + "step": 292, + "token_acc": 0.7341421143847487 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 2.6148929595947266, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8156468868255615, + "step": 293, + "token_acc": 0.7572543282126311 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 2.203497886657715, + "learning_rate": 4.478392321601651e-05, + "loss": 0.892130434513092, + "step": 294, + "token_acc": 0.7416920489157612 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 2.1712839603424072, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7399520874023438, + "step": 295, + "token_acc": 0.7850873526707348 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 1.8004732131958008, + "learning_rate": 4.463292327201862e-05, + "loss": 0.8421741724014282, + "step": 296, + "token_acc": 0.7520073969536231 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 1.4337384700775146, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8471038341522217, + "step": 297, + "token_acc": 0.757553327501514 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 1.6089038848876953, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7584915161132812, + "step": 298, + "token_acc": 0.771377487562189 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.462379813194275, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8365672826766968, + "step": 299, + "token_acc": 0.7544501643614712 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 8.664839744567871, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.857391357421875, + "step": 300, + "token_acc": 0.749980424399029 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 1.634519100189209, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9205117225646973, + "step": 301, + "token_acc": 0.7280529559461311 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 6.171248435974121, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8554207682609558, + "step": 302, + "token_acc": 0.7522151310490117 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.0984041690826416, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8889010548591614, + "step": 303, + "token_acc": 0.7385387618516452 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 2.31172776222229, + "learning_rate": 4.401014914000078e-05, + "loss": 0.8025680780410767, + "step": 304, + "token_acc": 0.7657713928794504 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 1.0633413791656494, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8589308261871338, + "step": 305, + "token_acc": 0.7430749104146522 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 2.115835428237915, + "learning_rate": 4.384983704904674e-05, + "loss": 0.8085026144981384, + "step": 306, + "token_acc": 0.7655552946701104 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 1.1347414255142212, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8337522745132446, + "step": 307, + "token_acc": 0.7556942478445503 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.038212299346924, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7678971290588379, + "step": 308, + "token_acc": 0.7758904109589041 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 1.3275516033172607, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8638439774513245, + "step": 309, + "token_acc": 0.7517523364485982 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 2.3478550910949707, + "learning_rate": 4.352377813387398e-05, + "loss": 0.929733395576477, + "step": 310, + "token_acc": 0.7266237841229997 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 44.539588928222656, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.6898671388626099, + "step": 311, + "token_acc": 0.7947743004777226 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 30.594491958618164, + "learning_rate": 4.335806273589214e-05, + "loss": 0.7981156706809998, + "step": 312, + "token_acc": 0.7670547784637024 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 4.215977191925049, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7518867254257202, + "step": 313, + "token_acc": 0.779008 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 3.641622543334961, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8727045059204102, + "step": 314, + "token_acc": 0.7429807447620663 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 1.9243735074996948, + "learning_rate": 4.310617707378668e-05, + "loss": 0.8108093738555908, + "step": 315, + "token_acc": 0.7594791997459511 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 0.8778403401374817, + "learning_rate": 4.302133991757297e-05, + "loss": 0.8932883739471436, + "step": 316, + "token_acc": 0.7411044408221683 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 1.0130997896194458, + "learning_rate": 4.2936068525181e-05, + "loss": 0.8487477898597717, + "step": 317, + "token_acc": 0.7464837731723075 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 1.079648494720459, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9818820357322693, + "step": 318, + "token_acc": 0.7180284775465499 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 1.9027600288391113, + "learning_rate": 4.276423126095974e-05, + "loss": 0.808303952217102, + "step": 319, + "token_acc": 0.7607510997308121 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 1.5247927904129028, + "learning_rate": 4.267766952966369e-05, + "loss": 0.9470866918563843, + "step": 320, + "token_acc": 0.7265260406944185 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 1.369870662689209, + "learning_rate": 4.259068184315608e-05, + "loss": 0.9087713956832886, + "step": 321, + "token_acc": 0.7350676621558563 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 6.133328914642334, + "learning_rate": 4.250327029746309e-05, + "loss": 0.7461989521980286, + "step": 322, + "token_acc": 0.7807190257419967 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 1.9726554155349731, + "learning_rate": 4.24154369988241e-05, + "loss": 0.7489862442016602, + "step": 323, + "token_acc": 0.7799331724521997 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.3422818183898926, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9204419851303101, + "step": 324, + "token_acc": 0.7276635593581067 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 5.088674068450928, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7810251712799072, + "step": 325, + "token_acc": 0.7680823083468709 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 3.301347255706787, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6452058553695679, + "step": 326, + "token_acc": 0.8035996835443038 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 1.5935312509536743, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9706965088844299, + "step": 327, + "token_acc": 0.7185623981234843 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 3.254168748855591, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8170771598815918, + "step": 328, + "token_acc": 0.7567391847961991 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 1.6932677030563354, + "learning_rate": 4.187969961854726e-05, + "loss": 1.0035200119018555, + "step": 329, + "token_acc": 0.710241224902499 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 3.9655134677886963, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7571268081665039, + "step": 330, + "token_acc": 0.7816722301700842 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 1.8478268384933472, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6960297226905823, + "step": 331, + "token_acc": 0.797862706031516 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 4.037573337554932, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.8032216429710388, + "step": 332, + "token_acc": 0.7642302509144581 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 1.7107889652252197, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7450529336929321, + "step": 333, + "token_acc": 0.7807361655955263 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 2.1832103729248047, + "learning_rate": 4.142204747357604e-05, + "loss": 0.9057133197784424, + "step": 334, + "token_acc": 0.7387870402398248 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 1.6151518821716309, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8928775191307068, + "step": 335, + "token_acc": 0.7462082912032356 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 14.127095222473145, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7594292163848877, + "step": 336, + "token_acc": 0.7754250629722922 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 1.6860201358795166, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8408955335617065, + "step": 337, + "token_acc": 0.7568825910931174 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.581010341644287, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8329792022705078, + "step": 338, + "token_acc": 0.7593260342227759 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 1.9535971879959106, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6480681896209717, + "step": 339, + "token_acc": 0.8122850705561485 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 1.9793946743011475, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7445608377456665, + "step": 340, + "token_acc": 0.7827135845603527 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 4.794119834899902, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8328458070755005, + "step": 341, + "token_acc": 0.7548175481754817 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 1.6560248136520386, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7087723016738892, + "step": 342, + "token_acc": 0.7858705845576742 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 2.5469024181365967, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8401075005531311, + "step": 343, + "token_acc": 0.7521624133247552 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 1.101097822189331, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8827832937240601, + "step": 344, + "token_acc": 0.7426626391957081 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 0.9751433730125427, + "learning_rate": 4.038078976451567e-05, + "loss": 0.8690142035484314, + "step": 345, + "token_acc": 0.7447467748295871 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.7000588178634644, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7611054182052612, + "step": 346, + "token_acc": 0.7782417893544734 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 1.2874529361724854, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8283425569534302, + "step": 347, + "token_acc": 0.7594009983361065 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 2.1631717681884766, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7190766930580139, + "step": 348, + "token_acc": 0.7870029281193917 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 1.429532766342163, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8946720361709595, + "step": 349, + "token_acc": 0.7392836839113133 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 3.1684229373931885, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9295719861984253, + "step": 350, + "token_acc": 0.7288985616956851 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.7300114631652832, + "learning_rate": 3.979373519225858e-05, + "loss": 0.92355877161026, + "step": 351, + "token_acc": 0.7324363188167625 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 2.299527406692505, + "learning_rate": 3.969463130731183e-05, + "loss": 0.8874197006225586, + "step": 352, + "token_acc": 0.7404152666494357 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.4366137981414795, + "learning_rate": 3.959517334544466e-05, + "loss": 0.8959657549858093, + "step": 353, + "token_acc": 0.732359413775343 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 1.7419233322143555, + "learning_rate": 3.949536370316285e-05, + "loss": 0.870617151260376, + "step": 354, + "token_acc": 0.7478128119311843 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 2.7980542182922363, + "learning_rate": 3.939520478544614e-05, + "loss": 0.938357412815094, + "step": 355, + "token_acc": 0.723624015469509 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 1.4998390674591064, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.9020789265632629, + "step": 356, + "token_acc": 0.7391279337321676 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 7.364425182342529, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8625916242599487, + "step": 357, + "token_acc": 0.7521179064639666 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 3.1867001056671143, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7600144147872925, + "step": 358, + "token_acc": 0.7793380140421263 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 1.8029720783233643, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7643027305603027, + "step": 359, + "token_acc": 0.7712042239220199 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.355663776397705, + "learning_rate": 3.888925582549006e-05, + "loss": 0.8453084230422974, + "step": 360, + "token_acc": 0.7502929524022097 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 1.006208062171936, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8521932363510132, + "step": 361, + "token_acc": 0.756155379559291 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 1.4199978113174438, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8347768783569336, + "step": 362, + "token_acc": 0.7501978691019787 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 1.349457025527954, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7749630808830261, + "step": 363, + "token_acc": 0.7748823133826497 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 5.823076248168945, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6983618140220642, + "step": 364, + "token_acc": 0.7871479571598572 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 8.135080337524414, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8401281833648682, + "step": 365, + "token_acc": 0.7508409829522777 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.687354564666748, + "learning_rate": 3.827110064348773e-05, + "loss": 0.8170597553253174, + "step": 366, + "token_acc": 0.7552287581699346 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.9633206129074097, + "learning_rate": 3.816694101379631e-05, + "loss": 0.8735244274139404, + "step": 367, + "token_acc": 0.7437511571931124 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 4.996685981750488, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.693369448184967, + "step": 368, + "token_acc": 0.7922726867136611 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 1.0713677406311035, + "learning_rate": 3.795767247323533e-05, + "loss": 0.9313665628433228, + "step": 369, + "token_acc": 0.7287721170089801 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 4.217531681060791, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7590094804763794, + "step": 370, + "token_acc": 0.773895906118427 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 1.6878818273544312, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8483130931854248, + "step": 371, + "token_acc": 0.7492018446257538 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 0.8570557832717896, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9103615283966064, + "step": 372, + "token_acc": 0.7282932011331444 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 2.5253098011016846, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8272509574890137, + "step": 373, + "token_acc": 0.7556038061178875 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 1.4744120836257935, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9171687364578247, + "step": 374, + "token_acc": 0.7330784603353897 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 1.189939260482788, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.861799955368042, + "step": 375, + "token_acc": 0.7455566567558639 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 1.3322968482971191, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8449103832244873, + "step": 376, + "token_acc": 0.7524626452684007 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 1.3432042598724365, + "learning_rate": 3.710831292775353e-05, + "loss": 0.7643551826477051, + "step": 377, + "token_acc": 0.7682315405651777 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 1.8385838270187378, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7325477004051208, + "step": 378, + "token_acc": 0.7822782174094127 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 1.7004828453063965, + "learning_rate": 3.689300402536093e-05, + "loss": 0.9835074543952942, + "step": 379, + "token_acc": 0.715375239421905 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.2685455083847046, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8341811895370483, + "step": 380, + "token_acc": 0.7532715029856435 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 0.9319852590560913, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8452165126800537, + "step": 381, + "token_acc": 0.7504095866685391 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 1.6068520545959473, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7542648911476135, + "step": 382, + "token_acc": 0.776282880551962 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 2.165843963623047, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7548285126686096, + "step": 383, + "token_acc": 0.7744026531996684 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 1.8156840801239014, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6292520761489868, + "step": 384, + "token_acc": 0.8097231165486156 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 0.9236544370651245, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8094581365585327, + "step": 385, + "token_acc": 0.7608140039542846 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.497694969177246, + "learning_rate": 3.613053314713671e-05, + "loss": 0.8500128984451294, + "step": 386, + "token_acc": 0.7480623568786331 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 3.220353364944458, + "learning_rate": 3.602051485530486e-05, + "loss": 0.917942225933075, + "step": 387, + "token_acc": 0.7284884019955769 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 4.521829605102539, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7702268362045288, + "step": 388, + "token_acc": 0.7716129918286068 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 0.9622291922569275, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9329461455345154, + "step": 389, + "token_acc": 0.7276041666666667 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 1.7155946493148804, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6712834239006042, + "step": 390, + "token_acc": 0.8011521228931086 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 1.6805239915847778, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8204821348190308, + "step": 391, + "token_acc": 0.7557218065946245 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.821913719177246, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7822115421295166, + "step": 392, + "token_acc": 0.7652249806051202 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 0.9204578399658203, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.7939423322677612, + "step": 393, + "token_acc": 0.7637715229684224 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.6548840999603271, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7488706111907959, + "step": 394, + "token_acc": 0.7780097425191371 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 1.4144301414489746, + "learning_rate": 3.513103285012475e-05, + "loss": 0.8302121758460999, + "step": 395, + "token_acc": 0.7556669572798606 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 1.2530573606491089, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7473949790000916, + "step": 396, + "token_acc": 0.7778376713383643 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 1.3626383543014526, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7733973860740662, + "step": 397, + "token_acc": 0.7717758815005635 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 1.8561214208602905, + "learning_rate": 3.47933752712989e-05, + "loss": 0.717442512512207, + "step": 398, + "token_acc": 0.7897643593519882 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 1.4010168313980103, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8622786402702332, + "step": 399, + "token_acc": 0.746109355434977 + }, + { + "epoch": 1.0, + "grad_norm": 3.488276720046997, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7453683614730835, + "step": 400, + "token_acc": 0.7741160315825609 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 1.1606934070587158, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7595579028129578, + "step": 401, + "token_acc": 0.7722797596215317 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 7.119320392608643, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8560916185379028, + "step": 402, + "token_acc": 0.7451851136747598 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 2.264742612838745, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7480262517929077, + "step": 403, + "token_acc": 0.7768546688509244 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 2.638277053833008, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6516366600990295, + "step": 404, + "token_acc": 0.8008649868371568 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 10.03870964050293, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7640280723571777, + "step": 405, + "token_acc": 0.7745649948822927 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 1.4635159969329834, + "learning_rate": 3.388277253201041e-05, + "loss": 0.8078231811523438, + "step": 406, + "token_acc": 0.7627060907480583 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 1.8901174068450928, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8164265155792236, + "step": 407, + "token_acc": 0.7621255796465722 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 2.5771090984344482, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8471720218658447, + "step": 408, + "token_acc": 0.7479161404395049 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 1.9842844009399414, + "learning_rate": 3.353768924152341e-05, + "loss": 0.705992579460144, + "step": 409, + "token_acc": 0.7897742247210753 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 1.8455222845077515, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9950985908508301, + "step": 410, + "token_acc": 0.7158471618394464 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 2.81369948387146, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7523729801177979, + "step": 411, + "token_acc": 0.7738898001336493 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 0.9068171381950378, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8897726535797119, + "step": 412, + "token_acc": 0.7371789837430299 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 2.705150604248047, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6471114158630371, + "step": 413, + "token_acc": 0.8097399917457697 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 1.5322827100753784, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7631367444992065, + "step": 414, + "token_acc": 0.7776249140141329 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 0.8264560699462891, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8537945747375488, + "step": 415, + "token_acc": 0.7472068130322681 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 1.2941429615020752, + "learning_rate": 3.272542485937369e-05, + "loss": 0.8233134746551514, + "step": 416, + "token_acc": 0.7573484469633828 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 0.9657873511314392, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8734332323074341, + "step": 417, + "token_acc": 0.7438148443735035 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.698813796043396, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8446903824806213, + "step": 418, + "token_acc": 0.7472349272349272 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.7393252849578857, + "learning_rate": 3.23744632744341e-05, + "loss": 0.6763110160827637, + "step": 419, + "token_acc": 0.7926863572433193 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 1.9159985780715942, + "learning_rate": 3.225711693136156e-05, + "loss": 0.635500431060791, + "step": 420, + "token_acc": 0.8037298569617961 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 1.2441291809082031, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.828086256980896, + "step": 421, + "token_acc": 0.7563552765374243 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 2.318335771560669, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8139811754226685, + "step": 422, + "token_acc": 0.7583092707501382 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 1.2812583446502686, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6982682943344116, + "step": 423, + "token_acc": 0.7941985274549809 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 1.2541266679763794, + "learning_rate": 3.178601124662686e-05, + "loss": 0.865225613117218, + "step": 424, + "token_acc": 0.7453209807224406 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.2426998615264893, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.7594386339187622, + "step": 425, + "token_acc": 0.7677123091603053 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 3.8673322200775146, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7875864505767822, + "step": 426, + "token_acc": 0.7661815909293813 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 1.1603846549987793, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8166364431381226, + "step": 427, + "token_acc": 0.7610032474262419 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 2.748734712600708, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7897321581840515, + "step": 428, + "token_acc": 0.7664034021871203 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 4.712365627288818, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7913838624954224, + "step": 429, + "token_acc": 0.7640121816885894 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 1.5520957708358765, + "learning_rate": 3.10745044975816e-05, + "loss": 0.799659252166748, + "step": 430, + "token_acc": 0.767484623676368 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 2.1518683433532715, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8150660395622253, + "step": 431, + "token_acc": 0.762330198537095 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 1.1168107986450195, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8917897939682007, + "step": 432, + "token_acc": 0.7390166223114175 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 2.890058755874634, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8356524705886841, + "step": 433, + "token_acc": 0.7508724667850364 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 1.5636504888534546, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6680396199226379, + "step": 434, + "token_acc": 0.7951321186041821 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 1.5193849802017212, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8508872985839844, + "step": 435, + "token_acc": 0.7515897223801892 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 2.8505938053131104, + "learning_rate": 3.035772882662627e-05, + "loss": 0.7488077878952026, + "step": 436, + "token_acc": 0.7749569385156894 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 1.3607008457183838, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8307385444641113, + "step": 437, + "token_acc": 0.7534736006351727 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 0.8386856317520142, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8256966471672058, + "step": 438, + "token_acc": 0.7536278768832609 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 1.4726793766021729, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.671474039554596, + "step": 439, + "token_acc": 0.7985303617571059 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 1.5878239870071411, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.6621131300926208, + "step": 440, + "token_acc": 0.8018326039387309 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.060871958732605, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8641493320465088, + "step": 441, + "token_acc": 0.74706401151186 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 1.7958430051803589, + "learning_rate": 2.963630595278977e-05, + "loss": 0.6422966718673706, + "step": 442, + "token_acc": 0.8062888198757764 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 2.897059917449951, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.730861485004425, + "step": 443, + "token_acc": 0.7823434073791591 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 1.9405778646469116, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.863489031791687, + "step": 444, + "token_acc": 0.7414182794179969 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 1.0297330617904663, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.7957867383956909, + "step": 445, + "token_acc": 0.7574887156339762 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 1.080908179283142, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8564661145210266, + "step": 446, + "token_acc": 0.7462025024239346 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 2.1639764308929443, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7737131714820862, + "step": 447, + "token_acc": 0.7662964751327861 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 1.6361067295074463, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7582350969314575, + "step": 448, + "token_acc": 0.773669430328965 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 2.3244810104370117, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6141003370285034, + "step": 449, + "token_acc": 0.8189434489178496 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 2.4419093132019043, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6784725785255432, + "step": 450, + "token_acc": 0.7944106055177356 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 2.702949047088623, + "learning_rate": 2.854682793330633e-05, + "loss": 0.6986773014068604, + "step": 451, + "token_acc": 0.7902205177372963 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 1.953333854675293, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.7032589912414551, + "step": 452, + "token_acc": 0.7920252438324727 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 2.284067153930664, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8273622989654541, + "step": 453, + "token_acc": 0.7528546054300939 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 1.595000147819519, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9244086742401123, + "step": 454, + "token_acc": 0.7275905912269549 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 1.6957809925079346, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.6975402235984802, + "step": 455, + "token_acc": 0.7869734644646502 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 2.092339038848877, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7530581951141357, + "step": 456, + "token_acc": 0.7761567319716548 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 1.3622016906738281, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.787225604057312, + "step": 457, + "token_acc": 0.7615973644377171 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 1.3467158079147339, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7957576513290405, + "step": 458, + "token_acc": 0.7672947418542956 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 1.4943625926971436, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8363101482391357, + "step": 459, + "token_acc": 0.7491413533163834 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 1.0831845998764038, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8885717988014221, + "step": 460, + "token_acc": 0.7409447431039041 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.542517900466919, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8255709409713745, + "step": 461, + "token_acc": 0.7530204962243797 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 1.334511637687683, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8665659427642822, + "step": 462, + "token_acc": 0.7449273920827532 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 1.208848237991333, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.8557275533676147, + "step": 463, + "token_acc": 0.7444496016090354 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 2.0628461837768555, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9177385568618774, + "step": 464, + "token_acc": 0.7293287497738375 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 2.4950785636901855, + "learning_rate": 2.683911408999169e-05, + "loss": 0.723082959651947, + "step": 465, + "token_acc": 0.7769183168316832 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 2.308980941772461, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6471742987632751, + "step": 466, + "token_acc": 0.8040623523854511 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 1.521958827972412, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5249975323677063, + "step": 467, + "token_acc": 0.8463351666853743 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 3.039774179458618, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7578822374343872, + "step": 468, + "token_acc": 0.7744256850262939 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 1.9503605365753174, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7234141826629639, + "step": 469, + "token_acc": 0.7862872211844852 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 1.0008007287979126, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8409122228622437, + "step": 470, + "token_acc": 0.7482727545809552 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 1.5808378458023071, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.724835991859436, + "step": 471, + "token_acc": 0.7787719171657407 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 1.2275604009628296, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8796378970146179, + "step": 472, + "token_acc": 0.7436432934788284 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 5.61031436920166, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7971165180206299, + "step": 473, + "token_acc": 0.7616080156402737 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.6030521392822266, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.836396336555481, + "step": 474, + "token_acc": 0.7549324367188986 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 1.1238839626312256, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8152873516082764, + "step": 475, + "token_acc": 0.7558295833089825 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 2.533327102661133, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6784950494766235, + "step": 476, + "token_acc": 0.7988939165409754 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 2.931954860687256, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7702056169509888, + "step": 477, + "token_acc": 0.7747391716724629 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 1.1211943626403809, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9144121408462524, + "step": 478, + "token_acc": 0.7323793949304988 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 1.1485220193862915, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8556366562843323, + "step": 479, + "token_acc": 0.7465940054495913 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 1.1166046857833862, + "learning_rate": 2.5e-05, + "loss": 0.7300997972488403, + "step": 480, + "token_acc": 0.7833213400495722 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 1.2781999111175537, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7646458745002747, + "step": 481, + "token_acc": 0.7700712005892463 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 0.9656017422676086, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.8519848585128784, + "step": 482, + "token_acc": 0.746612222920219 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 2.7804577350616455, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.749862790107727, + "step": 483, + "token_acc": 0.7760351317440402 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 2.4027388095855713, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8318485021591187, + "step": 484, + "token_acc": 0.7504805638615976 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 3.0088815689086914, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8486036062240601, + "step": 485, + "token_acc": 0.7461552976695914 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 1.2995445728302002, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9670998454093933, + "step": 486, + "token_acc": 0.7201265687773314 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.1181038618087769, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8590025305747986, + "step": 487, + "token_acc": 0.747782901738205 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 2.26283597946167, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7187557220458984, + "step": 488, + "token_acc": 0.7850413930916358 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 1.03593909740448, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8461419939994812, + "step": 489, + "token_acc": 0.7481977342945417 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 2.398747444152832, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.698701024055481, + "step": 490, + "token_acc": 0.7867596299875742 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 1.4672415256500244, + "learning_rate": 2.365075276976245e-05, + "loss": 0.9008340239524841, + "step": 491, + "token_acc": 0.7327416173570019 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 3.996742010116577, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6810827255249023, + "step": 492, + "token_acc": 0.7924176507147297 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 1.1854064464569092, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.7924419045448303, + "step": 493, + "token_acc": 0.7695827357781875 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 1.384638786315918, + "learning_rate": 2.328329352789066e-05, + "loss": 0.7272655367851257, + "step": 494, + "token_acc": 0.7785135218763537 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 1.6975595951080322, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8528483510017395, + "step": 495, + "token_acc": 0.7481278895617633 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.2870354652404785, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8342181444168091, + "step": 496, + "token_acc": 0.7528511514973144 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 1.530961036682129, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6387697458267212, + "step": 497, + "token_acc": 0.8062214611872146 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 1.8430241346359253, + "learning_rate": 2.279394073699077e-05, + "loss": 0.7026108503341675, + "step": 498, + "token_acc": 0.785983362109559 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.2643704414367676, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7243825197219849, + "step": 499, + "token_acc": 0.7818732643271901 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 2.194952964782715, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5638291835784912, + "step": 500, + "token_acc": 0.8303964757709251 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 1.3642157316207886, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6388370394706726, + "step": 501, + "token_acc": 0.8047690014903129 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 1.4096916913986206, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8699530363082886, + "step": 502, + "token_acc": 0.7426746977039084 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.6735522150993347, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.9338130950927734, + "step": 503, + "token_acc": 0.7246069109818764 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 3.0893852710723877, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6764394044876099, + "step": 504, + "token_acc": 0.7987681647579636 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 1.2103800773620605, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7435534596443176, + "step": 505, + "token_acc": 0.7749155088246339 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 1.6574653387069702, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6575552225112915, + "step": 506, + "token_acc": 0.7954854039375424 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 3.2512946128845215, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6957029104232788, + "step": 507, + "token_acc": 0.790222367560497 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 1.6446380615234375, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8102457523345947, + "step": 508, + "token_acc": 0.7554084174642717 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 2.266608715057373, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7922036051750183, + "step": 509, + "token_acc": 0.7567540772319437 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 1.3823511600494385, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8182840943336487, + "step": 510, + "token_acc": 0.7597468183960676 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 2.875134229660034, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.758751392364502, + "step": 511, + "token_acc": 0.7762652146060218 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 0.9661290049552917, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8285502791404724, + "step": 512, + "token_acc": 0.7517256372628948 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 0.8895630240440369, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.8042497038841248, + "step": 513, + "token_acc": 0.7564245365581987 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 1.1554466485977173, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7614545226097107, + "step": 514, + "token_acc": 0.7749671279193538 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 2.6851818561553955, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.852085530757904, + "step": 515, + "token_acc": 0.7448673497214539 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.071006178855896, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7973021268844604, + "step": 516, + "token_acc": 0.7651457615236315 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 1.7251087427139282, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8796536326408386, + "step": 517, + "token_acc": 0.7393803896518684 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 0.8552775979042053, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7860521078109741, + "step": 518, + "token_acc": 0.7619782361539711 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 1.719724178314209, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8427704572677612, + "step": 519, + "token_acc": 0.7528826254065241 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 0.9758151173591614, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.8721702098846436, + "step": 520, + "token_acc": 0.7431514121894245 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 1.168480396270752, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8419342637062073, + "step": 521, + "token_acc": 0.7471320023837902 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 1.2203398942947388, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7959424257278442, + "step": 522, + "token_acc": 0.7663697898111863 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 1.0408990383148193, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7919071912765503, + "step": 523, + "token_acc": 0.7651286474054909 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 1.310434103012085, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8253304958343506, + "step": 524, + "token_acc": 0.75065126566724 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 1.0451242923736572, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7233434915542603, + "step": 525, + "token_acc": 0.7851820128479657 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 2.0899829864501953, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8267189264297485, + "step": 526, + "token_acc": 0.7562781712813909 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.255731225013733, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8266547322273254, + "step": 527, + "token_acc": 0.7522840531561462 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 1.7167625427246094, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.8521392941474915, + "step": 528, + "token_acc": 0.7510395283962313 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 1.0622138977050781, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8637402653694153, + "step": 529, + "token_acc": 0.7384504331087585 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 0.9813028573989868, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8480241894721985, + "step": 530, + "token_acc": 0.7536379362979546 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 4.28452730178833, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6397439241409302, + "step": 531, + "token_acc": 0.803735568791823 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 1.437615990638733, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9618914127349854, + "step": 532, + "token_acc": 0.7202291690698658 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 1.5095962285995483, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.7862619161605835, + "step": 533, + "token_acc": 0.7709383172800919 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 1.4545536041259766, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.877753496170044, + "step": 534, + "token_acc": 0.7414333585558318 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 3.5752525329589844, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.754334568977356, + "step": 535, + "token_acc": 0.7730709984595995 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 0.9353688955307007, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8347004055976868, + "step": 536, + "token_acc": 0.7475584067407124 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 4.231163501739502, + "learning_rate": 1.809595995707573e-05, + "loss": 0.8207680583000183, + "step": 537, + "token_acc": 0.7532355478861087 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 6.469966411590576, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7109387516975403, + "step": 538, + "token_acc": 0.7860278826157283 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 3.1630420684814453, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6461949348449707, + "step": 539, + "token_acc": 0.8017308524448291 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 1.0982550382614136, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8327257633209229, + "step": 540, + "token_acc": 0.7495007244390492 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 3.802609443664551, + "learning_rate": 1.762553672556591e-05, + "loss": 0.8171138763427734, + "step": 541, + "token_acc": 0.7566524822695035 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.0654925107955933, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7269375324249268, + "step": 542, + "token_acc": 0.7761418269230769 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 4.295766353607178, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.6608070731163025, + "step": 543, + "token_acc": 0.800157433828594 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 8.248258590698242, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7909623980522156, + "step": 544, + "token_acc": 0.7613503425992981 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.1179834604263306, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7602176666259766, + "step": 545, + "token_acc": 0.7709024552090246 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 2.3431406021118164, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6769133806228638, + "step": 546, + "token_acc": 0.7952830188679245 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 4.3784613609313965, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8144751787185669, + "step": 547, + "token_acc": 0.7544433094994892 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 1.7156646251678467, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8162662386894226, + "step": 548, + "token_acc": 0.7523768777334094 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 1.510075330734253, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7336026430130005, + "step": 549, + "token_acc": 0.7803434417245159 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 1.9461703300476074, + "learning_rate": 1.65777536651945e-05, + "loss": 0.7254256010055542, + "step": 550, + "token_acc": 0.7800743813474467 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 1.164979338645935, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.805265486240387, + "step": 551, + "token_acc": 0.7578671900556101 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 1.0273913145065308, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8320894241333008, + "step": 552, + "token_acc": 0.7525619764425735 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.8113181591033936, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.7513222694396973, + "step": 553, + "token_acc": 0.7729531069216634 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 2.532973527908325, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.706010103225708, + "step": 554, + "token_acc": 0.7890974084003575 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.9803953170776367, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.8844308257102966, + "step": 555, + "token_acc": 0.7387483137799943 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 3.6705994606018066, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7106630206108093, + "step": 556, + "token_acc": 0.7811320754716982 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 4.300747394561768, + "learning_rate": 1.577407047339834e-05, + "loss": 0.8109298944473267, + "step": 557, + "token_acc": 0.7626044755998922 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 1.2714130878448486, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6885141134262085, + "step": 558, + "token_acc": 0.7883173946756268 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 1.7359731197357178, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8751633167266846, + "step": 559, + "token_acc": 0.740814826910516 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 1.4216480255126953, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.820943295955658, + "step": 560, + "token_acc": 0.7575292646891693 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 4.9061760902404785, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.748153567314148, + "step": 561, + "token_acc": 0.7805115166018546 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 1.267930030822754, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.7889722585678101, + "step": 562, + "token_acc": 0.7689055058530289 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 0.9083903431892395, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8080474138259888, + "step": 563, + "token_acc": 0.7599738658173057 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 0.7936918139457703, + "learning_rate": 1.498127917242148e-05, + "loss": 0.9597259759902954, + "step": 564, + "token_acc": 0.720810821167184 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 2.1689324378967285, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7804182767868042, + "step": 565, + "token_acc": 0.7724068479355488 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 2.234748601913452, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8393502831459045, + "step": 566, + "token_acc": 0.7503378646951268 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 1.605635404586792, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7155381441116333, + "step": 567, + "token_acc": 0.7872617578499932 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 1.4522089958190918, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.7572216987609863, + "step": 568, + "token_acc": 0.7713926653718725 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 1.9692518711090088, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.8563569784164429, + "step": 569, + "token_acc": 0.7470536883457005 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 10.908825874328613, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7974921464920044, + "step": 570, + "token_acc": 0.7605943594506085 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 1.1746379137039185, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7666845321655273, + "step": 571, + "token_acc": 0.7709790209790209 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 1.0229063034057617, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7350344061851501, + "step": 572, + "token_acc": 0.7786911497811466 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 0.9891268610954285, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6754674315452576, + "step": 573, + "token_acc": 0.7943711387384639 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.231886386871338, + "learning_rate": 1.38694668528633e-05, + "loss": 0.8030673265457153, + "step": 574, + "token_acc": 0.7635471587580551 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 1.0724684000015259, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8548064827919006, + "step": 575, + "token_acc": 0.7461031175059952 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 1.5738338232040405, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.8126094341278076, + "step": 576, + "token_acc": 0.7611274150158963 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 1.4901602268218994, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8209086656570435, + "step": 577, + "token_acc": 0.7550751384128658 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 1.6848169565200806, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6577416658401489, + "step": 578, + "token_acc": 0.8033895475037569 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 3.016223907470703, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.6531224846839905, + "step": 579, + "token_acc": 0.8058121432278152 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.9795825481414795, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7647002339363098, + "step": 580, + "token_acc": 0.7752119263373283 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 2.140911817550659, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7398731708526611, + "step": 581, + "token_acc": 0.7717614002224433 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 1.2959418296813965, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.9219870567321777, + "step": 582, + "token_acc": 0.735004404580764 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 3.881425619125366, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6551182866096497, + "step": 583, + "token_acc": 0.800154768814084 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 0.6841437220573425, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8579003214836121, + "step": 584, + "token_acc": 0.7427914321021557 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 2.339364528656006, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7305861711502075, + "step": 585, + "token_acc": 0.7815454841865015 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 1.287462592124939, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7356473207473755, + "step": 586, + "token_acc": 0.7739403453689168 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 1.0997488498687744, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8273265361785889, + "step": 587, + "token_acc": 0.7510488803518173 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 2.9153354167938232, + "learning_rate": 1.235856566555039e-05, + "loss": 0.6755957007408142, + "step": 588, + "token_acc": 0.7906052393857272 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.6633471250534058, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.730632483959198, + "step": 589, + "token_acc": 0.7806400809944316 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 2.127331495285034, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.6703206300735474, + "step": 590, + "token_acc": 0.7975905830421188 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 1.4636554718017578, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.7496579885482788, + "step": 591, + "token_acc": 0.7742579196807183 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 2.0527307987213135, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.6405739188194275, + "step": 592, + "token_acc": 0.80549558390579 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.2344170808792114, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7799682021141052, + "step": 593, + "token_acc": 0.7664561072082178 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 5.459070205688477, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8071370124816895, + "step": 594, + "token_acc": 0.7617416829745597 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.069473147392273, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7295643091201782, + "step": 595, + "token_acc": 0.776476912968162 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 3.8844616413116455, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6706807017326355, + "step": 596, + "token_acc": 0.7991722152240418 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 5.004199028015137, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8247233033180237, + "step": 597, + "token_acc": 0.7518777783455112 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 3.0730934143066406, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8894381523132324, + "step": 598, + "token_acc": 0.7409200968523002 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 1.2874910831451416, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.71524977684021, + "step": 599, + "token_acc": 0.7803266787658802 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 1.2464348077774048, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7700718641281128, + "step": 600, + "token_acc": 0.7670187496841361 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 3.6714982986450195, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7547957897186279, + "step": 601, + "token_acc": 0.7734226755218216 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 0.8484803438186646, + "learning_rate": 1.090734344462458e-05, + "loss": 0.8919792175292969, + "step": 602, + "token_acc": 0.7393400901906505 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 13.488743782043457, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.7702862620353699, + "step": 603, + "token_acc": 0.7727465986394558 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 1.961902141571045, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.7595404386520386, + "step": 604, + "token_acc": 0.7702451257988836 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 27.53681755065918, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.6995214223861694, + "step": 605, + "token_acc": 0.787663379958725 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 0.8332082629203796, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.9005197286605835, + "step": 606, + "token_acc": 0.737596511295396 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 0.8233015537261963, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.8386024832725525, + "step": 607, + "token_acc": 0.7470095378616219 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 1.1943548917770386, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.7929884791374207, + "step": 608, + "token_acc": 0.7622805984214867 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 0.8096246719360352, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.80124831199646, + "step": 609, + "token_acc": 0.7553728275088768 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 1.0610454082489014, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.6171380281448364, + "step": 610, + "token_acc": 0.8159301496792587 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 18.28238296508789, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.650100588798523, + "step": 611, + "token_acc": 0.7978654890054283 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 3.4466676712036133, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7620124220848083, + "step": 612, + "token_acc": 0.7711020108795306 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 1.2529813051223755, + "learning_rate": 9.813437667457229e-06, + "loss": 0.6602888703346252, + "step": 613, + "token_acc": 0.8008800880088008 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 1.17232346534729, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8434534072875977, + "step": 614, + "token_acc": 0.7494439855118511 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 1.747151494026184, + "learning_rate": 9.619210235484333e-06, + "loss": 0.7442387938499451, + "step": 615, + "token_acc": 0.7745351402458241 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 1.0021146535873413, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7317293882369995, + "step": 616, + "token_acc": 0.7734412184673964 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.3337068557739258, + "learning_rate": 9.426465236041651e-06, + "loss": 0.7032402753829956, + "step": 617, + "token_acc": 0.7877114998566103 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 1.3676468133926392, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7973721027374268, + "step": 618, + "token_acc": 0.760376150854217 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 3.2059834003448486, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8150185346603394, + "step": 619, + "token_acc": 0.7556632064590542 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 4.086306571960449, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7822086811065674, + "step": 620, + "token_acc": 0.7675454095695808 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.2040249109268188, + "learning_rate": 9.04549669873337e-06, + "loss": 0.8220715522766113, + "step": 621, + "token_acc": 0.7524804177545692 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 1.4175060987472534, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6137598752975464, + "step": 622, + "token_acc": 0.8119511672735061 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 1.2992089986801147, + "learning_rate": 8.857309879408324e-06, + "loss": 0.6729296445846558, + "step": 623, + "token_acc": 0.7988444254226407 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 1.4079190492630005, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8189102411270142, + "step": 624, + "token_acc": 0.7577023215448037 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 1.279236078262329, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8362364172935486, + "step": 625, + "token_acc": 0.7482024803358587 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 1.2863163948059082, + "learning_rate": 8.577952526423969e-06, + "loss": 0.8098462820053101, + "step": 626, + "token_acc": 0.7593269058027426 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 27.66785430908203, + "learning_rate": 8.48562182685487e-06, + "loss": 0.7063795328140259, + "step": 627, + "token_acc": 0.7867946863080363 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 4.928782939910889, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6462287902832031, + "step": 628, + "token_acc": 0.8011155656266341 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 1.9602354764938354, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6783524751663208, + "step": 629, + "token_acc": 0.7902308752584425 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 16.4473876953125, + "learning_rate": 8.211026128824539e-06, + "loss": 0.804925799369812, + "step": 630, + "token_acc": 0.7570687117514912 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 1.3788988590240479, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8883236646652222, + "step": 631, + "token_acc": 0.7334713259466699 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 1.8335654735565186, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6375362873077393, + "step": 632, + "token_acc": 0.8153648894112618 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 1.9014967679977417, + "learning_rate": 7.940071245792579e-06, + "loss": 0.6049902439117432, + "step": 633, + "token_acc": 0.8161649828142902 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 1.3713113069534302, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6988447904586792, + "step": 634, + "token_acc": 0.7880343393220639 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 2.0989935398101807, + "learning_rate": 7.761486381573327e-06, + "loss": 0.7015566229820251, + "step": 635, + "token_acc": 0.7867938866841172 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 2.8194093704223633, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7713178992271423, + "step": 636, + "token_acc": 0.7664939550949914 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 2.2756409645080566, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8152978420257568, + "step": 637, + "token_acc": 0.7565742546007894 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 2.1602797508239746, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.6049292087554932, + "step": 638, + "token_acc": 0.8249440056583756 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 11.161283493041992, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9276903867721558, + "step": 639, + "token_acc": 0.7289690681738996 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 1.107016921043396, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.7289862632751465, + "step": 640, + "token_acc": 0.7762255053470978 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 1.384218692779541, + "learning_rate": 7.235768739040258e-06, + "loss": 0.8030155897140503, + "step": 641, + "token_acc": 0.7603261596043309 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 2.4319992065429688, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8239895105361938, + "step": 642, + "token_acc": 0.7537327021121631 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 1.7713115215301514, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9458705186843872, + "step": 643, + "token_acc": 0.7223184753504489 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 1.1825437545776367, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.8767014145851135, + "step": 644, + "token_acc": 0.7381348433905504 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 9.377113342285156, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7727670669555664, + "step": 645, + "token_acc": 0.7667001312842691 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 1.6212266683578491, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7251728177070618, + "step": 646, + "token_acc": 0.7853043560071502 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 1.0910215377807617, + "learning_rate": 6.725459488639211e-06, + "loss": 0.8785561919212341, + "step": 647, + "token_acc": 0.7388308513002889 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 2.236516237258911, + "learning_rate": 6.641937264107867e-06, + "loss": 0.7488150596618652, + "step": 648, + "token_acc": 0.7735017626321974 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 2.128631114959717, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6163979768753052, + "step": 649, + "token_acc": 0.810862691960253 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 1.3468025922775269, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8207809329032898, + "step": 650, + "token_acc": 0.7570913888466028 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 3.4600303173065186, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8186502456665039, + "step": 651, + "token_acc": 0.7548624496232696 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 3.5918667316436768, + "learning_rate": 6.312291828435077e-06, + "loss": 0.6305141448974609, + "step": 652, + "token_acc": 0.8072335886744885 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 1.0806105136871338, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7253304719924927, + "step": 653, + "token_acc": 0.7833950441469667 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 1.2885851860046387, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8548451066017151, + "step": 654, + "token_acc": 0.7464474922018122 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 1.0645694732666016, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8382260799407959, + "step": 655, + "token_acc": 0.7489557422443328 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 1.9353832006454468, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7723536491394043, + "step": 656, + "token_acc": 0.7694327731092437 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 4.828452110290527, + "learning_rate": 5.910380944855087e-06, + "loss": 0.8856979608535767, + "step": 657, + "token_acc": 0.738218359188763 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 1.8781278133392334, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.7738165259361267, + "step": 658, + "token_acc": 0.768805515870551 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 3.0246331691741943, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8133803606033325, + "step": 659, + "token_acc": 0.7611378205128205 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 1.3994319438934326, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7647578120231628, + "step": 660, + "token_acc": 0.7703229113275244 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 2.361185312271118, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7304031252861023, + "step": 661, + "token_acc": 0.7841618588477041 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 0.8526070713996887, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7237846255302429, + "step": 662, + "token_acc": 0.7868933969769292 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 1.588171362876892, + "learning_rate": 5.443287214979592e-06, + "loss": 0.6091185212135315, + "step": 663, + "token_acc": 0.8140839427025944 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 5.0973029136657715, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6413316130638123, + "step": 664, + "token_acc": 0.804970235283001 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 1.4185309410095215, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6981616020202637, + "step": 665, + "token_acc": 0.7925278219395866 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.9851809740066528, + "learning_rate": 5.216076783983493e-06, + "loss": 0.690722644329071, + "step": 666, + "token_acc": 0.7912854528819762 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 0.9478880763053894, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8563956022262573, + "step": 667, + "token_acc": 0.7468872958551178 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 3.0436248779296875, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8058983683586121, + "step": 668, + "token_acc": 0.7552821610056165 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 0.8428975939750671, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8022825717926025, + "step": 669, + "token_acc": 0.7613861386138614 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 4.840924263000488, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8100841641426086, + "step": 670, + "token_acc": 0.7554166666666666 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 1.1505413055419922, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8260376453399658, + "step": 671, + "token_acc": 0.7448619472700851 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 0.9072193503379822, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8600703477859497, + "step": 672, + "token_acc": 0.7444852298549205 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 1.7683610916137695, + "learning_rate": 4.702687000087386e-06, + "loss": 0.692681610584259, + "step": 673, + "token_acc": 0.7806238492364346 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 1.461195468902588, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7662481069564819, + "step": 674, + "token_acc": 0.7671449553722743 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 3.3718554973602295, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7405479550361633, + "step": 675, + "token_acc": 0.7750420168067227 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 2.9479410648345947, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8610312938690186, + "step": 676, + "token_acc": 0.7424875170222424 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 13.503181457519531, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7888531684875488, + "step": 677, + "token_acc": 0.765451076009753 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 0.7887119054794312, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7960864305496216, + "step": 678, + "token_acc": 0.7637773578963942 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 0.7959216237068176, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.8545209169387817, + "step": 679, + "token_acc": 0.7468409007993101 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 2.6820693016052246, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7095437049865723, + "step": 680, + "token_acc": 0.7877780240892632 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 1.3040446043014526, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7295015454292297, + "step": 681, + "token_acc": 0.7838582677165354 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.168471336364746, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7117878794670105, + "step": 682, + "token_acc": 0.7835704178148507 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 4.244610786437988, + "learning_rate": 4.010984790046615e-06, + "loss": 0.677824079990387, + "step": 683, + "token_acc": 0.7980658751436231 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 2.731039047241211, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8463807702064514, + "step": 684, + "token_acc": 0.7515052317764658 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 1.8785216808319092, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6157097816467285, + "step": 685, + "token_acc": 0.8154915079773546 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 0.865153431892395, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8836787939071655, + "step": 686, + "token_acc": 0.7380481451107145 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 0.8936150074005127, + "learning_rate": 3.748372666094277e-06, + "loss": 0.8360207676887512, + "step": 687, + "token_acc": 0.7508485460049537 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 2.322671890258789, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7108975052833557, + "step": 688, + "token_acc": 0.7858799072519389 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 3.3480117321014404, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.6993001699447632, + "step": 689, + "token_acc": 0.7873237489632292 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.8085229396820068, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7427332997322083, + "step": 690, + "token_acc": 0.7776805599745467 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 1.3708637952804565, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6952468752861023, + "step": 691, + "token_acc": 0.794788931528984 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 3.7617907524108887, + "learning_rate": 3.431640350555204e-06, + "loss": 0.6230769157409668, + "step": 692, + "token_acc": 0.8099717779868297 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 1.36726713180542, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6950256824493408, + "step": 693, + "token_acc": 0.7924514890894875 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 0.9996148943901062, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8100589513778687, + "step": 694, + "token_acc": 0.7537666602279313 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.661024570465088, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7753657102584839, + "step": 695, + "token_acc": 0.7681395005172159 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 2.1857688426971436, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7994472980499268, + "step": 696, + "token_acc": 0.759318423855165 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 3.475571870803833, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.7001972198486328, + "step": 697, + "token_acc": 0.7877510538060997 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.2787102460861206, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8403792977333069, + "step": 698, + "token_acc": 0.747796232717825 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 4.386336326599121, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8107684850692749, + "step": 699, + "token_acc": 0.7630341042728341 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 2.2676963806152344, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8950088024139404, + "step": 700, + "token_acc": 0.7388262048456223 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 1.0399364233016968, + "learning_rate": 2.894385171586095e-06, + "loss": 0.8310389518737793, + "step": 701, + "token_acc": 0.7524891179266523 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.593347191810608, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8382736444473267, + "step": 702, + "token_acc": 0.7514249790444258 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 1.2109148502349854, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6921058893203735, + "step": 703, + "token_acc": 0.787412490469259 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 0.9180388450622559, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8293173313140869, + "step": 704, + "token_acc": 0.757765414928141 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.0169309377670288, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7837424278259277, + "step": 705, + "token_acc": 0.7702204734245206 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 2.0241503715515137, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7397447824478149, + "step": 706, + "token_acc": 0.782954903815831 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 3.890124559402466, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7422389984130859, + "step": 707, + "token_acc": 0.7778991727797722 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.0221773386001587, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8820300698280334, + "step": 708, + "token_acc": 0.7368034292712798 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 1.0830367803573608, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8977921009063721, + "step": 709, + "token_acc": 0.7326030349286163 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 1.0371887683868408, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.7248738408088684, + "step": 710, + "token_acc": 0.7812835915270313 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 1.263805866241455, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7425920963287354, + "step": 711, + "token_acc": 0.7737332204619664 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 14.53322696685791, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8866590261459351, + "step": 712, + "token_acc": 0.7439101885193815 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 1.5575921535491943, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.7303316593170166, + "step": 713, + "token_acc": 0.7762118300234893 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 1.711562156677246, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9044393301010132, + "step": 714, + "token_acc": 0.729759955266206 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 1.9925239086151123, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7561551928520203, + "step": 715, + "token_acc": 0.775 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 1.4626455307006836, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7318213582038879, + "step": 716, + "token_acc": 0.7775335492827394 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 1.060317039489746, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.8696292638778687, + "step": 717, + "token_acc": 0.7421656220829443 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 0.9130681157112122, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7886737585067749, + "step": 718, + "token_acc": 0.7600247142415817 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.1878103017807007, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.762123703956604, + "step": 719, + "token_acc": 0.7682668745823124 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 1.7159684896469116, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.615555465221405, + "step": 720, + "token_acc": 0.8126673532440782 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 1.6527683734893799, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6307755708694458, + "step": 721, + "token_acc": 0.8067388444804209 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 3.193925619125366, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8727781176567078, + "step": 722, + "token_acc": 0.7392866177586643 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 0.9598880410194397, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.8311202526092529, + "step": 723, + "token_acc": 0.7487229203176852 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 2.1851632595062256, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7448897957801819, + "step": 724, + "token_acc": 0.7755723861756768 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 1.598838448524475, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7494593858718872, + "step": 725, + "token_acc": 0.7767838568753901 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 2.4717111587524414, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7850619554519653, + "step": 726, + "token_acc": 0.7650719167601755 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.356717586517334, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7940848469734192, + "step": 727, + "token_acc": 0.768211150514505 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 10.029845237731934, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7329187393188477, + "step": 728, + "token_acc": 0.7865592568401191 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 0.8495982885360718, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.8017995953559875, + "step": 729, + "token_acc": 0.7568345323741007 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 1.0362679958343506, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.7437936663627625, + "step": 730, + "token_acc": 0.7828212859587645 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 0.9663056135177612, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8609859943389893, + "step": 731, + "token_acc": 0.7439180537772087 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 1.3956825733184814, + "learning_rate": 1.379848838328049e-06, + "loss": 0.7277930378913879, + "step": 732, + "token_acc": 0.7791022255752547 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 3.7636775970458984, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7486779093742371, + "step": 733, + "token_acc": 0.7818169417541945 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 1.315354347229004, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8382982611656189, + "step": 734, + "token_acc": 0.7525453258561551 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.1111931800842285, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8941514492034912, + "step": 735, + "token_acc": 0.7349274757866444 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 1.297447919845581, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8244005441665649, + "step": 736, + "token_acc": 0.7516801237731471 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.0711147785186768, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6347471475601196, + "step": 737, + "token_acc": 0.8084218512898331 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 1.7543067932128906, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.7033067941665649, + "step": 738, + "token_acc": 0.7927236056163215 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 1.6257784366607666, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7322490215301514, + "step": 739, + "token_acc": 0.776595744680851 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 1.1702452898025513, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.748277485370636, + "step": 740, + "token_acc": 0.7742450209798475 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 1.2065194845199585, + "learning_rate": 1.041156686749717e-06, + "loss": 0.814299464225769, + "step": 741, + "token_acc": 0.7569658605204783 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.3025304079055786, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.723736047744751, + "step": 742, + "token_acc": 0.7832843667852173 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 1.5178861618041992, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8111813068389893, + "step": 743, + "token_acc": 0.7574536219081273 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 1.1835012435913086, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6973958015441895, + "step": 744, + "token_acc": 0.7883607669070958 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 1.0553349256515503, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8839579224586487, + "step": 745, + "token_acc": 0.7393556055524897 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 2.3524389266967773, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7688311338424683, + "step": 746, + "token_acc": 0.770196330865787 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 2.358461380004883, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7249113321304321, + "step": 747, + "token_acc": 0.7800233725166701 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 0.9818371534347534, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8962013721466064, + "step": 748, + "token_acc": 0.7347520288548242 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 1.4014264345169067, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8181411027908325, + "step": 749, + "token_acc": 0.7530269496159354 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 2.099468469619751, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7440256476402283, + "step": 750, + "token_acc": 0.7781477466315626 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 1.3900328874588013, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7947307229042053, + "step": 751, + "token_acc": 0.763049013367282 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 1.937106966972351, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6677680611610413, + "step": 752, + "token_acc": 0.7976190476190477 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 2.1338562965393066, + "learning_rate": 6.623969226072363e-07, + "loss": 0.912758469581604, + "step": 753, + "token_acc": 0.7364955399869837 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 1.8719439506530762, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8942464590072632, + "step": 754, + "token_acc": 0.7314372211599746 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.125182032585144, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7492611408233643, + "step": 755, + "token_acc": 0.7720939624419465 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 5.945156097412109, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7720708847045898, + "step": 756, + "token_acc": 0.7700412614205717 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 1.3858574628829956, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7861109972000122, + "step": 757, + "token_acc": 0.7625415642619633 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 3.03468656539917, + "learning_rate": 5.294312162731934e-07, + "loss": 0.7062956094741821, + "step": 758, + "token_acc": 0.7871165644171779 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 1.1258817911148071, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7970366477966309, + "step": 759, + "token_acc": 0.7655379339905701 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 1.3906890153884888, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7870966196060181, + "step": 760, + "token_acc": 0.7596698397397277 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 1.0741008520126343, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.7451232671737671, + "step": 761, + "token_acc": 0.7724817286304417 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 1.251846194267273, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7417510151863098, + "step": 762, + "token_acc": 0.773992627431041 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 2.0354645252227783, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.738898515701294, + "step": 763, + "token_acc": 0.7741708247725272 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 3.412504196166992, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.635358452796936, + "step": 764, + "token_acc": 0.8070014872440224 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 2.2815067768096924, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7735419273376465, + "step": 765, + "token_acc": 0.7652030509173366 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 2.218057870864868, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7568934559822083, + "step": 766, + "token_acc": 0.7767891934017405 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 1.2979291677474976, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8270889520645142, + "step": 767, + "token_acc": 0.7507336930796176 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 1.37172269821167, + "learning_rate": 3.077914851215585e-07, + "loss": 0.7350165247917175, + "step": 768, + "token_acc": 0.7841965471447543 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 5.036166667938232, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.8009260892868042, + "step": 769, + "token_acc": 0.7600553949903661 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 7.4999775886535645, + "learning_rate": 2.705872508804747e-07, + "loss": 0.6270233392715454, + "step": 770, + "token_acc": 0.8136564762670957 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 1.1216583251953125, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8184903860092163, + "step": 771, + "token_acc": 0.7551860202931229 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 3.301800489425659, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6371257305145264, + "step": 772, + "token_acc": 0.8157470801449859 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 3.2778139114379883, + "learning_rate": 2.192509677903687e-07, + "loss": 0.8046694993972778, + "step": 773, + "token_acc": 0.7623718671832851 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 1.263893485069275, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.84852534532547, + "step": 774, + "token_acc": 0.74725317090096 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 0.9263530969619751, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.7684552073478699, + "step": 775, + "token_acc": 0.7751570594070318 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 1.1419495344161987, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7462726831436157, + "step": 776, + "token_acc": 0.7782109441451659 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 3.4947397708892822, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.7795302271842957, + "step": 777, + "token_acc": 0.7635372501514234 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 2.087082862854004, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6606072783470154, + "step": 778, + "token_acc": 0.801208930486497 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 1.6553760766983032, + "learning_rate": 1.327100431795125e-07, + "loss": 0.7052230834960938, + "step": 779, + "token_acc": 0.7852637614678899 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 1.1143925189971924, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.8552008867263794, + "step": 780, + "token_acc": 0.7460056792911149 + }, + { + "epoch": 1.95369211514393, + "grad_norm": 1.6910258531570435, + "learning_rate": 1.0865311416741742e-07, + "loss": 0.787244975566864, + "step": 781, + "token_acc": 0.7597416764847057 + }, + { + "epoch": 1.9561952440550687, + "grad_norm": 0.9978480935096741, + "learning_rate": 9.752416870782155e-08, + "loss": 0.7427728176116943, + "step": 782, + "token_acc": 0.7691592363656256 + }, + { + "epoch": 1.9586983729662077, + "grad_norm": 3.087968587875366, + "learning_rate": 8.699526497563393e-08, + "loss": 0.6246906518936157, + "step": 783, + "token_acc": 0.8059849823321554 + }, + { + "epoch": 1.9612015018773468, + "grad_norm": 1.87112557888031, + "learning_rate": 7.706665667180091e-08, + "loss": 0.7229409217834473, + "step": 784, + "token_acc": 0.7798822819197102 + }, + { + "epoch": 1.9637046307884856, + "grad_norm": 4.381481170654297, + "learning_rate": 6.773858303274483e-08, + "loss": 0.7285189032554626, + "step": 785, + "token_acc": 0.7791870174885773 + }, + { + "epoch": 1.9662077596996246, + "grad_norm": 1.4539693593978882, + "learning_rate": 5.90112688246075e-08, + "loss": 0.8223809599876404, + "step": 786, + "token_acc": 0.7561250563655494 + }, + { + "epoch": 1.9687108886107634, + "grad_norm": 1.4071216583251953, + "learning_rate": 5.088492433783509e-08, + "loss": 0.6294353008270264, + "step": 787, + "token_acc": 0.8072788987365642 + }, + { + "epoch": 1.9712140175219024, + "grad_norm": 13.996487617492676, + "learning_rate": 4.335974538210441e-08, + "loss": 0.772925853729248, + "step": 788, + "token_acc": 0.7683742932964117 + }, + { + "epoch": 1.9737171464330414, + "grad_norm": 1.589355707168579, + "learning_rate": 3.6435913281607225e-08, + "loss": 0.7730788588523865, + "step": 789, + "token_acc": 0.7694374776065926 + }, + { + "epoch": 1.9762202753441802, + "grad_norm": 1.9809443950653076, + "learning_rate": 3.011359487068987e-08, + "loss": 0.7273301482200623, + "step": 790, + "token_acc": 0.7792143824652137 + }, + { + "epoch": 1.978723404255319, + "grad_norm": 1.8846714496612549, + "learning_rate": 2.439294248982038e-08, + "loss": 0.6879251003265381, + "step": 791, + "token_acc": 0.7894736842105263 + }, + { + "epoch": 1.981226533166458, + "grad_norm": 1.4308507442474365, + "learning_rate": 1.9274093981927478e-08, + "loss": 0.7810167670249939, + "step": 792, + "token_acc": 0.7666831928606842 + }, + { + "epoch": 1.983729662077597, + "grad_norm": 0.7908570170402527, + "learning_rate": 1.4757172689067179e-08, + "loss": 0.8870067000389099, + "step": 793, + "token_acc": 0.7335510965935604 + }, + { + "epoch": 1.986232790988736, + "grad_norm": 1.3998844623565674, + "learning_rate": 1.0842287449469579e-08, + "loss": 0.869205117225647, + "step": 794, + "token_acc": 0.7423013905810192 + }, + { + "epoch": 1.9887359198998749, + "grad_norm": 1.119472861289978, + "learning_rate": 7.529532594893751e-09, + "loss": 0.6787707805633545, + "step": 795, + "token_acc": 0.7989222231159012 + }, + { + "epoch": 1.9912390488110137, + "grad_norm": 2.85542631149292, + "learning_rate": 4.818987948379539e-09, + "loss": 0.886414647102356, + "step": 796, + "token_acc": 0.7438413023556681 + }, + { + "epoch": 1.9937421777221527, + "grad_norm": 0.8510656952857971, + "learning_rate": 2.7107188222991188e-09, + "loss": 0.769140899181366, + "step": 797, + "token_acc": 0.7727764553127029 + }, + { + "epoch": 1.9962453066332917, + "grad_norm": 1.367498517036438, + "learning_rate": 1.2047760167999134e-09, + "loss": 0.7304086089134216, + "step": 798, + "token_acc": 0.7812954876273653 + }, + { + "epoch": 1.9987484355444305, + "grad_norm": 1.9030873775482178, + "learning_rate": 3.01195818577793e-10, + "loss": 0.755138635635376, + "step": 799, + "token_acc": 0.7752727750755882 + }, + { + "epoch": 2.0, + "grad_norm": 1.4623066186904907, + "learning_rate": 0.0, + "loss": 0.8368865251541138, + "step": 800, + "token_acc": 0.759007551240561 + }, + { + "epoch": 2.0, + "eval_loss": 0.5354316234588623, + "eval_runtime": 2.8444, + "eval_samples_per_second": 4.219, + "eval_steps_per_second": 0.703, + "eval_token_acc": 0.7590822179732314, + "step": 800 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 3.9041551041015316e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..0bfcdf27206e894a799c26b9eb6965d540f808ed --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:49bbae92e24511cb6a61f553f51f6da390fae05a846251b575d4676e27bb1834 +size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/logging.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/logging.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..be7d4942632c6413192d2a42ae136c7258ee1eda --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/logging.jsonl @@ -0,0 +1,803 @@ +{"loss": 1.4558332, "grad_norm": 1.81413245, "learning_rate": 3.1e-07, "token_acc": 0.65871979, "epoch": 0.00250313, "global_step/max_steps": "1/800", "percentage": "0.12%", "elapsed_time": "12s", "remaining_time": "2h 45m 0s", "memory(GiB)": 41.98, "train_speed(s/it)": 12.390766} +{"loss": 1.51027501, "grad_norm": 2.70970654, "learning_rate": 6.3e-07, "token_acc": 0.63741072, "epoch": 0.00500626, "global_step/max_steps": "2/800", "percentage": "0.25%", "elapsed_time": "21s", "remaining_time": "2h 22m 51s", "memory(GiB)": 41.98, "train_speed(s/it)": 10.741063} +{"loss": 1.48469174, "grad_norm": 3.73147845, "learning_rate": 9.4e-07, "token_acc": 0.646795, "epoch": 0.00750939, "global_step/max_steps": "3/800", "percentage": "0.38%", "elapsed_time": "35s", "remaining_time": "2h 33m 37s", "memory(GiB)": 41.98, "train_speed(s/it)": 11.565127} +{"loss": 1.4477495, "grad_norm": 1.80397248, "learning_rate": 1.25e-06, "token_acc": 0.65511598, "epoch": 0.01001252, "global_step/max_steps": "4/800", "percentage": "0.50%", "elapsed_time": "47s", "remaining_time": "2h 37m 23s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.863631} +{"loss": 1.48353302, "grad_norm": 4.49486542, "learning_rate": 1.56e-06, "token_acc": 0.63696103, "epoch": 0.01251564, "global_step/max_steps": "5/800", "percentage": "0.62%", "elapsed_time": "59s", "remaining_time": "2h 37m 23s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.877811} +{"loss": 1.476511, "grad_norm": 3.468431, "learning_rate": 1.88e-06, "token_acc": 0.63957316, "epoch": 0.01501877, "global_step/max_steps": "6/800", "percentage": "0.75%", "elapsed_time": "1m 9s", "remaining_time": "2h 32m 40s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.536341} +{"loss": 1.4453218, "grad_norm": 1.64365697, "learning_rate": 2.19e-06, "token_acc": 0.66093, "epoch": 0.0175219, "global_step/max_steps": "7/800", "percentage": "0.88%", "elapsed_time": "1m 19s", "remaining_time": "2h 29m 22s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.301891} +{"loss": 1.43681729, "grad_norm": 5.72379589, "learning_rate": 2.5e-06, "token_acc": 0.65189604, "epoch": 0.02002503, "global_step/max_steps": "8/800", "percentage": "1.00%", "elapsed_time": "1m 30s", "remaining_time": "2h 29m 4s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.29241} +{"loss": 1.54694021, "grad_norm": 1.00102746, "learning_rate": 2.81e-06, "token_acc": 0.61862264, "epoch": 0.02252816, "global_step/max_steps": "9/800", "percentage": "1.12%", "elapsed_time": "1m 51s", "remaining_time": "2h 42m 46s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.346413} +{"loss": 1.54447556, "grad_norm": 1.23461747, "learning_rate": 3.13e-06, "token_acc": 0.61831968, "epoch": 0.02503129, "global_step/max_steps": "10/800", "percentage": "1.25%", "elapsed_time": "2m 7s", "remaining_time": "2h 47m 41s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.73516} +{"loss": 1.51285255, "grad_norm": 1.34937453, "learning_rate": 3.44e-06, "token_acc": 0.62636525, "epoch": 0.02753442, "global_step/max_steps": "11/800", "percentage": "1.38%", "elapsed_time": "2m 38s", "remaining_time": "3h 8m 42s", "memory(GiB)": 46.09, "train_speed(s/it)": 14.349243} +{"loss": 1.46874762, "grad_norm": 3.90444016, "learning_rate": 3.75e-06, "token_acc": 0.65392496, "epoch": 0.03003755, "global_step/max_steps": "12/800", "percentage": "1.50%", "elapsed_time": "2m 48s", "remaining_time": "3h 3m 26s", "memory(GiB)": 46.09, "train_speed(s/it)": 13.966387} +{"loss": 1.49748755, "grad_norm": 3.89909124, "learning_rate": 4.06e-06, "token_acc": 0.63968831, "epoch": 0.03254068, "global_step/max_steps": "13/800", "percentage": "1.62%", "elapsed_time": "3m 1s", "remaining_time": "3h 2m 26s", "memory(GiB)": 46.09, "train_speed(s/it)": 13.908042} +{"loss": 1.46033859, "grad_norm": 4.56066608, "learning_rate": 4.37e-06, "token_acc": 0.67359488, "epoch": 0.0350438, "global_step/max_steps": "14/800", "percentage": "1.75%", "elapsed_time": "3m 7s", "remaining_time": "2h 54m 33s", "memory(GiB)": 46.09, "train_speed(s/it)": 13.324887} +{"loss": 1.46727896, "grad_norm": 2.16520667, "learning_rate": 4.69e-06, "token_acc": 0.67072, "epoch": 0.03754693, "global_step/max_steps": "15/800", "percentage": "1.88%", "elapsed_time": "3m 14s", "remaining_time": "2h 49m 11s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.931154} +{"loss": 1.43232512, "grad_norm": 28.56511497, "learning_rate": 5e-06, "token_acc": 0.68028556, "epoch": 0.04005006, "global_step/max_steps": "16/800", "percentage": "2.00%", "elapsed_time": "3m 20s", "remaining_time": "2h 43m 35s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.51908} +{"loss": 1.52017832, "grad_norm": 1.2191155, "learning_rate": 5.31e-06, "token_acc": 0.63023493, "epoch": 0.04255319, "global_step/max_steps": "17/800", "percentage": "2.12%", "elapsed_time": "3m 30s", "remaining_time": "2h 41m 6s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.345463} +{"loss": 1.45490265, "grad_norm": 3.82360625, "learning_rate": 5.63e-06, "token_acc": 0.65339672, "epoch": 0.04505632, "global_step/max_steps": "18/800", "percentage": "2.25%", "elapsed_time": "3m 43s", "remaining_time": "2h 41m 20s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.378941} +{"loss": 1.42181575, "grad_norm": 3.61547351, "learning_rate": 5.94e-06, "token_acc": 0.66259295, "epoch": 0.04755945, "global_step/max_steps": "19/800", "percentage": "2.38%", "elapsed_time": "3m 52s", "remaining_time": "2h 39m 5s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.221764} +{"loss": 1.5040549, "grad_norm": 6.05622578, "learning_rate": 6.25e-06, "token_acc": 0.64638655, "epoch": 0.05006258, "global_step/max_steps": "20/800", "percentage": "2.50%", "elapsed_time": "4m 6s", "remaining_time": "2h 40m 6s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.315789} +{"loss": 1.51865125, "grad_norm": 1.11016071, "learning_rate": 6.56e-06, "token_acc": 0.63366227, "epoch": 0.05256571, "global_step/max_steps": "21/800", "percentage": "2.62%", "elapsed_time": "4m 26s", "remaining_time": "2h 44m 35s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.676679} +{"loss": 1.47107792, "grad_norm": 3.46882844, "learning_rate": 6.88e-06, "token_acc": 0.64960304, "epoch": 0.05506884, "global_step/max_steps": "22/800", "percentage": "2.75%", "elapsed_time": "4m 35s", "remaining_time": "2h 42m 21s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.520517} +{"loss": 1.45560551, "grad_norm": 2.94540191, "learning_rate": 7.19e-06, "token_acc": 0.65112738, "epoch": 0.05757196, "global_step/max_steps": "23/800", "percentage": "2.88%", "elapsed_time": "4m 45s", "remaining_time": "2h 40m 39s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.405413} +{"loss": 1.49816251, "grad_norm": 1.79596484, "learning_rate": 7.5e-06, "token_acc": 0.65819924, "epoch": 0.06007509, "global_step/max_steps": "24/800", "percentage": "3.00%", "elapsed_time": "4m 52s", "remaining_time": "2h 37m 26s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.172698} +{"loss": 1.46920872, "grad_norm": 2.83698964, "learning_rate": 7.81e-06, "token_acc": 0.64002291, "epoch": 0.06257822, "global_step/max_steps": "25/800", "percentage": "3.12%", "elapsed_time": "5m 1s", "remaining_time": "2h 35m 17s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.021683} +{"loss": 1.46728349, "grad_norm": 4.33515024, "learning_rate": 8.13e-06, "token_acc": 0.64268972, "epoch": 0.06508135, "global_step/max_steps": "26/800", "percentage": "3.25%", "elapsed_time": "5m 10s", "remaining_time": "2h 33m 52s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.927022} +{"loss": 1.50535274, "grad_norm": 2.61877441, "learning_rate": 8.44e-06, "token_acc": 0.64112455, "epoch": 0.06758448, "global_step/max_steps": "27/800", "percentage": "3.38%", "elapsed_time": "5m 18s", "remaining_time": "2h 31m 32s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.762209} +{"loss": 1.49523211, "grad_norm": 4.59664917, "learning_rate": 8.75e-06, "token_acc": 0.65828274, "epoch": 0.07008761, "global_step/max_steps": "28/800", "percentage": "3.50%", "elapsed_time": "5m 23s", "remaining_time": "2h 28m 39s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.552898} +{"loss": 1.45207429, "grad_norm": 2.28268576, "learning_rate": 9.06e-06, "token_acc": 0.64224635, "epoch": 0.07259074, "global_step/max_steps": "29/800", "percentage": "3.62%", "elapsed_time": "5m 34s", "remaining_time": "2h 28m 3s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.521148} +{"loss": 1.41394258, "grad_norm": 1.2480427, "learning_rate": 9.38e-06, "token_acc": 0.651309, "epoch": 0.07509387, "global_step/max_steps": "30/800", "percentage": "3.75%", "elapsed_time": "5m 58s", "remaining_time": "2h 33m 10s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.934973} +{"loss": 1.42694211, "grad_norm": 1.57327473, "learning_rate": 9.69e-06, "token_acc": 0.65117753, "epoch": 0.077597, "global_step/max_steps": "31/800", "percentage": "3.88%", "elapsed_time": "6m 22s", "remaining_time": "2h 37m 45s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.307557} +{"loss": 1.44998574, "grad_norm": 1.30590212, "learning_rate": 1e-05, "token_acc": 0.63626751, "epoch": 0.08010013, "global_step/max_steps": "32/800", "percentage": "4.00%", "elapsed_time": "6m 35s", "remaining_time": "2h 38m 4s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.349544} +{"loss": 1.44981241, "grad_norm": 2.71852946, "learning_rate": 1.031e-05, "token_acc": 0.64035601, "epoch": 0.08260325, "global_step/max_steps": "33/800", "percentage": "4.12%", "elapsed_time": "6m 45s", "remaining_time": "2h 36m 54s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.273441} +{"loss": 1.36018753, "grad_norm": 1.55987298, "learning_rate": 1.063e-05, "token_acc": 0.67006753, "epoch": 0.08510638, "global_step/max_steps": "34/800", "percentage": "4.25%", "elapsed_time": "6m 57s", "remaining_time": "2h 36m 25s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.251794} +{"loss": 1.37653637, "grad_norm": 9.86748028, "learning_rate": 1.094e-05, "token_acc": 0.66691658, "epoch": 0.08760951, "global_step/max_steps": "35/800", "percentage": "4.38%", "elapsed_time": "7m 6s", "remaining_time": "2h 35m 2s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.158945} +{"loss": 1.41096854, "grad_norm": 2.1362896, "learning_rate": 1.125e-05, "token_acc": 0.65672217, "epoch": 0.09011264, "global_step/max_steps": "36/800", "percentage": "4.50%", "elapsed_time": "7m 13s", "remaining_time": "2h 33m 3s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.019115} +{"loss": 1.48823214, "grad_norm": 4.0794034, "learning_rate": 1.156e-05, "token_acc": 0.6309482, "epoch": 0.09261577, "global_step/max_steps": "37/800", "percentage": "4.62%", "elapsed_time": "7m 24s", "remaining_time": "2h 32m 27s", "memory(GiB)": 46.09, "train_speed(s/it)": 11.987895} +{"loss": 1.31311727, "grad_norm": 0.79975605, "learning_rate": 1.188e-05, "token_acc": 0.66652716, "epoch": 0.0951189, "global_step/max_steps": "38/800", "percentage": "4.75%", "elapsed_time": "7m 48s", "remaining_time": "2h 36m 30s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.323085} +{"loss": 1.42822146, "grad_norm": 3.26526237, "learning_rate": 1.219e-05, "token_acc": 0.63256106, "epoch": 0.09762203, "global_step/max_steps": "39/800", "percentage": "4.88%", "elapsed_time": "8m 11s", "remaining_time": "2h 39m 36s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.583874} +{"loss": 1.33953559, "grad_norm": 3.65407777, "learning_rate": 1.25e-05, "token_acc": 0.67175302, "epoch": 0.10012516, "global_step/max_steps": "40/800", "percentage": "5.00%", "elapsed_time": "8m 22s", "remaining_time": "2h 38m 49s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.537949} +{"loss": 1.33718407, "grad_norm": 5.24853325, "learning_rate": 1.281e-05, "token_acc": 0.66939098, "epoch": 0.10262829, "global_step/max_steps": "41/800", "percentage": "5.12%", "elapsed_time": "8m 41s", "remaining_time": "2h 40m 44s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.705734} +{"loss": 1.34009445, "grad_norm": 3.77858138, "learning_rate": 1.313e-05, "token_acc": 0.66537916, "epoch": 0.10513141, "global_step/max_steps": "42/800", "percentage": "5.25%", "elapsed_time": "8m 50s", "remaining_time": "2h 39m 33s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.628867} +{"loss": 1.35555243, "grad_norm": 1.44952476, "learning_rate": 1.344e-05, "token_acc": 0.65992885, "epoch": 0.10763454, "global_step/max_steps": "43/800", "percentage": "5.38%", "elapsed_time": "9m 2s", "remaining_time": "2h 39m 6s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.609854} +{"loss": 1.32342768, "grad_norm": 3.1733644, "learning_rate": 1.375e-05, "token_acc": 0.6751474, "epoch": 0.11013767, "global_step/max_steps": "44/800", "percentage": "5.50%", "elapsed_time": "9m 11s", "remaining_time": "2h 37m 47s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.522749} +{"loss": 1.34484756, "grad_norm": 2.60513806, "learning_rate": 1.406e-05, "token_acc": 0.66171881, "epoch": 0.1126408, "global_step/max_steps": "45/800", "percentage": "5.62%", "elapsed_time": "9m 21s", "remaining_time": "2h 36m 52s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.466424} +{"loss": 1.30671358, "grad_norm": 4.86713982, "learning_rate": 1.437e-05, "token_acc": 0.67376079, "epoch": 0.11514393, "global_step/max_steps": "46/800", "percentage": "5.75%", "elapsed_time": "9m 30s", "remaining_time": "2h 35m 49s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.39928} +{"loss": 1.29495776, "grad_norm": 4.3610692, "learning_rate": 1.469e-05, "token_acc": 0.68954248, "epoch": 0.11764706, "global_step/max_steps": "47/800", "percentage": "5.88%", "elapsed_time": "9m 39s", "remaining_time": "2h 34m 39s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.323149} +{"loss": 1.3317585, "grad_norm": 1.57757425, "learning_rate": 1.5e-05, "token_acc": 0.66444226, "epoch": 0.12015019, "global_step/max_steps": "48/800", "percentage": "6.00%", "elapsed_time": "9m 48s", "remaining_time": "2h 33m 28s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.24493} +{"loss": 1.3528285, "grad_norm": 2.20259428, "learning_rate": 1.531e-05, "token_acc": 0.66219099, "epoch": 0.12265332, "global_step/max_steps": "49/800", "percentage": "6.12%", "elapsed_time": "10m 2s", "remaining_time": "2h 33m 51s", "memory(GiB)": 46.09, "train_speed(s/it)": 12.291312} +{"loss": 1.19991708, "grad_norm": 2.17864442, "learning_rate": 1.563e-05, "token_acc": 0.69595572, "epoch": 0.12515645, "global_step/max_steps": "50/800", "percentage": "6.25%", "elapsed_time": "10m 21s", "remaining_time": "2h 35m 19s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.425455} +{"loss": 1.34575152, "grad_norm": 2.96152425, "learning_rate": 1.594e-05, "token_acc": 0.66278792, "epoch": 0.12765957, "global_step/max_steps": "51/800", "percentage": "6.38%", "elapsed_time": "10m 41s", "remaining_time": "2h 36m 59s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.575383} +{"loss": 1.32373929, "grad_norm": 13.19290733, "learning_rate": 1.625e-05, "token_acc": 0.65428529, "epoch": 0.1301627, "global_step/max_steps": "52/800", "percentage": "6.50%", "elapsed_time": "11m 5s", "remaining_time": "2h 39m 27s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.789602} +{"loss": 1.34334421, "grad_norm": 3.60557771, "learning_rate": 1.656e-05, "token_acc": 0.66240974, "epoch": 0.13266583, "global_step/max_steps": "53/800", "percentage": "6.62%", "elapsed_time": "11m 15s", "remaining_time": "2h 38m 29s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.729624} +{"loss": 1.27892768, "grad_norm": 1.78576064, "learning_rate": 1.688e-05, "token_acc": 0.67233865, "epoch": 0.13516896, "global_step/max_steps": "54/800", "percentage": "6.75%", "elapsed_time": "11m 28s", "remaining_time": "2h 38m 28s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.744978} +{"loss": 1.32226467, "grad_norm": 2.16651225, "learning_rate": 1.719e-05, "token_acc": 0.65888192, "epoch": 0.13767209, "global_step/max_steps": "55/800", "percentage": "6.88%", "elapsed_time": "11m 42s", "remaining_time": "2h 38m 33s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.768985} +{"loss": 1.33628583, "grad_norm": 1.74622548, "learning_rate": 1.75e-05, "token_acc": 0.66137442, "epoch": 0.14017522, "global_step/max_steps": "56/800", "percentage": "7.00%", "elapsed_time": "11m 53s", "remaining_time": "2h 37m 59s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.740662} +{"loss": 1.220227, "grad_norm": 1.21841359, "learning_rate": 1.781e-05, "token_acc": 0.68884453, "epoch": 0.14267835, "global_step/max_steps": "57/800", "percentage": "7.12%", "elapsed_time": "12m 2s", "remaining_time": "2h 36m 50s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.664407} +{"loss": 1.22404385, "grad_norm": 2.86299038, "learning_rate": 1.813e-05, "token_acc": 0.69242424, "epoch": 0.14518148, "global_step/max_steps": "58/800", "percentage": "7.25%", "elapsed_time": "12m 10s", "remaining_time": "2h 35m 36s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.582253} +{"loss": 1.1999526, "grad_norm": 4.4618206, "learning_rate": 1.844e-05, "token_acc": 0.69395973, "epoch": 0.14768461, "global_step/max_steps": "59/800", "percentage": "7.38%", "elapsed_time": "12m 21s", "remaining_time": "2h 35m 1s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.551835} +{"loss": 1.25863838, "grad_norm": 1.08660328, "learning_rate": 1.875e-05, "token_acc": 0.67401081, "epoch": 0.15018773, "global_step/max_steps": "60/800", "percentage": "7.50%", "elapsed_time": "12m 31s", "remaining_time": "2h 34m 22s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.515696} +{"loss": 1.26998496, "grad_norm": 1.9648689, "learning_rate": 1.906e-05, "token_acc": 0.67294587, "epoch": 0.15269086, "global_step/max_steps": "61/800", "percentage": "7.62%", "elapsed_time": "12m 50s", "remaining_time": "2h 35m 27s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.620798} +{"loss": 1.26922607, "grad_norm": 0.93022835, "learning_rate": 1.937e-05, "token_acc": 0.66934022, "epoch": 0.15519399, "global_step/max_steps": "62/800", "percentage": "7.75%", "elapsed_time": "13m 3s", "remaining_time": "2h 35m 19s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.626817} +{"loss": 1.22307491, "grad_norm": 1.6925782, "learning_rate": 1.969e-05, "token_acc": 0.69140625, "epoch": 0.15769712, "global_step/max_steps": "63/800", "percentage": "7.88%", "elapsed_time": "13m 11s", "remaining_time": "2h 34m 19s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.563083} +{"loss": 1.2473464, "grad_norm": 3.13814139, "learning_rate": 2e-05, "token_acc": 0.67190796, "epoch": 0.16020025, "global_step/max_steps": "64/800", "percentage": "8.00%", "elapsed_time": "13m 23s", "remaining_time": "2h 33m 56s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.548805} +{"loss": 1.2626996, "grad_norm": 84.18292236, "learning_rate": 2.031e-05, "token_acc": 0.66414085, "epoch": 0.16270338, "global_step/max_steps": "65/800", "percentage": "8.12%", "elapsed_time": "13m 34s", "remaining_time": "2h 33m 21s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.518359} +{"loss": 1.25144935, "grad_norm": 1.18376219, "learning_rate": 2.062e-05, "token_acc": 0.67285481, "epoch": 0.16520651, "global_step/max_steps": "66/800", "percentage": "8.25%", "elapsed_time": "13m 51s", "remaining_time": "2h 34m 2s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.591829} +{"loss": 1.19057465, "grad_norm": 2.15585184, "learning_rate": 2.094e-05, "token_acc": 0.70789898, "epoch": 0.16770964, "global_step/max_steps": "67/800", "percentage": "8.38%", "elapsed_time": "13m 58s", "remaining_time": "2h 32m 47s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.506149} +{"loss": 1.25636125, "grad_norm": 2.13520622, "learning_rate": 2.125e-05, "token_acc": 0.67483542, "epoch": 0.17021277, "global_step/max_steps": "68/800", "percentage": "8.50%", "elapsed_time": "14m 11s", "remaining_time": "2h 32m 37s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.509107} +{"loss": 1.21788681, "grad_norm": 4.16011, "learning_rate": 2.156e-05, "token_acc": 0.68808374, "epoch": 0.17271589, "global_step/max_steps": "69/800", "percentage": "8.62%", "elapsed_time": "14m 17s", "remaining_time": "2h 31m 21s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.42232} +{"loss": 1.20124221, "grad_norm": 2.21967506, "learning_rate": 2.187e-05, "token_acc": 0.68041179, "epoch": 0.17521902, "global_step/max_steps": "70/800", "percentage": "8.75%", "elapsed_time": "14m 30s", "remaining_time": "2h 31m 8s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.422198} +{"loss": 1.2328397, "grad_norm": 4.0434885, "learning_rate": 2.219e-05, "token_acc": 0.67004841, "epoch": 0.17772215, "global_step/max_steps": "71/800", "percentage": "8.88%", "elapsed_time": "14m 56s", "remaining_time": "2h 33m 25s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.626463} +{"loss": 1.21818304, "grad_norm": 1.67566049, "learning_rate": 2.25e-05, "token_acc": 0.68504811, "epoch": 0.18022528, "global_step/max_steps": "72/800", "percentage": "9.00%", "elapsed_time": "15m 4s", "remaining_time": "2h 32m 25s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.562469} +{"loss": 1.0783236, "grad_norm": 3.0427444, "learning_rate": 2.281e-05, "token_acc": 0.71672881, "epoch": 0.18272841, "global_step/max_steps": "73/800", "percentage": "9.12%", "elapsed_time": "15m 17s", "remaining_time": "2h 32m 13s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.561924} +{"loss": 1.18442929, "grad_norm": 11.55377388, "learning_rate": 2.313e-05, "token_acc": 0.69242967, "epoch": 0.18523154, "global_step/max_steps": "74/800", "percentage": "9.25%", "elapsed_time": "15m 26s", "remaining_time": "2h 31m 23s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.511426} +{"loss": 1.1743784, "grad_norm": 1.27283394, "learning_rate": 2.344e-05, "token_acc": 0.6912672, "epoch": 0.18773467, "global_step/max_steps": "75/800", "percentage": "9.38%", "elapsed_time": "15m 36s", "remaining_time": "2h 30m 44s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.474337} +{"loss": 1.02694392, "grad_norm": 2.97003078, "learning_rate": 2.375e-05, "token_acc": 0.7346795, "epoch": 0.1902378, "global_step/max_steps": "76/800", "percentage": "9.50%", "elapsed_time": "15m 42s", "remaining_time": "2h 29m 31s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.390691} +{"loss": 1.1813221, "grad_norm": 2.9078362, "learning_rate": 2.406e-05, "token_acc": 0.68830138, "epoch": 0.19274093, "global_step/max_steps": "77/800", "percentage": "9.62%", "elapsed_time": "15m 52s", "remaining_time": "2h 29m 1s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.366735} +{"loss": 1.20394444, "grad_norm": 3.97250772, "learning_rate": 2.437e-05, "token_acc": 0.67752477, "epoch": 0.19524406, "global_step/max_steps": "78/800", "percentage": "9.75%", "elapsed_time": "16m 3s", "remaining_time": "2h 28m 32s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.343675} +{"loss": 1.21674514, "grad_norm": 1.53857791, "learning_rate": 2.469e-05, "token_acc": 0.67549927, "epoch": 0.19774718, "global_step/max_steps": "79/800", "percentage": "9.88%", "elapsed_time": "16m 14s", "remaining_time": "2h 28m 13s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.334931} +{"loss": 1.22278237, "grad_norm": 1.9446708, "learning_rate": 2.5e-05, "token_acc": 0.6712661, "epoch": 0.20025031, "global_step/max_steps": "80/800", "percentage": "10.00%", "elapsed_time": "16m 29s", "remaining_time": "2h 28m 18s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.358995} +{"loss": 1.1703465, "grad_norm": 1.40789115, "learning_rate": 2.531e-05, "token_acc": 0.68713789, "epoch": 0.20275344, "global_step/max_steps": "81/800", "percentage": "10.12%", "elapsed_time": "16m 54s", "remaining_time": "2h 30m 0s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.517997} +{"loss": 1.25976276, "grad_norm": 0.81937599, "learning_rate": 2.562e-05, "token_acc": 0.66003344, "epoch": 0.20525657, "global_step/max_steps": "82/800", "percentage": "10.25%", "elapsed_time": "17m 22s", "remaining_time": "2h 32m 4s", "memory(GiB)": 66.35, "train_speed(s/it)": 12.708072} +{"loss": 1.14701724, "grad_norm": 1.51105869, "learning_rate": 2.594e-05, "token_acc": 0.68807862, "epoch": 0.2077597, "global_step/max_steps": "83/800", "percentage": "10.38%", "elapsed_time": "17m 44s", "remaining_time": "2h 33m 12s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.82029} +{"loss": 1.17367887, "grad_norm": 2.44860959, "learning_rate": 2.625e-05, "token_acc": 0.69022231, "epoch": 0.21026283, "global_step/max_steps": "84/800", "percentage": "10.50%", "elapsed_time": "17m 56s", "remaining_time": "2h 32m 49s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.806561} +{"loss": 1.04769111, "grad_norm": 15.18591785, "learning_rate": 2.656e-05, "token_acc": 0.72188773, "epoch": 0.21276596, "global_step/max_steps": "85/800", "percentage": "10.62%", "elapsed_time": "18m 4s", "remaining_time": "2h 32m 0s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.755926} +{"loss": 1.17200565, "grad_norm": 1.7706151, "learning_rate": 2.687e-05, "token_acc": 0.6911137, "epoch": 0.21526909, "global_step/max_steps": "86/800", "percentage": "10.75%", "elapsed_time": "18m 13s", "remaining_time": "2h 31m 13s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.706858} +{"loss": 1.10034406, "grad_norm": 2.43222785, "learning_rate": 2.719e-05, "token_acc": 0.7121124, "epoch": 0.21777222, "global_step/max_steps": "87/800", "percentage": "10.88%", "elapsed_time": "18m 20s", "remaining_time": "2h 30m 14s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.642567} +{"loss": 1.09574962, "grad_norm": 3.55436254, "learning_rate": 2.75e-05, "token_acc": 0.70509978, "epoch": 0.22027534, "global_step/max_steps": "88/800", "percentage": "11.00%", "elapsed_time": "18m 29s", "remaining_time": "2h 29m 31s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.600013} +{"loss": 1.18587112, "grad_norm": 6.43117094, "learning_rate": 2.781e-05, "token_acc": 0.68400463, "epoch": 0.22277847, "global_step/max_steps": "89/800", "percentage": "11.12%", "elapsed_time": "18m 38s", "remaining_time": "2h 28m 52s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.563253} +{"loss": 0.97730064, "grad_norm": 2.45690751, "learning_rate": 2.813e-05, "token_acc": 0.73448421, "epoch": 0.2252816, "global_step/max_steps": "90/800", "percentage": "11.25%", "elapsed_time": "18m 45s", "remaining_time": "2h 27m 56s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.501337} +{"loss": 1.0643003, "grad_norm": 11.66300774, "learning_rate": 2.844e-05, "token_acc": 0.71099634, "epoch": 0.22778473, "global_step/max_steps": "91/800", "percentage": "11.38%", "elapsed_time": "19m 5s", "remaining_time": "2h 28m 41s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.583202} +{"loss": 1.15868509, "grad_norm": 2.88943648, "learning_rate": 2.875e-05, "token_acc": 0.68587797, "epoch": 0.23028786, "global_step/max_steps": "92/800", "percentage": "11.50%", "elapsed_time": "19m 16s", "remaining_time": "2h 28m 14s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.562085} +{"loss": 1.00986457, "grad_norm": 1.71590281, "learning_rate": 2.906e-05, "token_acc": 0.72750603, "epoch": 0.23279099, "global_step/max_steps": "93/800", "percentage": "11.62%", "elapsed_time": "19m 30s", "remaining_time": "2h 28m 16s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.582682} +{"loss": 1.17143404, "grad_norm": 1.53335273, "learning_rate": 2.938e-05, "token_acc": 0.68601405, "epoch": 0.23529412, "global_step/max_steps": "94/800", "percentage": "11.75%", "elapsed_time": "19m 43s", "remaining_time": "2h 28m 4s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.583106} +{"loss": 1.08212948, "grad_norm": 3.6715579, "learning_rate": 2.969e-05, "token_acc": 0.69631506, "epoch": 0.23779725, "global_step/max_steps": "95/800", "percentage": "11.88%", "elapsed_time": "19m 56s", "remaining_time": "2h 27m 57s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.591103} +{"loss": 0.99973029, "grad_norm": 5.29555655, "learning_rate": 3e-05, "token_acc": 0.73852385, "epoch": 0.24030038, "global_step/max_steps": "96/800", "percentage": "12.00%", "elapsed_time": "20m 8s", "remaining_time": "2h 27m 40s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.585115} +{"loss": 1.13035727, "grad_norm": 2.39762521, "learning_rate": 3.031e-05, "token_acc": 0.6882727, "epoch": 0.2428035, "global_step/max_steps": "97/800", "percentage": "12.12%", "elapsed_time": "20m 21s", "remaining_time": "2h 27m 28s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.585819} +{"loss": 1.15207303, "grad_norm": 2.03793836, "learning_rate": 3.063e-05, "token_acc": 0.68944815, "epoch": 0.24530663, "global_step/max_steps": "98/800", "percentage": "12.25%", "elapsed_time": "20m 29s", "remaining_time": "2h 26m 46s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.544467} +{"loss": 1.05738938, "grad_norm": 3.02187562, "learning_rate": 3.094e-05, "token_acc": 0.71251212, "epoch": 0.24780976, "global_step/max_steps": "99/800", "percentage": "12.38%", "elapsed_time": "20m 40s", "remaining_time": "2h 26m 18s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.521553} +{"loss": 1.06203246, "grad_norm": 3.04327655, "learning_rate": 3.125e-05, "token_acc": 0.70782749, "epoch": 0.25031289, "global_step/max_steps": "100/800", "percentage": "12.50%", "elapsed_time": "20m 52s", "remaining_time": "2h 26m 3s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.518226} +{"loss": 1.10855806, "grad_norm": 5.12579966, "learning_rate": 3.156e-05, "token_acc": 0.69820246, "epoch": 0.25281602, "global_step/max_steps": "101/800", "percentage": "12.62%", "elapsed_time": "21m 14s", "remaining_time": "2h 26m 57s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.61395} +{"loss": 1.10066605, "grad_norm": 4.36597776, "learning_rate": 3.188e-05, "token_acc": 0.6985514, "epoch": 0.25531915, "global_step/max_steps": "102/800", "percentage": "12.75%", "elapsed_time": "21m 23s", "remaining_time": "2h 26m 20s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.578102} +{"loss": 1.07113051, "grad_norm": 2.45406651, "learning_rate": 3.219e-05, "token_acc": 0.70230845, "epoch": 0.25782228, "global_step/max_steps": "103/800", "percentage": "12.88%", "elapsed_time": "21m 36s", "remaining_time": "2h 26m 12s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.584939} +{"loss": 1.00827169, "grad_norm": 1.75350964, "learning_rate": 3.25e-05, "token_acc": 0.71914487, "epoch": 0.26032541, "global_step/max_steps": "104/800", "percentage": "13.00%", "elapsed_time": "21m 46s", "remaining_time": "2h 25m 40s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.557076} +{"loss": 1.06381214, "grad_norm": 3.07568312, "learning_rate": 3.281e-05, "token_acc": 0.70952078, "epoch": 0.26282854, "global_step/max_steps": "105/800", "percentage": "13.12%", "elapsed_time": "21m 58s", "remaining_time": "2h 25m 25s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.553864} +{"loss": 1.13535571, "grad_norm": 2.38269448, "learning_rate": 3.312e-05, "token_acc": 0.68541596, "epoch": 0.26533166, "global_step/max_steps": "106/800", "percentage": "13.25%", "elapsed_time": "22m 14s", "remaining_time": "2h 25m 32s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.582382} +{"loss": 1.0470202, "grad_norm": 1.89795232, "learning_rate": 3.344e-05, "token_acc": 0.71494849, "epoch": 0.26783479, "global_step/max_steps": "107/800", "percentage": "13.38%", "elapsed_time": "22m 23s", "remaining_time": "2h 24m 57s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.549566} +{"loss": 0.99188161, "grad_norm": 1.81444442, "learning_rate": 3.375e-05, "token_acc": 0.72210617, "epoch": 0.27033792, "global_step/max_steps": "108/800", "percentage": "13.50%", "elapsed_time": "22m 35s", "remaining_time": "2h 24m 41s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.545301} +{"loss": 1.07851434, "grad_norm": 3.80684042, "learning_rate": 3.406e-05, "token_acc": 0.69244279, "epoch": 0.27284105, "global_step/max_steps": "109/800", "percentage": "13.63%", "elapsed_time": "22m 50s", "remaining_time": "2h 24m 48s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.573185} +{"loss": 1.0899508, "grad_norm": 2.53781056, "learning_rate": 3.438e-05, "token_acc": 0.70454171, "epoch": 0.27534418, "global_step/max_steps": "110/800", "percentage": "13.75%", "elapsed_time": "23m 3s", "remaining_time": "2h 24m 33s", "memory(GiB)": 69.28, "train_speed(s/it)": 12.56956} +{"loss": 1.08843946, "grad_norm": 1.98939407, "learning_rate": 3.469e-05, "token_acc": 0.7042693, "epoch": 0.27784731, "global_step/max_steps": "111/800", "percentage": "13.88%", "elapsed_time": "23m 27s", "remaining_time": "2h 25m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.679109} +{"loss": 0.97529578, "grad_norm": 5.139678, "learning_rate": 3.5e-05, "token_acc": 0.72882152, "epoch": 0.28035044, "global_step/max_steps": "112/800", "percentage": "14.00%", "elapsed_time": "23m 40s", "remaining_time": "2h 25m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.677473} +{"loss": 1.03169048, "grad_norm": 3.48465776, "learning_rate": 3.531e-05, "token_acc": 0.71740848, "epoch": 0.28285357, "global_step/max_steps": "113/800", "percentage": "14.12%", "elapsed_time": "23m 52s", "remaining_time": "2h 25m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.671023} +{"loss": 1.02227092, "grad_norm": 3.43218184, "learning_rate": 3.563e-05, "token_acc": 0.71567589, "epoch": 0.2853567, "global_step/max_steps": "114/800", "percentage": "14.25%", "elapsed_time": "24m 1s", "remaining_time": "2h 24m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.644336} +{"loss": 1.13685763, "grad_norm": 2.86890221, "learning_rate": 3.594e-05, "token_acc": 0.68619522, "epoch": 0.28785982, "global_step/max_steps": "115/800", "percentage": "14.37%", "elapsed_time": "24m 20s", "remaining_time": "2h 24m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.692889} +{"loss": 1.04945302, "grad_norm": 1.87343466, "learning_rate": 3.625e-05, "token_acc": 0.70917686, "epoch": 0.29036295, "global_step/max_steps": "116/800", "percentage": "14.50%", "elapsed_time": "24m 32s", "remaining_time": "2h 24m 41s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.690881} +{"loss": 0.90637112, "grad_norm": 2.32932663, "learning_rate": 3.656e-05, "token_acc": 0.75856558, "epoch": 0.29286608, "global_step/max_steps": "117/800", "percentage": "14.62%", "elapsed_time": "24m 39s", "remaining_time": "2h 23m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.638207} +{"loss": 1.08755684, "grad_norm": 1.9864639, "learning_rate": 3.688e-05, "token_acc": 0.7017194, "epoch": 0.29536921, "global_step/max_steps": "118/800", "percentage": "14.75%", "elapsed_time": "24m 49s", "remaining_time": "2h 23m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.617884} +{"loss": 1.07678628, "grad_norm": 3.48268652, "learning_rate": 3.719e-05, "token_acc": 0.70153833, "epoch": 0.29787234, "global_step/max_steps": "119/800", "percentage": "14.88%", "elapsed_time": "25m 6s", "remaining_time": "2h 23m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.653929} +{"loss": 0.99850786, "grad_norm": 3.4741652, "learning_rate": 3.75e-05, "token_acc": 0.71926026, "epoch": 0.30037547, "global_step/max_steps": "120/800", "percentage": "15.00%", "elapsed_time": "25m 14s", "remaining_time": "2h 22m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.614927} +{"loss": 1.02747703, "grad_norm": 15.01812649, "learning_rate": 3.781e-05, "token_acc": 0.71627078, "epoch": 0.3028786, "global_step/max_steps": "121/800", "percentage": "15.12%", "elapsed_time": "25m 36s", "remaining_time": "2h 23m 40s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.695093} +{"loss": 0.99602765, "grad_norm": 2.66085243, "learning_rate": 3.812e-05, "token_acc": 0.72271574, "epoch": 0.30538173, "global_step/max_steps": "122/800", "percentage": "15.25%", "elapsed_time": "25m 43s", "remaining_time": "2h 22m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.646512} +{"loss": 1.09522486, "grad_norm": 3.83201075, "learning_rate": 3.844e-05, "token_acc": 0.69668556, "epoch": 0.30788486, "global_step/max_steps": "123/800", "percentage": "15.38%", "elapsed_time": "25m 58s", "remaining_time": "2h 22m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.667048} +{"loss": 1.03609085, "grad_norm": 3.40521407, "learning_rate": 3.875e-05, "token_acc": 0.71393315, "epoch": 0.31038798, "global_step/max_steps": "124/800", "percentage": "15.50%", "elapsed_time": "26m 5s", "remaining_time": "2h 22m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.617833} +{"loss": 0.93049479, "grad_norm": 2.29470539, "learning_rate": 3.906e-05, "token_acc": 0.73818788, "epoch": 0.31289111, "global_step/max_steps": "125/800", "percentage": "15.62%", "elapsed_time": "26m 15s", "remaining_time": "2h 21m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.598144} +{"loss": 0.91469294, "grad_norm": 5.56966877, "learning_rate": 3.938e-05, "token_acc": 0.74428029, "epoch": 0.31539424, "global_step/max_steps": "126/800", "percentage": "15.75%", "elapsed_time": "26m 23s", "remaining_time": "2h 21m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.56333} +{"loss": 0.87944657, "grad_norm": 4.52053976, "learning_rate": 3.969e-05, "token_acc": 0.75798165, "epoch": 0.31789737, "global_step/max_steps": "127/800", "percentage": "15.88%", "elapsed_time": "26m 29s", "remaining_time": "2h 20m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.514407} +{"loss": 1.01509452, "grad_norm": 3.53972459, "learning_rate": 4e-05, "token_acc": 0.71371318, "epoch": 0.3204005, "global_step/max_steps": "128/800", "percentage": "16.00%", "elapsed_time": "26m 38s", "remaining_time": "2h 19m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.484656} +{"loss": 1.0014472, "grad_norm": 3.90383697, "learning_rate": 4.031e-05, "token_acc": 0.7209396, "epoch": 0.32290363, "global_step/max_steps": "129/800", "percentage": "16.12%", "elapsed_time": "26m 46s", "remaining_time": "2h 19m 14s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.450619} +{"loss": 0.98482507, "grad_norm": 2.71509361, "learning_rate": 4.063e-05, "token_acc": 0.72494387, "epoch": 0.32540676, "global_step/max_steps": "130/800", "percentage": "16.25%", "elapsed_time": "26m 57s", "remaining_time": "2h 18m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.440749} +{"loss": 0.89051259, "grad_norm": 3.82440472, "learning_rate": 4.094e-05, "token_acc": 0.75770659, "epoch": 0.32790989, "global_step/max_steps": "131/800", "percentage": "16.38%", "elapsed_time": "27m 18s", "remaining_time": "2h 19m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.50417} +{"loss": 0.98082727, "grad_norm": 4.4119029, "learning_rate": 4.125e-05, "token_acc": 0.72255448, "epoch": 0.33041302, "global_step/max_steps": "132/800", "percentage": "16.50%", "elapsed_time": "27m 30s", "remaining_time": "2h 19m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.500781} +{"loss": 1.02537608, "grad_norm": 5.34667015, "learning_rate": 4.156e-05, "token_acc": 0.70989368, "epoch": 0.33291615, "global_step/max_steps": "133/800", "percentage": "16.62%", "elapsed_time": "27m 47s", "remaining_time": "2h 19m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.531837} +{"loss": 0.95483458, "grad_norm": 2.1438992, "learning_rate": 4.188e-05, "token_acc": 0.73383977, "epoch": 0.33541927, "global_step/max_steps": "134/800", "percentage": "16.75%", "elapsed_time": "27m 55s", "remaining_time": "2h 18m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.496526} +{"loss": 0.88475007, "grad_norm": 4.16446066, "learning_rate": 4.219e-05, "token_acc": 0.75247234, "epoch": 0.3379224, "global_step/max_steps": "135/800", "percentage": "16.88%", "elapsed_time": "28m 3s", "remaining_time": "2h 18m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.469099} +{"loss": 1.07362354, "grad_norm": 2.00526261, "learning_rate": 4.25e-05, "token_acc": 0.6994132, "epoch": 0.34042553, "global_step/max_steps": "136/800", "percentage": "17.00%", "elapsed_time": "28m 19s", "remaining_time": "2h 18m 14s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.491359} +{"loss": 1.01284993, "grad_norm": 2.24675059, "learning_rate": 4.281e-05, "token_acc": 0.71442328, "epoch": 0.34292866, "global_step/max_steps": "137/800", "percentage": "17.12%", "elapsed_time": "28m 31s", "remaining_time": "2h 18m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.490738} +{"loss": 0.83775395, "grad_norm": 3.92526507, "learning_rate": 4.313e-05, "token_acc": 0.77254783, "epoch": 0.34543179, "global_step/max_steps": "138/800", "percentage": "17.25%", "elapsed_time": "28m 40s", "remaining_time": "2h 17m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.465215} +{"loss": 0.95933485, "grad_norm": 12.72631454, "learning_rate": 4.344e-05, "token_acc": 0.73167251, "epoch": 0.34793492, "global_step/max_steps": "139/800", "percentage": "17.38%", "elapsed_time": "28m 48s", "remaining_time": "2h 16m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.433037} +{"loss": 0.90289479, "grad_norm": 2.69947147, "learning_rate": 4.375e-05, "token_acc": 0.74604941, "epoch": 0.35043805, "global_step/max_steps": "140/800", "percentage": "17.50%", "elapsed_time": "28m 58s", "remaining_time": "2h 16m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.410951} +{"loss": 0.89962143, "grad_norm": 3.98080587, "learning_rate": 4.406e-05, "token_acc": 0.74258675, "epoch": 0.35294118, "global_step/max_steps": "141/800", "percentage": "17.62%", "elapsed_time": "29m 18s", "remaining_time": "2h 16m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.465345} +{"loss": 1.03840899, "grad_norm": 1.22128654, "learning_rate": 4.438e-05, "token_acc": 0.71212015, "epoch": 0.35544431, "global_step/max_steps": "142/800", "percentage": "17.75%", "elapsed_time": "29m 34s", "remaining_time": "2h 17m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.495577} +{"loss": 0.92632514, "grad_norm": 3.96118522, "learning_rate": 4.469e-05, "token_acc": 0.74003172, "epoch": 0.35794743, "global_step/max_steps": "143/800", "percentage": "17.88%", "elapsed_time": "29m 52s", "remaining_time": "2h 17m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.529358} +{"loss": 0.96079385, "grad_norm": 5.35015631, "learning_rate": 4.5e-05, "token_acc": 0.73034365, "epoch": 0.36045056, "global_step/max_steps": "144/800", "percentage": "18.00%", "elapsed_time": "30m 3s", "remaining_time": "2h 16m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.523664} +{"loss": 0.9440912, "grad_norm": 1.41068661, "learning_rate": 4.531e-05, "token_acc": 0.73137291, "epoch": 0.36295369, "global_step/max_steps": "145/800", "percentage": "18.12%", "elapsed_time": "30m 12s", "remaining_time": "2h 16m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.496623} +{"loss": 0.93182683, "grad_norm": 3.61819124, "learning_rate": 4.562e-05, "token_acc": 0.73335817, "epoch": 0.36545682, "global_step/max_steps": "146/800", "percentage": "18.25%", "elapsed_time": "30m 27s", "remaining_time": "2h 16m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.515204} +{"loss": 0.85721862, "grad_norm": 2.85038376, "learning_rate": 4.594e-05, "token_acc": 0.75075009, "epoch": 0.36795995, "global_step/max_steps": "147/800", "percentage": "18.38%", "elapsed_time": "30m 35s", "remaining_time": "2h 15m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.483116} +{"loss": 0.93327838, "grad_norm": 3.6773138, "learning_rate": 4.625e-05, "token_acc": 0.74011759, "epoch": 0.37046308, "global_step/max_steps": "148/800", "percentage": "18.50%", "elapsed_time": "30m 42s", "remaining_time": "2h 15m 17s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.448807} +{"loss": 1.04290581, "grad_norm": 1.32619464, "learning_rate": 4.656e-05, "token_acc": 0.702854, "epoch": 0.37296621, "global_step/max_steps": "149/800", "percentage": "18.62%", "elapsed_time": "30m 54s", "remaining_time": "2h 15m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.444362} +{"loss": 0.97765768, "grad_norm": 3.06520295, "learning_rate": 4.688e-05, "token_acc": 0.71996331, "epoch": 0.37546934, "global_step/max_steps": "150/800", "percentage": "18.75%", "elapsed_time": "31m 5s", "remaining_time": "2h 14m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.435891} +{"loss": 1.02732861, "grad_norm": 20.23040581, "learning_rate": 4.719e-05, "token_acc": 0.71189497, "epoch": 0.37797247, "global_step/max_steps": "151/800", "percentage": "18.88%", "elapsed_time": "31m 26s", "remaining_time": "2h 15m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.489415} +{"loss": 0.86888617, "grad_norm": 3.04811978, "learning_rate": 4.75e-05, "token_acc": 0.75108479, "epoch": 0.38047559, "global_step/max_steps": "152/800", "percentage": "19.00%", "elapsed_time": "31m 37s", "remaining_time": "2h 14m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.482452} +{"loss": 1.03333235, "grad_norm": 5.97629023, "learning_rate": 4.781e-05, "token_acc": 0.70930791, "epoch": 0.38297872, "global_step/max_steps": "153/800", "percentage": "19.12%", "elapsed_time": "31m 53s", "remaining_time": "2h 14m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.504927} +{"loss": 0.901492, "grad_norm": 3.42905402, "learning_rate": 4.813e-05, "token_acc": 0.74359373, "epoch": 0.38548185, "global_step/max_steps": "154/800", "percentage": "19.25%", "elapsed_time": "32m 0s", "remaining_time": "2h 14m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.469184} +{"loss": 0.9900403, "grad_norm": 1.62057555, "learning_rate": 4.844e-05, "token_acc": 0.71841288, "epoch": 0.38798498, "global_step/max_steps": "155/800", "percentage": "19.38%", "elapsed_time": "32m 13s", "remaining_time": "2h 14m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.47061} +{"loss": 0.89628446, "grad_norm": 10.17509842, "learning_rate": 4.875e-05, "token_acc": 0.74358974, "epoch": 0.39048811, "global_step/max_steps": "156/800", "percentage": "19.50%", "elapsed_time": "32m 22s", "remaining_time": "2h 13m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.446568} +{"loss": 0.96646893, "grad_norm": 1.21489704, "learning_rate": 4.906e-05, "token_acc": 0.72568735, "epoch": 0.39299124, "global_step/max_steps": "157/800", "percentage": "19.62%", "elapsed_time": "32m 31s", "remaining_time": "2h 13m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.426943} +{"loss": 0.8573643, "grad_norm": 1.45164335, "learning_rate": 4.938e-05, "token_acc": 0.7516488, "epoch": 0.39549437, "global_step/max_steps": "158/800", "percentage": "19.75%", "elapsed_time": "32m 43s", "remaining_time": "2h 12m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.424889} +{"loss": 0.88728547, "grad_norm": 2.4918766, "learning_rate": 4.969e-05, "token_acc": 0.74958796, "epoch": 0.3979975, "global_step/max_steps": "159/800", "percentage": "19.88%", "elapsed_time": "33m 1s", "remaining_time": "2h 13m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.461218} +{"loss": 0.94936484, "grad_norm": 1.72107315, "learning_rate": 5e-05, "token_acc": 0.72643019, "epoch": 0.40050063, "global_step/max_steps": "160/800", "percentage": "20.00%", "elapsed_time": "33m 15s", "remaining_time": "2h 12m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.466031} +{"loss": 0.87964916, "grad_norm": 6.05318356, "learning_rate": 5e-05, "token_acc": 0.75417156, "epoch": 0.40300375, "global_step/max_steps": "161/800", "percentage": "20.12%", "elapsed_time": "33m 32s", "remaining_time": "2h 13m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.49964} +{"loss": 0.88587093, "grad_norm": 2.3308754, "learning_rate": 5e-05, "token_acc": 0.74525088, "epoch": 0.40550688, "global_step/max_steps": "162/800", "percentage": "20.25%", "elapsed_time": "33m 41s", "remaining_time": "2h 12m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.4752} +{"loss": 0.85142916, "grad_norm": 2.5140872, "learning_rate": 5e-05, "token_acc": 0.75316891, "epoch": 0.40801001, "global_step/max_steps": "163/800", "percentage": "20.38%", "elapsed_time": "33m 58s", "remaining_time": "2h 12m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.500814} +{"loss": 1.03998482, "grad_norm": 3.97996688, "learning_rate": 5e-05, "token_acc": 0.70550285, "epoch": 0.41051314, "global_step/max_steps": "164/800", "percentage": "20.50%", "elapsed_time": "34m 13s", "remaining_time": "2h 12m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.52048} +{"loss": 0.93886173, "grad_norm": 1.88253534, "learning_rate": 4.999e-05, "token_acc": 0.73143298, "epoch": 0.41301627, "global_step/max_steps": "165/800", "percentage": "20.62%", "elapsed_time": "34m 30s", "remaining_time": "2h 12m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.543505} +{"loss": 0.95852745, "grad_norm": 1.46041179, "learning_rate": 4.999e-05, "token_acc": 0.72339199, "epoch": 0.4155194, "global_step/max_steps": "166/800", "percentage": "20.75%", "elapsed_time": "34m 41s", "remaining_time": "2h 12m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.535676} +{"loss": 0.87134588, "grad_norm": 2.50480151, "learning_rate": 4.999e-05, "token_acc": 0.74876205, "epoch": 0.41802253, "global_step/max_steps": "167/800", "percentage": "20.88%", "elapsed_time": "34m 51s", "remaining_time": "2h 12m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.521814} +{"loss": 0.95451081, "grad_norm": 1.32897806, "learning_rate": 4.998e-05, "token_acc": 0.72435443, "epoch": 0.42052566, "global_step/max_steps": "168/800", "percentage": "21.00%", "elapsed_time": "35m 2s", "remaining_time": "2h 11m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.509657} +{"loss": 0.80035734, "grad_norm": 8.59180641, "learning_rate": 4.998e-05, "token_acc": 0.7734826, "epoch": 0.42302879, "global_step/max_steps": "169/800", "percentage": "21.12%", "elapsed_time": "35m 10s", "remaining_time": "2h 11m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.484318} +{"loss": 0.8462348, "grad_norm": 2.13934922, "learning_rate": 4.997e-05, "token_acc": 0.75830135, "epoch": 0.42553191, "global_step/max_steps": "170/800", "percentage": "21.25%", "elapsed_time": "35m 19s", "remaining_time": "2h 10m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.462842} +{"loss": 0.8536551, "grad_norm": 2.35060668, "learning_rate": 4.996e-05, "token_acc": 0.75836165, "epoch": 0.42803504, "global_step/max_steps": "171/800", "percentage": "21.38%", "elapsed_time": "35m 37s", "remaining_time": "2h 11m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.499382} +{"loss": 0.82064044, "grad_norm": 2.13743067, "learning_rate": 4.996e-05, "token_acc": 0.75804936, "epoch": 0.43053817, "global_step/max_steps": "172/800", "percentage": "21.50%", "elapsed_time": "35m 43s", "remaining_time": "2h 10m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.460254} +{"loss": 1.00326335, "grad_norm": 1.54084027, "learning_rate": 4.995e-05, "token_acc": 0.71229462, "epoch": 0.4330413, "global_step/max_steps": "173/800", "percentage": "21.62%", "elapsed_time": "36m 1s", "remaining_time": "2h 10m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.493823} +{"loss": 0.97555083, "grad_norm": 7.39818096, "learning_rate": 4.994e-05, "token_acc": 0.72718617, "epoch": 0.43554443, "global_step/max_steps": "174/800", "percentage": "21.75%", "elapsed_time": "36m 20s", "remaining_time": "2h 10m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.529089} +{"loss": 0.83161163, "grad_norm": 34.21598053, "learning_rate": 4.993e-05, "token_acc": 0.76519295, "epoch": 0.43804756, "global_step/max_steps": "175/800", "percentage": "21.88%", "elapsed_time": "36m 27s", "remaining_time": "2h 10m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.499515} +{"loss": 0.92632973, "grad_norm": 1.19467342, "learning_rate": 4.992e-05, "token_acc": 0.7333371, "epoch": 0.44055069, "global_step/max_steps": "176/800", "percentage": "22.00%", "elapsed_time": "36m 37s", "remaining_time": "2h 9m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.480165} +{"loss": 0.86576486, "grad_norm": 3.41966772, "learning_rate": 4.991e-05, "token_acc": 0.75368536, "epoch": 0.44305382, "global_step/max_steps": "177/800", "percentage": "22.12%", "elapsed_time": "36m 44s", "remaining_time": "2h 9m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.449289} +{"loss": 1.01502883, "grad_norm": 0.84961998, "learning_rate": 4.99e-05, "token_acc": 0.7088443, "epoch": 0.44555695, "global_step/max_steps": "178/800", "percentage": "22.25%", "elapsed_time": "36m 59s", "remaining_time": "2h 9m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.463897} +{"loss": 0.85824704, "grad_norm": 3.24967861, "learning_rate": 4.989e-05, "token_acc": 0.7626391, "epoch": 0.44806008, "global_step/max_steps": "179/800", "percentage": "22.38%", "elapsed_time": "37m 5s", "remaining_time": "2h 8m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.428192} +{"loss": 0.91668272, "grad_norm": 1.03476882, "learning_rate": 4.988e-05, "token_acc": 0.74483307, "epoch": 0.4505632, "global_step/max_steps": "180/800", "percentage": "22.50%", "elapsed_time": "37m 12s", "remaining_time": "2h 8m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.398097} +{"loss": 0.82421589, "grad_norm": 3.35790491, "learning_rate": 4.987e-05, "token_acc": 0.76346899, "epoch": 0.45306633, "global_step/max_steps": "181/800", "percentage": "22.62%", "elapsed_time": "37m 29s", "remaining_time": "2h 8m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.426297} +{"loss": 0.95428348, "grad_norm": 2.15505838, "learning_rate": 4.985e-05, "token_acc": 0.72807443, "epoch": 0.45556946, "global_step/max_steps": "182/800", "percentage": "22.75%", "elapsed_time": "37m 40s", "remaining_time": "2h 7m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.414994} +{"loss": 0.96289515, "grad_norm": 1.22947598, "learning_rate": 4.984e-05, "token_acc": 0.72758763, "epoch": 0.45807259, "global_step/max_steps": "183/800", "percentage": "22.88%", "elapsed_time": "37m 52s", "remaining_time": "2h 7m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.413719} +{"loss": 0.94376642, "grad_norm": 1.35429442, "learning_rate": 4.983e-05, "token_acc": 0.73045636, "epoch": 0.46057572, "global_step/max_steps": "184/800", "percentage": "23.00%", "elapsed_time": "38m 2s", "remaining_time": "2h 7m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.401934} +{"loss": 0.85414028, "grad_norm": 2.54288554, "learning_rate": 4.981e-05, "token_acc": 0.7521788, "epoch": 0.46307885, "global_step/max_steps": "185/800", "percentage": "23.12%", "elapsed_time": "38m 9s", "remaining_time": "2h 6m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.372331} +{"loss": 1.00942588, "grad_norm": 2.54859257, "learning_rate": 4.98e-05, "token_acc": 0.71577409, "epoch": 0.46558198, "global_step/max_steps": "186/800", "percentage": "23.25%", "elapsed_time": "38m 20s", "remaining_time": "2h 6m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.365001} +{"loss": 0.87872809, "grad_norm": 1.8278656, "learning_rate": 4.978e-05, "token_acc": 0.75165807, "epoch": 0.46808511, "global_step/max_steps": "187/800", "percentage": "23.38%", "elapsed_time": "38m 27s", "remaining_time": "2h 6m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.338496} +{"loss": 0.9875797, "grad_norm": 4.45726919, "learning_rate": 4.976e-05, "token_acc": 0.72287526, "epoch": 0.47058824, "global_step/max_steps": "188/800", "percentage": "23.50%", "elapsed_time": "38m 40s", "remaining_time": "2h 5m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.340193} +{"loss": 0.84718597, "grad_norm": 3.18542194, "learning_rate": 4.975e-05, "token_acc": 0.75195822, "epoch": 0.47309136, "global_step/max_steps": "189/800", "percentage": "23.62%", "elapsed_time": "38m 49s", "remaining_time": "2h 5m 29s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.323213} +{"loss": 0.85864043, "grad_norm": 6.70485353, "learning_rate": 4.973e-05, "token_acc": 0.75412062, "epoch": 0.47559449, "global_step/max_steps": "190/800", "percentage": "23.75%", "elapsed_time": "39m 1s", "remaining_time": "2h 5m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.31976} +{"loss": 0.87986165, "grad_norm": 1.5821383, "learning_rate": 4.971e-05, "token_acc": 0.74698119, "epoch": 0.47809762, "global_step/max_steps": "191/800", "percentage": "23.88%", "elapsed_time": "39m 24s", "remaining_time": "2h 5m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.374463} +{"loss": 0.81918406, "grad_norm": 10.70607948, "learning_rate": 4.969e-05, "token_acc": 0.76338459, "epoch": 0.48060075, "global_step/max_steps": "192/800", "percentage": "24.00%", "elapsed_time": "39m 30s", "remaining_time": "2h 5m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.343849} +{"loss": 0.83324558, "grad_norm": 5.072083, "learning_rate": 4.967e-05, "token_acc": 0.75631023, "epoch": 0.48310388, "global_step/max_steps": "193/800", "percentage": "24.12%", "elapsed_time": "39m 41s", "remaining_time": "2h 4m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.336635} +{"loss": 0.9354732, "grad_norm": 1.33644104, "learning_rate": 4.965e-05, "token_acc": 0.73036902, "epoch": 0.48560701, "global_step/max_steps": "194/800", "percentage": "24.25%", "elapsed_time": "39m 54s", "remaining_time": "2h 4m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.341264} +{"loss": 0.79415512, "grad_norm": 8.60687447, "learning_rate": 4.963e-05, "token_acc": 0.76644981, "epoch": 0.48811014, "global_step/max_steps": "195/800", "percentage": "24.38%", "elapsed_time": "40m 3s", "remaining_time": "2h 4m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.322886} +{"loss": 0.89624965, "grad_norm": 2.6359663, "learning_rate": 4.961e-05, "token_acc": 0.73379842, "epoch": 0.49061327, "global_step/max_steps": "196/800", "percentage": "24.50%", "elapsed_time": "40m 14s", "remaining_time": "2h 3m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.314644} +{"loss": 0.80746651, "grad_norm": 4.91393471, "learning_rate": 4.959e-05, "token_acc": 0.76622094, "epoch": 0.4931164, "global_step/max_steps": "197/800", "percentage": "24.62%", "elapsed_time": "40m 25s", "remaining_time": "2h 3m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.312079} +{"loss": 1.00433278, "grad_norm": 14.05099392, "learning_rate": 4.957e-05, "token_acc": 0.71575776, "epoch": 0.49561952, "global_step/max_steps": "198/800", "percentage": "24.75%", "elapsed_time": "40m 37s", "remaining_time": "2h 3m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.309755} +{"loss": 0.89787543, "grad_norm": 1.20292974, "learning_rate": 4.954e-05, "token_acc": 0.73651907, "epoch": 0.49812265, "global_step/max_steps": "199/800", "percentage": "24.88%", "elapsed_time": "40m 46s", "remaining_time": "2h 3m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.291223} +{"loss": 0.83700508, "grad_norm": 1.68102324, "learning_rate": 4.952e-05, "token_acc": 0.75674547, "epoch": 0.50062578, "global_step/max_steps": "200/800", "percentage": "25.00%", "elapsed_time": "40m 54s", "remaining_time": "2h 2m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.269195} +{"loss": 0.88613009, "grad_norm": 1.76283407, "learning_rate": 4.95e-05, "token_acc": 0.74521085, "epoch": 0.50312891, "global_step/max_steps": "201/800", "percentage": "25.12%", "elapsed_time": "41m 12s", "remaining_time": "2h 2m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.298904} +{"loss": 0.77549452, "grad_norm": 2.88378286, "learning_rate": 4.947e-05, "token_acc": 0.77656654, "epoch": 0.50563204, "global_step/max_steps": "202/800", "percentage": "25.25%", "elapsed_time": "41m 19s", "remaining_time": "2h 2m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.270526} +{"loss": 0.89741594, "grad_norm": 4.41598892, "learning_rate": 4.945e-05, "token_acc": 0.74224558, "epoch": 0.50813517, "global_step/max_steps": "203/800", "percentage": "25.37%", "elapsed_time": "41m 25s", "remaining_time": "2h 1m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.243806} +{"loss": 0.98009437, "grad_norm": 1.2022016, "learning_rate": 4.942e-05, "token_acc": 0.72062118, "epoch": 0.5106383, "global_step/max_steps": "204/800", "percentage": "25.50%", "elapsed_time": "41m 38s", "remaining_time": "2h 1m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.246558} +{"loss": 0.8181082, "grad_norm": 3.14894128, "learning_rate": 4.939e-05, "token_acc": 0.76778321, "epoch": 0.51314143, "global_step/max_steps": "205/800", "percentage": "25.62%", "elapsed_time": "41m 46s", "remaining_time": "2h 1m 14s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.225383} +{"loss": 0.95685595, "grad_norm": 2.73618364, "learning_rate": 4.937e-05, "token_acc": 0.72502206, "epoch": 0.51564456, "global_step/max_steps": "206/800", "percentage": "25.75%", "elapsed_time": "41m 58s", "remaining_time": "2h 1m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.223821} +{"loss": 0.88992608, "grad_norm": 1.23950851, "learning_rate": 4.934e-05, "token_acc": 0.74446455, "epoch": 0.51814768, "global_step/max_steps": "207/800", "percentage": "25.87%", "elapsed_time": "42m 12s", "remaining_time": "2h 0m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.230122} +{"loss": 0.79369533, "grad_norm": 11.25462055, "learning_rate": 4.931e-05, "token_acc": 0.76536515, "epoch": 0.52065081, "global_step/max_steps": "208/800", "percentage": "26.00%", "elapsed_time": "42m 24s", "remaining_time": "2h 0m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.228626} +{"loss": 0.9342562, "grad_norm": 1.99174535, "learning_rate": 4.928e-05, "token_acc": 0.72629879, "epoch": 0.52315394, "global_step/max_steps": "209/800", "percentage": "26.12%", "elapsed_time": "42m 33s", "remaining_time": "2h 0m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.21573} +{"loss": 0.95572257, "grad_norm": 1.39365602, "learning_rate": 4.925e-05, "token_acc": 0.73198565, "epoch": 0.52565707, "global_step/max_steps": "210/800", "percentage": "26.25%", "elapsed_time": "42m 45s", "remaining_time": "2h 0m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.214353} +{"loss": 0.92703426, "grad_norm": 1.60294747, "learning_rate": 4.922e-05, "token_acc": 0.73081648, "epoch": 0.5281602, "global_step/max_steps": "211/800", "percentage": "26.38%", "elapsed_time": "43m 12s", "remaining_time": "2h 0m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.285967} +{"loss": 0.94320804, "grad_norm": 2.34101248, "learning_rate": 4.919e-05, "token_acc": 0.72775801, "epoch": 0.53066333, "global_step/max_steps": "212/800", "percentage": "26.50%", "elapsed_time": "43m 28s", "remaining_time": "2h 0m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.300199} +{"loss": 0.89681333, "grad_norm": 1.34411633, "learning_rate": 4.916e-05, "token_acc": 0.74245084, "epoch": 0.53316646, "global_step/max_steps": "213/800", "percentage": "26.62%", "elapsed_time": "43m 37s", "remaining_time": "2h 0m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.28408} +{"loss": 0.86230981, "grad_norm": 4.8920722, "learning_rate": 4.913e-05, "token_acc": 0.74602446, "epoch": 0.53566959, "global_step/max_steps": "214/800", "percentage": "26.75%", "elapsed_time": "43m 51s", "remaining_time": "2h 0m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.292067} +{"loss": 0.98874122, "grad_norm": 2.77366447, "learning_rate": 4.909e-05, "token_acc": 0.71589998, "epoch": 0.53817272, "global_step/max_steps": "215/800", "percentage": "26.88%", "elapsed_time": "44m 4s", "remaining_time": "1h 59m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.298864} +{"loss": 0.94366831, "grad_norm": 1.62300742, "learning_rate": 4.906e-05, "token_acc": 0.72801871, "epoch": 0.54067584, "global_step/max_steps": "216/800", "percentage": "27.00%", "elapsed_time": "44m 15s", "remaining_time": "1h 59m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.293195} +{"loss": 0.7515862, "grad_norm": 3.8004024, "learning_rate": 4.903e-05, "token_acc": 0.78786689, "epoch": 0.54317897, "global_step/max_steps": "217/800", "percentage": "27.12%", "elapsed_time": "44m 22s", "remaining_time": "1h 59m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.268521} +{"loss": 0.95688522, "grad_norm": 1.26867843, "learning_rate": 4.899e-05, "token_acc": 0.72264314, "epoch": 0.5456821, "global_step/max_steps": "218/800", "percentage": "27.25%", "elapsed_time": "44m 37s", "remaining_time": "1h 59m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.280346} +{"loss": 0.75619292, "grad_norm": 2.2038455, "learning_rate": 4.896e-05, "token_acc": 0.78215121, "epoch": 0.54818523, "global_step/max_steps": "219/800", "percentage": "27.38%", "elapsed_time": "44m 43s", "remaining_time": "1h 58m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.250151} +{"loss": 0.90075719, "grad_norm": 60.95647049, "learning_rate": 4.892e-05, "token_acc": 0.73628548, "epoch": 0.55068836, "global_step/max_steps": "220/800", "percentage": "27.50%", "elapsed_time": "44m 51s", "remaining_time": "1h 58m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.229859} +{"loss": 0.85687077, "grad_norm": 1.39510965, "learning_rate": 4.889e-05, "token_acc": 0.75036539, "epoch": 0.55319149, "global_step/max_steps": "221/800", "percentage": "27.62%", "elapsed_time": "45m 9s", "remaining_time": "1h 58m 17s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.258118} +{"loss": 0.8863349, "grad_norm": 4.73269987, "learning_rate": 4.885e-05, "token_acc": 0.74563762, "epoch": 0.55569462, "global_step/max_steps": "222/800", "percentage": "27.75%", "elapsed_time": "45m 25s", "remaining_time": "1h 58m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.275724} +{"loss": 0.8580336, "grad_norm": 1.92627585, "learning_rate": 4.881e-05, "token_acc": 0.7447226, "epoch": 0.55819775, "global_step/max_steps": "223/800", "percentage": "27.88%", "elapsed_time": "45m 34s", "remaining_time": "1h 57m 53s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.25858} +{"loss": 0.81625605, "grad_norm": 2.42804861, "learning_rate": 4.878e-05, "token_acc": 0.75946105, "epoch": 0.56070088, "global_step/max_steps": "224/800", "percentage": "28.00%", "elapsed_time": "45m 42s", "remaining_time": "1h 57m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.239455} +{"loss": 0.89920193, "grad_norm": 1.84799731, "learning_rate": 4.874e-05, "token_acc": 0.74741498, "epoch": 0.56320401, "global_step/max_steps": "225/800", "percentage": "28.12%", "elapsed_time": "45m 54s", "remaining_time": "1h 57m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.239674} +{"loss": 0.89815903, "grad_norm": 1.21704614, "learning_rate": 4.87e-05, "token_acc": 0.74036048, "epoch": 0.56570713, "global_step/max_steps": "226/800", "percentage": "28.25%", "elapsed_time": "46m 5s", "remaining_time": "1h 57m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.232727} +{"loss": 0.85383976, "grad_norm": 1.40781212, "learning_rate": 4.866e-05, "token_acc": 0.75660882, "epoch": 0.56821026, "global_step/max_steps": "227/800", "percentage": "28.38%", "elapsed_time": "46m 12s", "remaining_time": "1h 56m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.213337} +{"loss": 0.89551228, "grad_norm": 1.72922242, "learning_rate": 4.862e-05, "token_acc": 0.7407334, "epoch": 0.57071339, "global_step/max_steps": "228/800", "percentage": "28.50%", "elapsed_time": "46m 28s", "remaining_time": "1h 56m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.230188} +{"loss": 0.84186476, "grad_norm": 1.77287388, "learning_rate": 4.858e-05, "token_acc": 0.75797682, "epoch": 0.57321652, "global_step/max_steps": "229/800", "percentage": "28.62%", "elapsed_time": "46m 38s", "remaining_time": "1h 56m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.217699} +{"loss": 0.90111655, "grad_norm": 2.35862517, "learning_rate": 4.854e-05, "token_acc": 0.73701276, "epoch": 0.57571965, "global_step/max_steps": "230/800", "percentage": "28.75%", "elapsed_time": "46m 47s", "remaining_time": "1h 55m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.204948} +{"loss": 0.69070417, "grad_norm": 1.42423046, "learning_rate": 4.85e-05, "token_acc": 0.79748578, "epoch": 0.57822278, "global_step/max_steps": "231/800", "percentage": "28.88%", "elapsed_time": "47m 7s", "remaining_time": "1h 56m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.23898} +{"loss": 0.83821809, "grad_norm": 2.37516856, "learning_rate": 4.845e-05, "token_acc": 0.75688925, "epoch": 0.58072591, "global_step/max_steps": "232/800", "percentage": "29.00%", "elapsed_time": "47m 15s", "remaining_time": "1h 55m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.221068} +{"loss": 0.84347993, "grad_norm": 2.9053638, "learning_rate": 4.841e-05, "token_acc": 0.75363707, "epoch": 0.58322904, "global_step/max_steps": "233/800", "percentage": "29.12%", "elapsed_time": "47m 24s", "remaining_time": "1h 55m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.203973} +{"loss": 0.82464558, "grad_norm": 1.85426426, "learning_rate": 4.837e-05, "token_acc": 0.75803364, "epoch": 0.58573217, "global_step/max_steps": "234/800", "percentage": "29.25%", "elapsed_time": "47m 31s", "remaining_time": "1h 54m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.18571} +{"loss": 0.81485581, "grad_norm": 4.34492779, "learning_rate": 4.832e-05, "token_acc": 0.75731074, "epoch": 0.58823529, "global_step/max_steps": "235/800", "percentage": "29.38%", "elapsed_time": "47m 43s", "remaining_time": "1h 54m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.185013} +{"loss": 0.86413753, "grad_norm": 8.02845955, "learning_rate": 4.828e-05, "token_acc": 0.74459989, "epoch": 0.59073842, "global_step/max_steps": "236/800", "percentage": "29.50%", "elapsed_time": "47m 57s", "remaining_time": "1h 54m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.188662} +{"loss": 0.98308307, "grad_norm": 10.52462864, "learning_rate": 4.824e-05, "token_acc": 0.71528428, "epoch": 0.59324155, "global_step/max_steps": "237/800", "percentage": "29.62%", "elapsed_time": "48m 4s", "remaining_time": "1h 54m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.166842} +{"loss": 0.81330258, "grad_norm": 1.79037225, "learning_rate": 4.819e-05, "token_acc": 0.75777244, "epoch": 0.59574468, "global_step/max_steps": "238/800", "percentage": "29.75%", "elapsed_time": "48m 11s", "remaining_time": "1h 53m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.146355} +{"loss": 0.8893339, "grad_norm": 1.22494221, "learning_rate": 4.814e-05, "token_acc": 0.74575236, "epoch": 0.59824781, "global_step/max_steps": "239/800", "percentage": "29.88%", "elapsed_time": "48m 25s", "remaining_time": "1h 53m 40s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.156243} +{"loss": 0.86402464, "grad_norm": 15.71100712, "learning_rate": 4.81e-05, "token_acc": 0.74554611, "epoch": 0.60075094, "global_step/max_steps": "240/800", "percentage": "30.00%", "elapsed_time": "48m 42s", "remaining_time": "1h 53m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.176609} +{"loss": 0.71058083, "grad_norm": 17.57068253, "learning_rate": 4.805e-05, "token_acc": 0.79252886, "epoch": 0.60325407, "global_step/max_steps": "241/800", "percentage": "30.12%", "elapsed_time": "48m 59s", "remaining_time": "1h 53m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.194681} +{"loss": 0.91536802, "grad_norm": 3.07522917, "learning_rate": 4.8e-05, "token_acc": 0.73106179, "epoch": 0.6057572, "global_step/max_steps": "242/800", "percentage": "30.25%", "elapsed_time": "49m 15s", "remaining_time": "1h 53m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.21029} +{"loss": 0.93882763, "grad_norm": 1.16705561, "learning_rate": 4.795e-05, "token_acc": 0.72558397, "epoch": 0.60826033, "global_step/max_steps": "243/800", "percentage": "30.38%", "elapsed_time": "49m 24s", "remaining_time": "1h 53m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.195968} +{"loss": 0.85378152, "grad_norm": 1.85241354, "learning_rate": 4.79e-05, "token_acc": 0.75088548, "epoch": 0.61076345, "global_step/max_steps": "244/800", "percentage": "30.50%", "elapsed_time": "49m 34s", "remaining_time": "1h 52m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.188769} +{"loss": 0.94724953, "grad_norm": 1.50538468, "learning_rate": 4.786e-05, "token_acc": 0.72773646, "epoch": 0.61326658, "global_step/max_steps": "245/800", "percentage": "30.63%", "elapsed_time": "49m 46s", "remaining_time": "1h 52m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.185736} +{"loss": 0.89517409, "grad_norm": 3.10875082, "learning_rate": 4.781e-05, "token_acc": 0.73578942, "epoch": 0.61576971, "global_step/max_steps": "246/800", "percentage": "30.75%", "elapsed_time": "50m 0s", "remaining_time": "1h 52m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.195643} +{"loss": 0.78661227, "grad_norm": 2.46861005, "learning_rate": 4.775e-05, "token_acc": 0.77236624, "epoch": 0.61827284, "global_step/max_steps": "247/800", "percentage": "30.88%", "elapsed_time": "50m 8s", "remaining_time": "1h 52m 14s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.176376} +{"loss": 0.89679635, "grad_norm": 1.96742737, "learning_rate": 4.77e-05, "token_acc": 0.73433966, "epoch": 0.62077597, "global_step/max_steps": "248/800", "percentage": "31.00%", "elapsed_time": "50m 19s", "remaining_time": "1h 51m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.17286} +{"loss": 0.92045969, "grad_norm": 3.1070292, "learning_rate": 4.765e-05, "token_acc": 0.73278859, "epoch": 0.6232791, "global_step/max_steps": "249/800", "percentage": "31.13%", "elapsed_time": "50m 31s", "remaining_time": "1h 51m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.17338} +{"loss": 0.75759518, "grad_norm": 1.85600376, "learning_rate": 4.76e-05, "token_acc": 0.77882334, "epoch": 0.62578223, "global_step/max_steps": "250/800", "percentage": "31.25%", "elapsed_time": "50m 40s", "remaining_time": "1h 51m 27s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.158829} +{"loss": 0.84908563, "grad_norm": 1.84015024, "learning_rate": 4.755e-05, "token_acc": 0.75496131, "epoch": 0.62828536, "global_step/max_steps": "251/800", "percentage": "31.37%", "elapsed_time": "50m 58s", "remaining_time": "1h 51m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.182285} +{"loss": 0.88616103, "grad_norm": 1.01703346, "learning_rate": 4.749e-05, "token_acc": 0.73785734, "epoch": 0.63078849, "global_step/max_steps": "252/800", "percentage": "31.50%", "elapsed_time": "51m 5s", "remaining_time": "1h 51m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.162955} +{"loss": 0.84594959, "grad_norm": 1.29475224, "learning_rate": 4.744e-05, "token_acc": 0.75140533, "epoch": 0.63329161, "global_step/max_steps": "253/800", "percentage": "31.62%", "elapsed_time": "51m 15s", "remaining_time": "1h 50m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.153633} +{"loss": 0.75560099, "grad_norm": 1.45571518, "learning_rate": 4.739e-05, "token_acc": 0.7733115, "epoch": 0.63579474, "global_step/max_steps": "254/800", "percentage": "31.75%", "elapsed_time": "51m 22s", "remaining_time": "1h 50m 26s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.135667} +{"loss": 0.72917831, "grad_norm": 5.05823898, "learning_rate": 4.733e-05, "token_acc": 0.78592429, "epoch": 0.63829787, "global_step/max_steps": "255/800", "percentage": "31.87%", "elapsed_time": "51m 33s", "remaining_time": "1h 50m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.129467} +{"loss": 0.83165646, "grad_norm": 1.11475062, "learning_rate": 4.728e-05, "token_acc": 0.75546705, "epoch": 0.640801, "global_step/max_steps": "256/800", "percentage": "32.00%", "elapsed_time": "51m 42s", "remaining_time": "1h 49m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.115844} +{"loss": 0.80086124, "grad_norm": 2.4874413, "learning_rate": 4.722e-05, "token_acc": 0.76586497, "epoch": 0.64330413, "global_step/max_steps": "257/800", "percentage": "32.12%", "elapsed_time": "51m 50s", "remaining_time": "1h 49m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.101505} +{"loss": 0.79326212, "grad_norm": 3.97297263, "learning_rate": 4.716e-05, "token_acc": 0.76536225, "epoch": 0.64580726, "global_step/max_steps": "258/800", "percentage": "32.25%", "elapsed_time": "52m 3s", "remaining_time": "1h 49m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.104304} +{"loss": 0.83528191, "grad_norm": 1.72858131, "learning_rate": 4.711e-05, "token_acc": 0.75185845, "epoch": 0.64831039, "global_step/max_steps": "259/800", "percentage": "32.38%", "elapsed_time": "52m 12s", "remaining_time": "1h 49m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.093065} +{"loss": 0.89035577, "grad_norm": 1.68164802, "learning_rate": 4.705e-05, "token_acc": 0.74176637, "epoch": 0.65081352, "global_step/max_steps": "260/800", "percentage": "32.50%", "elapsed_time": "52m 21s", "remaining_time": "1h 48m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.079467} +{"loss": 0.92342532, "grad_norm": 2.65743232, "learning_rate": 4.699e-05, "token_acc": 0.73209453, "epoch": 0.65331665, "global_step/max_steps": "261/800", "percentage": "32.62%", "elapsed_time": "52m 51s", "remaining_time": "1h 49m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.149681} +{"loss": 0.75360155, "grad_norm": 2.65590096, "learning_rate": 4.693e-05, "token_acc": 0.78360387, "epoch": 0.65581977, "global_step/max_steps": "262/800", "percentage": "32.75%", "elapsed_time": "52m 59s", "remaining_time": "1h 48m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.134951} +{"loss": 0.9138115, "grad_norm": 1.36394405, "learning_rate": 4.687e-05, "token_acc": 0.73465387, "epoch": 0.6583229, "global_step/max_steps": "263/800", "percentage": "32.88%", "elapsed_time": "53m 13s", "remaining_time": "1h 48m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.139296} +{"loss": 0.97674698, "grad_norm": 1.46438885, "learning_rate": 4.681e-05, "token_acc": 0.7182792, "epoch": 0.66082603, "global_step/max_steps": "264/800", "percentage": "33.00%", "elapsed_time": "53m 27s", "remaining_time": "1h 48m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.146351} +{"loss": 0.8130523, "grad_norm": 1.21051717, "learning_rate": 4.675e-05, "token_acc": 0.76636208, "epoch": 0.66332916, "global_step/max_steps": "265/800", "percentage": "33.12%", "elapsed_time": "53m 38s", "remaining_time": "1h 48m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.141599} +{"loss": 0.84050721, "grad_norm": 2.53321791, "learning_rate": 4.669e-05, "token_acc": 0.75051405, "epoch": 0.66583229, "global_step/max_steps": "266/800", "percentage": "33.25%", "elapsed_time": "53m 48s", "remaining_time": "1h 47m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.133555} +{"loss": 0.95508778, "grad_norm": 0.85591686, "learning_rate": 4.663e-05, "token_acc": 0.72960619, "epoch": 0.66833542, "global_step/max_steps": "267/800", "percentage": "33.38%", "elapsed_time": "53m 58s", "remaining_time": "1h 47m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.125493} +{"loss": 0.84820181, "grad_norm": 1.43782783, "learning_rate": 4.657e-05, "token_acc": 0.75634592, "epoch": 0.67083855, "global_step/max_steps": "268/800", "percentage": "33.50%", "elapsed_time": "54m 5s", "remaining_time": "1h 47m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.109236} +{"loss": 0.87724721, "grad_norm": 11.27963829, "learning_rate": 4.651e-05, "token_acc": 0.74471055, "epoch": 0.67334168, "global_step/max_steps": "269/800", "percentage": "33.62%", "elapsed_time": "54m 14s", "remaining_time": "1h 47m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.09805} +{"loss": 0.83689439, "grad_norm": 1.9061811, "learning_rate": 4.644e-05, "token_acc": 0.75922734, "epoch": 0.67584481, "global_step/max_steps": "270/800", "percentage": "33.75%", "elapsed_time": "54m 22s", "remaining_time": "1h 46m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.08136} +{"loss": 0.86124092, "grad_norm": 1.9233216, "learning_rate": 4.638e-05, "token_acc": 0.74761073, "epoch": 0.67834793, "global_step/max_steps": "271/800", "percentage": "33.88%", "elapsed_time": "54m 48s", "remaining_time": "1h 46m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.13333} +{"loss": 0.88252008, "grad_norm": 4.40072298, "learning_rate": 4.632e-05, "token_acc": 0.7407548, "epoch": 0.68085106, "global_step/max_steps": "272/800", "percentage": "34.00%", "elapsed_time": "55m 7s", "remaining_time": "1h 46m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.157334} +{"loss": 0.82791853, "grad_norm": 1.99214673, "learning_rate": 4.625e-05, "token_acc": 0.75842933, "epoch": 0.68335419, "global_step/max_steps": "273/800", "percentage": "34.12%", "elapsed_time": "55m 15s", "remaining_time": "1h 46m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.143149} +{"loss": 0.80061436, "grad_norm": 1.76334798, "learning_rate": 4.619e-05, "token_acc": 0.76144777, "epoch": 0.68585732, "global_step/max_steps": "274/800", "percentage": "34.25%", "elapsed_time": "55m 25s", "remaining_time": "1h 46m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.133724} +{"loss": 0.82523239, "grad_norm": 2.8810699, "learning_rate": 4.612e-05, "token_acc": 0.75730395, "epoch": 0.68836045, "global_step/max_steps": "275/800", "percentage": "34.38%", "elapsed_time": "55m 40s", "remaining_time": "1h 46m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.145139} +{"loss": 0.8325485, "grad_norm": 3.15129709, "learning_rate": 4.606e-05, "token_acc": 0.75427, "epoch": 0.69086358, "global_step/max_steps": "276/800", "percentage": "34.50%", "elapsed_time": "55m 51s", "remaining_time": "1h 46m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.139661} +{"loss": 0.91689187, "grad_norm": 2.63782454, "learning_rate": 4.599e-05, "token_acc": 0.73034611, "epoch": 0.69336671, "global_step/max_steps": "277/800", "percentage": "34.62%", "elapsed_time": "56m 9s", "remaining_time": "1h 46m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.162796} +{"loss": 0.87163854, "grad_norm": 3.0020659, "learning_rate": 4.592e-05, "token_acc": 0.74437514, "epoch": 0.69586984, "global_step/max_steps": "278/800", "percentage": "34.75%", "elapsed_time": "56m 21s", "remaining_time": "1h 45m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.16159} +{"loss": 0.84708309, "grad_norm": 4.19805527, "learning_rate": 4.585e-05, "token_acc": 0.75168222, "epoch": 0.69837297, "global_step/max_steps": "279/800", "percentage": "34.88%", "elapsed_time": "56m 37s", "remaining_time": "1h 45m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.174849} +{"loss": 0.78960925, "grad_norm": 1.88717914, "learning_rate": 4.579e-05, "token_acc": 0.76818919, "epoch": 0.7008761, "global_step/max_steps": "280/800", "percentage": "35.00%", "elapsed_time": "56m 42s", "remaining_time": "1h 45m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.149927} +{"loss": 0.93076873, "grad_norm": 1.56604636, "learning_rate": 4.572e-05, "token_acc": 0.72555005, "epoch": 0.70337922, "global_step/max_steps": "281/800", "percentage": "35.12%", "elapsed_time": "56m 60s", "remaining_time": "1h 45m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.169916} +{"loss": 0.86580426, "grad_norm": 5.34921217, "learning_rate": 4.565e-05, "token_acc": 0.74489897, "epoch": 0.70588235, "global_step/max_steps": "282/800", "percentage": "35.25%", "elapsed_time": "57m 11s", "remaining_time": "1h 45m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.166274} +{"loss": 0.89701957, "grad_norm": 1.4808749, "learning_rate": 4.558e-05, "token_acc": 0.739118, "epoch": 0.70838548, "global_step/max_steps": "283/800", "percentage": "35.38%", "elapsed_time": "57m 25s", "remaining_time": "1h 44m 53s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.171386} +{"loss": 0.74469006, "grad_norm": 2.45550036, "learning_rate": 4.551e-05, "token_acc": 0.77904187, "epoch": 0.71088861, "global_step/max_steps": "284/800", "percentage": "35.50%", "elapsed_time": "57m 34s", "remaining_time": "1h 44m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.1603} +{"loss": 0.7530452, "grad_norm": 4.63496113, "learning_rate": 4.544e-05, "token_acc": 0.78353556, "epoch": 0.71339174, "global_step/max_steps": "285/800", "percentage": "35.62%", "elapsed_time": "57m 42s", "remaining_time": "1h 44m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.148319} +{"loss": 0.73702633, "grad_norm": 2.12060213, "learning_rate": 4.537e-05, "token_acc": 0.77828873, "epoch": 0.71589487, "global_step/max_steps": "286/800", "percentage": "35.75%", "elapsed_time": "57m 50s", "remaining_time": "1h 43m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.131332} +{"loss": 0.92292863, "grad_norm": 1.41696119, "learning_rate": 4.53e-05, "token_acc": 0.73394853, "epoch": 0.718398, "global_step/max_steps": "287/800", "percentage": "35.88%", "elapsed_time": "58m 1s", "remaining_time": "1h 43m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.128155} +{"loss": 0.85209137, "grad_norm": 1.99292636, "learning_rate": 4.523e-05, "token_acc": 0.75140056, "epoch": 0.72090113, "global_step/max_steps": "288/800", "percentage": "36.00%", "elapsed_time": "58m 7s", "remaining_time": "1h 43m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.108844} +{"loss": 0.95594162, "grad_norm": 3.44530702, "learning_rate": 4.515e-05, "token_acc": 0.72645871, "epoch": 0.72340426, "global_step/max_steps": "289/800", "percentage": "36.12%", "elapsed_time": "58m 19s", "remaining_time": "1h 43m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.107115} +{"loss": 0.83405221, "grad_norm": 1.33692098, "learning_rate": 4.508e-05, "token_acc": 0.75362141, "epoch": 0.72590738, "global_step/max_steps": "290/800", "percentage": "36.25%", "elapsed_time": "58m 28s", "remaining_time": "1h 42m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.098056} +{"loss": 0.88335234, "grad_norm": 3.41181993, "learning_rate": 4.501e-05, "token_acc": 0.74544818, "epoch": 0.72841051, "global_step/max_steps": "291/800", "percentage": "36.38%", "elapsed_time": "58m 50s", "remaining_time": "1h 42m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.130514} +{"loss": 0.91971898, "grad_norm": 3.54166055, "learning_rate": 4.493e-05, "token_acc": 0.73414211, "epoch": 0.73091364, "global_step/max_steps": "292/800", "percentage": "36.50%", "elapsed_time": "59m 10s", "remaining_time": "1h 42m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.158189} +{"loss": 0.81564689, "grad_norm": 2.61489296, "learning_rate": 4.486e-05, "token_acc": 0.75725433, "epoch": 0.73341677, "global_step/max_steps": "293/800", "percentage": "36.62%", "elapsed_time": "59m 21s", "remaining_time": "1h 42m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.153516} +{"loss": 0.89213043, "grad_norm": 2.20349789, "learning_rate": 4.478e-05, "token_acc": 0.74169205, "epoch": 0.7359199, "global_step/max_steps": "294/800", "percentage": "36.75%", "elapsed_time": "59m 32s", "remaining_time": "1h 42m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.149425} +{"loss": 0.73995209, "grad_norm": 2.17128396, "learning_rate": 4.471e-05, "token_acc": 0.78508735, "epoch": 0.73842303, "global_step/max_steps": "295/800", "percentage": "36.88%", "elapsed_time": "59m 41s", "remaining_time": "1h 42m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.139318} +{"loss": 0.84217417, "grad_norm": 1.80047321, "learning_rate": 4.463e-05, "token_acc": 0.7520074, "epoch": 0.74092616, "global_step/max_steps": "296/800", "percentage": "37.00%", "elapsed_time": "59m 59s", "remaining_time": "1h 42m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.159007} +{"loss": 0.84710383, "grad_norm": 1.43373847, "learning_rate": 4.456e-05, "token_acc": 0.75755333, "epoch": 0.74342929, "global_step/max_steps": "297/800", "percentage": "37.12%", "elapsed_time": "1h 0m 7s", "remaining_time": "1h 41m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.145722} +{"loss": 0.75849152, "grad_norm": 1.60890388, "learning_rate": 4.448e-05, "token_acc": 0.77137749, "epoch": 0.74593242, "global_step/max_steps": "298/800", "percentage": "37.25%", "elapsed_time": "1h 0m 18s", "remaining_time": "1h 41m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.139809} +{"loss": 0.83656728, "grad_norm": 1.46237981, "learning_rate": 4.44e-05, "token_acc": 0.75445016, "epoch": 0.74843554, "global_step/max_steps": "299/800", "percentage": "37.38%", "elapsed_time": "1h 0m 28s", "remaining_time": "1h 41m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.132816} +{"loss": 0.85739136, "grad_norm": 8.66483974, "learning_rate": 4.433e-05, "token_acc": 0.74998042, "epoch": 0.75093867, "global_step/max_steps": "300/800", "percentage": "37.50%", "elapsed_time": "1h 0m 36s", "remaining_time": "1h 40m 60s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.119617} +{"loss": 0.92051172, "grad_norm": 1.6345191, "learning_rate": 4.425e-05, "token_acc": 0.72805296, "epoch": 0.7534418, "global_step/max_steps": "301/800", "percentage": "37.62%", "elapsed_time": "1h 0m 60s", "remaining_time": "1h 41m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.158024} +{"loss": 0.85542077, "grad_norm": 6.17124844, "learning_rate": 4.417e-05, "token_acc": 0.75221513, "epoch": 0.75594493, "global_step/max_steps": "302/800", "percentage": "37.75%", "elapsed_time": "1h 1m 10s", "remaining_time": "1h 40m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.152713} +{"loss": 0.88890105, "grad_norm": 1.09840417, "learning_rate": 4.409e-05, "token_acc": 0.73853876, "epoch": 0.75844806, "global_step/max_steps": "303/800", "percentage": "37.88%", "elapsed_time": "1h 1m 19s", "remaining_time": "1h 40m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.141289} +{"loss": 0.80256808, "grad_norm": 2.31172776, "learning_rate": 4.401e-05, "token_acc": 0.76577139, "epoch": 0.76095119, "global_step/max_steps": "304/800", "percentage": "38.00%", "elapsed_time": "1h 1m 29s", "remaining_time": "1h 40m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.135703} +{"loss": 0.85893083, "grad_norm": 1.06334138, "learning_rate": 4.393e-05, "token_acc": 0.74307491, "epoch": 0.76345432, "global_step/max_steps": "305/800", "percentage": "38.12%", "elapsed_time": "1h 1m 39s", "remaining_time": "1h 40m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.127458} +{"loss": 0.80850261, "grad_norm": 2.11583543, "learning_rate": 4.385e-05, "token_acc": 0.76555529, "epoch": 0.76595745, "global_step/max_steps": "306/800", "percentage": "38.25%", "elapsed_time": "1h 1m 50s", "remaining_time": "1h 39m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.122806} +{"loss": 0.83375227, "grad_norm": 1.13474143, "learning_rate": 4.377e-05, "token_acc": 0.75569425, "epoch": 0.76846058, "global_step/max_steps": "307/800", "percentage": "38.38%", "elapsed_time": "1h 1m 58s", "remaining_time": "1h 39m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.110003} +{"loss": 0.76789713, "grad_norm": 2.0382123, "learning_rate": 4.369e-05, "token_acc": 0.77589041, "epoch": 0.7709637, "global_step/max_steps": "308/800", "percentage": "38.50%", "elapsed_time": "1h 2m 8s", "remaining_time": "1h 39m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.103} +{"loss": 0.86384398, "grad_norm": 1.3275516, "learning_rate": 4.361e-05, "token_acc": 0.75175234, "epoch": 0.77346683, "global_step/max_steps": "309/800", "percentage": "38.62%", "elapsed_time": "1h 2m 19s", "remaining_time": "1h 39m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.100095} +{"loss": 0.9297334, "grad_norm": 2.34785509, "learning_rate": 4.352e-05, "token_acc": 0.72662378, "epoch": 0.77596996, "global_step/max_steps": "310/800", "percentage": "38.75%", "elapsed_time": "1h 2m 37s", "remaining_time": "1h 38m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.119811} +{"loss": 0.68986714, "grad_norm": 44.53958893, "learning_rate": 4.344e-05, "token_acc": 0.7947743, "epoch": 0.77847309, "global_step/max_steps": "311/800", "percentage": "38.88%", "elapsed_time": "1h 2m 55s", "remaining_time": "1h 38m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.138206} +{"loss": 0.79811567, "grad_norm": 30.59449196, "learning_rate": 4.336e-05, "token_acc": 0.76705478, "epoch": 0.78097622, "global_step/max_steps": "312/800", "percentage": "39.00%", "elapsed_time": "1h 3m 4s", "remaining_time": "1h 38m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.127493} +{"loss": 0.75188673, "grad_norm": 4.21597719, "learning_rate": 4.327e-05, "token_acc": 0.779008, "epoch": 0.78347935, "global_step/max_steps": "313/800", "percentage": "39.12%", "elapsed_time": "1h 3m 15s", "remaining_time": "1h 38m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.12593} +{"loss": 0.87270451, "grad_norm": 3.64162254, "learning_rate": 4.319e-05, "token_acc": 0.74298074, "epoch": 0.78598248, "global_step/max_steps": "314/800", "percentage": "39.25%", "elapsed_time": "1h 3m 33s", "remaining_time": "1h 38m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.144607} +{"loss": 0.81080937, "grad_norm": 1.92437351, "learning_rate": 4.311e-05, "token_acc": 0.7594792, "epoch": 0.78848561, "global_step/max_steps": "315/800", "percentage": "39.38%", "elapsed_time": "1h 3m 42s", "remaining_time": "1h 38m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.132924} +{"loss": 0.89328837, "grad_norm": 0.87784034, "learning_rate": 4.302e-05, "token_acc": 0.74110444, "epoch": 0.79098874, "global_step/max_steps": "316/800", "percentage": "39.50%", "elapsed_time": "1h 3m 55s", "remaining_time": "1h 37m 53s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.135245} +{"loss": 0.84874779, "grad_norm": 1.01309979, "learning_rate": 4.294e-05, "token_acc": 0.74648377, "epoch": 0.79349186, "global_step/max_steps": "317/800", "percentage": "39.62%", "elapsed_time": "1h 4m 12s", "remaining_time": "1h 37m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.150986} +{"loss": 0.98188204, "grad_norm": 1.07964849, "learning_rate": 4.285e-05, "token_acc": 0.71802848, "epoch": 0.79599499, "global_step/max_steps": "318/800", "percentage": "39.75%", "elapsed_time": "1h 4m 26s", "remaining_time": "1h 37m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.156139} +{"loss": 0.80830395, "grad_norm": 1.90276003, "learning_rate": 4.276e-05, "token_acc": 0.7607511, "epoch": 0.79849812, "global_step/max_steps": "319/800", "percentage": "39.88%", "elapsed_time": "1h 4m 39s", "remaining_time": "1h 37m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.161272} +{"loss": 0.94708669, "grad_norm": 1.52479279, "learning_rate": 4.268e-05, "token_acc": 0.72652604, "epoch": 0.80100125, "global_step/max_steps": "320/800", "percentage": "40.00%", "elapsed_time": "1h 4m 52s", "remaining_time": "1h 37m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.163296} +{"loss": 0.9087714, "grad_norm": 1.36987066, "learning_rate": 4.259e-05, "token_acc": 0.73506766, "epoch": 0.80350438, "global_step/max_steps": "321/800", "percentage": "40.12%", "elapsed_time": "1h 5m 16s", "remaining_time": "1h 37m 23s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.199221} +{"loss": 0.74619895, "grad_norm": 6.13332891, "learning_rate": 4.25e-05, "token_acc": 0.78071903, "epoch": 0.80600751, "global_step/max_steps": "322/800", "percentage": "40.25%", "elapsed_time": "1h 5m 24s", "remaining_time": "1h 37m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.187007} +{"loss": 0.74898624, "grad_norm": 1.97265542, "learning_rate": 4.242e-05, "token_acc": 0.77993317, "epoch": 0.80851064, "global_step/max_steps": "323/800", "percentage": "40.38%", "elapsed_time": "1h 5m 31s", "remaining_time": "1h 36m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.170371} +{"loss": 0.92044199, "grad_norm": 1.34228182, "learning_rate": 4.233e-05, "token_acc": 0.72766356, "epoch": 0.81101377, "global_step/max_steps": "324/800", "percentage": "40.50%", "elapsed_time": "1h 5m 43s", "remaining_time": "1h 36m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.168299} +{"loss": 0.78102517, "grad_norm": 5.08867407, "learning_rate": 4.224e-05, "token_acc": 0.76808231, "epoch": 0.8135169, "global_step/max_steps": "325/800", "percentage": "40.62%", "elapsed_time": "1h 5m 51s", "remaining_time": "1h 36m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.158255} +{"loss": 0.64520586, "grad_norm": 3.30134726, "learning_rate": 4.215e-05, "token_acc": 0.80359968, "epoch": 0.81602003, "global_step/max_steps": "326/800", "percentage": "40.75%", "elapsed_time": "1h 5m 58s", "remaining_time": "1h 35m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.140739} +{"loss": 0.97069651, "grad_norm": 1.59353125, "learning_rate": 4.206e-05, "token_acc": 0.7185624, "epoch": 0.81852315, "global_step/max_steps": "327/800", "percentage": "40.88%", "elapsed_time": "1h 6m 10s", "remaining_time": "1h 35m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.139948} +{"loss": 0.81707716, "grad_norm": 3.25416875, "learning_rate": 4.197e-05, "token_acc": 0.75673918, "epoch": 0.82102628, "global_step/max_steps": "328/800", "percentage": "41.00%", "elapsed_time": "1h 6m 22s", "remaining_time": "1h 35m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.140374} +{"loss": 1.00352001, "grad_norm": 1.6932677, "learning_rate": 4.188e-05, "token_acc": 0.71024122, "epoch": 0.82352941, "global_step/max_steps": "329/800", "percentage": "41.12%", "elapsed_time": "1h 6m 38s", "remaining_time": "1h 35m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.152905} +{"loss": 0.75712681, "grad_norm": 3.96551347, "learning_rate": 4.179e-05, "token_acc": 0.78167223, "epoch": 0.82603254, "global_step/max_steps": "330/800", "percentage": "41.25%", "elapsed_time": "1h 6m 47s", "remaining_time": "1h 35m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.143367} +{"loss": 0.69602972, "grad_norm": 1.84782684, "learning_rate": 4.17e-05, "token_acc": 0.79786271, "epoch": 0.82853567, "global_step/max_steps": "331/800", "percentage": "41.38%", "elapsed_time": "1h 7m 7s", "remaining_time": "1h 35m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.165669} +{"loss": 0.80322164, "grad_norm": 4.03757334, "learning_rate": 4.161e-05, "token_acc": 0.76423025, "epoch": 0.8310388, "global_step/max_steps": "332/800", "percentage": "41.50%", "elapsed_time": "1h 7m 20s", "remaining_time": "1h 34m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.168588} +{"loss": 0.74505293, "grad_norm": 1.71078897, "learning_rate": 4.151e-05, "token_acc": 0.78073617, "epoch": 0.83354193, "global_step/max_steps": "333/800", "percentage": "41.62%", "elapsed_time": "1h 7m 27s", "remaining_time": "1h 34m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.153256} +{"loss": 0.90571332, "grad_norm": 2.18321037, "learning_rate": 4.142e-05, "token_acc": 0.73878704, "epoch": 0.83604506, "global_step/max_steps": "334/800", "percentage": "41.75%", "elapsed_time": "1h 7m 36s", "remaining_time": "1h 34m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.143554} +{"loss": 0.89287752, "grad_norm": 1.61515188, "learning_rate": 4.133e-05, "token_acc": 0.74620829, "epoch": 0.83854819, "global_step/max_steps": "335/800", "percentage": "41.88%", "elapsed_time": "1h 7m 45s", "remaining_time": "1h 34m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.133644} +{"loss": 0.75942922, "grad_norm": 14.12709522, "learning_rate": 4.124e-05, "token_acc": 0.77542506, "epoch": 0.84105131, "global_step/max_steps": "336/800", "percentage": "42.00%", "elapsed_time": "1h 7m 52s", "remaining_time": "1h 33m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.120233} +{"loss": 0.84089553, "grad_norm": 1.68602014, "learning_rate": 4.114e-05, "token_acc": 0.75688259, "epoch": 0.84355444, "global_step/max_steps": "337/800", "percentage": "42.12%", "elapsed_time": "1h 8m 4s", "remaining_time": "1h 33m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.117613} +{"loss": 0.8329792, "grad_norm": 1.58101034, "learning_rate": 4.105e-05, "token_acc": 0.75932603, "epoch": 0.84605757, "global_step/max_steps": "338/800", "percentage": "42.25%", "elapsed_time": "1h 8m 14s", "remaining_time": "1h 33m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.113269} +{"loss": 0.64806819, "grad_norm": 1.95359719, "learning_rate": 4.095e-05, "token_acc": 0.81228507, "epoch": 0.8485607, "global_step/max_steps": "339/800", "percentage": "42.38%", "elapsed_time": "1h 8m 21s", "remaining_time": "1h 32m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.098402} +{"loss": 0.74456084, "grad_norm": 1.97939467, "learning_rate": 4.086e-05, "token_acc": 0.78271358, "epoch": 0.85106383, "global_step/max_steps": "340/800", "percentage": "42.50%", "elapsed_time": "1h 8m 29s", "remaining_time": "1h 32m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.083907} +{"loss": 0.83284581, "grad_norm": 4.79411983, "learning_rate": 4.076e-05, "token_acc": 0.75481755, "epoch": 0.85356696, "global_step/max_steps": "341/800", "percentage": "42.62%", "elapsed_time": "1h 8m 53s", "remaining_time": "1h 32m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.118984} +{"loss": 0.7087723, "grad_norm": 1.65602481, "learning_rate": 4.067e-05, "token_acc": 0.78587058, "epoch": 0.85607009, "global_step/max_steps": "342/800", "percentage": "42.75%", "elapsed_time": "1h 9m 2s", "remaining_time": "1h 32m 27s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.11099} +{"loss": 0.8401075, "grad_norm": 2.54690242, "learning_rate": 4.057e-05, "token_acc": 0.75216241, "epoch": 0.85857322, "global_step/max_steps": "343/800", "percentage": "42.88%", "elapsed_time": "1h 9m 10s", "remaining_time": "1h 32m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.097823} +{"loss": 0.88278329, "grad_norm": 1.10109782, "learning_rate": 4.048e-05, "token_acc": 0.74266264, "epoch": 0.86107635, "global_step/max_steps": "344/800", "percentage": "43.00%", "elapsed_time": "1h 9m 21s", "remaining_time": "1h 31m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.095367} +{"loss": 0.8690142, "grad_norm": 0.97514337, "learning_rate": 4.038e-05, "token_acc": 0.74474677, "epoch": 0.86357947, "global_step/max_steps": "345/800", "percentage": "43.12%", "elapsed_time": "1h 9m 34s", "remaining_time": "1h 31m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.099567} +{"loss": 0.76110542, "grad_norm": 1.70005882, "learning_rate": 4.028e-05, "token_acc": 0.77824179, "epoch": 0.8660826, "global_step/max_steps": "346/800", "percentage": "43.25%", "elapsed_time": "1h 9m 43s", "remaining_time": "1h 31m 29s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.089774} +{"loss": 0.82834256, "grad_norm": 1.28745294, "learning_rate": 4.019e-05, "token_acc": 0.759401, "epoch": 0.86858573, "global_step/max_steps": "347/800", "percentage": "43.38%", "elapsed_time": "1h 9m 54s", "remaining_time": "1h 31m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.085946} +{"loss": 0.71907669, "grad_norm": 2.16317177, "learning_rate": 4.009e-05, "token_acc": 0.78700293, "epoch": 0.87108886, "global_step/max_steps": "348/800", "percentage": "43.50%", "elapsed_time": "1h 9m 60s", "remaining_time": "1h 30m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.068281} +{"loss": 0.89467204, "grad_norm": 1.42953277, "learning_rate": 3.999e-05, "token_acc": 0.73928368, "epoch": 0.87359199, "global_step/max_steps": "349/800", "percentage": "43.62%", "elapsed_time": "1h 10m 11s", "remaining_time": "1h 30m 41s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.064555} +{"loss": 0.92957199, "grad_norm": 3.16842294, "learning_rate": 3.989e-05, "token_acc": 0.72889856, "epoch": 0.87609512, "global_step/max_steps": "350/800", "percentage": "43.75%", "elapsed_time": "1h 10m 24s", "remaining_time": "1h 30m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.068719} +{"loss": 0.92355877, "grad_norm": 1.73001146, "learning_rate": 3.979e-05, "token_acc": 0.73243632, "epoch": 0.87859825, "global_step/max_steps": "351/800", "percentage": "43.88%", "elapsed_time": "1h 10m 46s", "remaining_time": "1h 30m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.097937} +{"loss": 0.8874197, "grad_norm": 2.29952741, "learning_rate": 3.969e-05, "token_acc": 0.74041527, "epoch": 0.88110138, "global_step/max_steps": "352/800", "percentage": "44.00%", "elapsed_time": "1h 10m 57s", "remaining_time": "1h 30m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.092952} +{"loss": 0.89596575, "grad_norm": 1.4366138, "learning_rate": 3.96e-05, "token_acc": 0.73235941, "epoch": 0.88360451, "global_step/max_steps": "353/800", "percentage": "44.12%", "elapsed_time": "1h 11m 12s", "remaining_time": "1h 30m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.102577} +{"loss": 0.87061715, "grad_norm": 1.74192333, "learning_rate": 3.95e-05, "token_acc": 0.74781281, "epoch": 0.88610763, "global_step/max_steps": "354/800", "percentage": "44.25%", "elapsed_time": "1h 11m 27s", "remaining_time": "1h 30m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.109158} +{"loss": 0.93835741, "grad_norm": 2.79805422, "learning_rate": 3.94e-05, "token_acc": 0.72362402, "epoch": 0.88861076, "global_step/max_steps": "355/800", "percentage": "44.38%", "elapsed_time": "1h 11m 38s", "remaining_time": "1h 29m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.108005} +{"loss": 0.90207893, "grad_norm": 1.49983907, "learning_rate": 3.929e-05, "token_acc": 0.73912793, "epoch": 0.89111389, "global_step/max_steps": "356/800", "percentage": "44.50%", "elapsed_time": "1h 11m 48s", "remaining_time": "1h 29m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.101216} +{"loss": 0.86259162, "grad_norm": 7.36442518, "learning_rate": 3.919e-05, "token_acc": 0.75211791, "epoch": 0.89361702, "global_step/max_steps": "357/800", "percentage": "44.62%", "elapsed_time": "1h 11m 56s", "remaining_time": "1h 29m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.090932} +{"loss": 0.76001441, "grad_norm": 3.18670011, "learning_rate": 3.909e-05, "token_acc": 0.77933801, "epoch": 0.89612015, "global_step/max_steps": "358/800", "percentage": "44.75%", "elapsed_time": "1h 12m 6s", "remaining_time": "1h 29m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.084399} +{"loss": 0.76430273, "grad_norm": 1.80297208, "learning_rate": 3.899e-05, "token_acc": 0.77120422, "epoch": 0.89862328, "global_step/max_steps": "359/800", "percentage": "44.88%", "elapsed_time": "1h 12m 14s", "remaining_time": "1h 28m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.073495} +{"loss": 0.84530842, "grad_norm": 1.35566378, "learning_rate": 3.889e-05, "token_acc": 0.75029295, "epoch": 0.90112641, "global_step/max_steps": "360/800", "percentage": "45.00%", "elapsed_time": "1h 12m 28s", "remaining_time": "1h 28m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.077652} +{"loss": 0.85219324, "grad_norm": 1.00620806, "learning_rate": 3.879e-05, "token_acc": 0.75615538, "epoch": 0.90362954, "global_step/max_steps": "361/800", "percentage": "45.12%", "elapsed_time": "1h 12m 51s", "remaining_time": "1h 28m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.109302} +{"loss": 0.83477688, "grad_norm": 1.41999781, "learning_rate": 3.868e-05, "token_acc": 0.75019787, "epoch": 0.90613267, "global_step/max_steps": "362/800", "percentage": "45.25%", "elapsed_time": "1h 13m 4s", "remaining_time": "1h 28m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.109705} +{"loss": 0.77496308, "grad_norm": 1.34945703, "learning_rate": 3.858e-05, "token_acc": 0.77488231, "epoch": 0.90863579, "global_step/max_steps": "363/800", "percentage": "45.38%", "elapsed_time": "1h 13m 12s", "remaining_time": "1h 28m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.098379} +{"loss": 0.69836181, "grad_norm": 5.82307625, "learning_rate": 3.848e-05, "token_acc": 0.78714796, "epoch": 0.91113892, "global_step/max_steps": "364/800", "percentage": "45.50%", "elapsed_time": "1h 13m 25s", "remaining_time": "1h 27m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.101443} +{"loss": 0.84012818, "grad_norm": 8.13508034, "learning_rate": 3.837e-05, "token_acc": 0.75084098, "epoch": 0.91364205, "global_step/max_steps": "365/800", "percentage": "45.62%", "elapsed_time": "1h 13m 40s", "remaining_time": "1h 27m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.108509} +{"loss": 0.81705976, "grad_norm": 1.68735456, "learning_rate": 3.827e-05, "token_acc": 0.75522876, "epoch": 0.91614518, "global_step/max_steps": "366/800", "percentage": "45.75%", "elapsed_time": "1h 13m 49s", "remaining_time": "1h 27m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.101195} +{"loss": 0.87352443, "grad_norm": 1.96332061, "learning_rate": 3.817e-05, "token_acc": 0.74375116, "epoch": 0.91864831, "global_step/max_steps": "367/800", "percentage": "45.88%", "elapsed_time": "1h 13m 58s", "remaining_time": "1h 27m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.09226} +{"loss": 0.69336945, "grad_norm": 4.99668598, "learning_rate": 3.806e-05, "token_acc": 0.79227269, "epoch": 0.92115144, "global_step/max_steps": "368/800", "percentage": "46.00%", "elapsed_time": "1h 14m 7s", "remaining_time": "1h 26m 60s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.082883} +{"loss": 0.93136656, "grad_norm": 1.07136774, "learning_rate": 3.796e-05, "token_acc": 0.72877212, "epoch": 0.92365457, "global_step/max_steps": "369/800", "percentage": "46.12%", "elapsed_time": "1h 14m 21s", "remaining_time": "1h 26m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.089055} +{"loss": 0.75900948, "grad_norm": 4.21753168, "learning_rate": 3.785e-05, "token_acc": 0.77389591, "epoch": 0.9261577, "global_step/max_steps": "370/800", "percentage": "46.25%", "elapsed_time": "1h 14m 30s", "remaining_time": "1h 26m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.081703} +{"loss": 0.84831309, "grad_norm": 1.68788183, "learning_rate": 3.775e-05, "token_acc": 0.74920184, "epoch": 0.92866083, "global_step/max_steps": "371/800", "percentage": "46.38%", "elapsed_time": "1h 14m 54s", "remaining_time": "1h 26m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.113802} +{"loss": 0.91036153, "grad_norm": 0.85705578, "learning_rate": 3.764e-05, "token_acc": 0.7282932, "epoch": 0.93116395, "global_step/max_steps": "372/800", "percentage": "46.50%", "elapsed_time": "1h 15m 14s", "remaining_time": "1h 26m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.135009} +{"loss": 0.82725096, "grad_norm": 2.5253098, "learning_rate": 3.754e-05, "token_acc": 0.75560381, "epoch": 0.93366708, "global_step/max_steps": "373/800", "percentage": "46.62%", "elapsed_time": "1h 15m 26s", "remaining_time": "1h 26m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.133095} +{"loss": 0.91716874, "grad_norm": 1.47441208, "learning_rate": 3.743e-05, "token_acc": 0.73307846, "epoch": 0.93617021, "global_step/max_steps": "374/800", "percentage": "46.75%", "elapsed_time": "1h 15m 40s", "remaining_time": "1h 26m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.140254} +{"loss": 0.86179996, "grad_norm": 1.18993926, "learning_rate": 3.732e-05, "token_acc": 0.74555666, "epoch": 0.93867334, "global_step/max_steps": "375/800", "percentage": "46.88%", "elapsed_time": "1h 15m 50s", "remaining_time": "1h 25m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.133265} +{"loss": 0.84491038, "grad_norm": 1.33229685, "learning_rate": 3.722e-05, "token_acc": 0.75246265, "epoch": 0.94117647, "global_step/max_steps": "376/800", "percentage": "47.00%", "elapsed_time": "1h 16m 5s", "remaining_time": "1h 25m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.14005} +{"loss": 0.76435518, "grad_norm": 1.34320426, "learning_rate": 3.711e-05, "token_acc": 0.76823154, "epoch": 0.9436796, "global_step/max_steps": "377/800", "percentage": "47.12%", "elapsed_time": "1h 16m 12s", "remaining_time": "1h 25m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.12712} +{"loss": 0.7325477, "grad_norm": 1.83858383, "learning_rate": 3.7e-05, "token_acc": 0.78227822, "epoch": 0.94618273, "global_step/max_steps": "378/800", "percentage": "47.25%", "elapsed_time": "1h 16m 20s", "remaining_time": "1h 25m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.11724} +{"loss": 0.98350745, "grad_norm": 1.70048285, "learning_rate": 3.689e-05, "token_acc": 0.71537524, "epoch": 0.94868586, "global_step/max_steps": "379/800", "percentage": "47.38%", "elapsed_time": "1h 16m 33s", "remaining_time": "1h 25m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.119955} +{"loss": 0.83418119, "grad_norm": 1.26854551, "learning_rate": 3.678e-05, "token_acc": 0.7532715, "epoch": 0.95118899, "global_step/max_steps": "380/800", "percentage": "47.50%", "elapsed_time": "1h 16m 42s", "remaining_time": "1h 24m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.111627} +{"loss": 0.84521651, "grad_norm": 0.93198526, "learning_rate": 3.668e-05, "token_acc": 0.75040959, "epoch": 0.95369212, "global_step/max_steps": "381/800", "percentage": "47.62%", "elapsed_time": "1h 17m 5s", "remaining_time": "1h 24m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.139948} +{"loss": 0.75426489, "grad_norm": 1.60685205, "learning_rate": 3.657e-05, "token_acc": 0.77628288, "epoch": 0.95619524, "global_step/max_steps": "382/800", "percentage": "47.75%", "elapsed_time": "1h 17m 15s", "remaining_time": "1h 24m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.134313} +{"loss": 0.75482851, "grad_norm": 2.16584396, "learning_rate": 3.646e-05, "token_acc": 0.77440265, "epoch": 0.95869837, "global_step/max_steps": "383/800", "percentage": "47.88%", "elapsed_time": "1h 17m 28s", "remaining_time": "1h 24m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.135581} +{"loss": 0.62925208, "grad_norm": 1.81568408, "learning_rate": 3.635e-05, "token_acc": 0.80972312, "epoch": 0.9612015, "global_step/max_steps": "384/800", "percentage": "48.00%", "elapsed_time": "1h 17m 36s", "remaining_time": "1h 24m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.124497} +{"loss": 0.80945814, "grad_norm": 0.92365444, "learning_rate": 3.624e-05, "token_acc": 0.760814, "epoch": 0.96370463, "global_step/max_steps": "385/800", "percentage": "48.12%", "elapsed_time": "1h 17m 48s", "remaining_time": "1h 23m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.125522} +{"loss": 0.8500129, "grad_norm": 1.49769497, "learning_rate": 3.613e-05, "token_acc": 0.74806236, "epoch": 0.96620776, "global_step/max_steps": "386/800", "percentage": "48.25%", "elapsed_time": "1h 18m 2s", "remaining_time": "1h 23m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.130613} +{"loss": 0.91794223, "grad_norm": 3.22035336, "learning_rate": 3.602e-05, "token_acc": 0.7284884, "epoch": 0.96871089, "global_step/max_steps": "387/800", "percentage": "48.38%", "elapsed_time": "1h 18m 15s", "remaining_time": "1h 23m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.131408} +{"loss": 0.77022684, "grad_norm": 4.52182961, "learning_rate": 3.591e-05, "token_acc": 0.77161299, "epoch": 0.97121402, "global_step/max_steps": "388/800", "percentage": "48.50%", "elapsed_time": "1h 18m 23s", "remaining_time": "1h 23m 14s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.120925} +{"loss": 0.93294615, "grad_norm": 0.96222919, "learning_rate": 3.58e-05, "token_acc": 0.72760417, "epoch": 0.97371715, "global_step/max_steps": "389/800", "percentage": "48.62%", "elapsed_time": "1h 18m 35s", "remaining_time": "1h 23m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.119769} +{"loss": 0.67128342, "grad_norm": 1.71559465, "learning_rate": 3.569e-05, "token_acc": 0.80115212, "epoch": 0.97622028, "global_step/max_steps": "390/800", "percentage": "48.75%", "elapsed_time": "1h 18m 40s", "remaining_time": "1h 22m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.102353} +{"loss": 0.82048213, "grad_norm": 1.68052399, "learning_rate": 3.558e-05, "token_acc": 0.75572181, "epoch": 0.9787234, "global_step/max_steps": "391/800", "percentage": "48.88%", "elapsed_time": "1h 18m 60s", "remaining_time": "1h 22m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.122133} +{"loss": 0.78221154, "grad_norm": 1.82191372, "learning_rate": 3.547e-05, "token_acc": 0.76522498, "epoch": 0.98122653, "global_step/max_steps": "392/800", "percentage": "49.00%", "elapsed_time": "1h 19m 10s", "remaining_time": "1h 22m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.118504} +{"loss": 0.79394233, "grad_norm": 0.92045784, "learning_rate": 3.535e-05, "token_acc": 0.76377152, "epoch": 0.98372966, "global_step/max_steps": "393/800", "percentage": "49.12%", "elapsed_time": "1h 19m 20s", "remaining_time": "1h 22m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.11128} +{"loss": 0.74887061, "grad_norm": 1.6548841, "learning_rate": 3.524e-05, "token_acc": 0.77800974, "epoch": 0.98623279, "global_step/max_steps": "394/800", "percentage": "49.25%", "elapsed_time": "1h 19m 26s", "remaining_time": "1h 21m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.095733} +{"loss": 0.83021218, "grad_norm": 1.41443014, "learning_rate": 3.513e-05, "token_acc": 0.75566696, "epoch": 0.98873592, "global_step/max_steps": "395/800", "percentage": "49.38%", "elapsed_time": "1h 19m 33s", "remaining_time": "1h 21m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.083035} +{"loss": 0.74739498, "grad_norm": 1.25305736, "learning_rate": 3.502e-05, "token_acc": 0.77783767, "epoch": 0.99123905, "global_step/max_steps": "396/800", "percentage": "49.50%", "elapsed_time": "1h 19m 43s", "remaining_time": "1h 21m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.077462} +{"loss": 0.77339739, "grad_norm": 1.36263835, "learning_rate": 3.491e-05, "token_acc": 0.77177588, "epoch": 0.99374218, "global_step/max_steps": "397/800", "percentage": "49.62%", "elapsed_time": "1h 19m 50s", "remaining_time": "1h 21m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.066548} +{"loss": 0.71744251, "grad_norm": 1.85612142, "learning_rate": 3.479e-05, "token_acc": 0.78976436, "epoch": 0.99624531, "global_step/max_steps": "398/800", "percentage": "49.75%", "elapsed_time": "1h 19m 57s", "remaining_time": "1h 20m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.052055} +{"loss": 0.86227864, "grad_norm": 1.40101683, "learning_rate": 3.468e-05, "token_acc": 0.74610936, "epoch": 0.99874844, "global_step/max_steps": "399/800", "percentage": "49.88%", "elapsed_time": "1h 20m 10s", "remaining_time": "1h 20m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.055866} +{"loss": 0.74536836, "grad_norm": 3.48827672, "learning_rate": 3.457e-05, "token_acc": 0.77411603, "epoch": 1.0, "global_step/max_steps": "400/800", "percentage": "50.00%", "elapsed_time": "1h 20m 14s", "remaining_time": "1h 20m 14s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.036196} +{"loss": 0.7595579, "grad_norm": 1.16069341, "learning_rate": 3.445e-05, "token_acc": 0.77227976, "epoch": 1.00250313, "global_step/max_steps": "401/800", "percentage": "50.12%", "elapsed_time": "1h 20m 36s", "remaining_time": "1h 20m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.059983} +{"loss": 0.85609162, "grad_norm": 7.11932039, "learning_rate": 3.434e-05, "token_acc": 0.74518511, "epoch": 1.00500626, "global_step/max_steps": "402/800", "percentage": "50.25%", "elapsed_time": "1h 20m 46s", "remaining_time": "1h 19m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.055313} +{"loss": 0.74802625, "grad_norm": 2.26474261, "learning_rate": 3.423e-05, "token_acc": 0.77685467, "epoch": 1.00750939, "global_step/max_steps": "403/800", "percentage": "50.38%", "elapsed_time": "1h 20m 56s", "remaining_time": "1h 19m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.05009} +{"loss": 0.65163666, "grad_norm": 2.63827705, "learning_rate": 3.411e-05, "token_acc": 0.80086499, "epoch": 1.01001252, "global_step/max_steps": "404/800", "percentage": "50.50%", "elapsed_time": "1h 21m 3s", "remaining_time": "1h 19m 26s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.036601} +{"loss": 0.76402807, "grad_norm": 10.03870964, "learning_rate": 3.4e-05, "token_acc": 0.77456499, "epoch": 1.01251564, "global_step/max_steps": "405/800", "percentage": "50.62%", "elapsed_time": "1h 21m 11s", "remaining_time": "1h 19m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.02832} +{"loss": 0.80782318, "grad_norm": 1.463516, "learning_rate": 3.388e-05, "token_acc": 0.76270609, "epoch": 1.01501877, "global_step/max_steps": "406/800", "percentage": "50.75%", "elapsed_time": "1h 21m 22s", "remaining_time": "1h 18m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.024594} +{"loss": 0.81642652, "grad_norm": 1.89011741, "learning_rate": 3.377e-05, "token_acc": 0.76212558, "epoch": 1.0175219, "global_step/max_steps": "407/800", "percentage": "50.88%", "elapsed_time": "1h 21m 30s", "remaining_time": "1h 18m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.014273} +{"loss": 0.84717202, "grad_norm": 2.5771091, "learning_rate": 3.365e-05, "token_acc": 0.74791614, "epoch": 1.02002503, "global_step/max_steps": "408/800", "percentage": "51.00%", "elapsed_time": "1h 21m 40s", "remaining_time": "1h 18m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.0102} +{"loss": 0.70599258, "grad_norm": 1.9842844, "learning_rate": 3.354e-05, "token_acc": 0.78977422, "epoch": 1.02252816, "global_step/max_steps": "409/800", "percentage": "51.12%", "elapsed_time": "1h 21m 47s", "remaining_time": "1h 18m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.997367} +{"loss": 0.99509859, "grad_norm": 1.84552228, "learning_rate": 3.342e-05, "token_acc": 0.71584716, "epoch": 1.02503129, "global_step/max_steps": "410/800", "percentage": "51.25%", "elapsed_time": "1h 22m 9s", "remaining_time": "1h 18m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.021602} +{"loss": 0.75237298, "grad_norm": 2.81369948, "learning_rate": 3.331e-05, "token_acc": 0.7738898, "epoch": 1.02753442, "global_step/max_steps": "411/800", "percentage": "51.38%", "elapsed_time": "1h 22m 29s", "remaining_time": "1h 18m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.041478} +{"loss": 0.88977265, "grad_norm": 0.90681714, "learning_rate": 3.319e-05, "token_acc": 0.73717898, "epoch": 1.03003755, "global_step/max_steps": "412/800", "percentage": "51.50%", "elapsed_time": "1h 22m 43s", "remaining_time": "1h 17m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.047083} +{"loss": 0.64711142, "grad_norm": 2.7051506, "learning_rate": 3.307e-05, "token_acc": 0.80973999, "epoch": 1.03254068, "global_step/max_steps": "413/800", "percentage": "51.62%", "elapsed_time": "1h 22m 51s", "remaining_time": "1h 17m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.036986} +{"loss": 0.76313674, "grad_norm": 1.53228271, "learning_rate": 3.296e-05, "token_acc": 0.77762491, "epoch": 1.0350438, "global_step/max_steps": "414/800", "percentage": "51.75%", "elapsed_time": "1h 23m 2s", "remaining_time": "1h 17m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.033795} +{"loss": 0.85379457, "grad_norm": 0.82645607, "learning_rate": 3.284e-05, "token_acc": 0.74720681, "epoch": 1.03754693, "global_step/max_steps": "415/800", "percentage": "51.88%", "elapsed_time": "1h 23m 16s", "remaining_time": "1h 17m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.038061} +{"loss": 0.82331347, "grad_norm": 1.29414296, "learning_rate": 3.273e-05, "token_acc": 0.75734845, "epoch": 1.04005006, "global_step/max_steps": "416/800", "percentage": "52.00%", "elapsed_time": "1h 23m 25s", "remaining_time": "1h 17m 0s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.031989} +{"loss": 0.87343323, "grad_norm": 0.96578735, "learning_rate": 3.261e-05, "token_acc": 0.74381484, "epoch": 1.04255319, "global_step/max_steps": "417/800", "percentage": "52.12%", "elapsed_time": "1h 23m 34s", "remaining_time": "1h 16m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.024556} +{"loss": 0.84469038, "grad_norm": 1.6988138, "learning_rate": 3.249e-05, "token_acc": 0.74723493, "epoch": 1.04505632, "global_step/max_steps": "418/800", "percentage": "52.25%", "elapsed_time": "1h 23m 50s", "remaining_time": "1h 16m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.032883} +{"loss": 0.67631102, "grad_norm": 3.73932528, "learning_rate": 3.237e-05, "token_acc": 0.79268636, "epoch": 1.04755945, "global_step/max_steps": "419/800", "percentage": "52.38%", "elapsed_time": "1h 23m 56s", "remaining_time": "1h 16m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.018879} +{"loss": 0.63550043, "grad_norm": 1.91599858, "learning_rate": 3.226e-05, "token_acc": 0.80372986, "epoch": 1.05006258, "global_step/max_steps": "420/800", "percentage": "52.50%", "elapsed_time": "1h 24m 3s", "remaining_time": "1h 16m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.007335} +{"loss": 0.82808626, "grad_norm": 1.24412918, "learning_rate": 3.214e-05, "token_acc": 0.75635528, "epoch": 1.05256571, "global_step/max_steps": "421/800", "percentage": "52.62%", "elapsed_time": "1h 24m 31s", "remaining_time": "1h 16m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.045759} +{"loss": 0.81398118, "grad_norm": 2.31833577, "learning_rate": 3.202e-05, "token_acc": 0.75830927, "epoch": 1.05506884, "global_step/max_steps": "422/800", "percentage": "52.75%", "elapsed_time": "1h 24m 39s", "remaining_time": "1h 15m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.036111} +{"loss": 0.69826829, "grad_norm": 1.28125834, "learning_rate": 3.19e-05, "token_acc": 0.79419853, "epoch": 1.05757196, "global_step/max_steps": "423/800", "percentage": "52.88%", "elapsed_time": "1h 24m 46s", "remaining_time": "1h 15m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.024314} +{"loss": 0.86522561, "grad_norm": 1.25412667, "learning_rate": 3.179e-05, "token_acc": 0.74532098, "epoch": 1.06007509, "global_step/max_steps": "424/800", "percentage": "53.00%", "elapsed_time": "1h 24m 60s", "remaining_time": "1h 15m 23s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.028149} +{"loss": 0.75943863, "grad_norm": 1.24269986, "learning_rate": 3.167e-05, "token_acc": 0.76771231, "epoch": 1.06257822, "global_step/max_steps": "425/800", "percentage": "53.12%", "elapsed_time": "1h 25m 11s", "remaining_time": "1h 15m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.02511} +{"loss": 0.78758645, "grad_norm": 3.86733222, "learning_rate": 3.155e-05, "token_acc": 0.76618159, "epoch": 1.06508135, "global_step/max_steps": "426/800", "percentage": "53.25%", "elapsed_time": "1h 25m 20s", "remaining_time": "1h 14m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.018102} +{"loss": 0.81663644, "grad_norm": 1.16038465, "learning_rate": 3.143e-05, "token_acc": 0.76100325, "epoch": 1.06758448, "global_step/max_steps": "427/800", "percentage": "53.37%", "elapsed_time": "1h 25m 29s", "remaining_time": "1h 14m 40s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.010924} +{"loss": 0.78973216, "grad_norm": 2.74873471, "learning_rate": 3.131e-05, "token_acc": 0.7664034, "epoch": 1.07008761, "global_step/max_steps": "428/800", "percentage": "53.50%", "elapsed_time": "1h 25m 43s", "remaining_time": "1h 14m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.015762} +{"loss": 0.79138386, "grad_norm": 4.71236563, "learning_rate": 3.119e-05, "token_acc": 0.76401218, "epoch": 1.07259074, "global_step/max_steps": "429/800", "percentage": "53.62%", "elapsed_time": "1h 25m 54s", "remaining_time": "1h 14m 17s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.014559} +{"loss": 0.79965925, "grad_norm": 1.55209577, "learning_rate": 3.107e-05, "token_acc": 0.76748462, "epoch": 1.07509387, "global_step/max_steps": "430/800", "percentage": "53.75%", "elapsed_time": "1h 26m 3s", "remaining_time": "1h 14m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.006985} +{"loss": 0.81506604, "grad_norm": 2.15186834, "learning_rate": 3.096e-05, "token_acc": 0.7623302, "epoch": 1.077597, "global_step/max_steps": "431/800", "percentage": "53.87%", "elapsed_time": "1h 26m 28s", "remaining_time": "1h 14m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.037905} +{"loss": 0.89178979, "grad_norm": 1.1168108, "learning_rate": 3.084e-05, "token_acc": 0.73901662, "epoch": 1.08010013, "global_step/max_steps": "432/800", "percentage": "54.00%", "elapsed_time": "1h 26m 39s", "remaining_time": "1h 13m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.035657} +{"loss": 0.83565247, "grad_norm": 2.89005876, "learning_rate": 3.072e-05, "token_acc": 0.75087247, "epoch": 1.08260325, "global_step/max_steps": "433/800", "percentage": "54.12%", "elapsed_time": "1h 26m 52s", "remaining_time": "1h 13m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.037539} +{"loss": 0.66803962, "grad_norm": 1.56365049, "learning_rate": 3.06e-05, "token_acc": 0.79513212, "epoch": 1.08510638, "global_step/max_steps": "434/800", "percentage": "54.25%", "elapsed_time": "1h 27m 2s", "remaining_time": "1h 13m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.033285} +{"loss": 0.8508873, "grad_norm": 1.51938498, "learning_rate": 3.048e-05, "token_acc": 0.75158972, "epoch": 1.08760951, "global_step/max_steps": "435/800", "percentage": "54.37%", "elapsed_time": "1h 27m 16s", "remaining_time": "1h 13m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.035788} +{"loss": 0.74880779, "grad_norm": 2.85059381, "learning_rate": 3.036e-05, "token_acc": 0.77495694, "epoch": 1.09011264, "global_step/max_steps": "436/800", "percentage": "54.50%", "elapsed_time": "1h 27m 22s", "remaining_time": "1h 12m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.022685} +{"loss": 0.83073854, "grad_norm": 1.36070085, "learning_rate": 3.024e-05, "token_acc": 0.7534736, "epoch": 1.09261577, "global_step/max_steps": "437/800", "percentage": "54.62%", "elapsed_time": "1h 27m 36s", "remaining_time": "1h 12m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.026705} +{"loss": 0.82569665, "grad_norm": 0.83868563, "learning_rate": 3.012e-05, "token_acc": 0.75362788, "epoch": 1.0951189, "global_step/max_steps": "438/800", "percentage": "54.75%", "elapsed_time": "1h 27m 50s", "remaining_time": "1h 12m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.032492} +{"loss": 0.67147404, "grad_norm": 1.47267938, "learning_rate": 3e-05, "token_acc": 0.79853036, "epoch": 1.09762203, "global_step/max_steps": "439/800", "percentage": "54.87%", "elapsed_time": "1h 27m 58s", "remaining_time": "1h 12m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.022266} +{"loss": 0.66211313, "grad_norm": 1.58782399, "learning_rate": 2.988e-05, "token_acc": 0.8018326, "epoch": 1.10012516, "global_step/max_steps": "440/800", "percentage": "55.00%", "elapsed_time": "1h 28m 16s", "remaining_time": "1h 12m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.037057} +{"loss": 0.86414933, "grad_norm": 1.06087196, "learning_rate": 2.976e-05, "token_acc": 0.74706401, "epoch": 1.10262829, "global_step/max_steps": "441/800", "percentage": "55.12%", "elapsed_time": "1h 28m 40s", "remaining_time": "1h 12m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.062944} +{"loss": 0.64229667, "grad_norm": 1.79584301, "learning_rate": 2.964e-05, "token_acc": 0.80628882, "epoch": 1.10513141, "global_step/max_steps": "442/800", "percentage": "55.25%", "elapsed_time": "1h 28m 46s", "remaining_time": "1h 11m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.049951} +{"loss": 0.73086149, "grad_norm": 2.89705992, "learning_rate": 2.952e-05, "token_acc": 0.78234341, "epoch": 1.10763454, "global_step/max_steps": "443/800", "percentage": "55.38%", "elapsed_time": "1h 28m 53s", "remaining_time": "1h 11m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.038616} +{"loss": 0.86348903, "grad_norm": 1.94057786, "learning_rate": 2.939e-05, "token_acc": 0.74141828, "epoch": 1.11013767, "global_step/max_steps": "444/800", "percentage": "55.50%", "elapsed_time": "1h 29m 7s", "remaining_time": "1h 11m 27s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.041901} +{"loss": 0.79578674, "grad_norm": 1.02973306, "learning_rate": 2.927e-05, "token_acc": 0.75748872, "epoch": 1.1126408, "global_step/max_steps": "445/800", "percentage": "55.62%", "elapsed_time": "1h 29m 19s", "remaining_time": "1h 11m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.04265} +{"loss": 0.85646611, "grad_norm": 1.08090818, "learning_rate": 2.915e-05, "token_acc": 0.7462025, "epoch": 1.11514393, "global_step/max_steps": "446/800", "percentage": "55.75%", "elapsed_time": "1h 29m 31s", "remaining_time": "1h 11m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.04367} +{"loss": 0.77371317, "grad_norm": 2.16397643, "learning_rate": 2.903e-05, "token_acc": 0.76629648, "epoch": 1.11764706, "global_step/max_steps": "447/800", "percentage": "55.88%", "elapsed_time": "1h 29m 42s", "remaining_time": "1h 10m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.040317} +{"loss": 0.7582351, "grad_norm": 1.63610673, "learning_rate": 2.891e-05, "token_acc": 0.77366943, "epoch": 1.12015019, "global_step/max_steps": "448/800", "percentage": "56.00%", "elapsed_time": "1h 29m 50s", "remaining_time": "1h 10m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.030506} +{"loss": 0.61410034, "grad_norm": 2.32448101, "learning_rate": 2.879e-05, "token_acc": 0.81894345, "epoch": 1.12265332, "global_step/max_steps": "449/800", "percentage": "56.12%", "elapsed_time": "1h 29m 59s", "remaining_time": "1h 10m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.02383} +{"loss": 0.67847258, "grad_norm": 2.44190931, "learning_rate": 2.867e-05, "token_acc": 0.79441061, "epoch": 1.12515645, "global_step/max_steps": "450/800", "percentage": "56.25%", "elapsed_time": "1h 30m 9s", "remaining_time": "1h 10m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.019272} +{"loss": 0.6986773, "grad_norm": 2.70294905, "learning_rate": 2.855e-05, "token_acc": 0.79022052, "epoch": 1.12765957, "global_step/max_steps": "451/800", "percentage": "56.38%", "elapsed_time": "1h 30m 27s", "remaining_time": "1h 9m 60s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.033275} +{"loss": 0.70325899, "grad_norm": 1.95333385, "learning_rate": 2.843e-05, "token_acc": 0.79202524, "epoch": 1.1301627, "global_step/max_steps": "452/800", "percentage": "56.50%", "elapsed_time": "1h 30m 34s", "remaining_time": "1h 9m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.021284} +{"loss": 0.8273623, "grad_norm": 2.28406715, "learning_rate": 2.83e-05, "token_acc": 0.75285461, "epoch": 1.13266583, "global_step/max_steps": "453/800", "percentage": "56.62%", "elapsed_time": "1h 30m 41s", "remaining_time": "1h 9m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.011821} +{"loss": 0.92440867, "grad_norm": 1.59500015, "learning_rate": 2.818e-05, "token_acc": 0.72759059, "epoch": 1.13516896, "global_step/max_steps": "454/800", "percentage": "56.75%", "elapsed_time": "1h 30m 57s", "remaining_time": "1h 9m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.020375} +{"loss": 0.69754022, "grad_norm": 1.69578099, "learning_rate": 2.806e-05, "token_acc": 0.78697346, "epoch": 1.13767209, "global_step/max_steps": "455/800", "percentage": "56.88%", "elapsed_time": "1h 31m 7s", "remaining_time": "1h 9m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.014527} +{"loss": 0.7530582, "grad_norm": 2.09233904, "learning_rate": 2.794e-05, "token_acc": 0.77615673, "epoch": 1.14017522, "global_step/max_steps": "456/800", "percentage": "57.00%", "elapsed_time": "1h 31m 16s", "remaining_time": "1h 8m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.008349} +{"loss": 0.7872256, "grad_norm": 1.36220169, "learning_rate": 2.782e-05, "token_acc": 0.76159736, "epoch": 1.14267835, "global_step/max_steps": "457/800", "percentage": "57.12%", "elapsed_time": "1h 31m 29s", "remaining_time": "1h 8m 40s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.011794} +{"loss": 0.79575765, "grad_norm": 1.34671581, "learning_rate": 2.769e-05, "token_acc": 0.76729474, "epoch": 1.14518148, "global_step/max_steps": "458/800", "percentage": "57.25%", "elapsed_time": "1h 31m 37s", "remaining_time": "1h 8m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.002607} +{"loss": 0.83631015, "grad_norm": 1.49436259, "learning_rate": 2.757e-05, "token_acc": 0.74914135, "epoch": 1.14768461, "global_step/max_steps": "459/800", "percentage": "57.38%", "elapsed_time": "1h 31m 53s", "remaining_time": "1h 8m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.010456} +{"loss": 0.8885718, "grad_norm": 1.0831846, "learning_rate": 2.745e-05, "token_acc": 0.74094474, "epoch": 1.15018773, "global_step/max_steps": "460/800", "percentage": "57.50%", "elapsed_time": "1h 32m 4s", "remaining_time": "1h 8m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.008418} +{"loss": 0.82557094, "grad_norm": 2.5425179, "learning_rate": 2.733e-05, "token_acc": 0.7530205, "epoch": 1.15269086, "global_step/max_steps": "461/800", "percentage": "57.63%", "elapsed_time": "1h 32m 24s", "remaining_time": "1h 7m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.026913} +{"loss": 0.86656594, "grad_norm": 1.33451164, "learning_rate": 2.721e-05, "token_acc": 0.74492739, "epoch": 1.15519399, "global_step/max_steps": "462/800", "percentage": "57.75%", "elapsed_time": "1h 32m 38s", "remaining_time": "1h 7m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.030578} +{"loss": 0.85572755, "grad_norm": 1.20884824, "learning_rate": 2.708e-05, "token_acc": 0.7444496, "epoch": 1.15769712, "global_step/max_steps": "463/800", "percentage": "57.88%", "elapsed_time": "1h 32m 53s", "remaining_time": "1h 7m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.036077} +{"loss": 0.91773856, "grad_norm": 2.06284618, "learning_rate": 2.696e-05, "token_acc": 0.72932875, "epoch": 1.16020025, "global_step/max_steps": "464/800", "percentage": "58.00%", "elapsed_time": "1h 33m 17s", "remaining_time": "1h 7m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.063202} +{"loss": 0.72308296, "grad_norm": 2.49507856, "learning_rate": 2.684e-05, "token_acc": 0.77691832, "epoch": 1.16270338, "global_step/max_steps": "465/800", "percentage": "58.13%", "elapsed_time": "1h 33m 24s", "remaining_time": "1h 7m 17s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.051844} +{"loss": 0.6471743, "grad_norm": 2.30898094, "learning_rate": 2.672e-05, "token_acc": 0.80406235, "epoch": 1.16520651, "global_step/max_steps": "466/800", "percentage": "58.25%", "elapsed_time": "1h 33m 32s", "remaining_time": "1h 7m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.04243} +{"loss": 0.52499753, "grad_norm": 1.52195883, "learning_rate": 2.659e-05, "token_acc": 0.84633517, "epoch": 1.16770964, "global_step/max_steps": "467/800", "percentage": "58.38%", "elapsed_time": "1h 33m 40s", "remaining_time": "1h 6m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.033647} +{"loss": 0.75788224, "grad_norm": 3.03977418, "learning_rate": 2.647e-05, "token_acc": 0.77442569, "epoch": 1.17021277, "global_step/max_steps": "468/800", "percentage": "58.50%", "elapsed_time": "1h 33m 47s", "remaining_time": "1h 6m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.023374} +{"loss": 0.72341418, "grad_norm": 1.95036054, "learning_rate": 2.635e-05, "token_acc": 0.78628722, "epoch": 1.17271589, "global_step/max_steps": "469/800", "percentage": "58.63%", "elapsed_time": "1h 33m 54s", "remaining_time": "1h 6m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.013146} +{"loss": 0.84091222, "grad_norm": 1.00080073, "learning_rate": 2.623e-05, "token_acc": 0.74827275, "epoch": 1.17521902, "global_step/max_steps": "470/800", "percentage": "58.75%", "elapsed_time": "1h 34m 4s", "remaining_time": "1h 6m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.00954} +{"loss": 0.72483599, "grad_norm": 1.58083785, "learning_rate": 2.61e-05, "token_acc": 0.77877192, "epoch": 1.17772215, "global_step/max_steps": "471/800", "percentage": "58.88%", "elapsed_time": "1h 34m 24s", "remaining_time": "1h 5m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.026021} +{"loss": 0.8796379, "grad_norm": 1.2275604, "learning_rate": 2.598e-05, "token_acc": 0.74364329, "epoch": 1.18022528, "global_step/max_steps": "472/800", "percentage": "59.00%", "elapsed_time": "1h 34m 38s", "remaining_time": "1h 5m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.029377} +{"loss": 0.79711652, "grad_norm": 5.61031437, "learning_rate": 2.586e-05, "token_acc": 0.76160802, "epoch": 1.18272841, "global_step/max_steps": "473/800", "percentage": "59.13%", "elapsed_time": "1h 34m 48s", "remaining_time": "1h 5m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.025783} +{"loss": 0.83639634, "grad_norm": 1.60305214, "learning_rate": 2.574e-05, "token_acc": 0.75493244, "epoch": 1.18523154, "global_step/max_steps": "474/800", "percentage": "59.25%", "elapsed_time": "1h 34m 58s", "remaining_time": "1h 5m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.020444} +{"loss": 0.81528735, "grad_norm": 1.12388396, "learning_rate": 2.561e-05, "token_acc": 0.75582958, "epoch": 1.18773467, "global_step/max_steps": "475/800", "percentage": "59.38%", "elapsed_time": "1h 35m 9s", "remaining_time": "1h 5m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.019391} +{"loss": 0.67849505, "grad_norm": 2.5333271, "learning_rate": 2.549e-05, "token_acc": 0.79889392, "epoch": 1.1902378, "global_step/max_steps": "476/800", "percentage": "59.50%", "elapsed_time": "1h 35m 16s", "remaining_time": "1h 4m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.007536} +{"loss": 0.77020562, "grad_norm": 2.93195486, "learning_rate": 2.537e-05, "token_acc": 0.77473917, "epoch": 1.19274093, "global_step/max_steps": "477/800", "percentage": "59.62%", "elapsed_time": "1h 35m 22s", "remaining_time": "1h 4m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.996698} +{"loss": 0.91441214, "grad_norm": 1.12119436, "learning_rate": 2.525e-05, "token_acc": 0.73237939, "epoch": 1.19524406, "global_step/max_steps": "478/800", "percentage": "59.75%", "elapsed_time": "1h 35m 37s", "remaining_time": "1h 4m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.002565} +{"loss": 0.85563666, "grad_norm": 1.14852202, "learning_rate": 2.512e-05, "token_acc": 0.74659401, "epoch": 1.19774718, "global_step/max_steps": "479/800", "percentage": "59.88%", "elapsed_time": "1h 35m 47s", "remaining_time": "1h 4m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.99866} +{"loss": 0.7300998, "grad_norm": 1.11660469, "learning_rate": 2.5e-05, "token_acc": 0.78332134, "epoch": 1.20025031, "global_step/max_steps": "480/800", "percentage": "60.00%", "elapsed_time": "1h 35m 55s", "remaining_time": "1h 3m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.988883} +{"loss": 0.76464587, "grad_norm": 1.27819991, "learning_rate": 2.488e-05, "token_acc": 0.7700712, "epoch": 1.20275344, "global_step/max_steps": "481/800", "percentage": "60.12%", "elapsed_time": "1h 36m 15s", "remaining_time": "1h 3m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.005469} +{"loss": 0.85198486, "grad_norm": 0.96560174, "learning_rate": 2.475e-05, "token_acc": 0.74661222, "epoch": 1.20525657, "global_step/max_steps": "482/800", "percentage": "60.25%", "elapsed_time": "1h 36m 31s", "remaining_time": "1h 3m 41s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.014324} +{"loss": 0.74986279, "grad_norm": 2.78045774, "learning_rate": 2.463e-05, "token_acc": 0.77603513, "epoch": 1.2077597, "global_step/max_steps": "483/800", "percentage": "60.38%", "elapsed_time": "1h 36m 44s", "remaining_time": "1h 3m 29s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.015793} +{"loss": 0.8318485, "grad_norm": 2.40273881, "learning_rate": 2.451e-05, "token_acc": 0.75048056, "epoch": 1.21026283, "global_step/max_steps": "484/800", "percentage": "60.50%", "elapsed_time": "1h 36m 56s", "remaining_time": "1h 3m 17s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.016023} +{"loss": 0.84860361, "grad_norm": 3.00888157, "learning_rate": 2.439e-05, "token_acc": 0.7461553, "epoch": 1.21276596, "global_step/max_steps": "485/800", "percentage": "60.62%", "elapsed_time": "1h 37m 7s", "remaining_time": "1h 3m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.0135} +{"loss": 0.96709985, "grad_norm": 1.29954457, "learning_rate": 2.426e-05, "token_acc": 0.72012657, "epoch": 1.21526909, "global_step/max_steps": "486/800", "percentage": "60.75%", "elapsed_time": "1h 37m 20s", "remaining_time": "1h 2m 53s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.015924} +{"loss": 0.85900253, "grad_norm": 1.11810386, "learning_rate": 2.414e-05, "token_acc": 0.7477829, "epoch": 1.21777222, "global_step/max_steps": "487/800", "percentage": "60.88%", "elapsed_time": "1h 37m 32s", "remaining_time": "1h 2m 41s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.017102} +{"loss": 0.71875572, "grad_norm": 2.26283598, "learning_rate": 2.402e-05, "token_acc": 0.78504139, "epoch": 1.22027534, "global_step/max_steps": "488/800", "percentage": "61.00%", "elapsed_time": "1h 37m 40s", "remaining_time": "1h 2m 27s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.008729} +{"loss": 0.84614199, "grad_norm": 1.0359391, "learning_rate": 2.39e-05, "token_acc": 0.74819773, "epoch": 1.22277847, "global_step/max_steps": "489/800", "percentage": "61.12%", "elapsed_time": "1h 37m 48s", "remaining_time": "1h 2m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.000157} +{"loss": 0.69870102, "grad_norm": 2.39874744, "learning_rate": 2.377e-05, "token_acc": 0.78675963, "epoch": 1.2252816, "global_step/max_steps": "490/800", "percentage": "61.25%", "elapsed_time": "1h 37m 58s", "remaining_time": "1h 1m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.996158} +{"loss": 0.90083402, "grad_norm": 1.46724153, "learning_rate": 2.365e-05, "token_acc": 0.73274162, "epoch": 1.22778473, "global_step/max_steps": "491/800", "percentage": "61.38%", "elapsed_time": "1h 38m 19s", "remaining_time": "1h 1m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.013417} +{"loss": 0.68108273, "grad_norm": 3.99674201, "learning_rate": 2.353e-05, "token_acc": 0.79241765, "epoch": 1.23028786, "global_step/max_steps": "492/800", "percentage": "61.50%", "elapsed_time": "1h 38m 26s", "remaining_time": "1h 1m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.004726} +{"loss": 0.7924419, "grad_norm": 1.18540645, "learning_rate": 2.341e-05, "token_acc": 0.76958274, "epoch": 1.23279099, "global_step/max_steps": "493/800", "percentage": "61.62%", "elapsed_time": "1h 38m 35s", "remaining_time": "1h 1m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.998712} +{"loss": 0.72726554, "grad_norm": 1.38463879, "learning_rate": 2.328e-05, "token_acc": 0.77851352, "epoch": 1.23529412, "global_step/max_steps": "494/800", "percentage": "61.75%", "elapsed_time": "1h 38m 45s", "remaining_time": "1h 1m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.993229} +{"loss": 0.85284835, "grad_norm": 1.6975596, "learning_rate": 2.316e-05, "token_acc": 0.74812789, "epoch": 1.23779725, "global_step/max_steps": "495/800", "percentage": "61.88%", "elapsed_time": "1h 38m 53s", "remaining_time": "1h 0m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.986338} +{"loss": 0.83421814, "grad_norm": 1.28703547, "learning_rate": 2.304e-05, "token_acc": 0.75285115, "epoch": 1.24030038, "global_step/max_steps": "496/800", "percentage": "62.00%", "elapsed_time": "1h 39m 4s", "remaining_time": "1h 0m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.983488} +{"loss": 0.63876975, "grad_norm": 1.53096104, "learning_rate": 2.292e-05, "token_acc": 0.80622146, "epoch": 1.2428035, "global_step/max_steps": "497/800", "percentage": "62.12%", "elapsed_time": "1h 39m 11s", "remaining_time": "1h 0m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.972878} +{"loss": 0.70261085, "grad_norm": 1.84302413, "learning_rate": 2.279e-05, "token_acc": 0.78598336, "epoch": 1.24530663, "global_step/max_steps": "498/800", "percentage": "62.25%", "elapsed_time": "1h 39m 18s", "remaining_time": "1h 0m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.963263} +{"loss": 0.72438252, "grad_norm": 1.26437044, "learning_rate": 2.267e-05, "token_acc": 0.78187326, "epoch": 1.24780976, "global_step/max_steps": "499/800", "percentage": "62.38%", "elapsed_time": "1h 39m 25s", "remaining_time": "59m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.954233} +{"loss": 0.56382918, "grad_norm": 2.19495296, "learning_rate": 2.255e-05, "token_acc": 0.83039648, "epoch": 1.25031289, "global_step/max_steps": "500/800", "percentage": "62.50%", "elapsed_time": "1h 39m 32s", "remaining_time": "59m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.944672} +{"loss": 0.63883704, "grad_norm": 1.36421573, "learning_rate": 2.243e-05, "token_acc": 0.804769, "epoch": 1.25281602, "global_step/max_steps": "501/800", "percentage": "62.62%", "elapsed_time": "1h 39m 51s", "remaining_time": "59m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.958949} +{"loss": 0.86995304, "grad_norm": 1.40969169, "learning_rate": 2.231e-05, "token_acc": 0.7426747, "epoch": 1.25531915, "global_step/max_steps": "502/800", "percentage": "62.75%", "elapsed_time": "1h 40m 5s", "remaining_time": "59m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.961925} +{"loss": 0.9338131, "grad_norm": 0.67355222, "learning_rate": 2.218e-05, "token_acc": 0.72460691, "epoch": 1.25782228, "global_step/max_steps": "503/800", "percentage": "62.88%", "elapsed_time": "1h 40m 22s", "remaining_time": "59m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.972299} +{"loss": 0.6764394, "grad_norm": 3.08938527, "learning_rate": 2.206e-05, "token_acc": 0.79876816, "epoch": 1.26032541, "global_step/max_steps": "504/800", "percentage": "63.00%", "elapsed_time": "1h 40m 30s", "remaining_time": "59m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.963363} +{"loss": 0.74355346, "grad_norm": 1.21038008, "learning_rate": 2.194e-05, "token_acc": 0.77491551, "epoch": 1.26282854, "global_step/max_steps": "505/800", "percentage": "63.12%", "elapsed_time": "1h 40m 37s", "remaining_time": "58m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.95357} +{"loss": 0.65755522, "grad_norm": 1.65746534, "learning_rate": 2.182e-05, "token_acc": 0.7954854, "epoch": 1.26533166, "global_step/max_steps": "506/800", "percentage": "63.25%", "elapsed_time": "1h 40m 45s", "remaining_time": "58m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.946465} +{"loss": 0.69570291, "grad_norm": 3.25129461, "learning_rate": 2.17e-05, "token_acc": 0.79022237, "epoch": 1.26783479, "global_step/max_steps": "507/800", "percentage": "63.38%", "elapsed_time": "1h 40m 53s", "remaining_time": "58m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.938272} +{"loss": 0.81024575, "grad_norm": 1.64463806, "learning_rate": 2.157e-05, "token_acc": 0.75540842, "epoch": 1.27033792, "global_step/max_steps": "508/800", "percentage": "63.50%", "elapsed_time": "1h 41m 6s", "remaining_time": "58m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.941458} +{"loss": 0.79220361, "grad_norm": 2.26660872, "learning_rate": 2.145e-05, "token_acc": 0.75675408, "epoch": 1.27284105, "global_step/max_steps": "509/800", "percentage": "63.62%", "elapsed_time": "1h 41m 22s", "remaining_time": "57m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949116} +{"loss": 0.81828409, "grad_norm": 1.38235116, "learning_rate": 2.133e-05, "token_acc": 0.75974682, "epoch": 1.27534418, "global_step/max_steps": "510/800", "percentage": "63.75%", "elapsed_time": "1h 41m 32s", "remaining_time": "57m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.945649} +{"loss": 0.75875139, "grad_norm": 2.87513423, "learning_rate": 2.121e-05, "token_acc": 0.77626521, "epoch": 1.27784731, "global_step/max_steps": "511/800", "percentage": "63.88%", "elapsed_time": "1h 41m 53s", "remaining_time": "57m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.961931} +{"loss": 0.82855028, "grad_norm": 0.966129, "learning_rate": 2.109e-05, "token_acc": 0.75172564, "epoch": 1.28035044, "global_step/max_steps": "512/800", "percentage": "64.00%", "elapsed_time": "1h 42m 3s", "remaining_time": "57m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.958119} +{"loss": 0.8042497, "grad_norm": 0.88956302, "learning_rate": 2.097e-05, "token_acc": 0.75642454, "epoch": 1.28285357, "global_step/max_steps": "513/800", "percentage": "64.12%", "elapsed_time": "1h 42m 17s", "remaining_time": "57m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.962007} +{"loss": 0.76145452, "grad_norm": 1.15544665, "learning_rate": 2.085e-05, "token_acc": 0.77496713, "epoch": 1.2853567, "global_step/max_steps": "514/800", "percentage": "64.25%", "elapsed_time": "1h 42m 28s", "remaining_time": "57m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.960487} +{"loss": 0.85208553, "grad_norm": 2.68518186, "learning_rate": 2.073e-05, "token_acc": 0.74486735, "epoch": 1.28785982, "global_step/max_steps": "515/800", "percentage": "64.38%", "elapsed_time": "1h 42m 45s", "remaining_time": "56m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.971703} +{"loss": 0.79730213, "grad_norm": 1.07100618, "learning_rate": 2.061e-05, "token_acc": 0.76514576, "epoch": 1.29036295, "global_step/max_steps": "516/800", "percentage": "64.50%", "elapsed_time": "1h 42m 55s", "remaining_time": "56m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.967783} +{"loss": 0.87965363, "grad_norm": 1.72510874, "learning_rate": 2.048e-05, "token_acc": 0.73938039, "epoch": 1.29286608, "global_step/max_steps": "517/800", "percentage": "64.62%", "elapsed_time": "1h 43m 11s", "remaining_time": "56m 29s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.974747} +{"loss": 0.78605211, "grad_norm": 0.8552776, "learning_rate": 2.036e-05, "token_acc": 0.76197824, "epoch": 1.29536921, "global_step/max_steps": "518/800", "percentage": "64.75%", "elapsed_time": "1h 43m 32s", "remaining_time": "56m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.992904} +{"loss": 0.84277046, "grad_norm": 1.71972418, "learning_rate": 2.024e-05, "token_acc": 0.75288263, "epoch": 1.29787234, "global_step/max_steps": "519/800", "percentage": "64.88%", "elapsed_time": "1h 43m 42s", "remaining_time": "56m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.987895} +{"loss": 0.87217021, "grad_norm": 0.97581512, "learning_rate": 2.012e-05, "token_acc": 0.74315141, "epoch": 1.30037547, "global_step/max_steps": "520/800", "percentage": "65.00%", "elapsed_time": "1h 43m 56s", "remaining_time": "55m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.991744} +{"loss": 0.84193426, "grad_norm": 1.1684804, "learning_rate": 2e-05, "token_acc": 0.747132, "epoch": 1.3028786, "global_step/max_steps": "521/800", "percentage": "65.12%", "elapsed_time": "1h 44m 22s", "remaining_time": "55m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.019927} +{"loss": 0.79594243, "grad_norm": 1.22033989, "learning_rate": 1.988e-05, "token_acc": 0.76636979, "epoch": 1.30538173, "global_step/max_steps": "522/800", "percentage": "65.25%", "elapsed_time": "1h 44m 32s", "remaining_time": "55m 40s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.015318} +{"loss": 0.79190719, "grad_norm": 1.04089904, "learning_rate": 1.976e-05, "token_acc": 0.76512865, "epoch": 1.30788486, "global_step/max_steps": "523/800", "percentage": "65.38%", "elapsed_time": "1h 44m 41s", "remaining_time": "55m 27s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.010119} +{"loss": 0.8253305, "grad_norm": 1.3104341, "learning_rate": 1.964e-05, "token_acc": 0.75065127, "epoch": 1.31038798, "global_step/max_steps": "524/800", "percentage": "65.50%", "elapsed_time": "1h 44m 55s", "remaining_time": "55m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.013198} +{"loss": 0.72334349, "grad_norm": 1.04512429, "learning_rate": 1.952e-05, "token_acc": 0.78518201, "epoch": 1.31289111, "global_step/max_steps": "525/800", "percentage": "65.62%", "elapsed_time": "1h 45m 1s", "remaining_time": "55m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.002851} +{"loss": 0.82671893, "grad_norm": 2.08998299, "learning_rate": 1.94e-05, "token_acc": 0.75627817, "epoch": 1.31539424, "global_step/max_steps": "526/800", "percentage": "65.75%", "elapsed_time": "1h 45m 11s", "remaining_time": "54m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.99771} +{"loss": 0.82665473, "grad_norm": 1.25573123, "learning_rate": 1.928e-05, "token_acc": 0.75228405, "epoch": 1.31789737, "global_step/max_steps": "527/800", "percentage": "65.88%", "elapsed_time": "1h 45m 22s", "remaining_time": "54m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.99564} +{"loss": 0.85213929, "grad_norm": 1.71676254, "learning_rate": 1.916e-05, "token_acc": 0.75103953, "epoch": 1.3204005, "global_step/max_steps": "528/800", "percentage": "66.00%", "elapsed_time": "1h 45m 38s", "remaining_time": "54m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.004201} +{"loss": 0.86374027, "grad_norm": 1.0622139, "learning_rate": 1.904e-05, "token_acc": 0.73845043, "epoch": 1.32290363, "global_step/max_steps": "529/800", "percentage": "66.12%", "elapsed_time": "1h 45m 58s", "remaining_time": "54m 17s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.01809} +{"loss": 0.84802419, "grad_norm": 0.98130286, "learning_rate": 1.893e-05, "token_acc": 0.75363794, "epoch": 1.32540676, "global_step/max_steps": "530/800", "percentage": "66.25%", "elapsed_time": "1h 46m 8s", "remaining_time": "54m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.015799} +{"loss": 0.63974392, "grad_norm": 4.2845273, "learning_rate": 1.881e-05, "token_acc": 0.80373557, "epoch": 1.32790989, "global_step/max_steps": "531/800", "percentage": "66.38%", "elapsed_time": "1h 46m 27s", "remaining_time": "53m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.028156} +{"loss": 0.96189141, "grad_norm": 1.43761599, "learning_rate": 1.869e-05, "token_acc": 0.72022917, "epoch": 1.33041302, "global_step/max_steps": "532/800", "percentage": "66.50%", "elapsed_time": "1h 46m 41s", "remaining_time": "53m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.03287} +{"loss": 0.78626192, "grad_norm": 1.50959623, "learning_rate": 1.857e-05, "token_acc": 0.77093832, "epoch": 1.33291615, "global_step/max_steps": "533/800", "percentage": "66.62%", "elapsed_time": "1h 46m 51s", "remaining_time": "53m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.028829} +{"loss": 0.8777535, "grad_norm": 1.4545536, "learning_rate": 1.845e-05, "token_acc": 0.74143336, "epoch": 1.33541927, "global_step/max_steps": "534/800", "percentage": "66.75%", "elapsed_time": "1h 47m 4s", "remaining_time": "53m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.029775} +{"loss": 0.75433457, "grad_norm": 3.57525253, "learning_rate": 1.833e-05, "token_acc": 0.773071, "epoch": 1.3379224, "global_step/max_steps": "535/800", "percentage": "66.88%", "elapsed_time": "1h 47m 13s", "remaining_time": "53m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.024992} +{"loss": 0.83470041, "grad_norm": 0.9353689, "learning_rate": 1.821e-05, "token_acc": 0.74755841, "epoch": 1.34042553, "global_step/max_steps": "536/800", "percentage": "67.00%", "elapsed_time": "1h 47m 30s", "remaining_time": "52m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.033487} +{"loss": 0.82076806, "grad_norm": 4.2311635, "learning_rate": 1.81e-05, "token_acc": 0.75323555, "epoch": 1.34292866, "global_step/max_steps": "537/800", "percentage": "67.12%", "elapsed_time": "1h 47m 38s", "remaining_time": "52m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.025905} +{"loss": 0.71093875, "grad_norm": 6.46996641, "learning_rate": 1.798e-05, "token_acc": 0.78602788, "epoch": 1.34543179, "global_step/max_steps": "538/800", "percentage": "67.25%", "elapsed_time": "1h 47m 47s", "remaining_time": "52m 29s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.019944} +{"loss": 0.64619493, "grad_norm": 3.16304207, "learning_rate": 1.786e-05, "token_acc": 0.80173085, "epoch": 1.34793492, "global_step/max_steps": "539/800", "percentage": "67.38%", "elapsed_time": "1h 47m 55s", "remaining_time": "52m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.013152} +{"loss": 0.83272576, "grad_norm": 1.09825504, "learning_rate": 1.774e-05, "token_acc": 0.74950072, "epoch": 1.35043805, "global_step/max_steps": "540/800", "percentage": "67.50%", "elapsed_time": "1h 48m 3s", "remaining_time": "52m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.005747} +{"loss": 0.81711388, "grad_norm": 3.80260944, "learning_rate": 1.763e-05, "token_acc": 0.75665248, "epoch": 1.35294118, "global_step/max_steps": "541/800", "percentage": "67.62%", "elapsed_time": "1h 48m 26s", "remaining_time": "51m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.026165} +{"loss": 0.72693753, "grad_norm": 1.06549251, "learning_rate": 1.751e-05, "token_acc": 0.77614183, "epoch": 1.35544431, "global_step/max_steps": "542/800", "percentage": "67.75%", "elapsed_time": "1h 48m 36s", "remaining_time": "51m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.021439} +{"loss": 0.66080707, "grad_norm": 4.29576635, "learning_rate": 1.739e-05, "token_acc": 0.80015743, "epoch": 1.35794743, "global_step/max_steps": "543/800", "percentage": "67.88%", "elapsed_time": "1h 48m 43s", "remaining_time": "51m 27s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.01336} +{"loss": 0.7909624, "grad_norm": 8.24825859, "learning_rate": 1.727e-05, "token_acc": 0.76135034, "epoch": 1.36045056, "global_step/max_steps": "544/800", "percentage": "68.00%", "elapsed_time": "1h 48m 56s", "remaining_time": "51m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.015417} +{"loss": 0.76021767, "grad_norm": 1.11798346, "learning_rate": 1.716e-05, "token_acc": 0.77090246, "epoch": 1.36295369, "global_step/max_steps": "545/800", "percentage": "68.12%", "elapsed_time": "1h 49m 6s", "remaining_time": "51m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.011506} +{"loss": 0.67691338, "grad_norm": 2.3431406, "learning_rate": 1.704e-05, "token_acc": 0.79528302, "epoch": 1.36545682, "global_step/max_steps": "546/800", "percentage": "68.25%", "elapsed_time": "1h 49m 14s", "remaining_time": "50m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.00363} +{"loss": 0.81447518, "grad_norm": 4.37846136, "learning_rate": 1.693e-05, "token_acc": 0.75444331, "epoch": 1.36795995, "global_step/max_steps": "547/800", "percentage": "68.38%", "elapsed_time": "1h 49m 22s", "remaining_time": "50m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.997193} +{"loss": 0.81626624, "grad_norm": 1.71566463, "learning_rate": 1.681e-05, "token_acc": 0.75237688, "epoch": 1.37046308, "global_step/max_steps": "548/800", "percentage": "68.50%", "elapsed_time": "1h 49m 37s", "remaining_time": "50m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.000918} +{"loss": 0.73360264, "grad_norm": 1.51007533, "learning_rate": 1.669e-05, "token_acc": 0.78034344, "epoch": 1.37296621, "global_step/max_steps": "549/800", "percentage": "68.62%", "elapsed_time": "1h 49m 46s", "remaining_time": "50m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.996997} +{"loss": 0.7254256, "grad_norm": 1.94617033, "learning_rate": 1.658e-05, "token_acc": 0.78007438, "epoch": 1.37546934, "global_step/max_steps": "550/800", "percentage": "68.75%", "elapsed_time": "1h 49m 56s", "remaining_time": "49m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.993245} +{"loss": 0.80526549, "grad_norm": 1.16497934, "learning_rate": 1.646e-05, "token_acc": 0.75786719, "epoch": 1.37797247, "global_step/max_steps": "551/800", "percentage": "68.88%", "elapsed_time": "1h 50m 18s", "remaining_time": "49m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.010273} +{"loss": 0.83208942, "grad_norm": 1.02739131, "learning_rate": 1.635e-05, "token_acc": 0.75256198, "epoch": 1.38047559, "global_step/max_steps": "552/800", "percentage": "69.00%", "elapsed_time": "1h 50m 32s", "remaining_time": "49m 39s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.013711} +{"loss": 0.75132227, "grad_norm": 1.81131816, "learning_rate": 1.623e-05, "token_acc": 0.77295311, "epoch": 1.38297872, "global_step/max_steps": "553/800", "percentage": "69.12%", "elapsed_time": "1h 50m 40s", "remaining_time": "49m 26s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.007776} +{"loss": 0.7060101, "grad_norm": 2.53297353, "learning_rate": 1.612e-05, "token_acc": 0.78909741, "epoch": 1.38548185, "global_step/max_steps": "554/800", "percentage": "69.25%", "elapsed_time": "1h 50m 48s", "remaining_time": "49m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.99952} +{"loss": 0.88443083, "grad_norm": 1.98039532, "learning_rate": 1.6e-05, "token_acc": 0.73874831, "epoch": 1.38798498, "global_step/max_steps": "555/800", "percentage": "69.38%", "elapsed_time": "1h 51m 1s", "remaining_time": "49m 0s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.00199} +{"loss": 0.71066302, "grad_norm": 3.67059946, "learning_rate": 1.589e-05, "token_acc": 0.78113208, "epoch": 1.39048811, "global_step/max_steps": "556/800", "percentage": "69.50%", "elapsed_time": "1h 51m 11s", "remaining_time": "48m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.997366} +{"loss": 0.81092989, "grad_norm": 4.30074739, "learning_rate": 1.577e-05, "token_acc": 0.76260448, "epoch": 1.39299124, "global_step/max_steps": "557/800", "percentage": "69.62%", "elapsed_time": "1h 51m 20s", "remaining_time": "48m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.991993} +{"loss": 0.68851411, "grad_norm": 1.27141309, "learning_rate": 1.566e-05, "token_acc": 0.78831739, "epoch": 1.39549437, "global_step/max_steps": "558/800", "percentage": "69.75%", "elapsed_time": "1h 51m 27s", "remaining_time": "48m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.984013} +{"loss": 0.87516332, "grad_norm": 1.73597312, "learning_rate": 1.555e-05, "token_acc": 0.74081483, "epoch": 1.3979975, "global_step/max_steps": "559/800", "percentage": "69.88%", "elapsed_time": "1h 51m 37s", "remaining_time": "48m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.981143} +{"loss": 0.8209433, "grad_norm": 1.42164803, "learning_rate": 1.543e-05, "token_acc": 0.75752926, "epoch": 1.40050063, "global_step/max_steps": "560/800", "percentage": "70.00%", "elapsed_time": "1h 51m 50s", "remaining_time": "47m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.981475} +{"loss": 0.74815357, "grad_norm": 4.90617609, "learning_rate": 1.532e-05, "token_acc": 0.78051152, "epoch": 1.40300375, "global_step/max_steps": "561/800", "percentage": "70.12%", "elapsed_time": "1h 52m 9s", "remaining_time": "47m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.994463} +{"loss": 0.78897226, "grad_norm": 1.26793003, "learning_rate": 1.521e-05, "token_acc": 0.76890551, "epoch": 1.40550688, "global_step/max_steps": "562/800", "percentage": "70.25%", "elapsed_time": "1h 52m 22s", "remaining_time": "47m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.995656} +{"loss": 0.80804741, "grad_norm": 0.90839034, "learning_rate": 1.509e-05, "token_acc": 0.75997387, "epoch": 1.40801001, "global_step/max_steps": "563/800", "percentage": "70.38%", "elapsed_time": "1h 52m 32s", "remaining_time": "47m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.992835} +{"loss": 0.95972598, "grad_norm": 0.79369181, "learning_rate": 1.498e-05, "token_acc": 0.72081082, "epoch": 1.41051314, "global_step/max_steps": "564/800", "percentage": "70.50%", "elapsed_time": "1h 52m 48s", "remaining_time": "47m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.999524} +{"loss": 0.78041828, "grad_norm": 2.16893244, "learning_rate": 1.487e-05, "token_acc": 0.77240685, "epoch": 1.41301627, "global_step/max_steps": "565/800", "percentage": "70.62%", "elapsed_time": "1h 52m 56s", "remaining_time": "46m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.993166} +{"loss": 0.83935028, "grad_norm": 2.2347486, "learning_rate": 1.476e-05, "token_acc": 0.75033786, "epoch": 1.4155194, "global_step/max_steps": "566/800", "percentage": "70.75%", "elapsed_time": "1h 53m 13s", "remaining_time": "46m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.001624} +{"loss": 0.71553814, "grad_norm": 1.6056354, "learning_rate": 1.465e-05, "token_acc": 0.78726176, "epoch": 1.41802253, "global_step/max_steps": "567/800", "percentage": "70.88%", "elapsed_time": "1h 53m 23s", "remaining_time": "46m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.998914} +{"loss": 0.7572217, "grad_norm": 1.452209, "learning_rate": 1.453e-05, "token_acc": 0.77139267, "epoch": 1.42052566, "global_step/max_steps": "568/800", "percentage": "71.00%", "elapsed_time": "1h 53m 34s", "remaining_time": "46m 23s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.997089} +{"loss": 0.85635698, "grad_norm": 1.96925187, "learning_rate": 1.442e-05, "token_acc": 0.74705369, "epoch": 1.42302879, "global_step/max_steps": "569/800", "percentage": "71.12%", "elapsed_time": "1h 53m 50s", "remaining_time": "46m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.004247} +{"loss": 0.79749215, "grad_norm": 10.90882587, "learning_rate": 1.431e-05, "token_acc": 0.76059436, "epoch": 1.42553191, "global_step/max_steps": "570/800", "percentage": "71.25%", "elapsed_time": "1h 54m 3s", "remaining_time": "46m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.005723} +{"loss": 0.76668453, "grad_norm": 1.17463791, "learning_rate": 1.42e-05, "token_acc": 0.77097902, "epoch": 1.42803504, "global_step/max_steps": "571/800", "percentage": "71.38%", "elapsed_time": "1h 54m 23s", "remaining_time": "45m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.019354} +{"loss": 0.73503441, "grad_norm": 1.0229063, "learning_rate": 1.409e-05, "token_acc": 0.77869115, "epoch": 1.43053817, "global_step/max_steps": "572/800", "percentage": "71.50%", "elapsed_time": "1h 54m 34s", "remaining_time": "45m 40s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.016867} +{"loss": 0.67546743, "grad_norm": 0.98912686, "learning_rate": 1.398e-05, "token_acc": 0.79437114, "epoch": 1.4330413, "global_step/max_steps": "573/800", "percentage": "71.62%", "elapsed_time": "1h 54m 43s", "remaining_time": "45m 27s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.012532} +{"loss": 0.80306733, "grad_norm": 1.23188639, "learning_rate": 1.387e-05, "token_acc": 0.76354716, "epoch": 1.43554443, "global_step/max_steps": "574/800", "percentage": "71.75%", "elapsed_time": "1h 54m 50s", "remaining_time": "45m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.003739} +{"loss": 0.85480648, "grad_norm": 1.0724684, "learning_rate": 1.376e-05, "token_acc": 0.74610312, "epoch": 1.43804756, "global_step/max_steps": "575/800", "percentage": "71.88%", "elapsed_time": "1h 55m 7s", "remaining_time": "45m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.012711} +{"loss": 0.81260943, "grad_norm": 1.57383382, "learning_rate": 1.365e-05, "token_acc": 0.76112742, "epoch": 1.44055069, "global_step/max_steps": "576/800", "percentage": "72.00%", "elapsed_time": "1h 55m 18s", "remaining_time": "44m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.011018} +{"loss": 0.82090867, "grad_norm": 1.49016023, "learning_rate": 1.354e-05, "token_acc": 0.75507514, "epoch": 1.44305382, "global_step/max_steps": "577/800", "percentage": "72.12%", "elapsed_time": "1h 55m 28s", "remaining_time": "44m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.007238} +{"loss": 0.65774167, "grad_norm": 1.68481696, "learning_rate": 1.343e-05, "token_acc": 0.80338955, "epoch": 1.44555695, "global_step/max_steps": "578/800", "percentage": "72.25%", "elapsed_time": "1h 55m 40s", "remaining_time": "44m 26s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.007098} +{"loss": 0.65312248, "grad_norm": 3.01622391, "learning_rate": 1.332e-05, "token_acc": 0.80581214, "epoch": 1.44806008, "global_step/max_steps": "579/800", "percentage": "72.38%", "elapsed_time": "1h 55m 47s", "remaining_time": "44m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.998149} +{"loss": 0.76470023, "grad_norm": 1.97958255, "learning_rate": 1.322e-05, "token_acc": 0.77521193, "epoch": 1.4505632, "global_step/max_steps": "580/800", "percentage": "72.50%", "elapsed_time": "1h 55m 57s", "remaining_time": "43m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.994419} +{"loss": 0.73987317, "grad_norm": 2.14091182, "learning_rate": 1.311e-05, "token_acc": 0.7717614, "epoch": 1.45306633, "global_step/max_steps": "581/800", "percentage": "72.62%", "elapsed_time": "1h 56m 15s", "remaining_time": "43m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.005531} +{"loss": 0.92198706, "grad_norm": 1.29594183, "learning_rate": 1.3e-05, "token_acc": 0.7350044, "epoch": 1.45556946, "global_step/max_steps": "582/800", "percentage": "72.75%", "elapsed_time": "1h 56m 29s", "remaining_time": "43m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.008516} +{"loss": 0.65511829, "grad_norm": 3.88142562, "learning_rate": 1.289e-05, "token_acc": 0.80015477, "epoch": 1.45807259, "global_step/max_steps": "583/800", "percentage": "72.88%", "elapsed_time": "1h 56m 37s", "remaining_time": "43m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.001097} +{"loss": 0.85790032, "grad_norm": 0.68414372, "learning_rate": 1.278e-05, "token_acc": 0.74279143, "epoch": 1.46057572, "global_step/max_steps": "584/800", "percentage": "73.00%", "elapsed_time": "1h 56m 55s", "remaining_time": "43m 15s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.011915} +{"loss": 0.73058617, "grad_norm": 2.33936453, "learning_rate": 1.268e-05, "token_acc": 0.78154548, "epoch": 1.46307885, "global_step/max_steps": "585/800", "percentage": "73.12%", "elapsed_time": "1h 57m 6s", "remaining_time": "43m 2s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.010369} +{"loss": 0.73564732, "grad_norm": 1.28746259, "learning_rate": 1.257e-05, "token_acc": 0.77394035, "epoch": 1.46558198, "global_step/max_steps": "586/800", "percentage": "73.25%", "elapsed_time": "1h 57m 14s", "remaining_time": "42m 49s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.003773} +{"loss": 0.82732654, "grad_norm": 1.09974885, "learning_rate": 1.246e-05, "token_acc": 0.75104888, "epoch": 1.46808511, "global_step/max_steps": "587/800", "percentage": "73.38%", "elapsed_time": "1h 57m 27s", "remaining_time": "42m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.004354} +{"loss": 0.6755957, "grad_norm": 2.91533542, "learning_rate": 1.236e-05, "token_acc": 0.79060524, "epoch": 1.47058824, "global_step/max_steps": "588/800", "percentage": "73.50%", "elapsed_time": "1h 57m 34s", "remaining_time": "42m 23s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.997414} +{"loss": 0.73063248, "grad_norm": 1.66334713, "learning_rate": 1.225e-05, "token_acc": 0.78064008, "epoch": 1.47309136, "global_step/max_steps": "589/800", "percentage": "73.62%", "elapsed_time": "1h 57m 46s", "remaining_time": "42m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.995771} +{"loss": 0.67032063, "grad_norm": 2.1273315, "learning_rate": 1.215e-05, "token_acc": 0.79759058, "epoch": 1.47559449, "global_step/max_steps": "590/800", "percentage": "73.75%", "elapsed_time": "1h 57m 56s", "remaining_time": "41m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.993811} +{"loss": 0.74965799, "grad_norm": 1.46365547, "learning_rate": 1.204e-05, "token_acc": 0.77425792, "epoch": 1.47809762, "global_step/max_steps": "591/800", "percentage": "73.88%", "elapsed_time": "1h 58m 19s", "remaining_time": "41m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.011816} +{"loss": 0.64057392, "grad_norm": 2.0527308, "learning_rate": 1.194e-05, "token_acc": 0.80549558, "epoch": 1.48060075, "global_step/max_steps": "592/800", "percentage": "74.00%", "elapsed_time": "1h 58m 27s", "remaining_time": "41m 37s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.004785} +{"loss": 0.7799682, "grad_norm": 1.23441708, "learning_rate": 1.183e-05, "token_acc": 0.76645611, "epoch": 1.48310388, "global_step/max_steps": "593/800", "percentage": "74.12%", "elapsed_time": "1h 58m 42s", "remaining_time": "41m 26s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.009762} +{"loss": 0.80713701, "grad_norm": 5.45907021, "learning_rate": 1.173e-05, "token_acc": 0.76174168, "epoch": 1.48560701, "global_step/max_steps": "594/800", "percentage": "74.25%", "elapsed_time": "1h 58m 52s", "remaining_time": "41m 13s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.006755} +{"loss": 0.72956431, "grad_norm": 1.06947315, "learning_rate": 1.163e-05, "token_acc": 0.77647691, "epoch": 1.48811014, "global_step/max_steps": "595/800", "percentage": "74.38%", "elapsed_time": "1h 59m 3s", "remaining_time": "41m 1s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.00451} +{"loss": 0.6706807, "grad_norm": 3.88446164, "learning_rate": 1.152e-05, "token_acc": 0.79917222, "epoch": 1.49061327, "global_step/max_steps": "596/800", "percentage": "74.50%", "elapsed_time": "1h 59m 9s", "remaining_time": "40m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.994392} +{"loss": 0.8247233, "grad_norm": 5.00419903, "learning_rate": 1.142e-05, "token_acc": 0.75187778, "epoch": 1.4931164, "global_step/max_steps": "597/800", "percentage": "74.62%", "elapsed_time": "1h 59m 25s", "remaining_time": "40m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.001223} +{"loss": 0.88943815, "grad_norm": 3.07309341, "learning_rate": 1.132e-05, "token_acc": 0.7409201, "epoch": 1.49561952, "global_step/max_steps": "598/800", "percentage": "74.75%", "elapsed_time": "1h 59m 36s", "remaining_time": "40m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.000523} +{"loss": 0.71524978, "grad_norm": 1.28749108, "learning_rate": 1.121e-05, "token_acc": 0.78032668, "epoch": 1.49812265, "global_step/max_steps": "599/800", "percentage": "74.88%", "elapsed_time": "1h 59m 43s", "remaining_time": "40m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.99248} +{"loss": 0.77007186, "grad_norm": 1.24643481, "learning_rate": 1.111e-05, "token_acc": 0.76701875, "epoch": 1.50062578, "global_step/max_steps": "600/800", "percentage": "75.00%", "elapsed_time": "1h 59m 59s", "remaining_time": "39m 60s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.99811} +{"loss": 0.75479579, "grad_norm": 3.6714983, "learning_rate": 1.101e-05, "token_acc": 0.77342268, "epoch": 1.50312891, "global_step/max_steps": "601/800", "percentage": "75.12%", "elapsed_time": "2h 0m 20s", "remaining_time": "39m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.013448} +{"loss": 0.89197922, "grad_norm": 0.84848034, "learning_rate": 1.091e-05, "token_acc": 0.73934009, "epoch": 1.50563204, "global_step/max_steps": "602/800", "percentage": "75.25%", "elapsed_time": "2h 0m 30s", "remaining_time": "39m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.010668} +{"loss": 0.77028626, "grad_norm": 13.48874378, "learning_rate": 1.081e-05, "token_acc": 0.7727466, "epoch": 1.50813517, "global_step/max_steps": "603/800", "percentage": "75.38%", "elapsed_time": "2h 0m 42s", "remaining_time": "39m 26s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.009922} +{"loss": 0.75954044, "grad_norm": 1.96190214, "learning_rate": 1.071e-05, "token_acc": 0.77024513, "epoch": 1.5106383, "global_step/max_steps": "604/800", "percentage": "75.50%", "elapsed_time": "2h 0m 49s", "remaining_time": "39m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.00163} +{"loss": 0.69952142, "grad_norm": 27.53681755, "learning_rate": 1.06e-05, "token_acc": 0.78766338, "epoch": 1.51314143, "global_step/max_steps": "605/800", "percentage": "75.62%", "elapsed_time": "2h 0m 56s", "remaining_time": "38m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.993688} +{"loss": 0.90051973, "grad_norm": 0.83320826, "learning_rate": 1.05e-05, "token_acc": 0.73759651, "epoch": 1.51564456, "global_step/max_steps": "606/800", "percentage": "75.75%", "elapsed_time": "2h 1m 13s", "remaining_time": "38m 48s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.001302} +{"loss": 0.83860248, "grad_norm": 0.82330155, "learning_rate": 1.04e-05, "token_acc": 0.74700954, "epoch": 1.51814768, "global_step/max_steps": "607/800", "percentage": "75.88%", "elapsed_time": "2h 1m 25s", "remaining_time": "38m 36s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.00153} +{"loss": 0.79298848, "grad_norm": 1.19435489, "learning_rate": 1.031e-05, "token_acc": 0.7622806, "epoch": 1.52065081, "global_step/max_steps": "608/800", "percentage": "76.00%", "elapsed_time": "2h 1m 36s", "remaining_time": "38m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.000693} +{"loss": 0.80124831, "grad_norm": 0.80962467, "learning_rate": 1.021e-05, "token_acc": 0.75537283, "epoch": 1.52315394, "global_step/max_steps": "609/800", "percentage": "76.12%", "elapsed_time": "2h 1m 49s", "remaining_time": "38m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.002319} +{"loss": 0.61713803, "grad_norm": 1.06104541, "learning_rate": 1.011e-05, "token_acc": 0.81593015, "epoch": 1.52565707, "global_step/max_steps": "610/800", "percentage": "76.25%", "elapsed_time": "2h 1m 59s", "remaining_time": "37m 60s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.9976} +{"loss": 0.65010059, "grad_norm": 18.28238297, "learning_rate": 1.001e-05, "token_acc": 0.79786549, "epoch": 1.5281602, "global_step/max_steps": "611/800", "percentage": "76.38%", "elapsed_time": "2h 2m 18s", "remaining_time": "37m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.009425} +{"loss": 0.76201242, "grad_norm": 3.44666767, "learning_rate": 9.91e-06, "token_acc": 0.77110201, "epoch": 1.53066333, "global_step/max_steps": "612/800", "percentage": "76.50%", "elapsed_time": "2h 2m 30s", "remaining_time": "37m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.009662} +{"loss": 0.66028887, "grad_norm": 1.25298131, "learning_rate": 9.81e-06, "token_acc": 0.80088009, "epoch": 1.53316646, "global_step/max_steps": "613/800", "percentage": "76.62%", "elapsed_time": "2h 2m 38s", "remaining_time": "37m 25s", "memory(GiB)": 72.42, "train_speed(s/it)": 12.003555} +{"loss": 0.84345341, "grad_norm": 1.17232347, "learning_rate": 9.72e-06, "token_acc": 0.74944399, "epoch": 1.53566959, "global_step/max_steps": "614/800", "percentage": "76.75%", "elapsed_time": "2h 2m 46s", "remaining_time": "37m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.997189} +{"loss": 0.74423879, "grad_norm": 1.74715149, "learning_rate": 9.62e-06, "token_acc": 0.77453514, "epoch": 1.53817272, "global_step/max_steps": "615/800", "percentage": "76.88%", "elapsed_time": "2h 2m 53s", "remaining_time": "36m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.988425} +{"loss": 0.73172939, "grad_norm": 1.00211465, "learning_rate": 9.52e-06, "token_acc": 0.77344122, "epoch": 1.54067584, "global_step/max_steps": "616/800", "percentage": "77.00%", "elapsed_time": "2h 3m 1s", "remaining_time": "36m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.98162} +{"loss": 0.70324028, "grad_norm": 1.33370686, "learning_rate": 9.43e-06, "token_acc": 0.7877115, "epoch": 1.54317897, "global_step/max_steps": "617/800", "percentage": "77.12%", "elapsed_time": "2h 3m 10s", "remaining_time": "36m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.977775} +{"loss": 0.7973721, "grad_norm": 1.36764681, "learning_rate": 9.33e-06, "token_acc": 0.76037615, "epoch": 1.5456821, "global_step/max_steps": "618/800", "percentage": "77.25%", "elapsed_time": "2h 3m 23s", "remaining_time": "36m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.979148} +{"loss": 0.81501853, "grad_norm": 3.2059834, "learning_rate": 9.24e-06, "token_acc": 0.75566321, "epoch": 1.54818523, "global_step/max_steps": "619/800", "percentage": "77.38%", "elapsed_time": "2h 3m 33s", "remaining_time": "36m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.975835} +{"loss": 0.78220868, "grad_norm": 4.08630657, "learning_rate": 9.14e-06, "token_acc": 0.76754541, "epoch": 1.55068836, "global_step/max_steps": "620/800", "percentage": "77.50%", "elapsed_time": "2h 3m 43s", "remaining_time": "35m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.972201} +{"loss": 0.82207155, "grad_norm": 1.20402491, "learning_rate": 9.05e-06, "token_acc": 0.75248042, "epoch": 1.55319149, "global_step/max_steps": "621/800", "percentage": "77.62%", "elapsed_time": "2h 4m 7s", "remaining_time": "35m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.991669} +{"loss": 0.61375988, "grad_norm": 1.4175061, "learning_rate": 8.95e-06, "token_acc": 0.81195117, "epoch": 1.55569462, "global_step/max_steps": "622/800", "percentage": "77.75%", "elapsed_time": "2h 4m 13s", "remaining_time": "35m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.98273} +{"loss": 0.67292964, "grad_norm": 1.299209, "learning_rate": 8.86e-06, "token_acc": 0.79884443, "epoch": 1.55819775, "global_step/max_steps": "623/800", "percentage": "77.88%", "elapsed_time": "2h 4m 19s", "remaining_time": "35m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.973212} +{"loss": 0.81891024, "grad_norm": 1.40791905, "learning_rate": 8.76e-06, "token_acc": 0.75770232, "epoch": 1.56070088, "global_step/max_steps": "624/800", "percentage": "78.00%", "elapsed_time": "2h 4m 28s", "remaining_time": "35m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.968142} +{"loss": 0.83623642, "grad_norm": 1.27923608, "learning_rate": 8.67e-06, "token_acc": 0.74820248, "epoch": 1.56320401, "global_step/max_steps": "625/800", "percentage": "78.12%", "elapsed_time": "2h 4m 41s", "remaining_time": "34m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.969152} +{"loss": 0.80984628, "grad_norm": 1.28631639, "learning_rate": 8.58e-06, "token_acc": 0.75932691, "epoch": 1.56570713, "global_step/max_steps": "626/800", "percentage": "78.25%", "elapsed_time": "2h 4m 51s", "remaining_time": "34m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.965862} +{"loss": 0.70637953, "grad_norm": 27.66785431, "learning_rate": 8.49e-06, "token_acc": 0.78679469, "epoch": 1.56821026, "global_step/max_steps": "627/800", "percentage": "78.38%", "elapsed_time": "2h 4m 60s", "remaining_time": "34m 29s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.961655} +{"loss": 0.64622879, "grad_norm": 4.92878294, "learning_rate": 8.39e-06, "token_acc": 0.80111557, "epoch": 1.57071339, "global_step/max_steps": "628/800", "percentage": "78.50%", "elapsed_time": "2h 5m 7s", "remaining_time": "34m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.953644} +{"loss": 0.67835248, "grad_norm": 1.96023548, "learning_rate": 8.3e-06, "token_acc": 0.79023088, "epoch": 1.57321652, "global_step/max_steps": "629/800", "percentage": "78.62%", "elapsed_time": "2h 5m 15s", "remaining_time": "34m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.947277} +{"loss": 0.8049258, "grad_norm": 16.4473877, "learning_rate": 8.21e-06, "token_acc": 0.75706871, "epoch": 1.57571965, "global_step/max_steps": "630/800", "percentage": "78.75%", "elapsed_time": "2h 5m 22s", "remaining_time": "33m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.939085} +{"loss": 0.88832366, "grad_norm": 1.37889886, "learning_rate": 8.12e-06, "token_acc": 0.73347133, "epoch": 1.57822278, "global_step/max_steps": "631/800", "percentage": "78.88%", "elapsed_time": "2h 5m 51s", "remaining_time": "33m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.966707} +{"loss": 0.63753629, "grad_norm": 1.83356547, "learning_rate": 8.03e-06, "token_acc": 0.81536489, "epoch": 1.58072591, "global_step/max_steps": "632/800", "percentage": "79.00%", "elapsed_time": "2h 5m 59s", "remaining_time": "33m 29s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.960438} +{"loss": 0.60499024, "grad_norm": 1.90149677, "learning_rate": 7.94e-06, "token_acc": 0.81616498, "epoch": 1.58322904, "global_step/max_steps": "633/800", "percentage": "79.12%", "elapsed_time": "2h 6m 9s", "remaining_time": "33m 17s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.956706} +{"loss": 0.69884479, "grad_norm": 1.37131131, "learning_rate": 7.85e-06, "token_acc": 0.78803434, "epoch": 1.58573217, "global_step/max_steps": "634/800", "percentage": "79.25%", "elapsed_time": "2h 6m 15s", "remaining_time": "33m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.94771} +{"loss": 0.70155662, "grad_norm": 2.09899354, "learning_rate": 7.76e-06, "token_acc": 0.78679389, "epoch": 1.58823529, "global_step/max_steps": "635/800", "percentage": "79.38%", "elapsed_time": "2h 6m 22s", "remaining_time": "32m 50s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.940672} +{"loss": 0.7713179, "grad_norm": 2.81940937, "learning_rate": 7.67e-06, "token_acc": 0.76649396, "epoch": 1.59073842, "global_step/max_steps": "636/800", "percentage": "79.50%", "elapsed_time": "2h 6m 34s", "remaining_time": "32m 38s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.94084} +{"loss": 0.81529784, "grad_norm": 2.27564096, "learning_rate": 7.58e-06, "token_acc": 0.75657425, "epoch": 1.59324155, "global_step/max_steps": "637/800", "percentage": "79.62%", "elapsed_time": "2h 6m 51s", "remaining_time": "32m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.948814} +{"loss": 0.60492921, "grad_norm": 2.16027975, "learning_rate": 7.5e-06, "token_acc": 0.82494401, "epoch": 1.59574468, "global_step/max_steps": "638/800", "percentage": "79.75%", "elapsed_time": "2h 6m 58s", "remaining_time": "32m 14s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.940285} +{"loss": 0.92769039, "grad_norm": 11.16128349, "learning_rate": 7.41e-06, "token_acc": 0.72896907, "epoch": 1.59824781, "global_step/max_steps": "639/800", "percentage": "79.88%", "elapsed_time": "2h 7m 14s", "remaining_time": "32m 3s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.947122} +{"loss": 0.72898626, "grad_norm": 1.10701692, "learning_rate": 7.32e-06, "token_acc": 0.77622551, "epoch": 1.60075094, "global_step/max_steps": "640/800", "percentage": "80.00%", "elapsed_time": "2h 7m 25s", "remaining_time": "31m 51s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.945582} +{"loss": 0.80301559, "grad_norm": 1.38421869, "learning_rate": 7.24e-06, "token_acc": 0.76032616, "epoch": 1.60325407, "global_step/max_steps": "641/800", "percentage": "80.12%", "elapsed_time": "2h 7m 47s", "remaining_time": "31m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.961119} +{"loss": 0.82398951, "grad_norm": 2.43199921, "learning_rate": 7.15e-06, "token_acc": 0.7537327, "epoch": 1.6057572, "global_step/max_steps": "642/800", "percentage": "80.25%", "elapsed_time": "2h 8m 3s", "remaining_time": "31m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.967007} +{"loss": 0.94587052, "grad_norm": 1.77131152, "learning_rate": 7.06e-06, "token_acc": 0.72231848, "epoch": 1.60826033, "global_step/max_steps": "643/800", "percentage": "80.38%", "elapsed_time": "2h 8m 20s", "remaining_time": "31m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.974527} +{"loss": 0.87670141, "grad_norm": 1.18254375, "learning_rate": 6.98e-06, "token_acc": 0.73813484, "epoch": 1.61076345, "global_step/max_steps": "644/800", "percentage": "80.50%", "elapsed_time": "2h 8m 36s", "remaining_time": "31m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.981323} +{"loss": 0.77276707, "grad_norm": 9.37711334, "learning_rate": 6.89e-06, "token_acc": 0.76670013, "epoch": 1.61326658, "global_step/max_steps": "645/800", "percentage": "80.62%", "elapsed_time": "2h 8m 45s", "remaining_time": "30m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.977445} +{"loss": 0.72517282, "grad_norm": 1.62122667, "learning_rate": 6.81e-06, "token_acc": 0.78530436, "epoch": 1.61576971, "global_step/max_steps": "646/800", "percentage": "80.75%", "elapsed_time": "2h 8m 53s", "remaining_time": "30m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.970767} +{"loss": 0.87855619, "grad_norm": 1.09102154, "learning_rate": 6.73e-06, "token_acc": 0.73883085, "epoch": 1.61827284, "global_step/max_steps": "647/800", "percentage": "80.88%", "elapsed_time": "2h 9m 8s", "remaining_time": "30m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.975635} +{"loss": 0.74881506, "grad_norm": 2.23651624, "learning_rate": 6.64e-06, "token_acc": 0.77350176, "epoch": 1.62077597, "global_step/max_steps": "648/800", "percentage": "81.00%", "elapsed_time": "2h 9m 17s", "remaining_time": "30m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.971183} +{"loss": 0.61639798, "grad_norm": 2.12863111, "learning_rate": 6.56e-06, "token_acc": 0.81086269, "epoch": 1.6232791, "global_step/max_steps": "649/800", "percentage": "81.12%", "elapsed_time": "2h 9m 23s", "remaining_time": "30m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.961475} +{"loss": 0.82078093, "grad_norm": 1.34680259, "learning_rate": 6.48e-06, "token_acc": 0.75709139, "epoch": 1.62578223, "global_step/max_steps": "650/800", "percentage": "81.25%", "elapsed_time": "2h 9m 34s", "remaining_time": "29m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.960503} +{"loss": 0.81865025, "grad_norm": 3.46003032, "learning_rate": 6.39e-06, "token_acc": 0.75486245, "epoch": 1.62828536, "global_step/max_steps": "651/800", "percentage": "81.38%", "elapsed_time": "2h 9m 53s", "remaining_time": "29m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.971205} +{"loss": 0.63051414, "grad_norm": 3.59186673, "learning_rate": 6.31e-06, "token_acc": 0.80723359, "epoch": 1.63078849, "global_step/max_steps": "652/800", "percentage": "81.50%", "elapsed_time": "2h 10m 1s", "remaining_time": "29m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.964956} +{"loss": 0.72533047, "grad_norm": 1.08061051, "learning_rate": 6.23e-06, "token_acc": 0.78339504, "epoch": 1.63329161, "global_step/max_steps": "653/800", "percentage": "81.62%", "elapsed_time": "2h 10m 10s", "remaining_time": "29m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.960501} +{"loss": 0.85484511, "grad_norm": 1.28858519, "learning_rate": 6.15e-06, "token_acc": 0.74644749, "epoch": 1.63579474, "global_step/max_steps": "654/800", "percentage": "81.75%", "elapsed_time": "2h 10m 19s", "remaining_time": "29m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.95576} +{"loss": 0.83822608, "grad_norm": 1.06456947, "learning_rate": 6.07e-06, "token_acc": 0.74895574, "epoch": 1.63829787, "global_step/max_steps": "655/800", "percentage": "81.88%", "elapsed_time": "2h 10m 29s", "remaining_time": "28m 53s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.952048} +{"loss": 0.77235365, "grad_norm": 1.9353832, "learning_rate": 5.99e-06, "token_acc": 0.76943277, "epoch": 1.640801, "global_step/max_steps": "656/800", "percentage": "82.00%", "elapsed_time": "2h 10m 38s", "remaining_time": "28m 40s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.947688} +{"loss": 0.88569796, "grad_norm": 4.82845211, "learning_rate": 5.91e-06, "token_acc": 0.73821836, "epoch": 1.64330413, "global_step/max_steps": "657/800", "percentage": "82.12%", "elapsed_time": "2h 10m 54s", "remaining_time": "28m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.955008} +{"loss": 0.77381653, "grad_norm": 1.87812781, "learning_rate": 5.83e-06, "token_acc": 0.76880552, "epoch": 1.64580726, "global_step/max_steps": "658/800", "percentage": "82.25%", "elapsed_time": "2h 11m 9s", "remaining_time": "28m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.959573} +{"loss": 0.81338036, "grad_norm": 3.02463317, "learning_rate": 5.75e-06, "token_acc": 0.76113782, "epoch": 1.64831039, "global_step/max_steps": "659/800", "percentage": "82.38%", "elapsed_time": "2h 11m 17s", "remaining_time": "28m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.953496} +{"loss": 0.76475781, "grad_norm": 1.39943194, "learning_rate": 5.67e-06, "token_acc": 0.77032291, "epoch": 1.65081352, "global_step/max_steps": "660/800", "percentage": "82.50%", "elapsed_time": "2h 11m 28s", "remaining_time": "27m 53s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.951911} +{"loss": 0.73040313, "grad_norm": 2.36118531, "learning_rate": 5.6e-06, "token_acc": 0.78416186, "epoch": 1.65331665, "global_step/max_steps": "661/800", "percentage": "82.62%", "elapsed_time": "2h 11m 47s", "remaining_time": "27m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.962456} +{"loss": 0.72378463, "grad_norm": 0.85260707, "learning_rate": 5.52e-06, "token_acc": 0.7868934, "epoch": 1.65581977, "global_step/max_steps": "662/800", "percentage": "82.75%", "elapsed_time": "2h 12m 1s", "remaining_time": "27m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.96532} +{"loss": 0.60911852, "grad_norm": 1.58817136, "learning_rate": 5.44e-06, "token_acc": 0.81408394, "epoch": 1.6583229, "global_step/max_steps": "663/800", "percentage": "82.88%", "elapsed_time": "2h 12m 8s", "remaining_time": "27m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.958037} +{"loss": 0.64133161, "grad_norm": 5.09730291, "learning_rate": 5.37e-06, "token_acc": 0.80497024, "epoch": 1.66082603, "global_step/max_steps": "664/800", "percentage": "83.00%", "elapsed_time": "2h 12m 15s", "remaining_time": "27m 5s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949735} +{"loss": 0.6981616, "grad_norm": 1.41853094, "learning_rate": 5.29e-06, "token_acc": 0.79252782, "epoch": 1.66332916, "global_step/max_steps": "665/800", "percentage": "83.12%", "elapsed_time": "2h 12m 26s", "remaining_time": "26m 53s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949579} +{"loss": 0.69072264, "grad_norm": 1.98518097, "learning_rate": 5.22e-06, "token_acc": 0.79128545, "epoch": 1.66583229, "global_step/max_steps": "666/800", "percentage": "83.25%", "elapsed_time": "2h 12m 35s", "remaining_time": "26m 41s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.944237} +{"loss": 0.8563956, "grad_norm": 0.94788808, "learning_rate": 5.14e-06, "token_acc": 0.7468873, "epoch": 1.66833542, "global_step/max_steps": "667/800", "percentage": "83.38%", "elapsed_time": "2h 12m 43s", "remaining_time": "26m 28s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.938816} +{"loss": 0.80589837, "grad_norm": 3.04362488, "learning_rate": 5.07e-06, "token_acc": 0.75528216, "epoch": 1.67083855, "global_step/max_steps": "668/800", "percentage": "83.50%", "elapsed_time": "2h 12m 56s", "remaining_time": "26m 16s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.939991} +{"loss": 0.80228257, "grad_norm": 0.84289759, "learning_rate": 4.99e-06, "token_acc": 0.76138614, "epoch": 1.67334168, "global_step/max_steps": "669/800", "percentage": "83.62%", "elapsed_time": "2h 13m 6s", "remaining_time": "26m 4s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.937532} +{"loss": 0.81008416, "grad_norm": 4.84092426, "learning_rate": 4.92e-06, "token_acc": 0.75541667, "epoch": 1.67584481, "global_step/max_steps": "670/800", "percentage": "83.75%", "elapsed_time": "2h 13m 21s", "remaining_time": "25m 52s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.941311} +{"loss": 0.82603765, "grad_norm": 1.15054131, "learning_rate": 4.85e-06, "token_acc": 0.74486195, "epoch": 1.67834793, "global_step/max_steps": "671/800", "percentage": "83.88%", "elapsed_time": "2h 13m 42s", "remaining_time": "25m 42s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.955007} +{"loss": 0.86007035, "grad_norm": 0.90721935, "learning_rate": 4.77e-06, "token_acc": 0.74448523, "epoch": 1.68085106, "global_step/max_steps": "672/800", "percentage": "84.00%", "elapsed_time": "2h 14m 4s", "remaining_time": "25m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.970524} +{"loss": 0.69268161, "grad_norm": 1.76836109, "learning_rate": 4.7e-06, "token_acc": 0.78062385, "epoch": 1.68335419, "global_step/max_steps": "673/800", "percentage": "84.12%", "elapsed_time": "2h 14m 16s", "remaining_time": "25m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.970726} +{"loss": 0.76624811, "grad_norm": 1.46119547, "learning_rate": 4.63e-06, "token_acc": 0.76714496, "epoch": 1.68585732, "global_step/max_steps": "674/800", "percentage": "84.25%", "elapsed_time": "2h 14m 24s", "remaining_time": "25m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.965034} +{"loss": 0.74054796, "grad_norm": 3.3718555, "learning_rate": 4.56e-06, "token_acc": 0.77504202, "epoch": 1.68836045, "global_step/max_steps": "675/800", "percentage": "84.38%", "elapsed_time": "2h 14m 32s", "remaining_time": "24m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.957888} +{"loss": 0.86103129, "grad_norm": 2.94794106, "learning_rate": 4.49e-06, "token_acc": 0.74248752, "epoch": 1.69086358, "global_step/max_steps": "676/800", "percentage": "84.50%", "elapsed_time": "2h 14m 44s", "remaining_time": "24m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.959027} +{"loss": 0.78885317, "grad_norm": 13.50318146, "learning_rate": 4.42e-06, "token_acc": 0.76545108, "epoch": 1.69336671, "global_step/max_steps": "677/800", "percentage": "84.62%", "elapsed_time": "2h 14m 54s", "remaining_time": "24m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.956414} +{"loss": 0.79608643, "grad_norm": 0.78871191, "learning_rate": 4.35e-06, "token_acc": 0.76377736, "epoch": 1.69586984, "global_step/max_steps": "678/800", "percentage": "84.75%", "elapsed_time": "2h 15m 10s", "remaining_time": "24m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.9613} +{"loss": 0.85452092, "grad_norm": 0.79592162, "learning_rate": 4.28e-06, "token_acc": 0.7468409, "epoch": 1.69837297, "global_step/max_steps": "679/800", "percentage": "84.88%", "elapsed_time": "2h 15m 25s", "remaining_time": "24m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.966697} +{"loss": 0.7095437, "grad_norm": 2.6820693, "learning_rate": 4.21e-06, "token_acc": 0.78777802, "epoch": 1.7008761, "global_step/max_steps": "680/800", "percentage": "85.00%", "elapsed_time": "2h 15m 33s", "remaining_time": "23m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.960115} +{"loss": 0.72950155, "grad_norm": 1.3040446, "learning_rate": 4.15e-06, "token_acc": 0.78385827, "epoch": 1.70337922, "global_step/max_steps": "681/800", "percentage": "85.12%", "elapsed_time": "2h 15m 51s", "remaining_time": "23m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.969137} +{"loss": 0.71178788, "grad_norm": 1.16847134, "learning_rate": 4.08e-06, "token_acc": 0.78357042, "epoch": 1.70588235, "global_step/max_steps": "682/800", "percentage": "85.25%", "elapsed_time": "2h 16m 1s", "remaining_time": "23m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.966466} +{"loss": 0.67782408, "grad_norm": 4.24461079, "learning_rate": 4.01e-06, "token_acc": 0.79806588, "epoch": 1.70838548, "global_step/max_steps": "683/800", "percentage": "85.38%", "elapsed_time": "2h 16m 8s", "remaining_time": "23m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.958319} +{"loss": 0.84638077, "grad_norm": 2.73103905, "learning_rate": 3.94e-06, "token_acc": 0.75150523, "epoch": 1.71088861, "global_step/max_steps": "684/800", "percentage": "85.50%", "elapsed_time": "2h 16m 20s", "remaining_time": "23m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.959631} +{"loss": 0.61570978, "grad_norm": 1.87852168, "learning_rate": 3.88e-06, "token_acc": 0.81549151, "epoch": 1.71339174, "global_step/max_steps": "685/800", "percentage": "85.62%", "elapsed_time": "2h 16m 28s", "remaining_time": "22m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.953902} +{"loss": 0.88367879, "grad_norm": 0.86515343, "learning_rate": 3.81e-06, "token_acc": 0.73804815, "epoch": 1.71589487, "global_step/max_steps": "686/800", "percentage": "85.75%", "elapsed_time": "2h 16m 44s", "remaining_time": "22m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.958866} +{"loss": 0.83602077, "grad_norm": 0.89361501, "learning_rate": 3.75e-06, "token_acc": 0.75084855, "epoch": 1.718398, "global_step/max_steps": "687/800", "percentage": "85.88%", "elapsed_time": "2h 16m 58s", "remaining_time": "22m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.962787} +{"loss": 0.71089751, "grad_norm": 2.32267189, "learning_rate": 3.68e-06, "token_acc": 0.78587991, "epoch": 1.72090113, "global_step/max_steps": "688/800", "percentage": "86.00%", "elapsed_time": "2h 17m 6s", "remaining_time": "22m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.956077} +{"loss": 0.69930017, "grad_norm": 3.34801173, "learning_rate": 3.62e-06, "token_acc": 0.78732375, "epoch": 1.72340426, "global_step/max_steps": "689/800", "percentage": "86.12%", "elapsed_time": "2h 17m 14s", "remaining_time": "22m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949987} +{"loss": 0.7427333, "grad_norm": 1.80852294, "learning_rate": 3.56e-06, "token_acc": 0.77768056, "epoch": 1.72590738, "global_step/max_steps": "690/800", "percentage": "86.25%", "elapsed_time": "2h 17m 22s", "remaining_time": "21m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.944702} +{"loss": 0.69524688, "grad_norm": 1.3708638, "learning_rate": 3.49e-06, "token_acc": 0.79478893, "epoch": 1.72841051, "global_step/max_steps": "691/800", "percentage": "86.38%", "elapsed_time": "2h 17m 41s", "remaining_time": "21m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.954455} +{"loss": 0.62307692, "grad_norm": 3.76179075, "learning_rate": 3.43e-06, "token_acc": 0.80997178, "epoch": 1.73091364, "global_step/max_steps": "692/800", "percentage": "86.50%", "elapsed_time": "2h 17m 51s", "remaining_time": "21m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.951611} +{"loss": 0.69502568, "grad_norm": 1.36726713, "learning_rate": 3.37e-06, "token_acc": 0.79245149, "epoch": 1.73341677, "global_step/max_steps": "693/800", "percentage": "86.62%", "elapsed_time": "2h 17m 60s", "remaining_time": "21m 18s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.947549} +{"loss": 0.81005895, "grad_norm": 0.99961489, "learning_rate": 3.31e-06, "token_acc": 0.75376666, "epoch": 1.7359199, "global_step/max_steps": "694/800", "percentage": "86.75%", "elapsed_time": "2h 18m 15s", "remaining_time": "21m 7s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.952371} +{"loss": 0.77536571, "grad_norm": 1.66102457, "learning_rate": 3.25e-06, "token_acc": 0.7681395, "epoch": 1.73842303, "global_step/max_steps": "695/800", "percentage": "86.88%", "elapsed_time": "2h 18m 23s", "remaining_time": "20m 54s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.946223} +{"loss": 0.7994473, "grad_norm": 2.18576884, "learning_rate": 3.19e-06, "token_acc": 0.75931842, "epoch": 1.74092616, "global_step/max_steps": "696/800", "percentage": "87.00%", "elapsed_time": "2h 18m 36s", "remaining_time": "20m 43s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.94782} +{"loss": 0.70019722, "grad_norm": 3.47557187, "learning_rate": 3.13e-06, "token_acc": 0.78775105, "epoch": 1.74342929, "global_step/max_steps": "697/800", "percentage": "87.12%", "elapsed_time": "2h 18m 44s", "remaining_time": "20m 30s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.942277} +{"loss": 0.8403793, "grad_norm": 1.27871025, "learning_rate": 3.07e-06, "token_acc": 0.74779623, "epoch": 1.74593242, "global_step/max_steps": "698/800", "percentage": "87.25%", "elapsed_time": "2h 18m 58s", "remaining_time": "20m 19s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.946125} +{"loss": 0.81076849, "grad_norm": 4.38633633, "learning_rate": 3.01e-06, "token_acc": 0.7630341, "epoch": 1.74843554, "global_step/max_steps": "699/800", "percentage": "87.38%", "elapsed_time": "2h 19m 9s", "remaining_time": "20m 6s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.944131} +{"loss": 0.8950088, "grad_norm": 2.26769638, "learning_rate": 2.95e-06, "token_acc": 0.7388262, "epoch": 1.75093867, "global_step/max_steps": "700/800", "percentage": "87.50%", "elapsed_time": "2h 19m 24s", "remaining_time": "19m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.948661} +{"loss": 0.83103895, "grad_norm": 1.03993642, "learning_rate": 2.89e-06, "token_acc": 0.75248912, "epoch": 1.7534418, "global_step/max_steps": "701/800", "percentage": "87.62%", "elapsed_time": "2h 19m 48s", "remaining_time": "19m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.965638} +{"loss": 0.83827364, "grad_norm": 1.59334719, "learning_rate": 2.84e-06, "token_acc": 0.75142498, "epoch": 1.75594493, "global_step/max_steps": "702/800", "percentage": "87.75%", "elapsed_time": "2h 19m 60s", "remaining_time": "19m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.965129} +{"loss": 0.69210589, "grad_norm": 1.21091485, "learning_rate": 2.78e-06, "token_acc": 0.78741249, "epoch": 1.75844806, "global_step/max_steps": "703/800", "percentage": "87.88%", "elapsed_time": "2h 20m 11s", "remaining_time": "19m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.964257} +{"loss": 0.82931733, "grad_norm": 0.91803885, "learning_rate": 2.72e-06, "token_acc": 0.75776541, "epoch": 1.76095119, "global_step/max_steps": "704/800", "percentage": "88.00%", "elapsed_time": "2h 20m 22s", "remaining_time": "19m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.962944} +{"loss": 0.78374243, "grad_norm": 1.01693094, "learning_rate": 2.67e-06, "token_acc": 0.77022047, "epoch": 1.76345432, "global_step/max_steps": "705/800", "percentage": "88.12%", "elapsed_time": "2h 20m 30s", "remaining_time": "18m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.958128} +{"loss": 0.73974478, "grad_norm": 2.02415037, "learning_rate": 2.61e-06, "token_acc": 0.7829549, "epoch": 1.76595745, "global_step/max_steps": "706/800", "percentage": "88.25%", "elapsed_time": "2h 20m 39s", "remaining_time": "18m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.952664} +{"loss": 0.742239, "grad_norm": 3.89012456, "learning_rate": 2.56e-06, "token_acc": 0.77789917, "epoch": 1.76846058, "global_step/max_steps": "707/800", "percentage": "88.38%", "elapsed_time": "2h 20m 48s", "remaining_time": "18m 31s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949701} +{"loss": 0.88203007, "grad_norm": 1.02217734, "learning_rate": 2.51e-06, "token_acc": 0.73680343, "epoch": 1.7709637, "global_step/max_steps": "708/800", "percentage": "88.50%", "elapsed_time": "2h 21m 6s", "remaining_time": "18m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.956992} +{"loss": 0.8977921, "grad_norm": 1.08303678, "learning_rate": 2.45e-06, "token_acc": 0.73260303, "epoch": 1.77346683, "global_step/max_steps": "709/800", "percentage": "88.62%", "elapsed_time": "2h 21m 18s", "remaining_time": "18m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.957196} +{"loss": 0.72487384, "grad_norm": 1.03718877, "learning_rate": 2.4e-06, "token_acc": 0.78128359, "epoch": 1.77596996, "global_step/max_steps": "710/800", "percentage": "88.75%", "elapsed_time": "2h 21m 27s", "remaining_time": "17m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.952937} +{"loss": 0.7425921, "grad_norm": 1.26380587, "learning_rate": 2.35e-06, "token_acc": 0.77373322, "epoch": 1.77847309, "global_step/max_steps": "711/800", "percentage": "88.88%", "elapsed_time": "2h 21m 50s", "remaining_time": "17m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.969167} +{"loss": 0.88665903, "grad_norm": 14.53322697, "learning_rate": 2.3e-06, "token_acc": 0.74391019, "epoch": 1.78097622, "global_step/max_steps": "712/800", "percentage": "89.00%", "elapsed_time": "2h 22m 1s", "remaining_time": "17m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.968352} +{"loss": 0.73033166, "grad_norm": 1.55759215, "learning_rate": 2.25e-06, "token_acc": 0.77621183, "epoch": 1.78347935, "global_step/max_steps": "713/800", "percentage": "89.12%", "elapsed_time": "2h 22m 13s", "remaining_time": "17m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.968408} +{"loss": 0.90443933, "grad_norm": 1.71156216, "learning_rate": 2.19e-06, "token_acc": 0.72975996, "epoch": 1.78598248, "global_step/max_steps": "714/800", "percentage": "89.25%", "elapsed_time": "2h 22m 26s", "remaining_time": "17m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.96943} +{"loss": 0.75615519, "grad_norm": 1.99252391, "learning_rate": 2.14e-06, "token_acc": 0.775, "epoch": 1.78848561, "global_step/max_steps": "715/800", "percentage": "89.38%", "elapsed_time": "2h 22m 34s", "remaining_time": "16m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.962941} +{"loss": 0.73182136, "grad_norm": 1.46264553, "learning_rate": 2.1e-06, "token_acc": 0.77753355, "epoch": 1.79098874, "global_step/max_steps": "716/800", "percentage": "89.50%", "elapsed_time": "2h 22m 47s", "remaining_time": "16m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.965194} +{"loss": 0.86962926, "grad_norm": 1.06031704, "learning_rate": 2.05e-06, "token_acc": 0.74216562, "epoch": 1.79349186, "global_step/max_steps": "717/800", "percentage": "89.62%", "elapsed_time": "2h 22m 54s", "remaining_time": "16m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.957702} +{"loss": 0.78867376, "grad_norm": 0.91306812, "learning_rate": 2e-06, "token_acc": 0.76002471, "epoch": 1.79599499, "global_step/max_steps": "718/800", "percentage": "89.75%", "elapsed_time": "2h 23m 1s", "remaining_time": "16m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.951136} +{"loss": 0.7621237, "grad_norm": 1.1878103, "learning_rate": 1.95e-06, "token_acc": 0.76826687, "epoch": 1.79849812, "global_step/max_steps": "719/800", "percentage": "89.88%", "elapsed_time": "2h 23m 10s", "remaining_time": "16m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.947316} +{"loss": 0.61555547, "grad_norm": 1.71596849, "learning_rate": 1.9e-06, "token_acc": 0.81266735, "epoch": 1.80100125, "global_step/max_steps": "720/800", "percentage": "90.00%", "elapsed_time": "2h 23m 17s", "remaining_time": "15m 55s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.940326} +{"loss": 0.63077557, "grad_norm": 1.65276837, "learning_rate": 1.86e-06, "token_acc": 0.80673884, "epoch": 1.80350438, "global_step/max_steps": "721/800", "percentage": "90.12%", "elapsed_time": "2h 23m 34s", "remaining_time": "15m 44s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.947667} +{"loss": 0.87277812, "grad_norm": 3.19392562, "learning_rate": 1.81e-06, "token_acc": 0.73928662, "epoch": 1.80600751, "global_step/max_steps": "722/800", "percentage": "90.25%", "elapsed_time": "2h 23m 46s", "remaining_time": "15m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.947552} +{"loss": 0.83112025, "grad_norm": 0.95988804, "learning_rate": 1.76e-06, "token_acc": 0.74872292, "epoch": 1.80851064, "global_step/max_steps": "723/800", "percentage": "90.38%", "elapsed_time": "2h 24m 3s", "remaining_time": "15m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.954269} +{"loss": 0.7448898, "grad_norm": 2.18516326, "learning_rate": 1.72e-06, "token_acc": 0.77557239, "epoch": 1.81101377, "global_step/max_steps": "724/800", "percentage": "90.50%", "elapsed_time": "2h 24m 13s", "remaining_time": "15m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.951096} +{"loss": 0.74945939, "grad_norm": 1.59883845, "learning_rate": 1.68e-06, "token_acc": 0.77678386, "epoch": 1.8135169, "global_step/max_steps": "725/800", "percentage": "90.62%", "elapsed_time": "2h 24m 23s", "remaining_time": "14m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949606} +{"loss": 0.78506196, "grad_norm": 2.47171116, "learning_rate": 1.63e-06, "token_acc": 0.76507192, "epoch": 1.81602003, "global_step/max_steps": "726/800", "percentage": "90.75%", "elapsed_time": "2h 24m 38s", "remaining_time": "14m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.953338} +{"loss": 0.79408485, "grad_norm": 1.35671759, "learning_rate": 1.59e-06, "token_acc": 0.76821115, "epoch": 1.81852315, "global_step/max_steps": "727/800", "percentage": "90.88%", "elapsed_time": "2h 24m 49s", "remaining_time": "14m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.952359} +{"loss": 0.73291874, "grad_norm": 10.02984524, "learning_rate": 1.55e-06, "token_acc": 0.78655926, "epoch": 1.82102628, "global_step/max_steps": "728/800", "percentage": "91.00%", "elapsed_time": "2h 24m 57s", "remaining_time": "14m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.946531} +{"loss": 0.8017996, "grad_norm": 0.84959829, "learning_rate": 1.5e-06, "token_acc": 0.75683453, "epoch": 1.82352941, "global_step/max_steps": "729/800", "percentage": "91.12%", "elapsed_time": "2h 25m 5s", "remaining_time": "14m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.940667} +{"loss": 0.74379367, "grad_norm": 1.036268, "learning_rate": 1.46e-06, "token_acc": 0.78282129, "epoch": 1.82603254, "global_step/max_steps": "730/800", "percentage": "91.25%", "elapsed_time": "2h 25m 13s", "remaining_time": "13m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.936196} +{"loss": 0.86098599, "grad_norm": 0.96630561, "learning_rate": 1.42e-06, "token_acc": 0.74391805, "epoch": 1.82853567, "global_step/max_steps": "731/800", "percentage": "91.38%", "elapsed_time": "2h 25m 42s", "remaining_time": "13m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.95879} +{"loss": 0.72779304, "grad_norm": 1.39568257, "learning_rate": 1.38e-06, "token_acc": 0.77910223, "epoch": 1.8310388, "global_step/max_steps": "732/800", "percentage": "91.50%", "elapsed_time": "2h 25m 50s", "remaining_time": "13m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.952988} +{"loss": 0.74867791, "grad_norm": 3.7636776, "learning_rate": 1.34e-06, "token_acc": 0.78181694, "epoch": 1.83354193, "global_step/max_steps": "733/800", "percentage": "91.62%", "elapsed_time": "2h 25m 59s", "remaining_time": "13m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949883} +{"loss": 0.83829826, "grad_norm": 1.31535435, "learning_rate": 1.3e-06, "token_acc": 0.75254533, "epoch": 1.83604506, "global_step/max_steps": "734/800", "percentage": "91.75%", "elapsed_time": "2h 26m 10s", "remaining_time": "13m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.94815} +{"loss": 0.89415145, "grad_norm": 1.11119318, "learning_rate": 1.26e-06, "token_acc": 0.73492748, "epoch": 1.83854819, "global_step/max_steps": "735/800", "percentage": "91.88%", "elapsed_time": "2h 26m 22s", "remaining_time": "12m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.948374} +{"loss": 0.82440054, "grad_norm": 1.29744792, "learning_rate": 1.22e-06, "token_acc": 0.75168012, "epoch": 1.84105131, "global_step/max_steps": "736/800", "percentage": "92.00%", "elapsed_time": "2h 26m 33s", "remaining_time": "12m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.946826} +{"loss": 0.63474715, "grad_norm": 1.07111478, "learning_rate": 1.19e-06, "token_acc": 0.80842185, "epoch": 1.84355444, "global_step/max_steps": "737/800", "percentage": "92.12%", "elapsed_time": "2h 26m 42s", "remaining_time": "12m 32s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.943034} +{"loss": 0.70330679, "grad_norm": 1.75430679, "learning_rate": 1.15e-06, "token_acc": 0.79272361, "epoch": 1.84605757, "global_step/max_steps": "738/800", "percentage": "92.25%", "elapsed_time": "2h 26m 51s", "remaining_time": "12m 20s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.93953} +{"loss": 0.73224902, "grad_norm": 1.62577844, "learning_rate": 1.11e-06, "token_acc": 0.77659574, "epoch": 1.8485607, "global_step/max_steps": "739/800", "percentage": "92.38%", "elapsed_time": "2h 26m 58s", "remaining_time": "12m 8s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.931684} +{"loss": 0.74827749, "grad_norm": 1.17024529, "learning_rate": 1.08e-06, "token_acc": 0.77424502, "epoch": 1.85106383, "global_step/max_steps": "740/800", "percentage": "92.50%", "elapsed_time": "2h 27m 9s", "remaining_time": "11m 56s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.930903} +{"loss": 0.81429946, "grad_norm": 1.20651948, "learning_rate": 1.04e-06, "token_acc": 0.75696586, "epoch": 1.85356696, "global_step/max_steps": "741/800", "percentage": "92.62%", "elapsed_time": "2h 27m 34s", "remaining_time": "11m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.948104} +{"loss": 0.72373605, "grad_norm": 1.30253041, "learning_rate": 1.01e-06, "token_acc": 0.78328437, "epoch": 1.85607009, "global_step/max_steps": "742/800", "percentage": "92.75%", "elapsed_time": "2h 27m 41s", "remaining_time": "11m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.941752} +{"loss": 0.81118131, "grad_norm": 1.51788616, "learning_rate": 9.7e-07, "token_acc": 0.75745362, "epoch": 1.85857322, "global_step/max_steps": "743/800", "percentage": "92.88%", "elapsed_time": "2h 27m 53s", "remaining_time": "11m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.942797} +{"loss": 0.6973958, "grad_norm": 1.18350124, "learning_rate": 9.4e-07, "token_acc": 0.78836077, "epoch": 1.86107635, "global_step/max_steps": "744/800", "percentage": "93.00%", "elapsed_time": "2h 28m 5s", "remaining_time": "11m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.942118} +{"loss": 0.88395792, "grad_norm": 1.05533493, "learning_rate": 9.1e-07, "token_acc": 0.73935561, "epoch": 1.86357947, "global_step/max_steps": "745/800", "percentage": "93.12%", "elapsed_time": "2h 28m 19s", "remaining_time": "10m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.94481} +{"loss": 0.76883113, "grad_norm": 2.35243893, "learning_rate": 8.7e-07, "token_acc": 0.77019633, "epoch": 1.8660826, "global_step/max_steps": "746/800", "percentage": "93.25%", "elapsed_time": "2h 28m 27s", "remaining_time": "10m 45s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.940116} +{"loss": 0.72491133, "grad_norm": 2.35846138, "learning_rate": 8.4e-07, "token_acc": 0.78002337, "epoch": 1.86858573, "global_step/max_steps": "747/800", "percentage": "93.38%", "elapsed_time": "2h 28m 37s", "remaining_time": "10m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.937683} +{"loss": 0.89620137, "grad_norm": 0.98183715, "learning_rate": 8.1e-07, "token_acc": 0.73475203, "epoch": 1.87108886, "global_step/max_steps": "748/800", "percentage": "93.50%", "elapsed_time": "2h 28m 50s", "remaining_time": "10m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.938292} +{"loss": 0.8181411, "grad_norm": 1.40142643, "learning_rate": 7.8e-07, "token_acc": 0.75302695, "epoch": 1.87359199, "global_step/max_steps": "749/800", "percentage": "93.62%", "elapsed_time": "2h 29m 3s", "remaining_time": "10m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.939895} +{"loss": 0.74402565, "grad_norm": 2.09946847, "learning_rate": 7.5e-07, "token_acc": 0.77814775, "epoch": 1.87609512, "global_step/max_steps": "750/800", "percentage": "93.75%", "elapsed_time": "2h 29m 13s", "remaining_time": "9m 57s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.937183} +{"loss": 0.79473072, "grad_norm": 1.39003289, "learning_rate": 7.2e-07, "token_acc": 0.76304901, "epoch": 1.87859825, "global_step/max_steps": "751/800", "percentage": "93.88%", "elapsed_time": "2h 29m 35s", "remaining_time": "9m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.951229} +{"loss": 0.66776806, "grad_norm": 1.93710697, "learning_rate": 6.9e-07, "token_acc": 0.79761905, "epoch": 1.88110138, "global_step/max_steps": "752/800", "percentage": "94.00%", "elapsed_time": "2h 29m 43s", "remaining_time": "9m 33s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.945158} +{"loss": 0.91275847, "grad_norm": 2.1338563, "learning_rate": 6.6e-07, "token_acc": 0.73649554, "epoch": 1.88360451, "global_step/max_steps": "753/800", "percentage": "94.12%", "elapsed_time": "2h 29m 56s", "remaining_time": "9m 21s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.946768} +{"loss": 0.89424646, "grad_norm": 1.87194395, "learning_rate": 6.3e-07, "token_acc": 0.73143722, "epoch": 1.88610763, "global_step/max_steps": "754/800", "percentage": "94.25%", "elapsed_time": "2h 30m 11s", "remaining_time": "9m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.951071} +{"loss": 0.74926114, "grad_norm": 1.12518203, "learning_rate": 6.1e-07, "token_acc": 0.77209396, "epoch": 1.88861076, "global_step/max_steps": "755/800", "percentage": "94.38%", "elapsed_time": "2h 30m 22s", "remaining_time": "8m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.949948} +{"loss": 0.77207088, "grad_norm": 5.9451561, "learning_rate": 5.8e-07, "token_acc": 0.77004126, "epoch": 1.89111389, "global_step/max_steps": "756/800", "percentage": "94.50%", "elapsed_time": "2h 30m 32s", "remaining_time": "8m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.94713} +{"loss": 0.786111, "grad_norm": 1.38585746, "learning_rate": 5.5e-07, "token_acc": 0.76254156, "epoch": 1.89361702, "global_step/max_steps": "757/800", "percentage": "94.62%", "elapsed_time": "2h 30m 40s", "remaining_time": "8m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.942172} +{"loss": 0.70629561, "grad_norm": 3.03468657, "learning_rate": 5.3e-07, "token_acc": 0.78711656, "epoch": 1.89612015, "global_step/max_steps": "758/800", "percentage": "94.75%", "elapsed_time": "2h 30m 52s", "remaining_time": "8m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.941373} +{"loss": 0.79703665, "grad_norm": 1.12588179, "learning_rate": 5e-07, "token_acc": 0.76553793, "epoch": 1.89862328, "global_step/max_steps": "759/800", "percentage": "94.88%", "elapsed_time": "2h 30m 59s", "remaining_time": "8m 9s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.936055} +{"loss": 0.78709662, "grad_norm": 1.39068902, "learning_rate": 4.8e-07, "token_acc": 0.75966984, "epoch": 1.90112641, "global_step/max_steps": "760/800", "percentage": "95.00%", "elapsed_time": "2h 31m 14s", "remaining_time": "7m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.939668} +{"loss": 0.74512327, "grad_norm": 1.07410085, "learning_rate": 4.6e-07, "token_acc": 0.77248173, "epoch": 1.90362954, "global_step/max_steps": "761/800", "percentage": "95.12%", "elapsed_time": "2h 31m 32s", "remaining_time": "7m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.948004} +{"loss": 0.74175102, "grad_norm": 1.25184619, "learning_rate": 4.3e-07, "token_acc": 0.77399263, "epoch": 1.90613267, "global_step/max_steps": "762/800", "percentage": "95.25%", "elapsed_time": "2h 31m 43s", "remaining_time": "7m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.945555} +{"loss": 0.73889852, "grad_norm": 2.03546453, "learning_rate": 4.1e-07, "token_acc": 0.77417082, "epoch": 1.90863579, "global_step/max_steps": "763/800", "percentage": "95.38%", "elapsed_time": "2h 31m 51s", "remaining_time": "7m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.940425} +{"loss": 0.63535845, "grad_norm": 3.4125042, "learning_rate": 3.9e-07, "token_acc": 0.80700149, "epoch": 1.91113892, "global_step/max_steps": "764/800", "percentage": "95.50%", "elapsed_time": "2h 31m 56s", "remaining_time": "7m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.932223} +{"loss": 0.77354193, "grad_norm": 2.28150678, "learning_rate": 3.7e-07, "token_acc": 0.76520305, "epoch": 1.91364205, "global_step/max_steps": "765/800", "percentage": "95.62%", "elapsed_time": "2h 32m 9s", "remaining_time": "6m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.932938} +{"loss": 0.75689346, "grad_norm": 2.21805787, "learning_rate": 3.5e-07, "token_acc": 0.77678919, "epoch": 1.91614518, "global_step/max_steps": "766/800", "percentage": "95.75%", "elapsed_time": "2h 32m 20s", "remaining_time": "6m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.93152} +{"loss": 0.82708895, "grad_norm": 1.29792917, "learning_rate": 3.3e-07, "token_acc": 0.75073369, "epoch": 1.91864831, "global_step/max_steps": "767/800", "percentage": "95.88%", "elapsed_time": "2h 32m 31s", "remaining_time": "6m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.931222} +{"loss": 0.73501652, "grad_norm": 1.3717227, "learning_rate": 3.1e-07, "token_acc": 0.78419655, "epoch": 1.92115144, "global_step/max_steps": "768/800", "percentage": "96.00%", "elapsed_time": "2h 32m 40s", "remaining_time": "6m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.927656} +{"loss": 0.80092609, "grad_norm": 5.03616667, "learning_rate": 2.9e-07, "token_acc": 0.76005539, "epoch": 1.92365457, "global_step/max_steps": "769/800", "percentage": "96.12%", "elapsed_time": "2h 32m 54s", "remaining_time": "6m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.929605} +{"loss": 0.62702334, "grad_norm": 7.49997759, "learning_rate": 2.7e-07, "token_acc": 0.81365648, "epoch": 1.9261577, "global_step/max_steps": "770/800", "percentage": "96.25%", "elapsed_time": "2h 33m 1s", "remaining_time": "5m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.923363} +{"loss": 0.81849039, "grad_norm": 1.12165833, "learning_rate": 2.5e-07, "token_acc": 0.75518602, "epoch": 1.92866083, "global_step/max_steps": "771/800", "percentage": "96.38%", "elapsed_time": "2h 33m 20s", "remaining_time": "5m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.932641} +{"loss": 0.63712573, "grad_norm": 3.30180049, "learning_rate": 2.4e-07, "token_acc": 0.81574708, "epoch": 1.93116395, "global_step/max_steps": "772/800", "percentage": "96.50%", "elapsed_time": "2h 33m 28s", "remaining_time": "5m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.927669} +{"loss": 0.8046695, "grad_norm": 3.27781391, "learning_rate": 2.2e-07, "token_acc": 0.76237187, "epoch": 1.93366708, "global_step/max_steps": "773/800", "percentage": "96.62%", "elapsed_time": "2h 33m 43s", "remaining_time": "5m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.931425} +{"loss": 0.84852535, "grad_norm": 1.26389349, "learning_rate": 2e-07, "token_acc": 0.74725317, "epoch": 1.93617021, "global_step/max_steps": "774/800", "percentage": "96.75%", "elapsed_time": "2h 33m 56s", "remaining_time": "5m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.932544} +{"loss": 0.76845521, "grad_norm": 0.9263531, "learning_rate": 1.9e-07, "token_acc": 0.77515706, "epoch": 1.93867334, "global_step/max_steps": "775/800", "percentage": "96.88%", "elapsed_time": "2h 34m 7s", "remaining_time": "4m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.931976} +{"loss": 0.74627268, "grad_norm": 1.14194953, "learning_rate": 1.7e-07, "token_acc": 0.77821094, "epoch": 1.94117647, "global_step/max_steps": "776/800", "percentage": "97.00%", "elapsed_time": "2h 34m 16s", "remaining_time": "4m 46s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.927191} +{"loss": 0.77953023, "grad_norm": 3.49473977, "learning_rate": 1.6e-07, "token_acc": 0.76353725, "epoch": 1.9436796, "global_step/max_steps": "777/800", "percentage": "97.12%", "elapsed_time": "2h 34m 27s", "remaining_time": "4m 34s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.927118} +{"loss": 0.66060728, "grad_norm": 2.08708286, "learning_rate": 1.5e-07, "token_acc": 0.80120893, "epoch": 1.94618273, "global_step/max_steps": "778/800", "percentage": "97.25%", "elapsed_time": "2h 34m 36s", "remaining_time": "4m 22s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.922607} +{"loss": 0.70522308, "grad_norm": 1.65537608, "learning_rate": 1.3e-07, "token_acc": 0.78526376, "epoch": 1.94868586, "global_step/max_steps": "779/800", "percentage": "97.38%", "elapsed_time": "2h 34m 44s", "remaining_time": "4m 10s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.917477} +{"loss": 0.85520089, "grad_norm": 1.11439252, "learning_rate": 1.2e-07, "token_acc": 0.74600568, "epoch": 1.95118899, "global_step/max_steps": "780/800", "percentage": "97.50%", "elapsed_time": "2h 34m 59s", "remaining_time": "3m 58s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.921471} +{"loss": 0.78724498, "grad_norm": 1.69102585, "learning_rate": 1.1e-07, "token_acc": 0.75974168, "epoch": 1.95369212, "global_step/max_steps": "781/800", "percentage": "97.62%", "elapsed_time": "2h 35m 26s", "remaining_time": "3m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.941102} +{"loss": 0.74277282, "grad_norm": 0.99784809, "learning_rate": 1e-07, "token_acc": 0.76915924, "epoch": 1.95619524, "global_step/max_steps": "782/800", "percentage": "97.75%", "elapsed_time": "2h 35m 42s", "remaining_time": "3m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.946579} +{"loss": 0.62469065, "grad_norm": 3.08796859, "learning_rate": 9e-08, "token_acc": 0.80598498, "epoch": 1.95869837, "global_step/max_steps": "783/800", "percentage": "97.88%", "elapsed_time": "2h 35m 49s", "remaining_time": "3m 23s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.93974} +{"loss": 0.72294092, "grad_norm": 1.87112558, "learning_rate": 8e-08, "token_acc": 0.77988228, "epoch": 1.9612015, "global_step/max_steps": "784/800", "percentage": "98.00%", "elapsed_time": "2h 35m 57s", "remaining_time": "3m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.935019} +{"loss": 0.7285189, "grad_norm": 4.38148117, "learning_rate": 7e-08, "token_acc": 0.77918702, "epoch": 1.96370463, "global_step/max_steps": "785/800", "percentage": "98.12%", "elapsed_time": "2h 36m 5s", "remaining_time": "2m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.930037} +{"loss": 0.82238096, "grad_norm": 1.45396936, "learning_rate": 6e-08, "token_acc": 0.75612506, "epoch": 1.96620776, "global_step/max_steps": "786/800", "percentage": "98.25%", "elapsed_time": "2h 36m 13s", "remaining_time": "2m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.924503} +{"loss": 0.6294353, "grad_norm": 1.40712166, "learning_rate": 5e-08, "token_acc": 0.8072789, "epoch": 1.96871089, "global_step/max_steps": "787/800", "percentage": "98.38%", "elapsed_time": "2h 36m 21s", "remaining_time": "2m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.920243} +{"loss": 0.77292585, "grad_norm": 13.99648762, "learning_rate": 4e-08, "token_acc": 0.76837429, "epoch": 1.97121402, "global_step/max_steps": "788/800", "percentage": "98.50%", "elapsed_time": "2h 36m 33s", "remaining_time": "2m 23s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.919425} +{"loss": 0.77307886, "grad_norm": 1.58935571, "learning_rate": 4e-08, "token_acc": 0.76943748, "epoch": 1.97371715, "global_step/max_steps": "789/800", "percentage": "98.62%", "elapsed_time": "2h 36m 45s", "remaining_time": "2m 11s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.920465} +{"loss": 0.72733015, "grad_norm": 1.9809444, "learning_rate": 3e-08, "token_acc": 0.77921438, "epoch": 1.97622028, "global_step/max_steps": "790/800", "percentage": "98.75%", "elapsed_time": "2h 36m 57s", "remaining_time": "1m 59s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.920756} +{"loss": 0.6879251, "grad_norm": 1.88467145, "learning_rate": 2e-08, "token_acc": 0.78947368, "epoch": 1.9787234, "global_step/max_steps": "791/800", "percentage": "98.88%", "elapsed_time": "2h 37m 19s", "remaining_time": "1m 47s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.932869} +{"loss": 0.78101677, "grad_norm": 1.43085074, "learning_rate": 2e-08, "token_acc": 0.76668319, "epoch": 1.98122653, "global_step/max_steps": "792/800", "percentage": "99.00%", "elapsed_time": "2h 37m 31s", "remaining_time": "1m 35s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.933159} +{"loss": 0.8870067, "grad_norm": 0.79085702, "learning_rate": 1e-08, "token_acc": 0.7335511, "epoch": 1.98372966, "global_step/max_steps": "793/800", "percentage": "99.12%", "elapsed_time": "2h 37m 48s", "remaining_time": "1m 24s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.939263} +{"loss": 0.86920512, "grad_norm": 1.39988446, "learning_rate": 1e-08, "token_acc": 0.74230139, "epoch": 1.98623279, "global_step/max_steps": "794/800", "percentage": "99.25%", "elapsed_time": "2h 38m 2s", "remaining_time": "1m 12s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.942137} +{"loss": 0.67877078, "grad_norm": 1.11947286, "learning_rate": 1e-08, "token_acc": 0.79892222, "epoch": 1.98873592, "global_step/max_steps": "795/800", "percentage": "99.38%", "elapsed_time": "2h 38m 12s", "remaining_time": "60s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.939747} +{"loss": 0.88641465, "grad_norm": 2.85542631, "learning_rate": 0.0, "token_acc": 0.7438413, "epoch": 1.99123905, "global_step/max_steps": "796/800", "percentage": "99.50%", "elapsed_time": "2h 38m 21s", "remaining_time": "48s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.935335} +{"loss": 0.7691409, "grad_norm": 0.8510657, "learning_rate": 0.0, "token_acc": 0.77277646, "epoch": 1.99374218, "global_step/max_steps": "797/800", "percentage": "99.62%", "elapsed_time": "2h 38m 30s", "remaining_time": "36s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.932502} +{"loss": 0.73040861, "grad_norm": 1.36749852, "learning_rate": 0.0, "token_acc": 0.78129549, "epoch": 1.99624531, "global_step/max_steps": "798/800", "percentage": "99.75%", "elapsed_time": "2h 38m 40s", "remaining_time": "24s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.929316} +{"loss": 0.75513864, "grad_norm": 1.90308738, "learning_rate": 0.0, "token_acc": 0.77527278, "epoch": 1.99874844, "global_step/max_steps": "799/800", "percentage": "99.88%", "elapsed_time": "2h 38m 53s", "remaining_time": "12s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.931155} +{"loss": 0.83688653, "grad_norm": 1.46230662, "learning_rate": 0.0, "token_acc": 0.75900755, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 38m 59s", "remaining_time": "0s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.92338} +{"eval_loss": 0.53543162, "eval_runtime": 2.8444, "eval_samples_per_second": 4.219, "eval_steps_per_second": 0.703, "eval_token_acc": 0.75908222, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 39m 2s", "remaining_time": "0s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.926947} +{"train_runtime": 9569.0522, "train_samples_per_second": 2.673, "train_steps_per_second": 0.084, "total_flos": 3.9041551041015316e+18, "train_loss": 0.87993101, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 39m 29s", "remaining_time": "0s", "memory(GiB)": 72.42, "train_speed(s/it)": 11.961313} +{"model_parameter_info": "PeftModelForCausalLM: 8343.6882M Params (51.5215M Trainable [0.6175%]), 0.0019M Buffers.", "last_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800", "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/checkpoint-800", "best_metric": 0.53543162, "global_step": 800, "log_history": [{"loss": 1.4558331966400146, "grad_norm": 1.8141324520111084, "learning_rate": 3.125e-07, "token_acc": 0.6587197909862835, "epoch": 0.0025031289111389237, "step": 1}, {"loss": 1.5102750062942505, "grad_norm": 2.7097065448760986, "learning_rate": 6.25e-07, "token_acc": 0.6374107200308861, "epoch": 0.0050062578222778474, "step": 2}, {"loss": 1.4846917390823364, "grad_norm": 3.731478452682495, "learning_rate": 9.375e-07, "token_acc": 0.6467950044849238, "epoch": 0.007509386733416771, "step": 3}, {"loss": 1.4477494955062866, "grad_norm": 1.8039724826812744, "learning_rate": 1.25e-06, "token_acc": 0.6551159771996162, "epoch": 0.010012515644555695, "step": 4}, {"loss": 1.4835330247879028, "grad_norm": 4.494865417480469, "learning_rate": 1.5625e-06, "token_acc": 0.636961027144518, "epoch": 0.012515644555694618, "step": 5}, {"loss": 1.476511001586914, "grad_norm": 3.468430995941162, "learning_rate": 1.875e-06, "token_acc": 0.6395731577829687, "epoch": 0.015018773466833541, "step": 6}, {"loss": 1.445321798324585, "grad_norm": 1.6436569690704346, "learning_rate": 2.1875e-06, "token_acc": 0.6609300016548072, "epoch": 0.017521902377972465, "step": 7}, {"loss": 1.4368172883987427, "grad_norm": 5.7237958908081055, "learning_rate": 2.5e-06, "token_acc": 0.6518960374946741, "epoch": 0.02002503128911139, "step": 8}, {"loss": 1.5469402074813843, "grad_norm": 1.0010274648666382, "learning_rate": 2.8125e-06, "token_acc": 0.61862263870296, "epoch": 0.02252816020025031, "step": 9}, {"loss": 1.5444755554199219, "grad_norm": 1.2346174716949463, "learning_rate": 3.125e-06, "token_acc": 0.6183196808672615, "epoch": 0.025031289111389236, "step": 10}, {"loss": 1.5128525495529175, "grad_norm": 1.349374532699585, "learning_rate": 3.4375000000000005e-06, "token_acc": 0.6263652527305055, "epoch": 0.02753441802252816, "step": 11}, {"loss": 1.468747615814209, "grad_norm": 3.90444016456604, "learning_rate": 3.75e-06, "token_acc": 0.6539249583813549, "epoch": 0.030037546933667083, "step": 12}, {"loss": 1.4974875450134277, "grad_norm": 3.8990912437438965, "learning_rate": 4.0625000000000005e-06, "token_acc": 0.6396883067214839, "epoch": 0.03254067584480601, "step": 13}, {"loss": 1.4603385925292969, "grad_norm": 4.560666084289551, "learning_rate": 4.375e-06, "token_acc": 0.673594883778133, "epoch": 0.03504380475594493, "step": 14}, {"loss": 1.4672789573669434, "grad_norm": 2.1652066707611084, "learning_rate": 4.6875000000000004e-06, "token_acc": 0.67072, "epoch": 0.03754693366708386, "step": 15}, {"loss": 1.4323251247406006, "grad_norm": 28.565114974975586, "learning_rate": 5e-06, "token_acc": 0.6802855573860516, "epoch": 0.04005006257822278, "step": 16}, {"loss": 1.5201783180236816, "grad_norm": 1.2191154956817627, "learning_rate": 5.3125e-06, "token_acc": 0.6302349336057201, "epoch": 0.0425531914893617, "step": 17}, {"loss": 1.4549026489257812, "grad_norm": 3.823606252670288, "learning_rate": 5.625e-06, "token_acc": 0.6533967235651278, "epoch": 0.04505632040050062, "step": 18}, {"loss": 1.4218157529830933, "grad_norm": 3.615473508834839, "learning_rate": 5.9375e-06, "token_acc": 0.6625929470661857, "epoch": 0.04755944931163955, "step": 19}, {"loss": 1.5040549039840698, "grad_norm": 6.056225776672363, "learning_rate": 6.25e-06, "token_acc": 0.6463865546218487, "epoch": 0.05006257822277847, "step": 20}, {"loss": 1.5186512470245361, "grad_norm": 1.1101607084274292, "learning_rate": 6.5625e-06, "token_acc": 0.6336622685441845, "epoch": 0.052565707133917394, "step": 21}, {"loss": 1.4710779190063477, "grad_norm": 3.4688284397125244, "learning_rate": 6.875000000000001e-06, "token_acc": 0.649603043334436, "epoch": 0.05506883604505632, "step": 22}, {"loss": 1.4556055068969727, "grad_norm": 2.945401906967163, "learning_rate": 7.187499999999999e-06, "token_acc": 0.6511273792093705, "epoch": 0.057571964956195244, "step": 23}, {"loss": 1.4981625080108643, "grad_norm": 1.7959648370742798, "learning_rate": 7.5e-06, "token_acc": 0.6581992406436449, "epoch": 0.060075093867334166, "step": 24}, {"loss": 1.4692087173461914, "grad_norm": 2.836989641189575, "learning_rate": 7.8125e-06, "token_acc": 0.6400229118933556, "epoch": 0.0625782227784731, "step": 25}, {"loss": 1.4672834873199463, "grad_norm": 4.335150241851807, "learning_rate": 8.125000000000001e-06, "token_acc": 0.6426897157925578, "epoch": 0.06508135168961202, "step": 26}, {"loss": 1.5053527355194092, "grad_norm": 2.6187744140625, "learning_rate": 8.437500000000002e-06, "token_acc": 0.6411245456568504, "epoch": 0.06758448060075094, "step": 27}, {"loss": 1.495232105255127, "grad_norm": 4.596649169921875, "learning_rate": 8.75e-06, "token_acc": 0.6582827406764961, "epoch": 0.07008760951188986, "step": 28}, {"loss": 1.4520742893218994, "grad_norm": 2.2826857566833496, "learning_rate": 9.0625e-06, "token_acc": 0.6422463489623367, "epoch": 0.07259073842302878, "step": 29}, {"loss": 1.413942575454712, "grad_norm": 1.2480427026748657, "learning_rate": 9.375000000000001e-06, "token_acc": 0.6513089987801445, "epoch": 0.07509386733416772, "step": 30}, {"loss": 1.4269421100616455, "grad_norm": 1.5732747316360474, "learning_rate": 9.6875e-06, "token_acc": 0.6511775266659626, "epoch": 0.07759699624530664, "step": 31}, {"loss": 1.4499857425689697, "grad_norm": 1.305902123451233, "learning_rate": 1e-05, "token_acc": 0.6362675125561723, "epoch": 0.08010012515644556, "step": 32}, {"loss": 1.449812412261963, "grad_norm": 2.718529462814331, "learning_rate": 1.03125e-05, "token_acc": 0.6403560135847289, "epoch": 0.08260325406758448, "step": 33}, {"loss": 1.3601875305175781, "grad_norm": 1.5598729848861694, "learning_rate": 1.0625e-05, "token_acc": 0.6700675278919553, "epoch": 0.0851063829787234, "step": 34}, {"loss": 1.3765363693237305, "grad_norm": 9.867480278015137, "learning_rate": 1.09375e-05, "token_acc": 0.6669165757906216, "epoch": 0.08760951188986232, "step": 35}, {"loss": 1.410968542098999, "grad_norm": 2.136289596557617, "learning_rate": 1.125e-05, "token_acc": 0.6567221708294789, "epoch": 0.09011264080100125, "step": 36}, {"loss": 1.488232135772705, "grad_norm": 4.079403400421143, "learning_rate": 1.1562500000000002e-05, "token_acc": 0.6309482023767738, "epoch": 0.09261576971214018, "step": 37}, {"loss": 1.313117265701294, "grad_norm": 0.7997560501098633, "learning_rate": 1.1875e-05, "token_acc": 0.6665271562409453, "epoch": 0.0951188986232791, "step": 38}, {"loss": 1.4282214641571045, "grad_norm": 3.2652623653411865, "learning_rate": 1.21875e-05, "token_acc": 0.6325610612275062, "epoch": 0.09762202753441802, "step": 39}, {"loss": 1.3395355939865112, "grad_norm": 3.6540777683258057, "learning_rate": 1.25e-05, "token_acc": 0.6717530163236338, "epoch": 0.10012515644555695, "step": 40}, {"loss": 1.3371840715408325, "grad_norm": 5.248533248901367, "learning_rate": 1.28125e-05, "token_acc": 0.6693909833904561, "epoch": 0.10262828535669587, "step": 41}, {"loss": 1.3400944471359253, "grad_norm": 3.778581380844116, "learning_rate": 1.3125e-05, "token_acc": 0.6653791581270692, "epoch": 0.10513141426783479, "step": 42}, {"loss": 1.3555524349212646, "grad_norm": 1.4495247602462769, "learning_rate": 1.34375e-05, "token_acc": 0.6599288486416559, "epoch": 0.10763454317897372, "step": 43}, {"loss": 1.323427677154541, "grad_norm": 3.1733644008636475, "learning_rate": 1.3750000000000002e-05, "token_acc": 0.6751474032792182, "epoch": 0.11013767209011265, "step": 44}, {"loss": 1.344847559928894, "grad_norm": 2.605138063430786, "learning_rate": 1.4062500000000001e-05, "token_acc": 0.6617188094694375, "epoch": 0.11264080100125157, "step": 45}, {"loss": 1.306713581085205, "grad_norm": 4.86713981628418, "learning_rate": 1.4374999999999999e-05, "token_acc": 0.6737607941796423, "epoch": 0.11514392991239049, "step": 46}, {"loss": 1.2949577569961548, "grad_norm": 4.361069202423096, "learning_rate": 1.4687500000000001e-05, "token_acc": 0.6895424836601307, "epoch": 0.11764705882352941, "step": 47}, {"loss": 1.3317584991455078, "grad_norm": 1.5775742530822754, "learning_rate": 1.5e-05, "token_acc": 0.6644422636571803, "epoch": 0.12015018773466833, "step": 48}, {"loss": 1.3528285026550293, "grad_norm": 2.20259428024292, "learning_rate": 1.5312500000000003e-05, "token_acc": 0.6621909900865856, "epoch": 0.12265331664580725, "step": 49}, {"loss": 1.1999170780181885, "grad_norm": 2.1786444187164307, "learning_rate": 1.5625e-05, "token_acc": 0.6959557173490251, "epoch": 0.1251564455569462, "step": 50}, {"loss": 1.3457515239715576, "grad_norm": 2.961524248123169, "learning_rate": 1.59375e-05, "token_acc": 0.6627879221864185, "epoch": 0.1276595744680851, "step": 51}, {"loss": 1.3237392902374268, "grad_norm": 13.192907333374023, "learning_rate": 1.6250000000000002e-05, "token_acc": 0.6542852884185423, "epoch": 0.13016270337922403, "step": 52}, {"loss": 1.3433442115783691, "grad_norm": 3.6055777072906494, "learning_rate": 1.65625e-05, "token_acc": 0.6624097352233217, "epoch": 0.13266583229036297, "step": 53}, {"loss": 1.2789276838302612, "grad_norm": 1.7857606410980225, "learning_rate": 1.6875000000000004e-05, "token_acc": 0.672338649851632, "epoch": 0.13516896120150187, "step": 54}, {"loss": 1.3222646713256836, "grad_norm": 2.1665122509002686, "learning_rate": 1.71875e-05, "token_acc": 0.6588819226750261, "epoch": 0.1376720901126408, "step": 55}, {"loss": 1.3362858295440674, "grad_norm": 1.7462254762649536, "learning_rate": 1.75e-05, "token_acc": 0.6613744187138898, "epoch": 0.14017521902377972, "step": 56}, {"loss": 1.2202270030975342, "grad_norm": 1.2184135913848877, "learning_rate": 1.7812500000000003e-05, "token_acc": 0.6888445331559104, "epoch": 0.14267834793491865, "step": 57}, {"loss": 1.224043846130371, "grad_norm": 2.862990379333496, "learning_rate": 1.8125e-05, "token_acc": 0.6924242424242424, "epoch": 0.14518147684605756, "step": 58}, {"loss": 1.1999526023864746, "grad_norm": 4.461820602416992, "learning_rate": 1.84375e-05, "token_acc": 0.6939597315436241, "epoch": 0.1476846057571965, "step": 59}, {"loss": 1.2586383819580078, "grad_norm": 1.0866032838821411, "learning_rate": 1.8750000000000002e-05, "token_acc": 0.6740108140886351, "epoch": 0.15018773466833543, "step": 60}, {"loss": 1.2699849605560303, "grad_norm": 1.9648689031600952, "learning_rate": 1.90625e-05, "token_acc": 0.6729458695772619, "epoch": 0.15269086357947434, "step": 61}, {"loss": 1.26922607421875, "grad_norm": 0.9302283525466919, "learning_rate": 1.9375e-05, "token_acc": 0.6693402228820422, "epoch": 0.15519399249061328, "step": 62}, {"loss": 1.2230749130249023, "grad_norm": 1.6925781965255737, "learning_rate": 1.96875e-05, "token_acc": 0.69140625, "epoch": 0.15769712140175218, "step": 63}, {"loss": 1.2473464012145996, "grad_norm": 3.138141393661499, "learning_rate": 2e-05, "token_acc": 0.671907957813998, "epoch": 0.16020025031289112, "step": 64}, {"loss": 1.2626996040344238, "grad_norm": 84.18292236328125, "learning_rate": 2.0312500000000002e-05, "token_acc": 0.6641408513483397, "epoch": 0.16270337922403003, "step": 65}, {"loss": 1.2514493465423584, "grad_norm": 1.1837621927261353, "learning_rate": 2.0625e-05, "token_acc": 0.6728548072359053, "epoch": 0.16520650813516896, "step": 66}, {"loss": 1.1905746459960938, "grad_norm": 2.1558518409729004, "learning_rate": 2.09375e-05, "token_acc": 0.707898979043525, "epoch": 0.1677096370463079, "step": 67}, {"loss": 1.2563612461090088, "grad_norm": 2.1352062225341797, "learning_rate": 2.125e-05, "token_acc": 0.6748354235740714, "epoch": 0.1702127659574468, "step": 68}, {"loss": 1.2178868055343628, "grad_norm": 4.160109996795654, "learning_rate": 2.1562500000000002e-05, "token_acc": 0.6880837359098229, "epoch": 0.17271589486858574, "step": 69}, {"loss": 1.201242208480835, "grad_norm": 2.219675064086914, "learning_rate": 2.1875e-05, "token_acc": 0.6804117879970587, "epoch": 0.17521902377972465, "step": 70}, {"loss": 1.2328397035598755, "grad_norm": 4.043488502502441, "learning_rate": 2.21875e-05, "token_acc": 0.6700484108608714, "epoch": 0.17772215269086358, "step": 71}, {"loss": 1.2181830406188965, "grad_norm": 1.675660490989685, "learning_rate": 2.25e-05, "token_acc": 0.6850481125092525, "epoch": 0.1802252816020025, "step": 72}, {"loss": 1.0783236026763916, "grad_norm": 3.0427443981170654, "learning_rate": 2.28125e-05, "token_acc": 0.7167288053169071, "epoch": 0.18272841051314143, "step": 73}, {"loss": 1.1844292879104614, "grad_norm": 11.553773880004883, "learning_rate": 2.3125000000000003e-05, "token_acc": 0.6924296745725317, "epoch": 0.18523153942428036, "step": 74}, {"loss": 1.1743783950805664, "grad_norm": 1.2728339433670044, "learning_rate": 2.34375e-05, "token_acc": 0.6912672045562411, "epoch": 0.18773466833541927, "step": 75}, {"loss": 1.0269439220428467, "grad_norm": 2.9700307846069336, "learning_rate": 2.375e-05, "token_acc": 0.7346795022305705, "epoch": 0.1902377972465582, "step": 76}, {"loss": 1.1813220977783203, "grad_norm": 2.9078361988067627, "learning_rate": 2.4062500000000002e-05, "token_acc": 0.6883013798998657, "epoch": 0.1927409261576971, "step": 77}, {"loss": 1.203944444656372, "grad_norm": 3.9725077152252197, "learning_rate": 2.4375e-05, "token_acc": 0.6775247733502003, "epoch": 0.19524405506883605, "step": 78}, {"loss": 1.216745138168335, "grad_norm": 1.538577914237976, "learning_rate": 2.4687500000000004e-05, "token_acc": 0.6754992693619094, "epoch": 0.19774718397997496, "step": 79}, {"loss": 1.2227823734283447, "grad_norm": 1.9446707963943481, "learning_rate": 2.5e-05, "token_acc": 0.6712661046604104, "epoch": 0.2002503128911139, "step": 80}, {"loss": 1.1703464984893799, "grad_norm": 1.4078911542892456, "learning_rate": 2.53125e-05, "token_acc": 0.6871378910776361, "epoch": 0.20275344180225283, "step": 81}, {"loss": 1.2597627639770508, "grad_norm": 0.8193759918212891, "learning_rate": 2.5625e-05, "token_acc": 0.6600334448160535, "epoch": 0.20525657071339173, "step": 82}, {"loss": 1.147017240524292, "grad_norm": 1.5110586881637573, "learning_rate": 2.5937500000000004e-05, "token_acc": 0.6880786212790201, "epoch": 0.20775969962453067, "step": 83}, {"loss": 1.1736788749694824, "grad_norm": 2.4486095905303955, "learning_rate": 2.625e-05, "token_acc": 0.6902223116386681, "epoch": 0.21026282853566958, "step": 84}, {"loss": 1.0476911067962646, "grad_norm": 15.185917854309082, "learning_rate": 2.6562500000000002e-05, "token_acc": 0.7218877279971666, "epoch": 0.2127659574468085, "step": 85}, {"loss": 1.1720056533813477, "grad_norm": 1.7706151008605957, "learning_rate": 2.6875e-05, "token_acc": 0.6911136980985643, "epoch": 0.21526908635794745, "step": 86}, {"loss": 1.1003440618515015, "grad_norm": 2.432227849960327, "learning_rate": 2.71875e-05, "token_acc": 0.7121124031007752, "epoch": 0.21777221526908636, "step": 87}, {"loss": 1.0957496166229248, "grad_norm": 3.5543625354766846, "learning_rate": 2.7500000000000004e-05, "token_acc": 0.70509977827051, "epoch": 0.2202753441802253, "step": 88}, {"loss": 1.1858711242675781, "grad_norm": 6.43117094039917, "learning_rate": 2.7812500000000002e-05, "token_acc": 0.6840046283541793, "epoch": 0.2227784730913642, "step": 89}, {"loss": 0.9773006439208984, "grad_norm": 2.4569075107574463, "learning_rate": 2.8125000000000003e-05, "token_acc": 0.7344842105263157, "epoch": 0.22528160200250313, "step": 90}, {"loss": 1.064300298690796, "grad_norm": 11.663007736206055, "learning_rate": 2.84375e-05, "token_acc": 0.7109963417258446, "epoch": 0.22778473091364204, "step": 91}, {"loss": 1.1586850881576538, "grad_norm": 2.8894364833831787, "learning_rate": 2.8749999999999997e-05, "token_acc": 0.6858779719278144, "epoch": 0.23028785982478098, "step": 92}, {"loss": 1.0098645687103271, "grad_norm": 1.7159028053283691, "learning_rate": 2.9062500000000005e-05, "token_acc": 0.7275060308987322, "epoch": 0.2327909887359199, "step": 93}, {"loss": 1.1714340448379517, "grad_norm": 1.5333527326583862, "learning_rate": 2.9375000000000003e-05, "token_acc": 0.6860140489913544, "epoch": 0.23529411764705882, "step": 94}, {"loss": 1.0821294784545898, "grad_norm": 3.671557903289795, "learning_rate": 2.96875e-05, "token_acc": 0.6963150599818382, "epoch": 0.23779724655819776, "step": 95}, {"loss": 0.9997302889823914, "grad_norm": 5.295556545257568, "learning_rate": 3e-05, "token_acc": 0.7385238523852385, "epoch": 0.24030037546933666, "step": 96}, {"loss": 1.130357265472412, "grad_norm": 2.397625207901001, "learning_rate": 3.0312499999999998e-05, "token_acc": 0.6882726951607206, "epoch": 0.2428035043804756, "step": 97}, {"loss": 1.1520730257034302, "grad_norm": 2.037938356399536, "learning_rate": 3.0625000000000006e-05, "token_acc": 0.6894481533067576, "epoch": 0.2453066332916145, "step": 98}, {"loss": 1.0573893785476685, "grad_norm": 3.0218756198883057, "learning_rate": 3.09375e-05, "token_acc": 0.7125121241513094, "epoch": 0.24780976220275344, "step": 99}, {"loss": 1.0620324611663818, "grad_norm": 3.04327654838562, "learning_rate": 3.125e-05, "token_acc": 0.707827486752968, "epoch": 0.2503128911138924, "step": 100}, {"loss": 1.1085580587387085, "grad_norm": 5.125799655914307, "learning_rate": 3.15625e-05, "token_acc": 0.6982024597918638, "epoch": 0.2528160200250313, "step": 101}, {"loss": 1.1006660461425781, "grad_norm": 4.365977764129639, "learning_rate": 3.1875e-05, "token_acc": 0.6985514046097003, "epoch": 0.2553191489361702, "step": 102}, {"loss": 1.0711305141448975, "grad_norm": 2.454066514968872, "learning_rate": 3.21875e-05, "token_acc": 0.7023084497283104, "epoch": 0.25782227784730916, "step": 103}, {"loss": 1.0082716941833496, "grad_norm": 1.7535096406936646, "learning_rate": 3.2500000000000004e-05, "token_acc": 0.7191448721716133, "epoch": 0.26032540675844806, "step": 104}, {"loss": 1.0638121366500854, "grad_norm": 3.075683116912842, "learning_rate": 3.2812500000000005e-05, "token_acc": 0.7095207815480664, "epoch": 0.26282853566958697, "step": 105}, {"loss": 1.1353557109832764, "grad_norm": 2.3826944828033447, "learning_rate": 3.3125e-05, "token_acc": 0.6854159649713708, "epoch": 0.26533166458072593, "step": 106}, {"loss": 1.0470201969146729, "grad_norm": 1.8979523181915283, "learning_rate": 3.34375e-05, "token_acc": 0.7149484887766937, "epoch": 0.26783479349186484, "step": 107}, {"loss": 0.9918816089630127, "grad_norm": 1.8144444227218628, "learning_rate": 3.375000000000001e-05, "token_acc": 0.722106165300766, "epoch": 0.27033792240300375, "step": 108}, {"loss": 1.0785143375396729, "grad_norm": 3.806840419769287, "learning_rate": 3.40625e-05, "token_acc": 0.6924427887174028, "epoch": 0.27284105131414266, "step": 109}, {"loss": 1.0899507999420166, "grad_norm": 2.5378105640411377, "learning_rate": 3.4375e-05, "token_acc": 0.7045417101433357, "epoch": 0.2753441802252816, "step": 110}, {"loss": 1.0884394645690918, "grad_norm": 1.9893940687179565, "learning_rate": 3.46875e-05, "token_acc": 0.7042693016878635, "epoch": 0.27784730913642053, "step": 111}, {"loss": 0.9752957820892334, "grad_norm": 5.139678001403809, "learning_rate": 3.5e-05, "token_acc": 0.7288215172043732, "epoch": 0.28035043804755944, "step": 112}, {"loss": 1.0316904783248901, "grad_norm": 3.4846577644348145, "learning_rate": 3.5312500000000005e-05, "token_acc": 0.7174084803792468, "epoch": 0.2828535669586984, "step": 113}, {"loss": 1.022270917892456, "grad_norm": 3.4321818351745605, "learning_rate": 3.5625000000000005e-05, "token_acc": 0.7156758903746856, "epoch": 0.2853566958698373, "step": 114}, {"loss": 1.1368576288223267, "grad_norm": 2.8689022064208984, "learning_rate": 3.59375e-05, "token_acc": 0.6861952181165647, "epoch": 0.2878598247809762, "step": 115}, {"loss": 1.0494530200958252, "grad_norm": 1.8734346628189087, "learning_rate": 3.625e-05, "token_acc": 0.7091768631813126, "epoch": 0.2903629536921151, "step": 116}, {"loss": 0.9063711166381836, "grad_norm": 2.329326629638672, "learning_rate": 3.65625e-05, "token_acc": 0.7585655778643492, "epoch": 0.2928660826032541, "step": 117}, {"loss": 1.0875568389892578, "grad_norm": 1.9864639043807983, "learning_rate": 3.6875e-05, "token_acc": 0.7017193984800302, "epoch": 0.295369211514393, "step": 118}, {"loss": 1.0767862796783447, "grad_norm": 3.4826865196228027, "learning_rate": 3.71875e-05, "token_acc": 0.7015383266862427, "epoch": 0.2978723404255319, "step": 119}, {"loss": 0.9985078573226929, "grad_norm": 3.474165201187134, "learning_rate": 3.7500000000000003e-05, "token_acc": 0.7192602563352256, "epoch": 0.30037546933667086, "step": 120}, {"loss": 1.0274770259857178, "grad_norm": 15.018126487731934, "learning_rate": 3.78125e-05, "token_acc": 0.716270783847981, "epoch": 0.30287859824780977, "step": 121}, {"loss": 0.9960276484489441, "grad_norm": 2.6608524322509766, "learning_rate": 3.8125e-05, "token_acc": 0.7227157360406091, "epoch": 0.3053817271589487, "step": 122}, {"loss": 1.0952248573303223, "grad_norm": 3.8320107460021973, "learning_rate": 3.8437500000000006e-05, "token_acc": 0.6966855558726406, "epoch": 0.3078848560700876, "step": 123}, {"loss": 1.0360908508300781, "grad_norm": 3.4052140712738037, "learning_rate": 3.875e-05, "token_acc": 0.7139331547031448, "epoch": 0.31038798498122655, "step": 124}, {"loss": 0.9304947853088379, "grad_norm": 2.294705390930176, "learning_rate": 3.90625e-05, "token_acc": 0.7381878821567538, "epoch": 0.31289111389236546, "step": 125}, {"loss": 0.9146929383277893, "grad_norm": 5.569668769836426, "learning_rate": 3.9375e-05, "token_acc": 0.7442802870409455, "epoch": 0.31539424280350437, "step": 126}, {"loss": 0.8794465661048889, "grad_norm": 4.5205397605896, "learning_rate": 3.96875e-05, "token_acc": 0.7579816513761468, "epoch": 0.31789737171464333, "step": 127}, {"loss": 1.015094518661499, "grad_norm": 3.539724588394165, "learning_rate": 4e-05, "token_acc": 0.7137131788123706, "epoch": 0.32040050062578224, "step": 128}, {"loss": 1.0014472007751465, "grad_norm": 3.903836965560913, "learning_rate": 4.0312500000000004e-05, "token_acc": 0.7209395973154362, "epoch": 0.32290362953692114, "step": 129}, {"loss": 0.984825074672699, "grad_norm": 2.7150936126708984, "learning_rate": 4.0625000000000005e-05, "token_acc": 0.7249438719705256, "epoch": 0.32540675844806005, "step": 130}, {"loss": 0.8905125856399536, "grad_norm": 3.824404716491699, "learning_rate": 4.09375e-05, "token_acc": 0.7577065883775149, "epoch": 0.327909887359199, "step": 131}, {"loss": 0.980827271938324, "grad_norm": 4.411902904510498, "learning_rate": 4.125e-05, "token_acc": 0.7225544750117011, "epoch": 0.3304130162703379, "step": 132}, {"loss": 1.0253760814666748, "grad_norm": 5.346670150756836, "learning_rate": 4.156250000000001e-05, "token_acc": 0.7098936760749819, "epoch": 0.33291614518147683, "step": 133}, {"loss": 0.9548345804214478, "grad_norm": 2.1438992023468018, "learning_rate": 4.1875e-05, "token_acc": 0.7338397692902863, "epoch": 0.3354192740926158, "step": 134}, {"loss": 0.8847500681877136, "grad_norm": 4.1644606590271, "learning_rate": 4.21875e-05, "token_acc": 0.7524723391755606, "epoch": 0.3379224030037547, "step": 135}, {"loss": 1.073623538017273, "grad_norm": 2.005262613296509, "learning_rate": 4.25e-05, "token_acc": 0.6994131997098965, "epoch": 0.3404255319148936, "step": 136}, {"loss": 1.0128499269485474, "grad_norm": 2.246750593185425, "learning_rate": 4.28125e-05, "token_acc": 0.7144232826877809, "epoch": 0.3429286608260325, "step": 137}, {"loss": 0.83775395154953, "grad_norm": 3.925265073776245, "learning_rate": 4.3125000000000005e-05, "token_acc": 0.772547828727604, "epoch": 0.3454317897371715, "step": 138}, {"loss": 0.9593348503112793, "grad_norm": 12.726314544677734, "learning_rate": 4.3437500000000006e-05, "token_acc": 0.7316725055144674, "epoch": 0.3479349186483104, "step": 139}, {"loss": 0.9028947949409485, "grad_norm": 2.6994714736938477, "learning_rate": 4.375e-05, "token_acc": 0.7460494101936346, "epoch": 0.3504380475594493, "step": 140}, {"loss": 0.8996214270591736, "grad_norm": 3.9808058738708496, "learning_rate": 4.40625e-05, "token_acc": 0.7425867507886436, "epoch": 0.35294117647058826, "step": 141}, {"loss": 1.0384089946746826, "grad_norm": 1.2212865352630615, "learning_rate": 4.4375e-05, "token_acc": 0.7121201463140123, "epoch": 0.35544430538172717, "step": 142}, {"loss": 0.9263251423835754, "grad_norm": 3.9611852169036865, "learning_rate": 4.46875e-05, "token_acc": 0.740031723458951, "epoch": 0.3579474342928661, "step": 143}, {"loss": 0.9607938528060913, "grad_norm": 5.350156307220459, "learning_rate": 4.5e-05, "token_acc": 0.7303436535801681, "epoch": 0.360450563204005, "step": 144}, {"loss": 0.9440912008285522, "grad_norm": 1.4106866121292114, "learning_rate": 4.5312500000000004e-05, "token_acc": 0.7313729139524784, "epoch": 0.36295369211514394, "step": 145}, {"loss": 0.9318268299102783, "grad_norm": 3.6181912422180176, "learning_rate": 4.5625e-05, "token_acc": 0.7333581652743043, "epoch": 0.36545682102628285, "step": 146}, {"loss": 0.8572186231613159, "grad_norm": 2.850383758544922, "learning_rate": 4.59375e-05, "token_acc": 0.7507500914745701, "epoch": 0.36795994993742176, "step": 147}, {"loss": 0.9332783818244934, "grad_norm": 3.677313804626465, "learning_rate": 4.6250000000000006e-05, "token_acc": 0.7401175938489372, "epoch": 0.3704630788485607, "step": 148}, {"loss": 1.0429058074951172, "grad_norm": 1.3261946439743042, "learning_rate": 4.65625e-05, "token_acc": 0.7028539965128017, "epoch": 0.37296620775969963, "step": 149}, {"loss": 0.977657675743103, "grad_norm": 3.0652029514312744, "learning_rate": 4.6875e-05, "token_acc": 0.7199633139712626, "epoch": 0.37546933667083854, "step": 150}, {"loss": 1.027328610420227, "grad_norm": 20.230405807495117, "learning_rate": 4.71875e-05, "token_acc": 0.7118949681636333, "epoch": 0.37797246558197745, "step": 151}, {"loss": 0.8688861727714539, "grad_norm": 3.0481197834014893, "learning_rate": 4.75e-05, "token_acc": 0.7510847854535436, "epoch": 0.3804755944931164, "step": 152}, {"loss": 1.033332347869873, "grad_norm": 5.976290225982666, "learning_rate": 4.7812500000000003e-05, "token_acc": 0.7093079141300865, "epoch": 0.3829787234042553, "step": 153}, {"loss": 0.9014919996261597, "grad_norm": 3.429054021835327, "learning_rate": 4.8125000000000004e-05, "token_acc": 0.7435937257338096, "epoch": 0.3854818523153942, "step": 154}, {"loss": 0.9900403022766113, "grad_norm": 1.6205755472183228, "learning_rate": 4.8437500000000005e-05, "token_acc": 0.7184128821764985, "epoch": 0.3879849812265332, "step": 155}, {"loss": 0.8962844610214233, "grad_norm": 10.175098419189453, "learning_rate": 4.875e-05, "token_acc": 0.7435897435897436, "epoch": 0.3904881101376721, "step": 156}, {"loss": 0.9664689302444458, "grad_norm": 1.2148970365524292, "learning_rate": 4.90625e-05, "token_acc": 0.7256873527101335, "epoch": 0.392991239048811, "step": 157}, {"loss": 0.857364296913147, "grad_norm": 1.4516433477401733, "learning_rate": 4.937500000000001e-05, "token_acc": 0.751648804616653, "epoch": 0.3954943679599499, "step": 158}, {"loss": 0.8872854709625244, "grad_norm": 2.4918766021728516, "learning_rate": 4.96875e-05, "token_acc": 0.7495879573673223, "epoch": 0.3979974968710889, "step": 159}, {"loss": 0.9493648409843445, "grad_norm": 1.7210731506347656, "learning_rate": 5e-05, "token_acc": 0.7264301870138468, "epoch": 0.4005006257822278, "step": 160}, {"loss": 0.8796491622924805, "grad_norm": 6.053183555603027, "learning_rate": 4.9999698804181425e-05, "token_acc": 0.7541715628672151, "epoch": 0.4030037546933667, "step": 161}, {"loss": 0.8858709335327148, "grad_norm": 2.3308753967285156, "learning_rate": 4.9998795223983205e-05, "token_acc": 0.7452508843180925, "epoch": 0.40550688360450565, "step": 162}, {"loss": 0.8514291644096375, "grad_norm": 2.514087200164795, "learning_rate": 4.99972892811777e-05, "token_acc": 0.7531689065363469, "epoch": 0.40801001251564456, "step": 163}, {"loss": 1.0399848222732544, "grad_norm": 3.979966878890991, "learning_rate": 4.9995181012051625e-05, "token_acc": 0.7055028462998102, "epoch": 0.41051314142678347, "step": 164}, {"loss": 0.9388617277145386, "grad_norm": 1.8825353384017944, "learning_rate": 4.9992470467405104e-05, "token_acc": 0.7314329823013729, "epoch": 0.4130162703379224, "step": 165}, {"loss": 0.9585274457931519, "grad_norm": 1.460411787033081, "learning_rate": 4.998915771255053e-05, "token_acc": 0.7233919943259897, "epoch": 0.41551939924906134, "step": 166}, {"loss": 0.8713458776473999, "grad_norm": 2.5048015117645264, "learning_rate": 4.9985242827310936e-05, "token_acc": 0.7487620536877769, "epoch": 0.41802252816020025, "step": 167}, {"loss": 0.9545108079910278, "grad_norm": 1.3289780616760254, "learning_rate": 4.9980725906018074e-05, "token_acc": 0.7243544303797468, "epoch": 0.42052565707133915, "step": 168}, {"loss": 0.8003573417663574, "grad_norm": 8.591806411743164, "learning_rate": 4.9975607057510185e-05, "token_acc": 0.7734825957670106, "epoch": 0.4230287859824781, "step": 169}, {"loss": 0.8462347984313965, "grad_norm": 2.1393492221832275, "learning_rate": 4.996988640512931e-05, "token_acc": 0.7583013515768396, "epoch": 0.425531914893617, "step": 170}, {"loss": 0.8536550998687744, "grad_norm": 2.350606679916382, "learning_rate": 4.99635640867184e-05, "token_acc": 0.7583616526560544, "epoch": 0.42803504380475593, "step": 171}, {"loss": 0.8206404447555542, "grad_norm": 2.1374306678771973, "learning_rate": 4.9956640254617906e-05, "token_acc": 0.7580493637372961, "epoch": 0.4305381727158949, "step": 172}, {"loss": 1.0032633543014526, "grad_norm": 1.5408402681350708, "learning_rate": 4.994911507566217e-05, "token_acc": 0.7122946175637394, "epoch": 0.4330413016270338, "step": 173}, {"loss": 0.9755508303642273, "grad_norm": 7.398180961608887, "learning_rate": 4.99409887311754e-05, "token_acc": 0.72718616887998, "epoch": 0.4355444305381727, "step": 174}, {"loss": 0.8316116333007812, "grad_norm": 34.215980529785156, "learning_rate": 4.993226141696726e-05, "token_acc": 0.7651929504709815, "epoch": 0.4380475594493116, "step": 175}, {"loss": 0.9263297319412231, "grad_norm": 1.1946734189987183, "learning_rate": 4.99229333433282e-05, "token_acc": 0.7333371021538809, "epoch": 0.4405506883604506, "step": 176}, {"loss": 0.865764856338501, "grad_norm": 3.4196677207946777, "learning_rate": 4.991300473502437e-05, "token_acc": 0.7536853599563217, "epoch": 0.4430538172715895, "step": 177}, {"loss": 1.0150288343429565, "grad_norm": 0.84961998462677, "learning_rate": 4.9902475831292185e-05, "token_acc": 0.7088443038523204, "epoch": 0.4455569461827284, "step": 178}, {"loss": 0.8582470417022705, "grad_norm": 3.249678611755371, "learning_rate": 4.9891346885832586e-05, "token_acc": 0.7626390957679838, "epoch": 0.44806007509386736, "step": 179}, {"loss": 0.9166827201843262, "grad_norm": 1.03476881980896, "learning_rate": 4.987961816680492e-05, "token_acc": 0.7448330683624801, "epoch": 0.45056320400500627, "step": 180}, {"loss": 0.8242158889770508, "grad_norm": 3.3579049110412598, "learning_rate": 4.986728995682049e-05, "token_acc": 0.763468992248062, "epoch": 0.4530663329161452, "step": 181}, {"loss": 0.9542834758758545, "grad_norm": 2.1550583839416504, "learning_rate": 4.9854362552935706e-05, "token_acc": 0.7280744258164551, "epoch": 0.4555694618272841, "step": 182}, {"loss": 0.9628951549530029, "grad_norm": 1.229475975036621, "learning_rate": 4.984083626664497e-05, "token_acc": 0.7275876331299762, "epoch": 0.45807259073842305, "step": 183}, {"loss": 0.9437664151191711, "grad_norm": 1.3542944192886353, "learning_rate": 4.982671142387316e-05, "token_acc": 0.7304563628843237, "epoch": 0.46057571964956195, "step": 184}, {"loss": 0.8541402816772461, "grad_norm": 2.5428855419158936, "learning_rate": 4.981198836496775e-05, "token_acc": 0.7521788023615407, "epoch": 0.46307884856070086, "step": 185}, {"loss": 1.0094258785247803, "grad_norm": 2.5485925674438477, "learning_rate": 4.979666744469065e-05, "token_acc": 0.7157740901376579, "epoch": 0.4655819774718398, "step": 186}, {"loss": 0.8787280917167664, "grad_norm": 1.8278656005859375, "learning_rate": 4.978074903220963e-05, "token_acc": 0.7516580692704495, "epoch": 0.46808510638297873, "step": 187}, {"loss": 0.9875797033309937, "grad_norm": 4.457269191741943, "learning_rate": 4.976423351108943e-05, "token_acc": 0.7228752642706131, "epoch": 0.47058823529411764, "step": 188}, {"loss": 0.8471859693527222, "grad_norm": 3.185421943664551, "learning_rate": 4.9747121279282525e-05, "token_acc": 0.7519582245430809, "epoch": 0.47309136420525655, "step": 189}, {"loss": 0.8586404323577881, "grad_norm": 6.704853534698486, "learning_rate": 4.972941274911953e-05, "token_acc": 0.7541206247299216, "epoch": 0.4755944931163955, "step": 190}, {"loss": 0.8798616528511047, "grad_norm": 1.5821382999420166, "learning_rate": 4.971110834729925e-05, "token_acc": 0.7469811850603763, "epoch": 0.4780976220275344, "step": 191}, {"loss": 0.8191840648651123, "grad_norm": 10.706079483032227, "learning_rate": 4.9692208514878444e-05, "token_acc": 0.763384590612672, "epoch": 0.4806007509386733, "step": 192}, {"loss": 0.833245575428009, "grad_norm": 5.072082996368408, "learning_rate": 4.9672713707261146e-05, "token_acc": 0.7563102340523176, "epoch": 0.4831038798498123, "step": 193}, {"loss": 0.9354732036590576, "grad_norm": 1.3364410400390625, "learning_rate": 4.965262439418772e-05, "token_acc": 0.7303690195237074, "epoch": 0.4856070087609512, "step": 194}, {"loss": 0.7941551208496094, "grad_norm": 8.606874465942383, "learning_rate": 4.963194105972353e-05, "token_acc": 0.766449806472865, "epoch": 0.4881101376720901, "step": 195}, {"loss": 0.8962496519088745, "grad_norm": 2.6359663009643555, "learning_rate": 4.9610664202247294e-05, "token_acc": 0.7337984211492564, "epoch": 0.490613266583229, "step": 196}, {"loss": 0.8074665069580078, "grad_norm": 4.913934707641602, "learning_rate": 4.958879433443904e-05, "token_acc": 0.766220939067011, "epoch": 0.493116395494368, "step": 197}, {"loss": 1.0043327808380127, "grad_norm": 14.050993919372559, "learning_rate": 4.95663319832678e-05, "token_acc": 0.7157577609920098, "epoch": 0.4956195244055069, "step": 198}, {"loss": 0.8978754281997681, "grad_norm": 1.2029297351837158, "learning_rate": 4.954327768997886e-05, "token_acc": 0.7365190705830776, "epoch": 0.4981226533166458, "step": 199}, {"loss": 0.837005078792572, "grad_norm": 1.6810232400894165, "learning_rate": 4.951963201008076e-05, "token_acc": 0.7567454682148526, "epoch": 0.5006257822277848, "step": 200}, {"loss": 0.8861300945281982, "grad_norm": 1.762834072113037, "learning_rate": 4.949539551333191e-05, "token_acc": 0.745210849086426, "epoch": 0.5031289111389237, "step": 201}, {"loss": 0.7754945158958435, "grad_norm": 2.8837828636169434, "learning_rate": 4.947056878372681e-05, "token_acc": 0.7765665374677002, "epoch": 0.5056320400500626, "step": 202}, {"loss": 0.8974159359931946, "grad_norm": 4.415988922119141, "learning_rate": 4.944515241948204e-05, "token_acc": 0.7422455780569085, "epoch": 0.5081351689612015, "step": 203}, {"loss": 0.9800943732261658, "grad_norm": 1.2022016048431396, "learning_rate": 4.9419147033021814e-05, "token_acc": 0.7206211812627291, "epoch": 0.5106382978723404, "step": 204}, {"loss": 0.8181082010269165, "grad_norm": 3.1489412784576416, "learning_rate": 4.9392553250963215e-05, "token_acc": 0.7677832141512985, "epoch": 0.5131414267834794, "step": 205}, {"loss": 0.9568559527397156, "grad_norm": 2.7361836433410645, "learning_rate": 4.936537171410113e-05, "token_acc": 0.725022063263505, "epoch": 0.5156445556946183, "step": 206}, {"loss": 0.8899260759353638, "grad_norm": 1.2395085096359253, "learning_rate": 4.933760307739277e-05, "token_acc": 0.7444645472559662, "epoch": 0.5181476846057572, "step": 207}, {"loss": 0.793695330619812, "grad_norm": 11.254620552062988, "learning_rate": 4.9309248009941914e-05, "token_acc": 0.7653651482284888, "epoch": 0.5206508135168961, "step": 208}, {"loss": 0.9342561960220337, "grad_norm": 1.9917453527450562, "learning_rate": 4.92803071949828e-05, "token_acc": 0.7262987886944818, "epoch": 0.523153942428035, "step": 209}, {"loss": 0.9557225704193115, "grad_norm": 1.3936560153961182, "learning_rate": 4.9250781329863606e-05, "token_acc": 0.7319856537332898, "epoch": 0.5256570713391739, "step": 210}, {"loss": 0.9270342588424683, "grad_norm": 1.602947473526001, "learning_rate": 4.92206711260297e-05, "token_acc": 0.730816476947015, "epoch": 0.5281602002503129, "step": 211}, {"loss": 0.9432080388069153, "grad_norm": 2.341012477874756, "learning_rate": 4.9189977309006495e-05, "token_acc": 0.7277580071174378, "epoch": 0.5306633291614519, "step": 212}, {"loss": 0.8968133330345154, "grad_norm": 1.3441163301467896, "learning_rate": 4.915870061838193e-05, "token_acc": 0.7424508426966292, "epoch": 0.5331664580725908, "step": 213}, {"loss": 0.8623098134994507, "grad_norm": 4.8920722007751465, "learning_rate": 4.912684180778869e-05, "token_acc": 0.7460244648318043, "epoch": 0.5356695869837297, "step": 214}, {"loss": 0.9887412190437317, "grad_norm": 2.7736644744873047, "learning_rate": 4.9094401644886e-05, "token_acc": 0.7158999839717903, "epoch": 0.5381727158948686, "step": 215}, {"loss": 0.9436683058738708, "grad_norm": 1.6230074167251587, "learning_rate": 4.906138091134118e-05, "token_acc": 0.7280187056072704, "epoch": 0.5406758448060075, "step": 216}, {"loss": 0.7515861988067627, "grad_norm": 3.8004024028778076, "learning_rate": 4.90277804028108e-05, "token_acc": 0.7878668891724747, "epoch": 0.5431789737171464, "step": 217}, {"loss": 0.9568852186203003, "grad_norm": 1.2686784267425537, "learning_rate": 4.8993600928921434e-05, "token_acc": 0.722643138007097, "epoch": 0.5456821026282853, "step": 218}, {"loss": 0.7561929225921631, "grad_norm": 2.203845500946045, "learning_rate": 4.8958843313250294e-05, "token_acc": 0.7821512081060016, "epoch": 0.5481852315394243, "step": 219}, {"loss": 0.9007571935653687, "grad_norm": 60.95647048950195, "learning_rate": 4.892350839330522e-05, "token_acc": 0.7362854803493449, "epoch": 0.5506883604505632, "step": 220}, {"loss": 0.8568707704544067, "grad_norm": 1.3951096534729004, "learning_rate": 4.888759702050466e-05, "token_acc": 0.7503653902367728, "epoch": 0.5531914893617021, "step": 221}, {"loss": 0.8863348960876465, "grad_norm": 4.732699871063232, "learning_rate": 4.885111006015701e-05, "token_acc": 0.7456376192735515, "epoch": 0.5556946182728411, "step": 222}, {"loss": 0.8580335974693298, "grad_norm": 1.9262758493423462, "learning_rate": 4.881404839143988e-05, "token_acc": 0.7447225981055481, "epoch": 0.55819774718398, "step": 223}, {"loss": 0.816256046295166, "grad_norm": 2.428048610687256, "learning_rate": 4.877641290737884e-05, "token_acc": 0.7594610513915476, "epoch": 0.5607008760951189, "step": 224}, {"loss": 0.8992019295692444, "grad_norm": 1.8479973077774048, "learning_rate": 4.873820451482592e-05, "token_acc": 0.747414978184209, "epoch": 0.5632040050062578, "step": 225}, {"loss": 0.8981590270996094, "grad_norm": 1.2170461416244507, "learning_rate": 4.8699424134437765e-05, "token_acc": 0.7403604836869724, "epoch": 0.5657071339173968, "step": 226}, {"loss": 0.8538397550582886, "grad_norm": 1.4078121185302734, "learning_rate": 4.8660072700653445e-05, "token_acc": 0.7566088200534926, "epoch": 0.5682102628285357, "step": 227}, {"loss": 0.8955122828483582, "grad_norm": 1.7292224168777466, "learning_rate": 4.862015116167196e-05, "token_acc": 0.7407333994053519, "epoch": 0.5707133917396746, "step": 228}, {"loss": 0.8418647646903992, "grad_norm": 1.772873878479004, "learning_rate": 4.857966047942933e-05, "token_acc": 0.7579768207182715, "epoch": 0.5732165206508135, "step": 229}, {"loss": 0.9011165499687195, "grad_norm": 2.3586251735687256, "learning_rate": 4.853860162957552e-05, "token_acc": 0.7370127630217316, "epoch": 0.5757196495619524, "step": 230}, {"loss": 0.6907041668891907, "grad_norm": 1.4242304563522339, "learning_rate": 4.849697560145083e-05, "token_acc": 0.7974857772068269, "epoch": 0.5782227784730913, "step": 231}, {"loss": 0.838218092918396, "grad_norm": 2.375168561935425, "learning_rate": 4.8454783398062106e-05, "token_acc": 0.756889252024066, "epoch": 0.5807259073842302, "step": 232}, {"loss": 0.8434799313545227, "grad_norm": 2.9053637981414795, "learning_rate": 4.8412026036058566e-05, "token_acc": 0.7536370711848172, "epoch": 0.5832290362953693, "step": 233}, {"loss": 0.8246455788612366, "grad_norm": 1.854264259338379, "learning_rate": 4.836870454570731e-05, "token_acc": 0.7580336387255572, "epoch": 0.5857321652065082, "step": 234}, {"loss": 0.8148558139801025, "grad_norm": 4.344927787780762, "learning_rate": 4.8324819970868473e-05, "token_acc": 0.757310740639519, "epoch": 0.5882352941176471, "step": 235}, {"loss": 0.8641375303268433, "grad_norm": 8.028459548950195, "learning_rate": 4.828037336897009e-05, "token_acc": 0.7445998946320904, "epoch": 0.590738423028786, "step": 236}, {"loss": 0.9830830693244934, "grad_norm": 10.524628639221191, "learning_rate": 4.8235365810982615e-05, "token_acc": 0.7152842788491544, "epoch": 0.5932415519399249, "step": 237}, {"loss": 0.8133025765419006, "grad_norm": 1.7903722524642944, "learning_rate": 4.8189798381393104e-05, "token_acc": 0.7577724358974359, "epoch": 0.5957446808510638, "step": 238}, {"loss": 0.8893339037895203, "grad_norm": 1.2249422073364258, "learning_rate": 4.81436721781791e-05, "token_acc": 0.745752359800111, "epoch": 0.5982478097622027, "step": 239}, {"loss": 0.8640246391296387, "grad_norm": 15.711007118225098, "learning_rate": 4.8096988312782174e-05, "token_acc": 0.7455461092760058, "epoch": 0.6007509386733417, "step": 240}, {"loss": 0.7105808258056641, "grad_norm": 17.570682525634766, "learning_rate": 4.8049747910081117e-05, "token_acc": 0.7925288608146374, "epoch": 0.6032540675844806, "step": 241}, {"loss": 0.9153680205345154, "grad_norm": 3.0752291679382324, "learning_rate": 4.8001952108364876e-05, "token_acc": 0.7310617855077621, "epoch": 0.6057571964956195, "step": 242}, {"loss": 0.938827633857727, "grad_norm": 1.167055606842041, "learning_rate": 4.79536020593051e-05, "token_acc": 0.7255839744922714, "epoch": 0.6082603254067585, "step": 243}, {"loss": 0.853781521320343, "grad_norm": 1.852413535118103, "learning_rate": 4.7904698927928406e-05, "token_acc": 0.7508854781582054, "epoch": 0.6107634543178974, "step": 244}, {"loss": 0.9472495317459106, "grad_norm": 1.5053846836090088, "learning_rate": 4.785524389258827e-05, "token_acc": 0.7277364588606363, "epoch": 0.6132665832290363, "step": 245}, {"loss": 0.8951740860939026, "grad_norm": 3.108750820159912, "learning_rate": 4.7805238144936694e-05, "token_acc": 0.7357894216998371, "epoch": 0.6157697121401752, "step": 246}, {"loss": 0.7866122722625732, "grad_norm": 2.4686100482940674, "learning_rate": 4.7754682889895446e-05, "token_acc": 0.7723662389805359, "epoch": 0.6182728410513142, "step": 247}, {"loss": 0.8967963457107544, "grad_norm": 1.967427372932434, "learning_rate": 4.7703579345627035e-05, "token_acc": 0.7343396554724204, "epoch": 0.6207759699624531, "step": 248}, {"loss": 0.9204596877098083, "grad_norm": 3.1070291996002197, "learning_rate": 4.765192874350537e-05, "token_acc": 0.7327885874226897, "epoch": 0.623279098873592, "step": 249}, {"loss": 0.7575951814651489, "grad_norm": 1.856003761291504, "learning_rate": 4.759973232808609e-05, "token_acc": 0.7788233433496757, "epoch": 0.6257822277847309, "step": 250}, {"loss": 0.8490856289863586, "grad_norm": 1.840150237083435, "learning_rate": 4.7546991357076544e-05, "token_acc": 0.7549613056470769, "epoch": 0.6282853566958698, "step": 251}, {"loss": 0.8861610293388367, "grad_norm": 1.0170334577560425, "learning_rate": 4.749370710130554e-05, "token_acc": 0.7378573411046351, "epoch": 0.6307884856070087, "step": 252}, {"loss": 0.8459495902061462, "grad_norm": 1.2947522401809692, "learning_rate": 4.7439880844692675e-05, "token_acc": 0.7514053303352953, "epoch": 0.6332916145181476, "step": 253}, {"loss": 0.7556009888648987, "grad_norm": 1.4557151794433594, "learning_rate": 4.738551388421743e-05, "token_acc": 0.7733115022513304, "epoch": 0.6357947434292867, "step": 254}, {"loss": 0.7291783094406128, "grad_norm": 5.058238983154297, "learning_rate": 4.7330607529887884e-05, "token_acc": 0.7859242925395076, "epoch": 0.6382978723404256, "step": 255}, {"loss": 0.8316564559936523, "grad_norm": 1.114750623703003, "learning_rate": 4.72751631047092e-05, "token_acc": 0.7554670474186518, "epoch": 0.6408010012515645, "step": 256}, {"loss": 0.8008612394332886, "grad_norm": 2.487441301345825, "learning_rate": 4.721918194465169e-05, "token_acc": 0.7658649666763258, "epoch": 0.6433041301627034, "step": 257}, {"loss": 0.7932621240615845, "grad_norm": 3.9729726314544678, "learning_rate": 4.7162665398618664e-05, "token_acc": 0.7653622505107653, "epoch": 0.6458072590738423, "step": 258}, {"loss": 0.8352819085121155, "grad_norm": 1.7285813093185425, "learning_rate": 4.7105614828413906e-05, "token_acc": 0.7518584505744301, "epoch": 0.6483103879849812, "step": 259}, {"loss": 0.8903557658195496, "grad_norm": 1.6816480159759521, "learning_rate": 4.7048031608708876e-05, "token_acc": 0.7417663664471031, "epoch": 0.6508135168961201, "step": 260}, {"loss": 0.9234253168106079, "grad_norm": 2.6574323177337646, "learning_rate": 4.698991712700958e-05, "token_acc": 0.7320945263583114, "epoch": 0.6533166458072591, "step": 261}, {"loss": 0.7536015510559082, "grad_norm": 2.6559009552001953, "learning_rate": 4.693127278362311e-05, "token_acc": 0.7836038664964435, "epoch": 0.655819774718398, "step": 262}, {"loss": 0.9138115048408508, "grad_norm": 1.3639440536499023, "learning_rate": 4.687209999162396e-05, "token_acc": 0.73465387392964, "epoch": 0.6583229036295369, "step": 263}, {"loss": 0.9767469763755798, "grad_norm": 1.4643888473510742, "learning_rate": 4.681240017681993e-05, "token_acc": 0.7182791953322303, "epoch": 0.6608260325406758, "step": 264}, {"loss": 0.8130522966384888, "grad_norm": 1.210517168045044, "learning_rate": 4.6752174777717786e-05, "token_acc": 0.7663620788121074, "epoch": 0.6633291614518148, "step": 265}, {"loss": 0.8405072093009949, "grad_norm": 2.5332179069519043, "learning_rate": 4.6691425245488607e-05, "token_acc": 0.750514050719671, "epoch": 0.6658322903629537, "step": 266}, {"loss": 0.9550877809524536, "grad_norm": 0.8559168577194214, "learning_rate": 4.6630153043932784e-05, "token_acc": 0.7296061884669479, "epoch": 0.6683354192740926, "step": 267}, {"loss": 0.8482018113136292, "grad_norm": 1.4378278255462646, "learning_rate": 4.65683596494448e-05, "token_acc": 0.756345916066623, "epoch": 0.6708385481852316, "step": 268}, {"loss": 0.8772472143173218, "grad_norm": 11.279638290405273, "learning_rate": 4.650604655097761e-05, "token_acc": 0.7447105454139452, "epoch": 0.6733416770963705, "step": 269}, {"loss": 0.8368943929672241, "grad_norm": 1.9061810970306396, "learning_rate": 4.6443215250006806e-05, "token_acc": 0.7592273445354014, "epoch": 0.6758448060075094, "step": 270}, {"loss": 0.8612409234046936, "grad_norm": 1.9233216047286987, "learning_rate": 4.637986726049438e-05, "token_acc": 0.7476107285993218, "epoch": 0.6783479349186483, "step": 271}, {"loss": 0.8825200796127319, "grad_norm": 4.400722980499268, "learning_rate": 4.6316004108852305e-05, "token_acc": 0.7407547988287604, "epoch": 0.6808510638297872, "step": 272}, {"loss": 0.827918529510498, "grad_norm": 1.9921467304229736, "learning_rate": 4.6251627333905724e-05, "token_acc": 0.7584293340826075, "epoch": 0.6833541927409261, "step": 273}, {"loss": 0.8006143569946289, "grad_norm": 1.7633479833602905, "learning_rate": 4.618673848685586e-05, "token_acc": 0.7614477652865369, "epoch": 0.685857321652065, "step": 274}, {"loss": 0.8252323865890503, "grad_norm": 2.8810698986053467, "learning_rate": 4.612133913124268e-05, "token_acc": 0.757303946694003, "epoch": 0.688360450563204, "step": 275}, {"loss": 0.8325484991073608, "grad_norm": 3.151297092437744, "learning_rate": 4.6055430842907167e-05, "token_acc": 0.7542700046794572, "epoch": 0.690863579474343, "step": 276}, {"loss": 0.916891872882843, "grad_norm": 2.637824535369873, "learning_rate": 4.59890152099534e-05, "token_acc": 0.7303461130806622, "epoch": 0.6933667083854819, "step": 277}, {"loss": 0.8716385364532471, "grad_norm": 3.002065896987915, "learning_rate": 4.5922093832710236e-05, "token_acc": 0.744375139229227, "epoch": 0.6958698372966208, "step": 278}, {"loss": 0.8470830917358398, "grad_norm": 4.198055267333984, "learning_rate": 4.585466832369281e-05, "token_acc": 0.75168222270458, "epoch": 0.6983729662077597, "step": 279}, {"loss": 0.7896092534065247, "grad_norm": 1.8871791362762451, "learning_rate": 4.5786740307563636e-05, "token_acc": 0.7681891866119958, "epoch": 0.7008760951188986, "step": 280}, {"loss": 0.9307687282562256, "grad_norm": 1.5660463571548462, "learning_rate": 4.5718311421093454e-05, "token_acc": 0.7255500518373459, "epoch": 0.7033792240300375, "step": 281}, {"loss": 0.8658042550086975, "grad_norm": 5.349212169647217, "learning_rate": 4.5649383313121827e-05, "token_acc": 0.7448989748183538, "epoch": 0.7058823529411765, "step": 282}, {"loss": 0.8970195651054382, "grad_norm": 1.4808748960494995, "learning_rate": 4.55799576445174e-05, "token_acc": 0.7391180003431905, "epoch": 0.7083854818523154, "step": 283}, {"loss": 0.7446900606155396, "grad_norm": 2.455500364303589, "learning_rate": 4.551003608813784e-05, "token_acc": 0.779041869824317, "epoch": 0.7108886107634543, "step": 284}, {"loss": 0.7530452013015747, "grad_norm": 4.634961128234863, "learning_rate": 4.5439620328789593e-05, "token_acc": 0.7835355578024941, "epoch": 0.7133917396745932, "step": 285}, {"loss": 0.7370263338088989, "grad_norm": 2.1206021308898926, "learning_rate": 4.536871206318723e-05, "token_acc": 0.778288729739917, "epoch": 0.7158948685857321, "step": 286}, {"loss": 0.9229286313056946, "grad_norm": 1.4169611930847168, "learning_rate": 4.529731299991262e-05, "token_acc": 0.7339485313231089, "epoch": 0.718397997496871, "step": 287}, {"loss": 0.852091372013092, "grad_norm": 1.9929263591766357, "learning_rate": 4.522542485937369e-05, "token_acc": 0.7514005602240896, "epoch": 0.72090112640801, "step": 288}, {"loss": 0.9559416174888611, "grad_norm": 3.4453070163726807, "learning_rate": 4.5153049373763026e-05, "token_acc": 0.7264587084529661, "epoch": 0.723404255319149, "step": 289}, {"loss": 0.8340522050857544, "grad_norm": 1.336920976638794, "learning_rate": 4.508018828701612e-05, "token_acc": 0.7536214092806285, "epoch": 0.7259073842302879, "step": 290}, {"loss": 0.8833523392677307, "grad_norm": 3.4118199348449707, "learning_rate": 4.500684335476936e-05, "token_acc": 0.7454481792717087, "epoch": 0.7284105131414268, "step": 291}, {"loss": 0.9197189807891846, "grad_norm": 3.5416605472564697, "learning_rate": 4.493301634431768e-05, "token_acc": 0.7341421143847487, "epoch": 0.7309136420525657, "step": 292}, {"loss": 0.8156468868255615, "grad_norm": 2.6148929595947266, "learning_rate": 4.485870903457204e-05, "token_acc": 0.7572543282126311, "epoch": 0.7334167709637046, "step": 293}, {"loss": 0.892130434513092, "grad_norm": 2.203497886657715, "learning_rate": 4.478392321601651e-05, "token_acc": 0.7416920489157612, "epoch": 0.7359198998748435, "step": 294}, {"loss": 0.7399520874023438, "grad_norm": 2.1712839603424072, "learning_rate": 4.470866069066516e-05, "token_acc": 0.7850873526707348, "epoch": 0.7384230287859824, "step": 295}, {"loss": 0.8421741724014282, "grad_norm": 1.8004732131958008, "learning_rate": 4.463292327201862e-05, "token_acc": 0.7520073969536231, "epoch": 0.7409261576971214, "step": 296}, {"loss": 0.8471038341522217, "grad_norm": 1.4337384700775146, "learning_rate": 4.455671278502042e-05, "token_acc": 0.757553327501514, "epoch": 0.7434292866082604, "step": 297}, {"loss": 0.7584915161132812, "grad_norm": 1.6089038848876953, "learning_rate": 4.4480031066012916e-05, "token_acc": 0.771377487562189, "epoch": 0.7459324155193993, "step": 298}, {"loss": 0.8365672826766968, "grad_norm": 1.462379813194275, "learning_rate": 4.44028799626932e-05, "token_acc": 0.7544501643614712, "epoch": 0.7484355444305382, "step": 299}, {"loss": 0.857391357421875, "grad_norm": 8.664839744567871, "learning_rate": 4.4325261334068426e-05, "token_acc": 0.749980424399029, "epoch": 0.7509386733416771, "step": 300}, {"loss": 0.9205117225646973, "grad_norm": 1.634519100189209, "learning_rate": 4.4247177050411114e-05, "token_acc": 0.7280529559461311, "epoch": 0.753441802252816, "step": 301}, {"loss": 0.8554207682609558, "grad_norm": 6.171248435974121, "learning_rate": 4.416862899321404e-05, "token_acc": 0.7522151310490117, "epoch": 0.7559449311639549, "step": 302}, {"loss": 0.8889010548591614, "grad_norm": 1.0984041690826416, "learning_rate": 4.408961905514491e-05, "token_acc": 0.7385387618516452, "epoch": 0.7584480600750939, "step": 303}, {"loss": 0.8025680780410767, "grad_norm": 2.31172776222229, "learning_rate": 4.401014914000078e-05, "token_acc": 0.7657713928794504, "epoch": 0.7609511889862328, "step": 304}, {"loss": 0.8589308261871338, "grad_norm": 1.0633413791656494, "learning_rate": 4.393022116266212e-05, "token_acc": 0.7430749104146522, "epoch": 0.7634543178973717, "step": 305}, {"loss": 0.8085026144981384, "grad_norm": 2.115835428237915, "learning_rate": 4.384983704904674e-05, "token_acc": 0.7655552946701104, "epoch": 0.7659574468085106, "step": 306}, {"loss": 0.8337522745132446, "grad_norm": 1.1347414255142212, "learning_rate": 4.376899873606336e-05, "token_acc": 0.7556942478445503, "epoch": 0.7684605757196495, "step": 307}, {"loss": 0.7678971290588379, "grad_norm": 2.038212299346924, "learning_rate": 4.3687708171564925e-05, "token_acc": 0.7758904109589041, "epoch": 0.7709637046307884, "step": 308}, {"loss": 0.8638439774513245, "grad_norm": 1.3275516033172607, "learning_rate": 4.360596731430168e-05, "token_acc": 0.7517523364485982, "epoch": 0.7734668335419274, "step": 309}, {"loss": 0.929733395576477, "grad_norm": 2.3478550910949707, "learning_rate": 4.352377813387398e-05, "token_acc": 0.7266237841229997, "epoch": 0.7759699624530664, "step": 310}, {"loss": 0.6898671388626099, "grad_norm": 44.539588928222656, "learning_rate": 4.3441142610684824e-05, "token_acc": 0.7947743004777226, "epoch": 0.7784730913642053, "step": 311}, {"loss": 0.7981156706809998, "grad_norm": 30.594491958618164, "learning_rate": 4.335806273589214e-05, "token_acc": 0.7670547784637024, "epoch": 0.7809762202753442, "step": 312}, {"loss": 0.7518867254257202, "grad_norm": 4.215977191925049, "learning_rate": 4.3274540511360793e-05, "token_acc": 0.779008, "epoch": 0.7834793491864831, "step": 313}, {"loss": 0.8727045059204102, "grad_norm": 3.641622543334961, "learning_rate": 4.319057794961437e-05, "token_acc": 0.7429807447620663, "epoch": 0.785982478097622, "step": 314}, {"loss": 0.8108093738555908, "grad_norm": 1.9243735074996948, "learning_rate": 4.310617707378668e-05, "token_acc": 0.7594791997459511, "epoch": 0.7884856070087609, "step": 315}, {"loss": 0.8932883739471436, "grad_norm": 0.8778403401374817, "learning_rate": 4.302133991757297e-05, "token_acc": 0.7411044408221683, "epoch": 0.7909887359198998, "step": 316}, {"loss": 0.8487477898597717, "grad_norm": 1.0130997896194458, "learning_rate": 4.2936068525181e-05, "token_acc": 0.7464837731723075, "epoch": 0.7934918648310388, "step": 317}, {"loss": 0.9818820357322693, "grad_norm": 1.079648494720459, "learning_rate": 4.285036495128171e-05, "token_acc": 0.7180284775465499, "epoch": 0.7959949937421777, "step": 318}, {"loss": 0.808303952217102, "grad_norm": 1.9027600288391113, "learning_rate": 4.276423126095974e-05, "token_acc": 0.7607510997308121, "epoch": 0.7984981226533167, "step": 319}, {"loss": 0.9470866918563843, "grad_norm": 1.5247927904129028, "learning_rate": 4.267766952966369e-05, "token_acc": 0.7265260406944185, "epoch": 0.8010012515644556, "step": 320}, {"loss": 0.9087713956832886, "grad_norm": 1.369870662689209, "learning_rate": 4.259068184315608e-05, "token_acc": 0.7350676621558563, "epoch": 0.8035043804755945, "step": 321}, {"loss": 0.7461989521980286, "grad_norm": 6.133328914642334, "learning_rate": 4.250327029746309e-05, "token_acc": 0.7807190257419967, "epoch": 0.8060075093867334, "step": 322}, {"loss": 0.7489862442016602, "grad_norm": 1.9726554155349731, "learning_rate": 4.24154369988241e-05, "token_acc": 0.7799331724521997, "epoch": 0.8085106382978723, "step": 323}, {"loss": 0.9204419851303101, "grad_norm": 1.3422818183898926, "learning_rate": 4.23271840636409e-05, "token_acc": 0.7276635593581067, "epoch": 0.8110137672090113, "step": 324}, {"loss": 0.7810251712799072, "grad_norm": 5.088674068450928, "learning_rate": 4.223851361842668e-05, "token_acc": 0.7680823083468709, "epoch": 0.8135168961201502, "step": 325}, {"loss": 0.6452058553695679, "grad_norm": 3.301347255706787, "learning_rate": 4.214942779975482e-05, "token_acc": 0.8035996835443038, "epoch": 0.8160200250312891, "step": 326}, {"loss": 0.9706965088844299, "grad_norm": 1.5935312509536743, "learning_rate": 4.205992875420742e-05, "token_acc": 0.7185623981234843, "epoch": 0.818523153942428, "step": 327}, {"loss": 0.8170771598815918, "grad_norm": 3.254168748855591, "learning_rate": 4.197001863832355e-05, "token_acc": 0.7567391847961991, "epoch": 0.8210262828535669, "step": 328}, {"loss": 1.0035200119018555, "grad_norm": 1.6932677030563354, "learning_rate": 4.187969961854726e-05, "token_acc": 0.710241224902499, "epoch": 0.8235294117647058, "step": 329}, {"loss": 0.7571268081665039, "grad_norm": 3.9655134677886963, "learning_rate": 4.178897387117546e-05, "token_acc": 0.7816722301700842, "epoch": 0.8260325406758448, "step": 330}, {"loss": 0.6960297226905823, "grad_norm": 1.8478268384933472, "learning_rate": 4.169784358230541e-05, "token_acc": 0.797862706031516, "epoch": 0.8285356695869838, "step": 331}, {"loss": 0.8032216429710388, "grad_norm": 4.037573337554932, "learning_rate": 4.1606310947782044e-05, "token_acc": 0.7642302509144581, "epoch": 0.8310387984981227, "step": 332}, {"loss": 0.7450529336929321, "grad_norm": 1.7107889652252197, "learning_rate": 4.151437817314513e-05, "token_acc": 0.7807361655955263, "epoch": 0.8335419274092616, "step": 333}, {"loss": 0.9057133197784424, "grad_norm": 2.1832103729248047, "learning_rate": 4.142204747357604e-05, "token_acc": 0.7387870402398248, "epoch": 0.8360450563204005, "step": 334}, {"loss": 0.8928775191307068, "grad_norm": 1.6151518821716309, "learning_rate": 4.1329321073844415e-05, "token_acc": 0.7462082912032356, "epoch": 0.8385481852315394, "step": 335}, {"loss": 0.7594292163848877, "grad_norm": 14.127095222473145, "learning_rate": 4.123620120825459e-05, "token_acc": 0.7754250629722922, "epoch": 0.8410513141426783, "step": 336}, {"loss": 0.8408955335617065, "grad_norm": 1.6860201358795166, "learning_rate": 4.114269012059169e-05, "token_acc": 0.7568825910931174, "epoch": 0.8435544430538173, "step": 337}, {"loss": 0.8329792022705078, "grad_norm": 1.581010341644287, "learning_rate": 4.104879006406758e-05, "token_acc": 0.7593260342227759, "epoch": 0.8460575719649562, "step": 338}, {"loss": 0.6480681896209717, "grad_norm": 1.9535971879959106, "learning_rate": 4.095450330126663e-05, "token_acc": 0.8122850705561485, "epoch": 0.8485607008760951, "step": 339}, {"loss": 0.7445608377456665, "grad_norm": 1.9793946743011475, "learning_rate": 4.085983210409114e-05, "token_acc": 0.7827135845603527, "epoch": 0.851063829787234, "step": 340}, {"loss": 0.8328458070755005, "grad_norm": 4.794119834899902, "learning_rate": 4.07647787537066e-05, "token_acc": 0.7548175481754817, "epoch": 0.853566958698373, "step": 341}, {"loss": 0.7087723016738892, "grad_norm": 1.6560248136520386, "learning_rate": 4.066934554048674e-05, "token_acc": 0.7858705845576742, "epoch": 0.8560700876095119, "step": 342}, {"loss": 0.8401075005531311, "grad_norm": 2.5469024181365967, "learning_rate": 4.0573534763958355e-05, "token_acc": 0.7521624133247552, "epoch": 0.8585732165206508, "step": 343}, {"loss": 0.8827832937240601, "grad_norm": 1.101097822189331, "learning_rate": 4.047734873274586e-05, "token_acc": 0.7426626391957081, "epoch": 0.8610763454317898, "step": 344}, {"loss": 0.8690142035484314, "grad_norm": 0.9751433730125427, "learning_rate": 4.038078976451567e-05, "token_acc": 0.7447467748295871, "epoch": 0.8635794743429287, "step": 345}, {"loss": 0.7611054182052612, "grad_norm": 1.7000588178634644, "learning_rate": 4.028386018592041e-05, "token_acc": 0.7782417893544734, "epoch": 0.8660826032540676, "step": 346}, {"loss": 0.8283425569534302, "grad_norm": 1.2874529361724854, "learning_rate": 4.018656233254278e-05, "token_acc": 0.7594009983361065, "epoch": 0.8685857321652065, "step": 347}, {"loss": 0.7190766930580139, "grad_norm": 2.1631717681884766, "learning_rate": 4.008889854883929e-05, "token_acc": 0.7870029281193917, "epoch": 0.8710888610763454, "step": 348}, {"loss": 0.8946720361709595, "grad_norm": 1.429532766342163, "learning_rate": 3.999087118808381e-05, "token_acc": 0.7392836839113133, "epoch": 0.8735919899874843, "step": 349}, {"loss": 0.9295719861984253, "grad_norm": 3.1684229373931885, "learning_rate": 3.9892482612310836e-05, "token_acc": 0.7288985616956851, "epoch": 0.8760951188986232, "step": 350}, {"loss": 0.92355877161026, "grad_norm": 1.7300114631652832, "learning_rate": 3.979373519225858e-05, "token_acc": 0.7324363188167625, "epoch": 0.8785982478097623, "step": 351}, {"loss": 0.8874197006225586, "grad_norm": 2.299527406692505, "learning_rate": 3.969463130731183e-05, "token_acc": 0.7404152666494357, "epoch": 0.8811013767209012, "step": 352}, {"loss": 0.8959657549858093, "grad_norm": 1.4366137981414795, "learning_rate": 3.959517334544466e-05, "token_acc": 0.732359413775343, "epoch": 0.8836045056320401, "step": 353}, {"loss": 0.870617151260376, "grad_norm": 1.7419233322143555, "learning_rate": 3.949536370316285e-05, "token_acc": 0.7478128119311843, "epoch": 0.886107634543179, "step": 354}, {"loss": 0.938357412815094, "grad_norm": 2.7980542182922363, "learning_rate": 3.939520478544614e-05, "token_acc": 0.723624015469509, "epoch": 0.8886107634543179, "step": 355}, {"loss": 0.9020789265632629, "grad_norm": 1.4998390674591064, "learning_rate": 3.9294699005690305e-05, "token_acc": 0.7391279337321676, "epoch": 0.8911138923654568, "step": 356}, {"loss": 0.8625916242599487, "grad_norm": 7.364425182342529, "learning_rate": 3.919384878564902e-05, "token_acc": 0.7521179064639666, "epoch": 0.8936170212765957, "step": 357}, {"loss": 0.7600144147872925, "grad_norm": 3.1867001056671143, "learning_rate": 3.909265655537542e-05, "token_acc": 0.7793380140421263, "epoch": 0.8961201501877347, "step": 358}, {"loss": 0.7643027305603027, "grad_norm": 1.8029720783233643, "learning_rate": 3.899112475316366e-05, "token_acc": 0.7712042239220199, "epoch": 0.8986232790988736, "step": 359}, {"loss": 0.8453084230422974, "grad_norm": 1.355663776397705, "learning_rate": 3.888925582549006e-05, "token_acc": 0.7502929524022097, "epoch": 0.9011264080100125, "step": 360}, {"loss": 0.8521932363510132, "grad_norm": 1.006208062171936, "learning_rate": 3.8787052226954234e-05, "token_acc": 0.756155379559291, "epoch": 0.9036295369211514, "step": 361}, {"loss": 0.8347768783569336, "grad_norm": 1.4199978113174438, "learning_rate": 3.868451642021992e-05, "token_acc": 0.7501978691019787, "epoch": 0.9061326658322904, "step": 362}, {"loss": 0.7749630808830261, "grad_norm": 1.349457025527954, "learning_rate": 3.8581650875955585e-05, "token_acc": 0.7748823133826497, "epoch": 0.9086357947434293, "step": 363}, {"loss": 0.6983618140220642, "grad_norm": 5.823076248168945, "learning_rate": 3.847845807277502e-05, "token_acc": 0.7871479571598572, "epoch": 0.9111389236545682, "step": 364}, {"loss": 0.8401281833648682, "grad_norm": 8.135080337524414, "learning_rate": 3.8374940497177434e-05, "token_acc": 0.7508409829522777, "epoch": 0.9136420525657072, "step": 365}, {"loss": 0.8170597553253174, "grad_norm": 1.687354564666748, "learning_rate": 3.827110064348773e-05, "token_acc": 0.7552287581699346, "epoch": 0.9161451814768461, "step": 366}, {"loss": 0.8735244274139404, "grad_norm": 1.9633206129074097, "learning_rate": 3.816694101379631e-05, "token_acc": 0.7437511571931124, "epoch": 0.918648310387985, "step": 367}, {"loss": 0.693369448184967, "grad_norm": 4.996685981750488, "learning_rate": 3.8062464117898724e-05, "token_acc": 0.7922726867136611, "epoch": 0.9211514392991239, "step": 368}, {"loss": 0.9313665628433228, "grad_norm": 1.0713677406311035, "learning_rate": 3.795767247323533e-05, "token_acc": 0.7287721170089801, "epoch": 0.9236545682102628, "step": 369}, {"loss": 0.7590094804763794, "grad_norm": 4.217531681060791, "learning_rate": 3.785256860483054e-05, "token_acc": 0.773895906118427, "epoch": 0.9261576971214017, "step": 370}, {"loss": 0.8483130931854248, "grad_norm": 1.6878818273544312, "learning_rate": 3.774715504523202e-05, "token_acc": 0.7492018446257538, "epoch": 0.9286608260325406, "step": 371}, {"loss": 0.9103615283966064, "grad_norm": 0.8570557832717896, "learning_rate": 3.764143433444962e-05, "token_acc": 0.7282932011331444, "epoch": 0.9311639549436797, "step": 372}, {"loss": 0.8272509574890137, "grad_norm": 2.5253098011016846, "learning_rate": 3.753540901989423e-05, "token_acc": 0.7556038061178875, "epoch": 0.9336670838548186, "step": 373}, {"loss": 0.9171687364578247, "grad_norm": 1.4744120836257935, "learning_rate": 3.742908165631636e-05, "token_acc": 0.7330784603353897, "epoch": 0.9361702127659575, "step": 374}, {"loss": 0.861799955368042, "grad_norm": 1.189939260482788, "learning_rate": 3.7322454805744605e-05, "token_acc": 0.7455566567558639, "epoch": 0.9386733416770964, "step": 375}, {"loss": 0.8449103832244873, "grad_norm": 1.3322968482971191, "learning_rate": 3.721553103742388e-05, "token_acc": 0.7524626452684007, "epoch": 0.9411764705882353, "step": 376}, {"loss": 0.7643551826477051, "grad_norm": 1.3432042598724365, "learning_rate": 3.710831292775353e-05, "token_acc": 0.7682315405651777, "epoch": 0.9436795994993742, "step": 377}, {"loss": 0.7325477004051208, "grad_norm": 1.8385838270187378, "learning_rate": 3.7000803060225284e-05, "token_acc": 0.7822782174094127, "epoch": 0.9461827284105131, "step": 378}, {"loss": 0.9835074543952942, "grad_norm": 1.7004828453063965, "learning_rate": 3.689300402536093e-05, "token_acc": 0.715375239421905, "epoch": 0.9486858573216521, "step": 379}, {"loss": 0.8341811895370483, "grad_norm": 1.2685455083847046, "learning_rate": 3.678491842064995e-05, "token_acc": 0.7532715029856435, "epoch": 0.951188986232791, "step": 380}, {"loss": 0.8452165126800537, "grad_norm": 0.9319852590560913, "learning_rate": 3.6676548850486915e-05, "token_acc": 0.7504095866685391, "epoch": 0.9536921151439299, "step": 381}, {"loss": 0.7542648911476135, "grad_norm": 1.6068520545959473, "learning_rate": 3.6567897926108756e-05, "token_acc": 0.776282880551962, "epoch": 0.9561952440550688, "step": 382}, {"loss": 0.7548285126686096, "grad_norm": 2.165843963623047, "learning_rate": 3.645896826553178e-05, "token_acc": 0.7744026531996684, "epoch": 0.9586983729662077, "step": 383}, {"loss": 0.6292520761489868, "grad_norm": 1.8156840801239014, "learning_rate": 3.634976249348867e-05, "token_acc": 0.8097231165486156, "epoch": 0.9612015018773467, "step": 384}, {"loss": 0.8094581365585327, "grad_norm": 0.9236544370651245, "learning_rate": 3.624028324136517e-05, "token_acc": 0.7608140039542846, "epoch": 0.9637046307884856, "step": 385}, {"loss": 0.8500128984451294, "grad_norm": 1.497694969177246, "learning_rate": 3.613053314713671e-05, "token_acc": 0.7480623568786331, "epoch": 0.9662077596996246, "step": 386}, {"loss": 0.917942225933075, "grad_norm": 3.220353364944458, "learning_rate": 3.602051485530486e-05, "token_acc": 0.7284884019955769, "epoch": 0.9687108886107635, "step": 387}, {"loss": 0.7702268362045288, "grad_norm": 4.521829605102539, "learning_rate": 3.591023101683355e-05, "token_acc": 0.7716129918286068, "epoch": 0.9712140175219024, "step": 388}, {"loss": 0.9329461455345154, "grad_norm": 0.9622291922569275, "learning_rate": 3.57996842890853e-05, "token_acc": 0.7276041666666667, "epoch": 0.9737171464330413, "step": 389}, {"loss": 0.6712834239006042, "grad_norm": 1.7155946493148804, "learning_rate": 3.568887733575706e-05, "token_acc": 0.8011521228931086, "epoch": 0.9762202753441802, "step": 390}, {"loss": 0.8204821348190308, "grad_norm": 1.6805239915847778, "learning_rate": 3.55778128268161e-05, "token_acc": 0.7557218065946245, "epoch": 0.9787234042553191, "step": 391}, {"loss": 0.7822115421295166, "grad_norm": 1.821913719177246, "learning_rate": 3.54664934384357e-05, "token_acc": 0.7652249806051202, "epoch": 0.981226533166458, "step": 392}, {"loss": 0.7939423322677612, "grad_norm": 0.9204578399658203, "learning_rate": 3.5354921852930594e-05, "token_acc": 0.7637715229684224, "epoch": 0.983729662077597, "step": 393}, {"loss": 0.7488706111907959, "grad_norm": 1.6548840999603271, "learning_rate": 3.5243100758692386e-05, "token_acc": 0.7780097425191371, "epoch": 0.986232790988736, "step": 394}, {"loss": 0.8302121758460999, "grad_norm": 1.4144301414489746, "learning_rate": 3.513103285012475e-05, "token_acc": 0.7556669572798606, "epoch": 0.9887359198998749, "step": 395}, {"loss": 0.7473949790000916, "grad_norm": 1.2530573606491089, "learning_rate": 3.5018720827578524e-05, "token_acc": 0.7778376713383643, "epoch": 0.9912390488110138, "step": 396}, {"loss": 0.7733973860740662, "grad_norm": 1.3626383543014526, "learning_rate": 3.4906167397286646e-05, "token_acc": 0.7717758815005635, "epoch": 0.9937421777221527, "step": 397}, {"loss": 0.717442512512207, "grad_norm": 1.8561214208602905, "learning_rate": 3.47933752712989e-05, "token_acc": 0.7897643593519882, "epoch": 0.9962453066332916, "step": 398}, {"loss": 0.8622786402702332, "grad_norm": 1.4010168313980103, "learning_rate": 3.468034716741664e-05, "token_acc": 0.746109355434977, "epoch": 0.9987484355444305, "step": 399}, {"loss": 0.7453683614730835, "grad_norm": 3.488276720046997, "learning_rate": 3.456708580912725e-05, "token_acc": 0.7741160315825609, "epoch": 1.0, "step": 400}, {"loss": 0.7595579028129578, "grad_norm": 1.1606934070587158, "learning_rate": 3.4453593925538515e-05, "token_acc": 0.7722797596215317, "epoch": 1.002503128911139, "step": 401}, {"loss": 0.8560916185379028, "grad_norm": 7.119320392608643, "learning_rate": 3.433987425131291e-05, "token_acc": 0.7451851136747598, "epoch": 1.0050062578222778, "step": 402}, {"loss": 0.7480262517929077, "grad_norm": 2.264742612838745, "learning_rate": 3.4225929526601664e-05, "token_acc": 0.7768546688509244, "epoch": 1.0075093867334168, "step": 403}, {"loss": 0.6516366600990295, "grad_norm": 2.638277053833008, "learning_rate": 3.411176249697875e-05, "token_acc": 0.8008649868371568, "epoch": 1.0100125156445556, "step": 404}, {"loss": 0.7640280723571777, "grad_norm": 10.03870964050293, "learning_rate": 3.399737591337471e-05, "token_acc": 0.7745649948822927, "epoch": 1.0125156445556946, "step": 405}, {"loss": 0.8078231811523438, "grad_norm": 1.4635159969329834, "learning_rate": 3.388277253201041e-05, "token_acc": 0.7627060907480583, "epoch": 1.0150187734668334, "step": 406}, {"loss": 0.8164265155792236, "grad_norm": 1.8901174068450928, "learning_rate": 3.3767955114330586e-05, "token_acc": 0.7621255796465722, "epoch": 1.0175219023779725, "step": 407}, {"loss": 0.8471720218658447, "grad_norm": 2.5771090984344482, "learning_rate": 3.365292642693732e-05, "token_acc": 0.7479161404395049, "epoch": 1.0200250312891115, "step": 408}, {"loss": 0.705992579460144, "grad_norm": 1.9842844009399414, "learning_rate": 3.353768924152341e-05, "token_acc": 0.7897742247210753, "epoch": 1.0225281602002503, "step": 409}, {"loss": 0.9950985908508301, "grad_norm": 1.8455222845077515, "learning_rate": 3.34222463348055e-05, "token_acc": 0.7158471618394464, "epoch": 1.0250312891113893, "step": 410}, {"loss": 0.7523729801177979, "grad_norm": 2.81369948387146, "learning_rate": 3.330660048845727e-05, "token_acc": 0.7738898001336493, "epoch": 1.027534418022528, "step": 411}, {"loss": 0.8897726535797119, "grad_norm": 0.9068171381950378, "learning_rate": 3.319075448904234e-05, "token_acc": 0.7371789837430299, "epoch": 1.0300375469336671, "step": 412}, {"loss": 0.6471114158630371, "grad_norm": 2.705150604248047, "learning_rate": 3.307471112794715e-05, "token_acc": 0.8097399917457697, "epoch": 1.032540675844806, "step": 413}, {"loss": 0.7631367444992065, "grad_norm": 1.5322827100753784, "learning_rate": 3.2958473201313744e-05, "token_acc": 0.7776249140141329, "epoch": 1.035043804755945, "step": 414}, {"loss": 0.8537945747375488, "grad_norm": 0.8264560699462891, "learning_rate": 3.284204350997229e-05, "token_acc": 0.7472068130322681, "epoch": 1.037546933667084, "step": 415}, {"loss": 0.8233134746551514, "grad_norm": 1.2941429615020752, "learning_rate": 3.272542485937369e-05, "token_acc": 0.7573484469633828, "epoch": 1.0400500625782227, "step": 416}, {"loss": 0.8734332323074341, "grad_norm": 0.9657873511314392, "learning_rate": 3.260862005952193e-05, "token_acc": 0.7438148443735035, "epoch": 1.0425531914893618, "step": 417}, {"loss": 0.8446903824806213, "grad_norm": 1.698813796043396, "learning_rate": 3.2491631924906416e-05, "token_acc": 0.7472349272349272, "epoch": 1.0450563204005006, "step": 418}, {"loss": 0.6763110160827637, "grad_norm": 3.7393252849578857, "learning_rate": 3.23744632744341e-05, "token_acc": 0.7926863572433193, "epoch": 1.0475594493116396, "step": 419}, {"loss": 0.635500431060791, "grad_norm": 1.9159985780715942, "learning_rate": 3.225711693136156e-05, "token_acc": 0.8037298569617961, "epoch": 1.0500625782227784, "step": 420}, {"loss": 0.828086256980896, "grad_norm": 1.2441291809082031, "learning_rate": 3.2139595723227054e-05, "token_acc": 0.7563552765374243, "epoch": 1.0525657071339174, "step": 421}, {"loss": 0.8139811754226685, "grad_norm": 2.318335771560669, "learning_rate": 3.202190248178231e-05, "token_acc": 0.7583092707501382, "epoch": 1.0550688360450564, "step": 422}, {"loss": 0.6982682943344116, "grad_norm": 1.2812583446502686, "learning_rate": 3.190404004292427e-05, "token_acc": 0.7941985274549809, "epoch": 1.0575719649561952, "step": 423}, {"loss": 0.865225613117218, "grad_norm": 1.2541266679763794, "learning_rate": 3.178601124662686e-05, "token_acc": 0.7453209807224406, "epoch": 1.0600750938673342, "step": 424}, {"loss": 0.7594386339187622, "grad_norm": 1.2426998615264893, "learning_rate": 3.1667818936872465e-05, "token_acc": 0.7677123091603053, "epoch": 1.062578222778473, "step": 425}, {"loss": 0.7875864505767822, "grad_norm": 3.8673322200775146, "learning_rate": 3.154946596158344e-05, "token_acc": 0.7661815909293813, "epoch": 1.065081351689612, "step": 426}, {"loss": 0.8166364431381226, "grad_norm": 1.1603846549987793, "learning_rate": 3.14309551725535e-05, "token_acc": 0.7610032474262419, "epoch": 1.0675844806007508, "step": 427}, {"loss": 0.7897321581840515, "grad_norm": 2.748734712600708, "learning_rate": 3.131228942537895e-05, "token_acc": 0.7664034021871203, "epoch": 1.0700876095118899, "step": 428}, {"loss": 0.7913838624954224, "grad_norm": 4.712365627288818, "learning_rate": 3.119347157938996e-05, "token_acc": 0.7640121816885894, "epoch": 1.0725907384230289, "step": 429}, {"loss": 0.799659252166748, "grad_norm": 1.5520957708358765, "learning_rate": 3.10745044975816e-05, "token_acc": 0.767484623676368, "epoch": 1.0750938673341677, "step": 430}, {"loss": 0.8150660395622253, "grad_norm": 2.1518683433532715, "learning_rate": 3.095539104654487e-05, "token_acc": 0.762330198537095, "epoch": 1.0775969962453067, "step": 431}, {"loss": 0.8917897939682007, "grad_norm": 1.1168107986450195, "learning_rate": 3.083613409639764e-05, "token_acc": 0.7390166223114175, "epoch": 1.0801001251564455, "step": 432}, {"loss": 0.8356524705886841, "grad_norm": 2.890058755874634, "learning_rate": 3.071673652071549e-05, "token_acc": 0.7508724667850364, "epoch": 1.0826032540675845, "step": 433}, {"loss": 0.6680396199226379, "grad_norm": 1.5636504888534546, "learning_rate": 3.0597201196462463e-05, "token_acc": 0.7951321186041821, "epoch": 1.0851063829787233, "step": 434}, {"loss": 0.8508872985839844, "grad_norm": 1.5193849802017212, "learning_rate": 3.0477531003921745e-05, "token_acc": 0.7515897223801892, "epoch": 1.0876095118898623, "step": 435}, {"loss": 0.7488077878952026, "grad_norm": 2.8505938053131104, "learning_rate": 3.035772882662627e-05, "token_acc": 0.7749569385156894, "epoch": 1.0901126408010013, "step": 436}, {"loss": 0.8307385444641113, "grad_norm": 1.3607008457183838, "learning_rate": 3.0237797551289228e-05, "token_acc": 0.7534736006351727, "epoch": 1.0926157697121401, "step": 437}, {"loss": 0.8256966471672058, "grad_norm": 0.8386856317520142, "learning_rate": 3.0117740067734495e-05, "token_acc": 0.7536278768832609, "epoch": 1.0951188986232792, "step": 438}, {"loss": 0.671474039554596, "grad_norm": 1.4726793766021729, "learning_rate": 2.9997559268827048e-05, "token_acc": 0.7985303617571059, "epoch": 1.097622027534418, "step": 439}, {"loss": 0.6621131300926208, "grad_norm": 1.5878239870071411, "learning_rate": 2.9877258050403212e-05, "token_acc": 0.8018326039387309, "epoch": 1.100125156445557, "step": 440}, {"loss": 0.8641493320465088, "grad_norm": 1.060871958732605, "learning_rate": 2.97568393112009e-05, "token_acc": 0.74706401151186, "epoch": 1.1026282853566958, "step": 441}, {"loss": 0.6422966718673706, "grad_norm": 1.7958430051803589, "learning_rate": 2.963630595278977e-05, "token_acc": 0.8062888198757764, "epoch": 1.1051314142678348, "step": 442}, {"loss": 0.730861485004425, "grad_norm": 2.897059917449951, "learning_rate": 2.9515660879501316e-05, "token_acc": 0.7823434073791591, "epoch": 1.1076345431789738, "step": 443}, {"loss": 0.863489031791687, "grad_norm": 1.9405778646469116, "learning_rate": 2.9394906998358868e-05, "token_acc": 0.7414182794179969, "epoch": 1.1101376720901126, "step": 444}, {"loss": 0.7957867383956909, "grad_norm": 1.0297330617904663, "learning_rate": 2.9274047219007534e-05, "token_acc": 0.7574887156339762, "epoch": 1.1126408010012516, "step": 445}, {"loss": 0.8564661145210266, "grad_norm": 1.080908179283142, "learning_rate": 2.9153084453644135e-05, "token_acc": 0.7462025024239346, "epoch": 1.1151439299123904, "step": 446}, {"loss": 0.7737131714820862, "grad_norm": 2.1639764308929443, "learning_rate": 2.9032021616947015e-05, "token_acc": 0.7662964751327861, "epoch": 1.1176470588235294, "step": 447}, {"loss": 0.7582350969314575, "grad_norm": 1.6361067295074463, "learning_rate": 2.8910861626005776e-05, "token_acc": 0.773669430328965, "epoch": 1.1201501877346682, "step": 448}, {"loss": 0.6141003370285034, "grad_norm": 2.3244810104370117, "learning_rate": 2.878960740025103e-05, "token_acc": 0.8189434489178496, "epoch": 1.1226533166458073, "step": 449}, {"loss": 0.6784725785255432, "grad_norm": 2.4419093132019043, "learning_rate": 2.8668261861384045e-05, "token_acc": 0.7944106055177356, "epoch": 1.1251564455569463, "step": 450}, {"loss": 0.6986773014068604, "grad_norm": 2.702949047088623, "learning_rate": 2.854682793330633e-05, "token_acc": 0.7902205177372963, "epoch": 1.127659574468085, "step": 451}, {"loss": 0.7032589912414551, "grad_norm": 1.953333854675293, "learning_rate": 2.8425308542049206e-05, "token_acc": 0.7920252438324727, "epoch": 1.130162703379224, "step": 452}, {"loss": 0.8273622989654541, "grad_norm": 2.284067153930664, "learning_rate": 2.8303706615703253e-05, "token_acc": 0.7528546054300939, "epoch": 1.1326658322903629, "step": 453}, {"loss": 0.9244086742401123, "grad_norm": 1.595000147819519, "learning_rate": 2.8182025084347836e-05, "token_acc": 0.7275905912269549, "epoch": 1.135168961201502, "step": 454}, {"loss": 0.6975402235984802, "grad_norm": 1.6957809925079346, "learning_rate": 2.8060266879980408e-05, "token_acc": 0.7869734644646502, "epoch": 1.1376720901126407, "step": 455}, {"loss": 0.7530581951141357, "grad_norm": 2.092339038848877, "learning_rate": 2.7938434936445945e-05, "token_acc": 0.7761567319716548, "epoch": 1.1401752190237797, "step": 456}, {"loss": 0.787225604057312, "grad_norm": 1.3622016906738281, "learning_rate": 2.7816532189366197e-05, "token_acc": 0.7615973644377171, "epoch": 1.1426783479349187, "step": 457}, {"loss": 0.7957576513290405, "grad_norm": 1.3467158079147339, "learning_rate": 2.7694561576068985e-05, "token_acc": 0.7672947418542956, "epoch": 1.1451814768460575, "step": 458}, {"loss": 0.8363101482391357, "grad_norm": 1.4943625926971436, "learning_rate": 2.757252603551741e-05, "token_acc": 0.7491413533163834, "epoch": 1.1476846057571966, "step": 459}, {"loss": 0.8885717988014221, "grad_norm": 1.0831845998764038, "learning_rate": 2.7450428508239024e-05, "token_acc": 0.7409447431039041, "epoch": 1.1501877346683353, "step": 460}, {"loss": 0.8255709409713745, "grad_norm": 2.542517900466919, "learning_rate": 2.7328271936254995e-05, "token_acc": 0.7530204962243797, "epoch": 1.1526908635794744, "step": 461}, {"loss": 0.8665659427642822, "grad_norm": 1.334511637687683, "learning_rate": 2.7206059263009244e-05, "token_acc": 0.7449273920827532, "epoch": 1.1551939924906134, "step": 462}, {"loss": 0.8557275533676147, "grad_norm": 1.208848237991333, "learning_rate": 2.7083793433297438e-05, "token_acc": 0.7444496016090354, "epoch": 1.1576971214017522, "step": 463}, {"loss": 0.9177385568618774, "grad_norm": 2.0628461837768555, "learning_rate": 2.6961477393196126e-05, "token_acc": 0.7293287497738375, "epoch": 1.1602002503128912, "step": 464}, {"loss": 0.723082959651947, "grad_norm": 2.4950785636901855, "learning_rate": 2.683911408999169e-05, "token_acc": 0.7769183168316832, "epoch": 1.16270337922403, "step": 465}, {"loss": 0.6471742987632751, "grad_norm": 2.308980941772461, "learning_rate": 2.6716706472109342e-05, "token_acc": 0.8040623523854511, "epoch": 1.165206508135169, "step": 466}, {"loss": 0.5249975323677063, "grad_norm": 1.521958827972412, "learning_rate": 2.659425748904212e-05, "token_acc": 0.8463351666853743, "epoch": 1.1677096370463078, "step": 467}, {"loss": 0.7578822374343872, "grad_norm": 3.039774179458618, "learning_rate": 2.6471770091279724e-05, "token_acc": 0.7744256850262939, "epoch": 1.1702127659574468, "step": 468}, {"loss": 0.7234141826629639, "grad_norm": 1.9503605365753174, "learning_rate": 2.6349247230237552e-05, "token_acc": 0.7862872211844852, "epoch": 1.1727158948685856, "step": 469}, {"loss": 0.8409122228622437, "grad_norm": 1.0008007287979126, "learning_rate": 2.6226691858185454e-05, "token_acc": 0.7482727545809552, "epoch": 1.1752190237797246, "step": 470}, {"loss": 0.724835991859436, "grad_norm": 1.5808378458023071, "learning_rate": 2.6104106928176687e-05, "token_acc": 0.7787719171657407, "epoch": 1.1777221526908637, "step": 471}, {"loss": 0.8796378970146179, "grad_norm": 1.2275604009628296, "learning_rate": 2.598149539397672e-05, "token_acc": 0.7436432934788284, "epoch": 1.1802252816020025, "step": 472}, {"loss": 0.7971165180206299, "grad_norm": 5.61031436920166, "learning_rate": 2.585886020999206e-05, "token_acc": 0.7616080156402737, "epoch": 1.1827284105131415, "step": 473}, {"loss": 0.836396336555481, "grad_norm": 1.6030521392822266, "learning_rate": 2.5736204331199088e-05, "token_acc": 0.7549324367188986, "epoch": 1.1852315394242803, "step": 474}, {"loss": 0.8152873516082764, "grad_norm": 1.1238839626312256, "learning_rate": 2.561353071307281e-05, "token_acc": 0.7558295833089825, "epoch": 1.1877346683354193, "step": 475}, {"loss": 0.6784950494766235, "grad_norm": 2.533327102661133, "learning_rate": 2.5490842311515707e-05, "token_acc": 0.7988939165409754, "epoch": 1.1902377972465583, "step": 476}, {"loss": 0.7702056169509888, "grad_norm": 2.931954860687256, "learning_rate": 2.5368142082786466e-05, "token_acc": 0.7747391716724629, "epoch": 1.1927409261576971, "step": 477}, {"loss": 0.9144121408462524, "grad_norm": 1.1211943626403809, "learning_rate": 2.5245432983428747e-05, "token_acc": 0.7323793949304988, "epoch": 1.1952440550688361, "step": 478}, {"loss": 0.8556366562843323, "grad_norm": 1.1485220193862915, "learning_rate": 2.5122717970199956e-05, "token_acc": 0.7465940054495913, "epoch": 1.197747183979975, "step": 479}, {"loss": 0.7300997972488403, "grad_norm": 1.1166046857833862, "learning_rate": 2.5e-05, "token_acc": 0.7833213400495722, "epoch": 1.200250312891114, "step": 480}, {"loss": 0.7646458745002747, "grad_norm": 1.2781999111175537, "learning_rate": 2.4877282029800053e-05, "token_acc": 0.7700712005892463, "epoch": 1.2027534418022527, "step": 481}, {"loss": 0.8519848585128784, "grad_norm": 0.9656017422676086, "learning_rate": 2.4754567016571263e-05, "token_acc": 0.746612222920219, "epoch": 1.2052565707133918, "step": 482}, {"loss": 0.749862790107727, "grad_norm": 2.7804577350616455, "learning_rate": 2.4631857917213543e-05, "token_acc": 0.7760351317440402, "epoch": 1.2077596996245306, "step": 483}, {"loss": 0.8318485021591187, "grad_norm": 2.4027388095855713, "learning_rate": 2.4509157688484295e-05, "token_acc": 0.7504805638615976, "epoch": 1.2102628285356696, "step": 484}, {"loss": 0.8486036062240601, "grad_norm": 3.0088815689086914, "learning_rate": 2.4386469286927196e-05, "token_acc": 0.7461552976695914, "epoch": 1.2127659574468086, "step": 485}, {"loss": 0.9670998454093933, "grad_norm": 1.2995445728302002, "learning_rate": 2.426379566880092e-05, "token_acc": 0.7201265687773314, "epoch": 1.2152690863579474, "step": 486}, {"loss": 0.8590025305747986, "grad_norm": 1.1181038618087769, "learning_rate": 2.414113979000794e-05, "token_acc": 0.747782901738205, "epoch": 1.2177722152690864, "step": 487}, {"loss": 0.7187557220458984, "grad_norm": 2.26283597946167, "learning_rate": 2.4018504606023293e-05, "token_acc": 0.7850413930916358, "epoch": 1.2202753441802252, "step": 488}, {"loss": 0.8461419939994812, "grad_norm": 1.03593909740448, "learning_rate": 2.389589307182332e-05, "token_acc": 0.7481977342945417, "epoch": 1.2227784730913642, "step": 489}, {"loss": 0.698701024055481, "grad_norm": 2.398747444152832, "learning_rate": 2.3773308141814552e-05, "token_acc": 0.7867596299875742, "epoch": 1.2252816020025032, "step": 490}, {"loss": 0.9008340239524841, "grad_norm": 1.4672415256500244, "learning_rate": 2.365075276976245e-05, "token_acc": 0.7327416173570019, "epoch": 1.227784730913642, "step": 491}, {"loss": 0.6810827255249023, "grad_norm": 3.996742010116577, "learning_rate": 2.3528229908720272e-05, "token_acc": 0.7924176507147297, "epoch": 1.230287859824781, "step": 492}, {"loss": 0.7924419045448303, "grad_norm": 1.1854064464569092, "learning_rate": 2.3405742510957894e-05, "token_acc": 0.7695827357781875, "epoch": 1.2327909887359199, "step": 493}, {"loss": 0.7272655367851257, "grad_norm": 1.384638786315918, "learning_rate": 2.328329352789066e-05, "token_acc": 0.7785135218763537, "epoch": 1.2352941176470589, "step": 494}, {"loss": 0.8528483510017395, "grad_norm": 1.6975595951080322, "learning_rate": 2.3160885910008318e-05, "token_acc": 0.7481278895617633, "epoch": 1.2377972465581977, "step": 495}, {"loss": 0.8342181444168091, "grad_norm": 1.2870354652404785, "learning_rate": 2.303852260680388e-05, "token_acc": 0.7528511514973144, "epoch": 1.2403003754693367, "step": 496}, {"loss": 0.6387697458267212, "grad_norm": 1.530961036682129, "learning_rate": 2.291620656670256e-05, "token_acc": 0.8062214611872146, "epoch": 1.2428035043804755, "step": 497}, {"loss": 0.7026108503341675, "grad_norm": 1.8430241346359253, "learning_rate": 2.279394073699077e-05, "token_acc": 0.785983362109559, "epoch": 1.2453066332916145, "step": 498}, {"loss": 0.7243825197219849, "grad_norm": 1.2643704414367676, "learning_rate": 2.267172806374501e-05, "token_acc": 0.7818732643271901, "epoch": 1.2478097622027535, "step": 499}, {"loss": 0.5638291835784912, "grad_norm": 2.194952964782715, "learning_rate": 2.2549571491760986e-05, "token_acc": 0.8303964757709251, "epoch": 1.2503128911138923, "step": 500}, {"loss": 0.6388370394706726, "grad_norm": 1.3642157316207886, "learning_rate": 2.2427473964482598e-05, "token_acc": 0.8047690014903129, "epoch": 1.2528160200250313, "step": 501}, {"loss": 0.8699530363082886, "grad_norm": 1.4096916913986206, "learning_rate": 2.2305438423931017e-05, "token_acc": 0.7426746977039084, "epoch": 1.2553191489361701, "step": 502}, {"loss": 0.9338130950927734, "grad_norm": 0.6735522150993347, "learning_rate": 2.2183467810633812e-05, "token_acc": 0.7246069109818764, "epoch": 1.2578222778473092, "step": 503}, {"loss": 0.6764394044876099, "grad_norm": 3.0893852710723877, "learning_rate": 2.2061565063554064e-05, "token_acc": 0.7987681647579636, "epoch": 1.2603254067584482, "step": 504}, {"loss": 0.7435534596443176, "grad_norm": 1.2103800773620605, "learning_rate": 2.1939733120019598e-05, "token_acc": 0.7749155088246339, "epoch": 1.262828535669587, "step": 505}, {"loss": 0.6575552225112915, "grad_norm": 1.6574653387069702, "learning_rate": 2.1817974915652173e-05, "token_acc": 0.7954854039375424, "epoch": 1.265331664580726, "step": 506}, {"loss": 0.6957029104232788, "grad_norm": 3.2512946128845215, "learning_rate": 2.1696293384296746e-05, "token_acc": 0.790222367560497, "epoch": 1.2678347934918648, "step": 507}, {"loss": 0.8102457523345947, "grad_norm": 1.6446380615234375, "learning_rate": 2.1574691457950803e-05, "token_acc": 0.7554084174642717, "epoch": 1.2703379224030038, "step": 508}, {"loss": 0.7922036051750183, "grad_norm": 2.266608715057373, "learning_rate": 2.1453172066693673e-05, "token_acc": 0.7567540772319437, "epoch": 1.2728410513141426, "step": 509}, {"loss": 0.8182840943336487, "grad_norm": 1.3823511600494385, "learning_rate": 2.1331738138615958e-05, "token_acc": 0.7597468183960676, "epoch": 1.2753441802252816, "step": 510}, {"loss": 0.758751392364502, "grad_norm": 2.875134229660034, "learning_rate": 2.1210392599748974e-05, "token_acc": 0.7762652146060218, "epoch": 1.2778473091364204, "step": 511}, {"loss": 0.8285502791404724, "grad_norm": 0.9661290049552917, "learning_rate": 2.1089138373994223e-05, "token_acc": 0.7517256372628948, "epoch": 1.2803504380475594, "step": 512}, {"loss": 0.8042497038841248, "grad_norm": 0.8895630240440369, "learning_rate": 2.0967978383052994e-05, "token_acc": 0.7564245365581987, "epoch": 1.2828535669586985, "step": 513}, {"loss": 0.7614545226097107, "grad_norm": 1.1554466485977173, "learning_rate": 2.0846915546355868e-05, "token_acc": 0.7749671279193538, "epoch": 1.2853566958698373, "step": 514}, {"loss": 0.852085530757904, "grad_norm": 2.6851818561553955, "learning_rate": 2.0725952780992468e-05, "token_acc": 0.7448673497214539, "epoch": 1.2878598247809763, "step": 515}, {"loss": 0.7973021268844604, "grad_norm": 1.071006178855896, "learning_rate": 2.0605093001641138e-05, "token_acc": 0.7651457615236315, "epoch": 1.290362953692115, "step": 516}, {"loss": 0.8796536326408386, "grad_norm": 1.7251087427139282, "learning_rate": 2.048433912049868e-05, "token_acc": 0.7393803896518684, "epoch": 1.292866082603254, "step": 517}, {"loss": 0.7860521078109741, "grad_norm": 0.8552775979042053, "learning_rate": 2.036369404721023e-05, "token_acc": 0.7619782361539711, "epoch": 1.295369211514393, "step": 518}, {"loss": 0.8427704572677612, "grad_norm": 1.719724178314209, "learning_rate": 2.0243160688799105e-05, "token_acc": 0.7528826254065241, "epoch": 1.297872340425532, "step": 519}, {"loss": 0.8721702098846436, "grad_norm": 0.9758151173591614, "learning_rate": 2.0122741949596797e-05, "token_acc": 0.7431514121894245, "epoch": 1.300375469336671, "step": 520}, {"loss": 0.8419342637062073, "grad_norm": 1.168480396270752, "learning_rate": 2.0002440731172958e-05, "token_acc": 0.7471320023837902, "epoch": 1.3028785982478097, "step": 521}, {"loss": 0.7959424257278442, "grad_norm": 1.2203398942947388, "learning_rate": 1.988225993226551e-05, "token_acc": 0.7663697898111863, "epoch": 1.3053817271589487, "step": 522}, {"loss": 0.7919071912765503, "grad_norm": 1.0408990383148193, "learning_rate": 1.976220244871079e-05, "token_acc": 0.7651286474054909, "epoch": 1.3078848560700875, "step": 523}, {"loss": 0.8253304958343506, "grad_norm": 1.310434103012085, "learning_rate": 1.9642271173373737e-05, "token_acc": 0.75065126566724, "epoch": 1.3103879849812266, "step": 524}, {"loss": 0.7233434915542603, "grad_norm": 1.0451242923736572, "learning_rate": 1.9522468996078258e-05, "token_acc": 0.7851820128479657, "epoch": 1.3128911138923653, "step": 525}, {"loss": 0.8267189264297485, "grad_norm": 2.0899829864501953, "learning_rate": 1.940279880353754e-05, "token_acc": 0.7562781712813909, "epoch": 1.3153942428035044, "step": 526}, {"loss": 0.8266547322273254, "grad_norm": 1.255731225013733, "learning_rate": 1.9283263479284514e-05, "token_acc": 0.7522840531561462, "epoch": 1.3178973717146434, "step": 527}, {"loss": 0.8521392941474915, "grad_norm": 1.7167625427246094, "learning_rate": 1.9163865903602374e-05, "token_acc": 0.7510395283962313, "epoch": 1.3204005006257822, "step": 528}, {"loss": 0.8637402653694153, "grad_norm": 1.0622138977050781, "learning_rate": 1.9044608953455138e-05, "token_acc": 0.7384504331087585, "epoch": 1.3229036295369212, "step": 529}, {"loss": 0.8480241894721985, "grad_norm": 0.9813028573989868, "learning_rate": 1.8925495502418406e-05, "token_acc": 0.7536379362979546, "epoch": 1.32540675844806, "step": 530}, {"loss": 0.6397439241409302, "grad_norm": 4.28452730178833, "learning_rate": 1.880652842061004e-05, "token_acc": 0.803735568791823, "epoch": 1.327909887359199, "step": 531}, {"loss": 0.9618914127349854, "grad_norm": 1.437615990638733, "learning_rate": 1.868771057462105e-05, "token_acc": 0.7202291690698658, "epoch": 1.330413016270338, "step": 532}, {"loss": 0.7862619161605835, "grad_norm": 1.5095962285995483, "learning_rate": 1.8569044827446515e-05, "token_acc": 0.7709383172800919, "epoch": 1.3329161451814768, "step": 533}, {"loss": 0.877753496170044, "grad_norm": 1.4545536041259766, "learning_rate": 1.8450534038416568e-05, "token_acc": 0.7414333585558318, "epoch": 1.3354192740926158, "step": 534}, {"loss": 0.754334568977356, "grad_norm": 3.5752525329589844, "learning_rate": 1.8332181063127545e-05, "token_acc": 0.7730709984595995, "epoch": 1.3379224030037546, "step": 535}, {"loss": 0.8347004055976868, "grad_norm": 0.9353688955307007, "learning_rate": 1.8213988753373146e-05, "token_acc": 0.7475584067407124, "epoch": 1.3404255319148937, "step": 536}, {"loss": 0.8207680583000183, "grad_norm": 4.231163501739502, "learning_rate": 1.809595995707573e-05, "token_acc": 0.7532355478861087, "epoch": 1.3429286608260325, "step": 537}, {"loss": 0.7109387516975403, "grad_norm": 6.469966411590576, "learning_rate": 1.7978097518217703e-05, "token_acc": 0.7860278826157283, "epoch": 1.3454317897371715, "step": 538}, {"loss": 0.6461949348449707, "grad_norm": 3.1630420684814453, "learning_rate": 1.7860404276772945e-05, "token_acc": 0.8017308524448291, "epoch": 1.3479349186483103, "step": 539}, {"loss": 0.8327257633209229, "grad_norm": 1.0982550382614136, "learning_rate": 1.7742883068638447e-05, "token_acc": 0.7495007244390492, "epoch": 1.3504380475594493, "step": 540}, {"loss": 0.8171138763427734, "grad_norm": 3.802609443664551, "learning_rate": 1.762553672556591e-05, "token_acc": 0.7566524822695035, "epoch": 1.3529411764705883, "step": 541}, {"loss": 0.7269375324249268, "grad_norm": 1.0654925107955933, "learning_rate": 1.7508368075093583e-05, "token_acc": 0.7761418269230769, "epoch": 1.355444305381727, "step": 542}, {"loss": 0.6608070731163025, "grad_norm": 4.295766353607178, "learning_rate": 1.7391379940478076e-05, "token_acc": 0.800157433828594, "epoch": 1.3579474342928661, "step": 543}, {"loss": 0.7909623980522156, "grad_norm": 8.248258590698242, "learning_rate": 1.7274575140626318e-05, "token_acc": 0.7613503425992981, "epoch": 1.360450563204005, "step": 544}, {"loss": 0.7602176666259766, "grad_norm": 1.1179834604263306, "learning_rate": 1.7157956490027717e-05, "token_acc": 0.7709024552090246, "epoch": 1.362953692115144, "step": 545}, {"loss": 0.6769133806228638, "grad_norm": 2.3431406021118164, "learning_rate": 1.704152679868626e-05, "token_acc": 0.7952830188679245, "epoch": 1.365456821026283, "step": 546}, {"loss": 0.8144751787185669, "grad_norm": 4.3784613609313965, "learning_rate": 1.6925288872052843e-05, "token_acc": 0.7544433094994892, "epoch": 1.3679599499374218, "step": 547}, {"loss": 0.8162662386894226, "grad_norm": 1.7156646251678467, "learning_rate": 1.6809245510957665e-05, "token_acc": 0.7523768777334094, "epoch": 1.3704630788485608, "step": 548}, {"loss": 0.7336026430130005, "grad_norm": 1.510075330734253, "learning_rate": 1.6693399511542735e-05, "token_acc": 0.7803434417245159, "epoch": 1.3729662077596996, "step": 549}, {"loss": 0.7254256010055542, "grad_norm": 1.9461703300476074, "learning_rate": 1.65777536651945e-05, "token_acc": 0.7800743813474467, "epoch": 1.3754693366708386, "step": 550}, {"loss": 0.805265486240387, "grad_norm": 1.164979338645935, "learning_rate": 1.6462310758476595e-05, "token_acc": 0.7578671900556101, "epoch": 1.3779724655819774, "step": 551}, {"loss": 0.8320894241333008, "grad_norm": 1.0273913145065308, "learning_rate": 1.6347073573062672e-05, "token_acc": 0.7525619764425735, "epoch": 1.3804755944931164, "step": 552}, {"loss": 0.7513222694396973, "grad_norm": 1.8113181591033936, "learning_rate": 1.6232044885669427e-05, "token_acc": 0.7729531069216634, "epoch": 1.3829787234042552, "step": 553}, {"loss": 0.706010103225708, "grad_norm": 2.532973527908325, "learning_rate": 1.6117227467989602e-05, "token_acc": 0.7890974084003575, "epoch": 1.3854818523153942, "step": 554}, {"loss": 0.8844308257102966, "grad_norm": 1.9803953170776367, "learning_rate": 1.6002624086625294e-05, "token_acc": 0.7387483137799943, "epoch": 1.3879849812265332, "step": 555}, {"loss": 0.7106630206108093, "grad_norm": 3.6705994606018066, "learning_rate": 1.588823750302126e-05, "token_acc": 0.7811320754716982, "epoch": 1.390488110137672, "step": 556}, {"loss": 0.8109298944473267, "grad_norm": 4.300747394561768, "learning_rate": 1.577407047339834e-05, "token_acc": 0.7626044755998922, "epoch": 1.392991239048811, "step": 557}, {"loss": 0.6885141134262085, "grad_norm": 1.2714130878448486, "learning_rate": 1.5660125748687094e-05, "token_acc": 0.7883173946756268, "epoch": 1.3954943679599499, "step": 558}, {"loss": 0.8751633167266846, "grad_norm": 1.7359731197357178, "learning_rate": 1.5546406074461488e-05, "token_acc": 0.740814826910516, "epoch": 1.3979974968710889, "step": 559}, {"loss": 0.820943295955658, "grad_norm": 1.4216480255126953, "learning_rate": 1.5432914190872757e-05, "token_acc": 0.7575292646891693, "epoch": 1.400500625782228, "step": 560}, {"loss": 0.748153567314148, "grad_norm": 4.9061760902404785, "learning_rate": 1.5319652832583362e-05, "token_acc": 0.7805115166018546, "epoch": 1.4030037546933667, "step": 561}, {"loss": 0.7889722585678101, "grad_norm": 1.267930030822754, "learning_rate": 1.5206624728701103e-05, "token_acc": 0.7689055058530289, "epoch": 1.4055068836045057, "step": 562}, {"loss": 0.8080474138259888, "grad_norm": 0.9083903431892395, "learning_rate": 1.5093832602713365e-05, "token_acc": 0.7599738658173057, "epoch": 1.4080100125156445, "step": 563}, {"loss": 0.9597259759902954, "grad_norm": 0.7936918139457703, "learning_rate": 1.498127917242148e-05, "token_acc": 0.720810821167184, "epoch": 1.4105131414267835, "step": 564}, {"loss": 0.7804182767868042, "grad_norm": 2.1689324378967285, "learning_rate": 1.4868967149875257e-05, "token_acc": 0.7724068479355488, "epoch": 1.4130162703379223, "step": 565}, {"loss": 0.8393502831459045, "grad_norm": 2.234748601913452, "learning_rate": 1.4756899241307615e-05, "token_acc": 0.7503378646951268, "epoch": 1.4155193992490613, "step": 566}, {"loss": 0.7155381441116333, "grad_norm": 1.605635404586792, "learning_rate": 1.4645078147069402e-05, "token_acc": 0.7872617578499932, "epoch": 1.4180225281602001, "step": 567}, {"loss": 0.7572216987609863, "grad_norm": 1.4522089958190918, "learning_rate": 1.4533506561564306e-05, "token_acc": 0.7713926653718725, "epoch": 1.4205256570713392, "step": 568}, {"loss": 0.8563569784164429, "grad_norm": 1.9692518711090088, "learning_rate": 1.4422187173183899e-05, "token_acc": 0.7470536883457005, "epoch": 1.4230287859824782, "step": 569}, {"loss": 0.7974921464920044, "grad_norm": 10.908825874328613, "learning_rate": 1.4311122664242954e-05, "token_acc": 0.7605943594506085, "epoch": 1.425531914893617, "step": 570}, {"loss": 0.7666845321655273, "grad_norm": 1.1746379137039185, "learning_rate": 1.4200315710914705e-05, "token_acc": 0.7709790209790209, "epoch": 1.428035043804756, "step": 571}, {"loss": 0.7350344061851501, "grad_norm": 1.0229063034057617, "learning_rate": 1.4089768983166444e-05, "token_acc": 0.7786911497811466, "epoch": 1.4305381727158948, "step": 572}, {"loss": 0.6754674315452576, "grad_norm": 0.9891268610954285, "learning_rate": 1.3979485144695158e-05, "token_acc": 0.7943711387384639, "epoch": 1.4330413016270338, "step": 573}, {"loss": 0.8030673265457153, "grad_norm": 1.231886386871338, "learning_rate": 1.38694668528633e-05, "token_acc": 0.7635471587580551, "epoch": 1.4355444305381728, "step": 574}, {"loss": 0.8548064827919006, "grad_norm": 1.0724684000015259, "learning_rate": 1.3759716758634832e-05, "token_acc": 0.7461031175059952, "epoch": 1.4380475594493116, "step": 575}, {"loss": 0.8126094341278076, "grad_norm": 1.5738338232040405, "learning_rate": 1.3650237506511331e-05, "token_acc": 0.7611274150158963, "epoch": 1.4405506883604506, "step": 576}, {"loss": 0.8209086656570435, "grad_norm": 1.4901602268218994, "learning_rate": 1.3541031734468212e-05, "token_acc": 0.7550751384128658, "epoch": 1.4430538172715894, "step": 577}, {"loss": 0.6577416658401489, "grad_norm": 1.6848169565200806, "learning_rate": 1.3432102073891251e-05, "token_acc": 0.8033895475037569, "epoch": 1.4455569461827285, "step": 578}, {"loss": 0.6531224846839905, "grad_norm": 3.016223907470703, "learning_rate": 1.3323451149513092e-05, "token_acc": 0.8058121432278152, "epoch": 1.4480600750938675, "step": 579}, {"loss": 0.7647002339363098, "grad_norm": 1.9795825481414795, "learning_rate": 1.3215081579350058e-05, "token_acc": 0.7752119263373283, "epoch": 1.4505632040050063, "step": 580}, {"loss": 0.7398731708526611, "grad_norm": 2.140911817550659, "learning_rate": 1.3106995974639084e-05, "token_acc": 0.7717614002224433, "epoch": 1.453066332916145, "step": 581}, {"loss": 0.9219870567321777, "grad_norm": 1.2959418296813965, "learning_rate": 1.2999196939774722e-05, "token_acc": 0.735004404580764, "epoch": 1.455569461827284, "step": 582}, {"loss": 0.6551182866096497, "grad_norm": 3.881425619125366, "learning_rate": 1.2891687072246472e-05, "token_acc": 0.800154768814084, "epoch": 1.458072590738423, "step": 583}, {"loss": 0.8579003214836121, "grad_norm": 0.6841437220573425, "learning_rate": 1.2784468962576136e-05, "token_acc": 0.7427914321021557, "epoch": 1.460575719649562, "step": 584}, {"loss": 0.7305861711502075, "grad_norm": 2.339364528656006, "learning_rate": 1.2677545194255402e-05, "token_acc": 0.7815454841865015, "epoch": 1.463078848560701, "step": 585}, {"loss": 0.7356473207473755, "grad_norm": 1.287462592124939, "learning_rate": 1.2570918343683635e-05, "token_acc": 0.7739403453689168, "epoch": 1.4655819774718397, "step": 586}, {"loss": 0.8273265361785889, "grad_norm": 1.0997488498687744, "learning_rate": 1.2464590980105776e-05, "token_acc": 0.7510488803518173, "epoch": 1.4680851063829787, "step": 587}, {"loss": 0.6755957007408142, "grad_norm": 2.9153354167938232, "learning_rate": 1.235856566555039e-05, "token_acc": 0.7906052393857272, "epoch": 1.4705882352941178, "step": 588}, {"loss": 0.730632483959198, "grad_norm": 1.6633471250534058, "learning_rate": 1.2252844954767984e-05, "token_acc": 0.7806400809944316, "epoch": 1.4730913642052565, "step": 589}, {"loss": 0.6703206300735474, "grad_norm": 2.127331495285034, "learning_rate": 1.2147431395169459e-05, "token_acc": 0.7975905830421188, "epoch": 1.4755944931163956, "step": 590}, {"loss": 0.7496579885482788, "grad_norm": 1.4636554718017578, "learning_rate": 1.2042327526764669e-05, "token_acc": 0.7742579196807183, "epoch": 1.4780976220275344, "step": 591}, {"loss": 0.6405739188194275, "grad_norm": 2.0527307987213135, "learning_rate": 1.1937535882101281e-05, "token_acc": 0.80549558390579, "epoch": 1.4806007509386734, "step": 592}, {"loss": 0.7799682021141052, "grad_norm": 1.2344170808792114, "learning_rate": 1.1833058986203705e-05, "token_acc": 0.7664561072082178, "epoch": 1.4831038798498124, "step": 593}, {"loss": 0.8071370124816895, "grad_norm": 5.459070205688477, "learning_rate": 1.1728899356512265e-05, "token_acc": 0.7617416829745597, "epoch": 1.4856070087609512, "step": 594}, {"loss": 0.7295643091201782, "grad_norm": 1.069473147392273, "learning_rate": 1.1625059502822574e-05, "token_acc": 0.776476912968162, "epoch": 1.48811013767209, "step": 595}, {"loss": 0.6706807017326355, "grad_norm": 3.8844616413116455, "learning_rate": 1.1521541927224994e-05, "token_acc": 0.7991722152240418, "epoch": 1.490613266583229, "step": 596}, {"loss": 0.8247233033180237, "grad_norm": 5.004199028015137, "learning_rate": 1.1418349124044405e-05, "token_acc": 0.7518777783455112, "epoch": 1.493116395494368, "step": 597}, {"loss": 0.8894381523132324, "grad_norm": 3.0730934143066406, "learning_rate": 1.1315483579780095e-05, "token_acc": 0.7409200968523002, "epoch": 1.4956195244055068, "step": 598}, {"loss": 0.71524977684021, "grad_norm": 1.2874910831451416, "learning_rate": 1.1212947773045767e-05, "token_acc": 0.7803266787658802, "epoch": 1.4981226533166458, "step": 599}, {"loss": 0.7700718641281128, "grad_norm": 1.2464348077774048, "learning_rate": 1.1110744174509952e-05, "token_acc": 0.7670187496841361, "epoch": 1.5006257822277846, "step": 600}, {"loss": 0.7547957897186279, "grad_norm": 3.6714982986450195, "learning_rate": 1.100887524683635e-05, "token_acc": 0.7734226755218216, "epoch": 1.5031289111389237, "step": 601}, {"loss": 0.8919792175292969, "grad_norm": 0.8484803438186646, "learning_rate": 1.090734344462458e-05, "token_acc": 0.7393400901906505, "epoch": 1.5056320400500627, "step": 602}, {"loss": 0.7702862620353699, "grad_norm": 13.488743782043457, "learning_rate": 1.0806151214350995e-05, "token_acc": 0.7727465986394558, "epoch": 1.5081351689612015, "step": 603}, {"loss": 0.7595404386520386, "grad_norm": 1.961902141571045, "learning_rate": 1.0705300994309697e-05, "token_acc": 0.7702451257988836, "epoch": 1.5106382978723403, "step": 604}, {"loss": 0.6995214223861694, "grad_norm": 27.53681755065918, "learning_rate": 1.0604795214553868e-05, "token_acc": 0.787663379958725, "epoch": 1.5131414267834793, "step": 605}, {"loss": 0.9005197286605835, "grad_norm": 0.8332082629203796, "learning_rate": 1.0504636296837161e-05, "token_acc": 0.737596511295396, "epoch": 1.5156445556946183, "step": 606}, {"loss": 0.8386024832725525, "grad_norm": 0.8233015537261963, "learning_rate": 1.0404826654555342e-05, "token_acc": 0.7470095378616219, "epoch": 1.5181476846057573, "step": 607}, {"loss": 0.7929884791374207, "grad_norm": 1.1943548917770386, "learning_rate": 1.0305368692688174e-05, "token_acc": 0.7622805984214867, "epoch": 1.5206508135168961, "step": 608}, {"loss": 0.80124831199646, "grad_norm": 0.8096246719360352, "learning_rate": 1.0206264807741434e-05, "token_acc": 0.7553728275088768, "epoch": 1.523153942428035, "step": 609}, {"loss": 0.6171380281448364, "grad_norm": 1.0610454082489014, "learning_rate": 1.0107517387689166e-05, "token_acc": 0.8159301496792587, "epoch": 1.525657071339174, "step": 610}, {"loss": 0.650100588798523, "grad_norm": 18.28238296508789, "learning_rate": 1.0009128811916197e-05, "token_acc": 0.7978654890054283, "epoch": 1.528160200250313, "step": 611}, {"loss": 0.7620124220848083, "grad_norm": 3.4466676712036133, "learning_rate": 9.911101451160715e-06, "token_acc": 0.7711020108795306, "epoch": 1.530663329161452, "step": 612}, {"loss": 0.6602888703346252, "grad_norm": 1.2529813051223755, "learning_rate": 9.813437667457229e-06, "token_acc": 0.8008800880088008, "epoch": 1.5331664580725908, "step": 613}, {"loss": 0.8434534072875977, "grad_norm": 1.17232346534729, "learning_rate": 9.716139814079595e-06, "token_acc": 0.7494439855118511, "epoch": 1.5356695869837296, "step": 614}, {"loss": 0.7442387938499451, "grad_norm": 1.747151494026184, "learning_rate": 9.619210235484333e-06, "token_acc": 0.7745351402458241, "epoch": 1.5381727158948686, "step": 615}, {"loss": 0.7317293882369995, "grad_norm": 1.0021146535873413, "learning_rate": 9.522651267254149e-06, "token_acc": 0.7734412184673964, "epoch": 1.5406758448060076, "step": 616}, {"loss": 0.7032402753829956, "grad_norm": 1.3337068557739258, "learning_rate": 9.426465236041651e-06, "token_acc": 0.7877114998566103, "epoch": 1.5431789737171464, "step": 617}, {"loss": 0.7973721027374268, "grad_norm": 1.3676468133926392, "learning_rate": 9.330654459513266e-06, "token_acc": 0.760376150854217, "epoch": 1.5456821026282852, "step": 618}, {"loss": 0.8150185346603394, "grad_norm": 3.2059834003448486, "learning_rate": 9.235221246293405e-06, "token_acc": 0.7556632064590542, "epoch": 1.5481852315394242, "step": 619}, {"loss": 0.7822086811065674, "grad_norm": 4.086306571960449, "learning_rate": 9.140167895908867e-06, "token_acc": 0.7675454095695808, "epoch": 1.5506883604505632, "step": 620}, {"loss": 0.8220715522766113, "grad_norm": 1.2040249109268188, "learning_rate": 9.04549669873337e-06, "token_acc": 0.7524804177545692, "epoch": 1.5531914893617023, "step": 621}, {"loss": 0.6137598752975464, "grad_norm": 1.4175060987472534, "learning_rate": 8.951209935932426e-06, "token_acc": 0.8119511672735061, "epoch": 1.555694618272841, "step": 622}, {"loss": 0.6729296445846558, "grad_norm": 1.2992089986801147, "learning_rate": 8.857309879408324e-06, "token_acc": 0.7988444254226407, "epoch": 1.5581977471839799, "step": 623}, {"loss": 0.8189102411270142, "grad_norm": 1.4079190492630005, "learning_rate": 8.763798791745411e-06, "token_acc": 0.7577023215448037, "epoch": 1.5607008760951189, "step": 624}, {"loss": 0.8362364172935486, "grad_norm": 1.279236078262329, "learning_rate": 8.670678926155587e-06, "token_acc": 0.7482024803358587, "epoch": 1.563204005006258, "step": 625}, {"loss": 0.8098462820053101, "grad_norm": 1.2863163948059082, "learning_rate": 8.577952526423969e-06, "token_acc": 0.7593269058027426, "epoch": 1.565707133917397, "step": 626}, {"loss": 0.7063795328140259, "grad_norm": 27.66785430908203, "learning_rate": 8.48562182685487e-06, "token_acc": 0.7867946863080363, "epoch": 1.5682102628285357, "step": 627}, {"loss": 0.6462287902832031, "grad_norm": 4.928782939910889, "learning_rate": 8.393689052217966e-06, "token_acc": 0.8011155656266341, "epoch": 1.5707133917396745, "step": 628}, {"loss": 0.6783524751663208, "grad_norm": 1.9602354764938354, "learning_rate": 8.3021564176946e-06, "token_acc": 0.7902308752584425, "epoch": 1.5732165206508135, "step": 629}, {"loss": 0.804925799369812, "grad_norm": 16.4473876953125, "learning_rate": 8.211026128824539e-06, "token_acc": 0.7570687117514912, "epoch": 1.5757196495619525, "step": 630}, {"loss": 0.8883236646652222, "grad_norm": 1.3788988590240479, "learning_rate": 8.120300381452742e-06, "token_acc": 0.7334713259466699, "epoch": 1.5782227784730913, "step": 631}, {"loss": 0.6375362873077393, "grad_norm": 1.8335654735565186, "learning_rate": 8.029981361676456e-06, "token_acc": 0.8153648894112618, "epoch": 1.5807259073842301, "step": 632}, {"loss": 0.6049902439117432, "grad_norm": 1.9014967679977417, "learning_rate": 7.940071245792579e-06, "token_acc": 0.8161649828142902, "epoch": 1.5832290362953692, "step": 633}, {"loss": 0.6988447904586792, "grad_norm": 1.3713113069534302, "learning_rate": 7.850572200245184e-06, "token_acc": 0.7880343393220639, "epoch": 1.5857321652065082, "step": 634}, {"loss": 0.7015566229820251, "grad_norm": 2.0989935398101807, "learning_rate": 7.761486381573327e-06, "token_acc": 0.7867938866841172, "epoch": 1.5882352941176472, "step": 635}, {"loss": 0.7713178992271423, "grad_norm": 2.8194093704223633, "learning_rate": 7.672815936359107e-06, "token_acc": 0.7664939550949914, "epoch": 1.590738423028786, "step": 636}, {"loss": 0.8152978420257568, "grad_norm": 2.2756409645080566, "learning_rate": 7.584563001175896e-06, "token_acc": 0.7565742546007894, "epoch": 1.5932415519399248, "step": 637}, {"loss": 0.6049292087554932, "grad_norm": 2.1602797508239746, "learning_rate": 7.4967297025369114e-06, "token_acc": 0.8249440056583756, "epoch": 1.5957446808510638, "step": 638}, {"loss": 0.9276903867721558, "grad_norm": 11.161283493041992, "learning_rate": 7.409318156843933e-06, "token_acc": 0.7289690681738996, "epoch": 1.5982478097622028, "step": 639}, {"loss": 0.7289862632751465, "grad_norm": 1.107016921043396, "learning_rate": 7.3223304703363135e-06, "token_acc": 0.7762255053470978, "epoch": 1.6007509386733418, "step": 640}, {"loss": 0.8030155897140503, "grad_norm": 1.384218692779541, "learning_rate": 7.235768739040258e-06, "token_acc": 0.7603261596043309, "epoch": 1.6032540675844806, "step": 641}, {"loss": 0.8239895105361938, "grad_norm": 2.4319992065429688, "learning_rate": 7.149635048718295e-06, "token_acc": 0.7537327021121631, "epoch": 1.6057571964956194, "step": 642}, {"loss": 0.9458705186843872, "grad_norm": 1.7713115215301514, "learning_rate": 7.063931474819005e-06, "token_acc": 0.7223184753504489, "epoch": 1.6082603254067585, "step": 643}, {"loss": 0.8767014145851135, "grad_norm": 1.1825437545776367, "learning_rate": 6.9786600824270296e-06, "token_acc": 0.7381348433905504, "epoch": 1.6107634543178975, "step": 644}, {"loss": 0.7727670669555664, "grad_norm": 9.377113342285156, "learning_rate": 6.893822926213331e-06, "token_acc": 0.7667001312842691, "epoch": 1.6132665832290363, "step": 645}, {"loss": 0.7251728177070618, "grad_norm": 1.6212266683578491, "learning_rate": 6.8094220503856275e-06, "token_acc": 0.7853043560071502, "epoch": 1.615769712140175, "step": 646}, {"loss": 0.8785561919212341, "grad_norm": 1.0910215377807617, "learning_rate": 6.725459488639211e-06, "token_acc": 0.7388308513002889, "epoch": 1.618272841051314, "step": 647}, {"loss": 0.7488150596618652, "grad_norm": 2.236516237258911, "learning_rate": 6.641937264107867e-06, "token_acc": 0.7735017626321974, "epoch": 1.620775969962453, "step": 648}, {"loss": 0.6163979768753052, "grad_norm": 2.128631114959717, "learning_rate": 6.558857389315179e-06, "token_acc": 0.810862691960253, "epoch": 1.6232790988735921, "step": 649}, {"loss": 0.8207809329032898, "grad_norm": 1.3468025922775269, "learning_rate": 6.476221866126029e-06, "token_acc": 0.7570913888466028, "epoch": 1.625782227784731, "step": 650}, {"loss": 0.8186502456665039, "grad_norm": 3.4600303173065186, "learning_rate": 6.394032685698325e-06, "token_acc": 0.7548624496232696, "epoch": 1.6282853566958697, "step": 651}, {"loss": 0.6305141448974609, "grad_norm": 3.5918667316436768, "learning_rate": 6.312291828435077e-06, "token_acc": 0.8072335886744885, "epoch": 1.6307884856070087, "step": 652}, {"loss": 0.7253304719924927, "grad_norm": 1.0806105136871338, "learning_rate": 6.231001263936651e-06, "token_acc": 0.7833950441469667, "epoch": 1.6332916145181477, "step": 653}, {"loss": 0.8548451066017151, "grad_norm": 1.2885851860046387, "learning_rate": 6.150162950953264e-06, "token_acc": 0.7464474922018122, "epoch": 1.6357947434292868, "step": 654}, {"loss": 0.8382260799407959, "grad_norm": 1.0645694732666016, "learning_rate": 6.069778837337886e-06, "token_acc": 0.7489557422443328, "epoch": 1.6382978723404256, "step": 655}, {"loss": 0.7723536491394043, "grad_norm": 1.9353832006454468, "learning_rate": 5.989850859999227e-06, "token_acc": 0.7694327731092437, "epoch": 1.6408010012515644, "step": 656}, {"loss": 0.8856979608535767, "grad_norm": 4.828452110290527, "learning_rate": 5.910380944855087e-06, "token_acc": 0.738218359188763, "epoch": 1.6433041301627034, "step": 657}, {"loss": 0.7738165259361267, "grad_norm": 1.8781278133392334, "learning_rate": 5.8313710067859626e-06, "token_acc": 0.768805515870551, "epoch": 1.6458072590738424, "step": 658}, {"loss": 0.8133803606033325, "grad_norm": 3.0246331691741943, "learning_rate": 5.752822949588893e-06, "token_acc": 0.7611378205128205, "epoch": 1.6483103879849812, "step": 659}, {"loss": 0.7647578120231628, "grad_norm": 1.3994319438934326, "learning_rate": 5.674738665931575e-06, "token_acc": 0.7703229113275244, "epoch": 1.65081351689612, "step": 660}, {"loss": 0.7304031252861023, "grad_norm": 2.361185312271118, "learning_rate": 5.597120037306808e-06, "token_acc": 0.7841618588477041, "epoch": 1.653316645807259, "step": 661}, {"loss": 0.7237846255302429, "grad_norm": 0.8526070713996887, "learning_rate": 5.519968933987083e-06, "token_acc": 0.7868933969769292, "epoch": 1.655819774718398, "step": 662}, {"loss": 0.6091185212135315, "grad_norm": 1.588171362876892, "learning_rate": 5.443287214979592e-06, "token_acc": 0.8140839427025944, "epoch": 1.658322903629537, "step": 663}, {"loss": 0.6413316130638123, "grad_norm": 5.0973029136657715, "learning_rate": 5.367076727981382e-06, "token_acc": 0.804970235283001, "epoch": 1.6608260325406758, "step": 664}, {"loss": 0.6981616020202637, "grad_norm": 1.4185309410095215, "learning_rate": 5.291339309334845e-06, "token_acc": 0.7925278219395866, "epoch": 1.6633291614518146, "step": 665}, {"loss": 0.690722644329071, "grad_norm": 1.9851809740066528, "learning_rate": 5.216076783983493e-06, "token_acc": 0.7912854528819762, "epoch": 1.6658322903629537, "step": 666}, {"loss": 0.8563956022262573, "grad_norm": 0.9478880763053894, "learning_rate": 5.141290965427966e-06, "token_acc": 0.7468872958551178, "epoch": 1.6683354192740927, "step": 667}, {"loss": 0.8058983683586121, "grad_norm": 3.0436248779296875, "learning_rate": 5.066983655682325e-06, "token_acc": 0.7552821610056165, "epoch": 1.6708385481852317, "step": 668}, {"loss": 0.8022825717926025, "grad_norm": 0.8428975939750671, "learning_rate": 4.993156645230643e-06, "token_acc": 0.7613861386138614, "epoch": 1.6733416770963705, "step": 669}, {"loss": 0.8100841641426086, "grad_norm": 4.840924263000488, "learning_rate": 4.91981171298388e-06, "token_acc": 0.7554166666666666, "epoch": 1.6758448060075093, "step": 670}, {"loss": 0.8260376453399658, "grad_norm": 1.1505413055419922, "learning_rate": 4.846950626236976e-06, "token_acc": 0.7448619472700851, "epoch": 1.6783479349186483, "step": 671}, {"loss": 0.8600703477859497, "grad_norm": 0.9072193503379822, "learning_rate": 4.7745751406263165e-06, "token_acc": 0.7444852298549205, "epoch": 1.6808510638297873, "step": 672}, {"loss": 0.692681610584259, "grad_norm": 1.7683610916137695, "learning_rate": 4.702687000087386e-06, "token_acc": 0.7806238492364346, "epoch": 1.6833541927409261, "step": 673}, {"loss": 0.7662481069564819, "grad_norm": 1.461195468902588, "learning_rate": 4.631287936812764e-06, "token_acc": 0.7671449553722743, "epoch": 1.685857321652065, "step": 674}, {"loss": 0.7405479550361633, "grad_norm": 3.3718554973602295, "learning_rate": 4.56037967121041e-06, "token_acc": 0.7750420168067227, "epoch": 1.688360450563204, "step": 675}, {"loss": 0.8610312938690186, "grad_norm": 2.9479410648345947, "learning_rate": 4.48996391186216e-06, "token_acc": 0.7424875170222424, "epoch": 1.690863579474343, "step": 676}, {"loss": 0.7888531684875488, "grad_norm": 13.503181457519531, "learning_rate": 4.420042355482601e-06, "token_acc": 0.765451076009753, "epoch": 1.693366708385482, "step": 677}, {"loss": 0.7960864305496216, "grad_norm": 0.7887119054794312, "learning_rate": 4.350616686878176e-06, "token_acc": 0.7637773578963942, "epoch": 1.6958698372966208, "step": 678}, {"loss": 0.8545209169387817, "grad_norm": 0.7959216237068176, "learning_rate": 4.2816885789065504e-06, "token_acc": 0.7468409007993101, "epoch": 1.6983729662077596, "step": 679}, {"loss": 0.7095437049865723, "grad_norm": 2.6820693016052246, "learning_rate": 4.213259692436367e-06, "token_acc": 0.7877780240892632, "epoch": 1.7008760951188986, "step": 680}, {"loss": 0.7295015454292297, "grad_norm": 1.3040446043014526, "learning_rate": 4.1453316763071935e-06, "token_acc": 0.7838582677165354, "epoch": 1.7033792240300376, "step": 681}, {"loss": 0.7117878794670105, "grad_norm": 1.168471336364746, "learning_rate": 4.077906167289766e-06, "token_acc": 0.7835704178148507, "epoch": 1.7058823529411766, "step": 682}, {"loss": 0.677824079990387, "grad_norm": 4.244610786437988, "learning_rate": 4.010984790046615e-06, "token_acc": 0.7980658751436231, "epoch": 1.7083854818523154, "step": 683}, {"loss": 0.8463807702064514, "grad_norm": 2.731039047241211, "learning_rate": 3.944569157092839e-06, "token_acc": 0.7515052317764658, "epoch": 1.7108886107634542, "step": 684}, {"loss": 0.6157097816467285, "grad_norm": 1.8785216808319092, "learning_rate": 3.878660868757323e-06, "token_acc": 0.8154915079773546, "epoch": 1.7133917396745932, "step": 685}, {"loss": 0.8836787939071655, "grad_norm": 0.865153431892395, "learning_rate": 3.8132615131441396e-06, "token_acc": 0.7380481451107145, "epoch": 1.7158948685857323, "step": 686}, {"loss": 0.8360207676887512, "grad_norm": 0.8936150074005127, "learning_rate": 3.748372666094277e-06, "token_acc": 0.7508485460049537, "epoch": 1.718397997496871, "step": 687}, {"loss": 0.7108975052833557, "grad_norm": 2.322671890258789, "learning_rate": 3.6839958911476957e-06, "token_acc": 0.7858799072519389, "epoch": 1.7209011264080099, "step": 688}, {"loss": 0.6993001699447632, "grad_norm": 3.3480117321014404, "learning_rate": 3.6201327395056246e-06, "token_acc": 0.7873237489632292, "epoch": 1.7234042553191489, "step": 689}, {"loss": 0.7427332997322083, "grad_norm": 1.8085229396820068, "learning_rate": 3.5567847499932e-06, "token_acc": 0.7776805599745467, "epoch": 1.7259073842302879, "step": 690}, {"loss": 0.6952468752861023, "grad_norm": 1.3708637952804565, "learning_rate": 3.4939534490223912e-06, "token_acc": 0.794788931528984, "epoch": 1.728410513141427, "step": 691}, {"loss": 0.6230769157409668, "grad_norm": 3.7617907524108887, "learning_rate": 3.431640350555204e-06, "token_acc": 0.8099717779868297, "epoch": 1.7309136420525657, "step": 692}, {"loss": 0.6950256824493408, "grad_norm": 1.36726713180542, "learning_rate": 3.369846956067224e-06, "token_acc": 0.7924514890894875, "epoch": 1.7334167709637045, "step": 693}, {"loss": 0.8100589513778687, "grad_norm": 0.9996148943901062, "learning_rate": 3.308574754511404e-06, "token_acc": 0.7537666602279313, "epoch": 1.7359198998748435, "step": 694}, {"loss": 0.7753657102584839, "grad_norm": 1.661024570465088, "learning_rate": 3.2478252222822164e-06, "token_acc": 0.7681395005172159, "epoch": 1.7384230287859825, "step": 695}, {"loss": 0.7994472980499268, "grad_norm": 2.1857688426971436, "learning_rate": 3.187599823180071e-06, "token_acc": 0.759318423855165, "epoch": 1.7409261576971216, "step": 696}, {"loss": 0.7001972198486328, "grad_norm": 3.475571870803833, "learning_rate": 3.1279000083760447e-06, "token_acc": 0.7877510538060997, "epoch": 1.7434292866082604, "step": 697}, {"loss": 0.8403792977333069, "grad_norm": 1.2787102460861206, "learning_rate": 3.0687272163768987e-06, "token_acc": 0.747796232717825, "epoch": 1.7459324155193992, "step": 698}, {"loss": 0.8107684850692749, "grad_norm": 4.386336326599121, "learning_rate": 3.0100828729904275e-06, "token_acc": 0.7630341042728341, "epoch": 1.7484355444305382, "step": 699}, {"loss": 0.8950088024139404, "grad_norm": 2.2676963806152344, "learning_rate": 2.9519683912911266e-06, "token_acc": 0.7388262048456223, "epoch": 1.7509386733416772, "step": 700}, {"loss": 0.8310389518737793, "grad_norm": 1.0399364233016968, "learning_rate": 2.894385171586095e-06, "token_acc": 0.7524891179266523, "epoch": 1.753441802252816, "step": 701}, {"loss": 0.8382736444473267, "grad_norm": 1.593347191810608, "learning_rate": 2.837334601381342e-06, "token_acc": 0.7514249790444258, "epoch": 1.7559449311639548, "step": 702}, {"loss": 0.6921058893203735, "grad_norm": 1.2109148502349854, "learning_rate": 2.7808180553483165e-06, "token_acc": 0.787412490469259, "epoch": 1.7584480600750938, "step": 703}, {"loss": 0.8293173313140869, "grad_norm": 0.9180388450622559, "learning_rate": 2.7248368952908053e-06, "token_acc": 0.757765414928141, "epoch": 1.7609511889862328, "step": 704}, {"loss": 0.7837424278259277, "grad_norm": 1.0169309377670288, "learning_rate": 2.66939247011212e-06, "token_acc": 0.7702204734245206, "epoch": 1.7634543178973718, "step": 705}, {"loss": 0.7397447824478149, "grad_norm": 2.0241503715515137, "learning_rate": 2.6144861157825774e-06, "token_acc": 0.782954903815831, "epoch": 1.7659574468085106, "step": 706}, {"loss": 0.7422389984130859, "grad_norm": 3.890124559402466, "learning_rate": 2.560119155307325e-06, "token_acc": 0.7778991727797722, "epoch": 1.7684605757196494, "step": 707}, {"loss": 0.8820300698280334, "grad_norm": 1.0221773386001587, "learning_rate": 2.506292898694468e-06, "token_acc": 0.7368034292712798, "epoch": 1.7709637046307884, "step": 708}, {"loss": 0.8977921009063721, "grad_norm": 1.0830367803573608, "learning_rate": 2.45300864292346e-06, "token_acc": 0.7326030349286163, "epoch": 1.7734668335419275, "step": 709}, {"loss": 0.7248738408088684, "grad_norm": 1.0371887683868408, "learning_rate": 2.4002676719139166e-06, "token_acc": 0.7812835915270313, "epoch": 1.7759699624530665, "step": 710}, {"loss": 0.7425920963287354, "grad_norm": 1.263805866241455, "learning_rate": 2.348071256494633e-06, "token_acc": 0.7737332204619664, "epoch": 1.7784730913642053, "step": 711}, {"loss": 0.8866590261459351, "grad_norm": 14.53322696685791, "learning_rate": 2.296420654372966e-06, "token_acc": 0.7439101885193815, "epoch": 1.780976220275344, "step": 712}, {"loss": 0.7303316593170166, "grad_norm": 1.5575921535491943, "learning_rate": 2.2453171101045585e-06, "token_acc": 0.7762118300234893, "epoch": 1.783479349186483, "step": 713}, {"loss": 0.9044393301010132, "grad_norm": 1.711562156677246, "learning_rate": 2.1947618550633097e-06, "token_acc": 0.729759955266206, "epoch": 1.7859824780976221, "step": 714}, {"loss": 0.7561551928520203, "grad_norm": 1.9925239086151123, "learning_rate": 2.144756107411733e-06, "token_acc": 0.775, "epoch": 1.788485607008761, "step": 715}, {"loss": 0.7318213582038879, "grad_norm": 1.4626455307006836, "learning_rate": 2.0953010720716037e-06, "token_acc": 0.7775335492827394, "epoch": 1.7909887359198997, "step": 716}, {"loss": 0.8696292638778687, "grad_norm": 1.060317039489746, "learning_rate": 2.0463979406949026e-06, "token_acc": 0.7421656220829443, "epoch": 1.7934918648310387, "step": 717}, {"loss": 0.7886737585067749, "grad_norm": 0.9130681157112122, "learning_rate": 1.99804789163513e-06, "token_acc": 0.7600247142415817, "epoch": 1.7959949937421777, "step": 718}, {"loss": 0.762123703956604, "grad_norm": 1.1878103017807007, "learning_rate": 1.9502520899188913e-06, "token_acc": 0.7682668745823124, "epoch": 1.7984981226533168, "step": 719}, {"loss": 0.615555465221405, "grad_norm": 1.7159684896469116, "learning_rate": 1.9030116872178316e-06, "token_acc": 0.8126673532440782, "epoch": 1.8010012515644556, "step": 720}, {"loss": 0.6307755708694458, "grad_norm": 1.6527683734893799, "learning_rate": 1.8563278218208996e-06, "token_acc": 0.8067388444804209, "epoch": 1.8035043804755944, "step": 721}, {"loss": 0.8727781176567078, "grad_norm": 3.193925619125366, "learning_rate": 1.8102016186068993e-06, "token_acc": 0.7392866177586643, "epoch": 1.8060075093867334, "step": 722}, {"loss": 0.8311202526092529, "grad_norm": 0.9598880410194397, "learning_rate": 1.7646341890173918e-06, "token_acc": 0.7487229203176852, "epoch": 1.8085106382978724, "step": 723}, {"loss": 0.7448897957801819, "grad_norm": 2.1851632595062256, "learning_rate": 1.7196266310299108e-06, "token_acc": 0.7755723861756768, "epoch": 1.8110137672090114, "step": 724}, {"loss": 0.7494593858718872, "grad_norm": 1.598838448524475, "learning_rate": 1.675180029131529e-06, "token_acc": 0.7767838568753901, "epoch": 1.8135168961201502, "step": 725}, {"loss": 0.7850619554519653, "grad_norm": 2.4717111587524414, "learning_rate": 1.631295454292689e-06, "token_acc": 0.7650719167601755, "epoch": 1.816020025031289, "step": 726}, {"loss": 0.7940848469734192, "grad_norm": 1.356717586517334, "learning_rate": 1.5879739639414333e-06, "token_acc": 0.768211150514505, "epoch": 1.818523153942428, "step": 727}, {"loss": 0.7329187393188477, "grad_norm": 10.029845237731934, "learning_rate": 1.5452166019378989e-06, "token_acc": 0.7865592568401191, "epoch": 1.821026282853567, "step": 728}, {"loss": 0.8017995953559875, "grad_norm": 0.8495982885360718, "learning_rate": 1.5030243985491743e-06, "token_acc": 0.7568345323741007, "epoch": 1.8235294117647058, "step": 729}, {"loss": 0.7437936663627625, "grad_norm": 1.0362679958343506, "learning_rate": 1.4613983704244826e-06, "token_acc": 0.7828212859587645, "epoch": 1.8260325406758446, "step": 730}, {"loss": 0.8609859943389893, "grad_norm": 0.9663056135177612, "learning_rate": 1.4203395205706683e-06, "token_acc": 0.7439180537772087, "epoch": 1.8285356695869837, "step": 731}, {"loss": 0.7277930378913879, "grad_norm": 1.3956825733184814, "learning_rate": 1.379848838328049e-06, "token_acc": 0.7791022255752547, "epoch": 1.8310387984981227, "step": 732}, {"loss": 0.7486779093742371, "grad_norm": 3.7636775970458984, "learning_rate": 1.3399272993465607e-06, "token_acc": 0.7818169417541945, "epoch": 1.8335419274092617, "step": 733}, {"loss": 0.8382982611656189, "grad_norm": 1.315354347229004, "learning_rate": 1.3005758655622424e-06, "token_acc": 0.7525453258561551, "epoch": 1.8360450563204005, "step": 734}, {"loss": 0.8941514492034912, "grad_norm": 1.1111931800842285, "learning_rate": 1.2617954851740832e-06, "token_acc": 0.7349274757866444, "epoch": 1.8385481852315393, "step": 735}, {"loss": 0.8244005441665649, "grad_norm": 1.297447919845581, "learning_rate": 1.2235870926211619e-06, "token_acc": 0.7516801237731471, "epoch": 1.8410513141426783, "step": 736}, {"loss": 0.6347471475601196, "grad_norm": 1.0711147785186768, "learning_rate": 1.185951608560118e-06, "token_acc": 0.8084218512898331, "epoch": 1.8435544430538173, "step": 737}, {"loss": 0.7033067941665649, "grad_norm": 1.7543067932128906, "learning_rate": 1.1488899398429898e-06, "token_acc": 0.7927236056163215, "epoch": 1.8460575719649563, "step": 738}, {"loss": 0.7322490215301514, "grad_norm": 1.6257784366607666, "learning_rate": 1.1124029794953472e-06, "token_acc": 0.776595744680851, "epoch": 1.8485607008760951, "step": 739}, {"loss": 0.748277485370636, "grad_norm": 1.1702452898025513, "learning_rate": 1.0764916066947794e-06, "token_acc": 0.7742450209798475, "epoch": 1.851063829787234, "step": 740}, {"loss": 0.814299464225769, "grad_norm": 1.2065194845199585, "learning_rate": 1.041156686749717e-06, "token_acc": 0.7569658605204783, "epoch": 1.853566958698373, "step": 741}, {"loss": 0.723736047744751, "grad_norm": 1.3025304079055786, "learning_rate": 1.0063990710785648e-06, "token_acc": 0.7832843667852173, "epoch": 1.856070087609512, "step": 742}, {"loss": 0.8111813068389893, "grad_norm": 1.5178861618041992, "learning_rate": 9.72219597189211e-07, "token_acc": 0.7574536219081273, "epoch": 1.8585732165206508, "step": 743}, {"loss": 0.6973958015441895, "grad_norm": 1.1835012435913086, "learning_rate": 9.386190886588208e-07, "token_acc": 0.7883607669070958, "epoch": 1.8610763454317898, "step": 744}, {"loss": 0.8839579224586487, "grad_norm": 1.0553349256515503, "learning_rate": 9.05598355114004e-07, "token_acc": 0.7393556055524897, "epoch": 1.8635794743429286, "step": 745}, {"loss": 0.7688311338424683, "grad_norm": 2.3524389266967773, "learning_rate": 8.731581922113153e-07, "token_acc": 0.770196330865787, "epoch": 1.8660826032540676, "step": 746}, {"loss": 0.7249113321304321, "grad_norm": 2.358461380004883, "learning_rate": 8.412993816180687e-07, "token_acc": 0.7800233725166701, "epoch": 1.8685857321652066, "step": 747}, {"loss": 0.8962013721466064, "grad_norm": 0.9818371534347534, "learning_rate": 8.10022690993506e-07, "token_acc": 0.7347520288548242, "epoch": 1.8710888610763454, "step": 748}, {"loss": 0.8181411027908325, "grad_norm": 1.4014264345169067, "learning_rate": 7.793288739703003e-07, "token_acc": 0.7530269496159354, "epoch": 1.8735919899874842, "step": 749}, {"loss": 0.7440256476402283, "grad_norm": 2.099468469619751, "learning_rate": 7.492186701364007e-07, "token_acc": 0.7781477466315626, "epoch": 1.8760951188986232, "step": 750}, {"loss": 0.7947307229042053, "grad_norm": 1.3900328874588013, "learning_rate": 7.196928050172053e-07, "token_acc": 0.763049013367282, "epoch": 1.8785982478097623, "step": 751}, {"loss": 0.6677680611610413, "grad_norm": 1.937106966972351, "learning_rate": 6.907519900580861e-07, "token_acc": 0.7976190476190477, "epoch": 1.8811013767209013, "step": 752}, {"loss": 0.912758469581604, "grad_norm": 2.1338562965393066, "learning_rate": 6.623969226072363e-07, "token_acc": 0.7364955399869837, "epoch": 1.88360450563204, "step": 753}, {"loss": 0.8942464590072632, "grad_norm": 1.8719439506530762, "learning_rate": 6.34628285898875e-07, "token_acc": 0.7314372211599746, "epoch": 1.8861076345431789, "step": 754}, {"loss": 0.7492611408233643, "grad_norm": 1.125182032585144, "learning_rate": 6.074467490367885e-07, "token_acc": 0.7720939624419465, "epoch": 1.8886107634543179, "step": 755}, {"loss": 0.7720708847045898, "grad_norm": 5.945156097412109, "learning_rate": 5.808529669781904e-07, "token_acc": 0.7700412614205717, "epoch": 1.891113892365457, "step": 756}, {"loss": 0.7861109972000122, "grad_norm": 1.3858574628829956, "learning_rate": 5.548475805179587e-07, "token_acc": 0.7625415642619633, "epoch": 1.8936170212765957, "step": 757}, {"loss": 0.7062956094741821, "grad_norm": 3.03468656539917, "learning_rate": 5.294312162731934e-07, "token_acc": 0.7871165644171779, "epoch": 1.8961201501877347, "step": 758}, {"loss": 0.7970366477966309, "grad_norm": 1.1258817911148071, "learning_rate": 5.046044866680949e-07, "token_acc": 0.7655379339905701, "epoch": 1.8986232790988735, "step": 759}, {"loss": 0.7870966196060181, "grad_norm": 1.3906890153884888, "learning_rate": 4.803679899192392e-07, "token_acc": 0.7596698397397277, "epoch": 1.9011264080100125, "step": 760}, {"loss": 0.7451232671737671, "grad_norm": 1.0741008520126343, "learning_rate": 4.5672231002114596e-07, "token_acc": 0.7724817286304417, "epoch": 1.9036295369211516, "step": 761}, {"loss": 0.7417510151863098, "grad_norm": 1.251846194267273, "learning_rate": 4.3366801673220545e-07, "token_acc": 0.773992627431041, "epoch": 1.9061326658322904, "step": 762}, {"loss": 0.738898515701294, "grad_norm": 2.0354645252227783, "learning_rate": 4.1120566556096254e-07, "token_acc": 0.7741708247725272, "epoch": 1.9086357947434291, "step": 763}, {"loss": 0.635358452796936, "grad_norm": 3.412504196166992, "learning_rate": 3.8933579775271013e-07, "token_acc": 0.8070014872440224, "epoch": 1.9111389236545682, "step": 764}, {"loss": 0.7735419273376465, "grad_norm": 2.2815067768096924, "learning_rate": 3.680589402764695e-07, "token_acc": 0.7652030509173366, "epoch": 1.9136420525657072, "step": 765}, {"loss": 0.7568934559822083, "grad_norm": 2.218057870864868, "learning_rate": 3.4737560581228344e-07, "token_acc": 0.7767891934017405, "epoch": 1.9161451814768462, "step": 766}, {"loss": 0.8270889520645142, "grad_norm": 1.2979291677474976, "learning_rate": 3.2728629273885425e-07, "token_acc": 0.7507336930796176, "epoch": 1.918648310387985, "step": 767}, {"loss": 0.7350165247917175, "grad_norm": 1.37172269821167, "learning_rate": 3.077914851215585e-07, "token_acc": 0.7841965471447543, "epoch": 1.9211514392991238, "step": 768}, {"loss": 0.8009260892868042, "grad_norm": 5.036166667938232, "learning_rate": 2.8889165270075126e-07, "token_acc": 0.7600553949903661, "epoch": 1.9236545682102628, "step": 769}, {"loss": 0.6270233392715454, "grad_norm": 7.4999775886535645, "learning_rate": 2.705872508804747e-07, "token_acc": 0.8136564762670957, "epoch": 1.9261576971214018, "step": 770}, {"loss": 0.8184903860092163, "grad_norm": 1.1216583251953125, "learning_rate": 2.5287872071747543e-07, "token_acc": 0.7551860202931229, "epoch": 1.9286608260325406, "step": 771}, {"loss": 0.6371257305145264, "grad_norm": 3.301800489425659, "learning_rate": 2.3576648891056875e-07, "token_acc": 0.8157470801449859, "epoch": 1.9311639549436797, "step": 772}, {"loss": 0.8046694993972778, "grad_norm": 3.2778139114379883, "learning_rate": 2.192509677903687e-07, "token_acc": 0.7623718671832851, "epoch": 1.9336670838548184, "step": 773}, {"loss": 0.84852534532547, "grad_norm": 1.263893485069275, "learning_rate": 2.0333255530934902e-07, "token_acc": 0.74725317090096, "epoch": 1.9361702127659575, "step": 774}, {"loss": 0.7684552073478699, "grad_norm": 0.9263530969619751, "learning_rate": 1.8801163503225083e-07, "token_acc": 0.7751570594070318, "epoch": 1.9386733416770965, "step": 775}, {"loss": 0.7462726831436157, "grad_norm": 1.1419495344161987, "learning_rate": 1.732885761268427e-07, "token_acc": 0.7782109441451659, "epoch": 1.9411764705882353, "step": 776}, {"loss": 0.7795302271842957, "grad_norm": 3.4947397708892822, "learning_rate": 1.5916373335503054e-07, "token_acc": 0.7635372501514234, "epoch": 1.943679599499374, "step": 777}, {"loss": 0.6606072783470154, "grad_norm": 2.087082862854004, "learning_rate": 1.4563744706429515e-07, "token_acc": 0.801208930486497, "epoch": 1.946182728410513, "step": 778}, {"loss": 0.7052230834960938, "grad_norm": 1.6553760766983032, "learning_rate": 1.327100431795125e-07, "token_acc": 0.7852637614678899, "epoch": 1.9486858573216521, "step": 779}, {"loss": 0.8552008867263794, "grad_norm": 1.1143925189971924, "learning_rate": 1.2038183319507955e-07, "token_acc": 0.7460056792911149, "epoch": 1.9511889862327911, "step": 780}, {"loss": 0.787244975566864, "grad_norm": 1.6910258531570435, "learning_rate": 1.0865311416741742e-07, "token_acc": 0.7597416764847057, "epoch": 1.95369211514393, "step": 781}, {"loss": 0.7427728176116943, "grad_norm": 0.9978480935096741, "learning_rate": 9.752416870782155e-08, "token_acc": 0.7691592363656256, "epoch": 1.9561952440550687, "step": 782}, {"loss": 0.6246906518936157, "grad_norm": 3.087968587875366, "learning_rate": 8.699526497563393e-08, "token_acc": 0.8059849823321554, "epoch": 1.9586983729662077, "step": 783}, {"loss": 0.7229409217834473, "grad_norm": 1.87112557888031, "learning_rate": 7.706665667180091e-08, "token_acc": 0.7798822819197102, "epoch": 1.9612015018773468, "step": 784}, {"loss": 0.7285189032554626, "grad_norm": 4.381481170654297, "learning_rate": 6.773858303274483e-08, "token_acc": 0.7791870174885773, "epoch": 1.9637046307884856, "step": 785}, {"loss": 0.8223809599876404, "grad_norm": 1.4539693593978882, "learning_rate": 5.90112688246075e-08, "token_acc": 0.7561250563655494, "epoch": 1.9662077596996246, "step": 786}, {"loss": 0.6294353008270264, "grad_norm": 1.4071216583251953, "learning_rate": 5.088492433783509e-08, "token_acc": 0.8072788987365642, "epoch": 1.9687108886107634, "step": 787}, {"loss": 0.772925853729248, "grad_norm": 13.996487617492676, "learning_rate": 4.335974538210441e-08, "token_acc": 0.7683742932964117, "epoch": 1.9712140175219024, "step": 788}, {"loss": 0.7730788588523865, "grad_norm": 1.589355707168579, "learning_rate": 3.6435913281607225e-08, "token_acc": 0.7694374776065926, "epoch": 1.9737171464330414, "step": 789}, {"loss": 0.7273301482200623, "grad_norm": 1.9809443950653076, "learning_rate": 3.011359487068987e-08, "token_acc": 0.7792143824652137, "epoch": 1.9762202753441802, "step": 790}, {"loss": 0.6879251003265381, "grad_norm": 1.8846714496612549, "learning_rate": 2.439294248982038e-08, "token_acc": 0.7894736842105263, "epoch": 1.978723404255319, "step": 791}, {"loss": 0.7810167670249939, "grad_norm": 1.4308507442474365, "learning_rate": 1.9274093981927478e-08, "token_acc": 0.7666831928606842, "epoch": 1.981226533166458, "step": 792}, {"loss": 0.8870067000389099, "grad_norm": 0.7908570170402527, "learning_rate": 1.4757172689067179e-08, "token_acc": 0.7335510965935604, "epoch": 1.983729662077597, "step": 793}, {"loss": 0.869205117225647, "grad_norm": 1.3998844623565674, "learning_rate": 1.0842287449469579e-08, "token_acc": 0.7423013905810192, "epoch": 1.986232790988736, "step": 794}, {"loss": 0.6787707805633545, "grad_norm": 1.119472861289978, "learning_rate": 7.529532594893751e-09, "token_acc": 0.7989222231159012, "epoch": 1.9887359198998749, "step": 795}, {"loss": 0.886414647102356, "grad_norm": 2.85542631149292, "learning_rate": 4.818987948379539e-09, "token_acc": 0.7438413023556681, "epoch": 1.9912390488110137, "step": 796}, {"loss": 0.769140899181366, "grad_norm": 0.8510656952857971, "learning_rate": 2.7107188222991188e-09, "token_acc": 0.7727764553127029, "epoch": 1.9937421777221527, "step": 797}, {"loss": 0.7304086089134216, "grad_norm": 1.367498517036438, "learning_rate": 1.2047760167999134e-09, "token_acc": 0.7812954876273653, "epoch": 1.9962453066332917, "step": 798}, {"loss": 0.755138635635376, "grad_norm": 1.9030873775482178, "learning_rate": 3.01195818577793e-10, "token_acc": 0.7752727750755882, "epoch": 1.9987484355444305, "step": 799}, {"loss": 0.8368865251541138, "grad_norm": 1.4623066186904907, "learning_rate": 0.0, "token_acc": 0.759007551240561, "epoch": 2.0, "step": 800}, {"eval_loss": 0.5354316234588623, "eval_runtime": 2.8444, "eval_samples_per_second": 4.219, "eval_steps_per_second": 0.703, "eval_token_acc": 0.7590822179732314, "epoch": 2.0, "step": 800}, {"train_runtime": 9569.0522, "train_samples_per_second": 2.673, "train_steps_per_second": 0.084, "total_flos": 3.9041551041015316e+18, "train_loss": 0.8799310095608235, "epoch": 2.0, "step": 800}], "memory": 72.421875} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/val_dataset.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/val_dataset.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..17357369272d0666030b402733ca4a9ec1cbbf29 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_4-2048-sft-5e-5lr-freeze_false/v0-20260722-042533/val_dataset.jsonl @@ -0,0 +1,12 @@ +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding When Cork Last Won the Sam Maguire**\n\nRight, the user needs to know the last time Cork lifted the Sam Maguire Cup. My immediate understanding is that the Sam Maguire is the prize for winning the All-Ireland Senior Football Championship. So, to get to the bottom of this, I need to pinpoint Cork's most recent victory in that particular competition.\n\nMy internal strategy is to leverage my search capabilities. I'll be looking for keywords that directly link Cork to this championship. Obvious contenders for my search query are \"Sam Maguire Cup\" itself, \"Cork GAA\" to focus on the county's involvement, or the full competition name, \"All-Ireland Senior Football Championship.\"\n\nConsidering the directness of the user's question, I feel that searching for \"Sam Maguire Cup\" is the most efficient starting point. It's the name of the trophy they're interested in, and it will likely lead me to lists of winners or historical records of the championship.\n\nTherefore, the next logical step in my process is to input \"Sam Maguire Cup\" into the search interface. This action, as I've noted, is represented by the timestamp [329] in my internal log.\n\n\n\n```type [329] [Sam Maguire Cup] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nOkay, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" This immediately triggers my understanding of the context – the Sam Maguire Cup signifies the championship title for the All-Ireland Senior Football Championship. My internal knowledge base confirms this association.\n\nMy next step is to identify the most efficient way to retrieve this specific historical data. My mind immediately goes to reliable sources for sports history. The prompt even subtly guides me by mentioning a specific Wikipedia page: 'Sam Maguire Cup' (id 1125). This is a prime candidate because such pages typically contain comprehensive lists of winners, usually organized chronologically or by county.\n\nSo, my plan is to access that Wikipedia page. If it's not immediately obvious, I'd anticipate navigating to a section detailing the history of winners or a table listing them. Alternatively, if direct access to that specific page wasn't available, I'd perform a targeted search query like \"Cork Sam Maguire wins\" or \"All-Ireland Senior Football Championship winners Cork\" to pinpoint the exact information. The provided link, however, makes it the most direct route, so clicking on 'Sam Maguire Cup' (id 1125) is my immediate and logical action.\n\n\n\n```click [1125] [Sam Maguire Cup]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" My immediate task is to locate this information efficiently. My current vantage point is the Wikipedia page dedicated to the Sam Maguire Cup itself. This is a logical starting point, as it's highly likely to contain a comprehensive history of the competition and its champions.\n\nMy strategy now is to navigate this page to extract the relevant data. I need to find a section listing the winners, or failing that, a way to search the content for mentions of \"Cork.\" My initial inclination is to look for a dedicated \"Roll of Honour\" or \"List of Winners\" section. If that's not immediately apparent, I'll resort to a more targeted search.\n\nI'm aware that direct keyboard shortcuts like \"Ctrl+F\" aren't directly accessible to me in this interaction model. However, the underlying capability to scan and locate information within the provided text is present. So, while I can't *literally* press Ctrl+F, I can effectively simulate that process by instructing myself to scroll down and meticulously examine the content for the keywords I'm looking for. My immediate action is therefore to begin scrolling through the page, actively scanning for the \"Cork\" team and the associated year of their victory. This is a process of systematic information retrieval, aiming to pinpoint the most recent instance of their championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core request here is to determine the last time Cork lifted the Sam Maguire Cup. My immediate thought is to access that information efficiently. I'm currently situated on the Wikipedia page dedicated to the Sam Maguire Cup itself, which is a logical starting point given its comprehensive nature regarding the trophy's history. My next step, therefore, is to navigate this page to locate the specific data I need. I anticipate that a list of past winners, or perhaps a dedicated table detailing championship outcomes, will be present. To that end, I'll initiate a scroll down the page, actively scanning for such an organized compilation of results.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Last Sam Maguire Triumph**\n\nMy objective is clear: I need to determine the last time Cork lifted the Sam Maguire Cup. To achieve this, I've navigated to the Wikipedia page dedicated to the Sam Maguire Cup itself. My immediate thought is to leverage the information available on this page. Since I'm looking for a specific team, Cork, my next logical step is to search for mentions of them within the document. I'm considering using a browser's find function (like Ctrl+F), though I recognize I can't execute that directly in this context. Therefore, my strategy shifts to a more manual approach: scrolling through the page, specifically looking for a list of past winners or any sections detailing Cork's history with the trophy.\n\nI'm currently scrolling, and I've just passed a section that discusses the \"New trophy\" and mentions Meath. This isn't directly helping me locate Cork's win, so I understand I need to continue my descent through the page content. My focus remains on identifying the relevant historical data pertaining to Cork's victories. I'll keep scrolling, diligently scanning for any reference that pinpoints their most recent championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Sam Maguire Glory**\n\nRight, so the user's popped the question: when did Cork last lift the Sam Maguire Cup? My current focus is the 'Sam Maguire Cup' Wikipedia page, and I've already navigated down to the 'Winners' section. I'm seeing the \"Old Trophy\" winners listed, with Kerry and Dublin prominently featured, but I need to pinpoint Cork. I'll have to scroll further down to catch the rest of the winners, including Cork, and any mentions of the \"New Trophy\" era.\n\nNow, hold on a second. I've just spotted something interesting earlier in the text, under the \"New trophy\" heading. It explicitly states: \"Cork won the new trophy on consecutive occasions in the late-1980s and early-1990s (1989, 1990), while Kerry did likewise during the mid-2000s (2006, 2007).\" This gives me a definite recent winning streak for Cork. However, the key question remains: did they win it *after* 1990? My next step is to meticulously scroll down and examine the complete list of winners for Cork, or specifically the \"New Trophy\" winners section, to confirm their absolute latest Sam Maguire triumph.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest to Determine Cork's Last Sam Maguire Triumph**\n\nMy immediate objective is to pinpoint the last time Cork clinched the Sam Maguire Cup. I've landed on the Wikipedia page dedicated to the Sam Maguire Cup itself. My initial scan reveals a historical breakdown of winners, bifurcated into those who won the \"Old Trophy\" and those who secured the \"New Trophy.\"\n\nMy attention is drawn to the \"Old Trophy\" section, where I observe an entry for 'Cork' followed by the years '– 1945, 1973'. This gives me a potential anchor, but I need to ascertain if this refers to the *last* victory, or merely *some* victories under the old system. To confirm the modern era's victors, I must now investigate the \"New Trophy\" list.\n\nI begin to scan the \"New Trophy\" winners. I see prominent teams like Dublin, Kerry, Tyrone, and Meath, with their respective winning years. However, Cork isn't immediately apparent in this initial segment. My thought process then shifts to a systematic approach: I need to continue scrolling down the page to examine the complete list of \"New Trophy\" winners. The instinct is to meticulously review every entry, ensuring I don't overlook any mention of Cork under the current iteration of the cup. I understand the need for thoroughness in this specific query; a simple glance won't suffice if the information is further down the list. So, my focus narrows to scrolling and reading, with the singular goal of finding that definitive answer for Cork's most recent Sam Maguire victory.\n\n\n\n\nI need to check the rest of the \"New Trophy\" winners to see if Cork won it more recently than 1973. I will scroll down to view the rest of the list.\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Locating Cork's Last Sam Maguire Cup Victory**\n\nAlright, the user needs to know when Cork last secured the Sam Maguire Cup. My primary source for this kind of GAA historical data is, predictably, the Wikipedia page dedicated to the Sam Maguire Cup itself. I’ve navigated to that page.\n\nNow, to efficiently extract the information, I'm examining the accessibility tree. This structure provides a programmatic representation of the page's elements, and I can see it clearly lists the counties and the corresponding years they've achieved victory. I've located the entry for 'Cork' – it's identified by the link with the identifier `[1626]`. Immediately following that, I see the `StaticText` element `[2762]`, which displays the years of Cork's triumphs: ' – 1989, 1990, 2010'.\n\nFrom this, it's evident that Cork has won the Sam Maguire Cup in 1989, 1990, and 2010. The most recent of these victories, and therefore the answer to the user's query, is 2010. I have all the necessary information to provide a definitive response.\n\nCork last won the Sam Maguire Cup in 2010.\n\n\n\n```stop [2010]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_0d3df91e50b5ad89ad135a18f41db7cd.png"}, {"bytes": null, "path": "images/obs_c02f2c042d5e36ccb1920249fccae855.png"}, {"bytes": null, "path": "images/obs_55bc9f58c00b85204ca49180d2615300.png"}, {"bytes": null, "path": "images/obs_66bd3c2599c1a7096fb11f0d061f642d.png"}, {"bytes": null, "path": "images/obs_bfe96132b69ae8aeefef8a8d5dc2eb9f.png"}, {"bytes": null, "path": "images/obs_fb605b8536dfb3105e119c560d6b73a2.png"}, {"bytes": null, "path": "images/obs_e5c4a973019ef77af4eeea6c109bad93.png"}, {"bytes": null, "path": "images/obs_ca9b4c6329f78ee5541d92dc37d24f26.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need answer when Yankees last won World Series. Current page is not found but has search box. I'll search for New York Yankees and find World Series championships info.\n```type [53] [New York Yankees] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results for New York Yankees are shown. To answer when they last won the World Series, the main New York Yankees article is likely the best source, so I should search within Wikipedia search box for a more direct page.No answer yet.\n```type [122] [New York Yankees World Series] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nHISTORY_info: No answer yet.\n", "loss": null}, {"role": "assistant", "content": "Search results show a relevant page snippet for \"List of New York Yankees seasons,\" which likely states total championships and may include the last title year. Opening it is the fastest path.Relevant result: List of New York Yankees seasons\n```click [1440] [List of New York Yankees seasons]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nclick [1440] [List of New York Yankees seasons]\nHISTORY_info: No answer yet.\nRelevant result: List of New York Yankees seasons\n", "loss": null}, {"role": "assistant", "content": "The page states the Yankees \"won another World Series in 2009,\" indicating their most recent World Series win was in 2009.\n```stop [2009]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_ee4581e0f64bc0dbb556a6e5b8e57024.png"}, {"bytes": null, "path": "images/obs_55b7c6544175a64b368f557136c1d997.png"}, {"bytes": null, "path": "images/obs_dc76ba61781e5961da2c9f59b54e4820.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [2017 World Strongest Man winner] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results do not directly show 2017, so refining the query is the fastest path.\n```type [768] [2017 World's Strongest Man] [1]```", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\ntype [768] [2017 World's Strongest Man] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show relevant athlete pages. The winner of the 2017 World's Strongest Man competition is Eddie Hall.Eddie Hall\n```stop [Eddie Hall]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_bdfb728489882a2e9d76a69ffc390579.png"}, {"bytes": null, "path": "images/obs_ed80b5566b62a125bc7bc4b1cb48288b.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We are on a not found page in a local Wikipedia mirror. Need identify brewer for whom Alfred W. Blomfield was in-house architect 1919-1940, then find beer brand produced by that brewer. Best path is search Alfred W. Blomfield. \n```type [53] [Alfred W. Blomfield] [1]```", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \nHISTORY_ACTION: type [53] [Alfred W. Blomfield] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the key fact: Alfred W. Blomfield was in-house architect for Watney Combe & Reid from 1919 to 1940. The question asks what beer brand this brewer produced. Watney Combe & Reid is known for Watney's Red Barrel.Watney's Red Barrel\n```stop [Watney's Red Barrel]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_78dcda339ee05f137a2d46fb19bde5c2.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer who sings the song. Current page is not found, but there is a search box. Search the song title. \n```type [53] [I Can Love You Like That] [1]```", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \nHISTORY_ACTION: type [53] [I Can Love You Like That] [1]\n", "loss": null}, {"role": "assistant", "content": "Search result snippet says \"I Can Love You Like That\" was recorded by American country music singer John Michael Montgomery.\n```stop [John Michael Montgomery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_c60be5a2612787f679a7d6c447a1d7f3.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer a factual query. Current page has search box. Search for the query terms on Wikipedia mirror.\n```type [53] [dodgers second baseman four silver slugger awards] [1]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the relevant page \"List of Silver Slugger Award winners at second base.\" Opening it should reveal which Dodgers second baseman has four awards.Relevant source identified: List of Silver Slugger Award winners at second base.\n```click [140] [List of Silver Slugger Award winners at second base]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\nclick [140] [List of Silver Slugger Award winners at second base]\nHISTORY_info: Relevant source identified: List of Silver Slugger Award winners at second base.\n", "loss": null}, {"role": "assistant", "content": "Need extract Dodgers second baseman with four Silver Slugger awards from page. Likely table visible in accessibility tree not provided; answer known as Jeff Kent? He won 4 total, played Dodgers. Need ensure \"with four silver slugger awards\" singular player. Dodgers second baseman with four Silver Slugger awards: Jeff Kent.\n```stop [Jeff Kent]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_69f440f34d34af671d47a20090f8649a.png"}, {"bytes": null, "path": "images/obs_26a2bd9817130cce77cb16da7abff361.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [Josh Peck Ice Age 3 character] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show a Josh Peck page, which likely contains his film roles including Ice Age 3. Opening it should reveal the character name.\n```click [140] [Josh Peck]```", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\nclick [140] [Josh Peck]\n", "loss": null}, {"role": "assistant", "content": "Josh Peck plays Eddie in Ice Age 3.The page explicitly states Peck provided the voice of Eddie in the Ice Age franchise, which includes Ice Age 3.\n```stop [Eddie]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_fad600165d51329f9b5efe5531f69a69.png"}, {"bytes": null, "path": "images/obs_33864d91a7ef8afb310262d979db2209.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevrolet Malibu**\n\nAh, so the user is curious about the Chevrolet Malibu – specifically, what *kind* of car it is. This is a straightforward information retrieval task. My immediate thought is to consult a reliable, comprehensive source. Wikipedia, given its breadth of automotive information, is the ideal place to start.\n\nTo that end, I'll initiate a search on Wikipedia. I'll utilize the designated search textbox, which is labeled `[329]` in this context. My query will be precise: I'll type \"Chevrolet Malibu\" into that textbox. Once the text is entered, I'll proceed to execute the search, typically by pressing the enter key. This action should then lead me to the Wikipedia page dedicated to the Chevrolet Malibu, from which I can extract the necessary details to answer the user's question about its classification and characteristics.\n\n\n\n\nI need to search for \"Chevrolet Malibu\" to find out what kind of car it is. The search box has ID 329.\n\n```type [329] [Chevrolet Malibu] [1]```", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \nHISTORY_ACTION: type [329] [Chevrolet Malibu] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevy Malibu's Vehicle Class**\n\nRight, so the user's core question is pretty straightforward: \"What kind of car is a Chevy Malibu?\" My initial impulse is to dive straight into the search results and find the definitive answer.\n\nScanning the first result, I see \"Chevrolet Malibu.\" This is a good start, and the accompanying snippet immediately provides what I need: \"The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nMy immediate thought is, \"Perfect, there it is. It's a mid-size car. I can just tell them that and be done.\" I even mentally prepare to just stop right there.\n\nHowever, as someone who values precision and thoroughness, especially when dealing with technical classifications, I decide it's prudent to just quickly double-check that snippet. It's a small thing, but reinforcing the certainty is important. So, I re-read it carefully: \"Chevrolet Malibu The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nYes, absolutely confirmed. The information is clear and unambiguous. The Malibu is, without question, a mid-size car, with a history of production spanning a couple of significant periods.\n\nAt this point, the conclusion is firm and well-supported by the evidence. I have precisely what's needed to answer the user's query. I can now confidently stop the process, knowing I've accurately identified the vehicle's classification.\n\n**Conclusion:** The Chevrolet Malibu is a mid-size car.\n\n\n\n```stop [mid-size car]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_821ba7176362b505d344917dba1f1b5a.png"}, {"bytes": null, "path": "images/obs_300b080495ff41dcc58f6d656b9f2593.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search likely for film A Christmas Story. Use search box.\n```type [53] [A Christmas Story family last name] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show the relevant page is likely the film or musical page. I should open the main \"A Christmas Story\" article directly by URL to find the family's surname.\n```goto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]```", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\ngoto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]\n", "loss": null}, {"role": "assistant", "content": "The family in A Christmas Story has the last name Parker.The plot text says “adult Ralphie Parker,” indicating the family’s last name.\n```stop [Parker]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_f5796d0cd2c3c76bf1721d4cb71697dd.png"}, {"bytes": null, "path": "images/obs_7546c67a613360c3fbe8321491e9ce2a.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search capital city philippines. Use search box.\n```type [53] [capital city of the Philippines] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \nHISTORY_ACTION: type [53] [capital city of the Philippines] [1]\n", "loss": null}, {"role": "assistant", "content": "Manila is the capital city of the Philippines.\n```stop [Manila]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a092b654fbe598fffad3ab58a28694a5.png"}, {"bytes": null, "path": "images/obs_4ce44a5ff98fb7b5672fcdc807fe12b9.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search for Vidushi Shashikala Dani. Use search box.\n```type [53] [Vidushi Shashikala Dani] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \nHISTORY_ACTION: type [53] [Vidushi Shashikala Dani] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show the relevant page \"Shashikala Dani.\" The snippet mentions she is a Jaltarang musician. To answer the question about the category of instrument she is the only All India Radio exponent of, I can infer from the linked Jal tarang page snippet that Jal tarang is classified as a percussion instrument.Percussion instrument\n```stop [Percussion instrument]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_adee30babf5ae245035574e710682042.png"}, {"bytes": null, "path": "images/obs_e8911999dba23dea1da60ec654d8166a.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need find which state-run lottery began in 1986 and was featured in TV show Flamingo Fortune. Likely search Wikipedia offline. \n```type [53] [Flamingo Fortune lottery 1986 state-run] [1]```", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \nHISTORY_ACTION: type [53] [Flamingo Fortune lottery 1986 state-run] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show a relevant page: \"Florida Lottery.\" The objective asks which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune. That strongly suggests the answer is the Florida Lottery. Florida Lottery\n```stop [Florida Lottery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_c84d4d6b46a5ccf0ddd19b5f6cf90280.png"}, {"bytes": null, "path": "images/obs_e9d9d94c8e35d135b65c335ad1a569a4.png"}]}