diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/TRAINING_COMPLETED b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/TRAINING_COMPLETED new file mode 100644 index 0000000000000000000000000000000000000000..e69de29bb2d1d6434b8b29ae775ad8c2e48c5391 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/args.json new file mode 100644 index 0000000000000000000000000000000000000000..85d6df2103014714697ed4adb0484d581cd7c722 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..f65fb5d2db9b498bbc045214fe000a3224312094 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(q_proj|up_proj|k_proj|gate_proj|o_proj|down_proj|v_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(qkv|up_proj|gate_proj|mlp.0|down_proj|mlp.2|attn.proj))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..85c8d4517a3e05b9c0b615c42d84d05112b672f0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a5e926474ab738bde90b669ae6783b177de1a6a9a237fe2d0183e87044aba516 +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/args.json new file mode 100644 index 0000000000000000000000000000000000000000..85d6df2103014714697ed4adb0484d581cd7c722 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a2e5c6e5e1ef7adc1b3ae852a9dde440ad26204b --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5a4ba8ab05029b16382db35d427b2f2af3bc6a38326670b2c6951d084d47b8a5 +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..c8d6926fdb4ec04f84d47cede30fca32148f2e49 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e5517922de75cf56e7803577b31ef606b557d0970f1467c1c9a3ffbc68a8b9cd +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..cf63be33383f5237b52b9d01a7cce7558cf815d5 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:53fe7283cf7e5f8dffaf3ba58dbd5dcbd095bed3642fb48073dd52a562ebde85 +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..55053e827bf98e9b618ec6a730c32b95d4464392 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f8573d8f81da32095e3cb8a568a9c4bb3161e77d61635f3aa159e2574180f48c +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..4061f87883f34d2eb01bcafdc954c894c940eebf --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ed7a8e802ce4e4efd859bfc8e3c9ba1e7b6557ef4615c0bbb080047bd54fdf98 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..bd37767fd785d01f83f9979575be104abe57b412 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b2eafbed0766eac5d9769e62db789bbd0dad16d9350cf43d6ffdb09cdca8bd18 +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..051ef913a223f4f1281b847529e246fc9dba2eb5 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aca1444bb923f4f358ba01741cb968c985c1cd1a135a31bcfa2a66271f0932f2 +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..942b4c002929386e691815497f1a748f967b6d53 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:94b10daaa2176c8aaac986f4d764d5d4c00fbe2a5a721d64e367d4682b5b8a31 +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..75a88ee0e4cbf9acb492f4fb6c036d475e41f4af --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/global_step780/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:76a6d5171bf5497c243c29926badb26de09236271fc96bc0b3cbd96ccb0eb154 +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/latest new file mode 100644 index 0000000000000000000000000000000000000000..1ec3dad1fcdbec2feb24a2594f56f8ac93ca6ae6 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/latest @@ -0,0 +1 @@ +global_step780 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..ef81e4d08447ec67a2dcc2f63d7383d561a62c37 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f32b6ef8c8be26987f349aa904cb3c6aa7c3628cd0b78a23fb6e4661beaea49e +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..a9f9540e75dbdd7d826a2ff847279ce05ac554ee --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c6d59a232addd1dac5661e8cf1cb345a52e850538588c309bf1b9997bab39b7a +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..b089ae3dfc544a779f6f72281d243f1d4f2aa662 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1fad76f488409ba97cc13ee7d318b0d2f65d789af596b0e77aa3d6bdc39930c4 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..fb9de799b0f53682e5f8b88ea0eac1264453ce9b --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b3fc9dfa73731b38a3dd22cac29e0f600e0e14e7aa64fa2cadeb84d59ef80138 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..faa556d78bf5203c1384c20152c8c1172e9f9974 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5a92ddbd5001a2d4edf4dffd7d94c5d53db9c4c835561d3561a31ccf28980b86 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..e9a9a42aac0c01cfdbad610b9d46ae9f3161de55 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc77c59b5207e2da1447beeb213fe54141b7d1dd8a8c4c63145fe5ef45d90108 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..803a7f510cbee61b4df9b8eaacebbc338e246a2d --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2731611c6a9e1f25cac25f7c89d31034d77ed19eb9cd7061fbd84652a2d87e0a +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..15afd05bd8740f447745c49a32327de0f5ffb4c9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ae1f271df0b474a7a8c6aea54f9b8bdff4baefc4648b92b5d024f40f98dff0a0 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..372669d5d6117ac9bc43efff9bc091a403d26fbc --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fbb84c2c585c8df368024c404ab725c0b20622db0462431267332163768c002e +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..6f4d32766aaef284a6fee18b342848d557de9549 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/trainer_state.json @@ -0,0 +1,6274 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9511889862327911, + "eval_steps": 2000, + "global_step": 780, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 7.8950982093811035, + "learning_rate": 3.125e-07, + "loss": 1.4557902812957764, + "step": 1, + "token_acc": 0.6572501632919661 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 5.087953090667725, + "learning_rate": 6.25e-07, + "loss": 1.501842737197876, + "step": 2, + "token_acc": 0.6372176822598289 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 10.051658630371094, + "learning_rate": 9.375e-07, + "loss": 1.4857144355773926, + "step": 3, + "token_acc": 0.6451390326364452 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 2.0114636421203613, + "learning_rate": 1.25e-06, + "loss": 1.4438570737838745, + "step": 4, + "token_acc": 0.6557932163214628 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 1.340759038925171, + "learning_rate": 1.5625e-06, + "loss": 1.478323221206665, + "step": 5, + "token_acc": 0.6383258353131477 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 1.9858087301254272, + "learning_rate": 1.875e-06, + "loss": 1.467094898223877, + "step": 6, + "token_acc": 0.6425992779783394 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 4.05888032913208, + "learning_rate": 2.1875e-06, + "loss": 1.4478201866149902, + "step": 7, + "token_acc": 0.6590269733576039 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 1.7842193841934204, + "learning_rate": 2.5e-06, + "loss": 1.4324607849121094, + "step": 8, + "token_acc": 0.6515308296305313 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 1.832907795906067, + "learning_rate": 2.8125e-06, + "loss": 1.5404188632965088, + "step": 9, + "token_acc": 0.6198423322921315 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.766298770904541, + "learning_rate": 3.125e-06, + "loss": 1.5408222675323486, + "step": 10, + "token_acc": 0.6189591644081732 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 1.6790711879730225, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5104762315750122, + "step": 11, + "token_acc": 0.625929823288218 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 4.442141056060791, + "learning_rate": 3.75e-06, + "loss": 1.4653594493865967, + "step": 12, + "token_acc": 0.6531566141631451 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 1.7403733730316162, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4969990253448486, + "step": 13, + "token_acc": 0.6385409694999522 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 2.5656747817993164, + "learning_rate": 4.375e-06, + "loss": 1.4600821733474731, + "step": 14, + "token_acc": 0.6697823145984504 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 3.5080008506774902, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.4708112478256226, + "step": 15, + "token_acc": 0.672 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 3.7129623889923096, + "learning_rate": 5e-06, + "loss": 1.429203987121582, + "step": 16, + "token_acc": 0.6813838550247117 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 2.3268940448760986, + "learning_rate": 5.3125e-06, + "loss": 1.512415885925293, + "step": 17, + "token_acc": 0.6315401203041653 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 2.3350868225097656, + "learning_rate": 5.625e-06, + "loss": 1.451557993888855, + "step": 18, + "token_acc": 0.6523656776263032 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 2.7687199115753174, + "learning_rate": 5.9375e-06, + "loss": 1.4157341718673706, + "step": 19, + "token_acc": 0.6632555400132518 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 5.971182346343994, + "learning_rate": 6.25e-06, + "loss": 1.4978222846984863, + "step": 20, + "token_acc": 0.6449075630252101 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 13.349177360534668, + "learning_rate": 6.5625e-06, + "loss": 1.5118396282196045, + "step": 21, + "token_acc": 0.6337731455815501 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 2.401188611984253, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4671411514282227, + "step": 22, + "token_acc": 0.6508435329143235 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 3.039811849594116, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4463262557983398, + "step": 23, + "token_acc": 0.6521815519765739 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.9413557052612305, + "learning_rate": 7.5e-06, + "loss": 1.4922974109649658, + "step": 24, + "token_acc": 0.6576568432471525 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.3279271125793457, + "learning_rate": 7.8125e-06, + "loss": 1.4638800621032715, + "step": 25, + "token_acc": 0.6408039991668403 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 2.4672555923461914, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4635385274887085, + "step": 26, + "token_acc": 0.642543217111046 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 4.2855987548828125, + "learning_rate": 8.437500000000002e-06, + "loss": 1.4971613883972168, + "step": 27, + "token_acc": 0.643646613752689 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 4.303065299987793, + "learning_rate": 8.75e-06, + "loss": 1.4926515817642212, + "step": 28, + "token_acc": 0.6576081719186663 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 4.372646808624268, + "learning_rate": 9.0625e-06, + "loss": 1.4479061365127563, + "step": 29, + "token_acc": 0.6445522674865488 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 2.5289852619171143, + "learning_rate": 9.375000000000001e-06, + "loss": 1.410093069076538, + "step": 30, + "token_acc": 0.6521535141221733 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 1.4264651536941528, + "learning_rate": 9.6875e-06, + "loss": 1.425238847732544, + "step": 31, + "token_acc": 0.6520223888478192 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 2.838380813598633, + "learning_rate": 1e-05, + "loss": 1.4446736574172974, + "step": 32, + "token_acc": 0.6348325214304595 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 2.671543836593628, + "learning_rate": 1.03125e-05, + "loss": 1.4461638927459717, + "step": 33, + "token_acc": 0.6419955498301909 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 1.9914096593856812, + "learning_rate": 1.0625e-05, + "loss": 1.355449914932251, + "step": 34, + "token_acc": 0.670728126834997 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 5.0682525634765625, + "learning_rate": 1.09375e-05, + "loss": 1.3718912601470947, + "step": 35, + "token_acc": 0.6667121046892039 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 7.020368576049805, + "learning_rate": 1.125e-05, + "loss": 1.4107385873794556, + "step": 36, + "token_acc": 0.6550262102991058 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 1.664873719215393, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.4824004173278809, + "step": 37, + "token_acc": 0.6308479165622023 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 2.0821597576141357, + "learning_rate": 1.1875e-05, + "loss": 1.3098841905593872, + "step": 38, + "token_acc": 0.6657222884002447 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 1.4780006408691406, + "learning_rate": 1.21875e-05, + "loss": 1.41942298412323, + "step": 39, + "token_acc": 0.6341868972397738 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 8.251653671264648, + "learning_rate": 1.25e-05, + "loss": 1.334580898284912, + "step": 40, + "token_acc": 0.6723917672107877 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 2.3996059894561768, + "learning_rate": 1.28125e-05, + "loss": 1.3334863185882568, + "step": 41, + "token_acc": 0.6682704982863169 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 8.757278442382812, + "learning_rate": 1.3125e-05, + "loss": 1.3246387243270874, + "step": 42, + "token_acc": 0.6669556991959641 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 1.0424623489379883, + "learning_rate": 1.34375e-05, + "loss": 1.344756841659546, + "step": 43, + "token_acc": 0.6592281155670547 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 3.8542351722717285, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.3171751499176025, + "step": 44, + "token_acc": 0.6736935627170665 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 25.883697509765625, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.3416380882263184, + "step": 45, + "token_acc": 0.6597396665905458 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 2.754948139190674, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.2994325160980225, + "step": 46, + "token_acc": 0.6748487114979261 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 17.700273513793945, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.2871052026748657, + "step": 47, + "token_acc": 0.6900871459694989 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 2.1236982345581055, + "learning_rate": 1.5e-05, + "loss": 1.3259053230285645, + "step": 48, + "token_acc": 0.6648348053647367 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.8360397815704346, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3459126949310303, + "step": 49, + "token_acc": 0.6621909900865856 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 1.8516582250595093, + "learning_rate": 1.5625e-05, + "loss": 1.1977975368499756, + "step": 50, + "token_acc": 0.6965541315513888 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 2.6509554386138916, + "learning_rate": 1.59375e-05, + "loss": 1.337214708328247, + "step": 51, + "token_acc": 0.6660699367466285 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 1.3980388641357422, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3174633979797363, + "step": 52, + "token_acc": 0.6557162021165599 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 2.930096387863159, + "learning_rate": 1.65625e-05, + "loss": 1.3363032341003418, + "step": 53, + "token_acc": 0.6643487563519658 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 1.6149736642837524, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2738587856292725, + "step": 54, + "token_acc": 0.6713186201780416 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 1.9161509275436401, + "learning_rate": 1.71875e-05, + "loss": 1.3153185844421387, + "step": 55, + "token_acc": 0.6600835945663532 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 1.3378994464874268, + "learning_rate": 1.75e-05, + "loss": 1.328718662261963, + "step": 56, + "token_acc": 0.6626896519329231 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 2.1358327865600586, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2075698375701904, + "step": 57, + "token_acc": 0.6894359429289569 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 3.4085142612457275, + "learning_rate": 1.8125e-05, + "loss": 1.211951494216919, + "step": 58, + "token_acc": 0.6959001782531195 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 2.7778501510620117, + "learning_rate": 1.84375e-05, + "loss": 1.1932858228683472, + "step": 59, + "token_acc": 0.6946308724832215 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 2.009060859680176, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2468700408935547, + "step": 60, + "token_acc": 0.6771944009298095 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 5.27526330947876, + "learning_rate": 1.90625e-05, + "loss": 1.260186791419983, + "step": 61, + "token_acc": 0.6741093689401075 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 2.183293342590332, + "learning_rate": 1.9375e-05, + "loss": 1.2611782550811768, + "step": 62, + "token_acc": 0.670921220067096 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 1.8381351232528687, + "learning_rate": 1.96875e-05, + "loss": 1.212986707687378, + "step": 63, + "token_acc": 0.691640625 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 2.4578311443328857, + "learning_rate": 2e-05, + "loss": 1.240574598312378, + "step": 64, + "token_acc": 0.6715244487056568 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 3.24009108543396, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2548034191131592, + "step": 65, + "token_acc": 0.6654780476933363 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 4.743288993835449, + "learning_rate": 2.0625e-05, + "loss": 1.2446942329406738, + "step": 66, + "token_acc": 0.6764411159748959 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 2.8019979000091553, + "learning_rate": 2.09375e-05, + "loss": 1.18748140335083, + "step": 67, + "token_acc": 0.7129500268672757 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 2.299891471862793, + "learning_rate": 2.125e-05, + "loss": 1.2521979808807373, + "step": 68, + "token_acc": 0.675844505309692 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 12.295174598693848, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.203750491142273, + "step": 69, + "token_acc": 0.6892914653784219 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 1.9590011835098267, + "learning_rate": 2.1875e-05, + "loss": 1.1940397024154663, + "step": 70, + "token_acc": 0.6833531308331919 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 1.3522539138793945, + "learning_rate": 2.21875e-05, + "loss": 1.224703073501587, + "step": 71, + "token_acc": 0.6722795201010313 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 5.405593395233154, + "learning_rate": 2.25e-05, + "loss": 1.209501028060913, + "step": 72, + "token_acc": 0.6863064396743154 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 2.510359525680542, + "learning_rate": 2.28125e-05, + "loss": 1.0670784711837769, + "step": 73, + "token_acc": 0.7204571243313341 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 3.786830186843872, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.1720937490463257, + "step": 74, + "token_acc": 0.6966354109211252 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 7.54746675491333, + "learning_rate": 2.34375e-05, + "loss": 1.1647639274597168, + "step": 75, + "token_acc": 0.6920582186362917 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 3.6000797748565674, + "learning_rate": 2.375e-05, + "loss": 1.01552414894104, + "step": 76, + "token_acc": 0.7369100727870392 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 2.196979522705078, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1755733489990234, + "step": 77, + "token_acc": 0.689888875320552 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 2.5549845695495605, + "learning_rate": 2.4375e-05, + "loss": 1.196420431137085, + "step": 78, + "token_acc": 0.6777883196289268 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 2.397491455078125, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.2095775604248047, + "step": 79, + "token_acc": 0.6770092547491476 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 2.3734941482543945, + "learning_rate": 2.5e-05, + "loss": 1.215873122215271, + "step": 80, + "token_acc": 0.6735724510895499 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 6.307923316955566, + "learning_rate": 2.53125e-05, + "loss": 1.159612774848938, + "step": 81, + "token_acc": 0.6885863267670915 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 1.9825963973999023, + "learning_rate": 2.5625e-05, + "loss": 1.244891881942749, + "step": 82, + "token_acc": 0.6620401337792642 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 3.535176992416382, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.1396539211273193, + "step": 83, + "token_acc": 0.6885533874566776 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 1.6742156744003296, + "learning_rate": 2.625e-05, + "loss": 1.159801959991455, + "step": 84, + "token_acc": 0.6944472387083794 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 2.6573984622955322, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0350620746612549, + "step": 85, + "token_acc": 0.7238356649548433 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 8.295306205749512, + "learning_rate": 2.6875e-05, + "loss": 1.162409782409668, + "step": 86, + "token_acc": 0.6927952399430862 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.998918294906616, + "learning_rate": 2.71875e-05, + "loss": 1.0885825157165527, + "step": 87, + "token_acc": 0.7137596899224806 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 1.8655437231063843, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0828857421875, + "step": 88, + "token_acc": 0.7061748303433447 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 1.323335886001587, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1780362129211426, + "step": 89, + "token_acc": 0.6848311201719103 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 5.304930210113525, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.9686488509178162, + "step": 90, + "token_acc": 0.7363368421052632 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 9.773175239562988, + "learning_rate": 2.84375e-05, + "loss": 1.0577869415283203, + "step": 91, + "token_acc": 0.7114267269205939 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.9195711612701416, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.145928978919983, + "step": 92, + "token_acc": 0.6888570610140361 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 4.456406116485596, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0008058547973633, + "step": 93, + "token_acc": 0.7271467433146847 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 1.3492659330368042, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1630926132202148, + "step": 94, + "token_acc": 0.6865543948126801 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 33.28302001953125, + "learning_rate": 2.96875e-05, + "loss": 1.0794365406036377, + "step": 95, + "token_acc": 0.6955025569946949 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 4.188589572906494, + "learning_rate": 3e-05, + "loss": 0.981617271900177, + "step": 96, + "token_acc": 0.7421242124212422 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 4.019721031188965, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.1217559576034546, + "step": 97, + "token_acc": 0.6885376192158248 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 3.235391616821289, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1427521705627441, + "step": 98, + "token_acc": 0.6908890062917247 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 2.8775594234466553, + "learning_rate": 3.09375e-05, + "loss": 1.0406608581542969, + "step": 99, + "token_acc": 0.7161332040090527 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 3.2784032821655273, + "learning_rate": 3.125e-05, + "loss": 1.0470802783966064, + "step": 100, + "token_acc": 0.7107116506807968 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 10.006264686584473, + "learning_rate": 3.15625e-05, + "loss": 1.1033154726028442, + "step": 101, + "token_acc": 0.6993850520340587 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 3.128004789352417, + "learning_rate": 3.1875e-05, + "loss": 1.0931888818740845, + "step": 102, + "token_acc": 0.6994311184094775 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 1.6552213430404663, + "learning_rate": 3.21875e-05, + "loss": 1.0672286748886108, + "step": 103, + "token_acc": 0.7047883009372379 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 2.4581258296966553, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.0013254880905151, + "step": 104, + "token_acc": 0.7210549515133705 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 1.6132698059082031, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.057444453239441, + "step": 105, + "token_acc": 0.7100988496444881 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 1.5642213821411133, + "learning_rate": 3.3125e-05, + "loss": 1.123189926147461, + "step": 106, + "token_acc": 0.6890246836356637 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 2.402168035507202, + "learning_rate": 3.34375e-05, + "loss": 1.0398962497711182, + "step": 107, + "token_acc": 0.7146073548475131 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 6.666412830352783, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9815630316734314, + "step": 108, + "token_acc": 0.7229632010284429 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 2.724987030029297, + "learning_rate": 3.40625e-05, + "loss": 1.0755481719970703, + "step": 109, + "token_acc": 0.6945715806279936 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 2.264068841934204, + "learning_rate": 3.4375e-05, + "loss": 1.0846197605133057, + "step": 110, + "token_acc": 0.7066835081553078 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 2.5315089225769043, + "learning_rate": 3.46875e-05, + "loss": 0.964267373085022, + "step": 111, + "token_acc": 0.7342624854819977 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 15.30518627166748, + "learning_rate": 3.5e-05, + "loss": 0.9664145708084106, + "step": 112, + "token_acc": 0.7298946944798443 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 2.818232297897339, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0291664600372314, + "step": 113, + "token_acc": 0.7168817487490123 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 7.732123851776123, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.0101385116577148, + "step": 114, + "token_acc": 0.717198464186416 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 3.8363802433013916, + "learning_rate": 3.59375e-05, + "loss": 1.1273301839828491, + "step": 115, + "token_acc": 0.688773189101754 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 3.1989147663116455, + "learning_rate": 3.625e-05, + "loss": 1.044485092163086, + "step": 116, + "token_acc": 0.7092324805339266 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.878786087036133, + "learning_rate": 3.65625e-05, + "loss": 0.8934916257858276, + "step": 117, + "token_acc": 0.7590650284686844 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 2.4027316570281982, + "learning_rate": 3.6875e-05, + "loss": 1.0810887813568115, + "step": 118, + "token_acc": 0.700803104619199 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 2.034160852432251, + "learning_rate": 3.71875e-05, + "loss": 1.0755298137664795, + "step": 119, + "token_acc": 0.7013630188017707 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 4.220553874969482, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9945212602615356, + "step": 120, + "token_acc": 0.7199625446245684 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 2.564206600189209, + "learning_rate": 3.78125e-05, + "loss": 1.0152537822723389, + "step": 121, + "token_acc": 0.7179334916864608 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 1.7850531339645386, + "learning_rate": 3.8125e-05, + "loss": 0.9843083024024963, + "step": 122, + "token_acc": 0.7254917512690355 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 3.826921224594116, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0854582786560059, + "step": 123, + "token_acc": 0.6981124383382934 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 2.541259765625, + "learning_rate": 3.875e-05, + "loss": 1.029062032699585, + "step": 124, + "token_acc": 0.7140036666196588 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.901413917541504, + "learning_rate": 3.90625e-05, + "loss": 0.9238264560699463, + "step": 125, + "token_acc": 0.7398554752640356 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 3.516462564468384, + "learning_rate": 3.9375e-05, + "loss": 0.9085039496421814, + "step": 126, + "token_acc": 0.7436048965808358 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 19.986804962158203, + "learning_rate": 3.96875e-05, + "loss": 0.8704398274421692, + "step": 127, + "token_acc": 0.7592660550458715 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 2.4190216064453125, + "learning_rate": 4e-05, + "loss": 1.0086506605148315, + "step": 128, + "token_acc": 0.7155834613586267 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 10.030716896057129, + "learning_rate": 4.0312500000000004e-05, + "loss": 0.9949646592140198, + "step": 129, + "token_acc": 0.7203355704697987 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 12.682878494262695, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.9811956882476807, + "step": 130, + "token_acc": 0.7252892752288297 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 2.5325679779052734, + "learning_rate": 4.09375e-05, + "loss": 0.8768625259399414, + "step": 131, + "token_acc": 0.7590881616440722 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 3.471003532409668, + "learning_rate": 4.125e-05, + "loss": 0.976413905620575, + "step": 132, + "token_acc": 0.7229185085027823 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 2.5259780883789062, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0195640325546265, + "step": 133, + "token_acc": 0.7145907169392374 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 2.968695640563965, + "learning_rate": 4.1875e-05, + "loss": 0.9508498311042786, + "step": 134, + "token_acc": 0.7329253710346768 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 6.434828281402588, + "learning_rate": 4.21875e-05, + "loss": 0.877600371837616, + "step": 135, + "token_acc": 0.7561930872417507 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 2.5651018619537354, + "learning_rate": 4.25e-05, + "loss": 1.044579267501831, + "step": 136, + "token_acc": 0.7108454096075035 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 2.949556589126587, + "learning_rate": 4.28125e-05, + "loss": 1.0095362663269043, + "step": 137, + "token_acc": 0.716402739139739 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 5.174262046813965, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.8357698917388916, + "step": 138, + "token_acc": 0.7733576272902115 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 2.26728892326355, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.951337456703186, + "step": 139, + "token_acc": 0.7335539120280264 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 10.75383186340332, + "learning_rate": 4.375e-05, + "loss": 0.895291805267334, + "step": 140, + "token_acc": 0.7494621262704948 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 16.128704071044922, + "learning_rate": 4.40625e-05, + "loss": 0.8901827335357666, + "step": 141, + "token_acc": 0.7465124430424115 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 9.271828651428223, + "learning_rate": 4.4375e-05, + "loss": 1.0329668521881104, + "step": 142, + "token_acc": 0.7120498030388295 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 4.020982265472412, + "learning_rate": 4.46875e-05, + "loss": 0.8827842473983765, + "step": 143, + "token_acc": 0.7564152259865106 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 2.2052903175354004, + "learning_rate": 4.5e-05, + "loss": 0.9577807784080505, + "step": 144, + "token_acc": 0.7318331737418874 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.911048173904419, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9372326135635376, + "step": 145, + "token_acc": 0.7335442645325393 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 2.1569759845733643, + "learning_rate": 4.5625e-05, + "loss": 0.9250544309616089, + "step": 146, + "token_acc": 0.7350609269408822 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 90.4991455078125, + "learning_rate": 4.59375e-05, + "loss": 0.8544453382492065, + "step": 147, + "token_acc": 0.755140870837907 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 4.5008697509765625, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.9220091700553894, + "step": 148, + "token_acc": 0.7407507914970601 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 1.819976806640625, + "learning_rate": 4.65625e-05, + "loss": 1.0421748161315918, + "step": 149, + "token_acc": 0.7048270166100762 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 2.314004898071289, + "learning_rate": 4.6875e-05, + "loss": 0.9764658212661743, + "step": 150, + "token_acc": 0.7197187404463466 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 1.502142310142517, + "learning_rate": 4.71875e-05, + "loss": 1.020967721939087, + "step": 151, + "token_acc": 0.7136980898179974 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 2.8821356296539307, + "learning_rate": 4.75e-05, + "loss": 0.8627139925956726, + "step": 152, + "token_acc": 0.7503271575177354 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 5.202376365661621, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.0209362506866455, + "step": 153, + "token_acc": 0.7102290932393464 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 2.1695210933685303, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.8892765641212463, + "step": 154, + "token_acc": 0.746233887249573 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 1.2071388959884644, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9921320080757141, + "step": 155, + "token_acc": 0.7195179708467084 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 3.7766385078430176, + "learning_rate": 4.875e-05, + "loss": 0.8882246613502502, + "step": 156, + "token_acc": 0.7476656291685193 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 4.709662437438965, + "learning_rate": 4.90625e-05, + "loss": 0.9586931467056274, + "step": 157, + "token_acc": 0.7263681592039801 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 4.0463080406188965, + "learning_rate": 4.937500000000001e-05, + "loss": 0.8552154302597046, + "step": 158, + "token_acc": 0.7541220115416323 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 2.8410274982452393, + "learning_rate": 4.96875e-05, + "loss": 0.8899470567703247, + "step": 159, + "token_acc": 0.7499725304911549 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 2.9422967433929443, + "learning_rate": 5e-05, + "loss": 0.9451851844787598, + "step": 160, + "token_acc": 0.7286368400728196 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 3.18597412109375, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8761780858039856, + "step": 161, + "token_acc": 0.7598903251077164 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 1.9840060472488403, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.8826810121536255, + "step": 162, + "token_acc": 0.744661338923097 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 21.6531925201416, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8482328653335571, + "step": 163, + "token_acc": 0.7538179596823458 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 2.402557373046875, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.031351089477539, + "step": 164, + "token_acc": 0.7049064787205205 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 2.2513351440429688, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9314454793930054, + "step": 165, + "token_acc": 0.7308264872911727 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.2842321395874023, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9550535678863525, + "step": 166, + "token_acc": 0.7228157276475021 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 2.6976544857025146, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8689353466033936, + "step": 167, + "token_acc": 0.7488272087568413 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.9013776779174805, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.9480851888656616, + "step": 168, + "token_acc": 0.7256708860759493 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 2.0147554874420166, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.792317807674408, + "step": 169, + "token_acc": 0.77470701416827 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 5.95169734954834, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8363028168678284, + "step": 170, + "token_acc": 0.7643083597530452 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 3.004988670349121, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8463314175605774, + "step": 171, + "token_acc": 0.7617599713825791 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 6.122714996337891, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8169602751731873, + "step": 172, + "token_acc": 0.7588180032453669 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 2.14045786857605, + "learning_rate": 4.994911507566217e-05, + "loss": 1.0029940605163574, + "step": 173, + "token_acc": 0.712219074598678 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 1.9638121128082275, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9134575128555298, + "step": 174, + "token_acc": 0.7453976298725498 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 6.963588237762451, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8294797539710999, + "step": 175, + "token_acc": 0.7652689152233364 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 2.013535261154175, + "learning_rate": 4.99229333433282e-05, + "loss": 0.9168058037757874, + "step": 176, + "token_acc": 0.7364463791056589 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 1.502765417098999, + "learning_rate": 4.991300473502437e-05, + "loss": 0.862735390663147, + "step": 177, + "token_acc": 0.7555572888230248 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 2.0426056385040283, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.006132960319519, + "step": 178, + "token_acc": 0.711357628807904 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 2.3713955879211426, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8480299711227417, + "step": 179, + "token_acc": 0.7630771926750197 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.9472578763961792, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9099956750869751, + "step": 180, + "token_acc": 0.744568097509274 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 5.378758907318115, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8087277412414551, + "step": 181, + "token_acc": 0.7657945736434109 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 1.7415252923965454, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9494457244873047, + "step": 182, + "token_acc": 0.7285589688923345 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 3.286355495452881, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9584786295890808, + "step": 183, + "token_acc": 0.729500568710578 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.2414660453796387, + "learning_rate": 4.982671142387316e-05, + "loss": 0.9425086975097656, + "step": 184, + "token_acc": 0.7302265729123582 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 2.1618587970733643, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8545800447463989, + "step": 185, + "token_acc": 0.7508434073657576 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 2.7464194297790527, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0033760070800781, + "step": 186, + "token_acc": 0.7168112389213652 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 2.1117477416992188, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8726233839988708, + "step": 187, + "token_acc": 0.7512896094325718 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 2.3225831985473633, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9832717776298523, + "step": 188, + "token_acc": 0.7242706131078224 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 1.5692338943481445, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8374819755554199, + "step": 189, + "token_acc": 0.7515348246418743 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 2.915736436843872, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8508638143539429, + "step": 190, + "token_acc": 0.7552318044323724 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 2.509810209274292, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8711614608764648, + "step": 191, + "token_acc": 0.748834597023308 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 38.909141540527344, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8127565383911133, + "step": 192, + "token_acc": 0.7634650994283874 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 2.6864702701568604, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.8236993551254272, + "step": 193, + "token_acc": 0.7607028125614633 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 1.8782848119735718, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9363845586776733, + "step": 194, + "token_acc": 0.7292962883501395 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 15.927218437194824, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7871609926223755, + "step": 195, + "token_acc": 0.7660380466112163 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 5.428698539733887, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8945263028144836, + "step": 196, + "token_acc": 0.733186463496726 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 4.436823844909668, + "learning_rate": 4.958879433443904e-05, + "loss": 0.8039653897285461, + "step": 197, + "token_acc": 0.767208630907157 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 1.1804406642913818, + "learning_rate": 4.95663319832678e-05, + "loss": 0.993769109249115, + "step": 198, + "token_acc": 0.7182901803257216 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 34.3048095703125, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8885359764099121, + "step": 199, + "token_acc": 0.7376394368941498 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 3.2417330741882324, + "learning_rate": 4.951963201008076e-05, + "loss": 0.8299421072006226, + "step": 200, + "token_acc": 0.7590844540974021 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 1.7213491201400757, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8799647092819214, + "step": 201, + "token_acc": 0.7460959726876146 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 3.129983901977539, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7674298286437988, + "step": 202, + "token_acc": 0.7778585271317829 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 1.7732640504837036, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8905498385429382, + "step": 203, + "token_acc": 0.7450012817226352 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.5776193141937256, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9746031761169434, + "step": 204, + "token_acc": 0.7222505091649695 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 2.398367166519165, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8019765019416809, + "step": 205, + "token_acc": 0.7681595784719608 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 2.5589308738708496, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9508465528488159, + "step": 206, + "token_acc": 0.7260439407311069 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 30.68482780456543, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8822273015975952, + "step": 207, + "token_acc": 0.7461445679331438 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 1.6417980194091797, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.7858006954193115, + "step": 208, + "token_acc": 0.7672451193058568 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 1.7159936428070068, + "learning_rate": 4.92803071949828e-05, + "loss": 0.9309002757072449, + "step": 209, + "token_acc": 0.7286675639300134 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 2.5000967979431152, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9468393921852112, + "step": 210, + "token_acc": 0.7337789370720574 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 4.127990245819092, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9223999977111816, + "step": 211, + "token_acc": 0.7299156498239292 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.085132598876953, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.9442908763885498, + "step": 212, + "token_acc": 0.728492959925731 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.8777406215667725, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8923409581184387, + "step": 213, + "token_acc": 0.7408707865168539 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 1.6103774309158325, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8582785725593567, + "step": 214, + "token_acc": 0.7472986748216106 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 5.4966020584106445, + "learning_rate": 4.9094401644886e-05, + "loss": 0.980675220489502, + "step": 215, + "token_acc": 0.7182641448950152 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 2.9030697345733643, + "learning_rate": 4.906138091134118e-05, + "loss": 0.9365415573120117, + "step": 216, + "token_acc": 0.730092204526404 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 4.844046115875244, + "learning_rate": 4.90277804028108e-05, + "loss": 0.738396942615509, + "step": 217, + "token_acc": 0.7914989692745656 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 1.5353028774261475, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9523649215698242, + "step": 218, + "token_acc": 0.7237939963556153 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 32.93247604370117, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7531812787055969, + "step": 219, + "token_acc": 0.7850740452065471 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 2.059149742126465, + "learning_rate": 4.892350839330522e-05, + "loss": 0.8953914642333984, + "step": 220, + "token_acc": 0.7396288209606987 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 3.8497390747070312, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8436079025268555, + "step": 221, + "token_acc": 0.7543846828412745 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 1.9176925420761108, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8814166188240051, + "step": 222, + "token_acc": 0.7467446887026201 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 1.9749252796173096, + "learning_rate": 4.881404839143988e-05, + "loss": 0.8513644337654114, + "step": 223, + "token_acc": 0.7457374830852503 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 4.914273262023926, + "learning_rate": 4.877641290737884e-05, + "loss": 0.8055661916732788, + "step": 224, + "token_acc": 0.7624061257546753 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 31.535110473632812, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8872958421707153, + "step": 225, + "token_acc": 0.7492080569003646 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 2.174323320388794, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8905588388442993, + "step": 226, + "token_acc": 0.7426990645676478 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 2.537534713745117, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8442504405975342, + "step": 227, + "token_acc": 0.759594451701188 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 2.5602848529815674, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8962931632995605, + "step": 228, + "token_acc": 0.7412289395441031 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 7.3618927001953125, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8395902514457703, + "step": 229, + "token_acc": 0.7582629846902275 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 3.7751402854919434, + "learning_rate": 4.853860162957552e-05, + "loss": 0.8951698541641235, + "step": 230, + "token_acc": 0.7401862711279752 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 1.730199933052063, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6874003410339355, + "step": 231, + "token_acc": 0.7996880161497523 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 1.931376576423645, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.8303564190864563, + "step": 232, + "token_acc": 0.7600831909678378 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 2.0311784744262695, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8384573459625244, + "step": 233, + "token_acc": 0.7549541998443393 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.0220412015914917, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8069633841514587, + "step": 234, + "token_acc": 0.7599480377410092 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 3.729283571243286, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8110902309417725, + "step": 235, + "token_acc": 0.7580623121071332 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 1.758043646812439, + "learning_rate": 4.828037336897009e-05, + "loss": 0.856610894203186, + "step": 236, + "token_acc": 0.746238951003922 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 4.306615829467773, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9790533781051636, + "step": 237, + "token_acc": 0.7135992011483493 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.5020512342453003, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.7993966937065125, + "step": 238, + "token_acc": 0.7609775641025641 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 1.6187368631362915, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8823633193969727, + "step": 239, + "token_acc": 0.7474736257634648 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 2.4625823497772217, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8518728017807007, + "step": 240, + "token_acc": 0.748145340336817 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 5.807409286499023, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.6972458362579346, + "step": 241, + "token_acc": 0.7948159442387279 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 2.591768503189087, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.9044586420059204, + "step": 242, + "token_acc": 0.7324852097326632 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 2.5517194271087646, + "learning_rate": 4.79536020593051e-05, + "loss": 0.9304581880569458, + "step": 243, + "token_acc": 0.727802037845706 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 2.617535352706909, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.8499206304550171, + "step": 244, + "token_acc": 0.7519966664351692 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.3205288648605347, + "learning_rate": 4.785524389258827e-05, + "loss": 0.9406691789627075, + "step": 245, + "token_acc": 0.7282037303843308 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 1.9039998054504395, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8956192135810852, + "step": 246, + "token_acc": 0.7330732381846017 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.1243889331817627, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.7765395641326904, + "step": 247, + "token_acc": 0.7724535218643624 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 1.0170472860336304, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.8932359218597412, + "step": 248, + "token_acc": 0.7361666956673046 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 1.2093161344528198, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9077604413032532, + "step": 249, + "token_acc": 0.734278362150693 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 6.2834248542785645, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7469887733459473, + "step": 250, + "token_acc": 0.7800094891665349 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 3.575439453125, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.8440943360328674, + "step": 251, + "token_acc": 0.7537353459505018 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 2.0179975032806396, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8843530416488647, + "step": 252, + "token_acc": 0.7379267277268943 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 1.3368704319000244, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.8424524068832397, + "step": 253, + "token_acc": 0.7527279941802791 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 7.156957149505615, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7525070905685425, + "step": 254, + "token_acc": 0.7739664347114203 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 7.08997106552124, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.720240592956543, + "step": 255, + "token_acc": 0.7869349503858876 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 2.1491920948028564, + "learning_rate": 4.72751631047092e-05, + "loss": 0.822435736656189, + "step": 256, + "token_acc": 0.7558427895092809 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 4.267916679382324, + "learning_rate": 4.721918194465169e-05, + "loss": 0.7940695285797119, + "step": 257, + "token_acc": 0.7643436685018835 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 3.5891292095184326, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7873713374137878, + "step": 258, + "token_acc": 0.7648121955052648 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 2.214632749557495, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8356124758720398, + "step": 259, + "token_acc": 0.7503839773914112 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 2.8201630115509033, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.8771319389343262, + "step": 260, + "token_acc": 0.7445221131872564 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 1.4439845085144043, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9190523624420166, + "step": 261, + "token_acc": 0.7323772975156534 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 4.227046489715576, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7340889573097229, + "step": 262, + "token_acc": 0.7861572132044501 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 1.6055476665496826, + "learning_rate": 4.687209999162396e-05, + "loss": 0.905823826789856, + "step": 263, + "token_acc": 0.7359950479727638 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 7.083006858825684, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9699968099594116, + "step": 264, + "token_acc": 0.7199773578333188 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 2.4387781620025635, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8051294684410095, + "step": 265, + "token_acc": 0.7680182752712735 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 1.6597864627838135, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.8352447748184204, + "step": 266, + "token_acc": 0.7523210168857872 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 3.9788217544555664, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.952012300491333, + "step": 267, + "token_acc": 0.7299187373027035 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 2.355642080307007, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8457879424095154, + "step": 268, + "token_acc": 0.7541639391955779 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 5.1823248863220215, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8699308037757874, + "step": 269, + "token_acc": 0.7468877351644058 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 4.252589702606201, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8364484906196594, + "step": 270, + "token_acc": 0.7554215137153526 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 1.3415782451629639, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8568819165229797, + "step": 271, + "token_acc": 0.7485356078511972 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 1.7074843645095825, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8769652843475342, + "step": 272, + "token_acc": 0.7422730723348877 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 4.651581287384033, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.8192580938339233, + "step": 273, + "token_acc": 0.7577268895757235 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 4.706144332885742, + "learning_rate": 4.618673848685586e-05, + "loss": 0.7910339832305908, + "step": 274, + "token_acc": 0.7648066904304908 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 2.0272216796875, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8216524720191956, + "step": 275, + "token_acc": 0.7571758072783188 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 1.8787137269973755, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8251311779022217, + "step": 276, + "token_acc": 0.7546209639681797 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 1.8774858713150024, + "learning_rate": 4.59890152099534e-05, + "loss": 0.9141278266906738, + "step": 277, + "token_acc": 0.732027338182084 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 3.588717460632324, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8628591299057007, + "step": 278, + "token_acc": 0.7456560481176209 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 2.5552499294281006, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8396396040916443, + "step": 279, + "token_acc": 0.7532559149120903 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 2.4589977264404297, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7853731513023376, + "step": 280, + "token_acc": 0.7682845427672357 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 2.5455079078674316, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9314486980438232, + "step": 281, + "token_acc": 0.7245133049187882 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 2.683380365371704, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8583184480667114, + "step": 282, + "token_acc": 0.7450482731163531 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.3633437156677246, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8894494771957397, + "step": 283, + "token_acc": 0.739060801921867 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 4.674302101135254, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7389158606529236, + "step": 284, + "token_acc": 0.7801253772927792 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 2.4775431156158447, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.7430102825164795, + "step": 285, + "token_acc": 0.7866531850353893 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 2.010530471801758, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7329319715499878, + "step": 286, + "token_acc": 0.7800226159065209 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 3.449420213699341, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9150421619415283, + "step": 287, + "token_acc": 0.7355081881985963 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 1.9925580024719238, + "learning_rate": 4.522542485937369e-05, + "loss": 0.8455727100372314, + "step": 288, + "token_acc": 0.7526455026455027 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 1.939789891242981, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9501767158508301, + "step": 289, + "token_acc": 0.7274806559929924 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 1.328555941581726, + "learning_rate": 4.508018828701612e-05, + "loss": 0.828056275844574, + "step": 290, + "token_acc": 0.7555241836484164 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 2.5277862548828125, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8774980902671814, + "step": 291, + "token_acc": 0.7489495798319328 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 1.7016732692718506, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9148298501968384, + "step": 292, + "token_acc": 0.735104948969767 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 4.40346097946167, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8074817061424255, + "step": 293, + "token_acc": 0.7590221897098268 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 5.940386772155762, + "learning_rate": 4.478392321601651e-05, + "loss": 0.8893970251083374, + "step": 294, + "token_acc": 0.7431922534891121 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 4.992410182952881, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7381858825683594, + "step": 295, + "token_acc": 0.7853381258881551 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 5.966536998748779, + "learning_rate": 4.463292327201862e-05, + "loss": 0.838369607925415, + "step": 296, + "token_acc": 0.754148620370821 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 1.494193434715271, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8503720760345459, + "step": 297, + "token_acc": 0.7541888163649821 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 4.080326080322266, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7552746534347534, + "step": 298, + "token_acc": 0.7728544776119403 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.7464518547058105, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8308608531951904, + "step": 299, + "token_acc": 0.7577373937852757 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 2.6353917121887207, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.8492376208305359, + "step": 300, + "token_acc": 0.7513898676689375 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 5.348440647125244, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9122411608695984, + "step": 301, + "token_acc": 0.7296964163433006 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 3.4473955631256104, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8476892113685608, + "step": 302, + "token_acc": 0.7541979056942809 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.6045217514038086, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8833868503570557, + "step": 303, + "token_acc": 0.7396542108198549 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 2.6573829650878906, + "learning_rate": 4.401014914000078e-05, + "loss": 0.7998722195625305, + "step": 304, + "token_acc": 0.7661461586508432 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 2.9124984741210938, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8530205488204956, + "step": 305, + "token_acc": 0.7466014447414823 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 13.436267852783203, + "learning_rate": 4.384983704904674e-05, + "loss": 0.806631863117218, + "step": 306, + "token_acc": 0.7660835876966424 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 4.7447686195373535, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8307251334190369, + "step": 307, + "token_acc": 0.7573671342169604 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.38670015335083, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7642802000045776, + "step": 308, + "token_acc": 0.7765166340508807 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 1.7410259246826172, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8567044138908386, + "step": 309, + "token_acc": 0.7521028037383177 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 4.307875156402588, + "learning_rate": 4.352377813387398e-05, + "loss": 0.9223236441612244, + "step": 310, + "token_acc": 0.7292516473172262 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 3.766094207763672, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.685102641582489, + "step": 311, + "token_acc": 0.7947743004777226 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 1.5777055025100708, + "learning_rate": 4.335806273589214e-05, + "loss": 0.7940619587898254, + "step": 312, + "token_acc": 0.7673673517230601 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 4.047732353210449, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7358657121658325, + "step": 313, + "token_acc": 0.782784 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 1.3510150909423828, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8665168881416321, + "step": 314, + "token_acc": 0.7442531173127491 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 2.992387056350708, + "learning_rate": 4.310617707378668e-05, + "loss": 0.7996443510055542, + "step": 315, + "token_acc": 0.7625912988250239 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 1.5894449949264526, + "learning_rate": 4.302133991757297e-05, + "loss": 0.8834421038627625, + "step": 316, + "token_acc": 0.7416610344690494 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 3.1843483448028564, + "learning_rate": 4.2936068525181e-05, + "loss": 0.842120885848999, + "step": 317, + "token_acc": 0.7479250534267681 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 1.8540269136428833, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9776566028594971, + "step": 318, + "token_acc": 0.7195618838992333 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 2.9334137439727783, + "learning_rate": 4.276423126095974e-05, + "loss": 0.8031361103057861, + "step": 319, + "token_acc": 0.7604228218764362 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 1.6915321350097656, + "learning_rate": 4.267766952966369e-05, + "loss": 0.9410305023193359, + "step": 320, + "token_acc": 0.7282994213179018 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 5.01201057434082, + "learning_rate": 4.259068184315608e-05, + "loss": 0.9005149602890015, + "step": 321, + "token_acc": 0.7376341577228185 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 1.6810280084609985, + "learning_rate": 4.250327029746309e-05, + "loss": 0.7451943755149841, + "step": 322, + "token_acc": 0.781010719754977 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 5.86810827255249, + "learning_rate": 4.24154369988241e-05, + "loss": 0.740115761756897, + "step": 323, + "token_acc": 0.7834601819194357 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.2761876583099365, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9164939522743225, + "step": 324, + "token_acc": 0.7285148767718044 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 2.3560471534729004, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7663041353225708, + "step": 325, + "token_acc": 0.7738841185116423 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 3.6525771617889404, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6357040405273438, + "step": 326, + "token_acc": 0.8093354430379747 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 1.9545413255691528, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9620451927185059, + "step": 327, + "token_acc": 0.7203116924422535 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 2.913717269897461, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8111364841461182, + "step": 328, + "token_acc": 0.75743935983996 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 1.9858478307724, + "learning_rate": 4.187969961854726e-05, + "loss": 0.9955106973648071, + "step": 329, + "token_acc": 0.7128412537917088 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 6.050736904144287, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7481118440628052, + "step": 330, + "token_acc": 0.7825464949928469 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 1.8267136812210083, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6872880458831787, + "step": 331, + "token_acc": 0.7973193262090201 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 2.2636425495147705, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.7994587421417236, + "step": 332, + "token_acc": 0.7658987358018353 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 3.7548258304595947, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7354224920272827, + "step": 333, + "token_acc": 0.7824889408229697 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 2.3976776599884033, + "learning_rate": 4.142204747357604e-05, + "loss": 0.8958951830863953, + "step": 334, + "token_acc": 0.7402859448864292 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 1.5932167768478394, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8891469240188599, + "step": 335, + "token_acc": 0.7463272467733302 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 1.8860996961593628, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7546243667602539, + "step": 336, + "token_acc": 0.7755037783375315 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 3.2070868015289307, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8346970081329346, + "step": 337, + "token_acc": 0.7553981106612686 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.9174991846084595, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8280372619628906, + "step": 338, + "token_acc": 0.7614895430407133 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 7.967592716217041, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6412019729614258, + "step": 339, + "token_acc": 0.8135894699395233 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 1.8168036937713623, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7411476373672485, + "step": 340, + "token_acc": 0.7818817070127277 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 5.3374481201171875, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8266500234603882, + "step": 341, + "token_acc": 0.7557682359027419 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 6.361590385437012, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7055239677429199, + "step": 342, + "token_acc": 0.7837323608688759 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 4.529880046844482, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8333171606063843, + "step": 343, + "token_acc": 0.7545928944170419 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 7.685861587524414, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8767172694206238, + "step": 344, + "token_acc": 0.7442405662503945 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 3.9726321697235107, + "learning_rate": 4.038078976451567e-05, + "loss": 0.8583240509033203, + "step": 345, + "token_acc": 0.7489155540532928 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.581453800201416, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7588601112365723, + "step": 346, + "token_acc": 0.7785956964892412 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 3.0492961406707764, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8237013816833496, + "step": 347, + "token_acc": 0.7580033277870216 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 1.490657091140747, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7148709297180176, + "step": 348, + "token_acc": 0.7866251062623972 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 2.604755401611328, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8905333280563354, + "step": 349, + "token_acc": 0.7405912450255827 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 9.451438903808594, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9194896817207336, + "step": 350, + "token_acc": 0.7317846328538986 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.6283177137374878, + "learning_rate": 3.979373519225858e-05, + "loss": 0.9222493171691895, + "step": 351, + "token_acc": 0.7324363188167625 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 1.01435124874115, + "learning_rate": 3.969463130731183e-05, + "loss": 0.8873315453529358, + "step": 352, + "token_acc": 0.7386921685189971 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.6070590019226074, + "learning_rate": 3.959517334544466e-05, + "loss": 0.8865751028060913, + "step": 353, + "token_acc": 0.7350283279486819 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 2.5121443271636963, + "learning_rate": 3.949536370316285e-05, + "loss": 0.8619804382324219, + "step": 354, + "token_acc": 0.7479302448476308 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 1.3835835456848145, + "learning_rate": 3.939520478544614e-05, + "loss": 0.9314793348312378, + "step": 355, + "token_acc": 0.7263123142951469 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 2.486131191253662, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.8991205096244812, + "step": 356, + "token_acc": 0.7395881270133456 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 2.7008180618286133, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8544954061508179, + "step": 357, + "token_acc": 0.7505512359289777 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 2.08654522895813, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7513941526412964, + "step": 358, + "token_acc": 0.7819888236136983 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 1.9756476879119873, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7608502507209778, + "step": 359, + "token_acc": 0.772964191430312 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.3755425214767456, + "learning_rate": 3.888925582549006e-05, + "loss": 0.8417959213256836, + "step": 360, + "token_acc": 0.7520785670442498 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 2.1407554149627686, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8518916368484497, + "step": 361, + "token_acc": 0.7552394806314315 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 4.228549003601074, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8237797021865845, + "step": 362, + "token_acc": 0.7532420091324201 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 2.090517044067383, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7693901062011719, + "step": 363, + "token_acc": 0.7751344989912575 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 2.4747915267944336, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6950187683105469, + "step": 364, + "token_acc": 0.7874652915509719 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 1.813559651374817, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8348764181137085, + "step": 365, + "token_acc": 0.7503848566052796 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.9585214853286743, + "learning_rate": 3.827110064348773e-05, + "loss": 0.809190571308136, + "step": 366, + "token_acc": 0.7566013071895424 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.5872814655303955, + "learning_rate": 3.816694101379631e-05, + "loss": 0.8659224510192871, + "step": 367, + "token_acc": 0.7458495340369068 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 3.7991831302642822, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.6858774423599243, + "step": 368, + "token_acc": 0.7921834567680913 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 11.759095191955566, + "learning_rate": 3.795767247323533e-05, + "loss": 0.9242225289344788, + "step": 369, + "token_acc": 0.7271716902285054 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 5.795279502868652, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7550444006919861, + "step": 370, + "token_acc": 0.7739854877721043 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 2.1931843757629395, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8427231311798096, + "step": 371, + "token_acc": 0.7499619926012264 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 1.1604092121124268, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9125556945800781, + "step": 372, + "token_acc": 0.7275495750708215 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 8.955742835998535, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8157449960708618, + "step": 373, + "token_acc": 0.7604572450348043 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 6.911311626434326, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9126226902008057, + "step": 374, + "token_acc": 0.731775132504996 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 1.0974699258804321, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.8590577244758606, + "step": 375, + "token_acc": 0.7466798810703666 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 17.13771629333496, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8356927037239075, + "step": 376, + "token_acc": 0.7555617044825678 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 1.2535425424575806, + "learning_rate": 3.710831292775353e-05, + "loss": 0.7597782611846924, + "step": 377, + "token_acc": 0.7681555758128229 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 2.29099702835083, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7276159524917603, + "step": 378, + "token_acc": 0.7826947105372761 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 2.584505319595337, + "learning_rate": 3.689300402536093e-05, + "loss": 0.9814828634262085, + "step": 379, + "token_acc": 0.7160717395089674 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.3225842714309692, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8274613618850708, + "step": 380, + "token_acc": 0.7544784652521916 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 3.4567878246307373, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8384053707122803, + "step": 381, + "token_acc": 0.7518606937227917 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 3.5069363117218018, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7467086315155029, + "step": 382, + "token_acc": 0.7784389823199656 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 1349.64501953125, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7556321620941162, + "step": 383, + "token_acc": 0.7752317780960277 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 2.6709060668945312, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6211893558502197, + "step": 384, + "token_acc": 0.8125134148959005 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 1.6858121156692505, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8058912754058838, + "step": 385, + "token_acc": 0.7628393692433814 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.219348430633545, + "learning_rate": 3.613053314713671e-05, + "loss": 0.8431601524353027, + "step": 386, + "token_acc": 0.7487229170336446 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 1.4409899711608887, + "learning_rate": 3.602051485530486e-05, + "loss": 0.9082483053207397, + "step": 387, + "token_acc": 0.729979941367073 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 1.596650242805481, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7665495872497559, + "step": 388, + "token_acc": 0.7712696559774772 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 1.0858607292175293, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9287350177764893, + "step": 389, + "token_acc": 0.7277777777777777 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 14.8970365524292, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6690181493759155, + "step": 390, + "token_acc": 0.8004053765735012 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 5.169677734375, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8137506246566772, + "step": 391, + "token_acc": 0.7589914103629815 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.0652302503585815, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7818809747695923, + "step": 392, + "token_acc": 0.7646431342125679 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 3.2523343563079834, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.790520429611206, + "step": 393, + "token_acc": 0.7665671262469026 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.9948564767837524, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7343300580978394, + "step": 394, + "token_acc": 0.7801844119693807 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 8.779631614685059, + "learning_rate": 3.513103285012475e-05, + "loss": 0.823872447013855, + "step": 395, + "token_acc": 0.7562481836675385 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 3.0845484733581543, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7353721857070923, + "step": 396, + "token_acc": 0.7806098875712305 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 1.4457420110702515, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7633687257766724, + "step": 397, + "token_acc": 0.7762840122363549 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 3.5868849754333496, + "learning_rate": 3.47933752712989e-05, + "loss": 0.7144147157669067, + "step": 398, + "token_acc": 0.789120029455081 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 2.74013614654541, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8580281734466553, + "step": 399, + "token_acc": 0.7488521853198974 + }, + { + "epoch": 1.0, + "grad_norm": 2.7789676189422607, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7465000152587891, + "step": 400, + "token_acc": 0.7748026089941641 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 2.5083093643188477, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7482450008392334, + "step": 401, + "token_acc": 0.7756680731364276 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 1.5304547548294067, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8512796759605408, + "step": 402, + "token_acc": 0.7466814693247091 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 3.557460308074951, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7484120726585388, + "step": 403, + "token_acc": 0.7753919962555581 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 5.367844581604004, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6399465799331665, + "step": 404, + "token_acc": 0.8064121850319669 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 2.309791326522827, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7572115659713745, + "step": 405, + "token_acc": 0.778211361310133 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 10.43783950805664, + "learning_rate": 3.388277253201041e-05, + "loss": 0.7999943494796753, + "step": 406, + "token_acc": 0.7620247990189399 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 4.304990768432617, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8064647912979126, + "step": 407, + "token_acc": 0.7639428499812007 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 1.3805936574935913, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8383949398994446, + "step": 408, + "token_acc": 0.7478151048244506 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 2.6776158809661865, + "learning_rate": 3.353768924152341e-05, + "loss": 0.6969519257545471, + "step": 409, + "token_acc": 0.7909162786611614 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 1.1812976598739624, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9484398365020752, + "step": 410, + "token_acc": 0.7265209203307951 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 7.378384113311768, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7456188797950745, + "step": 411, + "token_acc": 0.7744972966405443 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 2.924264669418335, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8864508867263794, + "step": 412, + "token_acc": 0.7376894683106887 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 2.464365005493164, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6419383883476257, + "step": 413, + "token_acc": 0.8134543953776311 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 5.192070007324219, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7585772275924683, + "step": 414, + "token_acc": 0.7764367456694391 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 2.1468076705932617, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8554524183273315, + "step": 415, + "token_acc": 0.7464255019923431 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 1.838391661643982, + "learning_rate": 3.272542485937369e-05, + "loss": 0.819720447063446, + "step": 416, + "token_acc": 0.7565149747180085 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 1.1302598714828491, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8727908730506897, + "step": 417, + "token_acc": 0.7423896933074906 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.2645598649978638, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8348588943481445, + "step": 418, + "token_acc": 0.7506860706860707 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.1367015838623047, + "learning_rate": 3.23744632744341e-05, + "loss": 0.673876941204071, + "step": 419, + "token_acc": 0.7934364744491327 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 10.951983451843262, + "learning_rate": 3.225711693136156e-05, + "loss": 0.6246871948242188, + "step": 420, + "token_acc": 0.8066268332428028 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 3.3616561889648438, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.8184407949447632, + "step": 421, + "token_acc": 0.7584331756487909 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 1.6267706155776978, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8076139688491821, + "step": 422, + "token_acc": 0.7578792160717577 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 2.607529878616333, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6964325308799744, + "step": 423, + "token_acc": 0.7924243768295929 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 2.781243085861206, + "learning_rate": 3.178601124662686e-05, + "loss": 0.8571556806564331, + "step": 424, + "token_acc": 0.7462099943851769 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.86491858959198, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.758177638053894, + "step": 425, + "token_acc": 0.7680104961832062 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 2.1224405765533447, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7757034301757812, + "step": 426, + "token_acc": 0.7722524774573699 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 1.8863650560379028, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8123703002929688, + "step": 427, + "token_acc": 0.7639742969667657 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 2.3641357421875, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7848698496818542, + "step": 428, + "token_acc": 0.7647326852976913 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 2.3047101497650146, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7829238176345825, + "step": 429, + "token_acc": 0.7659560681656191 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 2.6143319606781006, + "learning_rate": 3.10745044975816e-05, + "loss": 0.7950413227081299, + "step": 430, + "token_acc": 0.768625959038742 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 1.3800603151321411, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8089693784713745, + "step": 431, + "token_acc": 0.7642110762800418 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 4.631928443908691, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8975304365158081, + "step": 432, + "token_acc": 0.7377950351206317 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 1.7472598552703857, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8314036726951599, + "step": 433, + "token_acc": 0.7511785954815404 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 3.089261054992676, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6671078205108643, + "step": 434, + "token_acc": 0.7968802528071001 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 1.2681653499603271, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8389818668365479, + "step": 435, + "token_acc": 0.7532440676213618 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 1.615865707397461, + "learning_rate": 3.035772882662627e-05, + "loss": 0.740587055683136, + "step": 436, + "token_acc": 0.7783269677226091 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 1.1586065292358398, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8281398415565491, + "step": 437, + "token_acc": 0.7543171893608575 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 1.2768690586090088, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8269925117492676, + "step": 438, + "token_acc": 0.752611147056105 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 1.6892045736312866, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.6553794145584106, + "step": 439, + "token_acc": 0.8029715762273901 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 11.613991737365723, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.5059342384338379, + "step": 440, + "token_acc": 0.8454545454545455 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.2692391872406006, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8626140356063843, + "step": 441, + "token_acc": 0.7472961054634916 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 10.773530006408691, + "learning_rate": 2.963630595278977e-05, + "loss": 0.637244701385498, + "step": 442, + "token_acc": 0.8053183229813664 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 4.59783411026001, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.7247684001922607, + "step": 443, + "token_acc": 0.7837734769758795 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 1.9800934791564941, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.8562126159667969, + "step": 444, + "token_acc": 0.7429015397655035 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 1.0154430866241455, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.7898328304290771, + "step": 445, + "token_acc": 0.7574374230611407 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 0.9506177306175232, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8542905449867249, + "step": 446, + "token_acc": 0.7462486726072303 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 1.8862485885620117, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7725399732589722, + "step": 447, + "token_acc": 0.76569290197972 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 2.745835065841675, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7496145367622375, + "step": 448, + "token_acc": 0.7733351163412677 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 5.342070579528809, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6059656143188477, + "step": 449, + "token_acc": 0.8215033744472888 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 2.0042543411254883, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6715121865272522, + "step": 450, + "token_acc": 0.7972053027588678 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 3.369508981704712, + "learning_rate": 2.854682793330633e-05, + "loss": 0.7005834579467773, + "step": 451, + "token_acc": 0.7925215723873442 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 2.255542516708374, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.6925271153450012, + "step": 452, + "token_acc": 0.7939376553834385 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 1.9074103832244873, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8258252143859863, + "step": 453, + "token_acc": 0.7546308043643746 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 1.9372538328170776, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9210749864578247, + "step": 454, + "token_acc": 0.7282898919262556 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 2.819469928741455, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.695602536201477, + "step": 455, + "token_acc": 0.7881796251623678 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 1.7250150442123413, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7463157176971436, + "step": 456, + "token_acc": 0.7749062109212171 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 2.6007657051086426, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.787858247756958, + "step": 457, + "token_acc": 0.7616864037040335 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 2.298821210861206, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7881502509117126, + "step": 458, + "token_acc": 0.7664104482688252 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 7.818414211273193, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8358293175697327, + "step": 459, + "token_acc": 0.7499888487443687 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 0.8642250299453735, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8736441731452942, + "step": 460, + "token_acc": 0.7447342910020269 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.3678836822509766, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8240588903427124, + "step": 461, + "token_acc": 0.7507011866235167 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 4.159181594848633, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8616459369659424, + "step": 462, + "token_acc": 0.7484583250447583 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 2.0485188961029053, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.8544602394104004, + "step": 463, + "token_acc": 0.7434052757793765 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 3.685590982437134, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9081782102584839, + "step": 464, + "token_acc": 0.7326156444122791 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 2.547394037246704, + "learning_rate": 2.683911408999169e-05, + "loss": 0.7107387185096741, + "step": 465, + "token_acc": 0.7819461633663366 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 4.8121209144592285, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6490302085876465, + "step": 466, + "token_acc": 0.8037789324515824 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 14.578204154968262, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5259852409362793, + "step": 467, + "token_acc": 0.8461106745987204 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 8.176078796386719, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7505219578742981, + "step": 468, + "token_acc": 0.7776547651997416 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 3.2051355838775635, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7255773544311523, + "step": 469, + "token_acc": 0.7867267333260082 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 1.626749038696289, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8417118787765503, + "step": 470, + "token_acc": 0.7481726244117353 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 6.1625142097473145, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.7143338918685913, + "step": 471, + "token_acc": 0.782307525795512 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 1.209688425064087, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8743295669555664, + "step": 472, + "token_acc": 0.7435388711951131 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 4.4833550453186035, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7911447286605835, + "step": 473, + "token_acc": 0.7650904203323559 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.926804780960083, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.8273140788078308, + "step": 474, + "token_acc": 0.7583581805493879 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 1.872205376625061, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8174236416816711, + "step": 475, + "token_acc": 0.7558880252469172 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 3.878399610519409, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6719313263893127, + "step": 476, + "token_acc": 0.7988101223395341 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 1.8818238973617554, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7724275588989258, + "step": 477, + "token_acc": 0.773079355042681 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 2.963927745819092, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9049360752105713, + "step": 478, + "token_acc": 0.7339738348323794 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 2.7415409088134766, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8529146313667297, + "step": 479, + "token_acc": 0.7456251892219194 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 1.6160272359848022, + "learning_rate": 2.5e-05, + "loss": 0.7292277812957764, + "step": 480, + "token_acc": 0.7809226832973535 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 1.343587875366211, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7619751691818237, + "step": 481, + "token_acc": 0.7706236189540879 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 1.3238308429718018, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.8524097204208374, + "step": 482, + "token_acc": 0.7446827604774298 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 3.7486040592193604, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.7500920295715332, + "step": 483, + "token_acc": 0.7754705144291092 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 2.8402061462402344, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8324809074401855, + "step": 484, + "token_acc": 0.7528833831695857 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 3.4831743240356445, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8428285717964172, + "step": 485, + "token_acc": 0.7473346542126615 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 1.403225302696228, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9696469306945801, + "step": 486, + "token_acc": 0.71866889465638 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.4889639616012573, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8492543697357178, + "step": 487, + "token_acc": 0.7504687579182081 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 2.625995397567749, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7114861607551575, + "step": 488, + "token_acc": 0.7869125090383224 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 1.7950961589813232, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8308013677597046, + "step": 489, + "token_acc": 0.7517450509211581 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 2.1624467372894287, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.6955065727233887, + "step": 490, + "token_acc": 0.7887615628883059 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 8.656285285949707, + "learning_rate": 2.365075276976245e-05, + "loss": 0.8983242511749268, + "step": 491, + "token_acc": 0.7329764252841175 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 2.0143282413482666, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6728692650794983, + "step": 492, + "token_acc": 0.7958803160791974 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 7.166861534118652, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.7883687615394592, + "step": 493, + "token_acc": 0.7684217714949122 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 2.849721908569336, + "learning_rate": 2.328329352789066e-05, + "loss": 0.7245194911956787, + "step": 494, + "token_acc": 0.7787610619469026 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 5.236846923828125, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8468673825263977, + "step": 495, + "token_acc": 0.7493651103731197 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.2859762907028198, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8326257467269897, + "step": 496, + "token_acc": 0.7531454639099404 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 1.9283963441848755, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6319226622581482, + "step": 497, + "token_acc": 0.8054604261796042 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 3.758319616317749, + "learning_rate": 2.279394073699077e-05, + "loss": 0.6995894908905029, + "step": 498, + "token_acc": 0.7890441061057919 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.2176576852798462, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7224262356758118, + "step": 499, + "token_acc": 0.7844820331566102 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 2.0414905548095703, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5559295415878296, + "step": 500, + "token_acc": 0.830029368575624 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 2.3053483963012695, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6197410225868225, + "step": 501, + "token_acc": 0.8072528564331843 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 2.062232494354248, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8683875799179077, + "step": 502, + "token_acc": 0.743580453783796 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.8906859755516052, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.9356937408447266, + "step": 503, + "token_acc": 0.7245146004492445 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 3.9231433868408203, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6747022867202759, + "step": 504, + "token_acc": 0.7981907419882591 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 2.7428345680236816, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7441482543945312, + "step": 505, + "token_acc": 0.7742395794217048 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 1.9277092218399048, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6530448198318481, + "step": 506, + "token_acc": 0.7975220638153429 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 1.6292767524719238, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6860779523849487, + "step": 507, + "token_acc": 0.7898953564421191 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 2.6792891025543213, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8034096956253052, + "step": 508, + "token_acc": 0.7567851055460862 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 2.100313425064087, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7841708064079285, + "step": 509, + "token_acc": 0.7575472165766123 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 2.4685211181640625, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8183025121688843, + "step": 510, + "token_acc": 0.7573227392094808 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 6.109943389892578, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.7484889030456543, + "step": 511, + "token_acc": 0.7755445227418322 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 1.9834048748016357, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8298561573028564, + "step": 512, + "token_acc": 0.7505842708842871 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 2.403406858444214, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.8005748987197876, + "step": 513, + "token_acc": 0.758890922109953 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 1.7540974617004395, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7584190368652344, + "step": 514, + "token_acc": 0.7752175818671342 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 3.21459698677063, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.8561462163925171, + "step": 515, + "token_acc": 0.7418676224239354 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.681273341178894, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7925042510032654, + "step": 516, + "token_acc": 0.7639773324764854 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 1.0431792736053467, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8750126361846924, + "step": 517, + "token_acc": 0.7400191632066433 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 4.3631911277771, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7869176864624023, + "step": 518, + "token_acc": 0.7620188403443235 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 1.3742365837097168, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8369603753089905, + "step": 519, + "token_acc": 0.7513550803193062 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 0.8509203791618347, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.86566162109375, + "step": 520, + "token_acc": 0.7443547816238408 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 1.0245444774627686, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8384143114089966, + "step": 521, + "token_acc": 0.748472884386174 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 1.5151759386062622, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7885670065879822, + "step": 522, + "token_acc": 0.7661560384752405 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 4.340545177459717, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7875890731811523, + "step": 523, + "token_acc": 0.764338076757223 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 1.4497512578964233, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8240665793418884, + "step": 524, + "token_acc": 0.7531088719587122 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 4.8524088859558105, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7155791521072388, + "step": 525, + "token_acc": 0.7859528907922912 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 1.4243345260620117, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8229907155036926, + "step": 526, + "token_acc": 0.7575123417042283 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.1557880640029907, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8167639374732971, + "step": 527, + "token_acc": 0.7524916943521595 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 2.145895004272461, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.7714104056358337, + "step": 528, + "token_acc": 0.7715271647540326 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 1.0105962753295898, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8628207445144653, + "step": 529, + "token_acc": 0.7388354186717998 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 1.6246225833892822, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8422914743423462, + "step": 530, + "token_acc": 0.7541976188053322 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 1.6991968154907227, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6368581056594849, + "step": 531, + "token_acc": 0.8030737554231929 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 1.9977556467056274, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9611953496932983, + "step": 532, + "token_acc": 0.7224977890567924 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 1.7200034856796265, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.779466450214386, + "step": 533, + "token_acc": 0.7697901384193404 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 2.9292917251586914, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.8787710070610046, + "step": 534, + "token_acc": 0.7420819370878824 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 1.74767005443573, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.7538915276527405, + "step": 535, + "token_acc": 0.7723708164122672 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 2.842759132385254, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8347668647766113, + "step": 536, + "token_acc": 0.7466009191880506 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 1.0351887941360474, + "learning_rate": 1.809595995707573e-05, + "loss": 0.813193678855896, + "step": 537, + "token_acc": 0.756039689387403 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 2.1326282024383545, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7035706043243408, + "step": 538, + "token_acc": 0.7871062158206886 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 1.6530029773712158, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6484057903289795, + "step": 539, + "token_acc": 0.8037213327563825 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 1.397707462310791, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8277699947357178, + "step": 540, + "token_acc": 0.7495398833065747 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 2.410323143005371, + "learning_rate": 1.762553672556591e-05, + "loss": 0.8146207332611084, + "step": 541, + "token_acc": 0.7571063829787235 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.910866379737854, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7210761904716492, + "step": 542, + "token_acc": 0.7774188701923077 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 11.782573699951172, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.6522407531738281, + "step": 543, + "token_acc": 0.8072419561153202 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 1.7913554906845093, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7852916121482849, + "step": 544, + "token_acc": 0.7610718065845914 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.8758189678192139, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7586523294448853, + "step": 545, + "token_acc": 0.7717872152178722 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 3.353968858718872, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6757744550704956, + "step": 546, + "token_acc": 0.793317610062893 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 1.8377400636672974, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8068370819091797, + "step": 547, + "token_acc": 0.7570990806945863 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 1.3780946731567383, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8233660459518433, + "step": 548, + "token_acc": 0.7505704506560182 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 5.142945766448975, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7289072871208191, + "step": 549, + "token_acc": 0.7812933869199854 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 1.773954153060913, + "learning_rate": 1.65777536651945e-05, + "loss": 0.7236466407775879, + "step": 550, + "token_acc": 0.7810041481905307 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 3.5997884273529053, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.8042117357254028, + "step": 551, + "token_acc": 0.7581943081452405 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 0.8696406483650208, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8300492167472839, + "step": 552, + "token_acc": 0.7506484670663776 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.5040565729141235, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.748427152633667, + "step": 553, + "token_acc": 0.7755393724903015 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 7.286196708679199, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.703101634979248, + "step": 554, + "token_acc": 0.7881292820971105 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.6359056234359741, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.8726459741592407, + "step": 555, + "token_acc": 0.7418959244573438 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 5.042118549346924, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7041570544242859, + "step": 556, + "token_acc": 0.7845845042151747 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 1.9065269231796265, + "learning_rate": 1.577407047339834e-05, + "loss": 0.8025046586990356, + "step": 557, + "token_acc": 0.7626718792127258 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 1.8250200748443604, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6778990030288696, + "step": 558, + "token_acc": 0.7909020418712845 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 2.2167229652404785, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8701958656311035, + "step": 559, + "token_acc": 0.7410597648595689 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 3.1135730743408203, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.8122137784957886, + "step": 560, + "token_acc": 0.7573019661325151 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 1.591567039489746, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.7499758005142212, + "step": 561, + "token_acc": 0.7801376009572241 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 2.626103401184082, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.7822006940841675, + "step": 562, + "token_acc": 0.7697957003605288 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 1.4338953495025635, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8059190511703491, + "step": 563, + "token_acc": 0.7583813140593736 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 2.3067641258239746, + "learning_rate": 1.498127917242148e-05, + "loss": 0.956562876701355, + "step": 564, + "token_acc": 0.7224202015557344 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 4.148603439331055, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7793439030647278, + "step": 565, + "token_acc": 0.7708575412502905 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 3.040891170501709, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8436172008514404, + "step": 566, + "token_acc": 0.7491851498529295 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 6.971378803253174, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7122055292129517, + "step": 567, + "token_acc": 0.7875359934183463 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 2.5589678287506104, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.7449221611022949, + "step": 568, + "token_acc": 0.7731634868045242 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 3.4065513610839844, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.8547236323356628, + "step": 569, + "token_acc": 0.7475447402880838 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 2.0447330474853516, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7997812628746033, + "step": 570, + "token_acc": 0.7587858644117503 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 19.273677825927734, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7676827907562256, + "step": 571, + "token_acc": 0.77000777000777 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 3.677581548690796, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7329694032669067, + "step": 572, + "token_acc": 0.7787445286644603 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 2.750782012939453, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6624218225479126, + "step": 573, + "token_acc": 0.7990237205400046 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.7288239002227783, + "learning_rate": 1.38694668528633e-05, + "loss": 0.7868748903274536, + "step": 574, + "token_acc": 0.7691857059168131 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 1.542420744895935, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8554753661155701, + "step": 575, + "token_acc": 0.7459746488523467 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 1.5799529552459717, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.8055590987205505, + "step": 576, + "token_acc": 0.7627781853753974 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 2.379765748977661, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8156087398529053, + "step": 577, + "token_acc": 0.7587134194568943 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 5.061030864715576, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6562641859054565, + "step": 578, + "token_acc": 0.8027216563700117 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 3.107051372528076, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.6440657377243042, + "step": 579, + "token_acc": 0.806850025947068 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.5127389430999756, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7621431350708008, + "step": 580, + "token_acc": 0.7777696579947384 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 3.7916858196258545, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7451849579811096, + "step": 581, + "token_acc": 0.7728736170461863 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 1.4253214597702026, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.9144057035446167, + "step": 582, + "token_acc": 0.7358452790902539 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 2.429523229598999, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6499612331390381, + "step": 583, + "token_acc": 0.8022828400077384 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 1.506866693496704, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8545807600021362, + "step": 584, + "token_acc": 0.7438212275161334 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 1.14063560962677, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7255370020866394, + "step": 585, + "token_acc": 0.7810890120639061 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 2.096499443054199, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7315889000892639, + "step": 586, + "token_acc": 0.7754388468674183 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 5.344691753387451, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8230787515640259, + "step": 587, + "token_acc": 0.7523631400697569 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 1.977255940437317, + "learning_rate": 1.235856566555039e-05, + "loss": 0.676746129989624, + "step": 588, + "token_acc": 0.7930442637759711 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.3346836566925049, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.7244657278060913, + "step": 589, + "token_acc": 0.7811462961921368 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 3.2221341133117676, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.6661178469657898, + "step": 590, + "token_acc": 0.7992459076696707 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 4.241289138793945, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.744454026222229, + "step": 591, + "token_acc": 0.7769393863806435 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 7.127607822418213, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.6379393339157104, + "step": 592, + "token_acc": 0.8044160942100098 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.677003264427185, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7646165490150452, + "step": 593, + "token_acc": 0.7687584863333137 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 1.2843506336212158, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8055639266967773, + "step": 594, + "token_acc": 0.7631550337029789 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.2286913394927979, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7198688983917236, + "step": 595, + "token_acc": 0.7768950480855386 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 4.122060298919678, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6652401685714722, + "step": 596, + "token_acc": 0.7982724491632176 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 3.4319710731506348, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8203213214874268, + "step": 597, + "token_acc": 0.7535128506463645 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 1.9524973630905151, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8763255476951599, + "step": 598, + "token_acc": 0.7429590926468714 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 2.4943723678588867, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.7097381949424744, + "step": 599, + "token_acc": 0.7815607985480943 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 21.619144439697266, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7615182399749756, + "step": 600, + "token_acc": 0.7687875878101784 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 1.6322247982025146, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7482010722160339, + "step": 601, + "token_acc": 0.7713472485768501 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 1.0364089012145996, + "learning_rate": 1.090734344462458e-05, + "loss": 0.8905367851257324, + "step": 602, + "token_acc": 0.7401884180917088 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 4.594523906707764, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.7736368179321289, + "step": 603, + "token_acc": 0.7722505668934241 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 1.897789478302002, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.744308590888977, + "step": 604, + "token_acc": 0.7725912143030499 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 3.5902726650238037, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.6907957196235657, + "step": 605, + "token_acc": 0.7894978216005504 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 1.7016520500183105, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.8940221071243286, + "step": 606, + "token_acc": 0.7394552473548756 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 1.5157966613769531, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.8362439870834351, + "step": 607, + "token_acc": 0.7472730147020077 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 2.323500871658325, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.786865234375, + "step": 608, + "token_acc": 0.764400989515844 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 74.33378601074219, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.7950047254562378, + "step": 609, + "token_acc": 0.7578022799476734 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 3.3788833618164062, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.6147444248199463, + "step": 610, + "token_acc": 0.815751960085531 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 2.66544771194458, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.6397148966789246, + "step": 611, + "token_acc": 0.7999815990431502 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 1.6965497732162476, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7612807750701904, + "step": 612, + "token_acc": 0.7722021881303098 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 2.2254910469055176, + "learning_rate": 9.813437667457229e-06, + "loss": 0.65788334608078, + "step": 613, + "token_acc": 0.8018885221855518 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 1.936301350593567, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8385921716690063, + "step": 614, + "token_acc": 0.7499523416153016 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 3.259331703186035, + "learning_rate": 9.619210235484333e-06, + "loss": 0.7441162467002869, + "step": 615, + "token_acc": 0.7762369996848408 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 3.5360541343688965, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7276872992515564, + "step": 616, + "token_acc": 0.7725686181183563 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.201682209968567, + "learning_rate": 9.426465236041651e-06, + "loss": 0.702145516872406, + "step": 617, + "token_acc": 0.7885718382563809 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 1.1223235130310059, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7966522574424744, + "step": 618, + "token_acc": 0.7599822756141992 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 2.9685420989990234, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8100804090499878, + "step": 619, + "token_acc": 0.756401384083045 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 2.115173578262329, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7754491567611694, + "step": 620, + "token_acc": 0.7694536716375716 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.030800700187683, + "learning_rate": 9.04549669873337e-06, + "loss": 0.815934419631958, + "step": 621, + "token_acc": 0.7545691906005222 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 9.539032936096191, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6096709966659546, + "step": 622, + "token_acc": 0.8140929535232384 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 3.739379644393921, + "learning_rate": 8.857309879408324e-06, + "loss": 0.6682818531990051, + "step": 623, + "token_acc": 0.8030173336186603 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 2.9171271324157715, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8189687728881836, + "step": 624, + "token_acc": 0.7579735300499023 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 3.653998613357544, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8347030878067017, + "step": 625, + "token_acc": 0.7483955025816725 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 3.2206311225891113, + "learning_rate": 8.577952526423969e-06, + "loss": 0.7974085807800293, + "step": 626, + "token_acc": 0.7626205161985747 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 1.857633352279663, + "learning_rate": 8.48562182685487e-06, + "loss": 0.6958124041557312, + "step": 627, + "token_acc": 0.7893594633697225 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 3.203127861022949, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6396089792251587, + "step": 628, + "token_acc": 0.8018999477078612 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 10.867119789123535, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6756541132926941, + "step": 629, + "token_acc": 0.7908339076498966 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 1.9048235416412354, + "learning_rate": 8.211026128824539e-06, + "loss": 0.7945992946624756, + "step": 630, + "token_acc": 0.7612518398016888 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 5.721317768096924, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8779458403587341, + "step": 631, + "token_acc": 0.7360282478996713 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 6.489996433258057, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6239632368087769, + "step": 632, + "token_acc": 0.8178224169248851 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 2.635003089904785, + "learning_rate": 7.940071245792579e-06, + "loss": 0.60353684425354, + "step": 633, + "token_acc": 0.8162691386313926 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 5.4421467781066895, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6887288689613342, + "step": 634, + "token_acc": 0.7906894415434994 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 1.4320110082626343, + "learning_rate": 7.761486381573327e-06, + "loss": 0.6909926533699036, + "step": 635, + "token_acc": 0.7896647808832221 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 1.9564619064331055, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7665590047836304, + "step": 636, + "token_acc": 0.7702360391479562 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 1.2858654260635376, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8104827404022217, + "step": 637, + "token_acc": 0.7559560606781112 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 8.487231254577637, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.5926421880722046, + "step": 638, + "token_acc": 0.8263585995520453 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 1.635348916053772, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9333232641220093, + "step": 639, + "token_acc": 0.7273431148619875 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 4.053239345550537, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.726628303527832, + "step": 640, + "token_acc": 0.7767200346170489 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 2.1414389610290527, + "learning_rate": 7.235768739040258e-06, + "loss": 0.796164870262146, + "step": 641, + "token_acc": 0.7624649111081406 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 1.8818213939666748, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8160055875778198, + "step": 642, + "token_acc": 0.7571467589220685 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 0.7274258136749268, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9394699335098267, + "step": 643, + "token_acc": 0.7232635060639471 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 2.1022329330444336, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.872856616973877, + "step": 644, + "token_acc": 0.739904441691736 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 2.117232084274292, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7678521871566772, + "step": 645, + "token_acc": 0.7683991041779288 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 2.113924980163574, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7138104438781738, + "step": 646, + "token_acc": 0.788220905071032 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 10.124676704406738, + "learning_rate": 6.725459488639211e-06, + "loss": 0.8729824423789978, + "step": 647, + "token_acc": 0.7402089353189598 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 2.0404815673828125, + "learning_rate": 6.641937264107867e-06, + "loss": 0.75057452917099, + "step": 648, + "token_acc": 0.7728152449009975 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 3.357954502105713, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6092256307601929, + "step": 649, + "token_acc": 0.8122177055103884 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 1.6319386959075928, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8065642714500427, + "step": 650, + "token_acc": 0.7608971431471051 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 4.5181050300598145, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8111133575439453, + "step": 651, + "token_acc": 0.7587757724431984 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 3.557448148727417, + "learning_rate": 6.312291828435077e-06, + "loss": 0.624323844909668, + "step": 652, + "token_acc": 0.8063609037137593 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 2.8433284759521484, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7201327681541443, + "step": 653, + "token_acc": 0.78446311592139 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 1.2021771669387817, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8491130471229553, + "step": 654, + "token_acc": 0.7483784720503045 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 1.2091090679168701, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8359229564666748, + "step": 655, + "token_acc": 0.7512554559534426 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 10.087580680847168, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7748186588287354, + "step": 656, + "token_acc": 0.7694327731092437 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 1.498608946800232, + "learning_rate": 5.910380944855087e-06, + "loss": 0.8846578598022461, + "step": 657, + "token_acc": 0.7394652877104192 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 3.2764029502868652, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.6131420135498047, + "step": 658, + "token_acc": 0.8132510900776349 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 2.0642950534820557, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8031247854232788, + "step": 659, + "token_acc": 0.7614583333333333 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 1.2550472021102905, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7710773944854736, + "step": 660, + "token_acc": 0.7694515633008714 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 2.364381790161133, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7222622632980347, + "step": 661, + "token_acc": 0.7859005769382755 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 3.985602617263794, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7197556495666504, + "step": 662, + "token_acc": 0.7872414478918058 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 3.4668893814086914, + "learning_rate": 5.443287214979592e-06, + "loss": 0.6038973331451416, + "step": 663, + "token_acc": 0.8172893919663428 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 16.531862258911133, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6388102173805237, + "step": 664, + "token_acc": 0.8046867617877729 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 3.9002861976623535, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6912767291069031, + "step": 665, + "token_acc": 0.7929694400282635 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.7196484804153442, + "learning_rate": 5.216076783983493e-06, + "loss": 0.6770153641700745, + "step": 666, + "token_acc": 0.7955169258920403 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 1.4810196161270142, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8496290445327759, + "step": 667, + "token_acc": 0.7496900770764836 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 2.02133846282959, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8104414939880371, + "step": 668, + "token_acc": 0.7553891414816796 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 1.4801369905471802, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8000129461288452, + "step": 669, + "token_acc": 0.7611111111111111 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 1.9785418510437012, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8052246570587158, + "step": 670, + "token_acc": 0.7555092592592593 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 2.4100208282470703, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8232534527778625, + "step": 671, + "token_acc": 0.7465227319908657 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 1.3945097923278809, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8596230149269104, + "step": 672, + "token_acc": 0.7454640797063451 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 1.8322561979293823, + "learning_rate": 4.702687000087386e-06, + "loss": 0.6880487203598022, + "step": 673, + "token_acc": 0.782898299577602 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 2.1570794582366943, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7599859237670898, + "step": 674, + "token_acc": 0.7674839001242797 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 1.9660370349884033, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7393922209739685, + "step": 675, + "token_acc": 0.774453781512605 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 2.8953030109405518, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8593490123748779, + "step": 676, + "token_acc": 0.7433499773036768 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 1.105050802230835, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7844275236129761, + "step": 677, + "token_acc": 0.7651860489769956 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 7.612730979919434, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7978190183639526, + "step": 678, + "token_acc": 0.7632656274602425 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 0.9666391611099243, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.8501102924346924, + "step": 679, + "token_acc": 0.748565553381314 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 1.675850749015808, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7121337652206421, + "step": 680, + "token_acc": 0.7868174092957955 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 2.0955216884613037, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7239298224449158, + "step": 681, + "token_acc": 0.785748031496063 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.5945849418640137, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7046365141868591, + "step": 682, + "token_acc": 0.7846875698220005 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 1.6976025104522705, + "learning_rate": 4.010984790046615e-06, + "loss": 0.6717643141746521, + "step": 683, + "token_acc": 0.797970126388357 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 4.0479817390441895, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8405852317810059, + "step": 684, + "token_acc": 0.7521482434091308 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 3.3728387355804443, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6040500998497009, + "step": 685, + "token_acc": 0.816435066049065 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 4.269870758056641, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8831207752227783, + "step": 686, + "token_acc": 0.7357807901973081 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 2.9320452213287354, + "learning_rate": 3.748372666094277e-06, + "loss": 0.836078405380249, + "step": 687, + "token_acc": 0.7496101275112375 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 1.5719010829925537, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7011086344718933, + "step": 688, + "token_acc": 0.7888382505796754 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 4.483651161193848, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.6982402801513672, + "step": 689, + "token_acc": 0.7868399225877799 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.8235728740692139, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7384521961212158, + "step": 690, + "token_acc": 0.7768055997454661 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 16.569927215576172, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6786566972732544, + "step": 691, + "token_acc": 0.7962027873156938 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 1.5950816869735718, + "learning_rate": 3.431640350555204e-06, + "loss": 0.614397406578064, + "step": 692, + "token_acc": 0.8129821260583255 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 3.7220969200134277, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6824333071708679, + "step": 693, + "token_acc": 0.7938019759755491 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 1.5605802536010742, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8088199496269226, + "step": 694, + "token_acc": 0.7540081128066448 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.3383564949035645, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7779883742332458, + "step": 695, + "token_acc": 0.7683611644746564 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 1.5642516613006592, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7946350574493408, + "step": 696, + "token_acc": 0.7605515385908862 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 5.639887809753418, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.7023658752441406, + "step": 697, + "token_acc": 0.7881643111000909 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.8614176511764526, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8359920978546143, + "step": 698, + "token_acc": 0.7491880857381461 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 1.091104507446289, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8066213726997375, + "step": 699, + "token_acc": 0.764406115248922 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 2.4092867374420166, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8912680149078369, + "step": 700, + "token_acc": 0.7388699378990641 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 1.5786374807357788, + "learning_rate": 2.894385171586095e-06, + "loss": 0.8282228708267212, + "step": 701, + "token_acc": 0.7533897033071496 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.185546875, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8325650691986084, + "step": 702, + "token_acc": 0.7513830678960604 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 1.3140076398849487, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6865131855010986, + "step": 703, + "token_acc": 0.7894226103833091 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 3.943152904510498, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8178889751434326, + "step": 704, + "token_acc": 0.7603732035234122 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.6355938911437988, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7702490091323853, + "step": 705, + "token_acc": 0.7734057835238274 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 2.672015428543091, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7363954782485962, + "step": 706, + "token_acc": 0.7820876695048881 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 7.5712971687316895, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7284834980964661, + "step": 707, + "token_acc": 0.7819572342750117 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.2005418539047241, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8815107941627502, + "step": 708, + "token_acc": 0.736231884057971 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 5.682093620300293, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8969010710716248, + "step": 709, + "token_acc": 0.7336805243781988 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 7.478425979614258, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.7172174453735352, + "step": 710, + "token_acc": 0.7849509958899779 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 2.170532464981079, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7401068210601807, + "step": 711, + "token_acc": 0.7747611561252872 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 2.000027894973755, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8865785598754883, + "step": 712, + "token_acc": 0.7429570006354586 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 4.488513469696045, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.727079451084137, + "step": 713, + "token_acc": 0.7792013666453128 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 1.3857240676879883, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9031280279159546, + "step": 714, + "token_acc": 0.7300395414786116 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 3.1287314891815186, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7487377524375916, + "step": 715, + "token_acc": 0.7762605042016807 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 2.1425862312316895, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7209734320640564, + "step": 716, + "token_acc": 0.7816404442387783 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 16.06658935546875, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.862382173538208, + "step": 717, + "token_acc": 0.7451660221362848 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 1.3662980794906616, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7773480415344238, + "step": 718, + "token_acc": 0.7637318504788384 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.702649712562561, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.7579219937324524, + "step": 719, + "token_acc": 0.7706616172867008 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 2.08888840675354, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.611611008644104, + "step": 720, + "token_acc": 0.8128733264675592 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 4.993098735809326, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6228418350219727, + "step": 721, + "token_acc": 0.8083577860973389 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 2.1354899406433105, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8729016184806824, + "step": 722, + "token_acc": 0.7406020743738932 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 3.6772496700286865, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.8268842101097107, + "step": 723, + "token_acc": 0.7497296692643275 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 3.9325311183929443, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7343685030937195, + "step": 724, + "token_acc": 0.779054583442152 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 2.1486709117889404, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7464021444320679, + "step": 725, + "token_acc": 0.7783094098883573 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 1.5982136726379395, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7898986339569092, + "step": 726, + "token_acc": 0.7636947873100072 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.437714695930481, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7892969846725464, + "step": 727, + "token_acc": 0.7685018312888785 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 2.1532280445098877, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7180025577545166, + "step": 728, + "token_acc": 0.7896799477465709 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 28.962617874145508, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.7974023818969727, + "step": 729, + "token_acc": 0.7565578306585501 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 1.5716774463653564, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.74139004945755, + "step": 730, + "token_acc": 0.7853475674354168 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 1.4642187356948853, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8600186109542847, + "step": 731, + "token_acc": 0.7451101593889355 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 2.9124562740325928, + "learning_rate": 1.379848838328049e-06, + "loss": 0.723196268081665, + "step": 732, + "token_acc": 0.7787250094304036 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 3.190188407897949, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7476466298103333, + "step": 733, + "token_acc": 0.7836584367753376 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 2.4274721145629883, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8297971487045288, + "step": 734, + "token_acc": 0.7539064626776284 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.4249184131622314, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8851167559623718, + "step": 735, + "token_acc": 0.7376152741090876 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 4.431985855102539, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8166061043739319, + "step": 736, + "token_acc": 0.7520669148576126 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.8808094263076782, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6322556734085083, + "step": 737, + "token_acc": 0.8104704097116844 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 3.052344560623169, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.6962700486183167, + "step": 738, + "token_acc": 0.7900085330850981 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 1.5944037437438965, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7271436452865601, + "step": 739, + "token_acc": 0.7764268828098615 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 3.147589921951294, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.7402669191360474, + "step": 740, + "token_acc": 0.7758406713551208 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 2.1467528343200684, + "learning_rate": 1.041156686749717e-06, + "loss": 0.8103016018867493, + "step": 741, + "token_acc": 0.7585889736514635 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.210806965827942, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.7230099439620972, + "step": 742, + "token_acc": 0.7845214164218339 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 5.582250118255615, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8122878074645996, + "step": 743, + "token_acc": 0.7586682862190812 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 3.027064561843872, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6951571702957153, + "step": 744, + "token_acc": 0.787929227544541 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 2.49889874458313, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8861063718795776, + "step": 745, + "token_acc": 0.7379547480579021 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 1.5029351711273193, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7544765472412109, + "step": 746, + "token_acc": 0.7708400386224654 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 2.52443528175354, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7223730683326721, + "step": 747, + "token_acc": 0.7796796590362274 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 1.232771396636963, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8961279392242432, + "step": 748, + "token_acc": 0.7351487826871055 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 10.959983825683594, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8091161251068115, + "step": 749, + "token_acc": 0.7547194375732327 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 1.7464208602905273, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7364180684089661, + "step": 750, + "token_acc": 0.7817872076815858 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 2.182349443435669, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7897827625274658, + "step": 751, + "token_acc": 0.7664438786335668 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 8.031073570251465, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6580134034156799, + "step": 752, + "token_acc": 0.7999625046869141 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 1.5658347606658936, + "learning_rate": 6.623969226072363e-07, + "loss": 0.9101489186286926, + "step": 753, + "token_acc": 0.7374909076987864 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 1.1753172874450684, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8875089883804321, + "step": 754, + "token_acc": 0.73394678138942 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.634332537651062, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7488188743591309, + "step": 755, + "token_acc": 0.7744497543245609 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 1.9908474683761597, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7645170092582703, + "step": 756, + "token_acc": 0.7715148835838491 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 6.012979984283447, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7867085933685303, + "step": 757, + "token_acc": 0.7629029926268613 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 2.5716400146484375, + "learning_rate": 5.294312162731934e-07, + "loss": 0.6976877450942993, + "step": 758, + "token_acc": 0.7884969325153375 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 2.4027717113494873, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7928605079650879, + "step": 759, + "token_acc": 0.7669667095299328 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 2.02215838432312, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7859390377998352, + "step": 760, + "token_acc": 0.758043137727437 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 6.254071235656738, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.7381837368011475, + "step": 761, + "token_acc": 0.7740069907848744 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 4.3257060050964355, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7426378726959229, + "step": 762, + "token_acc": 0.7737384009152155 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 2.265584707260132, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.7314226627349854, + "step": 763, + "token_acc": 0.7758732022307014 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 5.339004993438721, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.6290936470031738, + "step": 764, + "token_acc": 0.8064294703123213 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 9.275211334228516, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7639355659484863, + "step": 765, + "token_acc": 0.766955266955267 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 1.5419917106628418, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7539982795715332, + "step": 766, + "token_acc": 0.7762047019093389 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 1.023754596710205, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8236006498336792, + "step": 767, + "token_acc": 0.7516803938275112 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 3.612969160079956, + "learning_rate": 3.077914851215585e-07, + "loss": 0.7220295667648315, + "step": 768, + "token_acc": 0.7861885790172642 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 2.2448315620422363, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.8047812581062317, + "step": 769, + "token_acc": 0.7596339113680154 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 4.780596733093262, + "learning_rate": 2.705872508804747e-07, + "loss": 0.627181887626648, + "step": 770, + "token_acc": 0.8130530973451328 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 2.8713886737823486, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8144195079803467, + "step": 771, + "token_acc": 0.7571025930101466 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 3.7934675216674805, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6252330541610718, + "step": 772, + "token_acc": 0.8169552960128876 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 2.7746498584747314, + "learning_rate": 2.192509677903687e-07, + "loss": 0.8003941178321838, + "step": 773, + "token_acc": 0.7631566040512041 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 1.8860054016113281, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.8493106365203857, + "step": 774, + "token_acc": 0.7480242106480589 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 2.0492420196533203, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.7619702816009521, + "step": 775, + "token_acc": 0.7746059737683236 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 3.8298299312591553, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7479050159454346, + "step": 776, + "token_acc": 0.7769350722994046 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 2.153553009033203, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.779269814491272, + "step": 777, + "token_acc": 0.7659600242277408 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 2.5486974716186523, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6520084142684937, + "step": 778, + "token_acc": 0.801793896850931 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 1.529793620109558, + "learning_rate": 1.327100431795125e-07, + "loss": 0.6999301910400391, + "step": 779, + "token_acc": 0.7859088302752294 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 1.554592251777649, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.8654152154922485, + "step": 780, + "token_acc": 0.7451161517670807 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.120737365578744e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..dd4978bcc5aa41de8580cb034567754d4c1ffbb0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ac2064c380d0d9aed49e54d844332ebad8b9b0acd4873c3be8f3435db854dcfb +size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-780/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..f65fb5d2db9b498bbc045214fe000a3224312094 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(q_proj|up_proj|k_proj|gate_proj|o_proj|down_proj|v_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(qkv|up_proj|gate_proj|mlp.0|down_proj|mlp.2|attn.proj))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..5a8b20f2be52fbb0088baadb23abfa367b2ba355 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:46867c0899fa473824890908a4afb09dfcb567693c85715c549b45184101d00f +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/args.json new file mode 100644 index 0000000000000000000000000000000000000000..85d6df2103014714697ed4adb0484d581cd7c722 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..504c4b85af7b5d2cbf5ca87b0fdd36e7ac553a3c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:514944a7bc35a7f4c95702dd0304538ee5a5e697d93ea6b20c204c10cef50f0e +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..1832f08694fbe453d76347697ec3d7906910df49 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9c1d29e36bb2952b92bfb5dc43ec10852d41dd19628e99f77c257f672b8b906d +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..1387af5c82153874c9c7dc79b2786c129b892982 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3723b91b5702149a262bfadd2ff2a0b699e45eea8bffb9867395b86e225c1963 +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..1c55d1e375aa4219404c7cc9ad16966f257ca7a7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aa7b7277ca8396a0394e9fd1c5915be920903abf7d2a85afc286324ef721da64 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..7f551e2012eeaa43d1379ba33edb57fabef137c7 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:88d10e5effa0236a5993cbf009540d88037be4542f06333de1343afce0f4a66a +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..e0498967b2eb14140abbb47b8cd00c7cae586428 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6f4eaaa3df811ad6cd361655a08fd98bfc2eb489c5198274d8c8d3217add7bbf +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..4ca529dddf0b5a46674fa2a75284997846c18857 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d9fab88cbe8d9b98d94c162d019aa0d4e0a493689c67df7c4ced712edbafc5cc +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..50adf3d144ba6e66decfde650d742856601aac0c --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b99d043fb8149bb9e48f30ca826cf3c5be532a12993c81bf1dfaba93f44e7b77 +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..b376020f69d2b899566f7e5d365f8b7ddee629af --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/global_step790/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d9bd81eb046a509c3a47dceba1d8fe02b33c446dcea2e581f786b3f7efdb3650 +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/latest new file mode 100644 index 0000000000000000000000000000000000000000..4063e09c8e977daac7183734788b33f1e7c57532 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/latest @@ -0,0 +1 @@ +global_step790 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..1371d9eada8a7f90d8e2794f8a63f3f8714e53d4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e6e0b36d8f44455236308ddac9328ce682822720c88486bccc4d3623c6fbec5c +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..315fe01c7ecedc945fcd5f41b33941c54fed287e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:88cd2eb64019b94bf2b72619d20d3fedd231e7849d2d23a44128d7737a283639 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..35e57f678dc4544c98623f629f76ce4d64ecad61 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4dd64466dd3dc59b83f465643382249dcd464dc5e7c79ee5f4c1b09594d1ff9b +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..214f8681cb3a32ee27b32789e50a3702e33c2aa6 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8ad3ecec541c83d88a2e4331aa4763313c89ff1c16831ef503678737abe02fb6 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..83d64c0a6ebe94e5bf18bda9dec369cfe4804de0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4ab8e041fa1df229c452e894f74951272a45c4ffb65bfbbe7319a4cb7943a9ec +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..e36175ba366e918b33b6dccd0ed908b271f1bdc0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:de16e36f2c35956389eb6bdd2298d7e09883066d128d0531ec3916bcc6a70d2f +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..3418c764eae9b5f959ddaf3cf5818c3fb3e7837e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:861305f67fd2f98f1a657686a6da54b1d8d6147809b7aaa4be39ace853b9fe29 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..f8c5f9358c0b6287175d7f6803f8d5117e409eae --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd90a0ca15b2f96fb7e624caa6ed5deaf5b519eafca904c73c6b1cc811287afc +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..a9a2d9bb4e829f08f192e2dd4d91dc944579ace9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d41f6995235eb5427339d2fc8cc042254d91f00a2b7526717fd1bc7cec9e2ada +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..39c5c19c12d7038f2d0a76dd3d86425dc505dfd9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/trainer_state.json @@ -0,0 +1,6354 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.9762202753441802, + "eval_steps": 2000, + "global_step": 790, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 7.8950982093811035, + "learning_rate": 3.125e-07, + "loss": 1.4557902812957764, + "step": 1, + "token_acc": 0.6572501632919661 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 5.087953090667725, + "learning_rate": 6.25e-07, + "loss": 1.501842737197876, + "step": 2, + "token_acc": 0.6372176822598289 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 10.051658630371094, + "learning_rate": 9.375e-07, + "loss": 1.4857144355773926, + "step": 3, + "token_acc": 0.6451390326364452 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 2.0114636421203613, + "learning_rate": 1.25e-06, + "loss": 1.4438570737838745, + "step": 4, + "token_acc": 0.6557932163214628 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 1.340759038925171, + "learning_rate": 1.5625e-06, + "loss": 1.478323221206665, + "step": 5, + "token_acc": 0.6383258353131477 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 1.9858087301254272, + "learning_rate": 1.875e-06, + "loss": 1.467094898223877, + "step": 6, + "token_acc": 0.6425992779783394 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 4.05888032913208, + "learning_rate": 2.1875e-06, + "loss": 1.4478201866149902, + "step": 7, + "token_acc": 0.6590269733576039 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 1.7842193841934204, + "learning_rate": 2.5e-06, + "loss": 1.4324607849121094, + "step": 8, + "token_acc": 0.6515308296305313 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 1.832907795906067, + "learning_rate": 2.8125e-06, + "loss": 1.5404188632965088, + "step": 9, + "token_acc": 0.6198423322921315 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.766298770904541, + "learning_rate": 3.125e-06, + "loss": 1.5408222675323486, + "step": 10, + "token_acc": 0.6189591644081732 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 1.6790711879730225, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5104762315750122, + "step": 11, + "token_acc": 0.625929823288218 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 4.442141056060791, + "learning_rate": 3.75e-06, + "loss": 1.4653594493865967, + "step": 12, + "token_acc": 0.6531566141631451 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 1.7403733730316162, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4969990253448486, + "step": 13, + "token_acc": 0.6385409694999522 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 2.5656747817993164, + "learning_rate": 4.375e-06, + "loss": 1.4600821733474731, + "step": 14, + "token_acc": 0.6697823145984504 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 3.5080008506774902, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.4708112478256226, + "step": 15, + "token_acc": 0.672 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 3.7129623889923096, + "learning_rate": 5e-06, + "loss": 1.429203987121582, + "step": 16, + "token_acc": 0.6813838550247117 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 2.3268940448760986, + "learning_rate": 5.3125e-06, + "loss": 1.512415885925293, + "step": 17, + "token_acc": 0.6315401203041653 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 2.3350868225097656, + "learning_rate": 5.625e-06, + "loss": 1.451557993888855, + "step": 18, + "token_acc": 0.6523656776263032 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 2.7687199115753174, + "learning_rate": 5.9375e-06, + "loss": 1.4157341718673706, + "step": 19, + "token_acc": 0.6632555400132518 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 5.971182346343994, + "learning_rate": 6.25e-06, + "loss": 1.4978222846984863, + "step": 20, + "token_acc": 0.6449075630252101 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 13.349177360534668, + "learning_rate": 6.5625e-06, + "loss": 1.5118396282196045, + "step": 21, + "token_acc": 0.6337731455815501 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 2.401188611984253, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4671411514282227, + "step": 22, + "token_acc": 0.6508435329143235 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 3.039811849594116, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4463262557983398, + "step": 23, + "token_acc": 0.6521815519765739 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.9413557052612305, + "learning_rate": 7.5e-06, + "loss": 1.4922974109649658, + "step": 24, + "token_acc": 0.6576568432471525 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.3279271125793457, + "learning_rate": 7.8125e-06, + "loss": 1.4638800621032715, + "step": 25, + "token_acc": 0.6408039991668403 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 2.4672555923461914, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4635385274887085, + "step": 26, + "token_acc": 0.642543217111046 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 4.2855987548828125, + "learning_rate": 8.437500000000002e-06, + "loss": 1.4971613883972168, + "step": 27, + "token_acc": 0.643646613752689 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 4.303065299987793, + "learning_rate": 8.75e-06, + "loss": 1.4926515817642212, + "step": 28, + "token_acc": 0.6576081719186663 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 4.372646808624268, + "learning_rate": 9.0625e-06, + "loss": 1.4479061365127563, + "step": 29, + "token_acc": 0.6445522674865488 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 2.5289852619171143, + "learning_rate": 9.375000000000001e-06, + "loss": 1.410093069076538, + "step": 30, + "token_acc": 0.6521535141221733 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 1.4264651536941528, + "learning_rate": 9.6875e-06, + "loss": 1.425238847732544, + "step": 31, + "token_acc": 0.6520223888478192 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 2.838380813598633, + "learning_rate": 1e-05, + "loss": 1.4446736574172974, + "step": 32, + "token_acc": 0.6348325214304595 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 2.671543836593628, + "learning_rate": 1.03125e-05, + "loss": 1.4461638927459717, + "step": 33, + "token_acc": 0.6419955498301909 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 1.9914096593856812, + "learning_rate": 1.0625e-05, + "loss": 1.355449914932251, + "step": 34, + "token_acc": 0.670728126834997 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 5.0682525634765625, + "learning_rate": 1.09375e-05, + "loss": 1.3718912601470947, + "step": 35, + "token_acc": 0.6667121046892039 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 7.020368576049805, + "learning_rate": 1.125e-05, + "loss": 1.4107385873794556, + "step": 36, + "token_acc": 0.6550262102991058 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 1.664873719215393, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.4824004173278809, + "step": 37, + "token_acc": 0.6308479165622023 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 2.0821597576141357, + "learning_rate": 1.1875e-05, + "loss": 1.3098841905593872, + "step": 38, + "token_acc": 0.6657222884002447 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 1.4780006408691406, + "learning_rate": 1.21875e-05, + "loss": 1.41942298412323, + "step": 39, + "token_acc": 0.6341868972397738 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 8.251653671264648, + "learning_rate": 1.25e-05, + "loss": 1.334580898284912, + "step": 40, + "token_acc": 0.6723917672107877 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 2.3996059894561768, + "learning_rate": 1.28125e-05, + "loss": 1.3334863185882568, + "step": 41, + "token_acc": 0.6682704982863169 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 8.757278442382812, + "learning_rate": 1.3125e-05, + "loss": 1.3246387243270874, + "step": 42, + "token_acc": 0.6669556991959641 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 1.0424623489379883, + "learning_rate": 1.34375e-05, + "loss": 1.344756841659546, + "step": 43, + "token_acc": 0.6592281155670547 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 3.8542351722717285, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.3171751499176025, + "step": 44, + "token_acc": 0.6736935627170665 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 25.883697509765625, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.3416380882263184, + "step": 45, + "token_acc": 0.6597396665905458 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 2.754948139190674, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.2994325160980225, + "step": 46, + "token_acc": 0.6748487114979261 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 17.700273513793945, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.2871052026748657, + "step": 47, + "token_acc": 0.6900871459694989 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 2.1236982345581055, + "learning_rate": 1.5e-05, + "loss": 1.3259053230285645, + "step": 48, + "token_acc": 0.6648348053647367 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.8360397815704346, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3459126949310303, + "step": 49, + "token_acc": 0.6621909900865856 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 1.8516582250595093, + "learning_rate": 1.5625e-05, + "loss": 1.1977975368499756, + "step": 50, + "token_acc": 0.6965541315513888 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 2.6509554386138916, + "learning_rate": 1.59375e-05, + "loss": 1.337214708328247, + "step": 51, + "token_acc": 0.6660699367466285 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 1.3980388641357422, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3174633979797363, + "step": 52, + "token_acc": 0.6557162021165599 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 2.930096387863159, + "learning_rate": 1.65625e-05, + "loss": 1.3363032341003418, + "step": 53, + "token_acc": 0.6643487563519658 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 1.6149736642837524, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2738587856292725, + "step": 54, + "token_acc": 0.6713186201780416 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 1.9161509275436401, + "learning_rate": 1.71875e-05, + "loss": 1.3153185844421387, + "step": 55, + "token_acc": 0.6600835945663532 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 1.3378994464874268, + "learning_rate": 1.75e-05, + "loss": 1.328718662261963, + "step": 56, + "token_acc": 0.6626896519329231 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 2.1358327865600586, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2075698375701904, + "step": 57, + "token_acc": 0.6894359429289569 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 3.4085142612457275, + "learning_rate": 1.8125e-05, + "loss": 1.211951494216919, + "step": 58, + "token_acc": 0.6959001782531195 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 2.7778501510620117, + "learning_rate": 1.84375e-05, + "loss": 1.1932858228683472, + "step": 59, + "token_acc": 0.6946308724832215 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 2.009060859680176, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2468700408935547, + "step": 60, + "token_acc": 0.6771944009298095 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 5.27526330947876, + "learning_rate": 1.90625e-05, + "loss": 1.260186791419983, + "step": 61, + "token_acc": 0.6741093689401075 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 2.183293342590332, + "learning_rate": 1.9375e-05, + "loss": 1.2611782550811768, + "step": 62, + "token_acc": 0.670921220067096 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 1.8381351232528687, + "learning_rate": 1.96875e-05, + "loss": 1.212986707687378, + "step": 63, + "token_acc": 0.691640625 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 2.4578311443328857, + "learning_rate": 2e-05, + "loss": 1.240574598312378, + "step": 64, + "token_acc": 0.6715244487056568 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 3.24009108543396, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2548034191131592, + "step": 65, + "token_acc": 0.6654780476933363 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 4.743288993835449, + "learning_rate": 2.0625e-05, + "loss": 1.2446942329406738, + "step": 66, + "token_acc": 0.6764411159748959 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 2.8019979000091553, + "learning_rate": 2.09375e-05, + "loss": 1.18748140335083, + "step": 67, + "token_acc": 0.7129500268672757 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 2.299891471862793, + "learning_rate": 2.125e-05, + "loss": 1.2521979808807373, + "step": 68, + "token_acc": 0.675844505309692 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 12.295174598693848, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.203750491142273, + "step": 69, + "token_acc": 0.6892914653784219 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 1.9590011835098267, + "learning_rate": 2.1875e-05, + "loss": 1.1940397024154663, + "step": 70, + "token_acc": 0.6833531308331919 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 1.3522539138793945, + "learning_rate": 2.21875e-05, + "loss": 1.224703073501587, + "step": 71, + "token_acc": 0.6722795201010313 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 5.405593395233154, + "learning_rate": 2.25e-05, + "loss": 1.209501028060913, + "step": 72, + "token_acc": 0.6863064396743154 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 2.510359525680542, + "learning_rate": 2.28125e-05, + "loss": 1.0670784711837769, + "step": 73, + "token_acc": 0.7204571243313341 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 3.786830186843872, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.1720937490463257, + "step": 74, + "token_acc": 0.6966354109211252 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 7.54746675491333, + "learning_rate": 2.34375e-05, + "loss": 1.1647639274597168, + "step": 75, + "token_acc": 0.6920582186362917 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 3.6000797748565674, + "learning_rate": 2.375e-05, + "loss": 1.01552414894104, + "step": 76, + "token_acc": 0.7369100727870392 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 2.196979522705078, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1755733489990234, + "step": 77, + "token_acc": 0.689888875320552 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 2.5549845695495605, + "learning_rate": 2.4375e-05, + "loss": 1.196420431137085, + "step": 78, + "token_acc": 0.6777883196289268 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 2.397491455078125, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.2095775604248047, + "step": 79, + "token_acc": 0.6770092547491476 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 2.3734941482543945, + "learning_rate": 2.5e-05, + "loss": 1.215873122215271, + "step": 80, + "token_acc": 0.6735724510895499 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 6.307923316955566, + "learning_rate": 2.53125e-05, + "loss": 1.159612774848938, + "step": 81, + "token_acc": 0.6885863267670915 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 1.9825963973999023, + "learning_rate": 2.5625e-05, + "loss": 1.244891881942749, + "step": 82, + "token_acc": 0.6620401337792642 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 3.535176992416382, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.1396539211273193, + "step": 83, + "token_acc": 0.6885533874566776 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 1.6742156744003296, + "learning_rate": 2.625e-05, + "loss": 1.159801959991455, + "step": 84, + "token_acc": 0.6944472387083794 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 2.6573984622955322, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0350620746612549, + "step": 85, + "token_acc": 0.7238356649548433 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 8.295306205749512, + "learning_rate": 2.6875e-05, + "loss": 1.162409782409668, + "step": 86, + "token_acc": 0.6927952399430862 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.998918294906616, + "learning_rate": 2.71875e-05, + "loss": 1.0885825157165527, + "step": 87, + "token_acc": 0.7137596899224806 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 1.8655437231063843, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0828857421875, + "step": 88, + "token_acc": 0.7061748303433447 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 1.323335886001587, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1780362129211426, + "step": 89, + "token_acc": 0.6848311201719103 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 5.304930210113525, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.9686488509178162, + "step": 90, + "token_acc": 0.7363368421052632 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 9.773175239562988, + "learning_rate": 2.84375e-05, + "loss": 1.0577869415283203, + "step": 91, + "token_acc": 0.7114267269205939 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.9195711612701416, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.145928978919983, + "step": 92, + "token_acc": 0.6888570610140361 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 4.456406116485596, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0008058547973633, + "step": 93, + "token_acc": 0.7271467433146847 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 1.3492659330368042, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1630926132202148, + "step": 94, + "token_acc": 0.6865543948126801 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 33.28302001953125, + "learning_rate": 2.96875e-05, + "loss": 1.0794365406036377, + "step": 95, + "token_acc": 0.6955025569946949 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 4.188589572906494, + "learning_rate": 3e-05, + "loss": 0.981617271900177, + "step": 96, + "token_acc": 0.7421242124212422 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 4.019721031188965, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.1217559576034546, + "step": 97, + "token_acc": 0.6885376192158248 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 3.235391616821289, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1427521705627441, + "step": 98, + "token_acc": 0.6908890062917247 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 2.8775594234466553, + "learning_rate": 3.09375e-05, + "loss": 1.0406608581542969, + "step": 99, + "token_acc": 0.7161332040090527 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 3.2784032821655273, + "learning_rate": 3.125e-05, + "loss": 1.0470802783966064, + "step": 100, + "token_acc": 0.7107116506807968 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 10.006264686584473, + "learning_rate": 3.15625e-05, + "loss": 1.1033154726028442, + "step": 101, + "token_acc": 0.6993850520340587 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 3.128004789352417, + "learning_rate": 3.1875e-05, + "loss": 1.0931888818740845, + "step": 102, + "token_acc": 0.6994311184094775 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 1.6552213430404663, + "learning_rate": 3.21875e-05, + "loss": 1.0672286748886108, + "step": 103, + "token_acc": 0.7047883009372379 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 2.4581258296966553, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.0013254880905151, + "step": 104, + "token_acc": 0.7210549515133705 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 1.6132698059082031, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.057444453239441, + "step": 105, + "token_acc": 0.7100988496444881 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 1.5642213821411133, + "learning_rate": 3.3125e-05, + "loss": 1.123189926147461, + "step": 106, + "token_acc": 0.6890246836356637 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 2.402168035507202, + "learning_rate": 3.34375e-05, + "loss": 1.0398962497711182, + "step": 107, + "token_acc": 0.7146073548475131 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 6.666412830352783, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9815630316734314, + "step": 108, + "token_acc": 0.7229632010284429 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 2.724987030029297, + "learning_rate": 3.40625e-05, + "loss": 1.0755481719970703, + "step": 109, + "token_acc": 0.6945715806279936 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 2.264068841934204, + "learning_rate": 3.4375e-05, + "loss": 1.0846197605133057, + "step": 110, + "token_acc": 0.7066835081553078 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 2.5315089225769043, + "learning_rate": 3.46875e-05, + "loss": 0.964267373085022, + "step": 111, + "token_acc": 0.7342624854819977 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 15.30518627166748, + "learning_rate": 3.5e-05, + "loss": 0.9664145708084106, + "step": 112, + "token_acc": 0.7298946944798443 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 2.818232297897339, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0291664600372314, + "step": 113, + "token_acc": 0.7168817487490123 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 7.732123851776123, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.0101385116577148, + "step": 114, + "token_acc": 0.717198464186416 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 3.8363802433013916, + "learning_rate": 3.59375e-05, + "loss": 1.1273301839828491, + "step": 115, + "token_acc": 0.688773189101754 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 3.1989147663116455, + "learning_rate": 3.625e-05, + "loss": 1.044485092163086, + "step": 116, + "token_acc": 0.7092324805339266 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.878786087036133, + "learning_rate": 3.65625e-05, + "loss": 0.8934916257858276, + "step": 117, + "token_acc": 0.7590650284686844 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 2.4027316570281982, + "learning_rate": 3.6875e-05, + "loss": 1.0810887813568115, + "step": 118, + "token_acc": 0.700803104619199 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 2.034160852432251, + "learning_rate": 3.71875e-05, + "loss": 1.0755298137664795, + "step": 119, + "token_acc": 0.7013630188017707 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 4.220553874969482, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9945212602615356, + "step": 120, + "token_acc": 0.7199625446245684 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 2.564206600189209, + "learning_rate": 3.78125e-05, + "loss": 1.0152537822723389, + "step": 121, + "token_acc": 0.7179334916864608 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 1.7850531339645386, + "learning_rate": 3.8125e-05, + "loss": 0.9843083024024963, + "step": 122, + "token_acc": 0.7254917512690355 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 3.826921224594116, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0854582786560059, + "step": 123, + "token_acc": 0.6981124383382934 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 2.541259765625, + "learning_rate": 3.875e-05, + "loss": 1.029062032699585, + "step": 124, + "token_acc": 0.7140036666196588 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.901413917541504, + "learning_rate": 3.90625e-05, + "loss": 0.9238264560699463, + "step": 125, + "token_acc": 0.7398554752640356 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 3.516462564468384, + "learning_rate": 3.9375e-05, + "loss": 0.9085039496421814, + "step": 126, + "token_acc": 0.7436048965808358 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 19.986804962158203, + "learning_rate": 3.96875e-05, + "loss": 0.8704398274421692, + "step": 127, + "token_acc": 0.7592660550458715 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 2.4190216064453125, + "learning_rate": 4e-05, + "loss": 1.0086506605148315, + "step": 128, + "token_acc": 0.7155834613586267 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 10.030716896057129, + "learning_rate": 4.0312500000000004e-05, + "loss": 0.9949646592140198, + "step": 129, + "token_acc": 0.7203355704697987 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 12.682878494262695, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.9811956882476807, + "step": 130, + "token_acc": 0.7252892752288297 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 2.5325679779052734, + "learning_rate": 4.09375e-05, + "loss": 0.8768625259399414, + "step": 131, + "token_acc": 0.7590881616440722 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 3.471003532409668, + "learning_rate": 4.125e-05, + "loss": 0.976413905620575, + "step": 132, + "token_acc": 0.7229185085027823 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 2.5259780883789062, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0195640325546265, + "step": 133, + "token_acc": 0.7145907169392374 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 2.968695640563965, + "learning_rate": 4.1875e-05, + "loss": 0.9508498311042786, + "step": 134, + "token_acc": 0.7329253710346768 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 6.434828281402588, + "learning_rate": 4.21875e-05, + "loss": 0.877600371837616, + "step": 135, + "token_acc": 0.7561930872417507 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 2.5651018619537354, + "learning_rate": 4.25e-05, + "loss": 1.044579267501831, + "step": 136, + "token_acc": 0.7108454096075035 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 2.949556589126587, + "learning_rate": 4.28125e-05, + "loss": 1.0095362663269043, + "step": 137, + "token_acc": 0.716402739139739 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 5.174262046813965, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.8357698917388916, + "step": 138, + "token_acc": 0.7733576272902115 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 2.26728892326355, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.951337456703186, + "step": 139, + "token_acc": 0.7335539120280264 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 10.75383186340332, + "learning_rate": 4.375e-05, + "loss": 0.895291805267334, + "step": 140, + "token_acc": 0.7494621262704948 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 16.128704071044922, + "learning_rate": 4.40625e-05, + "loss": 0.8901827335357666, + "step": 141, + "token_acc": 0.7465124430424115 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 9.271828651428223, + "learning_rate": 4.4375e-05, + "loss": 1.0329668521881104, + "step": 142, + "token_acc": 0.7120498030388295 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 4.020982265472412, + "learning_rate": 4.46875e-05, + "loss": 0.8827842473983765, + "step": 143, + "token_acc": 0.7564152259865106 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 2.2052903175354004, + "learning_rate": 4.5e-05, + "loss": 0.9577807784080505, + "step": 144, + "token_acc": 0.7318331737418874 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.911048173904419, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9372326135635376, + "step": 145, + "token_acc": 0.7335442645325393 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 2.1569759845733643, + "learning_rate": 4.5625e-05, + "loss": 0.9250544309616089, + "step": 146, + "token_acc": 0.7350609269408822 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 90.4991455078125, + "learning_rate": 4.59375e-05, + "loss": 0.8544453382492065, + "step": 147, + "token_acc": 0.755140870837907 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 4.5008697509765625, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.9220091700553894, + "step": 148, + "token_acc": 0.7407507914970601 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 1.819976806640625, + "learning_rate": 4.65625e-05, + "loss": 1.0421748161315918, + "step": 149, + "token_acc": 0.7048270166100762 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 2.314004898071289, + "learning_rate": 4.6875e-05, + "loss": 0.9764658212661743, + "step": 150, + "token_acc": 0.7197187404463466 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 1.502142310142517, + "learning_rate": 4.71875e-05, + "loss": 1.020967721939087, + "step": 151, + "token_acc": 0.7136980898179974 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 2.8821356296539307, + "learning_rate": 4.75e-05, + "loss": 0.8627139925956726, + "step": 152, + "token_acc": 0.7503271575177354 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 5.202376365661621, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.0209362506866455, + "step": 153, + "token_acc": 0.7102290932393464 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 2.1695210933685303, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.8892765641212463, + "step": 154, + "token_acc": 0.746233887249573 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 1.2071388959884644, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9921320080757141, + "step": 155, + "token_acc": 0.7195179708467084 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 3.7766385078430176, + "learning_rate": 4.875e-05, + "loss": 0.8882246613502502, + "step": 156, + "token_acc": 0.7476656291685193 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 4.709662437438965, + "learning_rate": 4.90625e-05, + "loss": 0.9586931467056274, + "step": 157, + "token_acc": 0.7263681592039801 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 4.0463080406188965, + "learning_rate": 4.937500000000001e-05, + "loss": 0.8552154302597046, + "step": 158, + "token_acc": 0.7541220115416323 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 2.8410274982452393, + "learning_rate": 4.96875e-05, + "loss": 0.8899470567703247, + "step": 159, + "token_acc": 0.7499725304911549 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 2.9422967433929443, + "learning_rate": 5e-05, + "loss": 0.9451851844787598, + "step": 160, + "token_acc": 0.7286368400728196 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 3.18597412109375, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8761780858039856, + "step": 161, + "token_acc": 0.7598903251077164 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 1.9840060472488403, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.8826810121536255, + "step": 162, + "token_acc": 0.744661338923097 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 21.6531925201416, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8482328653335571, + "step": 163, + "token_acc": 0.7538179596823458 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 2.402557373046875, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.031351089477539, + "step": 164, + "token_acc": 0.7049064787205205 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 2.2513351440429688, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9314454793930054, + "step": 165, + "token_acc": 0.7308264872911727 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.2842321395874023, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9550535678863525, + "step": 166, + "token_acc": 0.7228157276475021 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 2.6976544857025146, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8689353466033936, + "step": 167, + "token_acc": 0.7488272087568413 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.9013776779174805, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.9480851888656616, + "step": 168, + "token_acc": 0.7256708860759493 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 2.0147554874420166, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.792317807674408, + "step": 169, + "token_acc": 0.77470701416827 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 5.95169734954834, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8363028168678284, + "step": 170, + "token_acc": 0.7643083597530452 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 3.004988670349121, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8463314175605774, + "step": 171, + "token_acc": 0.7617599713825791 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 6.122714996337891, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8169602751731873, + "step": 172, + "token_acc": 0.7588180032453669 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 2.14045786857605, + "learning_rate": 4.994911507566217e-05, + "loss": 1.0029940605163574, + "step": 173, + "token_acc": 0.712219074598678 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 1.9638121128082275, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9134575128555298, + "step": 174, + "token_acc": 0.7453976298725498 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 6.963588237762451, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8294797539710999, + "step": 175, + "token_acc": 0.7652689152233364 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 2.013535261154175, + "learning_rate": 4.99229333433282e-05, + "loss": 0.9168058037757874, + "step": 176, + "token_acc": 0.7364463791056589 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 1.502765417098999, + "learning_rate": 4.991300473502437e-05, + "loss": 0.862735390663147, + "step": 177, + "token_acc": 0.7555572888230248 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 2.0426056385040283, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.006132960319519, + "step": 178, + "token_acc": 0.711357628807904 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 2.3713955879211426, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8480299711227417, + "step": 179, + "token_acc": 0.7630771926750197 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.9472578763961792, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9099956750869751, + "step": 180, + "token_acc": 0.744568097509274 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 5.378758907318115, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8087277412414551, + "step": 181, + "token_acc": 0.7657945736434109 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 1.7415252923965454, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9494457244873047, + "step": 182, + "token_acc": 0.7285589688923345 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 3.286355495452881, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9584786295890808, + "step": 183, + "token_acc": 0.729500568710578 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.2414660453796387, + "learning_rate": 4.982671142387316e-05, + "loss": 0.9425086975097656, + "step": 184, + "token_acc": 0.7302265729123582 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 2.1618587970733643, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8545800447463989, + "step": 185, + "token_acc": 0.7508434073657576 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 2.7464194297790527, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0033760070800781, + "step": 186, + "token_acc": 0.7168112389213652 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 2.1117477416992188, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8726233839988708, + "step": 187, + "token_acc": 0.7512896094325718 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 2.3225831985473633, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9832717776298523, + "step": 188, + "token_acc": 0.7242706131078224 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 1.5692338943481445, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8374819755554199, + "step": 189, + "token_acc": 0.7515348246418743 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 2.915736436843872, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8508638143539429, + "step": 190, + "token_acc": 0.7552318044323724 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 2.509810209274292, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8711614608764648, + "step": 191, + "token_acc": 0.748834597023308 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 38.909141540527344, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8127565383911133, + "step": 192, + "token_acc": 0.7634650994283874 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 2.6864702701568604, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.8236993551254272, + "step": 193, + "token_acc": 0.7607028125614633 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 1.8782848119735718, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9363845586776733, + "step": 194, + "token_acc": 0.7292962883501395 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 15.927218437194824, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7871609926223755, + "step": 195, + "token_acc": 0.7660380466112163 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 5.428698539733887, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8945263028144836, + "step": 196, + "token_acc": 0.733186463496726 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 4.436823844909668, + "learning_rate": 4.958879433443904e-05, + "loss": 0.8039653897285461, + "step": 197, + "token_acc": 0.767208630907157 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 1.1804406642913818, + "learning_rate": 4.95663319832678e-05, + "loss": 0.993769109249115, + "step": 198, + "token_acc": 0.7182901803257216 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 34.3048095703125, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8885359764099121, + "step": 199, + "token_acc": 0.7376394368941498 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 3.2417330741882324, + "learning_rate": 4.951963201008076e-05, + "loss": 0.8299421072006226, + "step": 200, + "token_acc": 0.7590844540974021 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 1.7213491201400757, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8799647092819214, + "step": 201, + "token_acc": 0.7460959726876146 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 3.129983901977539, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7674298286437988, + "step": 202, + "token_acc": 0.7778585271317829 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 1.7732640504837036, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8905498385429382, + "step": 203, + "token_acc": 0.7450012817226352 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.5776193141937256, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9746031761169434, + "step": 204, + "token_acc": 0.7222505091649695 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 2.398367166519165, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8019765019416809, + "step": 205, + "token_acc": 0.7681595784719608 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 2.5589308738708496, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9508465528488159, + "step": 206, + "token_acc": 0.7260439407311069 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 30.68482780456543, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8822273015975952, + "step": 207, + "token_acc": 0.7461445679331438 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 1.6417980194091797, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.7858006954193115, + "step": 208, + "token_acc": 0.7672451193058568 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 1.7159936428070068, + "learning_rate": 4.92803071949828e-05, + "loss": 0.9309002757072449, + "step": 209, + "token_acc": 0.7286675639300134 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 2.5000967979431152, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9468393921852112, + "step": 210, + "token_acc": 0.7337789370720574 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 4.127990245819092, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9223999977111816, + "step": 211, + "token_acc": 0.7299156498239292 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.085132598876953, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.9442908763885498, + "step": 212, + "token_acc": 0.728492959925731 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.8777406215667725, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8923409581184387, + "step": 213, + "token_acc": 0.7408707865168539 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 1.6103774309158325, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8582785725593567, + "step": 214, + "token_acc": 0.7472986748216106 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 5.4966020584106445, + "learning_rate": 4.9094401644886e-05, + "loss": 0.980675220489502, + "step": 215, + "token_acc": 0.7182641448950152 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 2.9030697345733643, + "learning_rate": 4.906138091134118e-05, + "loss": 0.9365415573120117, + "step": 216, + "token_acc": 0.730092204526404 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 4.844046115875244, + "learning_rate": 4.90277804028108e-05, + "loss": 0.738396942615509, + "step": 217, + "token_acc": 0.7914989692745656 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 1.5353028774261475, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9523649215698242, + "step": 218, + "token_acc": 0.7237939963556153 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 32.93247604370117, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7531812787055969, + "step": 219, + "token_acc": 0.7850740452065471 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 2.059149742126465, + "learning_rate": 4.892350839330522e-05, + "loss": 0.8953914642333984, + "step": 220, + "token_acc": 0.7396288209606987 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 3.8497390747070312, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8436079025268555, + "step": 221, + "token_acc": 0.7543846828412745 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 1.9176925420761108, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8814166188240051, + "step": 222, + "token_acc": 0.7467446887026201 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 1.9749252796173096, + "learning_rate": 4.881404839143988e-05, + "loss": 0.8513644337654114, + "step": 223, + "token_acc": 0.7457374830852503 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 4.914273262023926, + "learning_rate": 4.877641290737884e-05, + "loss": 0.8055661916732788, + "step": 224, + "token_acc": 0.7624061257546753 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 31.535110473632812, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8872958421707153, + "step": 225, + "token_acc": 0.7492080569003646 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 2.174323320388794, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8905588388442993, + "step": 226, + "token_acc": 0.7426990645676478 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 2.537534713745117, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8442504405975342, + "step": 227, + "token_acc": 0.759594451701188 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 2.5602848529815674, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8962931632995605, + "step": 228, + "token_acc": 0.7412289395441031 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 7.3618927001953125, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8395902514457703, + "step": 229, + "token_acc": 0.7582629846902275 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 3.7751402854919434, + "learning_rate": 4.853860162957552e-05, + "loss": 0.8951698541641235, + "step": 230, + "token_acc": 0.7401862711279752 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 1.730199933052063, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6874003410339355, + "step": 231, + "token_acc": 0.7996880161497523 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 1.931376576423645, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.8303564190864563, + "step": 232, + "token_acc": 0.7600831909678378 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 2.0311784744262695, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8384573459625244, + "step": 233, + "token_acc": 0.7549541998443393 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.0220412015914917, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8069633841514587, + "step": 234, + "token_acc": 0.7599480377410092 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 3.729283571243286, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8110902309417725, + "step": 235, + "token_acc": 0.7580623121071332 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 1.758043646812439, + "learning_rate": 4.828037336897009e-05, + "loss": 0.856610894203186, + "step": 236, + "token_acc": 0.746238951003922 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 4.306615829467773, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9790533781051636, + "step": 237, + "token_acc": 0.7135992011483493 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.5020512342453003, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.7993966937065125, + "step": 238, + "token_acc": 0.7609775641025641 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 1.6187368631362915, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8823633193969727, + "step": 239, + "token_acc": 0.7474736257634648 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 2.4625823497772217, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8518728017807007, + "step": 240, + "token_acc": 0.748145340336817 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 5.807409286499023, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.6972458362579346, + "step": 241, + "token_acc": 0.7948159442387279 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 2.591768503189087, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.9044586420059204, + "step": 242, + "token_acc": 0.7324852097326632 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 2.5517194271087646, + "learning_rate": 4.79536020593051e-05, + "loss": 0.9304581880569458, + "step": 243, + "token_acc": 0.727802037845706 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 2.617535352706909, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.8499206304550171, + "step": 244, + "token_acc": 0.7519966664351692 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.3205288648605347, + "learning_rate": 4.785524389258827e-05, + "loss": 0.9406691789627075, + "step": 245, + "token_acc": 0.7282037303843308 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 1.9039998054504395, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8956192135810852, + "step": 246, + "token_acc": 0.7330732381846017 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.1243889331817627, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.7765395641326904, + "step": 247, + "token_acc": 0.7724535218643624 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 1.0170472860336304, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.8932359218597412, + "step": 248, + "token_acc": 0.7361666956673046 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 1.2093161344528198, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9077604413032532, + "step": 249, + "token_acc": 0.734278362150693 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 6.2834248542785645, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7469887733459473, + "step": 250, + "token_acc": 0.7800094891665349 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 3.575439453125, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.8440943360328674, + "step": 251, + "token_acc": 0.7537353459505018 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 2.0179975032806396, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8843530416488647, + "step": 252, + "token_acc": 0.7379267277268943 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 1.3368704319000244, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.8424524068832397, + "step": 253, + "token_acc": 0.7527279941802791 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 7.156957149505615, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7525070905685425, + "step": 254, + "token_acc": 0.7739664347114203 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 7.08997106552124, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.720240592956543, + "step": 255, + "token_acc": 0.7869349503858876 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 2.1491920948028564, + "learning_rate": 4.72751631047092e-05, + "loss": 0.822435736656189, + "step": 256, + "token_acc": 0.7558427895092809 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 4.267916679382324, + "learning_rate": 4.721918194465169e-05, + "loss": 0.7940695285797119, + "step": 257, + "token_acc": 0.7643436685018835 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 3.5891292095184326, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7873713374137878, + "step": 258, + "token_acc": 0.7648121955052648 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 2.214632749557495, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8356124758720398, + "step": 259, + "token_acc": 0.7503839773914112 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 2.8201630115509033, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.8771319389343262, + "step": 260, + "token_acc": 0.7445221131872564 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 1.4439845085144043, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9190523624420166, + "step": 261, + "token_acc": 0.7323772975156534 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 4.227046489715576, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7340889573097229, + "step": 262, + "token_acc": 0.7861572132044501 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 1.6055476665496826, + "learning_rate": 4.687209999162396e-05, + "loss": 0.905823826789856, + "step": 263, + "token_acc": 0.7359950479727638 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 7.083006858825684, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9699968099594116, + "step": 264, + "token_acc": 0.7199773578333188 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 2.4387781620025635, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8051294684410095, + "step": 265, + "token_acc": 0.7680182752712735 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 1.6597864627838135, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.8352447748184204, + "step": 266, + "token_acc": 0.7523210168857872 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 3.9788217544555664, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.952012300491333, + "step": 267, + "token_acc": 0.7299187373027035 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 2.355642080307007, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8457879424095154, + "step": 268, + "token_acc": 0.7541639391955779 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 5.1823248863220215, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8699308037757874, + "step": 269, + "token_acc": 0.7468877351644058 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 4.252589702606201, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8364484906196594, + "step": 270, + "token_acc": 0.7554215137153526 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 1.3415782451629639, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8568819165229797, + "step": 271, + "token_acc": 0.7485356078511972 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 1.7074843645095825, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8769652843475342, + "step": 272, + "token_acc": 0.7422730723348877 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 4.651581287384033, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.8192580938339233, + "step": 273, + "token_acc": 0.7577268895757235 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 4.706144332885742, + "learning_rate": 4.618673848685586e-05, + "loss": 0.7910339832305908, + "step": 274, + "token_acc": 0.7648066904304908 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 2.0272216796875, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8216524720191956, + "step": 275, + "token_acc": 0.7571758072783188 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 1.8787137269973755, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8251311779022217, + "step": 276, + "token_acc": 0.7546209639681797 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 1.8774858713150024, + "learning_rate": 4.59890152099534e-05, + "loss": 0.9141278266906738, + "step": 277, + "token_acc": 0.732027338182084 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 3.588717460632324, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8628591299057007, + "step": 278, + "token_acc": 0.7456560481176209 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 2.5552499294281006, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8396396040916443, + "step": 279, + "token_acc": 0.7532559149120903 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 2.4589977264404297, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7853731513023376, + "step": 280, + "token_acc": 0.7682845427672357 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 2.5455079078674316, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9314486980438232, + "step": 281, + "token_acc": 0.7245133049187882 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 2.683380365371704, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8583184480667114, + "step": 282, + "token_acc": 0.7450482731163531 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.3633437156677246, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8894494771957397, + "step": 283, + "token_acc": 0.739060801921867 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 4.674302101135254, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7389158606529236, + "step": 284, + "token_acc": 0.7801253772927792 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 2.4775431156158447, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.7430102825164795, + "step": 285, + "token_acc": 0.7866531850353893 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 2.010530471801758, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7329319715499878, + "step": 286, + "token_acc": 0.7800226159065209 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 3.449420213699341, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9150421619415283, + "step": 287, + "token_acc": 0.7355081881985963 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 1.9925580024719238, + "learning_rate": 4.522542485937369e-05, + "loss": 0.8455727100372314, + "step": 288, + "token_acc": 0.7526455026455027 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 1.939789891242981, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9501767158508301, + "step": 289, + "token_acc": 0.7274806559929924 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 1.328555941581726, + "learning_rate": 4.508018828701612e-05, + "loss": 0.828056275844574, + "step": 290, + "token_acc": 0.7555241836484164 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 2.5277862548828125, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8774980902671814, + "step": 291, + "token_acc": 0.7489495798319328 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 1.7016732692718506, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9148298501968384, + "step": 292, + "token_acc": 0.735104948969767 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 4.40346097946167, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8074817061424255, + "step": 293, + "token_acc": 0.7590221897098268 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 5.940386772155762, + "learning_rate": 4.478392321601651e-05, + "loss": 0.8893970251083374, + "step": 294, + "token_acc": 0.7431922534891121 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 4.992410182952881, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7381858825683594, + "step": 295, + "token_acc": 0.7853381258881551 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 5.966536998748779, + "learning_rate": 4.463292327201862e-05, + "loss": 0.838369607925415, + "step": 296, + "token_acc": 0.754148620370821 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 1.494193434715271, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8503720760345459, + "step": 297, + "token_acc": 0.7541888163649821 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 4.080326080322266, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7552746534347534, + "step": 298, + "token_acc": 0.7728544776119403 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.7464518547058105, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8308608531951904, + "step": 299, + "token_acc": 0.7577373937852757 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 2.6353917121887207, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.8492376208305359, + "step": 300, + "token_acc": 0.7513898676689375 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 5.348440647125244, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9122411608695984, + "step": 301, + "token_acc": 0.7296964163433006 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 3.4473955631256104, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8476892113685608, + "step": 302, + "token_acc": 0.7541979056942809 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.6045217514038086, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8833868503570557, + "step": 303, + "token_acc": 0.7396542108198549 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 2.6573829650878906, + "learning_rate": 4.401014914000078e-05, + "loss": 0.7998722195625305, + "step": 304, + "token_acc": 0.7661461586508432 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 2.9124984741210938, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8530205488204956, + "step": 305, + "token_acc": 0.7466014447414823 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 13.436267852783203, + "learning_rate": 4.384983704904674e-05, + "loss": 0.806631863117218, + "step": 306, + "token_acc": 0.7660835876966424 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 4.7447686195373535, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8307251334190369, + "step": 307, + "token_acc": 0.7573671342169604 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.38670015335083, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7642802000045776, + "step": 308, + "token_acc": 0.7765166340508807 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 1.7410259246826172, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8567044138908386, + "step": 309, + "token_acc": 0.7521028037383177 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 4.307875156402588, + "learning_rate": 4.352377813387398e-05, + "loss": 0.9223236441612244, + "step": 310, + "token_acc": 0.7292516473172262 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 3.766094207763672, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.685102641582489, + "step": 311, + "token_acc": 0.7947743004777226 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 1.5777055025100708, + "learning_rate": 4.335806273589214e-05, + "loss": 0.7940619587898254, + "step": 312, + "token_acc": 0.7673673517230601 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 4.047732353210449, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7358657121658325, + "step": 313, + "token_acc": 0.782784 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 1.3510150909423828, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8665168881416321, + "step": 314, + "token_acc": 0.7442531173127491 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 2.992387056350708, + "learning_rate": 4.310617707378668e-05, + "loss": 0.7996443510055542, + "step": 315, + "token_acc": 0.7625912988250239 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 1.5894449949264526, + "learning_rate": 4.302133991757297e-05, + "loss": 0.8834421038627625, + "step": 316, + "token_acc": 0.7416610344690494 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 3.1843483448028564, + "learning_rate": 4.2936068525181e-05, + "loss": 0.842120885848999, + "step": 317, + "token_acc": 0.7479250534267681 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 1.8540269136428833, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9776566028594971, + "step": 318, + "token_acc": 0.7195618838992333 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 2.9334137439727783, + "learning_rate": 4.276423126095974e-05, + "loss": 0.8031361103057861, + "step": 319, + "token_acc": 0.7604228218764362 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 1.6915321350097656, + "learning_rate": 4.267766952966369e-05, + "loss": 0.9410305023193359, + "step": 320, + "token_acc": 0.7282994213179018 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 5.01201057434082, + "learning_rate": 4.259068184315608e-05, + "loss": 0.9005149602890015, + "step": 321, + "token_acc": 0.7376341577228185 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 1.6810280084609985, + "learning_rate": 4.250327029746309e-05, + "loss": 0.7451943755149841, + "step": 322, + "token_acc": 0.781010719754977 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 5.86810827255249, + "learning_rate": 4.24154369988241e-05, + "loss": 0.740115761756897, + "step": 323, + "token_acc": 0.7834601819194357 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.2761876583099365, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9164939522743225, + "step": 324, + "token_acc": 0.7285148767718044 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 2.3560471534729004, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7663041353225708, + "step": 325, + "token_acc": 0.7738841185116423 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 3.6525771617889404, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6357040405273438, + "step": 326, + "token_acc": 0.8093354430379747 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 1.9545413255691528, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9620451927185059, + "step": 327, + "token_acc": 0.7203116924422535 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 2.913717269897461, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8111364841461182, + "step": 328, + "token_acc": 0.75743935983996 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 1.9858478307724, + "learning_rate": 4.187969961854726e-05, + "loss": 0.9955106973648071, + "step": 329, + "token_acc": 0.7128412537917088 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 6.050736904144287, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7481118440628052, + "step": 330, + "token_acc": 0.7825464949928469 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 1.8267136812210083, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6872880458831787, + "step": 331, + "token_acc": 0.7973193262090201 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 2.2636425495147705, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.7994587421417236, + "step": 332, + "token_acc": 0.7658987358018353 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 3.7548258304595947, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7354224920272827, + "step": 333, + "token_acc": 0.7824889408229697 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 2.3976776599884033, + "learning_rate": 4.142204747357604e-05, + "loss": 0.8958951830863953, + "step": 334, + "token_acc": 0.7402859448864292 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 1.5932167768478394, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8891469240188599, + "step": 335, + "token_acc": 0.7463272467733302 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 1.8860996961593628, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7546243667602539, + "step": 336, + "token_acc": 0.7755037783375315 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 3.2070868015289307, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8346970081329346, + "step": 337, + "token_acc": 0.7553981106612686 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.9174991846084595, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8280372619628906, + "step": 338, + "token_acc": 0.7614895430407133 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 7.967592716217041, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6412019729614258, + "step": 339, + "token_acc": 0.8135894699395233 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 1.8168036937713623, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7411476373672485, + "step": 340, + "token_acc": 0.7818817070127277 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 5.3374481201171875, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8266500234603882, + "step": 341, + "token_acc": 0.7557682359027419 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 6.361590385437012, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7055239677429199, + "step": 342, + "token_acc": 0.7837323608688759 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 4.529880046844482, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8333171606063843, + "step": 343, + "token_acc": 0.7545928944170419 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 7.685861587524414, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8767172694206238, + "step": 344, + "token_acc": 0.7442405662503945 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 3.9726321697235107, + "learning_rate": 4.038078976451567e-05, + "loss": 0.8583240509033203, + "step": 345, + "token_acc": 0.7489155540532928 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.581453800201416, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7588601112365723, + "step": 346, + "token_acc": 0.7785956964892412 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 3.0492961406707764, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8237013816833496, + "step": 347, + "token_acc": 0.7580033277870216 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 1.490657091140747, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7148709297180176, + "step": 348, + "token_acc": 0.7866251062623972 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 2.604755401611328, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8905333280563354, + "step": 349, + "token_acc": 0.7405912450255827 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 9.451438903808594, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9194896817207336, + "step": 350, + "token_acc": 0.7317846328538986 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.6283177137374878, + "learning_rate": 3.979373519225858e-05, + "loss": 0.9222493171691895, + "step": 351, + "token_acc": 0.7324363188167625 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 1.01435124874115, + "learning_rate": 3.969463130731183e-05, + "loss": 0.8873315453529358, + "step": 352, + "token_acc": 0.7386921685189971 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.6070590019226074, + "learning_rate": 3.959517334544466e-05, + "loss": 0.8865751028060913, + "step": 353, + "token_acc": 0.7350283279486819 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 2.5121443271636963, + "learning_rate": 3.949536370316285e-05, + "loss": 0.8619804382324219, + "step": 354, + "token_acc": 0.7479302448476308 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 1.3835835456848145, + "learning_rate": 3.939520478544614e-05, + "loss": 0.9314793348312378, + "step": 355, + "token_acc": 0.7263123142951469 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 2.486131191253662, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.8991205096244812, + "step": 356, + "token_acc": 0.7395881270133456 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 2.7008180618286133, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8544954061508179, + "step": 357, + "token_acc": 0.7505512359289777 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 2.08654522895813, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7513941526412964, + "step": 358, + "token_acc": 0.7819888236136983 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 1.9756476879119873, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7608502507209778, + "step": 359, + "token_acc": 0.772964191430312 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.3755425214767456, + "learning_rate": 3.888925582549006e-05, + "loss": 0.8417959213256836, + "step": 360, + "token_acc": 0.7520785670442498 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 2.1407554149627686, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8518916368484497, + "step": 361, + "token_acc": 0.7552394806314315 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 4.228549003601074, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8237797021865845, + "step": 362, + "token_acc": 0.7532420091324201 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 2.090517044067383, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7693901062011719, + "step": 363, + "token_acc": 0.7751344989912575 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 2.4747915267944336, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6950187683105469, + "step": 364, + "token_acc": 0.7874652915509719 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 1.813559651374817, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8348764181137085, + "step": 365, + "token_acc": 0.7503848566052796 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.9585214853286743, + "learning_rate": 3.827110064348773e-05, + "loss": 0.809190571308136, + "step": 366, + "token_acc": 0.7566013071895424 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.5872814655303955, + "learning_rate": 3.816694101379631e-05, + "loss": 0.8659224510192871, + "step": 367, + "token_acc": 0.7458495340369068 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 3.7991831302642822, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.6858774423599243, + "step": 368, + "token_acc": 0.7921834567680913 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 11.759095191955566, + "learning_rate": 3.795767247323533e-05, + "loss": 0.9242225289344788, + "step": 369, + "token_acc": 0.7271716902285054 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 5.795279502868652, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7550444006919861, + "step": 370, + "token_acc": 0.7739854877721043 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 2.1931843757629395, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8427231311798096, + "step": 371, + "token_acc": 0.7499619926012264 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 1.1604092121124268, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9125556945800781, + "step": 372, + "token_acc": 0.7275495750708215 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 8.955742835998535, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8157449960708618, + "step": 373, + "token_acc": 0.7604572450348043 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 6.911311626434326, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9126226902008057, + "step": 374, + "token_acc": 0.731775132504996 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 1.0974699258804321, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.8590577244758606, + "step": 375, + "token_acc": 0.7466798810703666 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 17.13771629333496, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8356927037239075, + "step": 376, + "token_acc": 0.7555617044825678 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 1.2535425424575806, + "learning_rate": 3.710831292775353e-05, + "loss": 0.7597782611846924, + "step": 377, + "token_acc": 0.7681555758128229 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 2.29099702835083, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7276159524917603, + "step": 378, + "token_acc": 0.7826947105372761 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 2.584505319595337, + "learning_rate": 3.689300402536093e-05, + "loss": 0.9814828634262085, + "step": 379, + "token_acc": 0.7160717395089674 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.3225842714309692, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8274613618850708, + "step": 380, + "token_acc": 0.7544784652521916 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 3.4567878246307373, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8384053707122803, + "step": 381, + "token_acc": 0.7518606937227917 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 3.5069363117218018, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7467086315155029, + "step": 382, + "token_acc": 0.7784389823199656 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 1349.64501953125, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7556321620941162, + "step": 383, + "token_acc": 0.7752317780960277 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 2.6709060668945312, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6211893558502197, + "step": 384, + "token_acc": 0.8125134148959005 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 1.6858121156692505, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8058912754058838, + "step": 385, + "token_acc": 0.7628393692433814 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.219348430633545, + "learning_rate": 3.613053314713671e-05, + "loss": 0.8431601524353027, + "step": 386, + "token_acc": 0.7487229170336446 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 1.4409899711608887, + "learning_rate": 3.602051485530486e-05, + "loss": 0.9082483053207397, + "step": 387, + "token_acc": 0.729979941367073 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 1.596650242805481, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7665495872497559, + "step": 388, + "token_acc": 0.7712696559774772 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 1.0858607292175293, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9287350177764893, + "step": 389, + "token_acc": 0.7277777777777777 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 14.8970365524292, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6690181493759155, + "step": 390, + "token_acc": 0.8004053765735012 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 5.169677734375, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8137506246566772, + "step": 391, + "token_acc": 0.7589914103629815 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.0652302503585815, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7818809747695923, + "step": 392, + "token_acc": 0.7646431342125679 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 3.2523343563079834, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.790520429611206, + "step": 393, + "token_acc": 0.7665671262469026 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.9948564767837524, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7343300580978394, + "step": 394, + "token_acc": 0.7801844119693807 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 8.779631614685059, + "learning_rate": 3.513103285012475e-05, + "loss": 0.823872447013855, + "step": 395, + "token_acc": 0.7562481836675385 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 3.0845484733581543, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7353721857070923, + "step": 396, + "token_acc": 0.7806098875712305 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 1.4457420110702515, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7633687257766724, + "step": 397, + "token_acc": 0.7762840122363549 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 3.5868849754333496, + "learning_rate": 3.47933752712989e-05, + "loss": 0.7144147157669067, + "step": 398, + "token_acc": 0.789120029455081 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 2.74013614654541, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8580281734466553, + "step": 399, + "token_acc": 0.7488521853198974 + }, + { + "epoch": 1.0, + "grad_norm": 2.7789676189422607, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7465000152587891, + "step": 400, + "token_acc": 0.7748026089941641 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 2.5083093643188477, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7482450008392334, + "step": 401, + "token_acc": 0.7756680731364276 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 1.5304547548294067, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8512796759605408, + "step": 402, + "token_acc": 0.7466814693247091 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 3.557460308074951, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7484120726585388, + "step": 403, + "token_acc": 0.7753919962555581 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 5.367844581604004, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6399465799331665, + "step": 404, + "token_acc": 0.8064121850319669 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 2.309791326522827, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7572115659713745, + "step": 405, + "token_acc": 0.778211361310133 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 10.43783950805664, + "learning_rate": 3.388277253201041e-05, + "loss": 0.7999943494796753, + "step": 406, + "token_acc": 0.7620247990189399 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 4.304990768432617, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8064647912979126, + "step": 407, + "token_acc": 0.7639428499812007 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 1.3805936574935913, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8383949398994446, + "step": 408, + "token_acc": 0.7478151048244506 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 2.6776158809661865, + "learning_rate": 3.353768924152341e-05, + "loss": 0.6969519257545471, + "step": 409, + "token_acc": 0.7909162786611614 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 1.1812976598739624, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9484398365020752, + "step": 410, + "token_acc": 0.7265209203307951 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 7.378384113311768, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7456188797950745, + "step": 411, + "token_acc": 0.7744972966405443 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 2.924264669418335, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8864508867263794, + "step": 412, + "token_acc": 0.7376894683106887 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 2.464365005493164, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6419383883476257, + "step": 413, + "token_acc": 0.8134543953776311 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 5.192070007324219, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7585772275924683, + "step": 414, + "token_acc": 0.7764367456694391 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 2.1468076705932617, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8554524183273315, + "step": 415, + "token_acc": 0.7464255019923431 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 1.838391661643982, + "learning_rate": 3.272542485937369e-05, + "loss": 0.819720447063446, + "step": 416, + "token_acc": 0.7565149747180085 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 1.1302598714828491, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8727908730506897, + "step": 417, + "token_acc": 0.7423896933074906 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.2645598649978638, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8348588943481445, + "step": 418, + "token_acc": 0.7506860706860707 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.1367015838623047, + "learning_rate": 3.23744632744341e-05, + "loss": 0.673876941204071, + "step": 419, + "token_acc": 0.7934364744491327 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 10.951983451843262, + "learning_rate": 3.225711693136156e-05, + "loss": 0.6246871948242188, + "step": 420, + "token_acc": 0.8066268332428028 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 3.3616561889648438, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.8184407949447632, + "step": 421, + "token_acc": 0.7584331756487909 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 1.6267706155776978, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8076139688491821, + "step": 422, + "token_acc": 0.7578792160717577 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 2.607529878616333, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6964325308799744, + "step": 423, + "token_acc": 0.7924243768295929 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 2.781243085861206, + "learning_rate": 3.178601124662686e-05, + "loss": 0.8571556806564331, + "step": 424, + "token_acc": 0.7462099943851769 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.86491858959198, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.758177638053894, + "step": 425, + "token_acc": 0.7680104961832062 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 2.1224405765533447, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7757034301757812, + "step": 426, + "token_acc": 0.7722524774573699 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 1.8863650560379028, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8123703002929688, + "step": 427, + "token_acc": 0.7639742969667657 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 2.3641357421875, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7848698496818542, + "step": 428, + "token_acc": 0.7647326852976913 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 2.3047101497650146, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7829238176345825, + "step": 429, + "token_acc": 0.7659560681656191 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 2.6143319606781006, + "learning_rate": 3.10745044975816e-05, + "loss": 0.7950413227081299, + "step": 430, + "token_acc": 0.768625959038742 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 1.3800603151321411, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8089693784713745, + "step": 431, + "token_acc": 0.7642110762800418 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 4.631928443908691, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8975304365158081, + "step": 432, + "token_acc": 0.7377950351206317 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 1.7472598552703857, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8314036726951599, + "step": 433, + "token_acc": 0.7511785954815404 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 3.089261054992676, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6671078205108643, + "step": 434, + "token_acc": 0.7968802528071001 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 1.2681653499603271, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8389818668365479, + "step": 435, + "token_acc": 0.7532440676213618 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 1.615865707397461, + "learning_rate": 3.035772882662627e-05, + "loss": 0.740587055683136, + "step": 436, + "token_acc": 0.7783269677226091 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 1.1586065292358398, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8281398415565491, + "step": 437, + "token_acc": 0.7543171893608575 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 1.2768690586090088, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8269925117492676, + "step": 438, + "token_acc": 0.752611147056105 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 1.6892045736312866, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.6553794145584106, + "step": 439, + "token_acc": 0.8029715762273901 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 11.613991737365723, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.5059342384338379, + "step": 440, + "token_acc": 0.8454545454545455 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.2692391872406006, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8626140356063843, + "step": 441, + "token_acc": 0.7472961054634916 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 10.773530006408691, + "learning_rate": 2.963630595278977e-05, + "loss": 0.637244701385498, + "step": 442, + "token_acc": 0.8053183229813664 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 4.59783411026001, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.7247684001922607, + "step": 443, + "token_acc": 0.7837734769758795 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 1.9800934791564941, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.8562126159667969, + "step": 444, + "token_acc": 0.7429015397655035 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 1.0154430866241455, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.7898328304290771, + "step": 445, + "token_acc": 0.7574374230611407 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 0.9506177306175232, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8542905449867249, + "step": 446, + "token_acc": 0.7462486726072303 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 1.8862485885620117, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7725399732589722, + "step": 447, + "token_acc": 0.76569290197972 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 2.745835065841675, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7496145367622375, + "step": 448, + "token_acc": 0.7733351163412677 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 5.342070579528809, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6059656143188477, + "step": 449, + "token_acc": 0.8215033744472888 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 2.0042543411254883, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6715121865272522, + "step": 450, + "token_acc": 0.7972053027588678 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 3.369508981704712, + "learning_rate": 2.854682793330633e-05, + "loss": 0.7005834579467773, + "step": 451, + "token_acc": 0.7925215723873442 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 2.255542516708374, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.6925271153450012, + "step": 452, + "token_acc": 0.7939376553834385 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 1.9074103832244873, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8258252143859863, + "step": 453, + "token_acc": 0.7546308043643746 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 1.9372538328170776, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9210749864578247, + "step": 454, + "token_acc": 0.7282898919262556 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 2.819469928741455, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.695602536201477, + "step": 455, + "token_acc": 0.7881796251623678 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 1.7250150442123413, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7463157176971436, + "step": 456, + "token_acc": 0.7749062109212171 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 2.6007657051086426, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.787858247756958, + "step": 457, + "token_acc": 0.7616864037040335 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 2.298821210861206, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7881502509117126, + "step": 458, + "token_acc": 0.7664104482688252 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 7.818414211273193, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8358293175697327, + "step": 459, + "token_acc": 0.7499888487443687 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 0.8642250299453735, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8736441731452942, + "step": 460, + "token_acc": 0.7447342910020269 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.3678836822509766, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8240588903427124, + "step": 461, + "token_acc": 0.7507011866235167 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 4.159181594848633, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8616459369659424, + "step": 462, + "token_acc": 0.7484583250447583 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 2.0485188961029053, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.8544602394104004, + "step": 463, + "token_acc": 0.7434052757793765 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 3.685590982437134, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9081782102584839, + "step": 464, + "token_acc": 0.7326156444122791 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 2.547394037246704, + "learning_rate": 2.683911408999169e-05, + "loss": 0.7107387185096741, + "step": 465, + "token_acc": 0.7819461633663366 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 4.8121209144592285, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6490302085876465, + "step": 466, + "token_acc": 0.8037789324515824 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 14.578204154968262, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5259852409362793, + "step": 467, + "token_acc": 0.8461106745987204 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 8.176078796386719, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7505219578742981, + "step": 468, + "token_acc": 0.7776547651997416 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 3.2051355838775635, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7255773544311523, + "step": 469, + "token_acc": 0.7867267333260082 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 1.626749038696289, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8417118787765503, + "step": 470, + "token_acc": 0.7481726244117353 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 6.1625142097473145, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.7143338918685913, + "step": 471, + "token_acc": 0.782307525795512 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 1.209688425064087, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8743295669555664, + "step": 472, + "token_acc": 0.7435388711951131 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 4.4833550453186035, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7911447286605835, + "step": 473, + "token_acc": 0.7650904203323559 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.926804780960083, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.8273140788078308, + "step": 474, + "token_acc": 0.7583581805493879 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 1.872205376625061, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8174236416816711, + "step": 475, + "token_acc": 0.7558880252469172 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 3.878399610519409, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6719313263893127, + "step": 476, + "token_acc": 0.7988101223395341 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 1.8818238973617554, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7724275588989258, + "step": 477, + "token_acc": 0.773079355042681 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 2.963927745819092, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9049360752105713, + "step": 478, + "token_acc": 0.7339738348323794 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 2.7415409088134766, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8529146313667297, + "step": 479, + "token_acc": 0.7456251892219194 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 1.6160272359848022, + "learning_rate": 2.5e-05, + "loss": 0.7292277812957764, + "step": 480, + "token_acc": 0.7809226832973535 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 1.343587875366211, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7619751691818237, + "step": 481, + "token_acc": 0.7706236189540879 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 1.3238308429718018, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.8524097204208374, + "step": 482, + "token_acc": 0.7446827604774298 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 3.7486040592193604, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.7500920295715332, + "step": 483, + "token_acc": 0.7754705144291092 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 2.8402061462402344, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8324809074401855, + "step": 484, + "token_acc": 0.7528833831695857 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 3.4831743240356445, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8428285717964172, + "step": 485, + "token_acc": 0.7473346542126615 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 1.403225302696228, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9696469306945801, + "step": 486, + "token_acc": 0.71866889465638 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.4889639616012573, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8492543697357178, + "step": 487, + "token_acc": 0.7504687579182081 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 2.625995397567749, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7114861607551575, + "step": 488, + "token_acc": 0.7869125090383224 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 1.7950961589813232, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8308013677597046, + "step": 489, + "token_acc": 0.7517450509211581 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 2.1624467372894287, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.6955065727233887, + "step": 490, + "token_acc": 0.7887615628883059 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 8.656285285949707, + "learning_rate": 2.365075276976245e-05, + "loss": 0.8983242511749268, + "step": 491, + "token_acc": 0.7329764252841175 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 2.0143282413482666, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6728692650794983, + "step": 492, + "token_acc": 0.7958803160791974 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 7.166861534118652, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.7883687615394592, + "step": 493, + "token_acc": 0.7684217714949122 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 2.849721908569336, + "learning_rate": 2.328329352789066e-05, + "loss": 0.7245194911956787, + "step": 494, + "token_acc": 0.7787610619469026 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 5.236846923828125, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8468673825263977, + "step": 495, + "token_acc": 0.7493651103731197 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.2859762907028198, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8326257467269897, + "step": 496, + "token_acc": 0.7531454639099404 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 1.9283963441848755, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6319226622581482, + "step": 497, + "token_acc": 0.8054604261796042 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 3.758319616317749, + "learning_rate": 2.279394073699077e-05, + "loss": 0.6995894908905029, + "step": 498, + "token_acc": 0.7890441061057919 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.2176576852798462, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7224262356758118, + "step": 499, + "token_acc": 0.7844820331566102 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 2.0414905548095703, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5559295415878296, + "step": 500, + "token_acc": 0.830029368575624 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 2.3053483963012695, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6197410225868225, + "step": 501, + "token_acc": 0.8072528564331843 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 2.062232494354248, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8683875799179077, + "step": 502, + "token_acc": 0.743580453783796 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.8906859755516052, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.9356937408447266, + "step": 503, + "token_acc": 0.7245146004492445 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 3.9231433868408203, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6747022867202759, + "step": 504, + "token_acc": 0.7981907419882591 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 2.7428345680236816, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7441482543945312, + "step": 505, + "token_acc": 0.7742395794217048 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 1.9277092218399048, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6530448198318481, + "step": 506, + "token_acc": 0.7975220638153429 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 1.6292767524719238, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6860779523849487, + "step": 507, + "token_acc": 0.7898953564421191 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 2.6792891025543213, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8034096956253052, + "step": 508, + "token_acc": 0.7567851055460862 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 2.100313425064087, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7841708064079285, + "step": 509, + "token_acc": 0.7575472165766123 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 2.4685211181640625, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8183025121688843, + "step": 510, + "token_acc": 0.7573227392094808 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 6.109943389892578, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.7484889030456543, + "step": 511, + "token_acc": 0.7755445227418322 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 1.9834048748016357, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8298561573028564, + "step": 512, + "token_acc": 0.7505842708842871 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 2.403406858444214, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.8005748987197876, + "step": 513, + "token_acc": 0.758890922109953 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 1.7540974617004395, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7584190368652344, + "step": 514, + "token_acc": 0.7752175818671342 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 3.21459698677063, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.8561462163925171, + "step": 515, + "token_acc": 0.7418676224239354 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.681273341178894, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7925042510032654, + "step": 516, + "token_acc": 0.7639773324764854 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 1.0431792736053467, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8750126361846924, + "step": 517, + "token_acc": 0.7400191632066433 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 4.3631911277771, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7869176864624023, + "step": 518, + "token_acc": 0.7620188403443235 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 1.3742365837097168, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8369603753089905, + "step": 519, + "token_acc": 0.7513550803193062 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 0.8509203791618347, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.86566162109375, + "step": 520, + "token_acc": 0.7443547816238408 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 1.0245444774627686, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8384143114089966, + "step": 521, + "token_acc": 0.748472884386174 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 1.5151759386062622, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7885670065879822, + "step": 522, + "token_acc": 0.7661560384752405 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 4.340545177459717, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7875890731811523, + "step": 523, + "token_acc": 0.764338076757223 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 1.4497512578964233, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8240665793418884, + "step": 524, + "token_acc": 0.7531088719587122 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 4.8524088859558105, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7155791521072388, + "step": 525, + "token_acc": 0.7859528907922912 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 1.4243345260620117, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8229907155036926, + "step": 526, + "token_acc": 0.7575123417042283 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.1557880640029907, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8167639374732971, + "step": 527, + "token_acc": 0.7524916943521595 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 2.145895004272461, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.7714104056358337, + "step": 528, + "token_acc": 0.7715271647540326 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 1.0105962753295898, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8628207445144653, + "step": 529, + "token_acc": 0.7388354186717998 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 1.6246225833892822, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8422914743423462, + "step": 530, + "token_acc": 0.7541976188053322 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 1.6991968154907227, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6368581056594849, + "step": 531, + "token_acc": 0.8030737554231929 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 1.9977556467056274, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9611953496932983, + "step": 532, + "token_acc": 0.7224977890567924 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 1.7200034856796265, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.779466450214386, + "step": 533, + "token_acc": 0.7697901384193404 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 2.9292917251586914, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.8787710070610046, + "step": 534, + "token_acc": 0.7420819370878824 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 1.74767005443573, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.7538915276527405, + "step": 535, + "token_acc": 0.7723708164122672 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 2.842759132385254, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8347668647766113, + "step": 536, + "token_acc": 0.7466009191880506 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 1.0351887941360474, + "learning_rate": 1.809595995707573e-05, + "loss": 0.813193678855896, + "step": 537, + "token_acc": 0.756039689387403 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 2.1326282024383545, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7035706043243408, + "step": 538, + "token_acc": 0.7871062158206886 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 1.6530029773712158, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6484057903289795, + "step": 539, + "token_acc": 0.8037213327563825 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 1.397707462310791, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8277699947357178, + "step": 540, + "token_acc": 0.7495398833065747 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 2.410323143005371, + "learning_rate": 1.762553672556591e-05, + "loss": 0.8146207332611084, + "step": 541, + "token_acc": 0.7571063829787235 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.910866379737854, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7210761904716492, + "step": 542, + "token_acc": 0.7774188701923077 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 11.782573699951172, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.6522407531738281, + "step": 543, + "token_acc": 0.8072419561153202 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 1.7913554906845093, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7852916121482849, + "step": 544, + "token_acc": 0.7610718065845914 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.8758189678192139, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7586523294448853, + "step": 545, + "token_acc": 0.7717872152178722 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 3.353968858718872, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6757744550704956, + "step": 546, + "token_acc": 0.793317610062893 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 1.8377400636672974, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8068370819091797, + "step": 547, + "token_acc": 0.7570990806945863 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 1.3780946731567383, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8233660459518433, + "step": 548, + "token_acc": 0.7505704506560182 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 5.142945766448975, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7289072871208191, + "step": 549, + "token_acc": 0.7812933869199854 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 1.773954153060913, + "learning_rate": 1.65777536651945e-05, + "loss": 0.7236466407775879, + "step": 550, + "token_acc": 0.7810041481905307 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 3.5997884273529053, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.8042117357254028, + "step": 551, + "token_acc": 0.7581943081452405 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 0.8696406483650208, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8300492167472839, + "step": 552, + "token_acc": 0.7506484670663776 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.5040565729141235, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.748427152633667, + "step": 553, + "token_acc": 0.7755393724903015 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 7.286196708679199, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.703101634979248, + "step": 554, + "token_acc": 0.7881292820971105 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.6359056234359741, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.8726459741592407, + "step": 555, + "token_acc": 0.7418959244573438 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 5.042118549346924, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7041570544242859, + "step": 556, + "token_acc": 0.7845845042151747 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 1.9065269231796265, + "learning_rate": 1.577407047339834e-05, + "loss": 0.8025046586990356, + "step": 557, + "token_acc": 0.7626718792127258 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 1.8250200748443604, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6778990030288696, + "step": 558, + "token_acc": 0.7909020418712845 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 2.2167229652404785, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8701958656311035, + "step": 559, + "token_acc": 0.7410597648595689 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 3.1135730743408203, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.8122137784957886, + "step": 560, + "token_acc": 0.7573019661325151 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 1.591567039489746, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.7499758005142212, + "step": 561, + "token_acc": 0.7801376009572241 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 2.626103401184082, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.7822006940841675, + "step": 562, + "token_acc": 0.7697957003605288 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 1.4338953495025635, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8059190511703491, + "step": 563, + "token_acc": 0.7583813140593736 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 2.3067641258239746, + "learning_rate": 1.498127917242148e-05, + "loss": 0.956562876701355, + "step": 564, + "token_acc": 0.7224202015557344 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 4.148603439331055, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7793439030647278, + "step": 565, + "token_acc": 0.7708575412502905 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 3.040891170501709, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8436172008514404, + "step": 566, + "token_acc": 0.7491851498529295 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 6.971378803253174, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7122055292129517, + "step": 567, + "token_acc": 0.7875359934183463 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 2.5589678287506104, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.7449221611022949, + "step": 568, + "token_acc": 0.7731634868045242 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 3.4065513610839844, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.8547236323356628, + "step": 569, + "token_acc": 0.7475447402880838 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 2.0447330474853516, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7997812628746033, + "step": 570, + "token_acc": 0.7587858644117503 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 19.273677825927734, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7676827907562256, + "step": 571, + "token_acc": 0.77000777000777 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 3.677581548690796, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7329694032669067, + "step": 572, + "token_acc": 0.7787445286644603 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 2.750782012939453, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6624218225479126, + "step": 573, + "token_acc": 0.7990237205400046 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.7288239002227783, + "learning_rate": 1.38694668528633e-05, + "loss": 0.7868748903274536, + "step": 574, + "token_acc": 0.7691857059168131 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 1.542420744895935, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8554753661155701, + "step": 575, + "token_acc": 0.7459746488523467 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 1.5799529552459717, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.8055590987205505, + "step": 576, + "token_acc": 0.7627781853753974 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 2.379765748977661, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8156087398529053, + "step": 577, + "token_acc": 0.7587134194568943 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 5.061030864715576, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6562641859054565, + "step": 578, + "token_acc": 0.8027216563700117 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 3.107051372528076, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.6440657377243042, + "step": 579, + "token_acc": 0.806850025947068 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.5127389430999756, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7621431350708008, + "step": 580, + "token_acc": 0.7777696579947384 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 3.7916858196258545, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7451849579811096, + "step": 581, + "token_acc": 0.7728736170461863 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 1.4253214597702026, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.9144057035446167, + "step": 582, + "token_acc": 0.7358452790902539 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 2.429523229598999, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6499612331390381, + "step": 583, + "token_acc": 0.8022828400077384 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 1.506866693496704, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8545807600021362, + "step": 584, + "token_acc": 0.7438212275161334 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 1.14063560962677, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7255370020866394, + "step": 585, + "token_acc": 0.7810890120639061 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 2.096499443054199, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7315889000892639, + "step": 586, + "token_acc": 0.7754388468674183 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 5.344691753387451, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8230787515640259, + "step": 587, + "token_acc": 0.7523631400697569 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 1.977255940437317, + "learning_rate": 1.235856566555039e-05, + "loss": 0.676746129989624, + "step": 588, + "token_acc": 0.7930442637759711 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.3346836566925049, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.7244657278060913, + "step": 589, + "token_acc": 0.7811462961921368 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 3.2221341133117676, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.6661178469657898, + "step": 590, + "token_acc": 0.7992459076696707 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 4.241289138793945, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.744454026222229, + "step": 591, + "token_acc": 0.7769393863806435 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 7.127607822418213, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.6379393339157104, + "step": 592, + "token_acc": 0.8044160942100098 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.677003264427185, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7646165490150452, + "step": 593, + "token_acc": 0.7687584863333137 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 1.2843506336212158, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8055639266967773, + "step": 594, + "token_acc": 0.7631550337029789 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.2286913394927979, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7198688983917236, + "step": 595, + "token_acc": 0.7768950480855386 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 4.122060298919678, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6652401685714722, + "step": 596, + "token_acc": 0.7982724491632176 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 3.4319710731506348, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8203213214874268, + "step": 597, + "token_acc": 0.7535128506463645 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 1.9524973630905151, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8763255476951599, + "step": 598, + "token_acc": 0.7429590926468714 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 2.4943723678588867, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.7097381949424744, + "step": 599, + "token_acc": 0.7815607985480943 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 21.619144439697266, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7615182399749756, + "step": 600, + "token_acc": 0.7687875878101784 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 1.6322247982025146, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7482010722160339, + "step": 601, + "token_acc": 0.7713472485768501 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 1.0364089012145996, + "learning_rate": 1.090734344462458e-05, + "loss": 0.8905367851257324, + "step": 602, + "token_acc": 0.7401884180917088 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 4.594523906707764, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.7736368179321289, + "step": 603, + "token_acc": 0.7722505668934241 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 1.897789478302002, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.744308590888977, + "step": 604, + "token_acc": 0.7725912143030499 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 3.5902726650238037, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.6907957196235657, + "step": 605, + "token_acc": 0.7894978216005504 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 1.7016520500183105, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.8940221071243286, + "step": 606, + "token_acc": 0.7394552473548756 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 1.5157966613769531, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.8362439870834351, + "step": 607, + "token_acc": 0.7472730147020077 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 2.323500871658325, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.786865234375, + "step": 608, + "token_acc": 0.764400989515844 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 74.33378601074219, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.7950047254562378, + "step": 609, + "token_acc": 0.7578022799476734 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 3.3788833618164062, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.6147444248199463, + "step": 610, + "token_acc": 0.815751960085531 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 2.66544771194458, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.6397148966789246, + "step": 611, + "token_acc": 0.7999815990431502 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 1.6965497732162476, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7612807750701904, + "step": 612, + "token_acc": 0.7722021881303098 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 2.2254910469055176, + "learning_rate": 9.813437667457229e-06, + "loss": 0.65788334608078, + "step": 613, + "token_acc": 0.8018885221855518 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 1.936301350593567, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8385921716690063, + "step": 614, + "token_acc": 0.7499523416153016 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 3.259331703186035, + "learning_rate": 9.619210235484333e-06, + "loss": 0.7441162467002869, + "step": 615, + "token_acc": 0.7762369996848408 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 3.5360541343688965, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7276872992515564, + "step": 616, + "token_acc": 0.7725686181183563 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.201682209968567, + "learning_rate": 9.426465236041651e-06, + "loss": 0.702145516872406, + "step": 617, + "token_acc": 0.7885718382563809 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 1.1223235130310059, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7966522574424744, + "step": 618, + "token_acc": 0.7599822756141992 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 2.9685420989990234, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8100804090499878, + "step": 619, + "token_acc": 0.756401384083045 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 2.115173578262329, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7754491567611694, + "step": 620, + "token_acc": 0.7694536716375716 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.030800700187683, + "learning_rate": 9.04549669873337e-06, + "loss": 0.815934419631958, + "step": 621, + "token_acc": 0.7545691906005222 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 9.539032936096191, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6096709966659546, + "step": 622, + "token_acc": 0.8140929535232384 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 3.739379644393921, + "learning_rate": 8.857309879408324e-06, + "loss": 0.6682818531990051, + "step": 623, + "token_acc": 0.8030173336186603 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 2.9171271324157715, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8189687728881836, + "step": 624, + "token_acc": 0.7579735300499023 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 3.653998613357544, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8347030878067017, + "step": 625, + "token_acc": 0.7483955025816725 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 3.2206311225891113, + "learning_rate": 8.577952526423969e-06, + "loss": 0.7974085807800293, + "step": 626, + "token_acc": 0.7626205161985747 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 1.857633352279663, + "learning_rate": 8.48562182685487e-06, + "loss": 0.6958124041557312, + "step": 627, + "token_acc": 0.7893594633697225 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 3.203127861022949, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6396089792251587, + "step": 628, + "token_acc": 0.8018999477078612 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 10.867119789123535, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6756541132926941, + "step": 629, + "token_acc": 0.7908339076498966 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 1.9048235416412354, + "learning_rate": 8.211026128824539e-06, + "loss": 0.7945992946624756, + "step": 630, + "token_acc": 0.7612518398016888 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 5.721317768096924, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8779458403587341, + "step": 631, + "token_acc": 0.7360282478996713 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 6.489996433258057, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6239632368087769, + "step": 632, + "token_acc": 0.8178224169248851 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 2.635003089904785, + "learning_rate": 7.940071245792579e-06, + "loss": 0.60353684425354, + "step": 633, + "token_acc": 0.8162691386313926 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 5.4421467781066895, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6887288689613342, + "step": 634, + "token_acc": 0.7906894415434994 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 1.4320110082626343, + "learning_rate": 7.761486381573327e-06, + "loss": 0.6909926533699036, + "step": 635, + "token_acc": 0.7896647808832221 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 1.9564619064331055, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7665590047836304, + "step": 636, + "token_acc": 0.7702360391479562 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 1.2858654260635376, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8104827404022217, + "step": 637, + "token_acc": 0.7559560606781112 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 8.487231254577637, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.5926421880722046, + "step": 638, + "token_acc": 0.8263585995520453 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 1.635348916053772, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9333232641220093, + "step": 639, + "token_acc": 0.7273431148619875 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 4.053239345550537, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.726628303527832, + "step": 640, + "token_acc": 0.7767200346170489 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 2.1414389610290527, + "learning_rate": 7.235768739040258e-06, + "loss": 0.796164870262146, + "step": 641, + "token_acc": 0.7624649111081406 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 1.8818213939666748, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8160055875778198, + "step": 642, + "token_acc": 0.7571467589220685 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 0.7274258136749268, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9394699335098267, + "step": 643, + "token_acc": 0.7232635060639471 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 2.1022329330444336, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.872856616973877, + "step": 644, + "token_acc": 0.739904441691736 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 2.117232084274292, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7678521871566772, + "step": 645, + "token_acc": 0.7683991041779288 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 2.113924980163574, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7138104438781738, + "step": 646, + "token_acc": 0.788220905071032 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 10.124676704406738, + "learning_rate": 6.725459488639211e-06, + "loss": 0.8729824423789978, + "step": 647, + "token_acc": 0.7402089353189598 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 2.0404815673828125, + "learning_rate": 6.641937264107867e-06, + "loss": 0.75057452917099, + "step": 648, + "token_acc": 0.7728152449009975 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 3.357954502105713, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6092256307601929, + "step": 649, + "token_acc": 0.8122177055103884 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 1.6319386959075928, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8065642714500427, + "step": 650, + "token_acc": 0.7608971431471051 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 4.5181050300598145, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8111133575439453, + "step": 651, + "token_acc": 0.7587757724431984 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 3.557448148727417, + "learning_rate": 6.312291828435077e-06, + "loss": 0.624323844909668, + "step": 652, + "token_acc": 0.8063609037137593 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 2.8433284759521484, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7201327681541443, + "step": 653, + "token_acc": 0.78446311592139 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 1.2021771669387817, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8491130471229553, + "step": 654, + "token_acc": 0.7483784720503045 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 1.2091090679168701, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8359229564666748, + "step": 655, + "token_acc": 0.7512554559534426 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 10.087580680847168, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7748186588287354, + "step": 656, + "token_acc": 0.7694327731092437 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 1.498608946800232, + "learning_rate": 5.910380944855087e-06, + "loss": 0.8846578598022461, + "step": 657, + "token_acc": 0.7394652877104192 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 3.2764029502868652, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.6131420135498047, + "step": 658, + "token_acc": 0.8132510900776349 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 2.0642950534820557, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8031247854232788, + "step": 659, + "token_acc": 0.7614583333333333 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 1.2550472021102905, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7710773944854736, + "step": 660, + "token_acc": 0.7694515633008714 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 2.364381790161133, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7222622632980347, + "step": 661, + "token_acc": 0.7859005769382755 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 3.985602617263794, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7197556495666504, + "step": 662, + "token_acc": 0.7872414478918058 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 3.4668893814086914, + "learning_rate": 5.443287214979592e-06, + "loss": 0.6038973331451416, + "step": 663, + "token_acc": 0.8172893919663428 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 16.531862258911133, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6388102173805237, + "step": 664, + "token_acc": 0.8046867617877729 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 3.9002861976623535, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6912767291069031, + "step": 665, + "token_acc": 0.7929694400282635 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.7196484804153442, + "learning_rate": 5.216076783983493e-06, + "loss": 0.6770153641700745, + "step": 666, + "token_acc": 0.7955169258920403 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 1.4810196161270142, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8496290445327759, + "step": 667, + "token_acc": 0.7496900770764836 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 2.02133846282959, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8104414939880371, + "step": 668, + "token_acc": 0.7553891414816796 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 1.4801369905471802, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8000129461288452, + "step": 669, + "token_acc": 0.7611111111111111 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 1.9785418510437012, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8052246570587158, + "step": 670, + "token_acc": 0.7555092592592593 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 2.4100208282470703, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8232534527778625, + "step": 671, + "token_acc": 0.7465227319908657 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 1.3945097923278809, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8596230149269104, + "step": 672, + "token_acc": 0.7454640797063451 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 1.8322561979293823, + "learning_rate": 4.702687000087386e-06, + "loss": 0.6880487203598022, + "step": 673, + "token_acc": 0.782898299577602 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 2.1570794582366943, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7599859237670898, + "step": 674, + "token_acc": 0.7674839001242797 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 1.9660370349884033, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7393922209739685, + "step": 675, + "token_acc": 0.774453781512605 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 2.8953030109405518, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8593490123748779, + "step": 676, + "token_acc": 0.7433499773036768 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 1.105050802230835, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7844275236129761, + "step": 677, + "token_acc": 0.7651860489769956 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 7.612730979919434, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7978190183639526, + "step": 678, + "token_acc": 0.7632656274602425 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 0.9666391611099243, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.8501102924346924, + "step": 679, + "token_acc": 0.748565553381314 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 1.675850749015808, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7121337652206421, + "step": 680, + "token_acc": 0.7868174092957955 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 2.0955216884613037, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7239298224449158, + "step": 681, + "token_acc": 0.785748031496063 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.5945849418640137, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7046365141868591, + "step": 682, + "token_acc": 0.7846875698220005 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 1.6976025104522705, + "learning_rate": 4.010984790046615e-06, + "loss": 0.6717643141746521, + "step": 683, + "token_acc": 0.797970126388357 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 4.0479817390441895, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8405852317810059, + "step": 684, + "token_acc": 0.7521482434091308 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 3.3728387355804443, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6040500998497009, + "step": 685, + "token_acc": 0.816435066049065 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 4.269870758056641, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8831207752227783, + "step": 686, + "token_acc": 0.7357807901973081 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 2.9320452213287354, + "learning_rate": 3.748372666094277e-06, + "loss": 0.836078405380249, + "step": 687, + "token_acc": 0.7496101275112375 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 1.5719010829925537, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7011086344718933, + "step": 688, + "token_acc": 0.7888382505796754 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 4.483651161193848, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.6982402801513672, + "step": 689, + "token_acc": 0.7868399225877799 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.8235728740692139, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7384521961212158, + "step": 690, + "token_acc": 0.7768055997454661 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 16.569927215576172, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6786566972732544, + "step": 691, + "token_acc": 0.7962027873156938 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 1.5950816869735718, + "learning_rate": 3.431640350555204e-06, + "loss": 0.614397406578064, + "step": 692, + "token_acc": 0.8129821260583255 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 3.7220969200134277, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6824333071708679, + "step": 693, + "token_acc": 0.7938019759755491 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 1.5605802536010742, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8088199496269226, + "step": 694, + "token_acc": 0.7540081128066448 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.3383564949035645, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7779883742332458, + "step": 695, + "token_acc": 0.7683611644746564 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 1.5642516613006592, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7946350574493408, + "step": 696, + "token_acc": 0.7605515385908862 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 5.639887809753418, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.7023658752441406, + "step": 697, + "token_acc": 0.7881643111000909 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.8614176511764526, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8359920978546143, + "step": 698, + "token_acc": 0.7491880857381461 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 1.091104507446289, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8066213726997375, + "step": 699, + "token_acc": 0.764406115248922 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 2.4092867374420166, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8912680149078369, + "step": 700, + "token_acc": 0.7388699378990641 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 1.5786374807357788, + "learning_rate": 2.894385171586095e-06, + "loss": 0.8282228708267212, + "step": 701, + "token_acc": 0.7533897033071496 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.185546875, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8325650691986084, + "step": 702, + "token_acc": 0.7513830678960604 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 1.3140076398849487, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6865131855010986, + "step": 703, + "token_acc": 0.7894226103833091 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 3.943152904510498, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8178889751434326, + "step": 704, + "token_acc": 0.7603732035234122 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.6355938911437988, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7702490091323853, + "step": 705, + "token_acc": 0.7734057835238274 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 2.672015428543091, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7363954782485962, + "step": 706, + "token_acc": 0.7820876695048881 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 7.5712971687316895, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7284834980964661, + "step": 707, + "token_acc": 0.7819572342750117 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.2005418539047241, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8815107941627502, + "step": 708, + "token_acc": 0.736231884057971 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 5.682093620300293, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8969010710716248, + "step": 709, + "token_acc": 0.7336805243781988 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 7.478425979614258, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.7172174453735352, + "step": 710, + "token_acc": 0.7849509958899779 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 2.170532464981079, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7401068210601807, + "step": 711, + "token_acc": 0.7747611561252872 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 2.000027894973755, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8865785598754883, + "step": 712, + "token_acc": 0.7429570006354586 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 4.488513469696045, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.727079451084137, + "step": 713, + "token_acc": 0.7792013666453128 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 1.3857240676879883, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9031280279159546, + "step": 714, + "token_acc": 0.7300395414786116 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 3.1287314891815186, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7487377524375916, + "step": 715, + "token_acc": 0.7762605042016807 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 2.1425862312316895, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7209734320640564, + "step": 716, + "token_acc": 0.7816404442387783 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 16.06658935546875, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.862382173538208, + "step": 717, + "token_acc": 0.7451660221362848 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 1.3662980794906616, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7773480415344238, + "step": 718, + "token_acc": 0.7637318504788384 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.702649712562561, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.7579219937324524, + "step": 719, + "token_acc": 0.7706616172867008 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 2.08888840675354, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.611611008644104, + "step": 720, + "token_acc": 0.8128733264675592 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 4.993098735809326, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6228418350219727, + "step": 721, + "token_acc": 0.8083577860973389 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 2.1354899406433105, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8729016184806824, + "step": 722, + "token_acc": 0.7406020743738932 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 3.6772496700286865, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.8268842101097107, + "step": 723, + "token_acc": 0.7497296692643275 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 3.9325311183929443, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7343685030937195, + "step": 724, + "token_acc": 0.779054583442152 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 2.1486709117889404, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7464021444320679, + "step": 725, + "token_acc": 0.7783094098883573 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 1.5982136726379395, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7898986339569092, + "step": 726, + "token_acc": 0.7636947873100072 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.437714695930481, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7892969846725464, + "step": 727, + "token_acc": 0.7685018312888785 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 2.1532280445098877, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7180025577545166, + "step": 728, + "token_acc": 0.7896799477465709 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 28.962617874145508, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.7974023818969727, + "step": 729, + "token_acc": 0.7565578306585501 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 1.5716774463653564, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.74139004945755, + "step": 730, + "token_acc": 0.7853475674354168 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 1.4642187356948853, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8600186109542847, + "step": 731, + "token_acc": 0.7451101593889355 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 2.9124562740325928, + "learning_rate": 1.379848838328049e-06, + "loss": 0.723196268081665, + "step": 732, + "token_acc": 0.7787250094304036 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 3.190188407897949, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7476466298103333, + "step": 733, + "token_acc": 0.7836584367753376 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 2.4274721145629883, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8297971487045288, + "step": 734, + "token_acc": 0.7539064626776284 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.4249184131622314, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8851167559623718, + "step": 735, + "token_acc": 0.7376152741090876 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 4.431985855102539, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8166061043739319, + "step": 736, + "token_acc": 0.7520669148576126 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.8808094263076782, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6322556734085083, + "step": 737, + "token_acc": 0.8104704097116844 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 3.052344560623169, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.6962700486183167, + "step": 738, + "token_acc": 0.7900085330850981 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 1.5944037437438965, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7271436452865601, + "step": 739, + "token_acc": 0.7764268828098615 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 3.147589921951294, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.7402669191360474, + "step": 740, + "token_acc": 0.7758406713551208 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 2.1467528343200684, + "learning_rate": 1.041156686749717e-06, + "loss": 0.8103016018867493, + "step": 741, + "token_acc": 0.7585889736514635 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.210806965827942, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.7230099439620972, + "step": 742, + "token_acc": 0.7845214164218339 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 5.582250118255615, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8122878074645996, + "step": 743, + "token_acc": 0.7586682862190812 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 3.027064561843872, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6951571702957153, + "step": 744, + "token_acc": 0.787929227544541 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 2.49889874458313, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8861063718795776, + "step": 745, + "token_acc": 0.7379547480579021 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 1.5029351711273193, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7544765472412109, + "step": 746, + "token_acc": 0.7708400386224654 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 2.52443528175354, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7223730683326721, + "step": 747, + "token_acc": 0.7796796590362274 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 1.232771396636963, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8961279392242432, + "step": 748, + "token_acc": 0.7351487826871055 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 10.959983825683594, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8091161251068115, + "step": 749, + "token_acc": 0.7547194375732327 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 1.7464208602905273, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7364180684089661, + "step": 750, + "token_acc": 0.7817872076815858 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 2.182349443435669, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7897827625274658, + "step": 751, + "token_acc": 0.7664438786335668 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 8.031073570251465, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6580134034156799, + "step": 752, + "token_acc": 0.7999625046869141 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 1.5658347606658936, + "learning_rate": 6.623969226072363e-07, + "loss": 0.9101489186286926, + "step": 753, + "token_acc": 0.7374909076987864 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 1.1753172874450684, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8875089883804321, + "step": 754, + "token_acc": 0.73394678138942 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.634332537651062, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7488188743591309, + "step": 755, + "token_acc": 0.7744497543245609 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 1.9908474683761597, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7645170092582703, + "step": 756, + "token_acc": 0.7715148835838491 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 6.012979984283447, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7867085933685303, + "step": 757, + "token_acc": 0.7629029926268613 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 2.5716400146484375, + "learning_rate": 5.294312162731934e-07, + "loss": 0.6976877450942993, + "step": 758, + "token_acc": 0.7884969325153375 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 2.4027717113494873, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7928605079650879, + "step": 759, + "token_acc": 0.7669667095299328 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 2.02215838432312, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7859390377998352, + "step": 760, + "token_acc": 0.758043137727437 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 6.254071235656738, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.7381837368011475, + "step": 761, + "token_acc": 0.7740069907848744 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 4.3257060050964355, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7426378726959229, + "step": 762, + "token_acc": 0.7737384009152155 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 2.265584707260132, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.7314226627349854, + "step": 763, + "token_acc": 0.7758732022307014 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 5.339004993438721, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.6290936470031738, + "step": 764, + "token_acc": 0.8064294703123213 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 9.275211334228516, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7639355659484863, + "step": 765, + "token_acc": 0.766955266955267 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 1.5419917106628418, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7539982795715332, + "step": 766, + "token_acc": 0.7762047019093389 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 1.023754596710205, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8236006498336792, + "step": 767, + "token_acc": 0.7516803938275112 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 3.612969160079956, + "learning_rate": 3.077914851215585e-07, + "loss": 0.7220295667648315, + "step": 768, + "token_acc": 0.7861885790172642 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 2.2448315620422363, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.8047812581062317, + "step": 769, + "token_acc": 0.7596339113680154 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 4.780596733093262, + "learning_rate": 2.705872508804747e-07, + "loss": 0.627181887626648, + "step": 770, + "token_acc": 0.8130530973451328 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 2.8713886737823486, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8144195079803467, + "step": 771, + "token_acc": 0.7571025930101466 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 3.7934675216674805, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6252330541610718, + "step": 772, + "token_acc": 0.8169552960128876 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 2.7746498584747314, + "learning_rate": 2.192509677903687e-07, + "loss": 0.8003941178321838, + "step": 773, + "token_acc": 0.7631566040512041 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 1.8860054016113281, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.8493106365203857, + "step": 774, + "token_acc": 0.7480242106480589 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 2.0492420196533203, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.7619702816009521, + "step": 775, + "token_acc": 0.7746059737683236 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 3.8298299312591553, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7479050159454346, + "step": 776, + "token_acc": 0.7769350722994046 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 2.153553009033203, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.779269814491272, + "step": 777, + "token_acc": 0.7659600242277408 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 2.5486974716186523, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6520084142684937, + "step": 778, + "token_acc": 0.801793896850931 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 1.529793620109558, + "learning_rate": 1.327100431795125e-07, + "loss": 0.6999301910400391, + "step": 779, + "token_acc": 0.7859088302752294 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 1.554592251777649, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.8654152154922485, + "step": 780, + "token_acc": 0.7451161517670807 + }, + { + "epoch": 1.95369211514393, + "grad_norm": 9.168543815612793, + "learning_rate": 1.0865311416741742e-07, + "loss": 0.7853003144264221, + "step": 781, + "token_acc": 0.7589562333638783 + }, + { + "epoch": 1.9561952440550687, + "grad_norm": 1.926802158355713, + "learning_rate": 9.752416870782155e-08, + "loss": 0.7436434626579285, + "step": 782, + "token_acc": 0.7709643892566053 + }, + { + "epoch": 1.9586983729662077, + "grad_norm": 7.400356292724609, + "learning_rate": 8.699526497563393e-08, + "loss": 0.621313214302063, + "step": 783, + "token_acc": 0.8069787985865724 + }, + { + "epoch": 1.9612015018773468, + "grad_norm": 1.7210184335708618, + "learning_rate": 7.706665667180091e-08, + "loss": 0.7174030542373657, + "step": 784, + "token_acc": 0.7825233926954422 + }, + { + "epoch": 1.9637046307884856, + "grad_norm": 1.6718780994415283, + "learning_rate": 6.773858303274483e-08, + "loss": 0.7276427745819092, + "step": 785, + "token_acc": 0.7806837876161966 + }, + { + "epoch": 1.9662077596996246, + "grad_norm": 1.5906116962432861, + "learning_rate": 5.90112688246075e-08, + "loss": 0.8167098760604858, + "step": 786, + "token_acc": 0.7573275214189088 + }, + { + "epoch": 1.9687108886107634, + "grad_norm": 1.7576080560684204, + "learning_rate": 5.088492433783509e-08, + "loss": 0.6295968890190125, + "step": 787, + "token_acc": 0.8075617574957571 + }, + { + "epoch": 1.9712140175219024, + "grad_norm": 1.972408652305603, + "learning_rate": 4.335974538210441e-08, + "loss": 0.7649188041687012, + "step": 788, + "token_acc": 0.7695280950732664 + }, + { + "epoch": 1.9737171464330414, + "grad_norm": 2.0982718467712402, + "learning_rate": 3.6435913281607225e-08, + "loss": 0.7731108069419861, + "step": 789, + "token_acc": 0.7673324973127911 + }, + { + "epoch": 1.9762202753441802, + "grad_norm": 1.579641342163086, + "learning_rate": 3.011359487068987e-08, + "loss": 0.7300990223884583, + "step": 790, + "token_acc": 0.7800763452776751 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 4.1724546647861494e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..dd4978bcc5aa41de8580cb034567754d4c1ffbb0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ac2064c380d0d9aed49e54d844332ebad8b9b0acd4873c3be8f3435db854dcfb +size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-790/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/README.md new file mode 100644 index 0000000000000000000000000000000000000000..7b99d5d44c922653ec55877d9b54ddd70fbde852 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/README.md @@ -0,0 +1,207 @@ +--- +base_model: /workspace/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..f65fb5d2db9b498bbc045214fe000a3224312094 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(q_proj|up_proj|k_proj|gate_proj|o_proj|down_proj|v_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(qkv|up_proj|gate_proj|mlp.0|down_proj|mlp.2|attn.proj))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..b5854ce3dbe1aea71b3f86a8c83649cb7b9732cd --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c603b2fa0d1c09c1e7085f798e4e7be226b1262720b52e24a4bced79329f5b27 +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/args.json new file mode 100644 index 0000000000000000000000000000000000000000..85d6df2103014714697ed4adb0484d581cd7c722 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/args.json @@ -0,0 +1,387 @@ +{ + "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 4, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 10.0, + "save_total_limit": 3, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "use_ipex": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 4, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 2, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "allgather_partitions": true, + "allgather_bucket_size": 200000000.0, + "overlap_comm": false, + "reduce_scatter": true, + "reduce_bucket_size": 200000000.0, + "contiguous_gradients": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "none" + ], + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 24576, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 8, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": 0, + "global_world_size": 8, + "local_world_size": 8, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", + "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a4ef929ccfdbbceee668561667a4199e86a9d396 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b38168ed0b743035b1d5b83694feeaa18d0d03f17b2f9c6ace52e8638596ff7c +size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..c75ba23d82829cf24dca2a3e384d9a06f9ebd5c6 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b6c35ccad6ef9a51780b4d876c35ace6862d4caf156ee5f90d34905307538045 +size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..27b2876ec56e5373897beb9e015c039ef139e6ab --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e5323f05f41e677640911041f3cfb6fee6b9a6ccfd470e0cf0d4ba91a1b22ab9 +size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..89cc460e2e64d5d8c9edafa62c853a58526bbbce --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7ca0407ceabcb05d7adc0de24ab052556c53658616d6b41b4dfca2a782354659 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a9ce2ad1149bdc2d59ef95ccd177e816544f76f9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:83ae1ae16ee8ae5c015743c54fa591b5abe4347fb0d7b4b80deec910a05ef355 +size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..c886194b5a1efdbc183adfcd14e194e56949f180 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ea7b45c1fedda89c2678ee0040691d001b9321a68575732c0f52f52ac771c9e8 +size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..bcde60476c578a0c108c66c9548f1713afee9b14 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3c4dfcb825b53687723d698d32c613413846bfe238f31a088259b8ea2a9f5656 +size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..033f0bcbe2105b6878d0d509a171d615346a3516 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d17270dce52c14c70476231875e8c627860036cb4bf0b4f2bc96c109461247ce +size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..9cee45ed3f9712247669ef2b476c111a8769b162 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/global_step800/mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6e2f3a34f0a968efda5effc4a358fa3d293e0409a64860f68e54e248fbd2ebf1 +size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/latest new file mode 100644 index 0000000000000000000000000000000000000000..57729c0be88118cbd582c8c68b4149cee821f0b4 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/latest @@ -0,0 +1 @@ +global_step800 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..b5bd31cad92e67fbe581b183c48907d61c6a8c1d --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:18477dae58fc31bc60e92c45b134e4e936c3522287bdd578dbf862f3d5846b4e +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..57ce87db1b9f3b1d904a843391f1a43b4dfa577f --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e908a1887d9a455191fcfba898418cc407f1ae78a40127184b40d7219c7ca832 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..1069068d3077cfddc1bf1ebf22dca2b4e6f64989 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:41b361d5da2c24be640ddf7d969fc85c7221060a0cb54e5ab4ee4785bc34d14d +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..ae386c413fabeb7962faa67715d53eb402527ba5 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70918e93ca8b12f187bb29f08581b7e07520b6ce7bf44db29af9b181f79ca533 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_4.pth new file mode 100644 index 0000000000000000000000000000000000000000..49fa1552f108e8f2b508c7ea3af8dd145ea37c9a --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_4.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:66e449ec34e640cf69fa1586732bbbd78ad736bfdb6ce13ec833b8aa03dff063 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_5.pth new file mode 100644 index 0000000000000000000000000000000000000000..d01fbe9e0ea0cc481cc2fbb005911b03f7ef22ab --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_5.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:71fa1ed0ec03db74fbcd340b4047c9b7f032870214abfd8ad706f1cb4a64ba71 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_6.pth new file mode 100644 index 0000000000000000000000000000000000000000..3a176e77800571ebc41ea296bc388aeb30653409 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_6.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d2ec278daed0dc3773c6dd54394bef72dcd452dce64ad695c5c27d60b500497a +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_7.pth new file mode 100644 index 0000000000000000000000000000000000000000..c086ca8837c1c3d39338972bf79de5f336c4deba --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/rng_state_7.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4c3f96b79c890716a4310c1cf7b3cef55ad1ef8900c98d8079fb2e9b62a86a06 +size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..bd91826e9d23f299fdb2bae445a35337089144fa --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:991fae96e95a86e14f420d2137cda3fb68f453af09b436a8d76fcc42d6c51ba0 +size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..c934c61ce4b42b9133285cfc5302dde8348bde18 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/trainer_state.json @@ -0,0 +1,6443 @@ +{ + "best_global_step": 800, + "best_metric": 0.53971583, + "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800", + "epoch": 2.0, + "eval_steps": 2000, + "global_step": 800, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025031289111389237, + "grad_norm": 7.8950982093811035, + "learning_rate": 3.125e-07, + "loss": 1.4557902812957764, + "step": 1, + "token_acc": 0.6572501632919661 + }, + { + "epoch": 0.0050062578222778474, + "grad_norm": 5.087953090667725, + "learning_rate": 6.25e-07, + "loss": 1.501842737197876, + "step": 2, + "token_acc": 0.6372176822598289 + }, + { + "epoch": 0.007509386733416771, + "grad_norm": 10.051658630371094, + "learning_rate": 9.375e-07, + "loss": 1.4857144355773926, + "step": 3, + "token_acc": 0.6451390326364452 + }, + { + "epoch": 0.010012515644555695, + "grad_norm": 2.0114636421203613, + "learning_rate": 1.25e-06, + "loss": 1.4438570737838745, + "step": 4, + "token_acc": 0.6557932163214628 + }, + { + "epoch": 0.012515644555694618, + "grad_norm": 1.340759038925171, + "learning_rate": 1.5625e-06, + "loss": 1.478323221206665, + "step": 5, + "token_acc": 0.6383258353131477 + }, + { + "epoch": 0.015018773466833541, + "grad_norm": 1.9858087301254272, + "learning_rate": 1.875e-06, + "loss": 1.467094898223877, + "step": 6, + "token_acc": 0.6425992779783394 + }, + { + "epoch": 0.017521902377972465, + "grad_norm": 4.05888032913208, + "learning_rate": 2.1875e-06, + "loss": 1.4478201866149902, + "step": 7, + "token_acc": 0.6590269733576039 + }, + { + "epoch": 0.02002503128911139, + "grad_norm": 1.7842193841934204, + "learning_rate": 2.5e-06, + "loss": 1.4324607849121094, + "step": 8, + "token_acc": 0.6515308296305313 + }, + { + "epoch": 0.02252816020025031, + "grad_norm": 1.832907795906067, + "learning_rate": 2.8125e-06, + "loss": 1.5404188632965088, + "step": 9, + "token_acc": 0.6198423322921315 + }, + { + "epoch": 0.025031289111389236, + "grad_norm": 1.766298770904541, + "learning_rate": 3.125e-06, + "loss": 1.5408222675323486, + "step": 10, + "token_acc": 0.6189591644081732 + }, + { + "epoch": 0.02753441802252816, + "grad_norm": 1.6790711879730225, + "learning_rate": 3.4375000000000005e-06, + "loss": 1.5104762315750122, + "step": 11, + "token_acc": 0.625929823288218 + }, + { + "epoch": 0.030037546933667083, + "grad_norm": 4.442141056060791, + "learning_rate": 3.75e-06, + "loss": 1.4653594493865967, + "step": 12, + "token_acc": 0.6531566141631451 + }, + { + "epoch": 0.03254067584480601, + "grad_norm": 1.7403733730316162, + "learning_rate": 4.0625000000000005e-06, + "loss": 1.4969990253448486, + "step": 13, + "token_acc": 0.6385409694999522 + }, + { + "epoch": 0.03504380475594493, + "grad_norm": 2.5656747817993164, + "learning_rate": 4.375e-06, + "loss": 1.4600821733474731, + "step": 14, + "token_acc": 0.6697823145984504 + }, + { + "epoch": 0.03754693366708386, + "grad_norm": 3.5080008506774902, + "learning_rate": 4.6875000000000004e-06, + "loss": 1.4708112478256226, + "step": 15, + "token_acc": 0.672 + }, + { + "epoch": 0.04005006257822278, + "grad_norm": 3.7129623889923096, + "learning_rate": 5e-06, + "loss": 1.429203987121582, + "step": 16, + "token_acc": 0.6813838550247117 + }, + { + "epoch": 0.0425531914893617, + "grad_norm": 2.3268940448760986, + "learning_rate": 5.3125e-06, + "loss": 1.512415885925293, + "step": 17, + "token_acc": 0.6315401203041653 + }, + { + "epoch": 0.04505632040050062, + "grad_norm": 2.3350868225097656, + "learning_rate": 5.625e-06, + "loss": 1.451557993888855, + "step": 18, + "token_acc": 0.6523656776263032 + }, + { + "epoch": 0.04755944931163955, + "grad_norm": 2.7687199115753174, + "learning_rate": 5.9375e-06, + "loss": 1.4157341718673706, + "step": 19, + "token_acc": 0.6632555400132518 + }, + { + "epoch": 0.05006257822277847, + "grad_norm": 5.971182346343994, + "learning_rate": 6.25e-06, + "loss": 1.4978222846984863, + "step": 20, + "token_acc": 0.6449075630252101 + }, + { + "epoch": 0.052565707133917394, + "grad_norm": 13.349177360534668, + "learning_rate": 6.5625e-06, + "loss": 1.5118396282196045, + "step": 21, + "token_acc": 0.6337731455815501 + }, + { + "epoch": 0.05506883604505632, + "grad_norm": 2.401188611984253, + "learning_rate": 6.875000000000001e-06, + "loss": 1.4671411514282227, + "step": 22, + "token_acc": 0.6508435329143235 + }, + { + "epoch": 0.057571964956195244, + "grad_norm": 3.039811849594116, + "learning_rate": 7.187499999999999e-06, + "loss": 1.4463262557983398, + "step": 23, + "token_acc": 0.6521815519765739 + }, + { + "epoch": 0.060075093867334166, + "grad_norm": 1.9413557052612305, + "learning_rate": 7.5e-06, + "loss": 1.4922974109649658, + "step": 24, + "token_acc": 0.6576568432471525 + }, + { + "epoch": 0.0625782227784731, + "grad_norm": 2.3279271125793457, + "learning_rate": 7.8125e-06, + "loss": 1.4638800621032715, + "step": 25, + "token_acc": 0.6408039991668403 + }, + { + "epoch": 0.06508135168961202, + "grad_norm": 2.4672555923461914, + "learning_rate": 8.125000000000001e-06, + "loss": 1.4635385274887085, + "step": 26, + "token_acc": 0.642543217111046 + }, + { + "epoch": 0.06758448060075094, + "grad_norm": 4.2855987548828125, + "learning_rate": 8.437500000000002e-06, + "loss": 1.4971613883972168, + "step": 27, + "token_acc": 0.643646613752689 + }, + { + "epoch": 0.07008760951188986, + "grad_norm": 4.303065299987793, + "learning_rate": 8.75e-06, + "loss": 1.4926515817642212, + "step": 28, + "token_acc": 0.6576081719186663 + }, + { + "epoch": 0.07259073842302878, + "grad_norm": 4.372646808624268, + "learning_rate": 9.0625e-06, + "loss": 1.4479061365127563, + "step": 29, + "token_acc": 0.6445522674865488 + }, + { + "epoch": 0.07509386733416772, + "grad_norm": 2.5289852619171143, + "learning_rate": 9.375000000000001e-06, + "loss": 1.410093069076538, + "step": 30, + "token_acc": 0.6521535141221733 + }, + { + "epoch": 0.07759699624530664, + "grad_norm": 1.4264651536941528, + "learning_rate": 9.6875e-06, + "loss": 1.425238847732544, + "step": 31, + "token_acc": 0.6520223888478192 + }, + { + "epoch": 0.08010012515644556, + "grad_norm": 2.838380813598633, + "learning_rate": 1e-05, + "loss": 1.4446736574172974, + "step": 32, + "token_acc": 0.6348325214304595 + }, + { + "epoch": 0.08260325406758448, + "grad_norm": 2.671543836593628, + "learning_rate": 1.03125e-05, + "loss": 1.4461638927459717, + "step": 33, + "token_acc": 0.6419955498301909 + }, + { + "epoch": 0.0851063829787234, + "grad_norm": 1.9914096593856812, + "learning_rate": 1.0625e-05, + "loss": 1.355449914932251, + "step": 34, + "token_acc": 0.670728126834997 + }, + { + "epoch": 0.08760951188986232, + "grad_norm": 5.0682525634765625, + "learning_rate": 1.09375e-05, + "loss": 1.3718912601470947, + "step": 35, + "token_acc": 0.6667121046892039 + }, + { + "epoch": 0.09011264080100125, + "grad_norm": 7.020368576049805, + "learning_rate": 1.125e-05, + "loss": 1.4107385873794556, + "step": 36, + "token_acc": 0.6550262102991058 + }, + { + "epoch": 0.09261576971214018, + "grad_norm": 1.664873719215393, + "learning_rate": 1.1562500000000002e-05, + "loss": 1.4824004173278809, + "step": 37, + "token_acc": 0.6308479165622023 + }, + { + "epoch": 0.0951188986232791, + "grad_norm": 2.0821597576141357, + "learning_rate": 1.1875e-05, + "loss": 1.3098841905593872, + "step": 38, + "token_acc": 0.6657222884002447 + }, + { + "epoch": 0.09762202753441802, + "grad_norm": 1.4780006408691406, + "learning_rate": 1.21875e-05, + "loss": 1.41942298412323, + "step": 39, + "token_acc": 0.6341868972397738 + }, + { + "epoch": 0.10012515644555695, + "grad_norm": 8.251653671264648, + "learning_rate": 1.25e-05, + "loss": 1.334580898284912, + "step": 40, + "token_acc": 0.6723917672107877 + }, + { + "epoch": 0.10262828535669587, + "grad_norm": 2.3996059894561768, + "learning_rate": 1.28125e-05, + "loss": 1.3334863185882568, + "step": 41, + "token_acc": 0.6682704982863169 + }, + { + "epoch": 0.10513141426783479, + "grad_norm": 8.757278442382812, + "learning_rate": 1.3125e-05, + "loss": 1.3246387243270874, + "step": 42, + "token_acc": 0.6669556991959641 + }, + { + "epoch": 0.10763454317897372, + "grad_norm": 1.0424623489379883, + "learning_rate": 1.34375e-05, + "loss": 1.344756841659546, + "step": 43, + "token_acc": 0.6592281155670547 + }, + { + "epoch": 0.11013767209011265, + "grad_norm": 3.8542351722717285, + "learning_rate": 1.3750000000000002e-05, + "loss": 1.3171751499176025, + "step": 44, + "token_acc": 0.6736935627170665 + }, + { + "epoch": 0.11264080100125157, + "grad_norm": 25.883697509765625, + "learning_rate": 1.4062500000000001e-05, + "loss": 1.3416380882263184, + "step": 45, + "token_acc": 0.6597396665905458 + }, + { + "epoch": 0.11514392991239049, + "grad_norm": 2.754948139190674, + "learning_rate": 1.4374999999999999e-05, + "loss": 1.2994325160980225, + "step": 46, + "token_acc": 0.6748487114979261 + }, + { + "epoch": 0.11764705882352941, + "grad_norm": 17.700273513793945, + "learning_rate": 1.4687500000000001e-05, + "loss": 1.2871052026748657, + "step": 47, + "token_acc": 0.6900871459694989 + }, + { + "epoch": 0.12015018773466833, + "grad_norm": 2.1236982345581055, + "learning_rate": 1.5e-05, + "loss": 1.3259053230285645, + "step": 48, + "token_acc": 0.6648348053647367 + }, + { + "epoch": 0.12265331664580725, + "grad_norm": 2.8360397815704346, + "learning_rate": 1.5312500000000003e-05, + "loss": 1.3459126949310303, + "step": 49, + "token_acc": 0.6621909900865856 + }, + { + "epoch": 0.1251564455569462, + "grad_norm": 1.8516582250595093, + "learning_rate": 1.5625e-05, + "loss": 1.1977975368499756, + "step": 50, + "token_acc": 0.6965541315513888 + }, + { + "epoch": 0.1276595744680851, + "grad_norm": 2.6509554386138916, + "learning_rate": 1.59375e-05, + "loss": 1.337214708328247, + "step": 51, + "token_acc": 0.6660699367466285 + }, + { + "epoch": 0.13016270337922403, + "grad_norm": 1.3980388641357422, + "learning_rate": 1.6250000000000002e-05, + "loss": 1.3174633979797363, + "step": 52, + "token_acc": 0.6557162021165599 + }, + { + "epoch": 0.13266583229036297, + "grad_norm": 2.930096387863159, + "learning_rate": 1.65625e-05, + "loss": 1.3363032341003418, + "step": 53, + "token_acc": 0.6643487563519658 + }, + { + "epoch": 0.13516896120150187, + "grad_norm": 1.6149736642837524, + "learning_rate": 1.6875000000000004e-05, + "loss": 1.2738587856292725, + "step": 54, + "token_acc": 0.6713186201780416 + }, + { + "epoch": 0.1376720901126408, + "grad_norm": 1.9161509275436401, + "learning_rate": 1.71875e-05, + "loss": 1.3153185844421387, + "step": 55, + "token_acc": 0.6600835945663532 + }, + { + "epoch": 0.14017521902377972, + "grad_norm": 1.3378994464874268, + "learning_rate": 1.75e-05, + "loss": 1.328718662261963, + "step": 56, + "token_acc": 0.6626896519329231 + }, + { + "epoch": 0.14267834793491865, + "grad_norm": 2.1358327865600586, + "learning_rate": 1.7812500000000003e-05, + "loss": 1.2075698375701904, + "step": 57, + "token_acc": 0.6894359429289569 + }, + { + "epoch": 0.14518147684605756, + "grad_norm": 3.4085142612457275, + "learning_rate": 1.8125e-05, + "loss": 1.211951494216919, + "step": 58, + "token_acc": 0.6959001782531195 + }, + { + "epoch": 0.1476846057571965, + "grad_norm": 2.7778501510620117, + "learning_rate": 1.84375e-05, + "loss": 1.1932858228683472, + "step": 59, + "token_acc": 0.6946308724832215 + }, + { + "epoch": 0.15018773466833543, + "grad_norm": 2.009060859680176, + "learning_rate": 1.8750000000000002e-05, + "loss": 1.2468700408935547, + "step": 60, + "token_acc": 0.6771944009298095 + }, + { + "epoch": 0.15269086357947434, + "grad_norm": 5.27526330947876, + "learning_rate": 1.90625e-05, + "loss": 1.260186791419983, + "step": 61, + "token_acc": 0.6741093689401075 + }, + { + "epoch": 0.15519399249061328, + "grad_norm": 2.183293342590332, + "learning_rate": 1.9375e-05, + "loss": 1.2611782550811768, + "step": 62, + "token_acc": 0.670921220067096 + }, + { + "epoch": 0.15769712140175218, + "grad_norm": 1.8381351232528687, + "learning_rate": 1.96875e-05, + "loss": 1.212986707687378, + "step": 63, + "token_acc": 0.691640625 + }, + { + "epoch": 0.16020025031289112, + "grad_norm": 2.4578311443328857, + "learning_rate": 2e-05, + "loss": 1.240574598312378, + "step": 64, + "token_acc": 0.6715244487056568 + }, + { + "epoch": 0.16270337922403003, + "grad_norm": 3.24009108543396, + "learning_rate": 2.0312500000000002e-05, + "loss": 1.2548034191131592, + "step": 65, + "token_acc": 0.6654780476933363 + }, + { + "epoch": 0.16520650813516896, + "grad_norm": 4.743288993835449, + "learning_rate": 2.0625e-05, + "loss": 1.2446942329406738, + "step": 66, + "token_acc": 0.6764411159748959 + }, + { + "epoch": 0.1677096370463079, + "grad_norm": 2.8019979000091553, + "learning_rate": 2.09375e-05, + "loss": 1.18748140335083, + "step": 67, + "token_acc": 0.7129500268672757 + }, + { + "epoch": 0.1702127659574468, + "grad_norm": 2.299891471862793, + "learning_rate": 2.125e-05, + "loss": 1.2521979808807373, + "step": 68, + "token_acc": 0.675844505309692 + }, + { + "epoch": 0.17271589486858574, + "grad_norm": 12.295174598693848, + "learning_rate": 2.1562500000000002e-05, + "loss": 1.203750491142273, + "step": 69, + "token_acc": 0.6892914653784219 + }, + { + "epoch": 0.17521902377972465, + "grad_norm": 1.9590011835098267, + "learning_rate": 2.1875e-05, + "loss": 1.1940397024154663, + "step": 70, + "token_acc": 0.6833531308331919 + }, + { + "epoch": 0.17772215269086358, + "grad_norm": 1.3522539138793945, + "learning_rate": 2.21875e-05, + "loss": 1.224703073501587, + "step": 71, + "token_acc": 0.6722795201010313 + }, + { + "epoch": 0.1802252816020025, + "grad_norm": 5.405593395233154, + "learning_rate": 2.25e-05, + "loss": 1.209501028060913, + "step": 72, + "token_acc": 0.6863064396743154 + }, + { + "epoch": 0.18272841051314143, + "grad_norm": 2.510359525680542, + "learning_rate": 2.28125e-05, + "loss": 1.0670784711837769, + "step": 73, + "token_acc": 0.7204571243313341 + }, + { + "epoch": 0.18523153942428036, + "grad_norm": 3.786830186843872, + "learning_rate": 2.3125000000000003e-05, + "loss": 1.1720937490463257, + "step": 74, + "token_acc": 0.6966354109211252 + }, + { + "epoch": 0.18773466833541927, + "grad_norm": 7.54746675491333, + "learning_rate": 2.34375e-05, + "loss": 1.1647639274597168, + "step": 75, + "token_acc": 0.6920582186362917 + }, + { + "epoch": 0.1902377972465582, + "grad_norm": 3.6000797748565674, + "learning_rate": 2.375e-05, + "loss": 1.01552414894104, + "step": 76, + "token_acc": 0.7369100727870392 + }, + { + "epoch": 0.1927409261576971, + "grad_norm": 2.196979522705078, + "learning_rate": 2.4062500000000002e-05, + "loss": 1.1755733489990234, + "step": 77, + "token_acc": 0.689888875320552 + }, + { + "epoch": 0.19524405506883605, + "grad_norm": 2.5549845695495605, + "learning_rate": 2.4375e-05, + "loss": 1.196420431137085, + "step": 78, + "token_acc": 0.6777883196289268 + }, + { + "epoch": 0.19774718397997496, + "grad_norm": 2.397491455078125, + "learning_rate": 2.4687500000000004e-05, + "loss": 1.2095775604248047, + "step": 79, + "token_acc": 0.6770092547491476 + }, + { + "epoch": 0.2002503128911139, + "grad_norm": 2.3734941482543945, + "learning_rate": 2.5e-05, + "loss": 1.215873122215271, + "step": 80, + "token_acc": 0.6735724510895499 + }, + { + "epoch": 0.20275344180225283, + "grad_norm": 6.307923316955566, + "learning_rate": 2.53125e-05, + "loss": 1.159612774848938, + "step": 81, + "token_acc": 0.6885863267670915 + }, + { + "epoch": 0.20525657071339173, + "grad_norm": 1.9825963973999023, + "learning_rate": 2.5625e-05, + "loss": 1.244891881942749, + "step": 82, + "token_acc": 0.6620401337792642 + }, + { + "epoch": 0.20775969962453067, + "grad_norm": 3.535176992416382, + "learning_rate": 2.5937500000000004e-05, + "loss": 1.1396539211273193, + "step": 83, + "token_acc": 0.6885533874566776 + }, + { + "epoch": 0.21026282853566958, + "grad_norm": 1.6742156744003296, + "learning_rate": 2.625e-05, + "loss": 1.159801959991455, + "step": 84, + "token_acc": 0.6944472387083794 + }, + { + "epoch": 0.2127659574468085, + "grad_norm": 2.6573984622955322, + "learning_rate": 2.6562500000000002e-05, + "loss": 1.0350620746612549, + "step": 85, + "token_acc": 0.7238356649548433 + }, + { + "epoch": 0.21526908635794745, + "grad_norm": 8.295306205749512, + "learning_rate": 2.6875e-05, + "loss": 1.162409782409668, + "step": 86, + "token_acc": 0.6927952399430862 + }, + { + "epoch": 0.21777221526908636, + "grad_norm": 2.998918294906616, + "learning_rate": 2.71875e-05, + "loss": 1.0885825157165527, + "step": 87, + "token_acc": 0.7137596899224806 + }, + { + "epoch": 0.2202753441802253, + "grad_norm": 1.8655437231063843, + "learning_rate": 2.7500000000000004e-05, + "loss": 1.0828857421875, + "step": 88, + "token_acc": 0.7061748303433447 + }, + { + "epoch": 0.2227784730913642, + "grad_norm": 1.323335886001587, + "learning_rate": 2.7812500000000002e-05, + "loss": 1.1780362129211426, + "step": 89, + "token_acc": 0.6848311201719103 + }, + { + "epoch": 0.22528160200250313, + "grad_norm": 5.304930210113525, + "learning_rate": 2.8125000000000003e-05, + "loss": 0.9686488509178162, + "step": 90, + "token_acc": 0.7363368421052632 + }, + { + "epoch": 0.22778473091364204, + "grad_norm": 9.773175239562988, + "learning_rate": 2.84375e-05, + "loss": 1.0577869415283203, + "step": 91, + "token_acc": 0.7114267269205939 + }, + { + "epoch": 0.23028785982478098, + "grad_norm": 2.9195711612701416, + "learning_rate": 2.8749999999999997e-05, + "loss": 1.145928978919983, + "step": 92, + "token_acc": 0.6888570610140361 + }, + { + "epoch": 0.2327909887359199, + "grad_norm": 4.456406116485596, + "learning_rate": 2.9062500000000005e-05, + "loss": 1.0008058547973633, + "step": 93, + "token_acc": 0.7271467433146847 + }, + { + "epoch": 0.23529411764705882, + "grad_norm": 1.3492659330368042, + "learning_rate": 2.9375000000000003e-05, + "loss": 1.1630926132202148, + "step": 94, + "token_acc": 0.6865543948126801 + }, + { + "epoch": 0.23779724655819776, + "grad_norm": 33.28302001953125, + "learning_rate": 2.96875e-05, + "loss": 1.0794365406036377, + "step": 95, + "token_acc": 0.6955025569946949 + }, + { + "epoch": 0.24030037546933666, + "grad_norm": 4.188589572906494, + "learning_rate": 3e-05, + "loss": 0.981617271900177, + "step": 96, + "token_acc": 0.7421242124212422 + }, + { + "epoch": 0.2428035043804756, + "grad_norm": 4.019721031188965, + "learning_rate": 3.0312499999999998e-05, + "loss": 1.1217559576034546, + "step": 97, + "token_acc": 0.6885376192158248 + }, + { + "epoch": 0.2453066332916145, + "grad_norm": 3.235391616821289, + "learning_rate": 3.0625000000000006e-05, + "loss": 1.1427521705627441, + "step": 98, + "token_acc": 0.6908890062917247 + }, + { + "epoch": 0.24780976220275344, + "grad_norm": 2.8775594234466553, + "learning_rate": 3.09375e-05, + "loss": 1.0406608581542969, + "step": 99, + "token_acc": 0.7161332040090527 + }, + { + "epoch": 0.2503128911138924, + "grad_norm": 3.2784032821655273, + "learning_rate": 3.125e-05, + "loss": 1.0470802783966064, + "step": 100, + "token_acc": 0.7107116506807968 + }, + { + "epoch": 0.2528160200250313, + "grad_norm": 10.006264686584473, + "learning_rate": 3.15625e-05, + "loss": 1.1033154726028442, + "step": 101, + "token_acc": 0.6993850520340587 + }, + { + "epoch": 0.2553191489361702, + "grad_norm": 3.128004789352417, + "learning_rate": 3.1875e-05, + "loss": 1.0931888818740845, + "step": 102, + "token_acc": 0.6994311184094775 + }, + { + "epoch": 0.25782227784730916, + "grad_norm": 1.6552213430404663, + "learning_rate": 3.21875e-05, + "loss": 1.0672286748886108, + "step": 103, + "token_acc": 0.7047883009372379 + }, + { + "epoch": 0.26032540675844806, + "grad_norm": 2.4581258296966553, + "learning_rate": 3.2500000000000004e-05, + "loss": 1.0013254880905151, + "step": 104, + "token_acc": 0.7210549515133705 + }, + { + "epoch": 0.26282853566958697, + "grad_norm": 1.6132698059082031, + "learning_rate": 3.2812500000000005e-05, + "loss": 1.057444453239441, + "step": 105, + "token_acc": 0.7100988496444881 + }, + { + "epoch": 0.26533166458072593, + "grad_norm": 1.5642213821411133, + "learning_rate": 3.3125e-05, + "loss": 1.123189926147461, + "step": 106, + "token_acc": 0.6890246836356637 + }, + { + "epoch": 0.26783479349186484, + "grad_norm": 2.402168035507202, + "learning_rate": 3.34375e-05, + "loss": 1.0398962497711182, + "step": 107, + "token_acc": 0.7146073548475131 + }, + { + "epoch": 0.27033792240300375, + "grad_norm": 6.666412830352783, + "learning_rate": 3.375000000000001e-05, + "loss": 0.9815630316734314, + "step": 108, + "token_acc": 0.7229632010284429 + }, + { + "epoch": 0.27284105131414266, + "grad_norm": 2.724987030029297, + "learning_rate": 3.40625e-05, + "loss": 1.0755481719970703, + "step": 109, + "token_acc": 0.6945715806279936 + }, + { + "epoch": 0.2753441802252816, + "grad_norm": 2.264068841934204, + "learning_rate": 3.4375e-05, + "loss": 1.0846197605133057, + "step": 110, + "token_acc": 0.7066835081553078 + }, + { + "epoch": 0.27784730913642053, + "grad_norm": 2.5315089225769043, + "learning_rate": 3.46875e-05, + "loss": 0.964267373085022, + "step": 111, + "token_acc": 0.7342624854819977 + }, + { + "epoch": 0.28035043804755944, + "grad_norm": 15.30518627166748, + "learning_rate": 3.5e-05, + "loss": 0.9664145708084106, + "step": 112, + "token_acc": 0.7298946944798443 + }, + { + "epoch": 0.2828535669586984, + "grad_norm": 2.818232297897339, + "learning_rate": 3.5312500000000005e-05, + "loss": 1.0291664600372314, + "step": 113, + "token_acc": 0.7168817487490123 + }, + { + "epoch": 0.2853566958698373, + "grad_norm": 7.732123851776123, + "learning_rate": 3.5625000000000005e-05, + "loss": 1.0101385116577148, + "step": 114, + "token_acc": 0.717198464186416 + }, + { + "epoch": 0.2878598247809762, + "grad_norm": 3.8363802433013916, + "learning_rate": 3.59375e-05, + "loss": 1.1273301839828491, + "step": 115, + "token_acc": 0.688773189101754 + }, + { + "epoch": 0.2903629536921151, + "grad_norm": 3.1989147663116455, + "learning_rate": 3.625e-05, + "loss": 1.044485092163086, + "step": 116, + "token_acc": 0.7092324805339266 + }, + { + "epoch": 0.2928660826032541, + "grad_norm": 2.878786087036133, + "learning_rate": 3.65625e-05, + "loss": 0.8934916257858276, + "step": 117, + "token_acc": 0.7590650284686844 + }, + { + "epoch": 0.295369211514393, + "grad_norm": 2.4027316570281982, + "learning_rate": 3.6875e-05, + "loss": 1.0810887813568115, + "step": 118, + "token_acc": 0.700803104619199 + }, + { + "epoch": 0.2978723404255319, + "grad_norm": 2.034160852432251, + "learning_rate": 3.71875e-05, + "loss": 1.0755298137664795, + "step": 119, + "token_acc": 0.7013630188017707 + }, + { + "epoch": 0.30037546933667086, + "grad_norm": 4.220553874969482, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.9945212602615356, + "step": 120, + "token_acc": 0.7199625446245684 + }, + { + "epoch": 0.30287859824780977, + "grad_norm": 2.564206600189209, + "learning_rate": 3.78125e-05, + "loss": 1.0152537822723389, + "step": 121, + "token_acc": 0.7179334916864608 + }, + { + "epoch": 0.3053817271589487, + "grad_norm": 1.7850531339645386, + "learning_rate": 3.8125e-05, + "loss": 0.9843083024024963, + "step": 122, + "token_acc": 0.7254917512690355 + }, + { + "epoch": 0.3078848560700876, + "grad_norm": 3.826921224594116, + "learning_rate": 3.8437500000000006e-05, + "loss": 1.0854582786560059, + "step": 123, + "token_acc": 0.6981124383382934 + }, + { + "epoch": 0.31038798498122655, + "grad_norm": 2.541259765625, + "learning_rate": 3.875e-05, + "loss": 1.029062032699585, + "step": 124, + "token_acc": 0.7140036666196588 + }, + { + "epoch": 0.31289111389236546, + "grad_norm": 2.901413917541504, + "learning_rate": 3.90625e-05, + "loss": 0.9238264560699463, + "step": 125, + "token_acc": 0.7398554752640356 + }, + { + "epoch": 0.31539424280350437, + "grad_norm": 3.516462564468384, + "learning_rate": 3.9375e-05, + "loss": 0.9085039496421814, + "step": 126, + "token_acc": 0.7436048965808358 + }, + { + "epoch": 0.31789737171464333, + "grad_norm": 19.986804962158203, + "learning_rate": 3.96875e-05, + "loss": 0.8704398274421692, + "step": 127, + "token_acc": 0.7592660550458715 + }, + { + "epoch": 0.32040050062578224, + "grad_norm": 2.4190216064453125, + "learning_rate": 4e-05, + "loss": 1.0086506605148315, + "step": 128, + "token_acc": 0.7155834613586267 + }, + { + "epoch": 0.32290362953692114, + "grad_norm": 10.030716896057129, + "learning_rate": 4.0312500000000004e-05, + "loss": 0.9949646592140198, + "step": 129, + "token_acc": 0.7203355704697987 + }, + { + "epoch": 0.32540675844806005, + "grad_norm": 12.682878494262695, + "learning_rate": 4.0625000000000005e-05, + "loss": 0.9811956882476807, + "step": 130, + "token_acc": 0.7252892752288297 + }, + { + "epoch": 0.327909887359199, + "grad_norm": 2.5325679779052734, + "learning_rate": 4.09375e-05, + "loss": 0.8768625259399414, + "step": 131, + "token_acc": 0.7590881616440722 + }, + { + "epoch": 0.3304130162703379, + "grad_norm": 3.471003532409668, + "learning_rate": 4.125e-05, + "loss": 0.976413905620575, + "step": 132, + "token_acc": 0.7229185085027823 + }, + { + "epoch": 0.33291614518147683, + "grad_norm": 2.5259780883789062, + "learning_rate": 4.156250000000001e-05, + "loss": 1.0195640325546265, + "step": 133, + "token_acc": 0.7145907169392374 + }, + { + "epoch": 0.3354192740926158, + "grad_norm": 2.968695640563965, + "learning_rate": 4.1875e-05, + "loss": 0.9508498311042786, + "step": 134, + "token_acc": 0.7329253710346768 + }, + { + "epoch": 0.3379224030037547, + "grad_norm": 6.434828281402588, + "learning_rate": 4.21875e-05, + "loss": 0.877600371837616, + "step": 135, + "token_acc": 0.7561930872417507 + }, + { + "epoch": 0.3404255319148936, + "grad_norm": 2.5651018619537354, + "learning_rate": 4.25e-05, + "loss": 1.044579267501831, + "step": 136, + "token_acc": 0.7108454096075035 + }, + { + "epoch": 0.3429286608260325, + "grad_norm": 2.949556589126587, + "learning_rate": 4.28125e-05, + "loss": 1.0095362663269043, + "step": 137, + "token_acc": 0.716402739139739 + }, + { + "epoch": 0.3454317897371715, + "grad_norm": 5.174262046813965, + "learning_rate": 4.3125000000000005e-05, + "loss": 0.8357698917388916, + "step": 138, + "token_acc": 0.7733576272902115 + }, + { + "epoch": 0.3479349186483104, + "grad_norm": 2.26728892326355, + "learning_rate": 4.3437500000000006e-05, + "loss": 0.951337456703186, + "step": 139, + "token_acc": 0.7335539120280264 + }, + { + "epoch": 0.3504380475594493, + "grad_norm": 10.75383186340332, + "learning_rate": 4.375e-05, + "loss": 0.895291805267334, + "step": 140, + "token_acc": 0.7494621262704948 + }, + { + "epoch": 0.35294117647058826, + "grad_norm": 16.128704071044922, + "learning_rate": 4.40625e-05, + "loss": 0.8901827335357666, + "step": 141, + "token_acc": 0.7465124430424115 + }, + { + "epoch": 0.35544430538172717, + "grad_norm": 9.271828651428223, + "learning_rate": 4.4375e-05, + "loss": 1.0329668521881104, + "step": 142, + "token_acc": 0.7120498030388295 + }, + { + "epoch": 0.3579474342928661, + "grad_norm": 4.020982265472412, + "learning_rate": 4.46875e-05, + "loss": 0.8827842473983765, + "step": 143, + "token_acc": 0.7564152259865106 + }, + { + "epoch": 0.360450563204005, + "grad_norm": 2.2052903175354004, + "learning_rate": 4.5e-05, + "loss": 0.9577807784080505, + "step": 144, + "token_acc": 0.7318331737418874 + }, + { + "epoch": 0.36295369211514394, + "grad_norm": 1.911048173904419, + "learning_rate": 4.5312500000000004e-05, + "loss": 0.9372326135635376, + "step": 145, + "token_acc": 0.7335442645325393 + }, + { + "epoch": 0.36545682102628285, + "grad_norm": 2.1569759845733643, + "learning_rate": 4.5625e-05, + "loss": 0.9250544309616089, + "step": 146, + "token_acc": 0.7350609269408822 + }, + { + "epoch": 0.36795994993742176, + "grad_norm": 90.4991455078125, + "learning_rate": 4.59375e-05, + "loss": 0.8544453382492065, + "step": 147, + "token_acc": 0.755140870837907 + }, + { + "epoch": 0.3704630788485607, + "grad_norm": 4.5008697509765625, + "learning_rate": 4.6250000000000006e-05, + "loss": 0.9220091700553894, + "step": 148, + "token_acc": 0.7407507914970601 + }, + { + "epoch": 0.37296620775969963, + "grad_norm": 1.819976806640625, + "learning_rate": 4.65625e-05, + "loss": 1.0421748161315918, + "step": 149, + "token_acc": 0.7048270166100762 + }, + { + "epoch": 0.37546933667083854, + "grad_norm": 2.314004898071289, + "learning_rate": 4.6875e-05, + "loss": 0.9764658212661743, + "step": 150, + "token_acc": 0.7197187404463466 + }, + { + "epoch": 0.37797246558197745, + "grad_norm": 1.502142310142517, + "learning_rate": 4.71875e-05, + "loss": 1.020967721939087, + "step": 151, + "token_acc": 0.7136980898179974 + }, + { + "epoch": 0.3804755944931164, + "grad_norm": 2.8821356296539307, + "learning_rate": 4.75e-05, + "loss": 0.8627139925956726, + "step": 152, + "token_acc": 0.7503271575177354 + }, + { + "epoch": 0.3829787234042553, + "grad_norm": 5.202376365661621, + "learning_rate": 4.7812500000000003e-05, + "loss": 1.0209362506866455, + "step": 153, + "token_acc": 0.7102290932393464 + }, + { + "epoch": 0.3854818523153942, + "grad_norm": 2.1695210933685303, + "learning_rate": 4.8125000000000004e-05, + "loss": 0.8892765641212463, + "step": 154, + "token_acc": 0.746233887249573 + }, + { + "epoch": 0.3879849812265332, + "grad_norm": 1.2071388959884644, + "learning_rate": 4.8437500000000005e-05, + "loss": 0.9921320080757141, + "step": 155, + "token_acc": 0.7195179708467084 + }, + { + "epoch": 0.3904881101376721, + "grad_norm": 3.7766385078430176, + "learning_rate": 4.875e-05, + "loss": 0.8882246613502502, + "step": 156, + "token_acc": 0.7476656291685193 + }, + { + "epoch": 0.392991239048811, + "grad_norm": 4.709662437438965, + "learning_rate": 4.90625e-05, + "loss": 0.9586931467056274, + "step": 157, + "token_acc": 0.7263681592039801 + }, + { + "epoch": 0.3954943679599499, + "grad_norm": 4.0463080406188965, + "learning_rate": 4.937500000000001e-05, + "loss": 0.8552154302597046, + "step": 158, + "token_acc": 0.7541220115416323 + }, + { + "epoch": 0.3979974968710889, + "grad_norm": 2.8410274982452393, + "learning_rate": 4.96875e-05, + "loss": 0.8899470567703247, + "step": 159, + "token_acc": 0.7499725304911549 + }, + { + "epoch": 0.4005006257822278, + "grad_norm": 2.9422967433929443, + "learning_rate": 5e-05, + "loss": 0.9451851844787598, + "step": 160, + "token_acc": 0.7286368400728196 + }, + { + "epoch": 0.4030037546933667, + "grad_norm": 3.18597412109375, + "learning_rate": 4.9999698804181425e-05, + "loss": 0.8761780858039856, + "step": 161, + "token_acc": 0.7598903251077164 + }, + { + "epoch": 0.40550688360450565, + "grad_norm": 1.9840060472488403, + "learning_rate": 4.9998795223983205e-05, + "loss": 0.8826810121536255, + "step": 162, + "token_acc": 0.744661338923097 + }, + { + "epoch": 0.40801001251564456, + "grad_norm": 21.6531925201416, + "learning_rate": 4.99972892811777e-05, + "loss": 0.8482328653335571, + "step": 163, + "token_acc": 0.7538179596823458 + }, + { + "epoch": 0.41051314142678347, + "grad_norm": 2.402557373046875, + "learning_rate": 4.9995181012051625e-05, + "loss": 1.031351089477539, + "step": 164, + "token_acc": 0.7049064787205205 + }, + { + "epoch": 0.4130162703379224, + "grad_norm": 2.2513351440429688, + "learning_rate": 4.9992470467405104e-05, + "loss": 0.9314454793930054, + "step": 165, + "token_acc": 0.7308264872911727 + }, + { + "epoch": 0.41551939924906134, + "grad_norm": 1.2842321395874023, + "learning_rate": 4.998915771255053e-05, + "loss": 0.9550535678863525, + "step": 166, + "token_acc": 0.7228157276475021 + }, + { + "epoch": 0.41802252816020025, + "grad_norm": 2.6976544857025146, + "learning_rate": 4.9985242827310936e-05, + "loss": 0.8689353466033936, + "step": 167, + "token_acc": 0.7488272087568413 + }, + { + "epoch": 0.42052565707133915, + "grad_norm": 1.9013776779174805, + "learning_rate": 4.9980725906018074e-05, + "loss": 0.9480851888656616, + "step": 168, + "token_acc": 0.7256708860759493 + }, + { + "epoch": 0.4230287859824781, + "grad_norm": 2.0147554874420166, + "learning_rate": 4.9975607057510185e-05, + "loss": 0.792317807674408, + "step": 169, + "token_acc": 0.77470701416827 + }, + { + "epoch": 0.425531914893617, + "grad_norm": 5.95169734954834, + "learning_rate": 4.996988640512931e-05, + "loss": 0.8363028168678284, + "step": 170, + "token_acc": 0.7643083597530452 + }, + { + "epoch": 0.42803504380475593, + "grad_norm": 3.004988670349121, + "learning_rate": 4.99635640867184e-05, + "loss": 0.8463314175605774, + "step": 171, + "token_acc": 0.7617599713825791 + }, + { + "epoch": 0.4305381727158949, + "grad_norm": 6.122714996337891, + "learning_rate": 4.9956640254617906e-05, + "loss": 0.8169602751731873, + "step": 172, + "token_acc": 0.7588180032453669 + }, + { + "epoch": 0.4330413016270338, + "grad_norm": 2.14045786857605, + "learning_rate": 4.994911507566217e-05, + "loss": 1.0029940605163574, + "step": 173, + "token_acc": 0.712219074598678 + }, + { + "epoch": 0.4355444305381727, + "grad_norm": 1.9638121128082275, + "learning_rate": 4.99409887311754e-05, + "loss": 0.9134575128555298, + "step": 174, + "token_acc": 0.7453976298725498 + }, + { + "epoch": 0.4380475594493116, + "grad_norm": 6.963588237762451, + "learning_rate": 4.993226141696726e-05, + "loss": 0.8294797539710999, + "step": 175, + "token_acc": 0.7652689152233364 + }, + { + "epoch": 0.4405506883604506, + "grad_norm": 2.013535261154175, + "learning_rate": 4.99229333433282e-05, + "loss": 0.9168058037757874, + "step": 176, + "token_acc": 0.7364463791056589 + }, + { + "epoch": 0.4430538172715895, + "grad_norm": 1.502765417098999, + "learning_rate": 4.991300473502437e-05, + "loss": 0.862735390663147, + "step": 177, + "token_acc": 0.7555572888230248 + }, + { + "epoch": 0.4455569461827284, + "grad_norm": 2.0426056385040283, + "learning_rate": 4.9902475831292185e-05, + "loss": 1.006132960319519, + "step": 178, + "token_acc": 0.711357628807904 + }, + { + "epoch": 0.44806007509386736, + "grad_norm": 2.3713955879211426, + "learning_rate": 4.9891346885832586e-05, + "loss": 0.8480299711227417, + "step": 179, + "token_acc": 0.7630771926750197 + }, + { + "epoch": 0.45056320400500627, + "grad_norm": 1.9472578763961792, + "learning_rate": 4.987961816680492e-05, + "loss": 0.9099956750869751, + "step": 180, + "token_acc": 0.744568097509274 + }, + { + "epoch": 0.4530663329161452, + "grad_norm": 5.378758907318115, + "learning_rate": 4.986728995682049e-05, + "loss": 0.8087277412414551, + "step": 181, + "token_acc": 0.7657945736434109 + }, + { + "epoch": 0.4555694618272841, + "grad_norm": 1.7415252923965454, + "learning_rate": 4.9854362552935706e-05, + "loss": 0.9494457244873047, + "step": 182, + "token_acc": 0.7285589688923345 + }, + { + "epoch": 0.45807259073842305, + "grad_norm": 3.286355495452881, + "learning_rate": 4.984083626664497e-05, + "loss": 0.9584786295890808, + "step": 183, + "token_acc": 0.729500568710578 + }, + { + "epoch": 0.46057571964956195, + "grad_norm": 1.2414660453796387, + "learning_rate": 4.982671142387316e-05, + "loss": 0.9425086975097656, + "step": 184, + "token_acc": 0.7302265729123582 + }, + { + "epoch": 0.46307884856070086, + "grad_norm": 2.1618587970733643, + "learning_rate": 4.981198836496775e-05, + "loss": 0.8545800447463989, + "step": 185, + "token_acc": 0.7508434073657576 + }, + { + "epoch": 0.4655819774718398, + "grad_norm": 2.7464194297790527, + "learning_rate": 4.979666744469065e-05, + "loss": 1.0033760070800781, + "step": 186, + "token_acc": 0.7168112389213652 + }, + { + "epoch": 0.46808510638297873, + "grad_norm": 2.1117477416992188, + "learning_rate": 4.978074903220963e-05, + "loss": 0.8726233839988708, + "step": 187, + "token_acc": 0.7512896094325718 + }, + { + "epoch": 0.47058823529411764, + "grad_norm": 2.3225831985473633, + "learning_rate": 4.976423351108943e-05, + "loss": 0.9832717776298523, + "step": 188, + "token_acc": 0.7242706131078224 + }, + { + "epoch": 0.47309136420525655, + "grad_norm": 1.5692338943481445, + "learning_rate": 4.9747121279282525e-05, + "loss": 0.8374819755554199, + "step": 189, + "token_acc": 0.7515348246418743 + }, + { + "epoch": 0.4755944931163955, + "grad_norm": 2.915736436843872, + "learning_rate": 4.972941274911953e-05, + "loss": 0.8508638143539429, + "step": 190, + "token_acc": 0.7552318044323724 + }, + { + "epoch": 0.4780976220275344, + "grad_norm": 2.509810209274292, + "learning_rate": 4.971110834729925e-05, + "loss": 0.8711614608764648, + "step": 191, + "token_acc": 0.748834597023308 + }, + { + "epoch": 0.4806007509386733, + "grad_norm": 38.909141540527344, + "learning_rate": 4.9692208514878444e-05, + "loss": 0.8127565383911133, + "step": 192, + "token_acc": 0.7634650994283874 + }, + { + "epoch": 0.4831038798498123, + "grad_norm": 2.6864702701568604, + "learning_rate": 4.9672713707261146e-05, + "loss": 0.8236993551254272, + "step": 193, + "token_acc": 0.7607028125614633 + }, + { + "epoch": 0.4856070087609512, + "grad_norm": 1.8782848119735718, + "learning_rate": 4.965262439418772e-05, + "loss": 0.9363845586776733, + "step": 194, + "token_acc": 0.7292962883501395 + }, + { + "epoch": 0.4881101376720901, + "grad_norm": 15.927218437194824, + "learning_rate": 4.963194105972353e-05, + "loss": 0.7871609926223755, + "step": 195, + "token_acc": 0.7660380466112163 + }, + { + "epoch": 0.490613266583229, + "grad_norm": 5.428698539733887, + "learning_rate": 4.9610664202247294e-05, + "loss": 0.8945263028144836, + "step": 196, + "token_acc": 0.733186463496726 + }, + { + "epoch": 0.493116395494368, + "grad_norm": 4.436823844909668, + "learning_rate": 4.958879433443904e-05, + "loss": 0.8039653897285461, + "step": 197, + "token_acc": 0.767208630907157 + }, + { + "epoch": 0.4956195244055069, + "grad_norm": 1.1804406642913818, + "learning_rate": 4.95663319832678e-05, + "loss": 0.993769109249115, + "step": 198, + "token_acc": 0.7182901803257216 + }, + { + "epoch": 0.4981226533166458, + "grad_norm": 34.3048095703125, + "learning_rate": 4.954327768997886e-05, + "loss": 0.8885359764099121, + "step": 199, + "token_acc": 0.7376394368941498 + }, + { + "epoch": 0.5006257822277848, + "grad_norm": 3.2417330741882324, + "learning_rate": 4.951963201008076e-05, + "loss": 0.8299421072006226, + "step": 200, + "token_acc": 0.7590844540974021 + }, + { + "epoch": 0.5031289111389237, + "grad_norm": 1.7213491201400757, + "learning_rate": 4.949539551333191e-05, + "loss": 0.8799647092819214, + "step": 201, + "token_acc": 0.7460959726876146 + }, + { + "epoch": 0.5056320400500626, + "grad_norm": 3.129983901977539, + "learning_rate": 4.947056878372681e-05, + "loss": 0.7674298286437988, + "step": 202, + "token_acc": 0.7778585271317829 + }, + { + "epoch": 0.5081351689612015, + "grad_norm": 1.7732640504837036, + "learning_rate": 4.944515241948204e-05, + "loss": 0.8905498385429382, + "step": 203, + "token_acc": 0.7450012817226352 + }, + { + "epoch": 0.5106382978723404, + "grad_norm": 1.5776193141937256, + "learning_rate": 4.9419147033021814e-05, + "loss": 0.9746031761169434, + "step": 204, + "token_acc": 0.7222505091649695 + }, + { + "epoch": 0.5131414267834794, + "grad_norm": 2.398367166519165, + "learning_rate": 4.9392553250963215e-05, + "loss": 0.8019765019416809, + "step": 205, + "token_acc": 0.7681595784719608 + }, + { + "epoch": 0.5156445556946183, + "grad_norm": 2.5589308738708496, + "learning_rate": 4.936537171410113e-05, + "loss": 0.9508465528488159, + "step": 206, + "token_acc": 0.7260439407311069 + }, + { + "epoch": 0.5181476846057572, + "grad_norm": 30.68482780456543, + "learning_rate": 4.933760307739277e-05, + "loss": 0.8822273015975952, + "step": 207, + "token_acc": 0.7461445679331438 + }, + { + "epoch": 0.5206508135168961, + "grad_norm": 1.6417980194091797, + "learning_rate": 4.9309248009941914e-05, + "loss": 0.7858006954193115, + "step": 208, + "token_acc": 0.7672451193058568 + }, + { + "epoch": 0.523153942428035, + "grad_norm": 1.7159936428070068, + "learning_rate": 4.92803071949828e-05, + "loss": 0.9309002757072449, + "step": 209, + "token_acc": 0.7286675639300134 + }, + { + "epoch": 0.5256570713391739, + "grad_norm": 2.5000967979431152, + "learning_rate": 4.9250781329863606e-05, + "loss": 0.9468393921852112, + "step": 210, + "token_acc": 0.7337789370720574 + }, + { + "epoch": 0.5281602002503129, + "grad_norm": 4.127990245819092, + "learning_rate": 4.92206711260297e-05, + "loss": 0.9223999977111816, + "step": 211, + "token_acc": 0.7299156498239292 + }, + { + "epoch": 0.5306633291614519, + "grad_norm": 2.085132598876953, + "learning_rate": 4.9189977309006495e-05, + "loss": 0.9442908763885498, + "step": 212, + "token_acc": 0.728492959925731 + }, + { + "epoch": 0.5331664580725908, + "grad_norm": 1.8777406215667725, + "learning_rate": 4.915870061838193e-05, + "loss": 0.8923409581184387, + "step": 213, + "token_acc": 0.7408707865168539 + }, + { + "epoch": 0.5356695869837297, + "grad_norm": 1.6103774309158325, + "learning_rate": 4.912684180778869e-05, + "loss": 0.8582785725593567, + "step": 214, + "token_acc": 0.7472986748216106 + }, + { + "epoch": 0.5381727158948686, + "grad_norm": 5.4966020584106445, + "learning_rate": 4.9094401644886e-05, + "loss": 0.980675220489502, + "step": 215, + "token_acc": 0.7182641448950152 + }, + { + "epoch": 0.5406758448060075, + "grad_norm": 2.9030697345733643, + "learning_rate": 4.906138091134118e-05, + "loss": 0.9365415573120117, + "step": 216, + "token_acc": 0.730092204526404 + }, + { + "epoch": 0.5431789737171464, + "grad_norm": 4.844046115875244, + "learning_rate": 4.90277804028108e-05, + "loss": 0.738396942615509, + "step": 217, + "token_acc": 0.7914989692745656 + }, + { + "epoch": 0.5456821026282853, + "grad_norm": 1.5353028774261475, + "learning_rate": 4.8993600928921434e-05, + "loss": 0.9523649215698242, + "step": 218, + "token_acc": 0.7237939963556153 + }, + { + "epoch": 0.5481852315394243, + "grad_norm": 32.93247604370117, + "learning_rate": 4.8958843313250294e-05, + "loss": 0.7531812787055969, + "step": 219, + "token_acc": 0.7850740452065471 + }, + { + "epoch": 0.5506883604505632, + "grad_norm": 2.059149742126465, + "learning_rate": 4.892350839330522e-05, + "loss": 0.8953914642333984, + "step": 220, + "token_acc": 0.7396288209606987 + }, + { + "epoch": 0.5531914893617021, + "grad_norm": 3.8497390747070312, + "learning_rate": 4.888759702050466e-05, + "loss": 0.8436079025268555, + "step": 221, + "token_acc": 0.7543846828412745 + }, + { + "epoch": 0.5556946182728411, + "grad_norm": 1.9176925420761108, + "learning_rate": 4.885111006015701e-05, + "loss": 0.8814166188240051, + "step": 222, + "token_acc": 0.7467446887026201 + }, + { + "epoch": 0.55819774718398, + "grad_norm": 1.9749252796173096, + "learning_rate": 4.881404839143988e-05, + "loss": 0.8513644337654114, + "step": 223, + "token_acc": 0.7457374830852503 + }, + { + "epoch": 0.5607008760951189, + "grad_norm": 4.914273262023926, + "learning_rate": 4.877641290737884e-05, + "loss": 0.8055661916732788, + "step": 224, + "token_acc": 0.7624061257546753 + }, + { + "epoch": 0.5632040050062578, + "grad_norm": 31.535110473632812, + "learning_rate": 4.873820451482592e-05, + "loss": 0.8872958421707153, + "step": 225, + "token_acc": 0.7492080569003646 + }, + { + "epoch": 0.5657071339173968, + "grad_norm": 2.174323320388794, + "learning_rate": 4.8699424134437765e-05, + "loss": 0.8905588388442993, + "step": 226, + "token_acc": 0.7426990645676478 + }, + { + "epoch": 0.5682102628285357, + "grad_norm": 2.537534713745117, + "learning_rate": 4.8660072700653445e-05, + "loss": 0.8442504405975342, + "step": 227, + "token_acc": 0.759594451701188 + }, + { + "epoch": 0.5707133917396746, + "grad_norm": 2.5602848529815674, + "learning_rate": 4.862015116167196e-05, + "loss": 0.8962931632995605, + "step": 228, + "token_acc": 0.7412289395441031 + }, + { + "epoch": 0.5732165206508135, + "grad_norm": 7.3618927001953125, + "learning_rate": 4.857966047942933e-05, + "loss": 0.8395902514457703, + "step": 229, + "token_acc": 0.7582629846902275 + }, + { + "epoch": 0.5757196495619524, + "grad_norm": 3.7751402854919434, + "learning_rate": 4.853860162957552e-05, + "loss": 0.8951698541641235, + "step": 230, + "token_acc": 0.7401862711279752 + }, + { + "epoch": 0.5782227784730913, + "grad_norm": 1.730199933052063, + "learning_rate": 4.849697560145083e-05, + "loss": 0.6874003410339355, + "step": 231, + "token_acc": 0.7996880161497523 + }, + { + "epoch": 0.5807259073842302, + "grad_norm": 1.931376576423645, + "learning_rate": 4.8454783398062106e-05, + "loss": 0.8303564190864563, + "step": 232, + "token_acc": 0.7600831909678378 + }, + { + "epoch": 0.5832290362953693, + "grad_norm": 2.0311784744262695, + "learning_rate": 4.8412026036058566e-05, + "loss": 0.8384573459625244, + "step": 233, + "token_acc": 0.7549541998443393 + }, + { + "epoch": 0.5857321652065082, + "grad_norm": 1.0220412015914917, + "learning_rate": 4.836870454570731e-05, + "loss": 0.8069633841514587, + "step": 234, + "token_acc": 0.7599480377410092 + }, + { + "epoch": 0.5882352941176471, + "grad_norm": 3.729283571243286, + "learning_rate": 4.8324819970868473e-05, + "loss": 0.8110902309417725, + "step": 235, + "token_acc": 0.7580623121071332 + }, + { + "epoch": 0.590738423028786, + "grad_norm": 1.758043646812439, + "learning_rate": 4.828037336897009e-05, + "loss": 0.856610894203186, + "step": 236, + "token_acc": 0.746238951003922 + }, + { + "epoch": 0.5932415519399249, + "grad_norm": 4.306615829467773, + "learning_rate": 4.8235365810982615e-05, + "loss": 0.9790533781051636, + "step": 237, + "token_acc": 0.7135992011483493 + }, + { + "epoch": 0.5957446808510638, + "grad_norm": 1.5020512342453003, + "learning_rate": 4.8189798381393104e-05, + "loss": 0.7993966937065125, + "step": 238, + "token_acc": 0.7609775641025641 + }, + { + "epoch": 0.5982478097622027, + "grad_norm": 1.6187368631362915, + "learning_rate": 4.81436721781791e-05, + "loss": 0.8823633193969727, + "step": 239, + "token_acc": 0.7474736257634648 + }, + { + "epoch": 0.6007509386733417, + "grad_norm": 2.4625823497772217, + "learning_rate": 4.8096988312782174e-05, + "loss": 0.8518728017807007, + "step": 240, + "token_acc": 0.748145340336817 + }, + { + "epoch": 0.6032540675844806, + "grad_norm": 5.807409286499023, + "learning_rate": 4.8049747910081117e-05, + "loss": 0.6972458362579346, + "step": 241, + "token_acc": 0.7948159442387279 + }, + { + "epoch": 0.6057571964956195, + "grad_norm": 2.591768503189087, + "learning_rate": 4.8001952108364876e-05, + "loss": 0.9044586420059204, + "step": 242, + "token_acc": 0.7324852097326632 + }, + { + "epoch": 0.6082603254067585, + "grad_norm": 2.5517194271087646, + "learning_rate": 4.79536020593051e-05, + "loss": 0.9304581880569458, + "step": 243, + "token_acc": 0.727802037845706 + }, + { + "epoch": 0.6107634543178974, + "grad_norm": 2.617535352706909, + "learning_rate": 4.7904698927928406e-05, + "loss": 0.8499206304550171, + "step": 244, + "token_acc": 0.7519966664351692 + }, + { + "epoch": 0.6132665832290363, + "grad_norm": 1.3205288648605347, + "learning_rate": 4.785524389258827e-05, + "loss": 0.9406691789627075, + "step": 245, + "token_acc": 0.7282037303843308 + }, + { + "epoch": 0.6157697121401752, + "grad_norm": 1.9039998054504395, + "learning_rate": 4.7805238144936694e-05, + "loss": 0.8956192135810852, + "step": 246, + "token_acc": 0.7330732381846017 + }, + { + "epoch": 0.6182728410513142, + "grad_norm": 2.1243889331817627, + "learning_rate": 4.7754682889895446e-05, + "loss": 0.7765395641326904, + "step": 247, + "token_acc": 0.7724535218643624 + }, + { + "epoch": 0.6207759699624531, + "grad_norm": 1.0170472860336304, + "learning_rate": 4.7703579345627035e-05, + "loss": 0.8932359218597412, + "step": 248, + "token_acc": 0.7361666956673046 + }, + { + "epoch": 0.623279098873592, + "grad_norm": 1.2093161344528198, + "learning_rate": 4.765192874350537e-05, + "loss": 0.9077604413032532, + "step": 249, + "token_acc": 0.734278362150693 + }, + { + "epoch": 0.6257822277847309, + "grad_norm": 6.2834248542785645, + "learning_rate": 4.759973232808609e-05, + "loss": 0.7469887733459473, + "step": 250, + "token_acc": 0.7800094891665349 + }, + { + "epoch": 0.6282853566958698, + "grad_norm": 3.575439453125, + "learning_rate": 4.7546991357076544e-05, + "loss": 0.8440943360328674, + "step": 251, + "token_acc": 0.7537353459505018 + }, + { + "epoch": 0.6307884856070087, + "grad_norm": 2.0179975032806396, + "learning_rate": 4.749370710130554e-05, + "loss": 0.8843530416488647, + "step": 252, + "token_acc": 0.7379267277268943 + }, + { + "epoch": 0.6332916145181476, + "grad_norm": 1.3368704319000244, + "learning_rate": 4.7439880844692675e-05, + "loss": 0.8424524068832397, + "step": 253, + "token_acc": 0.7527279941802791 + }, + { + "epoch": 0.6357947434292867, + "grad_norm": 7.156957149505615, + "learning_rate": 4.738551388421743e-05, + "loss": 0.7525070905685425, + "step": 254, + "token_acc": 0.7739664347114203 + }, + { + "epoch": 0.6382978723404256, + "grad_norm": 7.08997106552124, + "learning_rate": 4.7330607529887884e-05, + "loss": 0.720240592956543, + "step": 255, + "token_acc": 0.7869349503858876 + }, + { + "epoch": 0.6408010012515645, + "grad_norm": 2.1491920948028564, + "learning_rate": 4.72751631047092e-05, + "loss": 0.822435736656189, + "step": 256, + "token_acc": 0.7558427895092809 + }, + { + "epoch": 0.6433041301627034, + "grad_norm": 4.267916679382324, + "learning_rate": 4.721918194465169e-05, + "loss": 0.7940695285797119, + "step": 257, + "token_acc": 0.7643436685018835 + }, + { + "epoch": 0.6458072590738423, + "grad_norm": 3.5891292095184326, + "learning_rate": 4.7162665398618664e-05, + "loss": 0.7873713374137878, + "step": 258, + "token_acc": 0.7648121955052648 + }, + { + "epoch": 0.6483103879849812, + "grad_norm": 2.214632749557495, + "learning_rate": 4.7105614828413906e-05, + "loss": 0.8356124758720398, + "step": 259, + "token_acc": 0.7503839773914112 + }, + { + "epoch": 0.6508135168961201, + "grad_norm": 2.8201630115509033, + "learning_rate": 4.7048031608708876e-05, + "loss": 0.8771319389343262, + "step": 260, + "token_acc": 0.7445221131872564 + }, + { + "epoch": 0.6533166458072591, + "grad_norm": 1.4439845085144043, + "learning_rate": 4.698991712700958e-05, + "loss": 0.9190523624420166, + "step": 261, + "token_acc": 0.7323772975156534 + }, + { + "epoch": 0.655819774718398, + "grad_norm": 4.227046489715576, + "learning_rate": 4.693127278362311e-05, + "loss": 0.7340889573097229, + "step": 262, + "token_acc": 0.7861572132044501 + }, + { + "epoch": 0.6583229036295369, + "grad_norm": 1.6055476665496826, + "learning_rate": 4.687209999162396e-05, + "loss": 0.905823826789856, + "step": 263, + "token_acc": 0.7359950479727638 + }, + { + "epoch": 0.6608260325406758, + "grad_norm": 7.083006858825684, + "learning_rate": 4.681240017681993e-05, + "loss": 0.9699968099594116, + "step": 264, + "token_acc": 0.7199773578333188 + }, + { + "epoch": 0.6633291614518148, + "grad_norm": 2.4387781620025635, + "learning_rate": 4.6752174777717786e-05, + "loss": 0.8051294684410095, + "step": 265, + "token_acc": 0.7680182752712735 + }, + { + "epoch": 0.6658322903629537, + "grad_norm": 1.6597864627838135, + "learning_rate": 4.6691425245488607e-05, + "loss": 0.8352447748184204, + "step": 266, + "token_acc": 0.7523210168857872 + }, + { + "epoch": 0.6683354192740926, + "grad_norm": 3.9788217544555664, + "learning_rate": 4.6630153043932784e-05, + "loss": 0.952012300491333, + "step": 267, + "token_acc": 0.7299187373027035 + }, + { + "epoch": 0.6708385481852316, + "grad_norm": 2.355642080307007, + "learning_rate": 4.65683596494448e-05, + "loss": 0.8457879424095154, + "step": 268, + "token_acc": 0.7541639391955779 + }, + { + "epoch": 0.6733416770963705, + "grad_norm": 5.1823248863220215, + "learning_rate": 4.650604655097761e-05, + "loss": 0.8699308037757874, + "step": 269, + "token_acc": 0.7468877351644058 + }, + { + "epoch": 0.6758448060075094, + "grad_norm": 4.252589702606201, + "learning_rate": 4.6443215250006806e-05, + "loss": 0.8364484906196594, + "step": 270, + "token_acc": 0.7554215137153526 + }, + { + "epoch": 0.6783479349186483, + "grad_norm": 1.3415782451629639, + "learning_rate": 4.637986726049438e-05, + "loss": 0.8568819165229797, + "step": 271, + "token_acc": 0.7485356078511972 + }, + { + "epoch": 0.6808510638297872, + "grad_norm": 1.7074843645095825, + "learning_rate": 4.6316004108852305e-05, + "loss": 0.8769652843475342, + "step": 272, + "token_acc": 0.7422730723348877 + }, + { + "epoch": 0.6833541927409261, + "grad_norm": 4.651581287384033, + "learning_rate": 4.6251627333905724e-05, + "loss": 0.8192580938339233, + "step": 273, + "token_acc": 0.7577268895757235 + }, + { + "epoch": 0.685857321652065, + "grad_norm": 4.706144332885742, + "learning_rate": 4.618673848685586e-05, + "loss": 0.7910339832305908, + "step": 274, + "token_acc": 0.7648066904304908 + }, + { + "epoch": 0.688360450563204, + "grad_norm": 2.0272216796875, + "learning_rate": 4.612133913124268e-05, + "loss": 0.8216524720191956, + "step": 275, + "token_acc": 0.7571758072783188 + }, + { + "epoch": 0.690863579474343, + "grad_norm": 1.8787137269973755, + "learning_rate": 4.6055430842907167e-05, + "loss": 0.8251311779022217, + "step": 276, + "token_acc": 0.7546209639681797 + }, + { + "epoch": 0.6933667083854819, + "grad_norm": 1.8774858713150024, + "learning_rate": 4.59890152099534e-05, + "loss": 0.9141278266906738, + "step": 277, + "token_acc": 0.732027338182084 + }, + { + "epoch": 0.6958698372966208, + "grad_norm": 3.588717460632324, + "learning_rate": 4.5922093832710236e-05, + "loss": 0.8628591299057007, + "step": 278, + "token_acc": 0.7456560481176209 + }, + { + "epoch": 0.6983729662077597, + "grad_norm": 2.5552499294281006, + "learning_rate": 4.585466832369281e-05, + "loss": 0.8396396040916443, + "step": 279, + "token_acc": 0.7532559149120903 + }, + { + "epoch": 0.7008760951188986, + "grad_norm": 2.4589977264404297, + "learning_rate": 4.5786740307563636e-05, + "loss": 0.7853731513023376, + "step": 280, + "token_acc": 0.7682845427672357 + }, + { + "epoch": 0.7033792240300375, + "grad_norm": 2.5455079078674316, + "learning_rate": 4.5718311421093454e-05, + "loss": 0.9314486980438232, + "step": 281, + "token_acc": 0.7245133049187882 + }, + { + "epoch": 0.7058823529411765, + "grad_norm": 2.683380365371704, + "learning_rate": 4.5649383313121827e-05, + "loss": 0.8583184480667114, + "step": 282, + "token_acc": 0.7450482731163531 + }, + { + "epoch": 0.7083854818523154, + "grad_norm": 1.3633437156677246, + "learning_rate": 4.55799576445174e-05, + "loss": 0.8894494771957397, + "step": 283, + "token_acc": 0.739060801921867 + }, + { + "epoch": 0.7108886107634543, + "grad_norm": 4.674302101135254, + "learning_rate": 4.551003608813784e-05, + "loss": 0.7389158606529236, + "step": 284, + "token_acc": 0.7801253772927792 + }, + { + "epoch": 0.7133917396745932, + "grad_norm": 2.4775431156158447, + "learning_rate": 4.5439620328789593e-05, + "loss": 0.7430102825164795, + "step": 285, + "token_acc": 0.7866531850353893 + }, + { + "epoch": 0.7158948685857321, + "grad_norm": 2.010530471801758, + "learning_rate": 4.536871206318723e-05, + "loss": 0.7329319715499878, + "step": 286, + "token_acc": 0.7800226159065209 + }, + { + "epoch": 0.718397997496871, + "grad_norm": 3.449420213699341, + "learning_rate": 4.529731299991262e-05, + "loss": 0.9150421619415283, + "step": 287, + "token_acc": 0.7355081881985963 + }, + { + "epoch": 0.72090112640801, + "grad_norm": 1.9925580024719238, + "learning_rate": 4.522542485937369e-05, + "loss": 0.8455727100372314, + "step": 288, + "token_acc": 0.7526455026455027 + }, + { + "epoch": 0.723404255319149, + "grad_norm": 1.939789891242981, + "learning_rate": 4.5153049373763026e-05, + "loss": 0.9501767158508301, + "step": 289, + "token_acc": 0.7274806559929924 + }, + { + "epoch": 0.7259073842302879, + "grad_norm": 1.328555941581726, + "learning_rate": 4.508018828701612e-05, + "loss": 0.828056275844574, + "step": 290, + "token_acc": 0.7555241836484164 + }, + { + "epoch": 0.7284105131414268, + "grad_norm": 2.5277862548828125, + "learning_rate": 4.500684335476936e-05, + "loss": 0.8774980902671814, + "step": 291, + "token_acc": 0.7489495798319328 + }, + { + "epoch": 0.7309136420525657, + "grad_norm": 1.7016732692718506, + "learning_rate": 4.493301634431768e-05, + "loss": 0.9148298501968384, + "step": 292, + "token_acc": 0.735104948969767 + }, + { + "epoch": 0.7334167709637046, + "grad_norm": 4.40346097946167, + "learning_rate": 4.485870903457204e-05, + "loss": 0.8074817061424255, + "step": 293, + "token_acc": 0.7590221897098268 + }, + { + "epoch": 0.7359198998748435, + "grad_norm": 5.940386772155762, + "learning_rate": 4.478392321601651e-05, + "loss": 0.8893970251083374, + "step": 294, + "token_acc": 0.7431922534891121 + }, + { + "epoch": 0.7384230287859824, + "grad_norm": 4.992410182952881, + "learning_rate": 4.470866069066516e-05, + "loss": 0.7381858825683594, + "step": 295, + "token_acc": 0.7853381258881551 + }, + { + "epoch": 0.7409261576971214, + "grad_norm": 5.966536998748779, + "learning_rate": 4.463292327201862e-05, + "loss": 0.838369607925415, + "step": 296, + "token_acc": 0.754148620370821 + }, + { + "epoch": 0.7434292866082604, + "grad_norm": 1.494193434715271, + "learning_rate": 4.455671278502042e-05, + "loss": 0.8503720760345459, + "step": 297, + "token_acc": 0.7541888163649821 + }, + { + "epoch": 0.7459324155193993, + "grad_norm": 4.080326080322266, + "learning_rate": 4.4480031066012916e-05, + "loss": 0.7552746534347534, + "step": 298, + "token_acc": 0.7728544776119403 + }, + { + "epoch": 0.7484355444305382, + "grad_norm": 1.7464518547058105, + "learning_rate": 4.44028799626932e-05, + "loss": 0.8308608531951904, + "step": 299, + "token_acc": 0.7577373937852757 + }, + { + "epoch": 0.7509386733416771, + "grad_norm": 2.6353917121887207, + "learning_rate": 4.4325261334068426e-05, + "loss": 0.8492376208305359, + "step": 300, + "token_acc": 0.7513898676689375 + }, + { + "epoch": 0.753441802252816, + "grad_norm": 5.348440647125244, + "learning_rate": 4.4247177050411114e-05, + "loss": 0.9122411608695984, + "step": 301, + "token_acc": 0.7296964163433006 + }, + { + "epoch": 0.7559449311639549, + "grad_norm": 3.4473955631256104, + "learning_rate": 4.416862899321404e-05, + "loss": 0.8476892113685608, + "step": 302, + "token_acc": 0.7541979056942809 + }, + { + "epoch": 0.7584480600750939, + "grad_norm": 1.6045217514038086, + "learning_rate": 4.408961905514491e-05, + "loss": 0.8833868503570557, + "step": 303, + "token_acc": 0.7396542108198549 + }, + { + "epoch": 0.7609511889862328, + "grad_norm": 2.6573829650878906, + "learning_rate": 4.401014914000078e-05, + "loss": 0.7998722195625305, + "step": 304, + "token_acc": 0.7661461586508432 + }, + { + "epoch": 0.7634543178973717, + "grad_norm": 2.9124984741210938, + "learning_rate": 4.393022116266212e-05, + "loss": 0.8530205488204956, + "step": 305, + "token_acc": 0.7466014447414823 + }, + { + "epoch": 0.7659574468085106, + "grad_norm": 13.436267852783203, + "learning_rate": 4.384983704904674e-05, + "loss": 0.806631863117218, + "step": 306, + "token_acc": 0.7660835876966424 + }, + { + "epoch": 0.7684605757196495, + "grad_norm": 4.7447686195373535, + "learning_rate": 4.376899873606336e-05, + "loss": 0.8307251334190369, + "step": 307, + "token_acc": 0.7573671342169604 + }, + { + "epoch": 0.7709637046307884, + "grad_norm": 2.38670015335083, + "learning_rate": 4.3687708171564925e-05, + "loss": 0.7642802000045776, + "step": 308, + "token_acc": 0.7765166340508807 + }, + { + "epoch": 0.7734668335419274, + "grad_norm": 1.7410259246826172, + "learning_rate": 4.360596731430168e-05, + "loss": 0.8567044138908386, + "step": 309, + "token_acc": 0.7521028037383177 + }, + { + "epoch": 0.7759699624530664, + "grad_norm": 4.307875156402588, + "learning_rate": 4.352377813387398e-05, + "loss": 0.9223236441612244, + "step": 310, + "token_acc": 0.7292516473172262 + }, + { + "epoch": 0.7784730913642053, + "grad_norm": 3.766094207763672, + "learning_rate": 4.3441142610684824e-05, + "loss": 0.685102641582489, + "step": 311, + "token_acc": 0.7947743004777226 + }, + { + "epoch": 0.7809762202753442, + "grad_norm": 1.5777055025100708, + "learning_rate": 4.335806273589214e-05, + "loss": 0.7940619587898254, + "step": 312, + "token_acc": 0.7673673517230601 + }, + { + "epoch": 0.7834793491864831, + "grad_norm": 4.047732353210449, + "learning_rate": 4.3274540511360793e-05, + "loss": 0.7358657121658325, + "step": 313, + "token_acc": 0.782784 + }, + { + "epoch": 0.785982478097622, + "grad_norm": 1.3510150909423828, + "learning_rate": 4.319057794961437e-05, + "loss": 0.8665168881416321, + "step": 314, + "token_acc": 0.7442531173127491 + }, + { + "epoch": 0.7884856070087609, + "grad_norm": 2.992387056350708, + "learning_rate": 4.310617707378668e-05, + "loss": 0.7996443510055542, + "step": 315, + "token_acc": 0.7625912988250239 + }, + { + "epoch": 0.7909887359198998, + "grad_norm": 1.5894449949264526, + "learning_rate": 4.302133991757297e-05, + "loss": 0.8834421038627625, + "step": 316, + "token_acc": 0.7416610344690494 + }, + { + "epoch": 0.7934918648310388, + "grad_norm": 3.1843483448028564, + "learning_rate": 4.2936068525181e-05, + "loss": 0.842120885848999, + "step": 317, + "token_acc": 0.7479250534267681 + }, + { + "epoch": 0.7959949937421777, + "grad_norm": 1.8540269136428833, + "learning_rate": 4.285036495128171e-05, + "loss": 0.9776566028594971, + "step": 318, + "token_acc": 0.7195618838992333 + }, + { + "epoch": 0.7984981226533167, + "grad_norm": 2.9334137439727783, + "learning_rate": 4.276423126095974e-05, + "loss": 0.8031361103057861, + "step": 319, + "token_acc": 0.7604228218764362 + }, + { + "epoch": 0.8010012515644556, + "grad_norm": 1.6915321350097656, + "learning_rate": 4.267766952966369e-05, + "loss": 0.9410305023193359, + "step": 320, + "token_acc": 0.7282994213179018 + }, + { + "epoch": 0.8035043804755945, + "grad_norm": 5.01201057434082, + "learning_rate": 4.259068184315608e-05, + "loss": 0.9005149602890015, + "step": 321, + "token_acc": 0.7376341577228185 + }, + { + "epoch": 0.8060075093867334, + "grad_norm": 1.6810280084609985, + "learning_rate": 4.250327029746309e-05, + "loss": 0.7451943755149841, + "step": 322, + "token_acc": 0.781010719754977 + }, + { + "epoch": 0.8085106382978723, + "grad_norm": 5.86810827255249, + "learning_rate": 4.24154369988241e-05, + "loss": 0.740115761756897, + "step": 323, + "token_acc": 0.7834601819194357 + }, + { + "epoch": 0.8110137672090113, + "grad_norm": 1.2761876583099365, + "learning_rate": 4.23271840636409e-05, + "loss": 0.9164939522743225, + "step": 324, + "token_acc": 0.7285148767718044 + }, + { + "epoch": 0.8135168961201502, + "grad_norm": 2.3560471534729004, + "learning_rate": 4.223851361842668e-05, + "loss": 0.7663041353225708, + "step": 325, + "token_acc": 0.7738841185116423 + }, + { + "epoch": 0.8160200250312891, + "grad_norm": 3.6525771617889404, + "learning_rate": 4.214942779975482e-05, + "loss": 0.6357040405273438, + "step": 326, + "token_acc": 0.8093354430379747 + }, + { + "epoch": 0.818523153942428, + "grad_norm": 1.9545413255691528, + "learning_rate": 4.205992875420742e-05, + "loss": 0.9620451927185059, + "step": 327, + "token_acc": 0.7203116924422535 + }, + { + "epoch": 0.8210262828535669, + "grad_norm": 2.913717269897461, + "learning_rate": 4.197001863832355e-05, + "loss": 0.8111364841461182, + "step": 328, + "token_acc": 0.75743935983996 + }, + { + "epoch": 0.8235294117647058, + "grad_norm": 1.9858478307724, + "learning_rate": 4.187969961854726e-05, + "loss": 0.9955106973648071, + "step": 329, + "token_acc": 0.7128412537917088 + }, + { + "epoch": 0.8260325406758448, + "grad_norm": 6.050736904144287, + "learning_rate": 4.178897387117546e-05, + "loss": 0.7481118440628052, + "step": 330, + "token_acc": 0.7825464949928469 + }, + { + "epoch": 0.8285356695869838, + "grad_norm": 1.8267136812210083, + "learning_rate": 4.169784358230541e-05, + "loss": 0.6872880458831787, + "step": 331, + "token_acc": 0.7973193262090201 + }, + { + "epoch": 0.8310387984981227, + "grad_norm": 2.2636425495147705, + "learning_rate": 4.1606310947782044e-05, + "loss": 0.7994587421417236, + "step": 332, + "token_acc": 0.7658987358018353 + }, + { + "epoch": 0.8335419274092616, + "grad_norm": 3.7548258304595947, + "learning_rate": 4.151437817314513e-05, + "loss": 0.7354224920272827, + "step": 333, + "token_acc": 0.7824889408229697 + }, + { + "epoch": 0.8360450563204005, + "grad_norm": 2.3976776599884033, + "learning_rate": 4.142204747357604e-05, + "loss": 0.8958951830863953, + "step": 334, + "token_acc": 0.7402859448864292 + }, + { + "epoch": 0.8385481852315394, + "grad_norm": 1.5932167768478394, + "learning_rate": 4.1329321073844415e-05, + "loss": 0.8891469240188599, + "step": 335, + "token_acc": 0.7463272467733302 + }, + { + "epoch": 0.8410513141426783, + "grad_norm": 1.8860996961593628, + "learning_rate": 4.123620120825459e-05, + "loss": 0.7546243667602539, + "step": 336, + "token_acc": 0.7755037783375315 + }, + { + "epoch": 0.8435544430538173, + "grad_norm": 3.2070868015289307, + "learning_rate": 4.114269012059169e-05, + "loss": 0.8346970081329346, + "step": 337, + "token_acc": 0.7553981106612686 + }, + { + "epoch": 0.8460575719649562, + "grad_norm": 1.9174991846084595, + "learning_rate": 4.104879006406758e-05, + "loss": 0.8280372619628906, + "step": 338, + "token_acc": 0.7614895430407133 + }, + { + "epoch": 0.8485607008760951, + "grad_norm": 7.967592716217041, + "learning_rate": 4.095450330126663e-05, + "loss": 0.6412019729614258, + "step": 339, + "token_acc": 0.8135894699395233 + }, + { + "epoch": 0.851063829787234, + "grad_norm": 1.8168036937713623, + "learning_rate": 4.085983210409114e-05, + "loss": 0.7411476373672485, + "step": 340, + "token_acc": 0.7818817070127277 + }, + { + "epoch": 0.853566958698373, + "grad_norm": 5.3374481201171875, + "learning_rate": 4.07647787537066e-05, + "loss": 0.8266500234603882, + "step": 341, + "token_acc": 0.7557682359027419 + }, + { + "epoch": 0.8560700876095119, + "grad_norm": 6.361590385437012, + "learning_rate": 4.066934554048674e-05, + "loss": 0.7055239677429199, + "step": 342, + "token_acc": 0.7837323608688759 + }, + { + "epoch": 0.8585732165206508, + "grad_norm": 4.529880046844482, + "learning_rate": 4.0573534763958355e-05, + "loss": 0.8333171606063843, + "step": 343, + "token_acc": 0.7545928944170419 + }, + { + "epoch": 0.8610763454317898, + "grad_norm": 7.685861587524414, + "learning_rate": 4.047734873274586e-05, + "loss": 0.8767172694206238, + "step": 344, + "token_acc": 0.7442405662503945 + }, + { + "epoch": 0.8635794743429287, + "grad_norm": 3.9726321697235107, + "learning_rate": 4.038078976451567e-05, + "loss": 0.8583240509033203, + "step": 345, + "token_acc": 0.7489155540532928 + }, + { + "epoch": 0.8660826032540676, + "grad_norm": 1.581453800201416, + "learning_rate": 4.028386018592041e-05, + "loss": 0.7588601112365723, + "step": 346, + "token_acc": 0.7785956964892412 + }, + { + "epoch": 0.8685857321652065, + "grad_norm": 3.0492961406707764, + "learning_rate": 4.018656233254278e-05, + "loss": 0.8237013816833496, + "step": 347, + "token_acc": 0.7580033277870216 + }, + { + "epoch": 0.8710888610763454, + "grad_norm": 1.490657091140747, + "learning_rate": 4.008889854883929e-05, + "loss": 0.7148709297180176, + "step": 348, + "token_acc": 0.7866251062623972 + }, + { + "epoch": 0.8735919899874843, + "grad_norm": 2.604755401611328, + "learning_rate": 3.999087118808381e-05, + "loss": 0.8905333280563354, + "step": 349, + "token_acc": 0.7405912450255827 + }, + { + "epoch": 0.8760951188986232, + "grad_norm": 9.451438903808594, + "learning_rate": 3.9892482612310836e-05, + "loss": 0.9194896817207336, + "step": 350, + "token_acc": 0.7317846328538986 + }, + { + "epoch": 0.8785982478097623, + "grad_norm": 1.6283177137374878, + "learning_rate": 3.979373519225858e-05, + "loss": 0.9222493171691895, + "step": 351, + "token_acc": 0.7324363188167625 + }, + { + "epoch": 0.8811013767209012, + "grad_norm": 1.01435124874115, + "learning_rate": 3.969463130731183e-05, + "loss": 0.8873315453529358, + "step": 352, + "token_acc": 0.7386921685189971 + }, + { + "epoch": 0.8836045056320401, + "grad_norm": 1.6070590019226074, + "learning_rate": 3.959517334544466e-05, + "loss": 0.8865751028060913, + "step": 353, + "token_acc": 0.7350283279486819 + }, + { + "epoch": 0.886107634543179, + "grad_norm": 2.5121443271636963, + "learning_rate": 3.949536370316285e-05, + "loss": 0.8619804382324219, + "step": 354, + "token_acc": 0.7479302448476308 + }, + { + "epoch": 0.8886107634543179, + "grad_norm": 1.3835835456848145, + "learning_rate": 3.939520478544614e-05, + "loss": 0.9314793348312378, + "step": 355, + "token_acc": 0.7263123142951469 + }, + { + "epoch": 0.8911138923654568, + "grad_norm": 2.486131191253662, + "learning_rate": 3.9294699005690305e-05, + "loss": 0.8991205096244812, + "step": 356, + "token_acc": 0.7395881270133456 + }, + { + "epoch": 0.8936170212765957, + "grad_norm": 2.7008180618286133, + "learning_rate": 3.919384878564902e-05, + "loss": 0.8544954061508179, + "step": 357, + "token_acc": 0.7505512359289777 + }, + { + "epoch": 0.8961201501877347, + "grad_norm": 2.08654522895813, + "learning_rate": 3.909265655537542e-05, + "loss": 0.7513941526412964, + "step": 358, + "token_acc": 0.7819888236136983 + }, + { + "epoch": 0.8986232790988736, + "grad_norm": 1.9756476879119873, + "learning_rate": 3.899112475316366e-05, + "loss": 0.7608502507209778, + "step": 359, + "token_acc": 0.772964191430312 + }, + { + "epoch": 0.9011264080100125, + "grad_norm": 1.3755425214767456, + "learning_rate": 3.888925582549006e-05, + "loss": 0.8417959213256836, + "step": 360, + "token_acc": 0.7520785670442498 + }, + { + "epoch": 0.9036295369211514, + "grad_norm": 2.1407554149627686, + "learning_rate": 3.8787052226954234e-05, + "loss": 0.8518916368484497, + "step": 361, + "token_acc": 0.7552394806314315 + }, + { + "epoch": 0.9061326658322904, + "grad_norm": 4.228549003601074, + "learning_rate": 3.868451642021992e-05, + "loss": 0.8237797021865845, + "step": 362, + "token_acc": 0.7532420091324201 + }, + { + "epoch": 0.9086357947434293, + "grad_norm": 2.090517044067383, + "learning_rate": 3.8581650875955585e-05, + "loss": 0.7693901062011719, + "step": 363, + "token_acc": 0.7751344989912575 + }, + { + "epoch": 0.9111389236545682, + "grad_norm": 2.4747915267944336, + "learning_rate": 3.847845807277502e-05, + "loss": 0.6950187683105469, + "step": 364, + "token_acc": 0.7874652915509719 + }, + { + "epoch": 0.9136420525657072, + "grad_norm": 1.813559651374817, + "learning_rate": 3.8374940497177434e-05, + "loss": 0.8348764181137085, + "step": 365, + "token_acc": 0.7503848566052796 + }, + { + "epoch": 0.9161451814768461, + "grad_norm": 1.9585214853286743, + "learning_rate": 3.827110064348773e-05, + "loss": 0.809190571308136, + "step": 366, + "token_acc": 0.7566013071895424 + }, + { + "epoch": 0.918648310387985, + "grad_norm": 1.5872814655303955, + "learning_rate": 3.816694101379631e-05, + "loss": 0.8659224510192871, + "step": 367, + "token_acc": 0.7458495340369068 + }, + { + "epoch": 0.9211514392991239, + "grad_norm": 3.7991831302642822, + "learning_rate": 3.8062464117898724e-05, + "loss": 0.6858774423599243, + "step": 368, + "token_acc": 0.7921834567680913 + }, + { + "epoch": 0.9236545682102628, + "grad_norm": 11.759095191955566, + "learning_rate": 3.795767247323533e-05, + "loss": 0.9242225289344788, + "step": 369, + "token_acc": 0.7271716902285054 + }, + { + "epoch": 0.9261576971214017, + "grad_norm": 5.795279502868652, + "learning_rate": 3.785256860483054e-05, + "loss": 0.7550444006919861, + "step": 370, + "token_acc": 0.7739854877721043 + }, + { + "epoch": 0.9286608260325406, + "grad_norm": 2.1931843757629395, + "learning_rate": 3.774715504523202e-05, + "loss": 0.8427231311798096, + "step": 371, + "token_acc": 0.7499619926012264 + }, + { + "epoch": 0.9311639549436797, + "grad_norm": 1.1604092121124268, + "learning_rate": 3.764143433444962e-05, + "loss": 0.9125556945800781, + "step": 372, + "token_acc": 0.7275495750708215 + }, + { + "epoch": 0.9336670838548186, + "grad_norm": 8.955742835998535, + "learning_rate": 3.753540901989423e-05, + "loss": 0.8157449960708618, + "step": 373, + "token_acc": 0.7604572450348043 + }, + { + "epoch": 0.9361702127659575, + "grad_norm": 6.911311626434326, + "learning_rate": 3.742908165631636e-05, + "loss": 0.9126226902008057, + "step": 374, + "token_acc": 0.731775132504996 + }, + { + "epoch": 0.9386733416770964, + "grad_norm": 1.0974699258804321, + "learning_rate": 3.7322454805744605e-05, + "loss": 0.8590577244758606, + "step": 375, + "token_acc": 0.7466798810703666 + }, + { + "epoch": 0.9411764705882353, + "grad_norm": 17.13771629333496, + "learning_rate": 3.721553103742388e-05, + "loss": 0.8356927037239075, + "step": 376, + "token_acc": 0.7555617044825678 + }, + { + "epoch": 0.9436795994993742, + "grad_norm": 1.2535425424575806, + "learning_rate": 3.710831292775353e-05, + "loss": 0.7597782611846924, + "step": 377, + "token_acc": 0.7681555758128229 + }, + { + "epoch": 0.9461827284105131, + "grad_norm": 2.29099702835083, + "learning_rate": 3.7000803060225284e-05, + "loss": 0.7276159524917603, + "step": 378, + "token_acc": 0.7826947105372761 + }, + { + "epoch": 0.9486858573216521, + "grad_norm": 2.584505319595337, + "learning_rate": 3.689300402536093e-05, + "loss": 0.9814828634262085, + "step": 379, + "token_acc": 0.7160717395089674 + }, + { + "epoch": 0.951188986232791, + "grad_norm": 1.3225842714309692, + "learning_rate": 3.678491842064995e-05, + "loss": 0.8274613618850708, + "step": 380, + "token_acc": 0.7544784652521916 + }, + { + "epoch": 0.9536921151439299, + "grad_norm": 3.4567878246307373, + "learning_rate": 3.6676548850486915e-05, + "loss": 0.8384053707122803, + "step": 381, + "token_acc": 0.7518606937227917 + }, + { + "epoch": 0.9561952440550688, + "grad_norm": 3.5069363117218018, + "learning_rate": 3.6567897926108756e-05, + "loss": 0.7467086315155029, + "step": 382, + "token_acc": 0.7784389823199656 + }, + { + "epoch": 0.9586983729662077, + "grad_norm": 1349.64501953125, + "learning_rate": 3.645896826553178e-05, + "loss": 0.7556321620941162, + "step": 383, + "token_acc": 0.7752317780960277 + }, + { + "epoch": 0.9612015018773467, + "grad_norm": 2.6709060668945312, + "learning_rate": 3.634976249348867e-05, + "loss": 0.6211893558502197, + "step": 384, + "token_acc": 0.8125134148959005 + }, + { + "epoch": 0.9637046307884856, + "grad_norm": 1.6858121156692505, + "learning_rate": 3.624028324136517e-05, + "loss": 0.8058912754058838, + "step": 385, + "token_acc": 0.7628393692433814 + }, + { + "epoch": 0.9662077596996246, + "grad_norm": 1.219348430633545, + "learning_rate": 3.613053314713671e-05, + "loss": 0.8431601524353027, + "step": 386, + "token_acc": 0.7487229170336446 + }, + { + "epoch": 0.9687108886107635, + "grad_norm": 1.4409899711608887, + "learning_rate": 3.602051485530486e-05, + "loss": 0.9082483053207397, + "step": 387, + "token_acc": 0.729979941367073 + }, + { + "epoch": 0.9712140175219024, + "grad_norm": 1.596650242805481, + "learning_rate": 3.591023101683355e-05, + "loss": 0.7665495872497559, + "step": 388, + "token_acc": 0.7712696559774772 + }, + { + "epoch": 0.9737171464330413, + "grad_norm": 1.0858607292175293, + "learning_rate": 3.57996842890853e-05, + "loss": 0.9287350177764893, + "step": 389, + "token_acc": 0.7277777777777777 + }, + { + "epoch": 0.9762202753441802, + "grad_norm": 14.8970365524292, + "learning_rate": 3.568887733575706e-05, + "loss": 0.6690181493759155, + "step": 390, + "token_acc": 0.8004053765735012 + }, + { + "epoch": 0.9787234042553191, + "grad_norm": 5.169677734375, + "learning_rate": 3.55778128268161e-05, + "loss": 0.8137506246566772, + "step": 391, + "token_acc": 0.7589914103629815 + }, + { + "epoch": 0.981226533166458, + "grad_norm": 1.0652302503585815, + "learning_rate": 3.54664934384357e-05, + "loss": 0.7818809747695923, + "step": 392, + "token_acc": 0.7646431342125679 + }, + { + "epoch": 0.983729662077597, + "grad_norm": 3.2523343563079834, + "learning_rate": 3.5354921852930594e-05, + "loss": 0.790520429611206, + "step": 393, + "token_acc": 0.7665671262469026 + }, + { + "epoch": 0.986232790988736, + "grad_norm": 1.9948564767837524, + "learning_rate": 3.5243100758692386e-05, + "loss": 0.7343300580978394, + "step": 394, + "token_acc": 0.7801844119693807 + }, + { + "epoch": 0.9887359198998749, + "grad_norm": 8.779631614685059, + "learning_rate": 3.513103285012475e-05, + "loss": 0.823872447013855, + "step": 395, + "token_acc": 0.7562481836675385 + }, + { + "epoch": 0.9912390488110138, + "grad_norm": 3.0845484733581543, + "learning_rate": 3.5018720827578524e-05, + "loss": 0.7353721857070923, + "step": 396, + "token_acc": 0.7806098875712305 + }, + { + "epoch": 0.9937421777221527, + "grad_norm": 1.4457420110702515, + "learning_rate": 3.4906167397286646e-05, + "loss": 0.7633687257766724, + "step": 397, + "token_acc": 0.7762840122363549 + }, + { + "epoch": 0.9962453066332916, + "grad_norm": 3.5868849754333496, + "learning_rate": 3.47933752712989e-05, + "loss": 0.7144147157669067, + "step": 398, + "token_acc": 0.789120029455081 + }, + { + "epoch": 0.9987484355444305, + "grad_norm": 2.74013614654541, + "learning_rate": 3.468034716741664e-05, + "loss": 0.8580281734466553, + "step": 399, + "token_acc": 0.7488521853198974 + }, + { + "epoch": 1.0, + "grad_norm": 2.7789676189422607, + "learning_rate": 3.456708580912725e-05, + "loss": 0.7465000152587891, + "step": 400, + "token_acc": 0.7748026089941641 + }, + { + "epoch": 1.002503128911139, + "grad_norm": 2.5083093643188477, + "learning_rate": 3.4453593925538515e-05, + "loss": 0.7482450008392334, + "step": 401, + "token_acc": 0.7756680731364276 + }, + { + "epoch": 1.0050062578222778, + "grad_norm": 1.5304547548294067, + "learning_rate": 3.433987425131291e-05, + "loss": 0.8512796759605408, + "step": 402, + "token_acc": 0.7466814693247091 + }, + { + "epoch": 1.0075093867334168, + "grad_norm": 3.557460308074951, + "learning_rate": 3.4225929526601664e-05, + "loss": 0.7484120726585388, + "step": 403, + "token_acc": 0.7753919962555581 + }, + { + "epoch": 1.0100125156445556, + "grad_norm": 5.367844581604004, + "learning_rate": 3.411176249697875e-05, + "loss": 0.6399465799331665, + "step": 404, + "token_acc": 0.8064121850319669 + }, + { + "epoch": 1.0125156445556946, + "grad_norm": 2.309791326522827, + "learning_rate": 3.399737591337471e-05, + "loss": 0.7572115659713745, + "step": 405, + "token_acc": 0.778211361310133 + }, + { + "epoch": 1.0150187734668334, + "grad_norm": 10.43783950805664, + "learning_rate": 3.388277253201041e-05, + "loss": 0.7999943494796753, + "step": 406, + "token_acc": 0.7620247990189399 + }, + { + "epoch": 1.0175219023779725, + "grad_norm": 4.304990768432617, + "learning_rate": 3.3767955114330586e-05, + "loss": 0.8064647912979126, + "step": 407, + "token_acc": 0.7639428499812007 + }, + { + "epoch": 1.0200250312891115, + "grad_norm": 1.3805936574935913, + "learning_rate": 3.365292642693732e-05, + "loss": 0.8383949398994446, + "step": 408, + "token_acc": 0.7478151048244506 + }, + { + "epoch": 1.0225281602002503, + "grad_norm": 2.6776158809661865, + "learning_rate": 3.353768924152341e-05, + "loss": 0.6969519257545471, + "step": 409, + "token_acc": 0.7909162786611614 + }, + { + "epoch": 1.0250312891113893, + "grad_norm": 1.1812976598739624, + "learning_rate": 3.34222463348055e-05, + "loss": 0.9484398365020752, + "step": 410, + "token_acc": 0.7265209203307951 + }, + { + "epoch": 1.027534418022528, + "grad_norm": 7.378384113311768, + "learning_rate": 3.330660048845727e-05, + "loss": 0.7456188797950745, + "step": 411, + "token_acc": 0.7744972966405443 + }, + { + "epoch": 1.0300375469336671, + "grad_norm": 2.924264669418335, + "learning_rate": 3.319075448904234e-05, + "loss": 0.8864508867263794, + "step": 412, + "token_acc": 0.7376894683106887 + }, + { + "epoch": 1.032540675844806, + "grad_norm": 2.464365005493164, + "learning_rate": 3.307471112794715e-05, + "loss": 0.6419383883476257, + "step": 413, + "token_acc": 0.8134543953776311 + }, + { + "epoch": 1.035043804755945, + "grad_norm": 5.192070007324219, + "learning_rate": 3.2958473201313744e-05, + "loss": 0.7585772275924683, + "step": 414, + "token_acc": 0.7764367456694391 + }, + { + "epoch": 1.037546933667084, + "grad_norm": 2.1468076705932617, + "learning_rate": 3.284204350997229e-05, + "loss": 0.8554524183273315, + "step": 415, + "token_acc": 0.7464255019923431 + }, + { + "epoch": 1.0400500625782227, + "grad_norm": 1.838391661643982, + "learning_rate": 3.272542485937369e-05, + "loss": 0.819720447063446, + "step": 416, + "token_acc": 0.7565149747180085 + }, + { + "epoch": 1.0425531914893618, + "grad_norm": 1.1302598714828491, + "learning_rate": 3.260862005952193e-05, + "loss": 0.8727908730506897, + "step": 417, + "token_acc": 0.7423896933074906 + }, + { + "epoch": 1.0450563204005006, + "grad_norm": 1.2645598649978638, + "learning_rate": 3.2491631924906416e-05, + "loss": 0.8348588943481445, + "step": 418, + "token_acc": 0.7506860706860707 + }, + { + "epoch": 1.0475594493116396, + "grad_norm": 3.1367015838623047, + "learning_rate": 3.23744632744341e-05, + "loss": 0.673876941204071, + "step": 419, + "token_acc": 0.7934364744491327 + }, + { + "epoch": 1.0500625782227784, + "grad_norm": 10.951983451843262, + "learning_rate": 3.225711693136156e-05, + "loss": 0.6246871948242188, + "step": 420, + "token_acc": 0.8066268332428028 + }, + { + "epoch": 1.0525657071339174, + "grad_norm": 3.3616561889648438, + "learning_rate": 3.2139595723227054e-05, + "loss": 0.8184407949447632, + "step": 421, + "token_acc": 0.7584331756487909 + }, + { + "epoch": 1.0550688360450564, + "grad_norm": 1.6267706155776978, + "learning_rate": 3.202190248178231e-05, + "loss": 0.8076139688491821, + "step": 422, + "token_acc": 0.7578792160717577 + }, + { + "epoch": 1.0575719649561952, + "grad_norm": 2.607529878616333, + "learning_rate": 3.190404004292427e-05, + "loss": 0.6964325308799744, + "step": 423, + "token_acc": 0.7924243768295929 + }, + { + "epoch": 1.0600750938673342, + "grad_norm": 2.781243085861206, + "learning_rate": 3.178601124662686e-05, + "loss": 0.8571556806564331, + "step": 424, + "token_acc": 0.7462099943851769 + }, + { + "epoch": 1.062578222778473, + "grad_norm": 1.86491858959198, + "learning_rate": 3.1667818936872465e-05, + "loss": 0.758177638053894, + "step": 425, + "token_acc": 0.7680104961832062 + }, + { + "epoch": 1.065081351689612, + "grad_norm": 2.1224405765533447, + "learning_rate": 3.154946596158344e-05, + "loss": 0.7757034301757812, + "step": 426, + "token_acc": 0.7722524774573699 + }, + { + "epoch": 1.0675844806007508, + "grad_norm": 1.8863650560379028, + "learning_rate": 3.14309551725535e-05, + "loss": 0.8123703002929688, + "step": 427, + "token_acc": 0.7639742969667657 + }, + { + "epoch": 1.0700876095118899, + "grad_norm": 2.3641357421875, + "learning_rate": 3.131228942537895e-05, + "loss": 0.7848698496818542, + "step": 428, + "token_acc": 0.7647326852976913 + }, + { + "epoch": 1.0725907384230289, + "grad_norm": 2.3047101497650146, + "learning_rate": 3.119347157938996e-05, + "loss": 0.7829238176345825, + "step": 429, + "token_acc": 0.7659560681656191 + }, + { + "epoch": 1.0750938673341677, + "grad_norm": 2.6143319606781006, + "learning_rate": 3.10745044975816e-05, + "loss": 0.7950413227081299, + "step": 430, + "token_acc": 0.768625959038742 + }, + { + "epoch": 1.0775969962453067, + "grad_norm": 1.3800603151321411, + "learning_rate": 3.095539104654487e-05, + "loss": 0.8089693784713745, + "step": 431, + "token_acc": 0.7642110762800418 + }, + { + "epoch": 1.0801001251564455, + "grad_norm": 4.631928443908691, + "learning_rate": 3.083613409639764e-05, + "loss": 0.8975304365158081, + "step": 432, + "token_acc": 0.7377950351206317 + }, + { + "epoch": 1.0826032540675845, + "grad_norm": 1.7472598552703857, + "learning_rate": 3.071673652071549e-05, + "loss": 0.8314036726951599, + "step": 433, + "token_acc": 0.7511785954815404 + }, + { + "epoch": 1.0851063829787233, + "grad_norm": 3.089261054992676, + "learning_rate": 3.0597201196462463e-05, + "loss": 0.6671078205108643, + "step": 434, + "token_acc": 0.7968802528071001 + }, + { + "epoch": 1.0876095118898623, + "grad_norm": 1.2681653499603271, + "learning_rate": 3.0477531003921745e-05, + "loss": 0.8389818668365479, + "step": 435, + "token_acc": 0.7532440676213618 + }, + { + "epoch": 1.0901126408010013, + "grad_norm": 1.615865707397461, + "learning_rate": 3.035772882662627e-05, + "loss": 0.740587055683136, + "step": 436, + "token_acc": 0.7783269677226091 + }, + { + "epoch": 1.0926157697121401, + "grad_norm": 1.1586065292358398, + "learning_rate": 3.0237797551289228e-05, + "loss": 0.8281398415565491, + "step": 437, + "token_acc": 0.7543171893608575 + }, + { + "epoch": 1.0951188986232792, + "grad_norm": 1.2768690586090088, + "learning_rate": 3.0117740067734495e-05, + "loss": 0.8269925117492676, + "step": 438, + "token_acc": 0.752611147056105 + }, + { + "epoch": 1.097622027534418, + "grad_norm": 1.6892045736312866, + "learning_rate": 2.9997559268827048e-05, + "loss": 0.6553794145584106, + "step": 439, + "token_acc": 0.8029715762273901 + }, + { + "epoch": 1.100125156445557, + "grad_norm": 11.613991737365723, + "learning_rate": 2.9877258050403212e-05, + "loss": 0.5059342384338379, + "step": 440, + "token_acc": 0.8454545454545455 + }, + { + "epoch": 1.1026282853566958, + "grad_norm": 1.2692391872406006, + "learning_rate": 2.97568393112009e-05, + "loss": 0.8626140356063843, + "step": 441, + "token_acc": 0.7472961054634916 + }, + { + "epoch": 1.1051314142678348, + "grad_norm": 10.773530006408691, + "learning_rate": 2.963630595278977e-05, + "loss": 0.637244701385498, + "step": 442, + "token_acc": 0.8053183229813664 + }, + { + "epoch": 1.1076345431789738, + "grad_norm": 4.59783411026001, + "learning_rate": 2.9515660879501316e-05, + "loss": 0.7247684001922607, + "step": 443, + "token_acc": 0.7837734769758795 + }, + { + "epoch": 1.1101376720901126, + "grad_norm": 1.9800934791564941, + "learning_rate": 2.9394906998358868e-05, + "loss": 0.8562126159667969, + "step": 444, + "token_acc": 0.7429015397655035 + }, + { + "epoch": 1.1126408010012516, + "grad_norm": 1.0154430866241455, + "learning_rate": 2.9274047219007534e-05, + "loss": 0.7898328304290771, + "step": 445, + "token_acc": 0.7574374230611407 + }, + { + "epoch": 1.1151439299123904, + "grad_norm": 0.9506177306175232, + "learning_rate": 2.9153084453644135e-05, + "loss": 0.8542905449867249, + "step": 446, + "token_acc": 0.7462486726072303 + }, + { + "epoch": 1.1176470588235294, + "grad_norm": 1.8862485885620117, + "learning_rate": 2.9032021616947015e-05, + "loss": 0.7725399732589722, + "step": 447, + "token_acc": 0.76569290197972 + }, + { + "epoch": 1.1201501877346682, + "grad_norm": 2.745835065841675, + "learning_rate": 2.8910861626005776e-05, + "loss": 0.7496145367622375, + "step": 448, + "token_acc": 0.7733351163412677 + }, + { + "epoch": 1.1226533166458073, + "grad_norm": 5.342070579528809, + "learning_rate": 2.878960740025103e-05, + "loss": 0.6059656143188477, + "step": 449, + "token_acc": 0.8215033744472888 + }, + { + "epoch": 1.1251564455569463, + "grad_norm": 2.0042543411254883, + "learning_rate": 2.8668261861384045e-05, + "loss": 0.6715121865272522, + "step": 450, + "token_acc": 0.7972053027588678 + }, + { + "epoch": 1.127659574468085, + "grad_norm": 3.369508981704712, + "learning_rate": 2.854682793330633e-05, + "loss": 0.7005834579467773, + "step": 451, + "token_acc": 0.7925215723873442 + }, + { + "epoch": 1.130162703379224, + "grad_norm": 2.255542516708374, + "learning_rate": 2.8425308542049206e-05, + "loss": 0.6925271153450012, + "step": 452, + "token_acc": 0.7939376553834385 + }, + { + "epoch": 1.1326658322903629, + "grad_norm": 1.9074103832244873, + "learning_rate": 2.8303706615703253e-05, + "loss": 0.8258252143859863, + "step": 453, + "token_acc": 0.7546308043643746 + }, + { + "epoch": 1.135168961201502, + "grad_norm": 1.9372538328170776, + "learning_rate": 2.8182025084347836e-05, + "loss": 0.9210749864578247, + "step": 454, + "token_acc": 0.7282898919262556 + }, + { + "epoch": 1.1376720901126407, + "grad_norm": 2.819469928741455, + "learning_rate": 2.8060266879980408e-05, + "loss": 0.695602536201477, + "step": 455, + "token_acc": 0.7881796251623678 + }, + { + "epoch": 1.1401752190237797, + "grad_norm": 1.7250150442123413, + "learning_rate": 2.7938434936445945e-05, + "loss": 0.7463157176971436, + "step": 456, + "token_acc": 0.7749062109212171 + }, + { + "epoch": 1.1426783479349187, + "grad_norm": 2.6007657051086426, + "learning_rate": 2.7816532189366197e-05, + "loss": 0.787858247756958, + "step": 457, + "token_acc": 0.7616864037040335 + }, + { + "epoch": 1.1451814768460575, + "grad_norm": 2.298821210861206, + "learning_rate": 2.7694561576068985e-05, + "loss": 0.7881502509117126, + "step": 458, + "token_acc": 0.7664104482688252 + }, + { + "epoch": 1.1476846057571966, + "grad_norm": 7.818414211273193, + "learning_rate": 2.757252603551741e-05, + "loss": 0.8358293175697327, + "step": 459, + "token_acc": 0.7499888487443687 + }, + { + "epoch": 1.1501877346683353, + "grad_norm": 0.8642250299453735, + "learning_rate": 2.7450428508239024e-05, + "loss": 0.8736441731452942, + "step": 460, + "token_acc": 0.7447342910020269 + }, + { + "epoch": 1.1526908635794744, + "grad_norm": 2.3678836822509766, + "learning_rate": 2.7328271936254995e-05, + "loss": 0.8240588903427124, + "step": 461, + "token_acc": 0.7507011866235167 + }, + { + "epoch": 1.1551939924906134, + "grad_norm": 4.159181594848633, + "learning_rate": 2.7206059263009244e-05, + "loss": 0.8616459369659424, + "step": 462, + "token_acc": 0.7484583250447583 + }, + { + "epoch": 1.1576971214017522, + "grad_norm": 2.0485188961029053, + "learning_rate": 2.7083793433297438e-05, + "loss": 0.8544602394104004, + "step": 463, + "token_acc": 0.7434052757793765 + }, + { + "epoch": 1.1602002503128912, + "grad_norm": 3.685590982437134, + "learning_rate": 2.6961477393196126e-05, + "loss": 0.9081782102584839, + "step": 464, + "token_acc": 0.7326156444122791 + }, + { + "epoch": 1.16270337922403, + "grad_norm": 2.547394037246704, + "learning_rate": 2.683911408999169e-05, + "loss": 0.7107387185096741, + "step": 465, + "token_acc": 0.7819461633663366 + }, + { + "epoch": 1.165206508135169, + "grad_norm": 4.8121209144592285, + "learning_rate": 2.6716706472109342e-05, + "loss": 0.6490302085876465, + "step": 466, + "token_acc": 0.8037789324515824 + }, + { + "epoch": 1.1677096370463078, + "grad_norm": 14.578204154968262, + "learning_rate": 2.659425748904212e-05, + "loss": 0.5259852409362793, + "step": 467, + "token_acc": 0.8461106745987204 + }, + { + "epoch": 1.1702127659574468, + "grad_norm": 8.176078796386719, + "learning_rate": 2.6471770091279724e-05, + "loss": 0.7505219578742981, + "step": 468, + "token_acc": 0.7776547651997416 + }, + { + "epoch": 1.1727158948685856, + "grad_norm": 3.2051355838775635, + "learning_rate": 2.6349247230237552e-05, + "loss": 0.7255773544311523, + "step": 469, + "token_acc": 0.7867267333260082 + }, + { + "epoch": 1.1752190237797246, + "grad_norm": 1.626749038696289, + "learning_rate": 2.6226691858185454e-05, + "loss": 0.8417118787765503, + "step": 470, + "token_acc": 0.7481726244117353 + }, + { + "epoch": 1.1777221526908637, + "grad_norm": 6.1625142097473145, + "learning_rate": 2.6104106928176687e-05, + "loss": 0.7143338918685913, + "step": 471, + "token_acc": 0.782307525795512 + }, + { + "epoch": 1.1802252816020025, + "grad_norm": 1.209688425064087, + "learning_rate": 2.598149539397672e-05, + "loss": 0.8743295669555664, + "step": 472, + "token_acc": 0.7435388711951131 + }, + { + "epoch": 1.1827284105131415, + "grad_norm": 4.4833550453186035, + "learning_rate": 2.585886020999206e-05, + "loss": 0.7911447286605835, + "step": 473, + "token_acc": 0.7650904203323559 + }, + { + "epoch": 1.1852315394242803, + "grad_norm": 1.926804780960083, + "learning_rate": 2.5736204331199088e-05, + "loss": 0.8273140788078308, + "step": 474, + "token_acc": 0.7583581805493879 + }, + { + "epoch": 1.1877346683354193, + "grad_norm": 1.872205376625061, + "learning_rate": 2.561353071307281e-05, + "loss": 0.8174236416816711, + "step": 475, + "token_acc": 0.7558880252469172 + }, + { + "epoch": 1.1902377972465583, + "grad_norm": 3.878399610519409, + "learning_rate": 2.5490842311515707e-05, + "loss": 0.6719313263893127, + "step": 476, + "token_acc": 0.7988101223395341 + }, + { + "epoch": 1.1927409261576971, + "grad_norm": 1.8818238973617554, + "learning_rate": 2.5368142082786466e-05, + "loss": 0.7724275588989258, + "step": 477, + "token_acc": 0.773079355042681 + }, + { + "epoch": 1.1952440550688361, + "grad_norm": 2.963927745819092, + "learning_rate": 2.5245432983428747e-05, + "loss": 0.9049360752105713, + "step": 478, + "token_acc": 0.7339738348323794 + }, + { + "epoch": 1.197747183979975, + "grad_norm": 2.7415409088134766, + "learning_rate": 2.5122717970199956e-05, + "loss": 0.8529146313667297, + "step": 479, + "token_acc": 0.7456251892219194 + }, + { + "epoch": 1.200250312891114, + "grad_norm": 1.6160272359848022, + "learning_rate": 2.5e-05, + "loss": 0.7292277812957764, + "step": 480, + "token_acc": 0.7809226832973535 + }, + { + "epoch": 1.2027534418022527, + "grad_norm": 1.343587875366211, + "learning_rate": 2.4877282029800053e-05, + "loss": 0.7619751691818237, + "step": 481, + "token_acc": 0.7706236189540879 + }, + { + "epoch": 1.2052565707133918, + "grad_norm": 1.3238308429718018, + "learning_rate": 2.4754567016571263e-05, + "loss": 0.8524097204208374, + "step": 482, + "token_acc": 0.7446827604774298 + }, + { + "epoch": 1.2077596996245306, + "grad_norm": 3.7486040592193604, + "learning_rate": 2.4631857917213543e-05, + "loss": 0.7500920295715332, + "step": 483, + "token_acc": 0.7754705144291092 + }, + { + "epoch": 1.2102628285356696, + "grad_norm": 2.8402061462402344, + "learning_rate": 2.4509157688484295e-05, + "loss": 0.8324809074401855, + "step": 484, + "token_acc": 0.7528833831695857 + }, + { + "epoch": 1.2127659574468086, + "grad_norm": 3.4831743240356445, + "learning_rate": 2.4386469286927196e-05, + "loss": 0.8428285717964172, + "step": 485, + "token_acc": 0.7473346542126615 + }, + { + "epoch": 1.2152690863579474, + "grad_norm": 1.403225302696228, + "learning_rate": 2.426379566880092e-05, + "loss": 0.9696469306945801, + "step": 486, + "token_acc": 0.71866889465638 + }, + { + "epoch": 1.2177722152690864, + "grad_norm": 1.4889639616012573, + "learning_rate": 2.414113979000794e-05, + "loss": 0.8492543697357178, + "step": 487, + "token_acc": 0.7504687579182081 + }, + { + "epoch": 1.2202753441802252, + "grad_norm": 2.625995397567749, + "learning_rate": 2.4018504606023293e-05, + "loss": 0.7114861607551575, + "step": 488, + "token_acc": 0.7869125090383224 + }, + { + "epoch": 1.2227784730913642, + "grad_norm": 1.7950961589813232, + "learning_rate": 2.389589307182332e-05, + "loss": 0.8308013677597046, + "step": 489, + "token_acc": 0.7517450509211581 + }, + { + "epoch": 1.2252816020025032, + "grad_norm": 2.1624467372894287, + "learning_rate": 2.3773308141814552e-05, + "loss": 0.6955065727233887, + "step": 490, + "token_acc": 0.7887615628883059 + }, + { + "epoch": 1.227784730913642, + "grad_norm": 8.656285285949707, + "learning_rate": 2.365075276976245e-05, + "loss": 0.8983242511749268, + "step": 491, + "token_acc": 0.7329764252841175 + }, + { + "epoch": 1.230287859824781, + "grad_norm": 2.0143282413482666, + "learning_rate": 2.3528229908720272e-05, + "loss": 0.6728692650794983, + "step": 492, + "token_acc": 0.7958803160791974 + }, + { + "epoch": 1.2327909887359199, + "grad_norm": 7.166861534118652, + "learning_rate": 2.3405742510957894e-05, + "loss": 0.7883687615394592, + "step": 493, + "token_acc": 0.7684217714949122 + }, + { + "epoch": 1.2352941176470589, + "grad_norm": 2.849721908569336, + "learning_rate": 2.328329352789066e-05, + "loss": 0.7245194911956787, + "step": 494, + "token_acc": 0.7787610619469026 + }, + { + "epoch": 1.2377972465581977, + "grad_norm": 5.236846923828125, + "learning_rate": 2.3160885910008318e-05, + "loss": 0.8468673825263977, + "step": 495, + "token_acc": 0.7493651103731197 + }, + { + "epoch": 1.2403003754693367, + "grad_norm": 1.2859762907028198, + "learning_rate": 2.303852260680388e-05, + "loss": 0.8326257467269897, + "step": 496, + "token_acc": 0.7531454639099404 + }, + { + "epoch": 1.2428035043804755, + "grad_norm": 1.9283963441848755, + "learning_rate": 2.291620656670256e-05, + "loss": 0.6319226622581482, + "step": 497, + "token_acc": 0.8054604261796042 + }, + { + "epoch": 1.2453066332916145, + "grad_norm": 3.758319616317749, + "learning_rate": 2.279394073699077e-05, + "loss": 0.6995894908905029, + "step": 498, + "token_acc": 0.7890441061057919 + }, + { + "epoch": 1.2478097622027535, + "grad_norm": 1.2176576852798462, + "learning_rate": 2.267172806374501e-05, + "loss": 0.7224262356758118, + "step": 499, + "token_acc": 0.7844820331566102 + }, + { + "epoch": 1.2503128911138923, + "grad_norm": 2.0414905548095703, + "learning_rate": 2.2549571491760986e-05, + "loss": 0.5559295415878296, + "step": 500, + "token_acc": 0.830029368575624 + }, + { + "epoch": 1.2528160200250313, + "grad_norm": 2.3053483963012695, + "learning_rate": 2.2427473964482598e-05, + "loss": 0.6197410225868225, + "step": 501, + "token_acc": 0.8072528564331843 + }, + { + "epoch": 1.2553191489361701, + "grad_norm": 2.062232494354248, + "learning_rate": 2.2305438423931017e-05, + "loss": 0.8683875799179077, + "step": 502, + "token_acc": 0.743580453783796 + }, + { + "epoch": 1.2578222778473092, + "grad_norm": 0.8906859755516052, + "learning_rate": 2.2183467810633812e-05, + "loss": 0.9356937408447266, + "step": 503, + "token_acc": 0.7245146004492445 + }, + { + "epoch": 1.2603254067584482, + "grad_norm": 3.9231433868408203, + "learning_rate": 2.2061565063554064e-05, + "loss": 0.6747022867202759, + "step": 504, + "token_acc": 0.7981907419882591 + }, + { + "epoch": 1.262828535669587, + "grad_norm": 2.7428345680236816, + "learning_rate": 2.1939733120019598e-05, + "loss": 0.7441482543945312, + "step": 505, + "token_acc": 0.7742395794217048 + }, + { + "epoch": 1.265331664580726, + "grad_norm": 1.9277092218399048, + "learning_rate": 2.1817974915652173e-05, + "loss": 0.6530448198318481, + "step": 506, + "token_acc": 0.7975220638153429 + }, + { + "epoch": 1.2678347934918648, + "grad_norm": 1.6292767524719238, + "learning_rate": 2.1696293384296746e-05, + "loss": 0.6860779523849487, + "step": 507, + "token_acc": 0.7898953564421191 + }, + { + "epoch": 1.2703379224030038, + "grad_norm": 2.6792891025543213, + "learning_rate": 2.1574691457950803e-05, + "loss": 0.8034096956253052, + "step": 508, + "token_acc": 0.7567851055460862 + }, + { + "epoch": 1.2728410513141426, + "grad_norm": 2.100313425064087, + "learning_rate": 2.1453172066693673e-05, + "loss": 0.7841708064079285, + "step": 509, + "token_acc": 0.7575472165766123 + }, + { + "epoch": 1.2753441802252816, + "grad_norm": 2.4685211181640625, + "learning_rate": 2.1331738138615958e-05, + "loss": 0.8183025121688843, + "step": 510, + "token_acc": 0.7573227392094808 + }, + { + "epoch": 1.2778473091364204, + "grad_norm": 6.109943389892578, + "learning_rate": 2.1210392599748974e-05, + "loss": 0.7484889030456543, + "step": 511, + "token_acc": 0.7755445227418322 + }, + { + "epoch": 1.2803504380475594, + "grad_norm": 1.9834048748016357, + "learning_rate": 2.1089138373994223e-05, + "loss": 0.8298561573028564, + "step": 512, + "token_acc": 0.7505842708842871 + }, + { + "epoch": 1.2828535669586985, + "grad_norm": 2.403406858444214, + "learning_rate": 2.0967978383052994e-05, + "loss": 0.8005748987197876, + "step": 513, + "token_acc": 0.758890922109953 + }, + { + "epoch": 1.2853566958698373, + "grad_norm": 1.7540974617004395, + "learning_rate": 2.0846915546355868e-05, + "loss": 0.7584190368652344, + "step": 514, + "token_acc": 0.7752175818671342 + }, + { + "epoch": 1.2878598247809763, + "grad_norm": 3.21459698677063, + "learning_rate": 2.0725952780992468e-05, + "loss": 0.8561462163925171, + "step": 515, + "token_acc": 0.7418676224239354 + }, + { + "epoch": 1.290362953692115, + "grad_norm": 1.681273341178894, + "learning_rate": 2.0605093001641138e-05, + "loss": 0.7925042510032654, + "step": 516, + "token_acc": 0.7639773324764854 + }, + { + "epoch": 1.292866082603254, + "grad_norm": 1.0431792736053467, + "learning_rate": 2.048433912049868e-05, + "loss": 0.8750126361846924, + "step": 517, + "token_acc": 0.7400191632066433 + }, + { + "epoch": 1.295369211514393, + "grad_norm": 4.3631911277771, + "learning_rate": 2.036369404721023e-05, + "loss": 0.7869176864624023, + "step": 518, + "token_acc": 0.7620188403443235 + }, + { + "epoch": 1.297872340425532, + "grad_norm": 1.3742365837097168, + "learning_rate": 2.0243160688799105e-05, + "loss": 0.8369603753089905, + "step": 519, + "token_acc": 0.7513550803193062 + }, + { + "epoch": 1.300375469336671, + "grad_norm": 0.8509203791618347, + "learning_rate": 2.0122741949596797e-05, + "loss": 0.86566162109375, + "step": 520, + "token_acc": 0.7443547816238408 + }, + { + "epoch": 1.3028785982478097, + "grad_norm": 1.0245444774627686, + "learning_rate": 2.0002440731172958e-05, + "loss": 0.8384143114089966, + "step": 521, + "token_acc": 0.748472884386174 + }, + { + "epoch": 1.3053817271589487, + "grad_norm": 1.5151759386062622, + "learning_rate": 1.988225993226551e-05, + "loss": 0.7885670065879822, + "step": 522, + "token_acc": 0.7661560384752405 + }, + { + "epoch": 1.3078848560700875, + "grad_norm": 4.340545177459717, + "learning_rate": 1.976220244871079e-05, + "loss": 0.7875890731811523, + "step": 523, + "token_acc": 0.764338076757223 + }, + { + "epoch": 1.3103879849812266, + "grad_norm": 1.4497512578964233, + "learning_rate": 1.9642271173373737e-05, + "loss": 0.8240665793418884, + "step": 524, + "token_acc": 0.7531088719587122 + }, + { + "epoch": 1.3128911138923653, + "grad_norm": 4.8524088859558105, + "learning_rate": 1.9522468996078258e-05, + "loss": 0.7155791521072388, + "step": 525, + "token_acc": 0.7859528907922912 + }, + { + "epoch": 1.3153942428035044, + "grad_norm": 1.4243345260620117, + "learning_rate": 1.940279880353754e-05, + "loss": 0.8229907155036926, + "step": 526, + "token_acc": 0.7575123417042283 + }, + { + "epoch": 1.3178973717146434, + "grad_norm": 1.1557880640029907, + "learning_rate": 1.9283263479284514e-05, + "loss": 0.8167639374732971, + "step": 527, + "token_acc": 0.7524916943521595 + }, + { + "epoch": 1.3204005006257822, + "grad_norm": 2.145895004272461, + "learning_rate": 1.9163865903602374e-05, + "loss": 0.7714104056358337, + "step": 528, + "token_acc": 0.7715271647540326 + }, + { + "epoch": 1.3229036295369212, + "grad_norm": 1.0105962753295898, + "learning_rate": 1.9044608953455138e-05, + "loss": 0.8628207445144653, + "step": 529, + "token_acc": 0.7388354186717998 + }, + { + "epoch": 1.32540675844806, + "grad_norm": 1.6246225833892822, + "learning_rate": 1.8925495502418406e-05, + "loss": 0.8422914743423462, + "step": 530, + "token_acc": 0.7541976188053322 + }, + { + "epoch": 1.327909887359199, + "grad_norm": 1.6991968154907227, + "learning_rate": 1.880652842061004e-05, + "loss": 0.6368581056594849, + "step": 531, + "token_acc": 0.8030737554231929 + }, + { + "epoch": 1.330413016270338, + "grad_norm": 1.9977556467056274, + "learning_rate": 1.868771057462105e-05, + "loss": 0.9611953496932983, + "step": 532, + "token_acc": 0.7224977890567924 + }, + { + "epoch": 1.3329161451814768, + "grad_norm": 1.7200034856796265, + "learning_rate": 1.8569044827446515e-05, + "loss": 0.779466450214386, + "step": 533, + "token_acc": 0.7697901384193404 + }, + { + "epoch": 1.3354192740926158, + "grad_norm": 2.9292917251586914, + "learning_rate": 1.8450534038416568e-05, + "loss": 0.8787710070610046, + "step": 534, + "token_acc": 0.7420819370878824 + }, + { + "epoch": 1.3379224030037546, + "grad_norm": 1.74767005443573, + "learning_rate": 1.8332181063127545e-05, + "loss": 0.7538915276527405, + "step": 535, + "token_acc": 0.7723708164122672 + }, + { + "epoch": 1.3404255319148937, + "grad_norm": 2.842759132385254, + "learning_rate": 1.8213988753373146e-05, + "loss": 0.8347668647766113, + "step": 536, + "token_acc": 0.7466009191880506 + }, + { + "epoch": 1.3429286608260325, + "grad_norm": 1.0351887941360474, + "learning_rate": 1.809595995707573e-05, + "loss": 0.813193678855896, + "step": 537, + "token_acc": 0.756039689387403 + }, + { + "epoch": 1.3454317897371715, + "grad_norm": 2.1326282024383545, + "learning_rate": 1.7978097518217703e-05, + "loss": 0.7035706043243408, + "step": 538, + "token_acc": 0.7871062158206886 + }, + { + "epoch": 1.3479349186483103, + "grad_norm": 1.6530029773712158, + "learning_rate": 1.7860404276772945e-05, + "loss": 0.6484057903289795, + "step": 539, + "token_acc": 0.8037213327563825 + }, + { + "epoch": 1.3504380475594493, + "grad_norm": 1.397707462310791, + "learning_rate": 1.7742883068638447e-05, + "loss": 0.8277699947357178, + "step": 540, + "token_acc": 0.7495398833065747 + }, + { + "epoch": 1.3529411764705883, + "grad_norm": 2.410323143005371, + "learning_rate": 1.762553672556591e-05, + "loss": 0.8146207332611084, + "step": 541, + "token_acc": 0.7571063829787235 + }, + { + "epoch": 1.355444305381727, + "grad_norm": 1.910866379737854, + "learning_rate": 1.7508368075093583e-05, + "loss": 0.7210761904716492, + "step": 542, + "token_acc": 0.7774188701923077 + }, + { + "epoch": 1.3579474342928661, + "grad_norm": 11.782573699951172, + "learning_rate": 1.7391379940478076e-05, + "loss": 0.6522407531738281, + "step": 543, + "token_acc": 0.8072419561153202 + }, + { + "epoch": 1.360450563204005, + "grad_norm": 1.7913554906845093, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.7852916121482849, + "step": 544, + "token_acc": 0.7610718065845914 + }, + { + "epoch": 1.362953692115144, + "grad_norm": 1.8758189678192139, + "learning_rate": 1.7157956490027717e-05, + "loss": 0.7586523294448853, + "step": 545, + "token_acc": 0.7717872152178722 + }, + { + "epoch": 1.365456821026283, + "grad_norm": 3.353968858718872, + "learning_rate": 1.704152679868626e-05, + "loss": 0.6757744550704956, + "step": 546, + "token_acc": 0.793317610062893 + }, + { + "epoch": 1.3679599499374218, + "grad_norm": 1.8377400636672974, + "learning_rate": 1.6925288872052843e-05, + "loss": 0.8068370819091797, + "step": 547, + "token_acc": 0.7570990806945863 + }, + { + "epoch": 1.3704630788485608, + "grad_norm": 1.3780946731567383, + "learning_rate": 1.6809245510957665e-05, + "loss": 0.8233660459518433, + "step": 548, + "token_acc": 0.7505704506560182 + }, + { + "epoch": 1.3729662077596996, + "grad_norm": 5.142945766448975, + "learning_rate": 1.6693399511542735e-05, + "loss": 0.7289072871208191, + "step": 549, + "token_acc": 0.7812933869199854 + }, + { + "epoch": 1.3754693366708386, + "grad_norm": 1.773954153060913, + "learning_rate": 1.65777536651945e-05, + "loss": 0.7236466407775879, + "step": 550, + "token_acc": 0.7810041481905307 + }, + { + "epoch": 1.3779724655819774, + "grad_norm": 3.5997884273529053, + "learning_rate": 1.6462310758476595e-05, + "loss": 0.8042117357254028, + "step": 551, + "token_acc": 0.7581943081452405 + }, + { + "epoch": 1.3804755944931164, + "grad_norm": 0.8696406483650208, + "learning_rate": 1.6347073573062672e-05, + "loss": 0.8300492167472839, + "step": 552, + "token_acc": 0.7506484670663776 + }, + { + "epoch": 1.3829787234042552, + "grad_norm": 1.5040565729141235, + "learning_rate": 1.6232044885669427e-05, + "loss": 0.748427152633667, + "step": 553, + "token_acc": 0.7755393724903015 + }, + { + "epoch": 1.3854818523153942, + "grad_norm": 7.286196708679199, + "learning_rate": 1.6117227467989602e-05, + "loss": 0.703101634979248, + "step": 554, + "token_acc": 0.7881292820971105 + }, + { + "epoch": 1.3879849812265332, + "grad_norm": 1.6359056234359741, + "learning_rate": 1.6002624086625294e-05, + "loss": 0.8726459741592407, + "step": 555, + "token_acc": 0.7418959244573438 + }, + { + "epoch": 1.390488110137672, + "grad_norm": 5.042118549346924, + "learning_rate": 1.588823750302126e-05, + "loss": 0.7041570544242859, + "step": 556, + "token_acc": 0.7845845042151747 + }, + { + "epoch": 1.392991239048811, + "grad_norm": 1.9065269231796265, + "learning_rate": 1.577407047339834e-05, + "loss": 0.8025046586990356, + "step": 557, + "token_acc": 0.7626718792127258 + }, + { + "epoch": 1.3954943679599499, + "grad_norm": 1.8250200748443604, + "learning_rate": 1.5660125748687094e-05, + "loss": 0.6778990030288696, + "step": 558, + "token_acc": 0.7909020418712845 + }, + { + "epoch": 1.3979974968710889, + "grad_norm": 2.2167229652404785, + "learning_rate": 1.5546406074461488e-05, + "loss": 0.8701958656311035, + "step": 559, + "token_acc": 0.7410597648595689 + }, + { + "epoch": 1.400500625782228, + "grad_norm": 3.1135730743408203, + "learning_rate": 1.5432914190872757e-05, + "loss": 0.8122137784957886, + "step": 560, + "token_acc": 0.7573019661325151 + }, + { + "epoch": 1.4030037546933667, + "grad_norm": 1.591567039489746, + "learning_rate": 1.5319652832583362e-05, + "loss": 0.7499758005142212, + "step": 561, + "token_acc": 0.7801376009572241 + }, + { + "epoch": 1.4055068836045057, + "grad_norm": 2.626103401184082, + "learning_rate": 1.5206624728701103e-05, + "loss": 0.7822006940841675, + "step": 562, + "token_acc": 0.7697957003605288 + }, + { + "epoch": 1.4080100125156445, + "grad_norm": 1.4338953495025635, + "learning_rate": 1.5093832602713365e-05, + "loss": 0.8059190511703491, + "step": 563, + "token_acc": 0.7583813140593736 + }, + { + "epoch": 1.4105131414267835, + "grad_norm": 2.3067641258239746, + "learning_rate": 1.498127917242148e-05, + "loss": 0.956562876701355, + "step": 564, + "token_acc": 0.7224202015557344 + }, + { + "epoch": 1.4130162703379223, + "grad_norm": 4.148603439331055, + "learning_rate": 1.4868967149875257e-05, + "loss": 0.7793439030647278, + "step": 565, + "token_acc": 0.7708575412502905 + }, + { + "epoch": 1.4155193992490613, + "grad_norm": 3.040891170501709, + "learning_rate": 1.4756899241307615e-05, + "loss": 0.8436172008514404, + "step": 566, + "token_acc": 0.7491851498529295 + }, + { + "epoch": 1.4180225281602001, + "grad_norm": 6.971378803253174, + "learning_rate": 1.4645078147069402e-05, + "loss": 0.7122055292129517, + "step": 567, + "token_acc": 0.7875359934183463 + }, + { + "epoch": 1.4205256570713392, + "grad_norm": 2.5589678287506104, + "learning_rate": 1.4533506561564306e-05, + "loss": 0.7449221611022949, + "step": 568, + "token_acc": 0.7731634868045242 + }, + { + "epoch": 1.4230287859824782, + "grad_norm": 3.4065513610839844, + "learning_rate": 1.4422187173183899e-05, + "loss": 0.8547236323356628, + "step": 569, + "token_acc": 0.7475447402880838 + }, + { + "epoch": 1.425531914893617, + "grad_norm": 2.0447330474853516, + "learning_rate": 1.4311122664242954e-05, + "loss": 0.7997812628746033, + "step": 570, + "token_acc": 0.7587858644117503 + }, + { + "epoch": 1.428035043804756, + "grad_norm": 19.273677825927734, + "learning_rate": 1.4200315710914705e-05, + "loss": 0.7676827907562256, + "step": 571, + "token_acc": 0.77000777000777 + }, + { + "epoch": 1.4305381727158948, + "grad_norm": 3.677581548690796, + "learning_rate": 1.4089768983166444e-05, + "loss": 0.7329694032669067, + "step": 572, + "token_acc": 0.7787445286644603 + }, + { + "epoch": 1.4330413016270338, + "grad_norm": 2.750782012939453, + "learning_rate": 1.3979485144695158e-05, + "loss": 0.6624218225479126, + "step": 573, + "token_acc": 0.7990237205400046 + }, + { + "epoch": 1.4355444305381728, + "grad_norm": 1.7288239002227783, + "learning_rate": 1.38694668528633e-05, + "loss": 0.7868748903274536, + "step": 574, + "token_acc": 0.7691857059168131 + }, + { + "epoch": 1.4380475594493116, + "grad_norm": 1.542420744895935, + "learning_rate": 1.3759716758634832e-05, + "loss": 0.8554753661155701, + "step": 575, + "token_acc": 0.7459746488523467 + }, + { + "epoch": 1.4405506883604506, + "grad_norm": 1.5799529552459717, + "learning_rate": 1.3650237506511331e-05, + "loss": 0.8055590987205505, + "step": 576, + "token_acc": 0.7627781853753974 + }, + { + "epoch": 1.4430538172715894, + "grad_norm": 2.379765748977661, + "learning_rate": 1.3541031734468212e-05, + "loss": 0.8156087398529053, + "step": 577, + "token_acc": 0.7587134194568943 + }, + { + "epoch": 1.4455569461827285, + "grad_norm": 5.061030864715576, + "learning_rate": 1.3432102073891251e-05, + "loss": 0.6562641859054565, + "step": 578, + "token_acc": 0.8027216563700117 + }, + { + "epoch": 1.4480600750938675, + "grad_norm": 3.107051372528076, + "learning_rate": 1.3323451149513092e-05, + "loss": 0.6440657377243042, + "step": 579, + "token_acc": 0.806850025947068 + }, + { + "epoch": 1.4505632040050063, + "grad_norm": 1.5127389430999756, + "learning_rate": 1.3215081579350058e-05, + "loss": 0.7621431350708008, + "step": 580, + "token_acc": 0.7777696579947384 + }, + { + "epoch": 1.453066332916145, + "grad_norm": 3.7916858196258545, + "learning_rate": 1.3106995974639084e-05, + "loss": 0.7451849579811096, + "step": 581, + "token_acc": 0.7728736170461863 + }, + { + "epoch": 1.455569461827284, + "grad_norm": 1.4253214597702026, + "learning_rate": 1.2999196939774722e-05, + "loss": 0.9144057035446167, + "step": 582, + "token_acc": 0.7358452790902539 + }, + { + "epoch": 1.458072590738423, + "grad_norm": 2.429523229598999, + "learning_rate": 1.2891687072246472e-05, + "loss": 0.6499612331390381, + "step": 583, + "token_acc": 0.8022828400077384 + }, + { + "epoch": 1.460575719649562, + "grad_norm": 1.506866693496704, + "learning_rate": 1.2784468962576136e-05, + "loss": 0.8545807600021362, + "step": 584, + "token_acc": 0.7438212275161334 + }, + { + "epoch": 1.463078848560701, + "grad_norm": 1.14063560962677, + "learning_rate": 1.2677545194255402e-05, + "loss": 0.7255370020866394, + "step": 585, + "token_acc": 0.7810890120639061 + }, + { + "epoch": 1.4655819774718397, + "grad_norm": 2.096499443054199, + "learning_rate": 1.2570918343683635e-05, + "loss": 0.7315889000892639, + "step": 586, + "token_acc": 0.7754388468674183 + }, + { + "epoch": 1.4680851063829787, + "grad_norm": 5.344691753387451, + "learning_rate": 1.2464590980105776e-05, + "loss": 0.8230787515640259, + "step": 587, + "token_acc": 0.7523631400697569 + }, + { + "epoch": 1.4705882352941178, + "grad_norm": 1.977255940437317, + "learning_rate": 1.235856566555039e-05, + "loss": 0.676746129989624, + "step": 588, + "token_acc": 0.7930442637759711 + }, + { + "epoch": 1.4730913642052565, + "grad_norm": 1.3346836566925049, + "learning_rate": 1.2252844954767984e-05, + "loss": 0.7244657278060913, + "step": 589, + "token_acc": 0.7811462961921368 + }, + { + "epoch": 1.4755944931163956, + "grad_norm": 3.2221341133117676, + "learning_rate": 1.2147431395169459e-05, + "loss": 0.6661178469657898, + "step": 590, + "token_acc": 0.7992459076696707 + }, + { + "epoch": 1.4780976220275344, + "grad_norm": 4.241289138793945, + "learning_rate": 1.2042327526764669e-05, + "loss": 0.744454026222229, + "step": 591, + "token_acc": 0.7769393863806435 + }, + { + "epoch": 1.4806007509386734, + "grad_norm": 7.127607822418213, + "learning_rate": 1.1937535882101281e-05, + "loss": 0.6379393339157104, + "step": 592, + "token_acc": 0.8044160942100098 + }, + { + "epoch": 1.4831038798498124, + "grad_norm": 1.677003264427185, + "learning_rate": 1.1833058986203705e-05, + "loss": 0.7646165490150452, + "step": 593, + "token_acc": 0.7687584863333137 + }, + { + "epoch": 1.4856070087609512, + "grad_norm": 1.2843506336212158, + "learning_rate": 1.1728899356512265e-05, + "loss": 0.8055639266967773, + "step": 594, + "token_acc": 0.7631550337029789 + }, + { + "epoch": 1.48811013767209, + "grad_norm": 1.2286913394927979, + "learning_rate": 1.1625059502822574e-05, + "loss": 0.7198688983917236, + "step": 595, + "token_acc": 0.7768950480855386 + }, + { + "epoch": 1.490613266583229, + "grad_norm": 4.122060298919678, + "learning_rate": 1.1521541927224994e-05, + "loss": 0.6652401685714722, + "step": 596, + "token_acc": 0.7982724491632176 + }, + { + "epoch": 1.493116395494368, + "grad_norm": 3.4319710731506348, + "learning_rate": 1.1418349124044405e-05, + "loss": 0.8203213214874268, + "step": 597, + "token_acc": 0.7535128506463645 + }, + { + "epoch": 1.4956195244055068, + "grad_norm": 1.9524973630905151, + "learning_rate": 1.1315483579780095e-05, + "loss": 0.8763255476951599, + "step": 598, + "token_acc": 0.7429590926468714 + }, + { + "epoch": 1.4981226533166458, + "grad_norm": 2.4943723678588867, + "learning_rate": 1.1212947773045767e-05, + "loss": 0.7097381949424744, + "step": 599, + "token_acc": 0.7815607985480943 + }, + { + "epoch": 1.5006257822277846, + "grad_norm": 21.619144439697266, + "learning_rate": 1.1110744174509952e-05, + "loss": 0.7615182399749756, + "step": 600, + "token_acc": 0.7687875878101784 + }, + { + "epoch": 1.5031289111389237, + "grad_norm": 1.6322247982025146, + "learning_rate": 1.100887524683635e-05, + "loss": 0.7482010722160339, + "step": 601, + "token_acc": 0.7713472485768501 + }, + { + "epoch": 1.5056320400500627, + "grad_norm": 1.0364089012145996, + "learning_rate": 1.090734344462458e-05, + "loss": 0.8905367851257324, + "step": 602, + "token_acc": 0.7401884180917088 + }, + { + "epoch": 1.5081351689612015, + "grad_norm": 4.594523906707764, + "learning_rate": 1.0806151214350995e-05, + "loss": 0.7736368179321289, + "step": 603, + "token_acc": 0.7722505668934241 + }, + { + "epoch": 1.5106382978723403, + "grad_norm": 1.897789478302002, + "learning_rate": 1.0705300994309697e-05, + "loss": 0.744308590888977, + "step": 604, + "token_acc": 0.7725912143030499 + }, + { + "epoch": 1.5131414267834793, + "grad_norm": 3.5902726650238037, + "learning_rate": 1.0604795214553868e-05, + "loss": 0.6907957196235657, + "step": 605, + "token_acc": 0.7894978216005504 + }, + { + "epoch": 1.5156445556946183, + "grad_norm": 1.7016520500183105, + "learning_rate": 1.0504636296837161e-05, + "loss": 0.8940221071243286, + "step": 606, + "token_acc": 0.7394552473548756 + }, + { + "epoch": 1.5181476846057573, + "grad_norm": 1.5157966613769531, + "learning_rate": 1.0404826654555342e-05, + "loss": 0.8362439870834351, + "step": 607, + "token_acc": 0.7472730147020077 + }, + { + "epoch": 1.5206508135168961, + "grad_norm": 2.323500871658325, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.786865234375, + "step": 608, + "token_acc": 0.764400989515844 + }, + { + "epoch": 1.523153942428035, + "grad_norm": 74.33378601074219, + "learning_rate": 1.0206264807741434e-05, + "loss": 0.7950047254562378, + "step": 609, + "token_acc": 0.7578022799476734 + }, + { + "epoch": 1.525657071339174, + "grad_norm": 3.3788833618164062, + "learning_rate": 1.0107517387689166e-05, + "loss": 0.6147444248199463, + "step": 610, + "token_acc": 0.815751960085531 + }, + { + "epoch": 1.528160200250313, + "grad_norm": 2.66544771194458, + "learning_rate": 1.0009128811916197e-05, + "loss": 0.6397148966789246, + "step": 611, + "token_acc": 0.7999815990431502 + }, + { + "epoch": 1.530663329161452, + "grad_norm": 1.6965497732162476, + "learning_rate": 9.911101451160715e-06, + "loss": 0.7612807750701904, + "step": 612, + "token_acc": 0.7722021881303098 + }, + { + "epoch": 1.5331664580725908, + "grad_norm": 2.2254910469055176, + "learning_rate": 9.813437667457229e-06, + "loss": 0.65788334608078, + "step": 613, + "token_acc": 0.8018885221855518 + }, + { + "epoch": 1.5356695869837296, + "grad_norm": 1.936301350593567, + "learning_rate": 9.716139814079595e-06, + "loss": 0.8385921716690063, + "step": 614, + "token_acc": 0.7499523416153016 + }, + { + "epoch": 1.5381727158948686, + "grad_norm": 3.259331703186035, + "learning_rate": 9.619210235484333e-06, + "loss": 0.7441162467002869, + "step": 615, + "token_acc": 0.7762369996848408 + }, + { + "epoch": 1.5406758448060076, + "grad_norm": 3.5360541343688965, + "learning_rate": 9.522651267254149e-06, + "loss": 0.7276872992515564, + "step": 616, + "token_acc": 0.7725686181183563 + }, + { + "epoch": 1.5431789737171464, + "grad_norm": 1.201682209968567, + "learning_rate": 9.426465236041651e-06, + "loss": 0.702145516872406, + "step": 617, + "token_acc": 0.7885718382563809 + }, + { + "epoch": 1.5456821026282852, + "grad_norm": 1.1223235130310059, + "learning_rate": 9.330654459513266e-06, + "loss": 0.7966522574424744, + "step": 618, + "token_acc": 0.7599822756141992 + }, + { + "epoch": 1.5481852315394242, + "grad_norm": 2.9685420989990234, + "learning_rate": 9.235221246293405e-06, + "loss": 0.8100804090499878, + "step": 619, + "token_acc": 0.756401384083045 + }, + { + "epoch": 1.5506883604505632, + "grad_norm": 2.115173578262329, + "learning_rate": 9.140167895908867e-06, + "loss": 0.7754491567611694, + "step": 620, + "token_acc": 0.7694536716375716 + }, + { + "epoch": 1.5531914893617023, + "grad_norm": 1.030800700187683, + "learning_rate": 9.04549669873337e-06, + "loss": 0.815934419631958, + "step": 621, + "token_acc": 0.7545691906005222 + }, + { + "epoch": 1.555694618272841, + "grad_norm": 9.539032936096191, + "learning_rate": 8.951209935932426e-06, + "loss": 0.6096709966659546, + "step": 622, + "token_acc": 0.8140929535232384 + }, + { + "epoch": 1.5581977471839799, + "grad_norm": 3.739379644393921, + "learning_rate": 8.857309879408324e-06, + "loss": 0.6682818531990051, + "step": 623, + "token_acc": 0.8030173336186603 + }, + { + "epoch": 1.5607008760951189, + "grad_norm": 2.9171271324157715, + "learning_rate": 8.763798791745411e-06, + "loss": 0.8189687728881836, + "step": 624, + "token_acc": 0.7579735300499023 + }, + { + "epoch": 1.563204005006258, + "grad_norm": 3.653998613357544, + "learning_rate": 8.670678926155587e-06, + "loss": 0.8347030878067017, + "step": 625, + "token_acc": 0.7483955025816725 + }, + { + "epoch": 1.565707133917397, + "grad_norm": 3.2206311225891113, + "learning_rate": 8.577952526423969e-06, + "loss": 0.7974085807800293, + "step": 626, + "token_acc": 0.7626205161985747 + }, + { + "epoch": 1.5682102628285357, + "grad_norm": 1.857633352279663, + "learning_rate": 8.48562182685487e-06, + "loss": 0.6958124041557312, + "step": 627, + "token_acc": 0.7893594633697225 + }, + { + "epoch": 1.5707133917396745, + "grad_norm": 3.203127861022949, + "learning_rate": 8.393689052217966e-06, + "loss": 0.6396089792251587, + "step": 628, + "token_acc": 0.8018999477078612 + }, + { + "epoch": 1.5732165206508135, + "grad_norm": 10.867119789123535, + "learning_rate": 8.3021564176946e-06, + "loss": 0.6756541132926941, + "step": 629, + "token_acc": 0.7908339076498966 + }, + { + "epoch": 1.5757196495619525, + "grad_norm": 1.9048235416412354, + "learning_rate": 8.211026128824539e-06, + "loss": 0.7945992946624756, + "step": 630, + "token_acc": 0.7612518398016888 + }, + { + "epoch": 1.5782227784730913, + "grad_norm": 5.721317768096924, + "learning_rate": 8.120300381452742e-06, + "loss": 0.8779458403587341, + "step": 631, + "token_acc": 0.7360282478996713 + }, + { + "epoch": 1.5807259073842301, + "grad_norm": 6.489996433258057, + "learning_rate": 8.029981361676456e-06, + "loss": 0.6239632368087769, + "step": 632, + "token_acc": 0.8178224169248851 + }, + { + "epoch": 1.5832290362953692, + "grad_norm": 2.635003089904785, + "learning_rate": 7.940071245792579e-06, + "loss": 0.60353684425354, + "step": 633, + "token_acc": 0.8162691386313926 + }, + { + "epoch": 1.5857321652065082, + "grad_norm": 5.4421467781066895, + "learning_rate": 7.850572200245184e-06, + "loss": 0.6887288689613342, + "step": 634, + "token_acc": 0.7906894415434994 + }, + { + "epoch": 1.5882352941176472, + "grad_norm": 1.4320110082626343, + "learning_rate": 7.761486381573327e-06, + "loss": 0.6909926533699036, + "step": 635, + "token_acc": 0.7896647808832221 + }, + { + "epoch": 1.590738423028786, + "grad_norm": 1.9564619064331055, + "learning_rate": 7.672815936359107e-06, + "loss": 0.7665590047836304, + "step": 636, + "token_acc": 0.7702360391479562 + }, + { + "epoch": 1.5932415519399248, + "grad_norm": 1.2858654260635376, + "learning_rate": 7.584563001175896e-06, + "loss": 0.8104827404022217, + "step": 637, + "token_acc": 0.7559560606781112 + }, + { + "epoch": 1.5957446808510638, + "grad_norm": 8.487231254577637, + "learning_rate": 7.4967297025369114e-06, + "loss": 0.5926421880722046, + "step": 638, + "token_acc": 0.8263585995520453 + }, + { + "epoch": 1.5982478097622028, + "grad_norm": 1.635348916053772, + "learning_rate": 7.409318156843933e-06, + "loss": 0.9333232641220093, + "step": 639, + "token_acc": 0.7273431148619875 + }, + { + "epoch": 1.6007509386733418, + "grad_norm": 4.053239345550537, + "learning_rate": 7.3223304703363135e-06, + "loss": 0.726628303527832, + "step": 640, + "token_acc": 0.7767200346170489 + }, + { + "epoch": 1.6032540675844806, + "grad_norm": 2.1414389610290527, + "learning_rate": 7.235768739040258e-06, + "loss": 0.796164870262146, + "step": 641, + "token_acc": 0.7624649111081406 + }, + { + "epoch": 1.6057571964956194, + "grad_norm": 1.8818213939666748, + "learning_rate": 7.149635048718295e-06, + "loss": 0.8160055875778198, + "step": 642, + "token_acc": 0.7571467589220685 + }, + { + "epoch": 1.6082603254067585, + "grad_norm": 0.7274258136749268, + "learning_rate": 7.063931474819005e-06, + "loss": 0.9394699335098267, + "step": 643, + "token_acc": 0.7232635060639471 + }, + { + "epoch": 1.6107634543178975, + "grad_norm": 2.1022329330444336, + "learning_rate": 6.9786600824270296e-06, + "loss": 0.872856616973877, + "step": 644, + "token_acc": 0.739904441691736 + }, + { + "epoch": 1.6132665832290363, + "grad_norm": 2.117232084274292, + "learning_rate": 6.893822926213331e-06, + "loss": 0.7678521871566772, + "step": 645, + "token_acc": 0.7683991041779288 + }, + { + "epoch": 1.615769712140175, + "grad_norm": 2.113924980163574, + "learning_rate": 6.8094220503856275e-06, + "loss": 0.7138104438781738, + "step": 646, + "token_acc": 0.788220905071032 + }, + { + "epoch": 1.618272841051314, + "grad_norm": 10.124676704406738, + "learning_rate": 6.725459488639211e-06, + "loss": 0.8729824423789978, + "step": 647, + "token_acc": 0.7402089353189598 + }, + { + "epoch": 1.620775969962453, + "grad_norm": 2.0404815673828125, + "learning_rate": 6.641937264107867e-06, + "loss": 0.75057452917099, + "step": 648, + "token_acc": 0.7728152449009975 + }, + { + "epoch": 1.6232790988735921, + "grad_norm": 3.357954502105713, + "learning_rate": 6.558857389315179e-06, + "loss": 0.6092256307601929, + "step": 649, + "token_acc": 0.8122177055103884 + }, + { + "epoch": 1.625782227784731, + "grad_norm": 1.6319386959075928, + "learning_rate": 6.476221866126029e-06, + "loss": 0.8065642714500427, + "step": 650, + "token_acc": 0.7608971431471051 + }, + { + "epoch": 1.6282853566958697, + "grad_norm": 4.5181050300598145, + "learning_rate": 6.394032685698325e-06, + "loss": 0.8111133575439453, + "step": 651, + "token_acc": 0.7587757724431984 + }, + { + "epoch": 1.6307884856070087, + "grad_norm": 3.557448148727417, + "learning_rate": 6.312291828435077e-06, + "loss": 0.624323844909668, + "step": 652, + "token_acc": 0.8063609037137593 + }, + { + "epoch": 1.6332916145181477, + "grad_norm": 2.8433284759521484, + "learning_rate": 6.231001263936651e-06, + "loss": 0.7201327681541443, + "step": 653, + "token_acc": 0.78446311592139 + }, + { + "epoch": 1.6357947434292868, + "grad_norm": 1.2021771669387817, + "learning_rate": 6.150162950953264e-06, + "loss": 0.8491130471229553, + "step": 654, + "token_acc": 0.7483784720503045 + }, + { + "epoch": 1.6382978723404256, + "grad_norm": 1.2091090679168701, + "learning_rate": 6.069778837337886e-06, + "loss": 0.8359229564666748, + "step": 655, + "token_acc": 0.7512554559534426 + }, + { + "epoch": 1.6408010012515644, + "grad_norm": 10.087580680847168, + "learning_rate": 5.989850859999227e-06, + "loss": 0.7748186588287354, + "step": 656, + "token_acc": 0.7694327731092437 + }, + { + "epoch": 1.6433041301627034, + "grad_norm": 1.498608946800232, + "learning_rate": 5.910380944855087e-06, + "loss": 0.8846578598022461, + "step": 657, + "token_acc": 0.7394652877104192 + }, + { + "epoch": 1.6458072590738424, + "grad_norm": 3.2764029502868652, + "learning_rate": 5.8313710067859626e-06, + "loss": 0.6131420135498047, + "step": 658, + "token_acc": 0.8132510900776349 + }, + { + "epoch": 1.6483103879849812, + "grad_norm": 2.0642950534820557, + "learning_rate": 5.752822949588893e-06, + "loss": 0.8031247854232788, + "step": 659, + "token_acc": 0.7614583333333333 + }, + { + "epoch": 1.65081351689612, + "grad_norm": 1.2550472021102905, + "learning_rate": 5.674738665931575e-06, + "loss": 0.7710773944854736, + "step": 660, + "token_acc": 0.7694515633008714 + }, + { + "epoch": 1.653316645807259, + "grad_norm": 2.364381790161133, + "learning_rate": 5.597120037306808e-06, + "loss": 0.7222622632980347, + "step": 661, + "token_acc": 0.7859005769382755 + }, + { + "epoch": 1.655819774718398, + "grad_norm": 3.985602617263794, + "learning_rate": 5.519968933987083e-06, + "loss": 0.7197556495666504, + "step": 662, + "token_acc": 0.7872414478918058 + }, + { + "epoch": 1.658322903629537, + "grad_norm": 3.4668893814086914, + "learning_rate": 5.443287214979592e-06, + "loss": 0.6038973331451416, + "step": 663, + "token_acc": 0.8172893919663428 + }, + { + "epoch": 1.6608260325406758, + "grad_norm": 16.531862258911133, + "learning_rate": 5.367076727981382e-06, + "loss": 0.6388102173805237, + "step": 664, + "token_acc": 0.8046867617877729 + }, + { + "epoch": 1.6633291614518146, + "grad_norm": 3.9002861976623535, + "learning_rate": 5.291339309334845e-06, + "loss": 0.6912767291069031, + "step": 665, + "token_acc": 0.7929694400282635 + }, + { + "epoch": 1.6658322903629537, + "grad_norm": 1.7196484804153442, + "learning_rate": 5.216076783983493e-06, + "loss": 0.6770153641700745, + "step": 666, + "token_acc": 0.7955169258920403 + }, + { + "epoch": 1.6683354192740927, + "grad_norm": 1.4810196161270142, + "learning_rate": 5.141290965427966e-06, + "loss": 0.8496290445327759, + "step": 667, + "token_acc": 0.7496900770764836 + }, + { + "epoch": 1.6708385481852317, + "grad_norm": 2.02133846282959, + "learning_rate": 5.066983655682325e-06, + "loss": 0.8104414939880371, + "step": 668, + "token_acc": 0.7553891414816796 + }, + { + "epoch": 1.6733416770963705, + "grad_norm": 1.4801369905471802, + "learning_rate": 4.993156645230643e-06, + "loss": 0.8000129461288452, + "step": 669, + "token_acc": 0.7611111111111111 + }, + { + "epoch": 1.6758448060075093, + "grad_norm": 1.9785418510437012, + "learning_rate": 4.91981171298388e-06, + "loss": 0.8052246570587158, + "step": 670, + "token_acc": 0.7555092592592593 + }, + { + "epoch": 1.6783479349186483, + "grad_norm": 2.4100208282470703, + "learning_rate": 4.846950626236976e-06, + "loss": 0.8232534527778625, + "step": 671, + "token_acc": 0.7465227319908657 + }, + { + "epoch": 1.6808510638297873, + "grad_norm": 1.3945097923278809, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.8596230149269104, + "step": 672, + "token_acc": 0.7454640797063451 + }, + { + "epoch": 1.6833541927409261, + "grad_norm": 1.8322561979293823, + "learning_rate": 4.702687000087386e-06, + "loss": 0.6880487203598022, + "step": 673, + "token_acc": 0.782898299577602 + }, + { + "epoch": 1.685857321652065, + "grad_norm": 2.1570794582366943, + "learning_rate": 4.631287936812764e-06, + "loss": 0.7599859237670898, + "step": 674, + "token_acc": 0.7674839001242797 + }, + { + "epoch": 1.688360450563204, + "grad_norm": 1.9660370349884033, + "learning_rate": 4.56037967121041e-06, + "loss": 0.7393922209739685, + "step": 675, + "token_acc": 0.774453781512605 + }, + { + "epoch": 1.690863579474343, + "grad_norm": 2.8953030109405518, + "learning_rate": 4.48996391186216e-06, + "loss": 0.8593490123748779, + "step": 676, + "token_acc": 0.7433499773036768 + }, + { + "epoch": 1.693366708385482, + "grad_norm": 1.105050802230835, + "learning_rate": 4.420042355482601e-06, + "loss": 0.7844275236129761, + "step": 677, + "token_acc": 0.7651860489769956 + }, + { + "epoch": 1.6958698372966208, + "grad_norm": 7.612730979919434, + "learning_rate": 4.350616686878176e-06, + "loss": 0.7978190183639526, + "step": 678, + "token_acc": 0.7632656274602425 + }, + { + "epoch": 1.6983729662077596, + "grad_norm": 0.9666391611099243, + "learning_rate": 4.2816885789065504e-06, + "loss": 0.8501102924346924, + "step": 679, + "token_acc": 0.748565553381314 + }, + { + "epoch": 1.7008760951188986, + "grad_norm": 1.675850749015808, + "learning_rate": 4.213259692436367e-06, + "loss": 0.7121337652206421, + "step": 680, + "token_acc": 0.7868174092957955 + }, + { + "epoch": 1.7033792240300376, + "grad_norm": 2.0955216884613037, + "learning_rate": 4.1453316763071935e-06, + "loss": 0.7239298224449158, + "step": 681, + "token_acc": 0.785748031496063 + }, + { + "epoch": 1.7058823529411766, + "grad_norm": 1.5945849418640137, + "learning_rate": 4.077906167289766e-06, + "loss": 0.7046365141868591, + "step": 682, + "token_acc": 0.7846875698220005 + }, + { + "epoch": 1.7083854818523154, + "grad_norm": 1.6976025104522705, + "learning_rate": 4.010984790046615e-06, + "loss": 0.6717643141746521, + "step": 683, + "token_acc": 0.797970126388357 + }, + { + "epoch": 1.7108886107634542, + "grad_norm": 4.0479817390441895, + "learning_rate": 3.944569157092839e-06, + "loss": 0.8405852317810059, + "step": 684, + "token_acc": 0.7521482434091308 + }, + { + "epoch": 1.7133917396745932, + "grad_norm": 3.3728387355804443, + "learning_rate": 3.878660868757323e-06, + "loss": 0.6040500998497009, + "step": 685, + "token_acc": 0.816435066049065 + }, + { + "epoch": 1.7158948685857323, + "grad_norm": 4.269870758056641, + "learning_rate": 3.8132615131441396e-06, + "loss": 0.8831207752227783, + "step": 686, + "token_acc": 0.7357807901973081 + }, + { + "epoch": 1.718397997496871, + "grad_norm": 2.9320452213287354, + "learning_rate": 3.748372666094277e-06, + "loss": 0.836078405380249, + "step": 687, + "token_acc": 0.7496101275112375 + }, + { + "epoch": 1.7209011264080099, + "grad_norm": 1.5719010829925537, + "learning_rate": 3.6839958911476957e-06, + "loss": 0.7011086344718933, + "step": 688, + "token_acc": 0.7888382505796754 + }, + { + "epoch": 1.7234042553191489, + "grad_norm": 4.483651161193848, + "learning_rate": 3.6201327395056246e-06, + "loss": 0.6982402801513672, + "step": 689, + "token_acc": 0.7868399225877799 + }, + { + "epoch": 1.7259073842302879, + "grad_norm": 1.8235728740692139, + "learning_rate": 3.5567847499932e-06, + "loss": 0.7384521961212158, + "step": 690, + "token_acc": 0.7768055997454661 + }, + { + "epoch": 1.728410513141427, + "grad_norm": 16.569927215576172, + "learning_rate": 3.4939534490223912e-06, + "loss": 0.6786566972732544, + "step": 691, + "token_acc": 0.7962027873156938 + }, + { + "epoch": 1.7309136420525657, + "grad_norm": 1.5950816869735718, + "learning_rate": 3.431640350555204e-06, + "loss": 0.614397406578064, + "step": 692, + "token_acc": 0.8129821260583255 + }, + { + "epoch": 1.7334167709637045, + "grad_norm": 3.7220969200134277, + "learning_rate": 3.369846956067224e-06, + "loss": 0.6824333071708679, + "step": 693, + "token_acc": 0.7938019759755491 + }, + { + "epoch": 1.7359198998748435, + "grad_norm": 1.5605802536010742, + "learning_rate": 3.308574754511404e-06, + "loss": 0.8088199496269226, + "step": 694, + "token_acc": 0.7540081128066448 + }, + { + "epoch": 1.7384230287859825, + "grad_norm": 1.3383564949035645, + "learning_rate": 3.2478252222822164e-06, + "loss": 0.7779883742332458, + "step": 695, + "token_acc": 0.7683611644746564 + }, + { + "epoch": 1.7409261576971216, + "grad_norm": 1.5642516613006592, + "learning_rate": 3.187599823180071e-06, + "loss": 0.7946350574493408, + "step": 696, + "token_acc": 0.7605515385908862 + }, + { + "epoch": 1.7434292866082604, + "grad_norm": 5.639887809753418, + "learning_rate": 3.1279000083760447e-06, + "loss": 0.7023658752441406, + "step": 697, + "token_acc": 0.7881643111000909 + }, + { + "epoch": 1.7459324155193992, + "grad_norm": 1.8614176511764526, + "learning_rate": 3.0687272163768987e-06, + "loss": 0.8359920978546143, + "step": 698, + "token_acc": 0.7491880857381461 + }, + { + "epoch": 1.7484355444305382, + "grad_norm": 1.091104507446289, + "learning_rate": 3.0100828729904275e-06, + "loss": 0.8066213726997375, + "step": 699, + "token_acc": 0.764406115248922 + }, + { + "epoch": 1.7509386733416772, + "grad_norm": 2.4092867374420166, + "learning_rate": 2.9519683912911266e-06, + "loss": 0.8912680149078369, + "step": 700, + "token_acc": 0.7388699378990641 + }, + { + "epoch": 1.753441802252816, + "grad_norm": 1.5786374807357788, + "learning_rate": 2.894385171586095e-06, + "loss": 0.8282228708267212, + "step": 701, + "token_acc": 0.7533897033071496 + }, + { + "epoch": 1.7559449311639548, + "grad_norm": 1.185546875, + "learning_rate": 2.837334601381342e-06, + "loss": 0.8325650691986084, + "step": 702, + "token_acc": 0.7513830678960604 + }, + { + "epoch": 1.7584480600750938, + "grad_norm": 1.3140076398849487, + "learning_rate": 2.7808180553483165e-06, + "loss": 0.6865131855010986, + "step": 703, + "token_acc": 0.7894226103833091 + }, + { + "epoch": 1.7609511889862328, + "grad_norm": 3.943152904510498, + "learning_rate": 2.7248368952908053e-06, + "loss": 0.8178889751434326, + "step": 704, + "token_acc": 0.7603732035234122 + }, + { + "epoch": 1.7634543178973718, + "grad_norm": 1.6355938911437988, + "learning_rate": 2.66939247011212e-06, + "loss": 0.7702490091323853, + "step": 705, + "token_acc": 0.7734057835238274 + }, + { + "epoch": 1.7659574468085106, + "grad_norm": 2.672015428543091, + "learning_rate": 2.6144861157825774e-06, + "loss": 0.7363954782485962, + "step": 706, + "token_acc": 0.7820876695048881 + }, + { + "epoch": 1.7684605757196494, + "grad_norm": 7.5712971687316895, + "learning_rate": 2.560119155307325e-06, + "loss": 0.7284834980964661, + "step": 707, + "token_acc": 0.7819572342750117 + }, + { + "epoch": 1.7709637046307884, + "grad_norm": 1.2005418539047241, + "learning_rate": 2.506292898694468e-06, + "loss": 0.8815107941627502, + "step": 708, + "token_acc": 0.736231884057971 + }, + { + "epoch": 1.7734668335419275, + "grad_norm": 5.682093620300293, + "learning_rate": 2.45300864292346e-06, + "loss": 0.8969010710716248, + "step": 709, + "token_acc": 0.7336805243781988 + }, + { + "epoch": 1.7759699624530665, + "grad_norm": 7.478425979614258, + "learning_rate": 2.4002676719139166e-06, + "loss": 0.7172174453735352, + "step": 710, + "token_acc": 0.7849509958899779 + }, + { + "epoch": 1.7784730913642053, + "grad_norm": 2.170532464981079, + "learning_rate": 2.348071256494633e-06, + "loss": 0.7401068210601807, + "step": 711, + "token_acc": 0.7747611561252872 + }, + { + "epoch": 1.780976220275344, + "grad_norm": 2.000027894973755, + "learning_rate": 2.296420654372966e-06, + "loss": 0.8865785598754883, + "step": 712, + "token_acc": 0.7429570006354586 + }, + { + "epoch": 1.783479349186483, + "grad_norm": 4.488513469696045, + "learning_rate": 2.2453171101045585e-06, + "loss": 0.727079451084137, + "step": 713, + "token_acc": 0.7792013666453128 + }, + { + "epoch": 1.7859824780976221, + "grad_norm": 1.3857240676879883, + "learning_rate": 2.1947618550633097e-06, + "loss": 0.9031280279159546, + "step": 714, + "token_acc": 0.7300395414786116 + }, + { + "epoch": 1.788485607008761, + "grad_norm": 3.1287314891815186, + "learning_rate": 2.144756107411733e-06, + "loss": 0.7487377524375916, + "step": 715, + "token_acc": 0.7762605042016807 + }, + { + "epoch": 1.7909887359198997, + "grad_norm": 2.1425862312316895, + "learning_rate": 2.0953010720716037e-06, + "loss": 0.7209734320640564, + "step": 716, + "token_acc": 0.7816404442387783 + }, + { + "epoch": 1.7934918648310387, + "grad_norm": 16.06658935546875, + "learning_rate": 2.0463979406949026e-06, + "loss": 0.862382173538208, + "step": 717, + "token_acc": 0.7451660221362848 + }, + { + "epoch": 1.7959949937421777, + "grad_norm": 1.3662980794906616, + "learning_rate": 1.99804789163513e-06, + "loss": 0.7773480415344238, + "step": 718, + "token_acc": 0.7637318504788384 + }, + { + "epoch": 1.7984981226533168, + "grad_norm": 1.702649712562561, + "learning_rate": 1.9502520899188913e-06, + "loss": 0.7579219937324524, + "step": 719, + "token_acc": 0.7706616172867008 + }, + { + "epoch": 1.8010012515644556, + "grad_norm": 2.08888840675354, + "learning_rate": 1.9030116872178316e-06, + "loss": 0.611611008644104, + "step": 720, + "token_acc": 0.8128733264675592 + }, + { + "epoch": 1.8035043804755944, + "grad_norm": 4.993098735809326, + "learning_rate": 1.8563278218208996e-06, + "loss": 0.6228418350219727, + "step": 721, + "token_acc": 0.8083577860973389 + }, + { + "epoch": 1.8060075093867334, + "grad_norm": 2.1354899406433105, + "learning_rate": 1.8102016186068993e-06, + "loss": 0.8729016184806824, + "step": 722, + "token_acc": 0.7406020743738932 + }, + { + "epoch": 1.8085106382978724, + "grad_norm": 3.6772496700286865, + "learning_rate": 1.7646341890173918e-06, + "loss": 0.8268842101097107, + "step": 723, + "token_acc": 0.7497296692643275 + }, + { + "epoch": 1.8110137672090114, + "grad_norm": 3.9325311183929443, + "learning_rate": 1.7196266310299108e-06, + "loss": 0.7343685030937195, + "step": 724, + "token_acc": 0.779054583442152 + }, + { + "epoch": 1.8135168961201502, + "grad_norm": 2.1486709117889404, + "learning_rate": 1.675180029131529e-06, + "loss": 0.7464021444320679, + "step": 725, + "token_acc": 0.7783094098883573 + }, + { + "epoch": 1.816020025031289, + "grad_norm": 1.5982136726379395, + "learning_rate": 1.631295454292689e-06, + "loss": 0.7898986339569092, + "step": 726, + "token_acc": 0.7636947873100072 + }, + { + "epoch": 1.818523153942428, + "grad_norm": 1.437714695930481, + "learning_rate": 1.5879739639414333e-06, + "loss": 0.7892969846725464, + "step": 727, + "token_acc": 0.7685018312888785 + }, + { + "epoch": 1.821026282853567, + "grad_norm": 2.1532280445098877, + "learning_rate": 1.5452166019378989e-06, + "loss": 0.7180025577545166, + "step": 728, + "token_acc": 0.7896799477465709 + }, + { + "epoch": 1.8235294117647058, + "grad_norm": 28.962617874145508, + "learning_rate": 1.5030243985491743e-06, + "loss": 0.7974023818969727, + "step": 729, + "token_acc": 0.7565578306585501 + }, + { + "epoch": 1.8260325406758446, + "grad_norm": 1.5716774463653564, + "learning_rate": 1.4613983704244826e-06, + "loss": 0.74139004945755, + "step": 730, + "token_acc": 0.7853475674354168 + }, + { + "epoch": 1.8285356695869837, + "grad_norm": 1.4642187356948853, + "learning_rate": 1.4203395205706683e-06, + "loss": 0.8600186109542847, + "step": 731, + "token_acc": 0.7451101593889355 + }, + { + "epoch": 1.8310387984981227, + "grad_norm": 2.9124562740325928, + "learning_rate": 1.379848838328049e-06, + "loss": 0.723196268081665, + "step": 732, + "token_acc": 0.7787250094304036 + }, + { + "epoch": 1.8335419274092617, + "grad_norm": 3.190188407897949, + "learning_rate": 1.3399272993465607e-06, + "loss": 0.7476466298103333, + "step": 733, + "token_acc": 0.7836584367753376 + }, + { + "epoch": 1.8360450563204005, + "grad_norm": 2.4274721145629883, + "learning_rate": 1.3005758655622424e-06, + "loss": 0.8297971487045288, + "step": 734, + "token_acc": 0.7539064626776284 + }, + { + "epoch": 1.8385481852315393, + "grad_norm": 1.4249184131622314, + "learning_rate": 1.2617954851740832e-06, + "loss": 0.8851167559623718, + "step": 735, + "token_acc": 0.7376152741090876 + }, + { + "epoch": 1.8410513141426783, + "grad_norm": 4.431985855102539, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.8166061043739319, + "step": 736, + "token_acc": 0.7520669148576126 + }, + { + "epoch": 1.8435544430538173, + "grad_norm": 1.8808094263076782, + "learning_rate": 1.185951608560118e-06, + "loss": 0.6322556734085083, + "step": 737, + "token_acc": 0.8104704097116844 + }, + { + "epoch": 1.8460575719649563, + "grad_norm": 3.052344560623169, + "learning_rate": 1.1488899398429898e-06, + "loss": 0.6962700486183167, + "step": 738, + "token_acc": 0.7900085330850981 + }, + { + "epoch": 1.8485607008760951, + "grad_norm": 1.5944037437438965, + "learning_rate": 1.1124029794953472e-06, + "loss": 0.7271436452865601, + "step": 739, + "token_acc": 0.7764268828098615 + }, + { + "epoch": 1.851063829787234, + "grad_norm": 3.147589921951294, + "learning_rate": 1.0764916066947794e-06, + "loss": 0.7402669191360474, + "step": 740, + "token_acc": 0.7758406713551208 + }, + { + "epoch": 1.853566958698373, + "grad_norm": 2.1467528343200684, + "learning_rate": 1.041156686749717e-06, + "loss": 0.8103016018867493, + "step": 741, + "token_acc": 0.7585889736514635 + }, + { + "epoch": 1.856070087609512, + "grad_norm": 1.210806965827942, + "learning_rate": 1.0063990710785648e-06, + "loss": 0.7230099439620972, + "step": 742, + "token_acc": 0.7845214164218339 + }, + { + "epoch": 1.8585732165206508, + "grad_norm": 5.582250118255615, + "learning_rate": 9.72219597189211e-07, + "loss": 0.8122878074645996, + "step": 743, + "token_acc": 0.7586682862190812 + }, + { + "epoch": 1.8610763454317898, + "grad_norm": 3.027064561843872, + "learning_rate": 9.386190886588208e-07, + "loss": 0.6951571702957153, + "step": 744, + "token_acc": 0.787929227544541 + }, + { + "epoch": 1.8635794743429286, + "grad_norm": 2.49889874458313, + "learning_rate": 9.05598355114004e-07, + "loss": 0.8861063718795776, + "step": 745, + "token_acc": 0.7379547480579021 + }, + { + "epoch": 1.8660826032540676, + "grad_norm": 1.5029351711273193, + "learning_rate": 8.731581922113153e-07, + "loss": 0.7544765472412109, + "step": 746, + "token_acc": 0.7708400386224654 + }, + { + "epoch": 1.8685857321652066, + "grad_norm": 2.52443528175354, + "learning_rate": 8.412993816180687e-07, + "loss": 0.7223730683326721, + "step": 747, + "token_acc": 0.7796796590362274 + }, + { + "epoch": 1.8710888610763454, + "grad_norm": 1.232771396636963, + "learning_rate": 8.10022690993506e-07, + "loss": 0.8961279392242432, + "step": 748, + "token_acc": 0.7351487826871055 + }, + { + "epoch": 1.8735919899874842, + "grad_norm": 10.959983825683594, + "learning_rate": 7.793288739703003e-07, + "loss": 0.8091161251068115, + "step": 749, + "token_acc": 0.7547194375732327 + }, + { + "epoch": 1.8760951188986232, + "grad_norm": 1.7464208602905273, + "learning_rate": 7.492186701364007e-07, + "loss": 0.7364180684089661, + "step": 750, + "token_acc": 0.7817872076815858 + }, + { + "epoch": 1.8785982478097623, + "grad_norm": 2.182349443435669, + "learning_rate": 7.196928050172053e-07, + "loss": 0.7897827625274658, + "step": 751, + "token_acc": 0.7664438786335668 + }, + { + "epoch": 1.8811013767209013, + "grad_norm": 8.031073570251465, + "learning_rate": 6.907519900580861e-07, + "loss": 0.6580134034156799, + "step": 752, + "token_acc": 0.7999625046869141 + }, + { + "epoch": 1.88360450563204, + "grad_norm": 1.5658347606658936, + "learning_rate": 6.623969226072363e-07, + "loss": 0.9101489186286926, + "step": 753, + "token_acc": 0.7374909076987864 + }, + { + "epoch": 1.8861076345431789, + "grad_norm": 1.1753172874450684, + "learning_rate": 6.34628285898875e-07, + "loss": 0.8875089883804321, + "step": 754, + "token_acc": 0.73394678138942 + }, + { + "epoch": 1.8886107634543179, + "grad_norm": 1.634332537651062, + "learning_rate": 6.074467490367885e-07, + "loss": 0.7488188743591309, + "step": 755, + "token_acc": 0.7744497543245609 + }, + { + "epoch": 1.891113892365457, + "grad_norm": 1.9908474683761597, + "learning_rate": 5.808529669781904e-07, + "loss": 0.7645170092582703, + "step": 756, + "token_acc": 0.7715148835838491 + }, + { + "epoch": 1.8936170212765957, + "grad_norm": 6.012979984283447, + "learning_rate": 5.548475805179587e-07, + "loss": 0.7867085933685303, + "step": 757, + "token_acc": 0.7629029926268613 + }, + { + "epoch": 1.8961201501877347, + "grad_norm": 2.5716400146484375, + "learning_rate": 5.294312162731934e-07, + "loss": 0.6976877450942993, + "step": 758, + "token_acc": 0.7884969325153375 + }, + { + "epoch": 1.8986232790988735, + "grad_norm": 2.4027717113494873, + "learning_rate": 5.046044866680949e-07, + "loss": 0.7928605079650879, + "step": 759, + "token_acc": 0.7669667095299328 + }, + { + "epoch": 1.9011264080100125, + "grad_norm": 2.02215838432312, + "learning_rate": 4.803679899192392e-07, + "loss": 0.7859390377998352, + "step": 760, + "token_acc": 0.758043137727437 + }, + { + "epoch": 1.9036295369211516, + "grad_norm": 6.254071235656738, + "learning_rate": 4.5672231002114596e-07, + "loss": 0.7381837368011475, + "step": 761, + "token_acc": 0.7740069907848744 + }, + { + "epoch": 1.9061326658322904, + "grad_norm": 4.3257060050964355, + "learning_rate": 4.3366801673220545e-07, + "loss": 0.7426378726959229, + "step": 762, + "token_acc": 0.7737384009152155 + }, + { + "epoch": 1.9086357947434291, + "grad_norm": 2.265584707260132, + "learning_rate": 4.1120566556096254e-07, + "loss": 0.7314226627349854, + "step": 763, + "token_acc": 0.7758732022307014 + }, + { + "epoch": 1.9111389236545682, + "grad_norm": 5.339004993438721, + "learning_rate": 3.8933579775271013e-07, + "loss": 0.6290936470031738, + "step": 764, + "token_acc": 0.8064294703123213 + }, + { + "epoch": 1.9136420525657072, + "grad_norm": 9.275211334228516, + "learning_rate": 3.680589402764695e-07, + "loss": 0.7639355659484863, + "step": 765, + "token_acc": 0.766955266955267 + }, + { + "epoch": 1.9161451814768462, + "grad_norm": 1.5419917106628418, + "learning_rate": 3.4737560581228344e-07, + "loss": 0.7539982795715332, + "step": 766, + "token_acc": 0.7762047019093389 + }, + { + "epoch": 1.918648310387985, + "grad_norm": 1.023754596710205, + "learning_rate": 3.2728629273885425e-07, + "loss": 0.8236006498336792, + "step": 767, + "token_acc": 0.7516803938275112 + }, + { + "epoch": 1.9211514392991238, + "grad_norm": 3.612969160079956, + "learning_rate": 3.077914851215585e-07, + "loss": 0.7220295667648315, + "step": 768, + "token_acc": 0.7861885790172642 + }, + { + "epoch": 1.9236545682102628, + "grad_norm": 2.2448315620422363, + "learning_rate": 2.8889165270075126e-07, + "loss": 0.8047812581062317, + "step": 769, + "token_acc": 0.7596339113680154 + }, + { + "epoch": 1.9261576971214018, + "grad_norm": 4.780596733093262, + "learning_rate": 2.705872508804747e-07, + "loss": 0.627181887626648, + "step": 770, + "token_acc": 0.8130530973451328 + }, + { + "epoch": 1.9286608260325406, + "grad_norm": 2.8713886737823486, + "learning_rate": 2.5287872071747543e-07, + "loss": 0.8144195079803467, + "step": 771, + "token_acc": 0.7571025930101466 + }, + { + "epoch": 1.9311639549436797, + "grad_norm": 3.7934675216674805, + "learning_rate": 2.3576648891056875e-07, + "loss": 0.6252330541610718, + "step": 772, + "token_acc": 0.8169552960128876 + }, + { + "epoch": 1.9336670838548184, + "grad_norm": 2.7746498584747314, + "learning_rate": 2.192509677903687e-07, + "loss": 0.8003941178321838, + "step": 773, + "token_acc": 0.7631566040512041 + }, + { + "epoch": 1.9361702127659575, + "grad_norm": 1.8860054016113281, + "learning_rate": 2.0333255530934902e-07, + "loss": 0.8493106365203857, + "step": 774, + "token_acc": 0.7480242106480589 + }, + { + "epoch": 1.9386733416770965, + "grad_norm": 2.0492420196533203, + "learning_rate": 1.8801163503225083e-07, + "loss": 0.7619702816009521, + "step": 775, + "token_acc": 0.7746059737683236 + }, + { + "epoch": 1.9411764705882353, + "grad_norm": 3.8298299312591553, + "learning_rate": 1.732885761268427e-07, + "loss": 0.7479050159454346, + "step": 776, + "token_acc": 0.7769350722994046 + }, + { + "epoch": 1.943679599499374, + "grad_norm": 2.153553009033203, + "learning_rate": 1.5916373335503054e-07, + "loss": 0.779269814491272, + "step": 777, + "token_acc": 0.7659600242277408 + }, + { + "epoch": 1.946182728410513, + "grad_norm": 2.5486974716186523, + "learning_rate": 1.4563744706429515e-07, + "loss": 0.6520084142684937, + "step": 778, + "token_acc": 0.801793896850931 + }, + { + "epoch": 1.9486858573216521, + "grad_norm": 1.529793620109558, + "learning_rate": 1.327100431795125e-07, + "loss": 0.6999301910400391, + "step": 779, + "token_acc": 0.7859088302752294 + }, + { + "epoch": 1.9511889862327911, + "grad_norm": 1.554592251777649, + "learning_rate": 1.2038183319507955e-07, + "loss": 0.8654152154922485, + "step": 780, + "token_acc": 0.7451161517670807 + }, + { + "epoch": 1.95369211514393, + "grad_norm": 9.168543815612793, + "learning_rate": 1.0865311416741742e-07, + "loss": 0.7853003144264221, + "step": 781, + "token_acc": 0.7589562333638783 + }, + { + "epoch": 1.9561952440550687, + "grad_norm": 1.926802158355713, + "learning_rate": 9.752416870782155e-08, + "loss": 0.7436434626579285, + "step": 782, + "token_acc": 0.7709643892566053 + }, + { + "epoch": 1.9586983729662077, + "grad_norm": 7.400356292724609, + "learning_rate": 8.699526497563393e-08, + "loss": 0.621313214302063, + "step": 783, + "token_acc": 0.8069787985865724 + }, + { + "epoch": 1.9612015018773468, + "grad_norm": 1.7210184335708618, + "learning_rate": 7.706665667180091e-08, + "loss": 0.7174030542373657, + "step": 784, + "token_acc": 0.7825233926954422 + }, + { + "epoch": 1.9637046307884856, + "grad_norm": 1.6718780994415283, + "learning_rate": 6.773858303274483e-08, + "loss": 0.7276427745819092, + "step": 785, + "token_acc": 0.7806837876161966 + }, + { + "epoch": 1.9662077596996246, + "grad_norm": 1.5906116962432861, + "learning_rate": 5.90112688246075e-08, + "loss": 0.8167098760604858, + "step": 786, + "token_acc": 0.7573275214189088 + }, + { + "epoch": 1.9687108886107634, + "grad_norm": 1.7576080560684204, + "learning_rate": 5.088492433783509e-08, + "loss": 0.6295968890190125, + "step": 787, + "token_acc": 0.8075617574957571 + }, + { + "epoch": 1.9712140175219024, + "grad_norm": 1.972408652305603, + "learning_rate": 4.335974538210441e-08, + "loss": 0.7649188041687012, + "step": 788, + "token_acc": 0.7695280950732664 + }, + { + "epoch": 1.9737171464330414, + "grad_norm": 2.0982718467712402, + "learning_rate": 3.6435913281607225e-08, + "loss": 0.7731108069419861, + "step": 789, + "token_acc": 0.7673324973127911 + }, + { + "epoch": 1.9762202753441802, + "grad_norm": 1.579641342163086, + "learning_rate": 3.011359487068987e-08, + "loss": 0.7300990223884583, + "step": 790, + "token_acc": 0.7800763452776751 + }, + { + "epoch": 1.978723404255319, + "grad_norm": 5.343920707702637, + "learning_rate": 2.439294248982038e-08, + "loss": 0.6828333735466003, + "step": 791, + "token_acc": 0.7913875598086124 + }, + { + "epoch": 1.981226533166458, + "grad_norm": 2.449629068374634, + "learning_rate": 1.9274093981927478e-08, + "loss": 0.7776758670806885, + "step": 792, + "token_acc": 0.7676251859196827 + }, + { + "epoch": 1.983729662077597, + "grad_norm": 9.144579887390137, + "learning_rate": 1.4757172689067179e-08, + "loss": 0.881503164768219, + "step": 793, + "token_acc": 0.7356721673100581 + }, + { + "epoch": 1.986232790988736, + "grad_norm": 1.3938573598861694, + "learning_rate": 1.0842287449469579e-08, + "loss": 0.8685541152954102, + "step": 794, + "token_acc": 0.7416292064025543 + }, + { + "epoch": 1.9887359198998749, + "grad_norm": 3.321380615234375, + "learning_rate": 7.529532594893751e-09, + "loss": 0.6688620448112488, + "step": 795, + "token_acc": 0.7994852408911767 + }, + { + "epoch": 1.9912390488110137, + "grad_norm": 1.3987860679626465, + "learning_rate": 4.818987948379539e-09, + "loss": 0.8769614100456238, + "step": 796, + "token_acc": 0.7454584658508975 + }, + { + "epoch": 1.9937421777221527, + "grad_norm": 1.9522247314453125, + "learning_rate": 2.7107188222991188e-09, + "loss": 0.7640627026557922, + "step": 797, + "token_acc": 0.7714239342133737 + }, + { + "epoch": 1.9962453066332917, + "grad_norm": 4.595679759979248, + "learning_rate": 1.2047760167999134e-09, + "loss": 0.7237029075622559, + "step": 798, + "token_acc": 0.7828966521106259 + }, + { + "epoch": 1.9987484355444305, + "grad_norm": 1.3017117977142334, + "learning_rate": 3.01195818577793e-10, + "loss": 0.7408468127250671, + "step": 799, + "token_acc": 0.7786249507032996 + }, + { + "epoch": 2.0, + "grad_norm": 1.644324541091919, + "learning_rate": 0.0, + "loss": 0.8260904550552368, + "step": 800, + "token_acc": 0.7600862998921252 + }, + { + "epoch": 2.0, + "eval_loss": 0.5397158265113831, + "eval_runtime": 3.2047, + "eval_samples_per_second": 3.744, + "eval_steps_per_second": 0.624, + "eval_token_acc": 0.7559409997268506, + "step": 800 + } + ], + "logging_steps": 1, + "max_steps": 800, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 10, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 4.2251231089288806e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..dd4978bcc5aa41de8580cb034567754d4c1ffbb0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ac2064c380d0d9aed49e54d844332ebad8b9b0acd4873c3be8f3435db854dcfb +size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/logging.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/logging.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..45f1ffc6be54d8fc122bb15d6ed95f45b343ff85 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/logging.jsonl @@ -0,0 +1,803 @@ +{"loss": 1.45579028, "grad_norm": 7.89509821, "learning_rate": 3.1e-07, "token_acc": 0.65725016, "epoch": 0.00250313, "global_step/max_steps": "1/800", "percentage": "0.12%", "elapsed_time": "12s", "remaining_time": "2h 38m 12s", "memory(GiB)": 45.0, "train_speed(s/it)": 11.880227} +{"loss": 1.50184274, "grad_norm": 5.08795309, "learning_rate": 6.3e-07, "token_acc": 0.63721768, "epoch": 0.00500626, "global_step/max_steps": "2/800", "percentage": "0.25%", "elapsed_time": "22s", "remaining_time": "2h 26m 6s", "memory(GiB)": 45.0, "train_speed(s/it)": 10.985021} +{"loss": 1.48571444, "grad_norm": 10.05165863, "learning_rate": 9.4e-07, "token_acc": 0.64513903, "epoch": 0.00750939, "global_step/max_steps": "3/800", "percentage": "0.38%", "elapsed_time": "39s", "remaining_time": "2h 50m 31s", "memory(GiB)": 45.0, "train_speed(s/it)": 12.837058} +{"loss": 1.44385707, "grad_norm": 2.01146364, "learning_rate": 1.25e-06, "token_acc": 0.65579322, "epoch": 0.01001252, "global_step/max_steps": "4/800", "percentage": "0.50%", "elapsed_time": "53s", "remaining_time": "2h 54m 19s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.139182} +{"loss": 1.47832322, "grad_norm": 1.34075904, "learning_rate": 1.56e-06, "token_acc": 0.63832584, "epoch": 0.01251564, "global_step/max_steps": "5/800", "percentage": "0.62%", "elapsed_time": "1m 7s", "remaining_time": "2h 57m 43s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.412663} +{"loss": 1.4670949, "grad_norm": 1.98580873, "learning_rate": 1.88e-06, "token_acc": 0.64259928, "epoch": 0.01501877, "global_step/max_steps": "6/800", "percentage": "0.75%", "elapsed_time": "1m 18s", "remaining_time": "2h 52m 46s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.054821} +{"loss": 1.44782019, "grad_norm": 4.05888033, "learning_rate": 2.19e-06, "token_acc": 0.65902697, "epoch": 0.0175219, "global_step/max_steps": "7/800", "percentage": "0.88%", "elapsed_time": "1m 30s", "remaining_time": "2h 49m 14s", "memory(GiB)": 49.35, "train_speed(s/it)": 12.804684} +{"loss": 1.43246078, "grad_norm": 1.78421938, "learning_rate": 2.5e-06, "token_acc": 0.65153083, "epoch": 0.02002503, "global_step/max_steps": "8/800", "percentage": "1.00%", "elapsed_time": "1m 44s", "remaining_time": "2h 51m 57s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.026808} +{"loss": 1.54041886, "grad_norm": 1.8329078, "learning_rate": 2.81e-06, "token_acc": 0.61984233, "epoch": 0.02252816, "global_step/max_steps": "9/800", "percentage": "1.12%", "elapsed_time": "2m 5s", "remaining_time": "3h 2m 34s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.847866} +{"loss": 1.54082227, "grad_norm": 1.76629877, "learning_rate": 3.13e-06, "token_acc": 0.61895916, "epoch": 0.02503129, "global_step/max_steps": "10/800", "percentage": "1.25%", "elapsed_time": "2m 21s", "remaining_time": "3h 5m 28s", "memory(GiB)": 49.35, "train_speed(s/it)": 14.086224} +{"loss": 1.51047623, "grad_norm": 1.67907119, "learning_rate": 3.44e-06, "token_acc": 0.62592982, "epoch": 0.02753442, "global_step/max_steps": "11/800", "percentage": "1.38%", "elapsed_time": "2m 50s", "remaining_time": "3h 22m 55s", "memory(GiB)": 49.35, "train_speed(s/it)": 15.430323} +{"loss": 1.46535945, "grad_norm": 4.44214106, "learning_rate": 3.75e-06, "token_acc": 0.65315661, "epoch": 0.03003755, "global_step/max_steps": "12/800", "percentage": "1.50%", "elapsed_time": "3m 1s", "remaining_time": "3h 17m 52s", "memory(GiB)": 49.35, "train_speed(s/it)": 15.066073} +{"loss": 1.49699903, "grad_norm": 1.74037337, "learning_rate": 4.06e-06, "token_acc": 0.63854097, "epoch": 0.03254068, "global_step/max_steps": "13/800", "percentage": "1.62%", "elapsed_time": "3m 15s", "remaining_time": "3h 16m 60s", "memory(GiB)": 49.35, "train_speed(s/it)": 15.018578} +{"loss": 1.46008217, "grad_norm": 2.56567478, "learning_rate": 4.37e-06, "token_acc": 0.66978231, "epoch": 0.0350438, "global_step/max_steps": "14/800", "percentage": "1.75%", "elapsed_time": "3m 21s", "remaining_time": "3h 8m 26s", "memory(GiB)": 49.35, "train_speed(s/it)": 14.384089} +{"loss": 1.47081125, "grad_norm": 3.50800085, "learning_rate": 4.69e-06, "token_acc": 0.672, "epoch": 0.03754693, "global_step/max_steps": "15/800", "percentage": "1.88%", "elapsed_time": "3m 29s", "remaining_time": "3h 2m 26s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.943378} +{"loss": 1.42920399, "grad_norm": 3.71296239, "learning_rate": 5e-06, "token_acc": 0.68138386, "epoch": 0.04005006, "global_step/max_steps": "16/800", "percentage": "2.00%", "elapsed_time": "3m 36s", "remaining_time": "2h 56m 31s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.509389} +{"loss": 1.51241589, "grad_norm": 2.32689404, "learning_rate": 5.31e-06, "token_acc": 0.63154012, "epoch": 0.04255319, "global_step/max_steps": "17/800", "percentage": "2.12%", "elapsed_time": "3m 47s", "remaining_time": "2h 54m 3s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.336757} +{"loss": 1.45155799, "grad_norm": 2.33508682, "learning_rate": 5.63e-06, "token_acc": 0.65236568, "epoch": 0.04505632, "global_step/max_steps": "18/800", "percentage": "2.25%", "elapsed_time": "4m 2s", "remaining_time": "2h 54m 59s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.425766} +{"loss": 1.41573417, "grad_norm": 2.76871991, "learning_rate": 5.94e-06, "token_acc": 0.66325554, "epoch": 0.04755945, "global_step/max_steps": "19/800", "percentage": "2.38%", "elapsed_time": "4m 12s", "remaining_time": "2h 52m 53s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.281898} +{"loss": 1.49782228, "grad_norm": 5.97118235, "learning_rate": 6.25e-06, "token_acc": 0.64490756, "epoch": 0.05006258, "global_step/max_steps": "20/800", "percentage": "2.50%", "elapsed_time": "4m 25s", "remaining_time": "2h 52m 16s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.250829} +{"loss": 1.51183963, "grad_norm": 13.34917736, "learning_rate": 6.56e-06, "token_acc": 0.63377315, "epoch": 0.05256571, "global_step/max_steps": "21/800", "percentage": "2.62%", "elapsed_time": "4m 46s", "remaining_time": "2h 56m 43s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.610891} +{"loss": 1.46714115, "grad_norm": 2.40118861, "learning_rate": 6.88e-06, "token_acc": 0.65084353, "epoch": 0.05506884, "global_step/max_steps": "22/800", "percentage": "2.75%", "elapsed_time": "4m 56s", "remaining_time": "2h 54m 34s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.462939} +{"loss": 1.44632626, "grad_norm": 3.03981185, "learning_rate": 7.19e-06, "token_acc": 0.65218155, "epoch": 0.05757196, "global_step/max_steps": "23/800", "percentage": "2.88%", "elapsed_time": "5m 7s", "remaining_time": "2h 53m 0s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.359407} +{"loss": 1.49229741, "grad_norm": 1.94135571, "learning_rate": 7.5e-06, "token_acc": 0.65765684, "epoch": 0.06007509, "global_step/max_steps": "24/800", "percentage": "3.00%", "elapsed_time": "5m 16s", "remaining_time": "2h 50m 7s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.153719} +{"loss": 1.46388006, "grad_norm": 2.32792711, "learning_rate": 7.81e-06, "token_acc": 0.640804, "epoch": 0.06257822, "global_step/max_steps": "25/800", "percentage": "3.12%", "elapsed_time": "5m 26s", "remaining_time": "2h 48m 16s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.026662} +{"loss": 1.46353853, "grad_norm": 2.46725559, "learning_rate": 8.13e-06, "token_acc": 0.64254322, "epoch": 0.06508135, "global_step/max_steps": "26/800", "percentage": "3.25%", "elapsed_time": "5m 36s", "remaining_time": "2h 46m 42s", "memory(GiB)": 49.35, "train_speed(s/it)": 12.922015} +{"loss": 1.49716139, "grad_norm": 4.28559875, "learning_rate": 8.44e-06, "token_acc": 0.64364661, "epoch": 0.06758448, "global_step/max_steps": "27/800", "percentage": "3.38%", "elapsed_time": "5m 44s", "remaining_time": "2h 44m 12s", "memory(GiB)": 49.35, "train_speed(s/it)": 12.745443} +{"loss": 1.49265158, "grad_norm": 4.3030653, "learning_rate": 8.75e-06, "token_acc": 0.65760817, "epoch": 0.07008761, "global_step/max_steps": "28/800", "percentage": "3.50%", "elapsed_time": "5m 51s", "remaining_time": "2h 41m 20s", "memory(GiB)": 49.35, "train_speed(s/it)": 12.538363} +{"loss": 1.44790614, "grad_norm": 4.37264681, "learning_rate": 9.06e-06, "token_acc": 0.64455227, "epoch": 0.07259074, "global_step/max_steps": "29/800", "percentage": "3.62%", "elapsed_time": "6m 3s", "remaining_time": "2h 40m 54s", "memory(GiB)": 49.35, "train_speed(s/it)": 12.521249} +{"loss": 1.41009307, "grad_norm": 2.52898526, "learning_rate": 9.38e-06, "token_acc": 0.65215351, "epoch": 0.07509387, "global_step/max_steps": "30/800", "percentage": "3.75%", "elapsed_time": "6m 31s", "remaining_time": "2h 47m 17s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.034857} +{"loss": 1.42523885, "grad_norm": 1.42646515, "learning_rate": 9.69e-06, "token_acc": 0.65202239, "epoch": 0.077597, "global_step/max_steps": "31/800", "percentage": "3.88%", "elapsed_time": "6m 54s", "remaining_time": "2h 51m 11s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.356854} +{"loss": 1.44467366, "grad_norm": 2.83838081, "learning_rate": 1e-05, "token_acc": 0.63483252, "epoch": 0.08010013, "global_step/max_steps": "32/800", "percentage": "4.00%", "elapsed_time": "7m 10s", "remaining_time": "2h 51m 53s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.428691} +{"loss": 1.44616389, "grad_norm": 2.67154384, "learning_rate": 1.031e-05, "token_acc": 0.64199555, "epoch": 0.08260325, "global_step/max_steps": "33/800", "percentage": "4.12%", "elapsed_time": "7m 21s", "remaining_time": "2h 50m 50s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.364107} +{"loss": 1.35544991, "grad_norm": 1.99140966, "learning_rate": 1.063e-05, "token_acc": 0.67072813, "epoch": 0.08510638, "global_step/max_steps": "34/800", "percentage": "4.25%", "elapsed_time": "7m 34s", "remaining_time": "2h 50m 35s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.361024} +{"loss": 1.37189126, "grad_norm": 5.06825256, "learning_rate": 1.094e-05, "token_acc": 0.6667121, "epoch": 0.08760951, "global_step/max_steps": "35/800", "percentage": "4.38%", "elapsed_time": "7m 45s", "remaining_time": "2h 49m 14s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.27275} +{"loss": 1.41073859, "grad_norm": 7.02036858, "learning_rate": 1.125e-05, "token_acc": 0.65502621, "epoch": 0.09011264, "global_step/max_steps": "36/800", "percentage": "4.50%", "elapsed_time": "7m 53s", "remaining_time": "2h 47m 12s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.131276} +{"loss": 1.48240042, "grad_norm": 1.66487372, "learning_rate": 1.156e-05, "token_acc": 0.63084792, "epoch": 0.09261577, "global_step/max_steps": "37/800", "percentage": "4.62%", "elapsed_time": "8m 5s", "remaining_time": "2h 46m 42s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.108675} +{"loss": 1.30988419, "grad_norm": 2.08215976, "learning_rate": 1.188e-05, "token_acc": 0.66572229, "epoch": 0.0951189, "global_step/max_steps": "38/800", "percentage": "4.75%", "elapsed_time": "8m 34s", "remaining_time": "2h 51m 49s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.529458} +{"loss": 1.41942298, "grad_norm": 1.47800064, "learning_rate": 1.219e-05, "token_acc": 0.6341869, "epoch": 0.09762203, "global_step/max_steps": "39/800", "percentage": "4.88%", "elapsed_time": "9m 0s", "remaining_time": "2h 55m 42s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.852199} +{"loss": 1.3345809, "grad_norm": 8.25165367, "learning_rate": 1.25e-05, "token_acc": 0.67239177, "epoch": 0.10012516, "global_step/max_steps": "40/800", "percentage": "5.00%", "elapsed_time": "9m 13s", "remaining_time": "2h 54m 59s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.813838} +{"loss": 1.33348632, "grad_norm": 2.39960599, "learning_rate": 1.281e-05, "token_acc": 0.6682705, "epoch": 0.10262829, "global_step/max_steps": "41/800", "percentage": "5.12%", "elapsed_time": "9m 32s", "remaining_time": "2h 56m 34s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.957784} +{"loss": 1.32463872, "grad_norm": 8.75727844, "learning_rate": 1.313e-05, "token_acc": 0.6669557, "epoch": 0.10513141, "global_step/max_steps": "42/800", "percentage": "5.25%", "elapsed_time": "9m 43s", "remaining_time": "2h 55m 13s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.869704} +{"loss": 1.34475684, "grad_norm": 1.04246235, "learning_rate": 1.344e-05, "token_acc": 0.65922812, "epoch": 0.10763454, "global_step/max_steps": "43/800", "percentage": "5.38%", "elapsed_time": "9m 56s", "remaining_time": "2h 54m 47s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.85318} +{"loss": 1.31717515, "grad_norm": 3.85423517, "learning_rate": 1.375e-05, "token_acc": 0.67369356, "epoch": 0.11013767, "global_step/max_steps": "44/800", "percentage": "5.50%", "elapsed_time": "10m 6s", "remaining_time": "2h 53m 27s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.765264} +{"loss": 1.34163809, "grad_norm": 25.88369751, "learning_rate": 1.406e-05, "token_acc": 0.65973967, "epoch": 0.1126408, "global_step/max_steps": "45/800", "percentage": "5.62%", "elapsed_time": "10m 17s", "remaining_time": "2h 52m 29s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.707897} +{"loss": 1.29943252, "grad_norm": 2.75494814, "learning_rate": 1.437e-05, "token_acc": 0.67484871, "epoch": 0.11514393, "global_step/max_steps": "46/800", "percentage": "5.75%", "elapsed_time": "10m 27s", "remaining_time": "2h 51m 22s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.636577} +{"loss": 1.2871052, "grad_norm": 17.70027351, "learning_rate": 1.469e-05, "token_acc": 0.69008715, "epoch": 0.11764706, "global_step/max_steps": "47/800", "percentage": "5.88%", "elapsed_time": "10m 37s", "remaining_time": "2h 50m 5s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.55212} +{"loss": 1.32590532, "grad_norm": 2.12369823, "learning_rate": 1.5e-05, "token_acc": 0.66483481, "epoch": 0.12015019, "global_step/max_steps": "48/800", "percentage": "6.00%", "elapsed_time": "10m 46s", "remaining_time": "2h 48m 37s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.453037} +{"loss": 1.34591269, "grad_norm": 2.83603978, "learning_rate": 1.531e-05, "token_acc": 0.66219099, "epoch": 0.12265332, "global_step/max_steps": "49/800", "percentage": "6.12%", "elapsed_time": "11m 2s", "remaining_time": "2h 49m 10s", "memory(GiB)": 49.35, "train_speed(s/it)": 13.515067} +{"loss": 1.19779754, "grad_norm": 1.85165823, "learning_rate": 1.563e-05, "token_acc": 0.69655413, "epoch": 0.12515645, "global_step/max_steps": "50/800", "percentage": "6.25%", "elapsed_time": "11m 24s", "remaining_time": "2h 50m 55s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.673896} +{"loss": 1.33721471, "grad_norm": 2.65095544, "learning_rate": 1.594e-05, "token_acc": 0.66606994, "epoch": 0.12765957, "global_step/max_steps": "51/800", "percentage": "6.38%", "elapsed_time": "11m 44s", "remaining_time": "2h 52m 16s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.799796} +{"loss": 1.3174634, "grad_norm": 1.39803886, "learning_rate": 1.625e-05, "token_acc": 0.6557162, "epoch": 0.1301627, "global_step/max_steps": "52/800", "percentage": "6.50%", "elapsed_time": "12m 10s", "remaining_time": "2h 54m 58s", "memory(GiB)": 71.34, "train_speed(s/it)": 14.034271} +{"loss": 1.33630323, "grad_norm": 2.93009639, "learning_rate": 1.656e-05, "token_acc": 0.66434876, "epoch": 0.13266583, "global_step/max_steps": "53/800", "percentage": "6.62%", "elapsed_time": "12m 21s", "remaining_time": "2h 53m 58s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.972638} +{"loss": 1.27385879, "grad_norm": 1.61497366, "learning_rate": 1.688e-05, "token_acc": 0.67131862, "epoch": 0.13516896, "global_step/max_steps": "54/800", "percentage": "6.75%", "elapsed_time": "12m 36s", "remaining_time": "2h 54m 1s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.995648} +{"loss": 1.31531858, "grad_norm": 1.91615093, "learning_rate": 1.719e-05, "token_acc": 0.66008359, "epoch": 0.13767209, "global_step/max_steps": "55/800", "percentage": "6.88%", "elapsed_time": "12m 51s", "remaining_time": "2h 54m 9s", "memory(GiB)": 71.34, "train_speed(s/it)": 14.026092} +{"loss": 1.32871866, "grad_norm": 1.33789945, "learning_rate": 1.75e-05, "token_acc": 0.66268965, "epoch": 0.14017522, "global_step/max_steps": "56/800", "percentage": "7.00%", "elapsed_time": "13m 4s", "remaining_time": "2h 53m 34s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.997075} +{"loss": 1.20756984, "grad_norm": 2.13583279, "learning_rate": 1.781e-05, "token_acc": 0.68943594, "epoch": 0.14267835, "global_step/max_steps": "57/800", "percentage": "7.12%", "elapsed_time": "13m 14s", "remaining_time": "2h 52m 24s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.922099} +{"loss": 1.21195149, "grad_norm": 3.40851426, "learning_rate": 1.813e-05, "token_acc": 0.69590018, "epoch": 0.14518148, "global_step/max_steps": "58/800", "percentage": "7.25%", "elapsed_time": "13m 22s", "remaining_time": "2h 51m 5s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.834252} +{"loss": 1.19328582, "grad_norm": 2.77785015, "learning_rate": 1.844e-05, "token_acc": 0.69463087, "epoch": 0.14768461, "global_step/max_steps": "59/800", "percentage": "7.38%", "elapsed_time": "13m 35s", "remaining_time": "2h 50m 33s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.809132} +{"loss": 1.24687004, "grad_norm": 2.00906086, "learning_rate": 1.875e-05, "token_acc": 0.6771944, "epoch": 0.15018773, "global_step/max_steps": "60/800", "percentage": "7.50%", "elapsed_time": "13m 47s", "remaining_time": "2h 49m 55s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.777516} +{"loss": 1.26018679, "grad_norm": 5.27526331, "learning_rate": 1.906e-05, "token_acc": 0.67410937, "epoch": 0.15269086, "global_step/max_steps": "61/800", "percentage": "7.62%", "elapsed_time": "14m 6s", "remaining_time": "2h 50m 49s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.868402} +{"loss": 1.26117826, "grad_norm": 2.18329334, "learning_rate": 1.937e-05, "token_acc": 0.67092122, "epoch": 0.15519399, "global_step/max_steps": "62/800", "percentage": "7.75%", "elapsed_time": "14m 20s", "remaining_time": "2h 50m 41s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.876731} +{"loss": 1.21298671, "grad_norm": 1.83813512, "learning_rate": 1.969e-05, "token_acc": 0.69164063, "epoch": 0.15769712, "global_step/max_steps": "63/800", "percentage": "7.88%", "elapsed_time": "14m 30s", "remaining_time": "2h 49m 38s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.810058} +{"loss": 1.2405746, "grad_norm": 2.45783114, "learning_rate": 2e-05, "token_acc": 0.67152445, "epoch": 0.16020025, "global_step/max_steps": "64/800", "percentage": "8.00%", "elapsed_time": "14m 44s", "remaining_time": "2h 49m 24s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.810184} +{"loss": 1.25480342, "grad_norm": 3.24009109, "learning_rate": 2.031e-05, "token_acc": 0.66547805, "epoch": 0.16270338, "global_step/max_steps": "65/800", "percentage": "8.12%", "elapsed_time": "14m 56s", "remaining_time": "2h 48m 49s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.781617} +{"loss": 1.24469423, "grad_norm": 4.74328899, "learning_rate": 2.062e-05, "token_acc": 0.67644112, "epoch": 0.16520651, "global_step/max_steps": "66/800", "percentage": "8.25%", "elapsed_time": "15m 17s", "remaining_time": "2h 49m 56s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.890362} +{"loss": 1.1874814, "grad_norm": 2.8019979, "learning_rate": 2.094e-05, "token_acc": 0.71295003, "epoch": 0.16770964, "global_step/max_steps": "67/800", "percentage": "8.38%", "elapsed_time": "15m 25s", "remaining_time": "2h 48m 34s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.798652} +{"loss": 1.25219798, "grad_norm": 2.29989147, "learning_rate": 2.125e-05, "token_acc": 0.67584451, "epoch": 0.17021277, "global_step/max_steps": "68/800", "percentage": "8.50%", "elapsed_time": "15m 40s", "remaining_time": "2h 48m 36s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.820307} +{"loss": 1.20375049, "grad_norm": 12.2951746, "learning_rate": 2.156e-05, "token_acc": 0.68929147, "epoch": 0.17271589, "global_step/max_steps": "69/800", "percentage": "8.62%", "elapsed_time": "15m 47s", "remaining_time": "2h 47m 14s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.726967} +{"loss": 1.1940397, "grad_norm": 1.95900118, "learning_rate": 2.187e-05, "token_acc": 0.68335313, "epoch": 0.17521902, "global_step/max_steps": "70/800", "percentage": "8.75%", "elapsed_time": "16m 1s", "remaining_time": "2h 47m 4s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.732008} +{"loss": 1.22470307, "grad_norm": 1.35225391, "learning_rate": 2.219e-05, "token_acc": 0.67227952, "epoch": 0.17772215, "global_step/max_steps": "71/800", "percentage": "8.88%", "elapsed_time": "16m 29s", "remaining_time": "2h 49m 13s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.927847} +{"loss": 1.20950103, "grad_norm": 5.4055934, "learning_rate": 2.25e-05, "token_acc": 0.68630644, "epoch": 0.18022528, "global_step/max_steps": "72/800", "percentage": "9.00%", "elapsed_time": "16m 38s", "remaining_time": "2h 48m 13s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.864048} +{"loss": 1.06707847, "grad_norm": 2.51035953, "learning_rate": 2.281e-05, "token_acc": 0.72045712, "epoch": 0.18272841, "global_step/max_steps": "73/800", "percentage": "9.12%", "elapsed_time": "16m 52s", "remaining_time": "2h 47m 57s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.861714} +{"loss": 1.17209375, "grad_norm": 3.78683019, "learning_rate": 2.313e-05, "token_acc": 0.69663541, "epoch": 0.18523154, "global_step/max_steps": "74/800", "percentage": "9.25%", "elapsed_time": "17m 2s", "remaining_time": "2h 47m 3s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.805285} +{"loss": 1.16476393, "grad_norm": 7.54746675, "learning_rate": 2.344e-05, "token_acc": 0.69205822, "epoch": 0.18773467, "global_step/max_steps": "75/800", "percentage": "9.38%", "elapsed_time": "17m 13s", "remaining_time": "2h 46m 24s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.77057} +{"loss": 1.01552415, "grad_norm": 3.60007977, "learning_rate": 2.375e-05, "token_acc": 0.73691007, "epoch": 0.1902378, "global_step/max_steps": "76/800", "percentage": "9.50%", "elapsed_time": "17m 19s", "remaining_time": "2h 45m 2s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.67669} +{"loss": 1.17557335, "grad_norm": 2.19697952, "learning_rate": 2.406e-05, "token_acc": 0.68988888, "epoch": 0.19274093, "global_step/max_steps": "77/800", "percentage": "9.62%", "elapsed_time": "17m 32s", "remaining_time": "2h 44m 37s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.661248} +{"loss": 1.19642043, "grad_norm": 2.55498457, "learning_rate": 2.437e-05, "token_acc": 0.67778832, "epoch": 0.19524406, "global_step/max_steps": "78/800", "percentage": "9.75%", "elapsed_time": "17m 44s", "remaining_time": "2h 44m 6s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.636784} +{"loss": 1.20957756, "grad_norm": 2.39749146, "learning_rate": 2.469e-05, "token_acc": 0.67700925, "epoch": 0.19774718, "global_step/max_steps": "79/800", "percentage": "9.88%", "elapsed_time": "17m 57s", "remaining_time": "2h 43m 54s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.638883} +{"loss": 1.21587312, "grad_norm": 2.37349415, "learning_rate": 2.5e-05, "token_acc": 0.67357245, "epoch": 0.20025031, "global_step/max_steps": "80/800", "percentage": "10.00%", "elapsed_time": "18m 13s", "remaining_time": "2h 44m 1s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.668527} +{"loss": 1.15961277, "grad_norm": 6.30792332, "learning_rate": 2.531e-05, "token_acc": 0.68858633, "epoch": 0.20275344, "global_step/max_steps": "81/800", "percentage": "10.12%", "elapsed_time": "18m 39s", "remaining_time": "2h 45m 35s", "memory(GiB)": 71.34, "train_speed(s/it)": 13.818331} +{"loss": 1.24489188, "grad_norm": 1.9825964, "learning_rate": 2.562e-05, "token_acc": 0.66204013, "epoch": 0.20525657, "global_step/max_steps": "82/800", "percentage": "10.25%", "elapsed_time": "19m 12s", "remaining_time": "2h 48m 4s", "memory(GiB)": 71.34, "train_speed(s/it)": 14.044251} +{"loss": 1.13965392, "grad_norm": 3.53517699, "learning_rate": 2.594e-05, "token_acc": 0.68855339, "epoch": 0.2077597, "global_step/max_steps": "83/800", "percentage": "10.38%", "elapsed_time": "19m 38s", "remaining_time": "2h 49m 39s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.196181} +{"loss": 1.15980196, "grad_norm": 1.67421567, "learning_rate": 2.625e-05, "token_acc": 0.69444724, "epoch": 0.21026283, "global_step/max_steps": "84/800", "percentage": "10.50%", "elapsed_time": "19m 52s", "remaining_time": "2h 49m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.185683} +{"loss": 1.03506207, "grad_norm": 2.65739846, "learning_rate": 2.656e-05, "token_acc": 0.72383566, "epoch": 0.21276596, "global_step/max_steps": "85/800", "percentage": "10.62%", "elapsed_time": "20m 1s", "remaining_time": "2h 48m 23s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.130595} +{"loss": 1.16240978, "grad_norm": 8.29530621, "learning_rate": 2.687e-05, "token_acc": 0.69279524, "epoch": 0.21526909, "global_step/max_steps": "86/800", "percentage": "10.75%", "elapsed_time": "20m 11s", "remaining_time": "2h 47m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.082581} +{"loss": 1.08858252, "grad_norm": 2.99891829, "learning_rate": 2.719e-05, "token_acc": 0.71375969, "epoch": 0.21777222, "global_step/max_steps": "87/800", "percentage": "10.88%", "elapsed_time": "20m 19s", "remaining_time": "2h 46m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.008694} +{"loss": 1.08288574, "grad_norm": 1.86554372, "learning_rate": 2.75e-05, "token_acc": 0.70617483, "epoch": 0.22027534, "global_step/max_steps": "88/800", "percentage": "11.00%", "elapsed_time": "20m 28s", "remaining_time": "2h 45m 38s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.957595} +{"loss": 1.17803621, "grad_norm": 1.32333589, "learning_rate": 2.781e-05, "token_acc": 0.68483112, "epoch": 0.22277847, "global_step/max_steps": "89/800", "percentage": "11.12%", "elapsed_time": "20m 39s", "remaining_time": "2h 44m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.917345} +{"loss": 0.96864885, "grad_norm": 5.30493021, "learning_rate": 2.813e-05, "token_acc": 0.73633684, "epoch": 0.2252816, "global_step/max_steps": "90/800", "percentage": "11.25%", "elapsed_time": "20m 46s", "remaining_time": "2h 43m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.849906} +{"loss": 1.05778694, "grad_norm": 9.77317524, "learning_rate": 2.844e-05, "token_acc": 0.71142673, "epoch": 0.22778473, "global_step/max_steps": "91/800", "percentage": "11.38%", "elapsed_time": "21m 6s", "remaining_time": "2h 44m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.916979} +{"loss": 1.14592898, "grad_norm": 2.91957116, "learning_rate": 2.875e-05, "token_acc": 0.68885706, "epoch": 0.23028786, "global_step/max_steps": "92/800", "percentage": "11.50%", "elapsed_time": "21m 18s", "remaining_time": "2h 43m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.892682} +{"loss": 1.00080585, "grad_norm": 4.45640612, "learning_rate": 2.906e-05, "token_acc": 0.72714674, "epoch": 0.23279099, "global_step/max_steps": "93/800", "percentage": "11.62%", "elapsed_time": "21m 35s", "remaining_time": "2h 44m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.920229} +{"loss": 1.16309261, "grad_norm": 1.34926593, "learning_rate": 2.938e-05, "token_acc": 0.68655439, "epoch": 0.23529412, "global_step/max_steps": "94/800", "percentage": "11.75%", "elapsed_time": "21m 49s", "remaining_time": "2h 43m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.922869} +{"loss": 1.07943654, "grad_norm": 33.28302002, "learning_rate": 2.969e-05, "token_acc": 0.69550256, "epoch": 0.23779725, "global_step/max_steps": "95/800", "percentage": "11.88%", "elapsed_time": "22m 6s", "remaining_time": "2h 43m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.95537} +{"loss": 0.98161727, "grad_norm": 4.18858957, "learning_rate": 3e-05, "token_acc": 0.74212421, "epoch": 0.24030038, "global_step/max_steps": "96/800", "percentage": "12.00%", "elapsed_time": "22m 19s", "remaining_time": "2h 43m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.952902} +{"loss": 1.12175596, "grad_norm": 4.01972103, "learning_rate": 3.031e-05, "token_acc": 0.68853762, "epoch": 0.2428035, "global_step/max_steps": "97/800", "percentage": "12.12%", "elapsed_time": "22m 34s", "remaining_time": "2h 43m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.96166} +{"loss": 1.14275217, "grad_norm": 3.23539162, "learning_rate": 3.063e-05, "token_acc": 0.69088901, "epoch": 0.24530663, "global_step/max_steps": "98/800", "percentage": "12.25%", "elapsed_time": "22m 44s", "remaining_time": "2h 42m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.91725} +{"loss": 1.04066086, "grad_norm": 2.87755942, "learning_rate": 3.094e-05, "token_acc": 0.7161332, "epoch": 0.24780976, "global_step/max_steps": "99/800", "percentage": "12.38%", "elapsed_time": "22m 55s", "remaining_time": "2h 42m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.891261} +{"loss": 1.04708028, "grad_norm": 3.27840328, "learning_rate": 3.125e-05, "token_acc": 0.71071165, "epoch": 0.25031289, "global_step/max_steps": "100/800", "percentage": "12.50%", "elapsed_time": "23m 9s", "remaining_time": "2h 42m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.893815} +{"loss": 1.10331547, "grad_norm": 10.00626469, "learning_rate": 3.156e-05, "token_acc": 0.69938505, "epoch": 0.25281602, "global_step/max_steps": "101/800", "percentage": "12.62%", "elapsed_time": "23m 32s", "remaining_time": "2h 42m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.975554} +{"loss": 1.09318888, "grad_norm": 3.12800479, "learning_rate": 3.188e-05, "token_acc": 0.69943112, "epoch": 0.25531915, "global_step/max_steps": "102/800", "percentage": "12.75%", "elapsed_time": "23m 42s", "remaining_time": "2h 42m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.938179} +{"loss": 1.06722867, "grad_norm": 1.65522134, "learning_rate": 3.219e-05, "token_acc": 0.7047883, "epoch": 0.25782228, "global_step/max_steps": "103/800", "percentage": "12.88%", "elapsed_time": "23m 57s", "remaining_time": "2h 42m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.948154} +{"loss": 1.00132549, "grad_norm": 2.45812583, "learning_rate": 3.25e-05, "token_acc": 0.72105495, "epoch": 0.26032541, "global_step/max_steps": "104/800", "percentage": "13.00%", "elapsed_time": "24m 7s", "remaining_time": "2h 41m 24s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.914327} +{"loss": 1.05744445, "grad_norm": 1.61326981, "learning_rate": 3.281e-05, "token_acc": 0.71009885, "epoch": 0.26282854, "global_step/max_steps": "105/800", "percentage": "13.12%", "elapsed_time": "24m 20s", "remaining_time": "2h 41m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.908756} +{"loss": 1.12318993, "grad_norm": 1.56422138, "learning_rate": 3.312e-05, "token_acc": 0.68902468, "epoch": 0.26533166, "global_step/max_steps": "106/800", "percentage": "13.25%", "elapsed_time": "24m 38s", "remaining_time": "2h 41m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.945065} +{"loss": 1.03989625, "grad_norm": 2.40216804, "learning_rate": 3.344e-05, "token_acc": 0.71460735, "epoch": 0.26783479, "global_step/max_steps": "107/800", "percentage": "13.38%", "elapsed_time": "24m 48s", "remaining_time": "2h 40m 39s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.909094} +{"loss": 0.98156303, "grad_norm": 6.66641283, "learning_rate": 3.375e-05, "token_acc": 0.7229632, "epoch": 0.27033792, "global_step/max_steps": "108/800", "percentage": "13.50%", "elapsed_time": "25m 2s", "remaining_time": "2h 40m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.904278} +{"loss": 1.07554817, "grad_norm": 2.72498703, "learning_rate": 3.406e-05, "token_acc": 0.69457158, "epoch": 0.27284105, "global_step/max_steps": "109/800", "percentage": "13.63%", "elapsed_time": "25m 20s", "remaining_time": "2h 40m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.94597} +{"loss": 1.08461976, "grad_norm": 2.26406884, "learning_rate": 3.438e-05, "token_acc": 0.70668351, "epoch": 0.27534418, "global_step/max_steps": "110/800", "percentage": "13.75%", "elapsed_time": "25m 33s", "remaining_time": "2h 40m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.939198} +{"loss": 0.96426737, "grad_norm": 2.53150892, "learning_rate": 3.469e-05, "token_acc": 0.73426249, "epoch": 0.27784731, "global_step/max_steps": "111/800", "percentage": "13.88%", "elapsed_time": "25m 52s", "remaining_time": "2h 40m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.982301} +{"loss": 0.96641457, "grad_norm": 15.30518627, "learning_rate": 3.5e-05, "token_acc": 0.72989469, "epoch": 0.28035044, "global_step/max_steps": "112/800", "percentage": "14.00%", "elapsed_time": "26m 6s", "remaining_time": "2h 40m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.985576} +{"loss": 1.02916646, "grad_norm": 2.8182323, "learning_rate": 3.531e-05, "token_acc": 0.71688175, "epoch": 0.28285357, "global_step/max_steps": "113/800", "percentage": "14.12%", "elapsed_time": "26m 20s", "remaining_time": "2h 40m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.982309} +{"loss": 1.01013851, "grad_norm": 7.73212385, "learning_rate": 3.563e-05, "token_acc": 0.71719846, "epoch": 0.2853567, "global_step/max_steps": "114/800", "percentage": "14.25%", "elapsed_time": "26m 31s", "remaining_time": "2h 39m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.95512} +{"loss": 1.12733018, "grad_norm": 3.83638024, "learning_rate": 3.594e-05, "token_acc": 0.68877319, "epoch": 0.28785982, "global_step/max_steps": "115/800", "percentage": "14.37%", "elapsed_time": "26m 52s", "remaining_time": "2h 40m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.020489} +{"loss": 1.04448509, "grad_norm": 3.19891477, "learning_rate": 3.625e-05, "token_acc": 0.70923248, "epoch": 0.29036295, "global_step/max_steps": "116/800", "percentage": "14.50%", "elapsed_time": "27m 7s", "remaining_time": "2h 39m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.024823} +{"loss": 0.89349163, "grad_norm": 2.87878609, "learning_rate": 3.656e-05, "token_acc": 0.75906503, "epoch": 0.29286608, "global_step/max_steps": "117/800", "percentage": "14.62%", "elapsed_time": "27m 14s", "remaining_time": "2h 38m 60s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.967621} +{"loss": 1.08108878, "grad_norm": 2.40273166, "learning_rate": 3.688e-05, "token_acc": 0.7008031, "epoch": 0.29536921, "global_step/max_steps": "118/800", "percentage": "14.75%", "elapsed_time": "27m 26s", "remaining_time": "2h 38m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.9451} +{"loss": 1.07552981, "grad_norm": 2.03416085, "learning_rate": 3.719e-05, "token_acc": 0.70136302, "epoch": 0.29787234, "global_step/max_steps": "119/800", "percentage": "14.88%", "elapsed_time": "27m 45s", "remaining_time": "2h 38m 51s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.995181} +{"loss": 0.99452126, "grad_norm": 4.22055387, "learning_rate": 3.75e-05, "token_acc": 0.71996254, "epoch": 0.30037547, "global_step/max_steps": "120/800", "percentage": "15.00%", "elapsed_time": "27m 54s", "remaining_time": "2h 38m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.953035} +{"loss": 1.01525378, "grad_norm": 2.5642066, "learning_rate": 3.781e-05, "token_acc": 0.71793349, "epoch": 0.3028786, "global_step/max_steps": "121/800", "percentage": "15.12%", "elapsed_time": "28m 18s", "remaining_time": "2h 38m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.032453} +{"loss": 0.9843083, "grad_norm": 1.78505313, "learning_rate": 3.812e-05, "token_acc": 0.72549175, "epoch": 0.30538173, "global_step/max_steps": "122/800", "percentage": "15.25%", "elapsed_time": "28m 26s", "remaining_time": "2h 37m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.980906} +{"loss": 1.08545828, "grad_norm": 3.82692122, "learning_rate": 3.844e-05, "token_acc": 0.69811244, "epoch": 0.30788486, "global_step/max_steps": "123/800", "percentage": "15.38%", "elapsed_time": "28m 43s", "remaining_time": "2h 38m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 14.005856} +{"loss": 1.02906203, "grad_norm": 2.54125977, "learning_rate": 3.875e-05, "token_acc": 0.71400367, "epoch": 0.31038798, "global_step/max_steps": "124/800", "percentage": "15.50%", "elapsed_time": "28m 50s", "remaining_time": "2h 37m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.954284} +{"loss": 0.92382646, "grad_norm": 2.90141392, "learning_rate": 3.906e-05, "token_acc": 0.73985548, "epoch": 0.31289111, "global_step/max_steps": "125/800", "percentage": "15.62%", "elapsed_time": "29m 2s", "remaining_time": "2h 36m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.937192} +{"loss": 0.90850395, "grad_norm": 3.51646256, "learning_rate": 3.938e-05, "token_acc": 0.7436049, "epoch": 0.31539424, "global_step/max_steps": "126/800", "percentage": "15.75%", "elapsed_time": "29m 11s", "remaining_time": "2h 36m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.897982} +{"loss": 0.87043983, "grad_norm": 19.98680496, "learning_rate": 3.969e-05, "token_acc": 0.75926606, "epoch": 0.31789737, "global_step/max_steps": "127/800", "percentage": "15.88%", "elapsed_time": "29m 18s", "remaining_time": "2h 35m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.843649} +{"loss": 1.00865066, "grad_norm": 2.41902161, "learning_rate": 4e-05, "token_acc": 0.71558346, "epoch": 0.3204005, "global_step/max_steps": "128/800", "percentage": "16.00%", "elapsed_time": "29m 27s", "remaining_time": "2h 34m 38s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.807201} +{"loss": 0.99496466, "grad_norm": 10.0307169, "learning_rate": 4.031e-05, "token_acc": 0.72033557, "epoch": 0.32290363, "global_step/max_steps": "129/800", "percentage": "16.12%", "elapsed_time": "29m 37s", "remaining_time": "2h 34m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.771863} +{"loss": 0.98119569, "grad_norm": 12.68287849, "learning_rate": 4.063e-05, "token_acc": 0.72528928, "epoch": 0.32540676, "global_step/max_steps": "130/800", "percentage": "16.25%", "elapsed_time": "29m 49s", "remaining_time": "2h 33m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.763051} +{"loss": 0.87686253, "grad_norm": 2.53256798, "learning_rate": 4.094e-05, "token_acc": 0.75908816, "epoch": 0.32790989, "global_step/max_steps": "131/800", "percentage": "16.38%", "elapsed_time": "30m 11s", "remaining_time": "2h 34m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.823726} +{"loss": 0.97641391, "grad_norm": 3.47100353, "learning_rate": 4.125e-05, "token_acc": 0.72291851, "epoch": 0.33041302, "global_step/max_steps": "132/800", "percentage": "16.50%", "elapsed_time": "30m 25s", "remaining_time": "2h 33m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.821971} +{"loss": 1.01956403, "grad_norm": 2.52597809, "learning_rate": 4.156e-05, "token_acc": 0.71459072, "epoch": 0.33291615, "global_step/max_steps": "133/800", "percentage": "16.62%", "elapsed_time": "30m 43s", "remaining_time": "2h 34m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.860171} +{"loss": 0.95084983, "grad_norm": 2.96869564, "learning_rate": 4.188e-05, "token_acc": 0.73292537, "epoch": 0.33541927, "global_step/max_steps": "134/800", "percentage": "16.75%", "elapsed_time": "30m 52s", "remaining_time": "2h 33m 24s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.819755} +{"loss": 0.87760037, "grad_norm": 6.43482828, "learning_rate": 4.219e-05, "token_acc": 0.75619309, "epoch": 0.3379224, "global_step/max_steps": "135/800", "percentage": "16.88%", "elapsed_time": "31m 2s", "remaining_time": "2h 32m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.792692} +{"loss": 1.04457927, "grad_norm": 2.56510186, "learning_rate": 4.25e-05, "token_acc": 0.71084541, "epoch": 0.34042553, "global_step/max_steps": "136/800", "percentage": "17.00%", "elapsed_time": "31m 17s", "remaining_time": "2h 32m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.800408} +{"loss": 1.00953627, "grad_norm": 2.94955659, "learning_rate": 4.281e-05, "token_acc": 0.71640274, "epoch": 0.34292866, "global_step/max_steps": "137/800", "percentage": "17.12%", "elapsed_time": "31m 31s", "remaining_time": "2h 32m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.801948} +{"loss": 0.83576989, "grad_norm": 5.17426205, "learning_rate": 4.313e-05, "token_acc": 0.77335763, "epoch": 0.34543179, "global_step/max_steps": "138/800", "percentage": "17.25%", "elapsed_time": "31m 41s", "remaining_time": "2h 32m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.777488} +{"loss": 0.95133746, "grad_norm": 2.26728892, "learning_rate": 4.344e-05, "token_acc": 0.73355391, "epoch": 0.34793492, "global_step/max_steps": "139/800", "percentage": "17.38%", "elapsed_time": "31m 50s", "remaining_time": "2h 31m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.744313} +{"loss": 0.89529181, "grad_norm": 10.75383186, "learning_rate": 4.375e-05, "token_acc": 0.74946213, "epoch": 0.35043805, "global_step/max_steps": "140/800", "percentage": "17.50%", "elapsed_time": "32m 1s", "remaining_time": "2h 30m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.721434} +{"loss": 0.89018273, "grad_norm": 16.12870407, "learning_rate": 4.406e-05, "token_acc": 0.74651244, "epoch": 0.35294118, "global_step/max_steps": "141/800", "percentage": "17.62%", "elapsed_time": "32m 22s", "remaining_time": "2h 31m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.775711} +{"loss": 1.03296685, "grad_norm": 9.27182865, "learning_rate": 4.438e-05, "token_acc": 0.7120498, "epoch": 0.35544431, "global_step/max_steps": "142/800", "percentage": "17.75%", "elapsed_time": "32m 42s", "remaining_time": "2h 31m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.818695} +{"loss": 0.88278425, "grad_norm": 4.02098227, "learning_rate": 4.469e-05, "token_acc": 0.75641523, "epoch": 0.35794743, "global_step/max_steps": "143/800", "percentage": "17.88%", "elapsed_time": "32m 53s", "remaining_time": "2h 31m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.794064} +{"loss": 0.95778078, "grad_norm": 2.20529032, "learning_rate": 4.5e-05, "token_acc": 0.73183317, "epoch": 0.36045056, "global_step/max_steps": "144/800", "percentage": "18.00%", "elapsed_time": "33m 6s", "remaining_time": "2h 30m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.790856} +{"loss": 0.93723261, "grad_norm": 1.91104817, "learning_rate": 4.531e-05, "token_acc": 0.73354426, "epoch": 0.36295369, "global_step/max_steps": "145/800", "percentage": "18.12%", "elapsed_time": "33m 16s", "remaining_time": "2h 30m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.764062} +{"loss": 0.92505443, "grad_norm": 2.15697598, "learning_rate": 4.562e-05, "token_acc": 0.73506093, "epoch": 0.36545682, "global_step/max_steps": "146/800", "percentage": "18.25%", "elapsed_time": "33m 33s", "remaining_time": "2h 30m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.790904} +{"loss": 0.85444534, "grad_norm": 90.49914551, "learning_rate": 4.594e-05, "token_acc": 0.75514087, "epoch": 0.36795995, "global_step/max_steps": "147/800", "percentage": "18.38%", "elapsed_time": "33m 42s", "remaining_time": "2h 29m 44s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.758395} +{"loss": 0.92200917, "grad_norm": 4.50086975, "learning_rate": 4.625e-05, "token_acc": 0.74075079, "epoch": 0.37046308, "global_step/max_steps": "148/800", "percentage": "18.50%", "elapsed_time": "33m 51s", "remaining_time": "2h 29m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.721408} +{"loss": 1.04217482, "grad_norm": 1.81997681, "learning_rate": 4.656e-05, "token_acc": 0.70482702, "epoch": 0.37296621, "global_step/max_steps": "149/800", "percentage": "18.62%", "elapsed_time": "34m 4s", "remaining_time": "2h 28m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.7164} +{"loss": 0.97646582, "grad_norm": 2.3140049, "learning_rate": 4.688e-05, "token_acc": 0.71971874, "epoch": 0.37546934, "global_step/max_steps": "150/800", "percentage": "18.75%", "elapsed_time": "34m 17s", "remaining_time": "2h 28m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.711622} +{"loss": 1.02096772, "grad_norm": 1.50214231, "learning_rate": 4.719e-05, "token_acc": 0.71369809, "epoch": 0.37797247, "global_step/max_steps": "151/800", "percentage": "18.88%", "elapsed_time": "34m 38s", "remaining_time": "2h 28m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.76218} +{"loss": 0.86271399, "grad_norm": 2.88213563, "learning_rate": 4.75e-05, "token_acc": 0.75032716, "epoch": 0.38047559, "global_step/max_steps": "152/800", "percentage": "19.00%", "elapsed_time": "34m 52s", "remaining_time": "2h 28m 39s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.763727} +{"loss": 1.02093625, "grad_norm": 5.20237637, "learning_rate": 4.781e-05, "token_acc": 0.71022909, "epoch": 0.38297872, "global_step/max_steps": "153/800", "percentage": "19.12%", "elapsed_time": "35m 9s", "remaining_time": "2h 28m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.787384} +{"loss": 0.88927656, "grad_norm": 2.16952109, "learning_rate": 4.813e-05, "token_acc": 0.74623389, "epoch": 0.38548185, "global_step/max_steps": "154/800", "percentage": "19.25%", "elapsed_time": "35m 17s", "remaining_time": "2h 28m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.748063} +{"loss": 0.99213201, "grad_norm": 1.2071389, "learning_rate": 4.844e-05, "token_acc": 0.71951797, "epoch": 0.38798498, "global_step/max_steps": "155/800", "percentage": "19.38%", "elapsed_time": "35m 32s", "remaining_time": "2h 27m 51s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.752878} +{"loss": 0.88822466, "grad_norm": 3.77663851, "learning_rate": 4.875e-05, "token_acc": 0.74766563, "epoch": 0.39048811, "global_step/max_steps": "156/800", "percentage": "19.50%", "elapsed_time": "35m 42s", "remaining_time": "2h 27m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.728508} +{"loss": 0.95869315, "grad_norm": 4.70966244, "learning_rate": 4.906e-05, "token_acc": 0.72636816, "epoch": 0.39299124, "global_step/max_steps": "157/800", "percentage": "19.62%", "elapsed_time": "35m 52s", "remaining_time": "2h 26m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.707533} +{"loss": 0.85521543, "grad_norm": 4.04630804, "learning_rate": 4.938e-05, "token_acc": 0.75412201, "epoch": 0.39549437, "global_step/max_steps": "158/800", "percentage": "19.75%", "elapsed_time": "36m 6s", "remaining_time": "2h 26m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.709694} +{"loss": 0.88994706, "grad_norm": 2.8410275, "learning_rate": 4.969e-05, "token_acc": 0.74997253, "epoch": 0.3979975, "global_step/max_steps": "159/800", "percentage": "19.88%", "elapsed_time": "36m 26s", "remaining_time": "2h 26m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.750513} +{"loss": 0.94518518, "grad_norm": 2.94229674, "learning_rate": 5e-05, "token_acc": 0.72863684, "epoch": 0.40050063, "global_step/max_steps": "160/800", "percentage": "20.00%", "elapsed_time": "36m 42s", "remaining_time": "2h 26m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.761203} +{"loss": 0.87617809, "grad_norm": 3.18597412, "learning_rate": 5e-05, "token_acc": 0.75989033, "epoch": 0.40300375, "global_step/max_steps": "161/800", "percentage": "20.12%", "elapsed_time": "36m 60s", "remaining_time": "2h 26m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.787197} +{"loss": 0.88268101, "grad_norm": 1.98400605, "learning_rate": 5e-05, "token_acc": 0.74466134, "epoch": 0.40550688, "global_step/max_steps": "162/800", "percentage": "20.25%", "elapsed_time": "37m 10s", "remaining_time": "2h 26m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.762533} +{"loss": 0.84823287, "grad_norm": 21.65319252, "learning_rate": 5e-05, "token_acc": 0.75381796, "epoch": 0.40801001, "global_step/max_steps": "163/800", "percentage": "20.38%", "elapsed_time": "37m 28s", "remaining_time": "2h 26m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.791002} +{"loss": 1.03135109, "grad_norm": 2.40255737, "learning_rate": 5e-05, "token_acc": 0.70490648, "epoch": 0.41051314, "global_step/max_steps": "164/800", "percentage": "20.50%", "elapsed_time": "37m 46s", "remaining_time": "2h 26m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.818407} +{"loss": 0.93144548, "grad_norm": 2.25133514, "learning_rate": 4.999e-05, "token_acc": 0.73082649, "epoch": 0.41301627, "global_step/max_steps": "165/800", "percentage": "20.62%", "elapsed_time": "38m 4s", "remaining_time": "2h 26m 30s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.843043} +{"loss": 0.95505357, "grad_norm": 1.28423214, "learning_rate": 4.999e-05, "token_acc": 0.72281573, "epoch": 0.4155194, "global_step/max_steps": "166/800", "percentage": "20.75%", "elapsed_time": "38m 16s", "remaining_time": "2h 26m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.833122} +{"loss": 0.86893535, "grad_norm": 2.69765449, "learning_rate": 4.999e-05, "token_acc": 0.74882721, "epoch": 0.41802253, "global_step/max_steps": "167/800", "percentage": "20.88%", "elapsed_time": "38m 27s", "remaining_time": "2h 25m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.817102} +{"loss": 0.94808519, "grad_norm": 1.90137768, "learning_rate": 4.998e-05, "token_acc": 0.72567089, "epoch": 0.42052566, "global_step/max_steps": "168/800", "percentage": "21.00%", "elapsed_time": "38m 39s", "remaining_time": "2h 25m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.805112} +{"loss": 0.79231781, "grad_norm": 2.01475549, "learning_rate": 4.998e-05, "token_acc": 0.77470701, "epoch": 0.42302879, "global_step/max_steps": "169/800", "percentage": "21.12%", "elapsed_time": "38m 48s", "remaining_time": "2h 24m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.777775} +{"loss": 0.83630282, "grad_norm": 5.95169735, "learning_rate": 4.997e-05, "token_acc": 0.76430836, "epoch": 0.42553191, "global_step/max_steps": "170/800", "percentage": "21.25%", "elapsed_time": "38m 58s", "remaining_time": "2h 24m 24s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.752224} +{"loss": 0.84633142, "grad_norm": 3.00498867, "learning_rate": 4.996e-05, "token_acc": 0.76175997, "epoch": 0.42803504, "global_step/max_steps": "171/800", "percentage": "21.38%", "elapsed_time": "39m 17s", "remaining_time": "2h 24m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.782344} +{"loss": 0.81696028, "grad_norm": 6.122715, "learning_rate": 4.996e-05, "token_acc": 0.758818, "epoch": 0.43053817, "global_step/max_steps": "172/800", "percentage": "21.50%", "elapsed_time": "39m 24s", "remaining_time": "2h 23m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.742566} +{"loss": 1.00299406, "grad_norm": 2.14045787, "learning_rate": 4.995e-05, "token_acc": 0.71221907, "epoch": 0.4330413, "global_step/max_steps": "173/800", "percentage": "21.62%", "elapsed_time": "39m 45s", "remaining_time": "2h 24m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.784473} +{"loss": 0.91345751, "grad_norm": 1.96381211, "learning_rate": 4.994e-05, "token_acc": 0.74539763, "epoch": 0.43554443, "global_step/max_steps": "174/800", "percentage": "21.75%", "elapsed_time": "39m 57s", "remaining_time": "2h 23m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.773712} +{"loss": 0.82947975, "grad_norm": 6.96358824, "learning_rate": 4.993e-05, "token_acc": 0.76526892, "epoch": 0.43804756, "global_step/max_steps": "175/800", "percentage": "21.88%", "elapsed_time": "40m 5s", "remaining_time": "2h 23m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.742526} +{"loss": 0.9168058, "grad_norm": 2.01353526, "learning_rate": 4.992e-05, "token_acc": 0.73644638, "epoch": 0.44055069, "global_step/max_steps": "176/800", "percentage": "22.00%", "elapsed_time": "40m 15s", "remaining_time": "2h 22m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.723558} +{"loss": 0.86273539, "grad_norm": 1.50276542, "learning_rate": 4.991e-05, "token_acc": 0.75555729, "epoch": 0.44305382, "global_step/max_steps": "177/800", "percentage": "22.12%", "elapsed_time": "40m 23s", "remaining_time": "2h 22m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.690807} +{"loss": 1.00613296, "grad_norm": 2.04260564, "learning_rate": 4.99e-05, "token_acc": 0.71135763, "epoch": 0.44555695, "global_step/max_steps": "178/800", "percentage": "22.25%", "elapsed_time": "40m 40s", "remaining_time": "2h 22m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.710596} +{"loss": 0.84802997, "grad_norm": 2.37139559, "learning_rate": 4.989e-05, "token_acc": 0.76307719, "epoch": 0.44806008, "global_step/max_steps": "179/800", "percentage": "22.38%", "elapsed_time": "40m 47s", "remaining_time": "2h 21m 30s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.671123} +{"loss": 0.90999568, "grad_norm": 1.94725788, "learning_rate": 4.988e-05, "token_acc": 0.7445681, "epoch": 0.4505632, "global_step/max_steps": "180/800", "percentage": "22.50%", "elapsed_time": "40m 55s", "remaining_time": "2h 20m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.636701} +{"loss": 0.80872774, "grad_norm": 5.37875891, "learning_rate": 4.987e-05, "token_acc": 0.76579457, "epoch": 0.45306633, "global_step/max_steps": "181/800", "percentage": "22.62%", "elapsed_time": "41m 13s", "remaining_time": "2h 20m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.660688} +{"loss": 0.94944572, "grad_norm": 1.74152529, "learning_rate": 4.985e-05, "token_acc": 0.72855897, "epoch": 0.45556946, "global_step/max_steps": "182/800", "percentage": "22.75%", "elapsed_time": "41m 24s", "remaining_time": "2h 20m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.648717} +{"loss": 0.95847863, "grad_norm": 3.2863555, "learning_rate": 4.984e-05, "token_acc": 0.72950057, "epoch": 0.45807259, "global_step/max_steps": "183/800", "percentage": "22.88%", "elapsed_time": "41m 38s", "remaining_time": "2h 20m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.64935} +{"loss": 0.9425087, "grad_norm": 1.24146605, "learning_rate": 4.983e-05, "token_acc": 0.73022657, "epoch": 0.46057572, "global_step/max_steps": "184/800", "percentage": "23.00%", "elapsed_time": "41m 50s", "remaining_time": "2h 20m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.638987} +{"loss": 0.85458004, "grad_norm": 2.1618588, "learning_rate": 4.981e-05, "token_acc": 0.75084341, "epoch": 0.46307885, "global_step/max_steps": "185/800", "percentage": "23.12%", "elapsed_time": "41m 57s", "remaining_time": "2h 19m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.60593} +{"loss": 1.00337601, "grad_norm": 2.74641943, "learning_rate": 4.98e-05, "token_acc": 0.71681124, "epoch": 0.46558198, "global_step/max_steps": "186/800", "percentage": "23.25%", "elapsed_time": "42m 9s", "remaining_time": "2h 19m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.598692} +{"loss": 0.87262338, "grad_norm": 2.11174774, "learning_rate": 4.978e-05, "token_acc": 0.75128961, "epoch": 0.46808511, "global_step/max_steps": "187/800", "percentage": "23.38%", "elapsed_time": "42m 18s", "remaining_time": "2h 18m 39s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.5716} +{"loss": 0.98327178, "grad_norm": 2.3225832, "learning_rate": 4.976e-05, "token_acc": 0.72427061, "epoch": 0.47058824, "global_step/max_steps": "188/800", "percentage": "23.50%", "elapsed_time": "42m 32s", "remaining_time": "2h 18m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.575912} +{"loss": 0.83748198, "grad_norm": 1.56923389, "learning_rate": 4.975e-05, "token_acc": 0.75153482, "epoch": 0.47309136, "global_step/max_steps": "189/800", "percentage": "23.62%", "elapsed_time": "42m 42s", "remaining_time": "2h 18m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.557185} +{"loss": 0.85086381, "grad_norm": 2.91573644, "learning_rate": 4.973e-05, "token_acc": 0.7552318, "epoch": 0.47559449, "global_step/max_steps": "190/800", "percentage": "23.75%", "elapsed_time": "42m 56s", "remaining_time": "2h 17m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.557531} +{"loss": 0.87116146, "grad_norm": 2.50981021, "learning_rate": 4.971e-05, "token_acc": 0.7488346, "epoch": 0.47809762, "global_step/max_steps": "191/800", "percentage": "23.88%", "elapsed_time": "43m 19s", "remaining_time": "2h 18m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.608988} +{"loss": 0.81275654, "grad_norm": 38.90914154, "learning_rate": 4.969e-05, "token_acc": 0.7634651, "epoch": 0.48060075, "global_step/max_steps": "192/800", "percentage": "24.00%", "elapsed_time": "43m 26s", "remaining_time": "2h 17m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.575247} +{"loss": 0.82369936, "grad_norm": 2.68647027, "learning_rate": 4.967e-05, "token_acc": 0.76070281, "epoch": 0.48310388, "global_step/max_steps": "193/800", "percentage": "24.12%", "elapsed_time": "43m 38s", "remaining_time": "2h 17m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.567023} +{"loss": 0.93638456, "grad_norm": 1.87828481, "learning_rate": 4.965e-05, "token_acc": 0.72929629, "epoch": 0.48560701, "global_step/max_steps": "194/800", "percentage": "24.25%", "elapsed_time": "43m 54s", "remaining_time": "2h 17m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.577143} +{"loss": 0.78716099, "grad_norm": 15.92721844, "learning_rate": 4.963e-05, "token_acc": 0.76603805, "epoch": 0.48811014, "global_step/max_steps": "195/800", "percentage": "24.38%", "elapsed_time": "44m 4s", "remaining_time": "2h 16m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.557731} +{"loss": 0.8945263, "grad_norm": 5.42869854, "learning_rate": 4.961e-05, "token_acc": 0.73318646, "epoch": 0.49061327, "global_step/max_steps": "196/800", "percentage": "24.50%", "elapsed_time": "44m 16s", "remaining_time": "2h 16m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.551995} +{"loss": 0.80396539, "grad_norm": 4.43682384, "learning_rate": 4.959e-05, "token_acc": 0.76720863, "epoch": 0.4931164, "global_step/max_steps": "197/800", "percentage": "24.62%", "elapsed_time": "44m 30s", "remaining_time": "2h 16m 12s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.551915} +{"loss": 0.99376911, "grad_norm": 1.18044066, "learning_rate": 4.957e-05, "token_acc": 0.71829018, "epoch": 0.49561952, "global_step/max_steps": "198/800", "percentage": "24.75%", "elapsed_time": "44m 43s", "remaining_time": "2h 15m 57s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.549856} +{"loss": 0.88853598, "grad_norm": 34.30480957, "learning_rate": 4.954e-05, "token_acc": 0.73763944, "epoch": 0.49812265, "global_step/max_steps": "199/800", "percentage": "24.88%", "elapsed_time": "44m 52s", "remaining_time": "2h 15m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.529113} +{"loss": 0.82994211, "grad_norm": 3.24173307, "learning_rate": 4.952e-05, "token_acc": 0.75908445, "epoch": 0.50062578, "global_step/max_steps": "200/800", "percentage": "25.00%", "elapsed_time": "45m 1s", "remaining_time": "2h 15m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.507376} +{"loss": 0.87996471, "grad_norm": 1.72134912, "learning_rate": 4.95e-05, "token_acc": 0.74609597, "epoch": 0.50312891, "global_step/max_steps": "201/800", "percentage": "25.12%", "elapsed_time": "45m 20s", "remaining_time": "2h 15m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.534388} +{"loss": 0.76742983, "grad_norm": 3.1299839, "learning_rate": 4.947e-05, "token_acc": 0.77785853, "epoch": 0.50563204, "global_step/max_steps": "202/800", "percentage": "25.25%", "elapsed_time": "45m 28s", "remaining_time": "2h 14m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.505947} +{"loss": 0.89054984, "grad_norm": 1.77326405, "learning_rate": 4.945e-05, "token_acc": 0.74500128, "epoch": 0.50813517, "global_step/max_steps": "203/800", "percentage": "25.37%", "elapsed_time": "45m 36s", "remaining_time": "2h 14m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.47701} +{"loss": 0.97460318, "grad_norm": 1.57761931, "learning_rate": 4.942e-05, "token_acc": 0.72225051, "epoch": 0.5106383, "global_step/max_steps": "204/800", "percentage": "25.50%", "elapsed_time": "45m 50s", "remaining_time": "2h 13m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.480081} +{"loss": 0.8019765, "grad_norm": 2.39836717, "learning_rate": 4.939e-05, "token_acc": 0.76815958, "epoch": 0.51314143, "global_step/max_steps": "205/800", "percentage": "25.62%", "elapsed_time": "45m 59s", "remaining_time": "2h 13m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.456896} +{"loss": 0.95084655, "grad_norm": 2.55893087, "learning_rate": 4.937e-05, "token_acc": 0.72604394, "epoch": 0.51564456, "global_step/max_steps": "206/800", "percentage": "25.75%", "elapsed_time": "46m 12s", "remaining_time": "2h 13m 12s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.453948} +{"loss": 0.8822273, "grad_norm": 30.6848278, "learning_rate": 4.934e-05, "token_acc": 0.74614457, "epoch": 0.51814768, "global_step/max_steps": "207/800", "percentage": "25.87%", "elapsed_time": "46m 27s", "remaining_time": "2h 13m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.463914} +{"loss": 0.7858007, "grad_norm": 1.64179802, "learning_rate": 4.931e-05, "token_acc": 0.76724512, "epoch": 0.52065081, "global_step/max_steps": "208/800", "percentage": "26.00%", "elapsed_time": "46m 40s", "remaining_time": "2h 12m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.462182} +{"loss": 0.93090028, "grad_norm": 1.71599364, "learning_rate": 4.928e-05, "token_acc": 0.72866756, "epoch": 0.52315394, "global_step/max_steps": "209/800", "percentage": "26.12%", "elapsed_time": "46m 51s", "remaining_time": "2h 12m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.447918} +{"loss": 0.94683939, "grad_norm": 2.5000968, "learning_rate": 4.925e-05, "token_acc": 0.73377894, "epoch": 0.52565707, "global_step/max_steps": "210/800", "percentage": "26.25%", "elapsed_time": "47m 4s", "remaining_time": "2h 12m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.448305} +{"loss": 0.9224, "grad_norm": 4.12799025, "learning_rate": 4.922e-05, "token_acc": 0.72991565, "epoch": 0.5281602, "global_step/max_steps": "211/800", "percentage": "26.38%", "elapsed_time": "47m 33s", "remaining_time": "2h 12m 44s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.521754} +{"loss": 0.94429088, "grad_norm": 2.0851326, "learning_rate": 4.919e-05, "token_acc": 0.72849296, "epoch": 0.53066333, "global_step/max_steps": "212/800", "percentage": "26.50%", "elapsed_time": "47m 50s", "remaining_time": "2h 12m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.539385} +{"loss": 0.89234096, "grad_norm": 1.87774062, "learning_rate": 4.916e-05, "token_acc": 0.74087079, "epoch": 0.53316646, "global_step/max_steps": "213/800", "percentage": "26.62%", "elapsed_time": "48m 0s", "remaining_time": "2h 12m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.521347} +{"loss": 0.85827857, "grad_norm": 1.61037743, "learning_rate": 4.913e-05, "token_acc": 0.74729867, "epoch": 0.53566959, "global_step/max_steps": "214/800", "percentage": "26.75%", "elapsed_time": "48m 16s", "remaining_time": "2h 12m 11s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.533939} +{"loss": 0.98067522, "grad_norm": 5.49660206, "learning_rate": 4.909e-05, "token_acc": 0.71826414, "epoch": 0.53817272, "global_step/max_steps": "215/800", "percentage": "26.88%", "elapsed_time": "48m 32s", "remaining_time": "2h 12m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.546322} +{"loss": 0.93654156, "grad_norm": 2.90306973, "learning_rate": 4.906e-05, "token_acc": 0.7300922, "epoch": 0.54067584, "global_step/max_steps": "216/800", "percentage": "27.00%", "elapsed_time": "48m 45s", "remaining_time": "2h 11m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.541709} +{"loss": 0.73839694, "grad_norm": 4.84404612, "learning_rate": 4.903e-05, "token_acc": 0.79149897, "epoch": 0.54317897, "global_step/max_steps": "217/800", "percentage": "27.12%", "elapsed_time": "48m 53s", "remaining_time": "2h 11m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.516311} +{"loss": 0.95236492, "grad_norm": 1.53530288, "learning_rate": 4.899e-05, "token_acc": 0.723794, "epoch": 0.5456821, "global_step/max_steps": "218/800", "percentage": "27.25%", "elapsed_time": "49m 9s", "remaining_time": "2h 11m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.528929} +{"loss": 0.75318128, "grad_norm": 32.93247604, "learning_rate": 4.896e-05, "token_acc": 0.78507405, "epoch": 0.54818523, "global_step/max_steps": "219/800", "percentage": "27.38%", "elapsed_time": "49m 16s", "remaining_time": "2h 10m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.496577} +{"loss": 0.89539146, "grad_norm": 2.05914974, "learning_rate": 4.892e-05, "token_acc": 0.73962882, "epoch": 0.55068836, "global_step/max_steps": "220/800", "percentage": "27.50%", "elapsed_time": "49m 24s", "remaining_time": "2h 10m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.474836} +{"loss": 0.8436079, "grad_norm": 3.84973907, "learning_rate": 4.889e-05, "token_acc": 0.75438468, "epoch": 0.55319149, "global_step/max_steps": "221/800", "percentage": "27.62%", "elapsed_time": "49m 44s", "remaining_time": "2h 10m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.502519} +{"loss": 0.88141662, "grad_norm": 1.91769254, "learning_rate": 4.885e-05, "token_acc": 0.74674469, "epoch": 0.55569462, "global_step/max_steps": "222/800", "percentage": "27.75%", "elapsed_time": "50m 3s", "remaining_time": "2h 10m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.52669} +{"loss": 0.85136443, "grad_norm": 1.97492528, "learning_rate": 4.881e-05, "token_acc": 0.74573748, "epoch": 0.55819775, "global_step/max_steps": "223/800", "percentage": "27.88%", "elapsed_time": "50m 13s", "remaining_time": "2h 9m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.50967} +{"loss": 0.80556619, "grad_norm": 4.91427326, "learning_rate": 4.878e-05, "token_acc": 0.76240613, "epoch": 0.56070088, "global_step/max_steps": "224/800", "percentage": "28.00%", "elapsed_time": "50m 22s", "remaining_time": "2h 9m 30s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.490096} +{"loss": 0.88729584, "grad_norm": 31.53511047, "learning_rate": 4.874e-05, "token_acc": 0.74920806, "epoch": 0.56320401, "global_step/max_steps": "225/800", "percentage": "28.12%", "elapsed_time": "50m 36s", "remaining_time": "2h 9m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.492047} +{"loss": 0.89055884, "grad_norm": 2.17432332, "learning_rate": 4.87e-05, "token_acc": 0.74269906, "epoch": 0.56570713, "global_step/max_steps": "226/800", "percentage": "28.25%", "elapsed_time": "50m 47s", "remaining_time": "2h 9m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.484358} +{"loss": 0.84425044, "grad_norm": 2.53753471, "learning_rate": 4.866e-05, "token_acc": 0.75959445, "epoch": 0.56821026, "global_step/max_steps": "227/800", "percentage": "28.38%", "elapsed_time": "50m 57s", "remaining_time": "2h 8m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.466736} +{"loss": 0.89629316, "grad_norm": 2.56028485, "learning_rate": 4.862e-05, "token_acc": 0.74122894, "epoch": 0.57071339, "global_step/max_steps": "228/800", "percentage": "28.50%", "elapsed_time": "51m 14s", "remaining_time": "2h 8m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.484506} +{"loss": 0.83959025, "grad_norm": 7.3618927, "learning_rate": 4.858e-05, "token_acc": 0.75826298, "epoch": 0.57321652, "global_step/max_steps": "229/800", "percentage": "28.62%", "elapsed_time": "51m 25s", "remaining_time": "2h 8m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.472318} +{"loss": 0.89516985, "grad_norm": 3.77514029, "learning_rate": 4.854e-05, "token_acc": 0.74018627, "epoch": 0.57571965, "global_step/max_steps": "230/800", "percentage": "28.75%", "elapsed_time": "51m 36s", "remaining_time": "2h 7m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.459109} +{"loss": 0.68740034, "grad_norm": 1.73019993, "learning_rate": 4.85e-05, "token_acc": 0.79968802, "epoch": 0.57822278, "global_step/max_steps": "231/800", "percentage": "28.88%", "elapsed_time": "51m 56s", "remaining_time": "2h 7m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.489907} +{"loss": 0.83035642, "grad_norm": 1.93137658, "learning_rate": 4.845e-05, "token_acc": 0.76008319, "epoch": 0.58072591, "global_step/max_steps": "232/800", "percentage": "29.00%", "elapsed_time": "52m 6s", "remaining_time": "2h 7m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.472493} +{"loss": 0.83845735, "grad_norm": 2.03117847, "learning_rate": 4.841e-05, "token_acc": 0.7549542, "epoch": 0.58322904, "global_step/max_steps": "233/800", "percentage": "29.12%", "elapsed_time": "52m 16s", "remaining_time": "2h 7m 11s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.458176} +{"loss": 0.80696338, "grad_norm": 1.0220412, "learning_rate": 4.837e-05, "token_acc": 0.75994804, "epoch": 0.58573217, "global_step/max_steps": "234/800", "percentage": "29.25%", "elapsed_time": "52m 25s", "remaining_time": "2h 6m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.440255} +{"loss": 0.81109023, "grad_norm": 3.72928357, "learning_rate": 4.832e-05, "token_acc": 0.75806231, "epoch": 0.58823529, "global_step/max_steps": "235/800", "percentage": "29.38%", "elapsed_time": "52m 38s", "remaining_time": "2h 6m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.439017} +{"loss": 0.85661089, "grad_norm": 1.75804365, "learning_rate": 4.828e-05, "token_acc": 0.74623895, "epoch": 0.59073842, "global_step/max_steps": "236/800", "percentage": "29.50%", "elapsed_time": "52m 53s", "remaining_time": "2h 6m 23s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.444738} +{"loss": 0.97905338, "grad_norm": 4.30661583, "learning_rate": 4.824e-05, "token_acc": 0.7135992, "epoch": 0.59324155, "global_step/max_steps": "237/800", "percentage": "29.62%", "elapsed_time": "53m 1s", "remaining_time": "2h 5m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.421426} +{"loss": 0.79939669, "grad_norm": 1.50205123, "learning_rate": 4.819e-05, "token_acc": 0.76097756, "epoch": 0.59574468, "global_step/max_steps": "238/800", "percentage": "29.75%", "elapsed_time": "53m 9s", "remaining_time": "2h 5m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.400576} +{"loss": 0.88236332, "grad_norm": 1.61873686, "learning_rate": 4.814e-05, "token_acc": 0.74747363, "epoch": 0.59824781, "global_step/max_steps": "239/800", "percentage": "29.88%", "elapsed_time": "53m 26s", "remaining_time": "2h 5m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.41375} +{"loss": 0.8518728, "grad_norm": 2.46258235, "learning_rate": 4.81e-05, "token_acc": 0.74814534, "epoch": 0.60075094, "global_step/max_steps": "240/800", "percentage": "30.00%", "elapsed_time": "53m 45s", "remaining_time": "2h 5m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.438929} +{"loss": 0.69724584, "grad_norm": 5.80740929, "learning_rate": 4.805e-05, "token_acc": 0.79481594, "epoch": 0.60325407, "global_step/max_steps": "241/800", "percentage": "30.12%", "elapsed_time": "54m 2s", "remaining_time": "2h 5m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.451334} +{"loss": 0.90445864, "grad_norm": 2.5917685, "learning_rate": 4.8e-05, "token_acc": 0.73248521, "epoch": 0.6057572, "global_step/max_steps": "242/800", "percentage": "30.25%", "elapsed_time": "54m 20s", "remaining_time": "2h 5m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.47247} +{"loss": 0.93045819, "grad_norm": 2.55171943, "learning_rate": 4.795e-05, "token_acc": 0.72780204, "epoch": 0.60826033, "global_step/max_steps": "243/800", "percentage": "30.38%", "elapsed_time": "54m 30s", "remaining_time": "2h 4m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.458445} +{"loss": 0.84992063, "grad_norm": 2.61753535, "learning_rate": 4.79e-05, "token_acc": 0.75199667, "epoch": 0.61076345, "global_step/max_steps": "244/800", "percentage": "30.50%", "elapsed_time": "54m 42s", "remaining_time": "2h 4m 39s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.451613} +{"loss": 0.94066918, "grad_norm": 1.32052886, "learning_rate": 4.786e-05, "token_acc": 0.72820373, "epoch": 0.61326658, "global_step/max_steps": "245/800", "percentage": "30.63%", "elapsed_time": "54m 55s", "remaining_time": "2h 4m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.450741} +{"loss": 0.89561921, "grad_norm": 1.90399981, "learning_rate": 4.781e-05, "token_acc": 0.73307324, "epoch": 0.61576971, "global_step/max_steps": "246/800", "percentage": "30.75%", "elapsed_time": "55m 12s", "remaining_time": "2h 4m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.465172} +{"loss": 0.77653956, "grad_norm": 2.12438893, "learning_rate": 4.775e-05, "token_acc": 0.77245352, "epoch": 0.61827284, "global_step/max_steps": "247/800", "percentage": "30.88%", "elapsed_time": "55m 21s", "remaining_time": "2h 3m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.444661} +{"loss": 0.89323592, "grad_norm": 1.01704729, "learning_rate": 4.77e-05, "token_acc": 0.7361667, "epoch": 0.62077597, "global_step/max_steps": "248/800", "percentage": "31.00%", "elapsed_time": "55m 33s", "remaining_time": "2h 3m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.441253} +{"loss": 0.90776044, "grad_norm": 1.20931613, "learning_rate": 4.765e-05, "token_acc": 0.73427836, "epoch": 0.6232791, "global_step/max_steps": "249/800", "percentage": "31.13%", "elapsed_time": "55m 48s", "remaining_time": "2h 3m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.444176} +{"loss": 0.74698877, "grad_norm": 6.28342485, "learning_rate": 4.76e-05, "token_acc": 0.78000949, "epoch": 0.62578223, "global_step/max_steps": "250/800", "percentage": "31.25%", "elapsed_time": "55m 57s", "remaining_time": "2h 3m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.428669} +{"loss": 0.84409434, "grad_norm": 3.57543945, "learning_rate": 4.755e-05, "token_acc": 0.75373535, "epoch": 0.62828536, "global_step/max_steps": "251/800", "percentage": "31.37%", "elapsed_time": "56m 16s", "remaining_time": "2h 3m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.449663} +{"loss": 0.88435304, "grad_norm": 2.0179975, "learning_rate": 4.749e-05, "token_acc": 0.73792673, "epoch": 0.63078849, "global_step/max_steps": "252/800", "percentage": "31.50%", "elapsed_time": "56m 24s", "remaining_time": "2h 2m 39s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.428399} +{"loss": 0.84245241, "grad_norm": 1.33687043, "learning_rate": 4.744e-05, "token_acc": 0.75272799, "epoch": 0.63329161, "global_step/max_steps": "253/800", "percentage": "31.62%", "elapsed_time": "56m 35s", "remaining_time": "2h 2m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.419514} +{"loss": 0.75250709, "grad_norm": 7.15695715, "learning_rate": 4.739e-05, "token_acc": 0.77396643, "epoch": 0.63579474, "global_step/max_steps": "254/800", "percentage": "31.75%", "elapsed_time": "56m 44s", "remaining_time": "2h 1m 57s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.400665} +{"loss": 0.72024059, "grad_norm": 7.08997107, "learning_rate": 4.733e-05, "token_acc": 0.78693495, "epoch": 0.63829787, "global_step/max_steps": "255/800", "percentage": "31.87%", "elapsed_time": "56m 56s", "remaining_time": "2h 1m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.395378} +{"loss": 0.82243574, "grad_norm": 2.14919209, "learning_rate": 4.728e-05, "token_acc": 0.75584279, "epoch": 0.640801, "global_step/max_steps": "256/800", "percentage": "32.00%", "elapsed_time": "57m 6s", "remaining_time": "2h 1m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.382377} +{"loss": 0.79406953, "grad_norm": 4.26791668, "learning_rate": 4.722e-05, "token_acc": 0.76434367, "epoch": 0.64330413, "global_step/max_steps": "257/800", "percentage": "32.12%", "elapsed_time": "57m 15s", "remaining_time": "2h 0m 58s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36631} +{"loss": 0.78737134, "grad_norm": 3.58912921, "learning_rate": 4.716e-05, "token_acc": 0.7648122, "epoch": 0.64580726, "global_step/max_steps": "258/800", "percentage": "32.25%", "elapsed_time": "57m 30s", "remaining_time": "2h 0m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.371286} +{"loss": 0.83561248, "grad_norm": 2.21463275, "learning_rate": 4.711e-05, "token_acc": 0.75038398, "epoch": 0.64831039, "global_step/max_steps": "259/800", "percentage": "32.38%", "elapsed_time": "57m 41s", "remaining_time": "2h 0m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.361296} +{"loss": 0.87713194, "grad_norm": 2.82016301, "learning_rate": 4.705e-05, "token_acc": 0.74452211, "epoch": 0.65081352, "global_step/max_steps": "260/800", "percentage": "32.50%", "elapsed_time": "57m 51s", "remaining_time": "2h 0m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.350559} +{"loss": 0.91905236, "grad_norm": 1.44398451, "learning_rate": 4.699e-05, "token_acc": 0.7323773, "epoch": 0.65331665, "global_step/max_steps": "261/800", "percentage": "32.62%", "elapsed_time": "58m 24s", "remaining_time": "2h 0m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.424497} +{"loss": 0.73408896, "grad_norm": 4.22704649, "learning_rate": 4.693e-05, "token_acc": 0.78615721, "epoch": 0.65581977, "global_step/max_steps": "262/800", "percentage": "32.75%", "elapsed_time": "58m 33s", "remaining_time": "2h 0m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.409248} +{"loss": 0.90582383, "grad_norm": 1.60554767, "learning_rate": 4.687e-05, "token_acc": 0.73599505, "epoch": 0.6583229, "global_step/max_steps": "263/800", "percentage": "32.88%", "elapsed_time": "58m 48s", "remaining_time": "2h 0m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.416313} +{"loss": 0.96999681, "grad_norm": 7.08300686, "learning_rate": 4.681e-05, "token_acc": 0.71997736, "epoch": 0.66082603, "global_step/max_steps": "264/800", "percentage": "33.00%", "elapsed_time": "59m 5s", "remaining_time": "1h 59m 58s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.428264} +{"loss": 0.80512947, "grad_norm": 2.43877816, "learning_rate": 4.675e-05, "token_acc": 0.76801828, "epoch": 0.66332916, "global_step/max_steps": "265/800", "percentage": "33.12%", "elapsed_time": "59m 18s", "remaining_time": "1h 59m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.42555} +{"loss": 0.83524477, "grad_norm": 1.65978646, "learning_rate": 4.669e-05, "token_acc": 0.75232102, "epoch": 0.66583229, "global_step/max_steps": "266/800", "percentage": "33.25%", "elapsed_time": "59m 29s", "remaining_time": "1h 59m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.419013} +{"loss": 0.9520123, "grad_norm": 3.97882175, "learning_rate": 4.663e-05, "token_acc": 0.72991874, "epoch": 0.66833542, "global_step/max_steps": "267/800", "percentage": "33.38%", "elapsed_time": "59m 41s", "remaining_time": "1h 59m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.411809} +{"loss": 0.84578794, "grad_norm": 2.35564208, "learning_rate": 4.657e-05, "token_acc": 0.75416394, "epoch": 0.67083855, "global_step/max_steps": "268/800", "percentage": "33.50%", "elapsed_time": "59m 50s", "remaining_time": "1h 58m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.394407} +{"loss": 0.8699308, "grad_norm": 5.18232489, "learning_rate": 4.651e-05, "token_acc": 0.74688774, "epoch": 0.67334168, "global_step/max_steps": "269/800", "percentage": "33.62%", "elapsed_time": "59m 60s", "remaining_time": "1h 58m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.382069} +{"loss": 0.83644849, "grad_norm": 4.2525897, "learning_rate": 4.644e-05, "token_acc": 0.75542151, "epoch": 0.67584481, "global_step/max_steps": "270/800", "percentage": "33.75%", "elapsed_time": "1h 0m 8s", "remaining_time": "1h 58m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.364798} +{"loss": 0.85688192, "grad_norm": 1.34157825, "learning_rate": 4.638e-05, "token_acc": 0.74853561, "epoch": 0.67834793, "global_step/max_steps": "271/800", "percentage": "33.88%", "elapsed_time": "1h 0m 36s", "remaining_time": "1h 58m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.416078} +{"loss": 0.87696528, "grad_norm": 1.70748436, "learning_rate": 4.632e-05, "token_acc": 0.74227307, "epoch": 0.68085106, "global_step/max_steps": "272/800", "percentage": "34.00%", "elapsed_time": "1h 0m 58s", "remaining_time": "1h 58m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.448302} +{"loss": 0.81925809, "grad_norm": 4.65158129, "learning_rate": 4.625e-05, "token_acc": 0.75772689, "epoch": 0.68335419, "global_step/max_steps": "273/800", "percentage": "34.12%", "elapsed_time": "1h 1m 7s", "remaining_time": "1h 57m 60s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.433822} +{"loss": 0.79103398, "grad_norm": 4.70614433, "learning_rate": 4.619e-05, "token_acc": 0.76480669, "epoch": 0.68585732, "global_step/max_steps": "274/800", "percentage": "34.25%", "elapsed_time": "1h 1m 19s", "remaining_time": "1h 57m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.426284} +{"loss": 0.82165247, "grad_norm": 2.02722168, "learning_rate": 4.612e-05, "token_acc": 0.75717581, "epoch": 0.68836045, "global_step/max_steps": "275/800", "percentage": "34.38%", "elapsed_time": "1h 1m 36s", "remaining_time": "1h 57m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.439001} +{"loss": 0.82513118, "grad_norm": 1.87871373, "learning_rate": 4.606e-05, "token_acc": 0.75462096, "epoch": 0.69086358, "global_step/max_steps": "276/800", "percentage": "34.50%", "elapsed_time": "1h 1m 49s", "remaining_time": "1h 57m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.436769} +{"loss": 0.91412783, "grad_norm": 1.87748587, "learning_rate": 4.599e-05, "token_acc": 0.73202734, "epoch": 0.69336671, "global_step/max_steps": "277/800", "percentage": "34.62%", "elapsed_time": "1h 2m 10s", "remaining_time": "1h 57m 23s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.466239} +{"loss": 0.86285913, "grad_norm": 3.58871746, "learning_rate": 4.592e-05, "token_acc": 0.74565605, "epoch": 0.69586984, "global_step/max_steps": "278/800", "percentage": "34.75%", "elapsed_time": "1h 2m 23s", "remaining_time": "1h 57m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.464068} +{"loss": 0.8396396, "grad_norm": 2.55524993, "learning_rate": 4.585e-05, "token_acc": 0.75325591, "epoch": 0.69837297, "global_step/max_steps": "279/800", "percentage": "34.88%", "elapsed_time": "1h 2m 41s", "remaining_time": "1h 57m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.481656} +{"loss": 0.78537315, "grad_norm": 2.45899773, "learning_rate": 4.579e-05, "token_acc": 0.76828454, "epoch": 0.7008761, "global_step/max_steps": "280/800", "percentage": "35.00%", "elapsed_time": "1h 2m 47s", "remaining_time": "1h 56m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.454387} +{"loss": 0.9314487, "grad_norm": 2.54550791, "learning_rate": 4.572e-05, "token_acc": 0.7245133, "epoch": 0.70337922, "global_step/max_steps": "281/800", "percentage": "35.12%", "elapsed_time": "1h 3m 6s", "remaining_time": "1h 56m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.473713} +{"loss": 0.85831845, "grad_norm": 2.68338037, "learning_rate": 4.565e-05, "token_acc": 0.74504827, "epoch": 0.70588235, "global_step/max_steps": "282/800", "percentage": "35.25%", "elapsed_time": "1h 3m 19s", "remaining_time": "1h 56m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.472714} +{"loss": 0.88944948, "grad_norm": 1.36334372, "learning_rate": 4.558e-05, "token_acc": 0.7390608, "epoch": 0.70838548, "global_step/max_steps": "283/800", "percentage": "35.38%", "elapsed_time": "1h 3m 34s", "remaining_time": "1h 56m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.478573} +{"loss": 0.73891586, "grad_norm": 4.6743021, "learning_rate": 4.551e-05, "token_acc": 0.78012538, "epoch": 0.71088861, "global_step/max_steps": "284/800", "percentage": "35.50%", "elapsed_time": "1h 3m 45s", "remaining_time": "1h 55m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.467878} +{"loss": 0.74301028, "grad_norm": 2.47754312, "learning_rate": 4.544e-05, "token_acc": 0.78665319, "epoch": 0.71339174, "global_step/max_steps": "285/800", "percentage": "35.62%", "elapsed_time": "1h 3m 55s", "remaining_time": "1h 55m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.454555} +{"loss": 0.73293197, "grad_norm": 2.01053047, "learning_rate": 4.537e-05, "token_acc": 0.78002262, "epoch": 0.71589487, "global_step/max_steps": "286/800", "percentage": "35.75%", "elapsed_time": "1h 4m 3s", "remaining_time": "1h 55m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.436785} +{"loss": 0.91504216, "grad_norm": 3.44942021, "learning_rate": 4.53e-05, "token_acc": 0.73550819, "epoch": 0.718398, "global_step/max_steps": "287/800", "percentage": "35.88%", "elapsed_time": "1h 4m 16s", "remaining_time": "1h 54m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.43429} +{"loss": 0.84557271, "grad_norm": 1.992558, "learning_rate": 4.523e-05, "token_acc": 0.7526455, "epoch": 0.72090113, "global_step/max_steps": "288/800", "percentage": "36.00%", "elapsed_time": "1h 4m 23s", "remaining_time": "1h 54m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.413104} +{"loss": 0.95017672, "grad_norm": 1.93978989, "learning_rate": 4.515e-05, "token_acc": 0.72748066, "epoch": 0.72340426, "global_step/max_steps": "289/800", "percentage": "36.12%", "elapsed_time": "1h 4m 36s", "remaining_time": "1h 54m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.41276} +{"loss": 0.82805628, "grad_norm": 1.32855594, "learning_rate": 4.508e-05, "token_acc": 0.75552418, "epoch": 0.72590738, "global_step/max_steps": "290/800", "percentage": "36.25%", "elapsed_time": "1h 4m 47s", "remaining_time": "1h 53m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.401918} +{"loss": 0.87749809, "grad_norm": 2.52778625, "learning_rate": 4.501e-05, "token_acc": 0.74894958, "epoch": 0.72841051, "global_step/max_steps": "291/800", "percentage": "36.38%", "elapsed_time": "1h 5m 9s", "remaining_time": "1h 53m 57s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.43211} +{"loss": 0.91482985, "grad_norm": 1.70167327, "learning_rate": 4.493e-05, "token_acc": 0.73510495, "epoch": 0.73091364, "global_step/max_steps": "292/800", "percentage": "36.50%", "elapsed_time": "1h 5m 33s", "remaining_time": "1h 54m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.467749} +{"loss": 0.80748171, "grad_norm": 4.40346098, "learning_rate": 4.486e-05, "token_acc": 0.75902219, "epoch": 0.73341677, "global_step/max_steps": "293/800", "percentage": "36.62%", "elapsed_time": "1h 5m 45s", "remaining_time": "1h 53m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.463291} +{"loss": 0.88939703, "grad_norm": 5.94038677, "learning_rate": 4.478e-05, "token_acc": 0.74319225, "epoch": 0.7359199, "global_step/max_steps": "294/800", "percentage": "36.75%", "elapsed_time": "1h 5m 57s", "remaining_time": "1h 53m 30s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.459128} +{"loss": 0.73818588, "grad_norm": 4.99241018, "learning_rate": 4.471e-05, "token_acc": 0.78533813, "epoch": 0.73842303, "global_step/max_steps": "295/800", "percentage": "36.88%", "elapsed_time": "1h 6m 7s", "remaining_time": "1h 53m 11s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.447152} +{"loss": 0.83836961, "grad_norm": 5.966537, "learning_rate": 4.463e-05, "token_acc": 0.75414862, "epoch": 0.74092616, "global_step/max_steps": "296/800", "percentage": "37.00%", "elapsed_time": "1h 6m 28s", "remaining_time": "1h 53m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.472626} +{"loss": 0.85037208, "grad_norm": 1.49419343, "learning_rate": 4.456e-05, "token_acc": 0.75418882, "epoch": 0.74342929, "global_step/max_steps": "297/800", "percentage": "37.12%", "elapsed_time": "1h 6m 38s", "remaining_time": "1h 52m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.459719} +{"loss": 0.75527465, "grad_norm": 4.08032608, "learning_rate": 4.448e-05, "token_acc": 0.77285448, "epoch": 0.74593242, "global_step/max_steps": "298/800", "percentage": "37.25%", "elapsed_time": "1h 6m 49s", "remaining_time": "1h 52m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.454039} +{"loss": 0.83086085, "grad_norm": 1.74645185, "learning_rate": 4.44e-05, "token_acc": 0.75773739, "epoch": 0.74843554, "global_step/max_steps": "299/800", "percentage": "37.38%", "elapsed_time": "1h 7m 1s", "remaining_time": "1h 52m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.449022} +{"loss": 0.84923762, "grad_norm": 2.63539171, "learning_rate": 4.433e-05, "token_acc": 0.75138987, "epoch": 0.75093867, "global_step/max_steps": "300/800", "percentage": "37.50%", "elapsed_time": "1h 7m 11s", "remaining_time": "1h 51m 58s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.435238} +{"loss": 0.91224116, "grad_norm": 5.34844065, "learning_rate": 4.425e-05, "token_acc": 0.72969642, "epoch": 0.7534418, "global_step/max_steps": "301/800", "percentage": "37.62%", "elapsed_time": "1h 7m 36s", "remaining_time": "1h 52m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.474155} +{"loss": 0.84768921, "grad_norm": 3.44739556, "learning_rate": 4.417e-05, "token_acc": 0.75419791, "epoch": 0.75594493, "global_step/max_steps": "302/800", "percentage": "37.75%", "elapsed_time": "1h 7m 47s", "remaining_time": "1h 51m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.467423} +{"loss": 0.88338685, "grad_norm": 1.60452175, "learning_rate": 4.409e-05, "token_acc": 0.73965421, "epoch": 0.75844806, "global_step/max_steps": "303/800", "percentage": "37.88%", "elapsed_time": "1h 7m 57s", "remaining_time": "1h 51m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.455033} +{"loss": 0.79987222, "grad_norm": 2.65738297, "learning_rate": 4.401e-05, "token_acc": 0.76614616, "epoch": 0.76095119, "global_step/max_steps": "304/800", "percentage": "38.00%", "elapsed_time": "1h 8m 9s", "remaining_time": "1h 51m 11s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.449429} +{"loss": 0.85302055, "grad_norm": 2.91249847, "learning_rate": 4.393e-05, "token_acc": 0.74660144, "epoch": 0.76345432, "global_step/max_steps": "305/800", "percentage": "38.12%", "elapsed_time": "1h 8m 19s", "remaining_time": "1h 50m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.440566} +{"loss": 0.80663186, "grad_norm": 13.43626785, "learning_rate": 4.385e-05, "token_acc": 0.76608359, "epoch": 0.76595745, "global_step/max_steps": "306/800", "percentage": "38.25%", "elapsed_time": "1h 8m 32s", "remaining_time": "1h 50m 38s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.436764} +{"loss": 0.83072513, "grad_norm": 4.74476862, "learning_rate": 4.377e-05, "token_acc": 0.75736713, "epoch": 0.76846058, "global_step/max_steps": "307/800", "percentage": "38.38%", "elapsed_time": "1h 8m 42s", "remaining_time": "1h 50m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.42515} +{"loss": 0.7642802, "grad_norm": 2.38670015, "learning_rate": 4.369e-05, "token_acc": 0.77651663, "epoch": 0.7709637, "global_step/max_steps": "308/800", "percentage": "38.50%", "elapsed_time": "1h 8m 54s", "remaining_time": "1h 50m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.420546} +{"loss": 0.85670441, "grad_norm": 1.74102592, "learning_rate": 4.361e-05, "token_acc": 0.7521028, "epoch": 0.77346683, "global_step/max_steps": "309/800", "percentage": "38.62%", "elapsed_time": "1h 9m 7s", "remaining_time": "1h 49m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.419979} +{"loss": 0.92232364, "grad_norm": 4.30787516, "learning_rate": 4.352e-05, "token_acc": 0.72925165, "epoch": 0.77596996, "global_step/max_steps": "310/800", "percentage": "38.75%", "elapsed_time": "1h 9m 27s", "remaining_time": "1h 49m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.443481} +{"loss": 0.68510264, "grad_norm": 3.76609421, "learning_rate": 4.344e-05, "token_acc": 0.7947743, "epoch": 0.77847309, "global_step/max_steps": "311/800", "percentage": "38.88%", "elapsed_time": "1h 9m 46s", "remaining_time": "1h 49m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.459246} +{"loss": 0.79406196, "grad_norm": 1.5777055, "learning_rate": 4.336e-05, "token_acc": 0.76736735, "epoch": 0.78097622, "global_step/max_steps": "312/800", "percentage": "39.00%", "elapsed_time": "1h 9m 56s", "remaining_time": "1h 49m 23s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.448666} +{"loss": 0.73586571, "grad_norm": 4.04773235, "learning_rate": 4.327e-05, "token_acc": 0.782784, "epoch": 0.78347935, "global_step/max_steps": "313/800", "percentage": "39.12%", "elapsed_time": "1h 10m 9s", "remaining_time": "1h 49m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.44766} +{"loss": 0.86651689, "grad_norm": 1.35101509, "learning_rate": 4.319e-05, "token_acc": 0.74425312, "epoch": 0.78598248, "global_step/max_steps": "314/800", "percentage": "39.25%", "elapsed_time": "1h 10m 30s", "remaining_time": "1h 49m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.472583} +{"loss": 0.79964435, "grad_norm": 2.99238706, "learning_rate": 4.311e-05, "token_acc": 0.7625913, "epoch": 0.78848561, "global_step/max_steps": "315/800", "percentage": "39.38%", "elapsed_time": "1h 10m 40s", "remaining_time": "1h 48m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.460484} +{"loss": 0.8834421, "grad_norm": 1.58944499, "learning_rate": 4.302e-05, "token_acc": 0.74166103, "epoch": 0.79098874, "global_step/max_steps": "316/800", "percentage": "39.50%", "elapsed_time": "1h 10m 55s", "remaining_time": "1h 48m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.464747} +{"loss": 0.84212089, "grad_norm": 3.18434834, "learning_rate": 4.294e-05, "token_acc": 0.74792505, "epoch": 0.79349186, "global_step/max_steps": "317/800", "percentage": "39.62%", "elapsed_time": "1h 11m 15s", "remaining_time": "1h 48m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.485518} +{"loss": 0.9776566, "grad_norm": 1.85402691, "learning_rate": 4.285e-05, "token_acc": 0.71956188, "epoch": 0.79599499, "global_step/max_steps": "318/800", "percentage": "39.75%", "elapsed_time": "1h 11m 30s", "remaining_time": "1h 48m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.489499} +{"loss": 0.80313611, "grad_norm": 2.93341374, "learning_rate": 4.276e-05, "token_acc": 0.76042282, "epoch": 0.79849812, "global_step/max_steps": "319/800", "percentage": "39.88%", "elapsed_time": "1h 11m 45s", "remaining_time": "1h 48m 12s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.496112} +{"loss": 0.9410305, "grad_norm": 1.69153214, "learning_rate": 4.268e-05, "token_acc": 0.72829942, "epoch": 0.80100125, "global_step/max_steps": "320/800", "percentage": "40.00%", "elapsed_time": "1h 11m 60s", "remaining_time": "1h 47m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.498858} +{"loss": 0.90051496, "grad_norm": 5.01201057, "learning_rate": 4.259e-05, "token_acc": 0.73763416, "epoch": 0.80350438, "global_step/max_steps": "321/800", "percentage": "40.12%", "elapsed_time": "1h 12m 25s", "remaining_time": "1h 48m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.534966} +{"loss": 0.74519438, "grad_norm": 1.68102801, "learning_rate": 4.25e-05, "token_acc": 0.78101072, "epoch": 0.80600751, "global_step/max_steps": "322/800", "percentage": "40.25%", "elapsed_time": "1h 12m 34s", "remaining_time": "1h 47m 44s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.522286} +{"loss": 0.74011576, "grad_norm": 5.86810827, "learning_rate": 4.242e-05, "token_acc": 0.78346018, "epoch": 0.80851064, "global_step/max_steps": "323/800", "percentage": "40.38%", "elapsed_time": "1h 12m 42s", "remaining_time": "1h 47m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.503297} +{"loss": 0.91649395, "grad_norm": 1.27618766, "learning_rate": 4.233e-05, "token_acc": 0.72851488, "epoch": 0.81101377, "global_step/max_steps": "324/800", "percentage": "40.50%", "elapsed_time": "1h 12m 56s", "remaining_time": "1h 47m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.504975} +{"loss": 0.76630414, "grad_norm": 2.35604715, "learning_rate": 4.224e-05, "token_acc": 0.77388412, "epoch": 0.8135169, "global_step/max_steps": "325/800", "percentage": "40.62%", "elapsed_time": "1h 13m 5s", "remaining_time": "1h 46m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.492669} +{"loss": 0.63570404, "grad_norm": 3.65257716, "learning_rate": 4.215e-05, "token_acc": 0.80933544, "epoch": 0.81602003, "global_step/max_steps": "326/800", "percentage": "40.75%", "elapsed_time": "1h 13m 12s", "remaining_time": "1h 46m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.473091} +{"loss": 0.96204519, "grad_norm": 1.95454133, "learning_rate": 4.206e-05, "token_acc": 0.72031169, "epoch": 0.81852315, "global_step/max_steps": "327/800", "percentage": "40.88%", "elapsed_time": "1h 13m 26s", "remaining_time": "1h 46m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.47496} +{"loss": 0.81113648, "grad_norm": 2.91371727, "learning_rate": 4.197e-05, "token_acc": 0.75743936, "epoch": 0.82102628, "global_step/max_steps": "328/800", "percentage": "41.00%", "elapsed_time": "1h 13m 41s", "remaining_time": "1h 46m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.478772} +{"loss": 0.9955107, "grad_norm": 1.98584783, "learning_rate": 4.188e-05, "token_acc": 0.71284125, "epoch": 0.82352941, "global_step/max_steps": "329/800", "percentage": "41.12%", "elapsed_time": "1h 13m 60s", "remaining_time": "1h 45m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.495105} +{"loss": 0.74811184, "grad_norm": 6.0507369, "learning_rate": 4.179e-05, "token_acc": 0.78254649, "epoch": 0.82603254, "global_step/max_steps": "330/800", "percentage": "41.25%", "elapsed_time": "1h 14m 10s", "remaining_time": "1h 45m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.483834} +{"loss": 0.68728805, "grad_norm": 1.82671368, "learning_rate": 4.17e-05, "token_acc": 0.79731933, "epoch": 0.82853567, "global_step/max_steps": "331/800", "percentage": "41.38%", "elapsed_time": "1h 14m 30s", "remaining_time": "1h 45m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.505518} +{"loss": 0.79945874, "grad_norm": 2.26364255, "learning_rate": 4.161e-05, "token_acc": 0.76589874, "epoch": 0.8310388, "global_step/max_steps": "332/800", "percentage": "41.50%", "elapsed_time": "1h 14m 46s", "remaining_time": "1h 45m 24s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.512239} +{"loss": 0.73542249, "grad_norm": 3.75482583, "learning_rate": 4.151e-05, "token_acc": 0.78248894, "epoch": 0.83354193, "global_step/max_steps": "333/800", "percentage": "41.62%", "elapsed_time": "1h 14m 54s", "remaining_time": "1h 45m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.49606} +{"loss": 0.89589518, "grad_norm": 2.39767766, "learning_rate": 4.142e-05, "token_acc": 0.74028594, "epoch": 0.83604506, "global_step/max_steps": "334/800", "percentage": "41.75%", "elapsed_time": "1h 15m 4s", "remaining_time": "1h 44m 44s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.485682} +{"loss": 0.88914692, "grad_norm": 1.59321678, "learning_rate": 4.133e-05, "token_acc": 0.74632725, "epoch": 0.83854819, "global_step/max_steps": "335/800", "percentage": "41.88%", "elapsed_time": "1h 15m 14s", "remaining_time": "1h 44m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.475267} +{"loss": 0.75462437, "grad_norm": 1.8860997, "learning_rate": 4.124e-05, "token_acc": 0.77550378, "epoch": 0.84105131, "global_step/max_steps": "336/800", "percentage": "42.00%", "elapsed_time": "1h 15m 23s", "remaining_time": "1h 44m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.460347} +{"loss": 0.83469701, "grad_norm": 3.2070868, "learning_rate": 4.114e-05, "token_acc": 0.75539811, "epoch": 0.84355444, "global_step/max_steps": "337/800", "percentage": "42.12%", "elapsed_time": "1h 15m 36s", "remaining_time": "1h 43m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.460093} +{"loss": 0.82803726, "grad_norm": 1.91749918, "learning_rate": 4.105e-05, "token_acc": 0.76148954, "epoch": 0.84605757, "global_step/max_steps": "338/800", "percentage": "42.25%", "elapsed_time": "1h 15m 48s", "remaining_time": "1h 43m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.455482} +{"loss": 0.64120197, "grad_norm": 7.96759272, "learning_rate": 4.095e-05, "token_acc": 0.81358947, "epoch": 0.8485607, "global_step/max_steps": "339/800", "percentage": "42.38%", "elapsed_time": "1h 15m 56s", "remaining_time": "1h 43m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.440425} +{"loss": 0.74114764, "grad_norm": 1.81680369, "learning_rate": 4.086e-05, "token_acc": 0.78188171, "epoch": 0.85106383, "global_step/max_steps": "340/800", "percentage": "42.50%", "elapsed_time": "1h 16m 4s", "remaining_time": "1h 42m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.424324} +{"loss": 0.82665002, "grad_norm": 5.33744812, "learning_rate": 4.076e-05, "token_acc": 0.75576824, "epoch": 0.85356696, "global_step/max_steps": "341/800", "percentage": "42.62%", "elapsed_time": "1h 16m 29s", "remaining_time": "1h 42m 57s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.45766} +{"loss": 0.70552397, "grad_norm": 6.36159039, "learning_rate": 4.067e-05, "token_acc": 0.78373236, "epoch": 0.85607009, "global_step/max_steps": "342/800", "percentage": "42.75%", "elapsed_time": "1h 16m 40s", "remaining_time": "1h 42m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.448877} +{"loss": 0.83331716, "grad_norm": 4.52988005, "learning_rate": 4.057e-05, "token_acc": 0.75459289, "epoch": 0.85857322, "global_step/max_steps": "343/800", "percentage": "42.88%", "elapsed_time": "1h 16m 48s", "remaining_time": "1h 42m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.435306} +{"loss": 0.87671727, "grad_norm": 7.68586159, "learning_rate": 4.048e-05, "token_acc": 0.74424057, "epoch": 0.86107635, "global_step/max_steps": "344/800", "percentage": "43.00%", "elapsed_time": "1h 17m 1s", "remaining_time": "1h 42m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.433552} +{"loss": 0.85832405, "grad_norm": 3.97263217, "learning_rate": 4.038e-05, "token_acc": 0.74891555, "epoch": 0.86357947, "global_step/max_steps": "345/800", "percentage": "43.12%", "elapsed_time": "1h 17m 17s", "remaining_time": "1h 41m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.439182} +{"loss": 0.75886011, "grad_norm": 1.5814538, "learning_rate": 4.028e-05, "token_acc": 0.7785957, "epoch": 0.8660826, "global_step/max_steps": "346/800", "percentage": "43.25%", "elapsed_time": "1h 17m 26s", "remaining_time": "1h 41m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.429025} +{"loss": 0.82370138, "grad_norm": 3.04929614, "learning_rate": 4.019e-05, "token_acc": 0.75800333, "epoch": 0.86858573, "global_step/max_steps": "347/800", "percentage": "43.38%", "elapsed_time": "1h 17m 38s", "remaining_time": "1h 41m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.424665} +{"loss": 0.71487093, "grad_norm": 1.49065709, "learning_rate": 4.009e-05, "token_acc": 0.78662511, "epoch": 0.87108886, "global_step/max_steps": "348/800", "percentage": "43.50%", "elapsed_time": "1h 17m 45s", "remaining_time": "1h 40m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.405687} +{"loss": 0.89053333, "grad_norm": 2.6047554, "learning_rate": 3.999e-05, "token_acc": 0.74059125, "epoch": 0.87359199, "global_step/max_steps": "349/800", "percentage": "43.62%", "elapsed_time": "1h 17m 58s", "remaining_time": "1h 40m 45s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.402853} +{"loss": 0.91948968, "grad_norm": 9.4514389, "learning_rate": 3.989e-05, "token_acc": 0.73178463, "epoch": 0.87609512, "global_step/max_steps": "350/800", "percentage": "43.75%", "elapsed_time": "1h 18m 14s", "remaining_time": "1h 40m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.410362} +{"loss": 0.92224932, "grad_norm": 1.62831771, "learning_rate": 3.979e-05, "token_acc": 0.73243632, "epoch": 0.87859825, "global_step/max_steps": "351/800", "percentage": "43.88%", "elapsed_time": "1h 18m 37s", "remaining_time": "1h 40m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.439847} +{"loss": 0.88733155, "grad_norm": 1.01435125, "learning_rate": 3.969e-05, "token_acc": 0.73869217, "epoch": 0.88110138, "global_step/max_steps": "352/800", "percentage": "44.00%", "elapsed_time": "1h 18m 49s", "remaining_time": "1h 40m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.434348} +{"loss": 0.8865751, "grad_norm": 1.607059, "learning_rate": 3.96e-05, "token_acc": 0.73502833, "epoch": 0.88360451, "global_step/max_steps": "353/800", "percentage": "44.12%", "elapsed_time": "1h 19m 6s", "remaining_time": "1h 40m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.445451} +{"loss": 0.86198044, "grad_norm": 2.51214433, "learning_rate": 3.95e-05, "token_acc": 0.74793024, "epoch": 0.88610763, "global_step/max_steps": "354/800", "percentage": "44.25%", "elapsed_time": "1h 19m 23s", "remaining_time": "1h 40m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.453581} +{"loss": 0.93147933, "grad_norm": 1.38358355, "learning_rate": 3.94e-05, "token_acc": 0.72631231, "epoch": 0.88861076, "global_step/max_steps": "355/800", "percentage": "44.38%", "elapsed_time": "1h 19m 36s", "remaining_time": "1h 39m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.453547} +{"loss": 0.89912051, "grad_norm": 2.48613119, "learning_rate": 3.929e-05, "token_acc": 0.73958813, "epoch": 0.89111389, "global_step/max_steps": "356/800", "percentage": "44.50%", "elapsed_time": "1h 19m 47s", "remaining_time": "1h 39m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.447433} +{"loss": 0.85449541, "grad_norm": 2.70081806, "learning_rate": 3.919e-05, "token_acc": 0.75055124, "epoch": 0.89361702, "global_step/max_steps": "357/800", "percentage": "44.62%", "elapsed_time": "1h 19m 57s", "remaining_time": "1h 39m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.436848} +{"loss": 0.75139415, "grad_norm": 2.08654523, "learning_rate": 3.909e-05, "token_acc": 0.78198882, "epoch": 0.89612015, "global_step/max_steps": "358/800", "percentage": "44.75%", "elapsed_time": "1h 20m 8s", "remaining_time": "1h 38m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.430556} +{"loss": 0.76085025, "grad_norm": 1.97564769, "learning_rate": 3.899e-05, "token_acc": 0.77296419, "epoch": 0.89862328, "global_step/max_steps": "359/800", "percentage": "44.88%", "elapsed_time": "1h 20m 17s", "remaining_time": "1h 38m 38s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.418594} +{"loss": 0.84179592, "grad_norm": 1.37554252, "learning_rate": 3.889e-05, "token_acc": 0.75207857, "epoch": 0.90112641, "global_step/max_steps": "360/800", "percentage": "45.00%", "elapsed_time": "1h 20m 33s", "remaining_time": "1h 38m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.425137} +{"loss": 0.85189164, "grad_norm": 2.14075541, "learning_rate": 3.879e-05, "token_acc": 0.75523948, "epoch": 0.90362954, "global_step/max_steps": "361/800", "percentage": "45.12%", "elapsed_time": "1h 20m 58s", "remaining_time": "1h 38m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.456515} +{"loss": 0.8237797, "grad_norm": 4.228549, "learning_rate": 3.868e-05, "token_acc": 0.75324201, "epoch": 0.90613267, "global_step/max_steps": "362/800", "percentage": "45.25%", "elapsed_time": "1h 21m 12s", "remaining_time": "1h 38m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.458911} +{"loss": 0.76939011, "grad_norm": 2.09051704, "learning_rate": 3.858e-05, "token_acc": 0.7751345, "epoch": 0.90863579, "global_step/max_steps": "363/800", "percentage": "45.38%", "elapsed_time": "1h 21m 21s", "remaining_time": "1h 37m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.447194} +{"loss": 0.69501877, "grad_norm": 2.47479153, "learning_rate": 3.848e-05, "token_acc": 0.78746529, "epoch": 0.91113892, "global_step/max_steps": "364/800", "percentage": "45.50%", "elapsed_time": "1h 21m 36s", "remaining_time": "1h 37m 45s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.451293} +{"loss": 0.83487642, "grad_norm": 1.81355965, "learning_rate": 3.837e-05, "token_acc": 0.75038486, "epoch": 0.91364205, "global_step/max_steps": "365/800", "percentage": "45.62%", "elapsed_time": "1h 21m 53s", "remaining_time": "1h 37m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.461166} +{"loss": 0.80919057, "grad_norm": 1.95852149, "learning_rate": 3.827e-05, "token_acc": 0.75660131, "epoch": 0.91614518, "global_step/max_steps": "366/800", "percentage": "45.75%", "elapsed_time": "1h 22m 5s", "remaining_time": "1h 37m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.455933} +{"loss": 0.86592245, "grad_norm": 1.58728147, "learning_rate": 3.817e-05, "token_acc": 0.74584953, "epoch": 0.91864831, "global_step/max_steps": "367/800", "percentage": "45.88%", "elapsed_time": "1h 22m 15s", "remaining_time": "1h 37m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.446697} +{"loss": 0.68587744, "grad_norm": 3.79918313, "learning_rate": 3.806e-05, "token_acc": 0.79218346, "epoch": 0.92115144, "global_step/max_steps": "368/800", "percentage": "46.00%", "elapsed_time": "1h 22m 25s", "remaining_time": "1h 36m 45s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.436854} +{"loss": 0.92422253, "grad_norm": 11.75909519, "learning_rate": 3.796e-05, "token_acc": 0.72717169, "epoch": 0.92365457, "global_step/max_steps": "369/800", "percentage": "46.12%", "elapsed_time": "1h 22m 42s", "remaining_time": "1h 36m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.447265} +{"loss": 0.7550444, "grad_norm": 5.7952795, "learning_rate": 3.785e-05, "token_acc": 0.77398549, "epoch": 0.9261577, "global_step/max_steps": "370/800", "percentage": "46.25%", "elapsed_time": "1h 22m 52s", "remaining_time": "1h 36m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.439159} +{"loss": 0.84272313, "grad_norm": 2.19318438, "learning_rate": 3.775e-05, "token_acc": 0.74996199, "epoch": 0.92866083, "global_step/max_steps": "371/800", "percentage": "46.38%", "elapsed_time": "1h 23m 17s", "remaining_time": "1h 36m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.469858} +{"loss": 0.91255569, "grad_norm": 1.16040921, "learning_rate": 3.764e-05, "token_acc": 0.72754958, "epoch": 0.93116395, "global_step/max_steps": "372/800", "percentage": "46.50%", "elapsed_time": "1h 23m 40s", "remaining_time": "1h 36m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.495686} +{"loss": 0.815745, "grad_norm": 8.95574284, "learning_rate": 3.754e-05, "token_acc": 0.76045725, "epoch": 0.93366708, "global_step/max_steps": "373/800", "percentage": "46.62%", "elapsed_time": "1h 23m 54s", "remaining_time": "1h 36m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.495646} +{"loss": 0.91262269, "grad_norm": 6.91131163, "learning_rate": 3.743e-05, "token_acc": 0.73177513, "epoch": 0.93617021, "global_step/max_steps": "374/800", "percentage": "46.75%", "elapsed_time": "1h 24m 11s", "remaining_time": "1h 35m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.504305} +{"loss": 0.85905772, "grad_norm": 1.09746993, "learning_rate": 3.732e-05, "token_acc": 0.74667988, "epoch": 0.93867334, "global_step/max_steps": "375/800", "percentage": "46.88%", "elapsed_time": "1h 24m 21s", "remaining_time": "1h 35m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.496997} +{"loss": 0.8356927, "grad_norm": 17.13771629, "learning_rate": 3.722e-05, "token_acc": 0.7555617, "epoch": 0.94117647, "global_step/max_steps": "376/800", "percentage": "47.00%", "elapsed_time": "1h 24m 39s", "remaining_time": "1h 35m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.507579} +{"loss": 0.75977826, "grad_norm": 1.25354254, "learning_rate": 3.711e-05, "token_acc": 0.76815558, "epoch": 0.9436796, "global_step/max_steps": "377/800", "percentage": "47.12%", "elapsed_time": "1h 24m 47s", "remaining_time": "1h 35m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.49386} +{"loss": 0.72761595, "grad_norm": 2.29099703, "learning_rate": 3.7e-05, "token_acc": 0.78269471, "epoch": 0.94618273, "global_step/max_steps": "378/800", "percentage": "47.25%", "elapsed_time": "1h 24m 56s", "remaining_time": "1h 34m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.482344} +{"loss": 0.98148286, "grad_norm": 2.58450532, "learning_rate": 3.689e-05, "token_acc": 0.71607174, "epoch": 0.94868586, "global_step/max_steps": "379/800", "percentage": "47.38%", "elapsed_time": "1h 25m 11s", "remaining_time": "1h 34m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.484912} +{"loss": 0.82746136, "grad_norm": 1.32258427, "learning_rate": 3.678e-05, "token_acc": 0.75447847, "epoch": 0.95118899, "global_step/max_steps": "380/800", "percentage": "47.50%", "elapsed_time": "1h 25m 21s", "remaining_time": "1h 34m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.477017} +{"loss": 0.83840537, "grad_norm": 3.45678782, "learning_rate": 3.668e-05, "token_acc": 0.75186069, "epoch": 0.95369212, "global_step/max_steps": "381/800", "percentage": "47.62%", "elapsed_time": "1h 25m 45s", "remaining_time": "1h 34m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.505157} +{"loss": 0.74670863, "grad_norm": 3.50693631, "learning_rate": 3.657e-05, "token_acc": 0.77843898, "epoch": 0.95619524, "global_step/max_steps": "382/800", "percentage": "47.75%", "elapsed_time": "1h 25m 57s", "remaining_time": "1h 34m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.499227} +{"loss": 0.75563216, "grad_norm": 1349.64501953, "learning_rate": 3.646e-05, "token_acc": 0.77523178, "epoch": 0.95869837, "global_step/max_steps": "383/800", "percentage": "47.88%", "elapsed_time": "1h 26m 11s", "remaining_time": "1h 33m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.500387} +{"loss": 0.62118936, "grad_norm": 2.67090607, "learning_rate": 3.635e-05, "token_acc": 0.81251341, "epoch": 0.9612015, "global_step/max_steps": "384/800", "percentage": "48.00%", "elapsed_time": "1h 26m 20s", "remaining_time": "1h 33m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.489706} +{"loss": 0.80589128, "grad_norm": 1.68581212, "learning_rate": 3.624e-05, "token_acc": 0.76283937, "epoch": 0.96370463, "global_step/max_steps": "385/800", "percentage": "48.12%", "elapsed_time": "1h 26m 34s", "remaining_time": "1h 33m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.492171} +{"loss": 0.84316015, "grad_norm": 1.21934843, "learning_rate": 3.613e-05, "token_acc": 0.74872292, "epoch": 0.96620776, "global_step/max_steps": "386/800", "percentage": "48.25%", "elapsed_time": "1h 26m 51s", "remaining_time": "1h 33m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.499325} +{"loss": 0.90824831, "grad_norm": 1.44098997, "learning_rate": 3.602e-05, "token_acc": 0.72997994, "epoch": 0.96871089, "global_step/max_steps": "387/800", "percentage": "48.38%", "elapsed_time": "1h 27m 5s", "remaining_time": "1h 32m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.501308} +{"loss": 0.76654959, "grad_norm": 1.59665024, "learning_rate": 3.591e-05, "token_acc": 0.77126966, "epoch": 0.97121402, "global_step/max_steps": "388/800", "percentage": "48.50%", "elapsed_time": "1h 27m 14s", "remaining_time": "1h 32m 38s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.489107} +{"loss": 0.92873502, "grad_norm": 1.08586073, "learning_rate": 3.58e-05, "token_acc": 0.72777778, "epoch": 0.97371715, "global_step/max_steps": "389/800", "percentage": "48.62%", "elapsed_time": "1h 27m 28s", "remaining_time": "1h 32m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.490468} +{"loss": 0.66901815, "grad_norm": 14.89703655, "learning_rate": 3.569e-05, "token_acc": 0.80040538, "epoch": 0.97622028, "global_step/max_steps": "390/800", "percentage": "48.75%", "elapsed_time": "1h 27m 34s", "remaining_time": "1h 32m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.470945} +{"loss": 0.81375062, "grad_norm": 5.16967773, "learning_rate": 3.558e-05, "token_acc": 0.75899141, "epoch": 0.9787234, "global_step/max_steps": "391/800", "percentage": "48.88%", "elapsed_time": "1h 27m 54s", "remaining_time": "1h 31m 57s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.488268} +{"loss": 0.78188097, "grad_norm": 1.06523025, "learning_rate": 3.547e-05, "token_acc": 0.76464313, "epoch": 0.98122653, "global_step/max_steps": "392/800", "percentage": "49.00%", "elapsed_time": "1h 28m 6s", "remaining_time": "1h 31m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.484703} +{"loss": 0.79052043, "grad_norm": 3.25233436, "learning_rate": 3.535e-05, "token_acc": 0.76656713, "epoch": 0.98372966, "global_step/max_steps": "393/800", "percentage": "49.12%", "elapsed_time": "1h 28m 16s", "remaining_time": "1h 31m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.47641} +{"loss": 0.73433006, "grad_norm": 1.99485648, "learning_rate": 3.524e-05, "token_acc": 0.78018441, "epoch": 0.98623279, "global_step/max_steps": "394/800", "percentage": "49.25%", "elapsed_time": "1h 28m 23s", "remaining_time": "1h 31m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.459388} +{"loss": 0.82387245, "grad_norm": 8.77963161, "learning_rate": 3.513e-05, "token_acc": 0.75624818, "epoch": 0.98873592, "global_step/max_steps": "395/800", "percentage": "49.38%", "elapsed_time": "1h 28m 31s", "remaining_time": "1h 30m 45s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.445482} +{"loss": 0.73537219, "grad_norm": 3.08454847, "learning_rate": 3.502e-05, "token_acc": 0.78060989, "epoch": 0.99123905, "global_step/max_steps": "396/800", "percentage": "49.50%", "elapsed_time": "1h 28m 42s", "remaining_time": "1h 30m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.43912} +{"loss": 0.76336873, "grad_norm": 1.44574201, "learning_rate": 3.491e-05, "token_acc": 0.77628401, "epoch": 0.99374218, "global_step/max_steps": "397/800", "percentage": "49.62%", "elapsed_time": "1h 28m 51s", "remaining_time": "1h 30m 12s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.42824} +{"loss": 0.71441472, "grad_norm": 3.58688498, "learning_rate": 3.479e-05, "token_acc": 0.78912003, "epoch": 0.99624531, "global_step/max_steps": "398/800", "percentage": "49.75%", "elapsed_time": "1h 28m 58s", "remaining_time": "1h 29m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.412702} +{"loss": 0.85802817, "grad_norm": 2.74013615, "learning_rate": 3.468e-05, "token_acc": 0.74885219, "epoch": 0.99874844, "global_step/max_steps": "399/800", "percentage": "49.88%", "elapsed_time": "1h 29m 13s", "remaining_time": "1h 29m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.417239} +{"loss": 0.74650002, "grad_norm": 2.77896762, "learning_rate": 3.457e-05, "token_acc": 0.77480261, "epoch": 1.0, "global_step/max_steps": "400/800", "percentage": "50.00%", "elapsed_time": "1h 29m 18s", "remaining_time": "1h 29m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.39533} +{"loss": 0.748245, "grad_norm": 2.50830936, "learning_rate": 3.445e-05, "token_acc": 0.77566807, "epoch": 1.00250313, "global_step/max_steps": "401/800", "percentage": "50.12%", "elapsed_time": "1h 29m 41s", "remaining_time": "1h 29m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.417921} +{"loss": 0.85127968, "grad_norm": 1.53045475, "learning_rate": 3.434e-05, "token_acc": 0.74668147, "epoch": 1.00500626, "global_step/max_steps": "402/800", "percentage": "50.25%", "elapsed_time": "1h 29m 53s", "remaining_time": "1h 28m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.414763} +{"loss": 0.74841207, "grad_norm": 3.55746031, "learning_rate": 3.423e-05, "token_acc": 0.775392, "epoch": 1.00750939, "global_step/max_steps": "403/800", "percentage": "50.38%", "elapsed_time": "1h 30m 4s", "remaining_time": "1h 28m 44s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.410158} +{"loss": 0.63994658, "grad_norm": 5.36784458, "learning_rate": 3.411e-05, "token_acc": 0.80641219, "epoch": 1.01001252, "global_step/max_steps": "404/800", "percentage": "50.50%", "elapsed_time": "1h 30m 12s", "remaining_time": "1h 28m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.39579} +{"loss": 0.75721157, "grad_norm": 2.30979133, "learning_rate": 3.4e-05, "token_acc": 0.77821136, "epoch": 1.01251564, "global_step/max_steps": "405/800", "percentage": "50.62%", "elapsed_time": "1h 30m 21s", "remaining_time": "1h 28m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.386305} +{"loss": 0.79999435, "grad_norm": 10.43783951, "learning_rate": 3.388e-05, "token_acc": 0.7620248, "epoch": 1.01501877, "global_step/max_steps": "406/800", "percentage": "50.75%", "elapsed_time": "1h 30m 34s", "remaining_time": "1h 27m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.383731} +{"loss": 0.80646479, "grad_norm": 4.30499077, "learning_rate": 3.377e-05, "token_acc": 0.76394285, "epoch": 1.0175219, "global_step/max_steps": "407/800", "percentage": "50.88%", "elapsed_time": "1h 30m 43s", "remaining_time": "1h 27m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.373685} +{"loss": 0.83839494, "grad_norm": 1.38059366, "learning_rate": 3.365e-05, "token_acc": 0.7478151, "epoch": 1.02002503, "global_step/max_steps": "408/800", "percentage": "51.00%", "elapsed_time": "1h 30m 55s", "remaining_time": "1h 27m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.370924} +{"loss": 0.69695193, "grad_norm": 2.67761588, "learning_rate": 3.354e-05, "token_acc": 0.79091628, "epoch": 1.02252816, "global_step/max_steps": "409/800", "percentage": "51.12%", "elapsed_time": "1h 31m 3s", "remaining_time": "1h 27m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.357215} +{"loss": 0.94843984, "grad_norm": 1.18129766, "learning_rate": 3.342e-05, "token_acc": 0.72652092, "epoch": 1.02503129, "global_step/max_steps": "410/800", "percentage": "51.25%", "elapsed_time": "1h 31m 20s", "remaining_time": "1h 26m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.366664} +{"loss": 0.74561888, "grad_norm": 7.37838411, "learning_rate": 3.331e-05, "token_acc": 0.7744973, "epoch": 1.02753442, "global_step/max_steps": "411/800", "percentage": "51.38%", "elapsed_time": "1h 31m 42s", "remaining_time": "1h 26m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.386429} +{"loss": 0.88645089, "grad_norm": 2.92426467, "learning_rate": 3.319e-05, "token_acc": 0.73768947, "epoch": 1.03003755, "global_step/max_steps": "412/800", "percentage": "51.50%", "elapsed_time": "1h 31m 57s", "remaining_time": "1h 26m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.391564} +{"loss": 0.64193839, "grad_norm": 2.46436501, "learning_rate": 3.307e-05, "token_acc": 0.8134544, "epoch": 1.03254068, "global_step/max_steps": "413/800", "percentage": "51.62%", "elapsed_time": "1h 32m 6s", "remaining_time": "1h 26m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.379621} +{"loss": 0.75857723, "grad_norm": 5.19207001, "learning_rate": 3.296e-05, "token_acc": 0.77643675, "epoch": 1.0350438, "global_step/max_steps": "414/800", "percentage": "51.75%", "elapsed_time": "1h 32m 18s", "remaining_time": "1h 26m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.376003} +{"loss": 0.85545242, "grad_norm": 2.14680767, "learning_rate": 3.284e-05, "token_acc": 0.7464255, "epoch": 1.03754693, "global_step/max_steps": "415/800", "percentage": "51.88%", "elapsed_time": "1h 32m 33s", "remaining_time": "1h 25m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.381289} +{"loss": 0.81972045, "grad_norm": 1.83839166, "learning_rate": 3.273e-05, "token_acc": 0.75651497, "epoch": 1.04005006, "global_step/max_steps": "416/800", "percentage": "52.00%", "elapsed_time": "1h 32m 44s", "remaining_time": "1h 25m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.374549} +{"loss": 0.87279087, "grad_norm": 1.13025987, "learning_rate": 3.261e-05, "token_acc": 0.74238969, "epoch": 1.04255319, "global_step/max_steps": "417/800", "percentage": "52.12%", "elapsed_time": "1h 32m 54s", "remaining_time": "1h 25m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367938} +{"loss": 0.83485889, "grad_norm": 1.26455986, "learning_rate": 3.249e-05, "token_acc": 0.75068607, "epoch": 1.04505632, "global_step/max_steps": "418/800", "percentage": "52.25%", "elapsed_time": "1h 33m 12s", "remaining_time": "1h 25m 11s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.378814} +{"loss": 0.67387694, "grad_norm": 3.13670158, "learning_rate": 3.237e-05, "token_acc": 0.79343647, "epoch": 1.04755945, "global_step/max_steps": "419/800", "percentage": "52.38%", "elapsed_time": "1h 33m 19s", "remaining_time": "1h 24m 51s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363472} +{"loss": 0.62468719, "grad_norm": 10.95198345, "learning_rate": 3.226e-05, "token_acc": 0.80662683, "epoch": 1.05006258, "global_step/max_steps": "420/800", "percentage": "52.50%", "elapsed_time": "1h 33m 27s", "remaining_time": "1h 24m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.349895} +{"loss": 0.81844079, "grad_norm": 3.36165619, "learning_rate": 3.214e-05, "token_acc": 0.75843318, "epoch": 1.05256571, "global_step/max_steps": "421/800", "percentage": "52.62%", "elapsed_time": "1h 33m 57s", "remaining_time": "1h 24m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.390145} +{"loss": 0.80761397, "grad_norm": 1.62677062, "learning_rate": 3.202e-05, "token_acc": 0.75787922, "epoch": 1.05506884, "global_step/max_steps": "422/800", "percentage": "52.75%", "elapsed_time": "1h 34m 6s", "remaining_time": "1h 24m 18s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.38006} +{"loss": 0.69643253, "grad_norm": 2.60752988, "learning_rate": 3.19e-05, "token_acc": 0.79242438, "epoch": 1.05757196, "global_step/max_steps": "423/800", "percentage": "52.88%", "elapsed_time": "1h 34m 14s", "remaining_time": "1h 23m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367129} +{"loss": 0.85715568, "grad_norm": 2.78124309, "learning_rate": 3.179e-05, "token_acc": 0.74620999, "epoch": 1.06007509, "global_step/max_steps": "424/800", "percentage": "53.00%", "elapsed_time": "1h 34m 30s", "remaining_time": "1h 23m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.372876} +{"loss": 0.75817764, "grad_norm": 1.86491859, "learning_rate": 3.167e-05, "token_acc": 0.7680105, "epoch": 1.06257822, "global_step/max_steps": "425/800", "percentage": "53.12%", "elapsed_time": "1h 34m 42s", "remaining_time": "1h 23m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.369251} +{"loss": 0.77570343, "grad_norm": 2.12244058, "learning_rate": 3.155e-05, "token_acc": 0.77225248, "epoch": 1.06508135, "global_step/max_steps": "426/800", "percentage": "53.25%", "elapsed_time": "1h 34m 52s", "remaining_time": "1h 23m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.361189} +{"loss": 0.8123703, "grad_norm": 1.88636506, "learning_rate": 3.143e-05, "token_acc": 0.7639743, "epoch": 1.06758448, "global_step/max_steps": "427/800", "percentage": "53.37%", "elapsed_time": "1h 35m 2s", "remaining_time": "1h 23m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354767} +{"loss": 0.78486985, "grad_norm": 2.36413574, "learning_rate": 3.131e-05, "token_acc": 0.76473269, "epoch": 1.07008761, "global_step/max_steps": "428/800", "percentage": "53.50%", "elapsed_time": "1h 35m 19s", "remaining_time": "1h 22m 51s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.361751} +{"loss": 0.78292382, "grad_norm": 2.30471015, "learning_rate": 3.119e-05, "token_acc": 0.76595607, "epoch": 1.07259074, "global_step/max_steps": "429/800", "percentage": "53.62%", "elapsed_time": "1h 35m 32s", "remaining_time": "1h 22m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.360701} +{"loss": 0.79504132, "grad_norm": 2.61433196, "learning_rate": 3.107e-05, "token_acc": 0.76862596, "epoch": 1.07509387, "global_step/max_steps": "430/800", "percentage": "53.75%", "elapsed_time": "1h 35m 41s", "remaining_time": "1h 22m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.352281} +{"loss": 0.80896938, "grad_norm": 1.38006032, "learning_rate": 3.096e-05, "token_acc": 0.76421108, "epoch": 1.077597, "global_step/max_steps": "431/800", "percentage": "53.87%", "elapsed_time": "1h 36m 9s", "remaining_time": "1h 22m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.384027} +{"loss": 0.89753044, "grad_norm": 4.63192844, "learning_rate": 3.084e-05, "token_acc": 0.73779504, "epoch": 1.08010013, "global_step/max_steps": "432/800", "percentage": "54.00%", "elapsed_time": "1h 36m 21s", "remaining_time": "1h 22m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.381383} +{"loss": 0.83140367, "grad_norm": 1.74725986, "learning_rate": 3.072e-05, "token_acc": 0.7511786, "epoch": 1.08260325, "global_step/max_steps": "433/800", "percentage": "54.12%", "elapsed_time": "1h 36m 35s", "remaining_time": "1h 21m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.384254} +{"loss": 0.66710782, "grad_norm": 3.08926105, "learning_rate": 3.06e-05, "token_acc": 0.79688025, "epoch": 1.08510638, "global_step/max_steps": "434/800", "percentage": "54.25%", "elapsed_time": "1h 36m 47s", "remaining_time": "1h 21m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.379179} +{"loss": 0.83898187, "grad_norm": 1.26816535, "learning_rate": 3.048e-05, "token_acc": 0.75324407, "epoch": 1.08760951, "global_step/max_steps": "435/800", "percentage": "54.37%", "elapsed_time": "1h 37m 2s", "remaining_time": "1h 21m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.384162} +{"loss": 0.74058706, "grad_norm": 1.61586571, "learning_rate": 3.036e-05, "token_acc": 0.77832697, "epoch": 1.09011264, "global_step/max_steps": "436/800", "percentage": "54.50%", "elapsed_time": "1h 37m 9s", "remaining_time": "1h 21m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.369107} +{"loss": 0.82813984, "grad_norm": 1.15860653, "learning_rate": 3.024e-05, "token_acc": 0.75431719, "epoch": 1.09261577, "global_step/max_steps": "437/800", "percentage": "54.62%", "elapsed_time": "1h 37m 24s", "remaining_time": "1h 20m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.374045} +{"loss": 0.82699251, "grad_norm": 1.27686906, "learning_rate": 3.012e-05, "token_acc": 0.75261115, "epoch": 1.0951189, "global_step/max_steps": "438/800", "percentage": "54.75%", "elapsed_time": "1h 37m 41s", "remaining_time": "1h 20m 44s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.381054} +{"loss": 0.65537941, "grad_norm": 1.68920457, "learning_rate": 3e-05, "token_acc": 0.80297158, "epoch": 1.09762203, "global_step/max_steps": "439/800", "percentage": "54.87%", "elapsed_time": "1h 37m 50s", "remaining_time": "1h 20m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.370396} +{"loss": 0.50593424, "grad_norm": 11.61399174, "learning_rate": 2.988e-05, "token_acc": 0.84545455, "epoch": 1.10012516, "global_step/max_steps": "440/800", "percentage": "55.00%", "elapsed_time": "1h 37m 59s", "remaining_time": "1h 20m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.360437} +{"loss": 0.86261404, "grad_norm": 1.26923919, "learning_rate": 2.976e-05, "token_acc": 0.74729611, "epoch": 1.10262829, "global_step/max_steps": "441/800", "percentage": "55.12%", "elapsed_time": "1h 38m 22s", "remaining_time": "1h 20m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.383814} +{"loss": 0.6372447, "grad_norm": 10.77353001, "learning_rate": 2.964e-05, "token_acc": 0.80531832, "epoch": 1.10513141, "global_step/max_steps": "442/800", "percentage": "55.25%", "elapsed_time": "1h 38m 29s", "remaining_time": "1h 19m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36924} +{"loss": 0.7247684, "grad_norm": 4.59783411, "learning_rate": 2.952e-05, "token_acc": 0.78377348, "epoch": 1.10763454, "global_step/max_steps": "443/800", "percentage": "55.38%", "elapsed_time": "1h 38m 37s", "remaining_time": "1h 19m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356737} +{"loss": 0.85621262, "grad_norm": 1.98009348, "learning_rate": 2.939e-05, "token_acc": 0.74290154, "epoch": 1.11013767, "global_step/max_steps": "444/800", "percentage": "55.50%", "elapsed_time": "1h 38m 53s", "remaining_time": "1h 19m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.362868} +{"loss": 0.78983283, "grad_norm": 1.01544309, "learning_rate": 2.927e-05, "token_acc": 0.75743742, "epoch": 1.1126408, "global_step/max_steps": "445/800", "percentage": "55.62%", "elapsed_time": "1h 39m 7s", "remaining_time": "1h 19m 4s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.364756} +{"loss": 0.85429054, "grad_norm": 0.95061773, "learning_rate": 2.915e-05, "token_acc": 0.74624867, "epoch": 1.11514393, "global_step/max_steps": "446/800", "percentage": "55.75%", "elapsed_time": "1h 39m 22s", "remaining_time": "1h 18m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.366627} +{"loss": 0.77253997, "grad_norm": 1.88624859, "learning_rate": 2.903e-05, "token_acc": 0.7656929, "epoch": 1.11764706, "global_step/max_steps": "447/800", "percentage": "55.88%", "elapsed_time": "1h 39m 34s", "remaining_time": "1h 18m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363926} +{"loss": 0.74961454, "grad_norm": 2.74583507, "learning_rate": 2.891e-05, "token_acc": 0.77333512, "epoch": 1.12015019, "global_step/max_steps": "448/800", "percentage": "56.00%", "elapsed_time": "1h 39m 43s", "remaining_time": "1h 18m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354774} +{"loss": 0.60596561, "grad_norm": 5.34207058, "learning_rate": 2.879e-05, "token_acc": 0.82150337, "epoch": 1.12265332, "global_step/max_steps": "449/800", "percentage": "56.12%", "elapsed_time": "1h 39m 53s", "remaining_time": "1h 18m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347853} +{"loss": 0.67151219, "grad_norm": 2.00425434, "learning_rate": 2.867e-05, "token_acc": 0.7972053, "epoch": 1.12515645, "global_step/max_steps": "450/800", "percentage": "56.25%", "elapsed_time": "1h 40m 4s", "remaining_time": "1h 17m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342123} +{"loss": 0.70058346, "grad_norm": 3.36950898, "learning_rate": 2.855e-05, "token_acc": 0.79252157, "epoch": 1.12765957, "global_step/max_steps": "451/800", "percentage": "56.38%", "elapsed_time": "1h 40m 22s", "remaining_time": "1h 17m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.352323} +{"loss": 0.69252712, "grad_norm": 2.25554252, "learning_rate": 2.843e-05, "token_acc": 0.79393766, "epoch": 1.1301627, "global_step/max_steps": "452/800", "percentage": "56.50%", "elapsed_time": "1h 40m 30s", "remaining_time": "1h 17m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.340192} +{"loss": 0.82582521, "grad_norm": 1.90741038, "learning_rate": 2.83e-05, "token_acc": 0.7546308, "epoch": 1.13266583, "global_step/max_steps": "453/800", "percentage": "56.62%", "elapsed_time": "1h 40m 39s", "remaining_time": "1h 17m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.330108} +{"loss": 0.92107499, "grad_norm": 1.93725383, "learning_rate": 2.818e-05, "token_acc": 0.72828989, "epoch": 1.13516896, "global_step/max_steps": "454/800", "percentage": "56.75%", "elapsed_time": "1h 40m 57s", "remaining_time": "1h 16m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.341852} +{"loss": 0.69560254, "grad_norm": 2.81946993, "learning_rate": 2.806e-05, "token_acc": 0.78817963, "epoch": 1.13767209, "global_step/max_steps": "455/800", "percentage": "56.88%", "elapsed_time": "1h 41m 8s", "remaining_time": "1h 16m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.336201} +{"loss": 0.74631572, "grad_norm": 1.72501504, "learning_rate": 2.794e-05, "token_acc": 0.77490621, "epoch": 1.14017522, "global_step/max_steps": "456/800", "percentage": "57.00%", "elapsed_time": "1h 41m 19s", "remaining_time": "1h 16m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.33077} +{"loss": 0.78785825, "grad_norm": 2.60076571, "learning_rate": 2.782e-05, "token_acc": 0.7616864, "epoch": 1.14267835, "global_step/max_steps": "457/800", "percentage": "57.12%", "elapsed_time": "1h 41m 34s", "remaining_time": "1h 16m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.335678} +{"loss": 0.78815025, "grad_norm": 2.29882121, "learning_rate": 2.769e-05, "token_acc": 0.76641045, "epoch": 1.14518148, "global_step/max_steps": "458/800", "percentage": "57.25%", "elapsed_time": "1h 41m 44s", "remaining_time": "1h 15m 58s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.327195} +{"loss": 0.83582932, "grad_norm": 7.81841421, "learning_rate": 2.757e-05, "token_acc": 0.74998885, "epoch": 1.14768461, "global_step/max_steps": "459/800", "percentage": "57.38%", "elapsed_time": "1h 42m 1s", "remaining_time": "1h 15m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.336335} +{"loss": 0.87364417, "grad_norm": 0.86422503, "learning_rate": 2.745e-05, "token_acc": 0.74473429, "epoch": 1.15018773, "global_step/max_steps": "460/800", "percentage": "57.50%", "elapsed_time": "1h 42m 13s", "remaining_time": "1h 15m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.333677} +{"loss": 0.82405889, "grad_norm": 2.36788368, "learning_rate": 2.733e-05, "token_acc": 0.75070119, "epoch": 1.15269086, "global_step/max_steps": "461/800", "percentage": "57.63%", "elapsed_time": "1h 42m 34s", "remaining_time": "1h 15m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35026} +{"loss": 0.86164594, "grad_norm": 4.15918159, "learning_rate": 2.721e-05, "token_acc": 0.74845833, "epoch": 1.15519399, "global_step/max_steps": "462/800", "percentage": "57.75%", "elapsed_time": "1h 42m 51s", "remaining_time": "1h 15m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356391} +{"loss": 0.85446024, "grad_norm": 2.0485189, "learning_rate": 2.708e-05, "token_acc": 0.74340528, "epoch": 1.15769712, "global_step/max_steps": "463/800", "percentage": "57.88%", "elapsed_time": "1h 43m 7s", "remaining_time": "1h 15m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363298} +{"loss": 0.90817821, "grad_norm": 3.68559098, "learning_rate": 2.696e-05, "token_acc": 0.73261564, "epoch": 1.16020025, "global_step/max_steps": "464/800", "percentage": "58.00%", "elapsed_time": "1h 43m 48s", "remaining_time": "1h 15m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.42227} +{"loss": 0.71073872, "grad_norm": 2.54739404, "learning_rate": 2.684e-05, "token_acc": 0.78194616, "epoch": 1.16270338, "global_step/max_steps": "465/800", "percentage": "58.13%", "elapsed_time": "1h 43m 56s", "remaining_time": "1h 14m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.409841} +{"loss": 0.64903021, "grad_norm": 4.81212091, "learning_rate": 2.672e-05, "token_acc": 0.80377893, "epoch": 1.16520651, "global_step/max_steps": "466/800", "percentage": "58.25%", "elapsed_time": "1h 44m 4s", "remaining_time": "1h 14m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.398617} +{"loss": 0.52598524, "grad_norm": 14.57820415, "learning_rate": 2.659e-05, "token_acc": 0.84611067, "epoch": 1.16770964, "global_step/max_steps": "467/800", "percentage": "58.38%", "elapsed_time": "1h 44m 13s", "remaining_time": "1h 14m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.388984} +{"loss": 0.75052196, "grad_norm": 8.1760788, "learning_rate": 2.647e-05, "token_acc": 0.77765477, "epoch": 1.17021277, "global_step/max_steps": "468/800", "percentage": "58.50%", "elapsed_time": "1h 44m 21s", "remaining_time": "1h 14m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.377732} +{"loss": 0.72557735, "grad_norm": 3.20513558, "learning_rate": 2.635e-05, "token_acc": 0.78672673, "epoch": 1.17271589, "global_step/max_steps": "469/800", "percentage": "58.63%", "elapsed_time": "1h 44m 29s", "remaining_time": "1h 13m 44s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36605} +{"loss": 0.84171188, "grad_norm": 1.62674904, "learning_rate": 2.623e-05, "token_acc": 0.74817262, "epoch": 1.17521902, "global_step/max_steps": "470/800", "percentage": "58.75%", "elapsed_time": "1h 44m 41s", "remaining_time": "1h 13m 30s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.362993} +{"loss": 0.71433389, "grad_norm": 6.16251421, "learning_rate": 2.61e-05, "token_acc": 0.78230753, "epoch": 1.17772215, "global_step/max_steps": "471/800", "percentage": "58.88%", "elapsed_time": "1h 45m 1s", "remaining_time": "1h 13m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.378149} +{"loss": 0.87432957, "grad_norm": 1.20968843, "learning_rate": 2.598e-05, "token_acc": 0.74353887, "epoch": 1.18022528, "global_step/max_steps": "472/800", "percentage": "59.00%", "elapsed_time": "1h 45m 17s", "remaining_time": "1h 13m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.38323} +{"loss": 0.79114473, "grad_norm": 4.48335505, "learning_rate": 2.586e-05, "token_acc": 0.76509042, "epoch": 1.18272841, "global_step/max_steps": "473/800", "percentage": "59.13%", "elapsed_time": "1h 45m 29s", "remaining_time": "1h 12m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.380932} +{"loss": 0.82731408, "grad_norm": 1.92680478, "learning_rate": 2.574e-05, "token_acc": 0.75835818, "epoch": 1.18523154, "global_step/max_steps": "474/800", "percentage": "59.25%", "elapsed_time": "1h 45m 40s", "remaining_time": "1h 12m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.375251} +{"loss": 0.81742364, "grad_norm": 1.87220538, "learning_rate": 2.561e-05, "token_acc": 0.75588803, "epoch": 1.18773467, "global_step/max_steps": "475/800", "percentage": "59.38%", "elapsed_time": "1h 45m 53s", "remaining_time": "1h 12m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.374054} +{"loss": 0.67193133, "grad_norm": 3.87839961, "learning_rate": 2.549e-05, "token_acc": 0.79881012, "epoch": 1.1902378, "global_step/max_steps": "476/800", "percentage": "59.50%", "elapsed_time": "1h 45m 60s", "remaining_time": "1h 12m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36114} +{"loss": 0.77242756, "grad_norm": 1.8818239, "learning_rate": 2.537e-05, "token_acc": 0.77307936, "epoch": 1.19274093, "global_step/max_steps": "477/800", "percentage": "59.62%", "elapsed_time": "1h 46m 8s", "remaining_time": "1h 11m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.349311} +{"loss": 0.90493608, "grad_norm": 2.96392775, "learning_rate": 2.525e-05, "token_acc": 0.73397383, "epoch": 1.19524406, "global_step/max_steps": "478/800", "percentage": "59.75%", "elapsed_time": "1h 46m 24s", "remaining_time": "1h 11m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356324} +{"loss": 0.85291463, "grad_norm": 2.74154091, "learning_rate": 2.512e-05, "token_acc": 0.74562519, "epoch": 1.19774718, "global_step/max_steps": "479/800", "percentage": "59.88%", "elapsed_time": "1h 46m 36s", "remaining_time": "1h 11m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353387} +{"loss": 0.72922778, "grad_norm": 1.61602724, "learning_rate": 2.5e-05, "token_acc": 0.78092268, "epoch": 1.20025031, "global_step/max_steps": "480/800", "percentage": "60.00%", "elapsed_time": "1h 46m 44s", "remaining_time": "1h 11m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342308} +{"loss": 0.76197517, "grad_norm": 1.34358788, "learning_rate": 2.488e-05, "token_acc": 0.77062362, "epoch": 1.20275344, "global_step/max_steps": "481/800", "percentage": "60.12%", "elapsed_time": "1h 47m 6s", "remaining_time": "1h 11m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359223} +{"loss": 0.85240972, "grad_norm": 1.32383084, "learning_rate": 2.475e-05, "token_acc": 0.74468276, "epoch": 1.20525657, "global_step/max_steps": "482/800", "percentage": "60.25%", "elapsed_time": "1h 47m 25s", "remaining_time": "1h 10m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.371072} +{"loss": 0.75009203, "grad_norm": 3.74860406, "learning_rate": 2.463e-05, "token_acc": 0.77547051, "epoch": 1.2077597, "global_step/max_steps": "483/800", "percentage": "60.38%", "elapsed_time": "1h 47m 40s", "remaining_time": "1h 10m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.375207} +{"loss": 0.83248091, "grad_norm": 2.84020615, "learning_rate": 2.451e-05, "token_acc": 0.75288338, "epoch": 1.21026283, "global_step/max_steps": "484/800", "percentage": "60.50%", "elapsed_time": "1h 47m 54s", "remaining_time": "1h 10m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.375784} +{"loss": 0.84282857, "grad_norm": 3.48317432, "learning_rate": 2.439e-05, "token_acc": 0.74733465, "epoch": 1.21276596, "global_step/max_steps": "485/800", "percentage": "60.62%", "elapsed_time": "1h 48m 6s", "remaining_time": "1h 10m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.373752} +{"loss": 0.96964693, "grad_norm": 1.4032253, "learning_rate": 2.426e-05, "token_acc": 0.71866889, "epoch": 1.21526909, "global_step/max_steps": "486/800", "percentage": "60.75%", "elapsed_time": "1h 48m 21s", "remaining_time": "1h 10m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.375953} +{"loss": 0.84925437, "grad_norm": 1.48896396, "learning_rate": 2.414e-05, "token_acc": 0.75046876, "epoch": 1.21777222, "global_step/max_steps": "487/800", "percentage": "60.88%", "elapsed_time": "1h 48m 35s", "remaining_time": "1h 9m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.378403} +{"loss": 0.71148616, "grad_norm": 2.6259954, "learning_rate": 2.402e-05, "token_acc": 0.78691251, "epoch": 1.22027534, "global_step/max_steps": "488/800", "percentage": "61.00%", "elapsed_time": "1h 48m 43s", "remaining_time": "1h 9m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367072} +{"loss": 0.83080137, "grad_norm": 1.79509616, "learning_rate": 2.39e-05, "token_acc": 0.75174505, "epoch": 1.22277847, "global_step/max_steps": "489/800", "percentage": "61.12%", "elapsed_time": "1h 48m 52s", "remaining_time": "1h 9m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.358333} +{"loss": 0.69550657, "grad_norm": 2.16244674, "learning_rate": 2.377e-05, "token_acc": 0.78876156, "epoch": 1.2252816, "global_step/max_steps": "490/800", "percentage": "61.25%", "elapsed_time": "1h 49m 4s", "remaining_time": "1h 9m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.355119} +{"loss": 0.89832425, "grad_norm": 8.65628529, "learning_rate": 2.365e-05, "token_acc": 0.73297643, "epoch": 1.22778473, "global_step/max_steps": "491/800", "percentage": "61.38%", "elapsed_time": "1h 49m 25s", "remaining_time": "1h 8m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.371019} +{"loss": 0.67286927, "grad_norm": 2.01432824, "learning_rate": 2.353e-05, "token_acc": 0.79588032, "epoch": 1.23028786, "global_step/max_steps": "492/800", "percentage": "61.50%", "elapsed_time": "1h 49m 34s", "remaining_time": "1h 8m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36135} +{"loss": 0.78836876, "grad_norm": 7.16686153, "learning_rate": 2.341e-05, "token_acc": 0.76842177, "epoch": 1.23279099, "global_step/max_steps": "493/800", "percentage": "61.62%", "elapsed_time": "1h 49m 44s", "remaining_time": "1h 8m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354716} +{"loss": 0.72451949, "grad_norm": 2.84972191, "learning_rate": 2.328e-05, "token_acc": 0.77876106, "epoch": 1.23529412, "global_step/max_steps": "494/800", "percentage": "61.75%", "elapsed_time": "1h 49m 55s", "remaining_time": "1h 8m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.349831} +{"loss": 0.84686738, "grad_norm": 5.23684692, "learning_rate": 2.316e-05, "token_acc": 0.74936511, "epoch": 1.23779725, "global_step/max_steps": "495/800", "percentage": "61.88%", "elapsed_time": "1h 50m 5s", "remaining_time": "1h 7m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342937} +{"loss": 0.83262575, "grad_norm": 1.28597629, "learning_rate": 2.304e-05, "token_acc": 0.75314546, "epoch": 1.24030038, "global_step/max_steps": "496/800", "percentage": "62.00%", "elapsed_time": "1h 50m 17s", "remaining_time": "1h 7m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.340549} +{"loss": 0.63192266, "grad_norm": 1.92839634, "learning_rate": 2.292e-05, "token_acc": 0.80546043, "epoch": 1.2428035, "global_step/max_steps": "497/800", "percentage": "62.12%", "elapsed_time": "1h 50m 25s", "remaining_time": "1h 7m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.330098} +{"loss": 0.69958949, "grad_norm": 3.75831962, "learning_rate": 2.279e-05, "token_acc": 0.78904411, "epoch": 1.24530663, "global_step/max_steps": "498/800", "percentage": "62.25%", "elapsed_time": "1h 50m 33s", "remaining_time": "1h 7m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.319858} +{"loss": 0.72242624, "grad_norm": 1.21765769, "learning_rate": 2.267e-05, "token_acc": 0.78448203, "epoch": 1.24780976, "global_step/max_steps": "499/800", "percentage": "62.38%", "elapsed_time": "1h 50m 42s", "remaining_time": "1h 6m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.311009} +{"loss": 0.55592954, "grad_norm": 2.04149055, "learning_rate": 2.255e-05, "token_acc": 0.83002937, "epoch": 1.25031289, "global_step/max_steps": "500/800", "percentage": "62.50%", "elapsed_time": "1h 50m 50s", "remaining_time": "1h 6m 30s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.300469} +{"loss": 0.61974102, "grad_norm": 2.3053484, "learning_rate": 2.243e-05, "token_acc": 0.80725286, "epoch": 1.25281602, "global_step/max_steps": "501/800", "percentage": "62.62%", "elapsed_time": "1h 51m 9s", "remaining_time": "1h 6m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.312289} +{"loss": 0.86838758, "grad_norm": 2.06223249, "learning_rate": 2.231e-05, "token_acc": 0.74358045, "epoch": 1.25531915, "global_step/max_steps": "502/800", "percentage": "62.75%", "elapsed_time": "1h 51m 25s", "remaining_time": "1h 6m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.316477} +{"loss": 0.93569374, "grad_norm": 0.89068598, "learning_rate": 2.218e-05, "token_acc": 0.7245146, "epoch": 1.25782228, "global_step/max_steps": "503/800", "percentage": "62.88%", "elapsed_time": "1h 51m 45s", "remaining_time": "1h 5m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.329936} +{"loss": 0.67470229, "grad_norm": 3.92314339, "learning_rate": 2.206e-05, "token_acc": 0.79819074, "epoch": 1.26032541, "global_step/max_steps": "504/800", "percentage": "63.00%", "elapsed_time": "1h 51m 53s", "remaining_time": "1h 5m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.319851} +{"loss": 0.74414825, "grad_norm": 2.74283457, "learning_rate": 2.194e-05, "token_acc": 0.77423958, "epoch": 1.26282854, "global_step/max_steps": "505/800", "percentage": "63.12%", "elapsed_time": "1h 52m 1s", "remaining_time": "1h 5m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.308743} +{"loss": 0.65304482, "grad_norm": 1.92770922, "learning_rate": 2.182e-05, "token_acc": 0.79752206, "epoch": 1.26533166, "global_step/max_steps": "506/800", "percentage": "63.25%", "elapsed_time": "1h 52m 10s", "remaining_time": "1h 5m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.300871} +{"loss": 0.68607795, "grad_norm": 1.62927675, "learning_rate": 2.17e-05, "token_acc": 0.78989536, "epoch": 1.26783479, "global_step/max_steps": "507/800", "percentage": "63.38%", "elapsed_time": "1h 52m 19s", "remaining_time": "1h 4m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.292185} +{"loss": 0.8034097, "grad_norm": 2.6792891, "learning_rate": 2.157e-05, "token_acc": 0.75678511, "epoch": 1.27033792, "global_step/max_steps": "508/800", "percentage": "63.50%", "elapsed_time": "1h 52m 35s", "remaining_time": "1h 4m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.296848} +{"loss": 0.78417081, "grad_norm": 2.10031343, "learning_rate": 2.145e-05, "token_acc": 0.75754722, "epoch": 1.27284105, "global_step/max_steps": "509/800", "percentage": "63.62%", "elapsed_time": "1h 52m 52s", "remaining_time": "1h 4m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.304662} +{"loss": 0.81830251, "grad_norm": 2.46852112, "learning_rate": 2.133e-05, "token_acc": 0.75732274, "epoch": 1.27534418, "global_step/max_steps": "510/800", "percentage": "63.75%", "elapsed_time": "1h 53m 4s", "remaining_time": "1h 4m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.301048} +{"loss": 0.7484889, "grad_norm": 6.10994339, "learning_rate": 2.121e-05, "token_acc": 0.77554452, "epoch": 1.27784731, "global_step/max_steps": "511/800", "percentage": "63.88%", "elapsed_time": "1h 53m 24s", "remaining_time": "1h 4m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.315808} +{"loss": 0.82985616, "grad_norm": 1.98340487, "learning_rate": 2.109e-05, "token_acc": 0.75058427, "epoch": 1.28035044, "global_step/max_steps": "512/800", "percentage": "64.00%", "elapsed_time": "1h 53m 36s", "remaining_time": "1h 3m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.311785} +{"loss": 0.8005749, "grad_norm": 2.40340686, "learning_rate": 2.097e-05, "token_acc": 0.75889092, "epoch": 1.28285357, "global_step/max_steps": "513/800", "percentage": "64.12%", "elapsed_time": "1h 53m 52s", "remaining_time": "1h 3m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.317599} +{"loss": 0.75841904, "grad_norm": 1.75409746, "learning_rate": 2.085e-05, "token_acc": 0.77521758, "epoch": 1.2853567, "global_step/max_steps": "514/800", "percentage": "64.25%", "elapsed_time": "1h 54m 5s", "remaining_time": "1h 3m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.317106} +{"loss": 0.85614622, "grad_norm": 3.21459699, "learning_rate": 2.073e-05, "token_acc": 0.74186762, "epoch": 1.28785982, "global_step/max_steps": "515/800", "percentage": "64.38%", "elapsed_time": "1h 54m 25s", "remaining_time": "1h 3m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.330753} +{"loss": 0.79250425, "grad_norm": 1.68127334, "learning_rate": 2.061e-05, "token_acc": 0.76397733, "epoch": 1.29036295, "global_step/max_steps": "516/800", "percentage": "64.50%", "elapsed_time": "1h 54m 37s", "remaining_time": "1h 3m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.328387} +{"loss": 0.87501264, "grad_norm": 1.04317927, "learning_rate": 2.048e-05, "token_acc": 0.74001916, "epoch": 1.29286608, "global_step/max_steps": "517/800", "percentage": "64.62%", "elapsed_time": "1h 54m 56s", "remaining_time": "1h 2m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.338841} +{"loss": 0.78691769, "grad_norm": 4.36319113, "learning_rate": 2.036e-05, "token_acc": 0.76201884, "epoch": 1.29536921, "global_step/max_steps": "518/800", "percentage": "64.75%", "elapsed_time": "1h 55m 21s", "remaining_time": "1h 2m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.360838} +{"loss": 0.83696038, "grad_norm": 1.37423658, "learning_rate": 2.024e-05, "token_acc": 0.75135508, "epoch": 1.29787234, "global_step/max_steps": "519/800", "percentage": "64.88%", "elapsed_time": "1h 55m 32s", "remaining_time": "1h 2m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356271} +{"loss": 0.86566162, "grad_norm": 0.85092038, "learning_rate": 2.012e-05, "token_acc": 0.74435478, "epoch": 1.30037547, "global_step/max_steps": "520/800", "percentage": "65.00%", "elapsed_time": "1h 55m 48s", "remaining_time": "1h 2m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.360644} +{"loss": 0.83841431, "grad_norm": 1.02454448, "learning_rate": 2e-05, "token_acc": 0.74847288, "epoch": 1.3028786, "global_step/max_steps": "521/800", "percentage": "65.12%", "elapsed_time": "1h 56m 15s", "remaining_time": "1h 2m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.388148} +{"loss": 0.78856701, "grad_norm": 1.51517594, "learning_rate": 1.988e-05, "token_acc": 0.76615604, "epoch": 1.30538173, "global_step/max_steps": "522/800", "percentage": "65.25%", "elapsed_time": "1h 56m 26s", "remaining_time": "1h 2m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.382759} +{"loss": 0.78758907, "grad_norm": 4.34054518, "learning_rate": 1.976e-05, "token_acc": 0.76433808, "epoch": 1.30788486, "global_step/max_steps": "523/800", "percentage": "65.38%", "elapsed_time": "1h 56m 37s", "remaining_time": "1h 1m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.37812} +{"loss": 0.82406658, "grad_norm": 1.44975126, "learning_rate": 1.964e-05, "token_acc": 0.75310887, "epoch": 1.31038798, "global_step/max_steps": "524/800", "percentage": "65.50%", "elapsed_time": "1h 56m 52s", "remaining_time": "1h 1m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.382172} +{"loss": 0.71557915, "grad_norm": 4.85240889, "learning_rate": 1.952e-05, "token_acc": 0.78595289, "epoch": 1.31289111, "global_step/max_steps": "525/800", "percentage": "65.62%", "elapsed_time": "1h 56m 60s", "remaining_time": "1h 1m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.37091} +{"loss": 0.82299072, "grad_norm": 1.42433453, "learning_rate": 1.94e-05, "token_acc": 0.75751234, "epoch": 1.31539424, "global_step/max_steps": "526/800", "percentage": "65.75%", "elapsed_time": "1h 57m 10s", "remaining_time": "1h 1m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.365829} +{"loss": 0.81676394, "grad_norm": 1.15578806, "learning_rate": 1.928e-05, "token_acc": 0.75249169, "epoch": 1.31789737, "global_step/max_steps": "527/800", "percentage": "65.88%", "elapsed_time": "1h 57m 23s", "remaining_time": "1h 0m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363497} +{"loss": 0.77141041, "grad_norm": 2.145895, "learning_rate": 1.916e-05, "token_acc": 0.77152716, "epoch": 1.3204005, "global_step/max_steps": "528/800", "percentage": "66.00%", "elapsed_time": "1h 57m 32s", "remaining_time": "1h 0m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356915} +{"loss": 0.86282074, "grad_norm": 1.01059628, "learning_rate": 1.904e-05, "token_acc": 0.73883542, "epoch": 1.32290363, "global_step/max_steps": "529/800", "percentage": "66.12%", "elapsed_time": "1h 57m 55s", "remaining_time": "1h 0m 24s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.37431} +{"loss": 0.84229147, "grad_norm": 1.62462258, "learning_rate": 1.893e-05, "token_acc": 0.75419762, "epoch": 1.32540676, "global_step/max_steps": "530/800", "percentage": "66.25%", "elapsed_time": "1h 58m 8s", "remaining_time": "1h 0m 11s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.373283} +{"loss": 0.63685811, "grad_norm": 1.69919682, "learning_rate": 1.881e-05, "token_acc": 0.80307376, "epoch": 1.32790989, "global_step/max_steps": "531/800", "percentage": "66.38%", "elapsed_time": "1h 58m 26s", "remaining_time": "1h 0m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.383154} +{"loss": 0.96119535, "grad_norm": 1.99775565, "learning_rate": 1.869e-05, "token_acc": 0.72249779, "epoch": 1.33041302, "global_step/max_steps": "532/800", "percentage": "66.50%", "elapsed_time": "1h 58m 42s", "remaining_time": "59m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.388107} +{"loss": 0.77946645, "grad_norm": 1.72000349, "learning_rate": 1.857e-05, "token_acc": 0.76979014, "epoch": 1.33291615, "global_step/max_steps": "533/800", "percentage": "66.62%", "elapsed_time": "1h 58m 54s", "remaining_time": "59m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.384017} +{"loss": 0.87877101, "grad_norm": 2.92929173, "learning_rate": 1.845e-05, "token_acc": 0.74208194, "epoch": 1.33541927, "global_step/max_steps": "534/800", "percentage": "66.75%", "elapsed_time": "1h 59m 8s", "remaining_time": "59m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.385154} +{"loss": 0.75389153, "grad_norm": 1.74767005, "learning_rate": 1.833e-05, "token_acc": 0.77237082, "epoch": 1.3379224, "global_step/max_steps": "535/800", "percentage": "66.88%", "elapsed_time": "1h 59m 19s", "remaining_time": "59m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.381124} +{"loss": 0.83476686, "grad_norm": 2.84275913, "learning_rate": 1.821e-05, "token_acc": 0.74660092, "epoch": 1.34042553, "global_step/max_steps": "536/800", "percentage": "67.00%", "elapsed_time": "1h 59m 38s", "remaining_time": "58m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.39147} +{"loss": 0.81319368, "grad_norm": 1.03518879, "learning_rate": 1.81e-05, "token_acc": 0.75603969, "epoch": 1.34292866, "global_step/max_steps": "537/800", "percentage": "67.12%", "elapsed_time": "1h 59m 47s", "remaining_time": "58m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.383905} +{"loss": 0.7035706, "grad_norm": 2.1326282, "learning_rate": 1.798e-05, "token_acc": 0.78710622, "epoch": 1.34543179, "global_step/max_steps": "538/800", "percentage": "67.25%", "elapsed_time": "1h 59m 57s", "remaining_time": "58m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.378082} +{"loss": 0.64840579, "grad_norm": 1.65300298, "learning_rate": 1.786e-05, "token_acc": 0.80372133, "epoch": 1.34793492, "global_step/max_steps": "539/800", "percentage": "67.38%", "elapsed_time": "2h 0m 7s", "remaining_time": "58m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.370961} +{"loss": 0.82776999, "grad_norm": 1.39770746, "learning_rate": 1.774e-05, "token_acc": 0.74953988, "epoch": 1.35043805, "global_step/max_steps": "540/800", "percentage": "67.50%", "elapsed_time": "2h 0m 16s", "remaining_time": "57m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363343} +{"loss": 0.81462073, "grad_norm": 2.41032314, "learning_rate": 1.763e-05, "token_acc": 0.75710638, "epoch": 1.35294118, "global_step/max_steps": "541/800", "percentage": "67.62%", "elapsed_time": "2h 0m 40s", "remaining_time": "57m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.382753} +{"loss": 0.72107619, "grad_norm": 1.91086638, "learning_rate": 1.751e-05, "token_acc": 0.77741887, "epoch": 1.35544431, "global_step/max_steps": "542/800", "percentage": "67.75%", "elapsed_time": "2h 0m 51s", "remaining_time": "57m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.378955} +{"loss": 0.65224075, "grad_norm": 11.7825737, "learning_rate": 1.739e-05, "token_acc": 0.80724196, "epoch": 1.35794743, "global_step/max_steps": "543/800", "percentage": "67.88%", "elapsed_time": "2h 1m 0s", "remaining_time": "57m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.370474} +{"loss": 0.78529161, "grad_norm": 1.79135549, "learning_rate": 1.727e-05, "token_acc": 0.76107181, "epoch": 1.36045056, "global_step/max_steps": "544/800", "percentage": "68.00%", "elapsed_time": "2h 1m 15s", "remaining_time": "57m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.372967} +{"loss": 0.75865233, "grad_norm": 1.87581897, "learning_rate": 1.716e-05, "token_acc": 0.77178722, "epoch": 1.36295369, "global_step/max_steps": "545/800", "percentage": "68.12%", "elapsed_time": "2h 1m 27s", "remaining_time": "56m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.370723} +{"loss": 0.67577446, "grad_norm": 3.35396886, "learning_rate": 1.704e-05, "token_acc": 0.79331761, "epoch": 1.36545682, "global_step/max_steps": "546/800", "percentage": "68.25%", "elapsed_time": "2h 1m 35s", "remaining_time": "56m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.361549} +{"loss": 0.80683708, "grad_norm": 1.83774006, "learning_rate": 1.693e-05, "token_acc": 0.75709908, "epoch": 1.36795995, "global_step/max_steps": "547/800", "percentage": "68.38%", "elapsed_time": "2h 1m 45s", "remaining_time": "56m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.355333} +{"loss": 0.82336605, "grad_norm": 1.37809467, "learning_rate": 1.681e-05, "token_acc": 0.75057045, "epoch": 1.37046308, "global_step/max_steps": "548/800", "percentage": "68.50%", "elapsed_time": "2h 2m 1s", "remaining_time": "56m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359449} +{"loss": 0.72890729, "grad_norm": 5.14294577, "learning_rate": 1.669e-05, "token_acc": 0.78129339, "epoch": 1.37296621, "global_step/max_steps": "549/800", "percentage": "68.62%", "elapsed_time": "2h 2m 12s", "remaining_time": "55m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.355998} +{"loss": 0.72364664, "grad_norm": 1.77395415, "learning_rate": 1.658e-05, "token_acc": 0.78100415, "epoch": 1.37546934, "global_step/max_steps": "550/800", "percentage": "68.75%", "elapsed_time": "2h 2m 24s", "remaining_time": "55m 38s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.352438} +{"loss": 0.80421174, "grad_norm": 3.59978843, "learning_rate": 1.646e-05, "token_acc": 0.75819431, "epoch": 1.37797247, "global_step/max_steps": "551/800", "percentage": "68.88%", "elapsed_time": "2h 2m 45s", "remaining_time": "55m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36721} +{"loss": 0.83004922, "grad_norm": 0.86964065, "learning_rate": 1.635e-05, "token_acc": 0.75064847, "epoch": 1.38047559, "global_step/max_steps": "552/800", "percentage": "69.00%", "elapsed_time": "2h 3m 1s", "remaining_time": "55m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.371976} +{"loss": 0.74842715, "grad_norm": 1.50405657, "learning_rate": 1.623e-05, "token_acc": 0.77553937, "epoch": 1.38297872, "global_step/max_steps": "553/800", "percentage": "69.12%", "elapsed_time": "2h 3m 12s", "remaining_time": "55m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36663} +{"loss": 0.70310163, "grad_norm": 7.28619671, "learning_rate": 1.612e-05, "token_acc": 0.78812928, "epoch": 1.38548185, "global_step/max_steps": "554/800", "percentage": "69.25%", "elapsed_time": "2h 3m 20s", "remaining_time": "54m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35793} +{"loss": 0.87264597, "grad_norm": 1.63590562, "learning_rate": 1.6e-05, "token_acc": 0.74189592, "epoch": 1.38798498, "global_step/max_steps": "555/800", "percentage": "69.38%", "elapsed_time": "2h 3m 37s", "remaining_time": "54m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363589} +{"loss": 0.70415705, "grad_norm": 5.04211855, "learning_rate": 1.589e-05, "token_acc": 0.7845845, "epoch": 1.39048811, "global_step/max_steps": "556/800", "percentage": "69.50%", "elapsed_time": "2h 3m 47s", "remaining_time": "54m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35873} +{"loss": 0.80250466, "grad_norm": 1.90652692, "learning_rate": 1.577e-05, "token_acc": 0.76267188, "epoch": 1.39299124, "global_step/max_steps": "557/800", "percentage": "69.62%", "elapsed_time": "2h 3m 58s", "remaining_time": "54m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353664} +{"loss": 0.677899, "grad_norm": 1.82502007, "learning_rate": 1.566e-05, "token_acc": 0.79090204, "epoch": 1.39549437, "global_step/max_steps": "558/800", "percentage": "69.75%", "elapsed_time": "2h 4m 7s", "remaining_time": "53m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345285} +{"loss": 0.87019587, "grad_norm": 2.21672297, "learning_rate": 1.555e-05, "token_acc": 0.74105976, "epoch": 1.3979975, "global_step/max_steps": "559/800", "percentage": "69.88%", "elapsed_time": "2h 4m 19s", "remaining_time": "53m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342722} +{"loss": 0.81221378, "grad_norm": 3.11357307, "learning_rate": 1.543e-05, "token_acc": 0.75730197, "epoch": 1.40050063, "global_step/max_steps": "560/800", "percentage": "70.00%", "elapsed_time": "2h 4m 33s", "remaining_time": "53m 23s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.34425} +{"loss": 0.7499758, "grad_norm": 1.59156704, "learning_rate": 1.532e-05, "token_acc": 0.7801376, "epoch": 1.40300375, "global_step/max_steps": "561/800", "percentage": "70.12%", "elapsed_time": "2h 4m 52s", "remaining_time": "53m 12s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354966} +{"loss": 0.78220069, "grad_norm": 2.6261034, "learning_rate": 1.521e-05, "token_acc": 0.7697957, "epoch": 1.40550688, "global_step/max_steps": "562/800", "percentage": "70.25%", "elapsed_time": "2h 5m 7s", "remaining_time": "52m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356795} +{"loss": 0.80591905, "grad_norm": 1.43389535, "learning_rate": 1.509e-05, "token_acc": 0.75838131, "epoch": 1.40801001, "global_step/max_steps": "563/800", "percentage": "70.38%", "elapsed_time": "2h 5m 18s", "remaining_time": "52m 45s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354071} +{"loss": 0.95656288, "grad_norm": 2.30676413, "learning_rate": 1.498e-05, "token_acc": 0.7224202, "epoch": 1.41051314, "global_step/max_steps": "564/800", "percentage": "70.50%", "elapsed_time": "2h 5m 37s", "remaining_time": "52m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363432} +{"loss": 0.7793439, "grad_norm": 4.14860344, "learning_rate": 1.487e-05, "token_acc": 0.77085754, "epoch": 1.41301627, "global_step/max_steps": "565/800", "percentage": "70.62%", "elapsed_time": "2h 5m 46s", "remaining_time": "52m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356605} +{"loss": 0.8436172, "grad_norm": 3.04089117, "learning_rate": 1.476e-05, "token_acc": 0.74918515, "epoch": 1.4155194, "global_step/max_steps": "566/800", "percentage": "70.75%", "elapsed_time": "2h 6m 7s", "remaining_time": "52m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.369021} +{"loss": 0.71220553, "grad_norm": 6.9713788, "learning_rate": 1.465e-05, "token_acc": 0.78753599, "epoch": 1.41802253, "global_step/max_steps": "567/800", "percentage": "70.88%", "elapsed_time": "2h 6m 19s", "remaining_time": "51m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367549} +{"loss": 0.74492216, "grad_norm": 2.55896783, "learning_rate": 1.453e-05, "token_acc": 0.77316349, "epoch": 1.42052566, "global_step/max_steps": "568/800", "percentage": "71.00%", "elapsed_time": "2h 6m 32s", "remaining_time": "51m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367052} +{"loss": 0.85472363, "grad_norm": 3.40655136, "learning_rate": 1.442e-05, "token_acc": 0.74754474, "epoch": 1.42302879, "global_step/max_steps": "569/800", "percentage": "71.12%", "elapsed_time": "2h 6m 57s", "remaining_time": "51m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.38709} +{"loss": 0.79978126, "grad_norm": 2.04473305, "learning_rate": 1.431e-05, "token_acc": 0.75878586, "epoch": 1.42553191, "global_step/max_steps": "570/800", "percentage": "71.25%", "elapsed_time": "2h 7m 12s", "remaining_time": "51m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.389265} +{"loss": 0.76768279, "grad_norm": 19.27367783, "learning_rate": 1.42e-05, "token_acc": 0.77000777, "epoch": 1.42803504, "global_step/max_steps": "571/800", "percentage": "71.38%", "elapsed_time": "2h 7m 32s", "remaining_time": "51m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.401131} +{"loss": 0.7329694, "grad_norm": 3.67758155, "learning_rate": 1.409e-05, "token_acc": 0.77874453, "epoch": 1.43053817, "global_step/max_steps": "572/800", "percentage": "71.50%", "elapsed_time": "2h 7m 45s", "remaining_time": "50m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.399561} +{"loss": 0.66242182, "grad_norm": 2.75078201, "learning_rate": 1.398e-05, "token_acc": 0.79902372, "epoch": 1.4330413, "global_step/max_steps": "573/800", "percentage": "71.62%", "elapsed_time": "2h 7m 56s", "remaining_time": "50m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.395875} +{"loss": 0.78687489, "grad_norm": 1.7288239, "learning_rate": 1.387e-05, "token_acc": 0.76918571, "epoch": 1.43554443, "global_step/max_steps": "574/800", "percentage": "71.75%", "elapsed_time": "2h 8m 4s", "remaining_time": "50m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.387206} +{"loss": 0.85547537, "grad_norm": 1.54242074, "learning_rate": 1.376e-05, "token_acc": 0.74597465, "epoch": 1.43804756, "global_step/max_steps": "575/800", "percentage": "71.88%", "elapsed_time": "2h 8m 26s", "remaining_time": "50m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.402313} +{"loss": 0.8055591, "grad_norm": 1.57995296, "learning_rate": 1.365e-05, "token_acc": 0.76277819, "epoch": 1.44055069, "global_step/max_steps": "576/800", "percentage": "72.00%", "elapsed_time": "2h 8m 40s", "remaining_time": "50m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.402191} +{"loss": 0.81560874, "grad_norm": 2.37976575, "learning_rate": 1.354e-05, "token_acc": 0.75871342, "epoch": 1.44305382, "global_step/max_steps": "577/800", "percentage": "72.12%", "elapsed_time": "2h 8m 52s", "remaining_time": "49m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.400381} +{"loss": 0.65626419, "grad_norm": 5.06103086, "learning_rate": 1.343e-05, "token_acc": 0.80272166, "epoch": 1.44555695, "global_step/max_steps": "578/800", "percentage": "72.25%", "elapsed_time": "2h 9m 6s", "remaining_time": "49m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.401059} +{"loss": 0.64406574, "grad_norm": 3.10705137, "learning_rate": 1.332e-05, "token_acc": 0.80685003, "epoch": 1.44806008, "global_step/max_steps": "579/800", "percentage": "72.38%", "elapsed_time": "2h 9m 14s", "remaining_time": "49m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.391443} +{"loss": 0.76214314, "grad_norm": 1.51273894, "learning_rate": 1.322e-05, "token_acc": 0.77776966, "epoch": 1.4505632, "global_step/max_steps": "580/800", "percentage": "72.50%", "elapsed_time": "2h 9m 25s", "remaining_time": "49m 5s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.387939} +{"loss": 0.74518496, "grad_norm": 3.79168582, "learning_rate": 1.311e-05, "token_acc": 0.77287362, "epoch": 1.45306633, "global_step/max_steps": "581/800", "percentage": "72.62%", "elapsed_time": "2h 9m 44s", "remaining_time": "48m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.397063} +{"loss": 0.9144057, "grad_norm": 1.42532146, "learning_rate": 1.3e-05, "token_acc": 0.73584528, "epoch": 1.45556946, "global_step/max_steps": "582/800", "percentage": "72.75%", "elapsed_time": "2h 9m 59s", "remaining_time": "48m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.400706} +{"loss": 0.64996123, "grad_norm": 2.42952323, "learning_rate": 1.289e-05, "token_acc": 0.80228284, "epoch": 1.45807259, "global_step/max_steps": "583/800", "percentage": "72.88%", "elapsed_time": "2h 10m 8s", "remaining_time": "48m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.393288} +{"loss": 0.85458076, "grad_norm": 1.50686669, "learning_rate": 1.278e-05, "token_acc": 0.74382123, "epoch": 1.46057572, "global_step/max_steps": "584/800", "percentage": "73.00%", "elapsed_time": "2h 10m 29s", "remaining_time": "48m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.406155} +{"loss": 0.725537, "grad_norm": 1.14063561, "learning_rate": 1.268e-05, "token_acc": 0.78108901, "epoch": 1.46307885, "global_step/max_steps": "585/800", "percentage": "73.12%", "elapsed_time": "2h 10m 41s", "remaining_time": "48m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.403889} +{"loss": 0.7315889, "grad_norm": 2.09649944, "learning_rate": 1.257e-05, "token_acc": 0.77543885, "epoch": 1.46558198, "global_step/max_steps": "586/800", "percentage": "73.25%", "elapsed_time": "2h 10m 50s", "remaining_time": "47m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.396694} +{"loss": 0.82307875, "grad_norm": 5.34469175, "learning_rate": 1.246e-05, "token_acc": 0.75236314, "epoch": 1.46808511, "global_step/max_steps": "587/800", "percentage": "73.38%", "elapsed_time": "2h 11m 5s", "remaining_time": "47m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.398799} +{"loss": 0.67674613, "grad_norm": 1.97725594, "learning_rate": 1.236e-05, "token_acc": 0.79304426, "epoch": 1.47058824, "global_step/max_steps": "588/800", "percentage": "73.50%", "elapsed_time": "2h 11m 14s", "remaining_time": "47m 19s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.3914} +{"loss": 0.72446573, "grad_norm": 1.33468366, "learning_rate": 1.225e-05, "token_acc": 0.7811463, "epoch": 1.47309136, "global_step/max_steps": "589/800", "percentage": "73.62%", "elapsed_time": "2h 11m 27s", "remaining_time": "47m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.391331} +{"loss": 0.66611785, "grad_norm": 3.22213411, "learning_rate": 1.215e-05, "token_acc": 0.79924591, "epoch": 1.47559449, "global_step/max_steps": "590/800", "percentage": "73.75%", "elapsed_time": "2h 11m 40s", "remaining_time": "46m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.389981} +{"loss": 0.74445403, "grad_norm": 4.24128914, "learning_rate": 1.204e-05, "token_acc": 0.77693939, "epoch": 1.47809762, "global_step/max_steps": "591/800", "percentage": "73.88%", "elapsed_time": "2h 12m 4s", "remaining_time": "46m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.407012} +{"loss": 0.63793933, "grad_norm": 7.12760782, "learning_rate": 1.194e-05, "token_acc": 0.80441609, "epoch": 1.48060075, "global_step/max_steps": "592/800", "percentage": "74.00%", "elapsed_time": "2h 12m 12s", "remaining_time": "46m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.399221} +{"loss": 0.76461655, "grad_norm": 1.67700326, "learning_rate": 1.183e-05, "token_acc": 0.76875849, "epoch": 1.48310388, "global_step/max_steps": "593/800", "percentage": "74.12%", "elapsed_time": "2h 12m 31s", "remaining_time": "46m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.407531} +{"loss": 0.80556393, "grad_norm": 1.28435063, "learning_rate": 1.173e-05, "token_acc": 0.76315503, "epoch": 1.48560701, "global_step/max_steps": "594/800", "percentage": "74.25%", "elapsed_time": "2h 12m 43s", "remaining_time": "46m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.405019} +{"loss": 0.7198689, "grad_norm": 1.22869134, "learning_rate": 1.163e-05, "token_acc": 0.77689505, "epoch": 1.48811014, "global_step/max_steps": "595/800", "percentage": "74.38%", "elapsed_time": "2h 12m 55s", "remaining_time": "45m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.403226} +{"loss": 0.66524017, "grad_norm": 4.1220603, "learning_rate": 1.152e-05, "token_acc": 0.79827245, "epoch": 1.49061327, "global_step/max_steps": "596/800", "percentage": "74.50%", "elapsed_time": "2h 13m 1s", "remaining_time": "45m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.391765} +{"loss": 0.82032132, "grad_norm": 3.43197107, "learning_rate": 1.142e-05, "token_acc": 0.75351285, "epoch": 1.4931164, "global_step/max_steps": "597/800", "percentage": "74.62%", "elapsed_time": "2h 13m 20s", "remaining_time": "45m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.400822} +{"loss": 0.87632555, "grad_norm": 1.95249736, "learning_rate": 1.132e-05, "token_acc": 0.74295909, "epoch": 1.49561952, "global_step/max_steps": "598/800", "percentage": "74.75%", "elapsed_time": "2h 13m 33s", "remaining_time": "45m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.400402} +{"loss": 0.70973819, "grad_norm": 2.49437237, "learning_rate": 1.121e-05, "token_acc": 0.7815608, "epoch": 1.49812265, "global_step/max_steps": "599/800", "percentage": "74.88%", "elapsed_time": "2h 13m 42s", "remaining_time": "44m 52s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.392717} +{"loss": 0.76151824, "grad_norm": 21.61914444, "learning_rate": 1.111e-05, "token_acc": 0.76878759, "epoch": 1.50062578, "global_step/max_steps": "600/800", "percentage": "75.00%", "elapsed_time": "2h 13m 60s", "remaining_time": "44m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.399881} +{"loss": 0.74820107, "grad_norm": 1.6322248, "learning_rate": 1.101e-05, "token_acc": 0.77134725, "epoch": 1.50312891, "global_step/max_steps": "601/800", "percentage": "75.12%", "elapsed_time": "2h 14m 22s", "remaining_time": "44m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.414399} +{"loss": 0.89053679, "grad_norm": 1.0364089, "learning_rate": 1.091e-05, "token_acc": 0.74018842, "epoch": 1.50563204, "global_step/max_steps": "602/800", "percentage": "75.25%", "elapsed_time": "2h 14m 34s", "remaining_time": "44m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.412018} +{"loss": 0.77363682, "grad_norm": 4.59452391, "learning_rate": 1.081e-05, "token_acc": 0.77225057, "epoch": 1.50813517, "global_step/max_steps": "603/800", "percentage": "75.38%", "elapsed_time": "2h 14m 48s", "remaining_time": "44m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.41238} +{"loss": 0.74430859, "grad_norm": 1.89778948, "learning_rate": 1.071e-05, "token_acc": 0.77259121, "epoch": 1.5106383, "global_step/max_steps": "604/800", "percentage": "75.50%", "elapsed_time": "2h 14m 56s", "remaining_time": "43m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.4033} +{"loss": 0.69079572, "grad_norm": 3.59027267, "learning_rate": 1.06e-05, "token_acc": 0.78949782, "epoch": 1.51314143, "global_step/max_steps": "605/800", "percentage": "75.62%", "elapsed_time": "2h 15m 4s", "remaining_time": "43m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.39442} +{"loss": 0.89402211, "grad_norm": 1.70165205, "learning_rate": 1.05e-05, "token_acc": 0.73945525, "epoch": 1.51564456, "global_step/max_steps": "606/800", "percentage": "75.75%", "elapsed_time": "2h 15m 23s", "remaining_time": "43m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.403678} +{"loss": 0.83624399, "grad_norm": 1.51579666, "learning_rate": 1.04e-05, "token_acc": 0.74727301, "epoch": 1.51814768, "global_step/max_steps": "607/800", "percentage": "75.88%", "elapsed_time": "2h 15m 36s", "remaining_time": "43m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.403521} +{"loss": 0.78686523, "grad_norm": 2.32350087, "learning_rate": 1.031e-05, "token_acc": 0.76440099, "epoch": 1.52065081, "global_step/max_steps": "608/800", "percentage": "76.00%", "elapsed_time": "2h 15m 49s", "remaining_time": "42m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.403503} +{"loss": 0.79500473, "grad_norm": 74.33378601, "learning_rate": 1.021e-05, "token_acc": 0.75780228, "epoch": 1.52315394, "global_step/max_steps": "609/800", "percentage": "76.12%", "elapsed_time": "2h 16m 4s", "remaining_time": "42m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.406087} +{"loss": 0.61474442, "grad_norm": 3.37888336, "learning_rate": 1.011e-05, "token_acc": 0.81575196, "epoch": 1.52565707, "global_step/max_steps": "610/800", "percentage": "76.25%", "elapsed_time": "2h 16m 15s", "remaining_time": "42m 26s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.401129} +{"loss": 0.6397149, "grad_norm": 2.66544771, "learning_rate": 1.001e-05, "token_acc": 0.7999816, "epoch": 1.5281602, "global_step/max_steps": "611/800", "percentage": "76.38%", "elapsed_time": "2h 16m 34s", "remaining_time": "42m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.411611} +{"loss": 0.76128078, "grad_norm": 1.69654977, "learning_rate": 9.91e-06, "token_acc": 0.77220219, "epoch": 1.53066333, "global_step/max_steps": "612/800", "percentage": "76.50%", "elapsed_time": "2h 16m 48s", "remaining_time": "42m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.412546} +{"loss": 0.65788335, "grad_norm": 2.22549105, "learning_rate": 9.81e-06, "token_acc": 0.80188852, "epoch": 1.53316646, "global_step/max_steps": "613/800", "percentage": "76.62%", "elapsed_time": "2h 16m 58s", "remaining_time": "41m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.405967} +{"loss": 0.83859217, "grad_norm": 1.93630135, "learning_rate": 9.72e-06, "token_acc": 0.74995234, "epoch": 1.53566959, "global_step/max_steps": "614/800", "percentage": "76.75%", "elapsed_time": "2h 17m 7s", "remaining_time": "41m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.398714} +{"loss": 0.74411625, "grad_norm": 3.2593317, "learning_rate": 9.62e-06, "token_acc": 0.776237, "epoch": 1.53817272, "global_step/max_steps": "615/800", "percentage": "76.88%", "elapsed_time": "2h 17m 14s", "remaining_time": "41m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.389167} +{"loss": 0.7276873, "grad_norm": 3.53605413, "learning_rate": 9.52e-06, "token_acc": 0.77256862, "epoch": 1.54067584, "global_step/max_steps": "616/800", "percentage": "77.00%", "elapsed_time": "2h 17m 23s", "remaining_time": "41m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.381935} +{"loss": 0.70214552, "grad_norm": 1.20168221, "learning_rate": 9.43e-06, "token_acc": 0.78857184, "epoch": 1.54317897, "global_step/max_steps": "617/800", "percentage": "77.12%", "elapsed_time": "2h 17m 34s", "remaining_time": "40m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.378062} +{"loss": 0.79665226, "grad_norm": 1.12232351, "learning_rate": 9.33e-06, "token_acc": 0.75998228, "epoch": 1.5456821, "global_step/max_steps": "618/800", "percentage": "77.25%", "elapsed_time": "2h 17m 49s", "remaining_time": "40m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.380416} +{"loss": 0.81008041, "grad_norm": 2.9685421, "learning_rate": 9.24e-06, "token_acc": 0.75640138, "epoch": 1.54818523, "global_step/max_steps": "619/800", "percentage": "77.38%", "elapsed_time": "2h 17m 60s", "remaining_time": "40m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.3763} +{"loss": 0.77544916, "grad_norm": 2.11517358, "learning_rate": 9.14e-06, "token_acc": 0.76945367, "epoch": 1.55068836, "global_step/max_steps": "620/800", "percentage": "77.50%", "elapsed_time": "2h 18m 11s", "remaining_time": "40m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.372873} +{"loss": 0.81593442, "grad_norm": 1.0308007, "learning_rate": 9.05e-06, "token_acc": 0.75456919, "epoch": 1.55319149, "global_step/max_steps": "621/800", "percentage": "77.62%", "elapsed_time": "2h 18m 37s", "remaining_time": "39m 57s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.392721} +{"loss": 0.609671, "grad_norm": 9.53903294, "learning_rate": 8.95e-06, "token_acc": 0.81409295, "epoch": 1.55569462, "global_step/max_steps": "622/800", "percentage": "77.75%", "elapsed_time": "2h 18m 44s", "remaining_time": "39m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.382737} +{"loss": 0.66828185, "grad_norm": 3.73937964, "learning_rate": 8.86e-06, "token_acc": 0.80301733, "epoch": 1.55819775, "global_step/max_steps": "623/800", "percentage": "77.88%", "elapsed_time": "2h 18m 51s", "remaining_time": "39m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.37211} +{"loss": 0.81896877, "grad_norm": 2.91712713, "learning_rate": 8.76e-06, "token_acc": 0.75797353, "epoch": 1.56070088, "global_step/max_steps": "624/800", "percentage": "78.00%", "elapsed_time": "2h 19m 1s", "remaining_time": "39m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367197} +{"loss": 0.83470309, "grad_norm": 3.65399861, "learning_rate": 8.67e-06, "token_acc": 0.7483955, "epoch": 1.56320401, "global_step/max_steps": "625/800", "percentage": "78.12%", "elapsed_time": "2h 19m 16s", "remaining_time": "38m 60s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.369116} +{"loss": 0.79740858, "grad_norm": 3.22063112, "learning_rate": 8.58e-06, "token_acc": 0.76262052, "epoch": 1.56570713, "global_step/max_steps": "626/800", "percentage": "78.25%", "elapsed_time": "2h 19m 28s", "remaining_time": "38m 46s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.366655} +{"loss": 0.6958124, "grad_norm": 1.85763335, "learning_rate": 8.49e-06, "token_acc": 0.78935946, "epoch": 1.56821026, "global_step/max_steps": "627/800", "percentage": "78.38%", "elapsed_time": "2h 19m 38s", "remaining_time": "38m 32s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.36241} +{"loss": 0.63960898, "grad_norm": 3.20312786, "learning_rate": 8.39e-06, "token_acc": 0.80189995, "epoch": 1.57071339, "global_step/max_steps": "628/800", "percentage": "78.50%", "elapsed_time": "2h 19m 46s", "remaining_time": "38m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353953} +{"loss": 0.67565411, "grad_norm": 10.86711979, "learning_rate": 8.3e-06, "token_acc": 0.79083391, "epoch": 1.57321652, "global_step/max_steps": "629/800", "percentage": "78.62%", "elapsed_time": "2h 19m 55s", "remaining_time": "38m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.346765} +{"loss": 0.79459929, "grad_norm": 1.90482354, "learning_rate": 8.21e-06, "token_acc": 0.76125184, "epoch": 1.57571965, "global_step/max_steps": "630/800", "percentage": "78.75%", "elapsed_time": "2h 20m 3s", "remaining_time": "37m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.338054} +{"loss": 0.87794584, "grad_norm": 5.72131777, "learning_rate": 8.12e-06, "token_acc": 0.73602825, "epoch": 1.57822278, "global_step/max_steps": "631/800", "percentage": "78.88%", "elapsed_time": "2h 20m 34s", "remaining_time": "37m 39s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.366092} +{"loss": 0.62396324, "grad_norm": 6.48999643, "learning_rate": 8.03e-06, "token_acc": 0.81782242, "epoch": 1.58072591, "global_step/max_steps": "632/800", "percentage": "79.00%", "elapsed_time": "2h 20m 43s", "remaining_time": "37m 24s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.358701} +{"loss": 0.60353684, "grad_norm": 2.63500309, "learning_rate": 7.94e-06, "token_acc": 0.81626914, "epoch": 1.58322904, "global_step/max_steps": "633/800", "percentage": "79.12%", "elapsed_time": "2h 20m 53s", "remaining_time": "37m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354656} +{"loss": 0.68872887, "grad_norm": 5.44214678, "learning_rate": 7.85e-06, "token_acc": 0.79068944, "epoch": 1.58573217, "global_step/max_steps": "634/800", "percentage": "79.25%", "elapsed_time": "2h 21m 1s", "remaining_time": "36m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345104} +{"loss": 0.69099265, "grad_norm": 1.43201101, "learning_rate": 7.76e-06, "token_acc": 0.78966478, "epoch": 1.58823529, "global_step/max_steps": "635/800", "percentage": "79.38%", "elapsed_time": "2h 21m 9s", "remaining_time": "36m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.337636} +{"loss": 0.766559, "grad_norm": 1.95646191, "learning_rate": 7.67e-06, "token_acc": 0.77023604, "epoch": 1.59073842, "global_step/max_steps": "636/800", "percentage": "79.50%", "elapsed_time": "2h 21m 23s", "remaining_time": "36m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.338389} +{"loss": 0.81048274, "grad_norm": 1.28586543, "learning_rate": 7.58e-06, "token_acc": 0.75595606, "epoch": 1.59324155, "global_step/max_steps": "637/800", "percentage": "79.62%", "elapsed_time": "2h 21m 42s", "remaining_time": "36m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347712} +{"loss": 0.59264219, "grad_norm": 8.48723125, "learning_rate": 7.5e-06, "token_acc": 0.8263586, "epoch": 1.59574468, "global_step/max_steps": "638/800", "percentage": "79.75%", "elapsed_time": "2h 21m 50s", "remaining_time": "36m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.338909} +{"loss": 0.93332326, "grad_norm": 1.63534892, "learning_rate": 7.41e-06, "token_acc": 0.72734311, "epoch": 1.59824781, "global_step/max_steps": "639/800", "percentage": "79.88%", "elapsed_time": "2h 22m 9s", "remaining_time": "35m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347901} +{"loss": 0.7266283, "grad_norm": 4.05323935, "learning_rate": 7.32e-06, "token_acc": 0.77672003, "epoch": 1.60075094, "global_step/max_steps": "640/800", "percentage": "80.00%", "elapsed_time": "2h 22m 22s", "remaining_time": "35m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347315} +{"loss": 0.79616487, "grad_norm": 2.14143896, "learning_rate": 7.24e-06, "token_acc": 0.76246491, "epoch": 1.60325407, "global_step/max_steps": "641/800", "percentage": "80.12%", "elapsed_time": "2h 22m 45s", "remaining_time": "35m 24s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.361203} +{"loss": 0.81600559, "grad_norm": 1.88182139, "learning_rate": 7.15e-06, "token_acc": 0.75714676, "epoch": 1.6057572, "global_step/max_steps": "642/800", "percentage": "80.25%", "elapsed_time": "2h 23m 3s", "remaining_time": "35m 12s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.368689} +{"loss": 0.93946993, "grad_norm": 0.72742581, "learning_rate": 7.06e-06, "token_acc": 0.72326351, "epoch": 1.60826033, "global_step/max_steps": "643/800", "percentage": "80.38%", "elapsed_time": "2h 23m 22s", "remaining_time": "35m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.378521} +{"loss": 0.87285662, "grad_norm": 2.10223293, "learning_rate": 6.98e-06, "token_acc": 0.73990444, "epoch": 1.61076345, "global_step/max_steps": "644/800", "percentage": "80.50%", "elapsed_time": "2h 23m 41s", "remaining_time": "34m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.386691} +{"loss": 0.76785219, "grad_norm": 2.11723208, "learning_rate": 6.89e-06, "token_acc": 0.7683991, "epoch": 1.61326658, "global_step/max_steps": "645/800", "percentage": "80.62%", "elapsed_time": "2h 23m 52s", "remaining_time": "34m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.382195} +{"loss": 0.71381044, "grad_norm": 2.11392498, "learning_rate": 6.81e-06, "token_acc": 0.78822091, "epoch": 1.61576971, "global_step/max_steps": "646/800", "percentage": "80.75%", "elapsed_time": "2h 24m 0s", "remaining_time": "34m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.375008} +{"loss": 0.87298244, "grad_norm": 10.1246767, "learning_rate": 6.73e-06, "token_acc": 0.74020894, "epoch": 1.61827284, "global_step/max_steps": "647/800", "percentage": "80.88%", "elapsed_time": "2h 24m 18s", "remaining_time": "34m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.381469} +{"loss": 0.75057453, "grad_norm": 2.04048157, "learning_rate": 6.64e-06, "token_acc": 0.77281524, "epoch": 1.62077597, "global_step/max_steps": "648/800", "percentage": "81.00%", "elapsed_time": "2h 24m 28s", "remaining_time": "33m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.375978} +{"loss": 0.60922563, "grad_norm": 3.3579545, "learning_rate": 6.56e-06, "token_acc": 0.81221771, "epoch": 1.6232791, "global_step/max_steps": "649/800", "percentage": "81.12%", "elapsed_time": "2h 24m 34s", "remaining_time": "33m 38s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.365386} +{"loss": 0.80656427, "grad_norm": 1.6319387, "learning_rate": 6.48e-06, "token_acc": 0.76089714, "epoch": 1.62578223, "global_step/max_steps": "650/800", "percentage": "81.25%", "elapsed_time": "2h 24m 48s", "remaining_time": "33m 25s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.3657} +{"loss": 0.81111336, "grad_norm": 4.51810503, "learning_rate": 6.39e-06, "token_acc": 0.75877577, "epoch": 1.62828536, "global_step/max_steps": "651/800", "percentage": "81.38%", "elapsed_time": "2h 25m 8s", "remaining_time": "33m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.375692} +{"loss": 0.62432384, "grad_norm": 3.55744815, "learning_rate": 6.31e-06, "token_acc": 0.8063609, "epoch": 1.63078849, "global_step/max_steps": "652/800", "percentage": "81.50%", "elapsed_time": "2h 25m 17s", "remaining_time": "32m 59s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.369036} +{"loss": 0.72013277, "grad_norm": 2.84332848, "learning_rate": 6.23e-06, "token_acc": 0.78446312, "epoch": 1.63329161, "global_step/max_steps": "653/800", "percentage": "81.62%", "elapsed_time": "2h 25m 27s", "remaining_time": "32m 45s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.364782} +{"loss": 0.84911305, "grad_norm": 1.20217717, "learning_rate": 6.15e-06, "token_acc": 0.74837847, "epoch": 1.63579474, "global_step/max_steps": "654/800", "percentage": "81.75%", "elapsed_time": "2h 25m 38s", "remaining_time": "32m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.360282} +{"loss": 0.83592296, "grad_norm": 1.20910907, "learning_rate": 6.07e-06, "token_acc": 0.75125546, "epoch": 1.63829787, "global_step/max_steps": "655/800", "percentage": "81.88%", "elapsed_time": "2h 25m 48s", "remaining_time": "32m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.355954} +{"loss": 0.77481866, "grad_norm": 10.08758068, "learning_rate": 5.99e-06, "token_acc": 0.76943277, "epoch": 1.640801, "global_step/max_steps": "656/800", "percentage": "82.00%", "elapsed_time": "2h 25m 59s", "remaining_time": "32m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35146} +{"loss": 0.88465786, "grad_norm": 1.49860895, "learning_rate": 5.91e-06, "token_acc": 0.73946529, "epoch": 1.64330413, "global_step/max_steps": "657/800", "percentage": "82.12%", "elapsed_time": "2h 26m 17s", "remaining_time": "31m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359485} +{"loss": 0.61314201, "grad_norm": 3.27640295, "learning_rate": 5.83e-06, "token_acc": 0.81325109, "epoch": 1.64580726, "global_step/max_steps": "658/800", "percentage": "82.25%", "elapsed_time": "2h 26m 25s", "remaining_time": "31m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.351403} +{"loss": 0.80312479, "grad_norm": 2.06429505, "learning_rate": 5.75e-06, "token_acc": 0.76145833, "epoch": 1.64831039, "global_step/max_steps": "659/800", "percentage": "82.38%", "elapsed_time": "2h 26m 34s", "remaining_time": "31m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.344453} +{"loss": 0.77107739, "grad_norm": 1.2550472, "learning_rate": 5.67e-06, "token_acc": 0.76945156, "epoch": 1.65081352, "global_step/max_steps": "660/800", "percentage": "82.50%", "elapsed_time": "2h 26m 46s", "remaining_time": "31m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342792} +{"loss": 0.72226226, "grad_norm": 2.36438179, "learning_rate": 5.6e-06, "token_acc": 0.78590058, "epoch": 1.65331665, "global_step/max_steps": "661/800", "percentage": "82.62%", "elapsed_time": "2h 27m 6s", "remaining_time": "30m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.3519} +{"loss": 0.71975565, "grad_norm": 3.98560262, "learning_rate": 5.52e-06, "token_acc": 0.78724145, "epoch": 1.65581977, "global_step/max_steps": "662/800", "percentage": "82.75%", "elapsed_time": "2h 27m 22s", "remaining_time": "30m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356355} +{"loss": 0.60389733, "grad_norm": 3.46688938, "learning_rate": 5.44e-06, "token_acc": 0.81728939, "epoch": 1.6583229, "global_step/max_steps": "663/800", "percentage": "82.88%", "elapsed_time": "2h 27m 30s", "remaining_time": "30m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.348557} +{"loss": 0.63881022, "grad_norm": 16.53186226, "learning_rate": 5.37e-06, "token_acc": 0.80468676, "epoch": 1.66082603, "global_step/max_steps": "664/800", "percentage": "83.00%", "elapsed_time": "2h 27m 37s", "remaining_time": "30m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.339479} +{"loss": 0.69127673, "grad_norm": 3.9002862, "learning_rate": 5.29e-06, "token_acc": 0.79296944, "epoch": 1.66332916, "global_step/max_steps": "665/800", "percentage": "83.12%", "elapsed_time": "2h 27m 51s", "remaining_time": "30m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.339283} +{"loss": 0.67701536, "grad_norm": 1.71964848, "learning_rate": 5.22e-06, "token_acc": 0.79551693, "epoch": 1.66583229, "global_step/max_steps": "666/800", "percentage": "83.25%", "elapsed_time": "2h 27m 60s", "remaining_time": "29m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.33318} +{"loss": 0.84962904, "grad_norm": 1.48101962, "learning_rate": 5.14e-06, "token_acc": 0.74969008, "epoch": 1.66833542, "global_step/max_steps": "667/800", "percentage": "83.38%", "elapsed_time": "2h 28m 10s", "remaining_time": "29m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.327632} +{"loss": 0.81044149, "grad_norm": 2.02133846, "learning_rate": 5.07e-06, "token_acc": 0.75538914, "epoch": 1.67083855, "global_step/max_steps": "668/800", "percentage": "83.50%", "elapsed_time": "2h 28m 24s", "remaining_time": "29m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.330084} +{"loss": 0.80001295, "grad_norm": 1.48013699, "learning_rate": 4.99e-06, "token_acc": 0.76111111, "epoch": 1.67334168, "global_step/max_steps": "669/800", "percentage": "83.62%", "elapsed_time": "2h 28m 37s", "remaining_time": "29m 6s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.328829} +{"loss": 0.80522466, "grad_norm": 1.97854185, "learning_rate": 4.92e-06, "token_acc": 0.75550926, "epoch": 1.67584481, "global_step/max_steps": "670/800", "percentage": "83.75%", "elapsed_time": "2h 28m 53s", "remaining_time": "28m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.333091} +{"loss": 0.82325345, "grad_norm": 2.41002083, "learning_rate": 4.85e-06, "token_acc": 0.74652273, "epoch": 1.67834793, "global_step/max_steps": "671/800", "percentage": "83.88%", "elapsed_time": "2h 29m 15s", "remaining_time": "28m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345385} +{"loss": 0.85962301, "grad_norm": 1.39450979, "learning_rate": 4.77e-06, "token_acc": 0.74546408, "epoch": 1.68085106, "global_step/max_steps": "672/800", "percentage": "84.00%", "elapsed_time": "2h 29m 41s", "remaining_time": "28m 31s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.364824} +{"loss": 0.68804872, "grad_norm": 1.8322562, "learning_rate": 4.7e-06, "token_acc": 0.7828983, "epoch": 1.68335419, "global_step/max_steps": "673/800", "percentage": "84.12%", "elapsed_time": "2h 29m 55s", "remaining_time": "28m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.365412} +{"loss": 0.75998592, "grad_norm": 2.15707946, "learning_rate": 4.63e-06, "token_acc": 0.7674839, "epoch": 1.68585732, "global_step/max_steps": "674/800", "percentage": "84.25%", "elapsed_time": "2h 30m 4s", "remaining_time": "28m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359036} +{"loss": 0.73939222, "grad_norm": 1.96603703, "learning_rate": 4.56e-06, "token_acc": 0.77445378, "epoch": 1.68836045, "global_step/max_steps": "675/800", "percentage": "84.38%", "elapsed_time": "2h 30m 12s", "remaining_time": "27m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.351567} +{"loss": 0.85934901, "grad_norm": 2.89530301, "learning_rate": 4.49e-06, "token_acc": 0.74334998, "epoch": 1.69086358, "global_step/max_steps": "676/800", "percentage": "84.50%", "elapsed_time": "2h 30m 27s", "remaining_time": "27m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353779} +{"loss": 0.78442752, "grad_norm": 1.1050508, "learning_rate": 4.42e-06, "token_acc": 0.76518605, "epoch": 1.69336671, "global_step/max_steps": "677/800", "percentage": "84.62%", "elapsed_time": "2h 30m 39s", "remaining_time": "27m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.350901} +{"loss": 0.79781902, "grad_norm": 7.61273098, "learning_rate": 4.35e-06, "token_acc": 0.76326563, "epoch": 1.69586984, "global_step/max_steps": "678/800", "percentage": "84.75%", "elapsed_time": "2h 30m 56s", "remaining_time": "27m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356971} +{"loss": 0.85011029, "grad_norm": 0.96663916, "learning_rate": 4.28e-06, "token_acc": 0.74856555, "epoch": 1.69837297, "global_step/max_steps": "679/800", "percentage": "84.88%", "elapsed_time": "2h 31m 14s", "remaining_time": "26m 57s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.364281} +{"loss": 0.71213377, "grad_norm": 1.67585075, "learning_rate": 4.21e-06, "token_acc": 0.78681741, "epoch": 1.7008761, "global_step/max_steps": "680/800", "percentage": "85.00%", "elapsed_time": "2h 31m 23s", "remaining_time": "26m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356663} +{"loss": 0.72392982, "grad_norm": 2.09552169, "learning_rate": 4.15e-06, "token_acc": 0.78574803, "epoch": 1.70337922, "global_step/max_steps": "681/800", "percentage": "85.12%", "elapsed_time": "2h 31m 40s", "remaining_time": "26m 30s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.363387} +{"loss": 0.70463651, "grad_norm": 1.59458494, "learning_rate": 4.08e-06, "token_acc": 0.78468757, "epoch": 1.70588235, "global_step/max_steps": "682/800", "percentage": "85.25%", "elapsed_time": "2h 31m 52s", "remaining_time": "26m 17s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.361063} +{"loss": 0.67176431, "grad_norm": 1.69760251, "learning_rate": 4.01e-06, "token_acc": 0.79797013, "epoch": 1.70838548, "global_step/max_steps": "683/800", "percentage": "85.38%", "elapsed_time": "2h 31m 60s", "remaining_time": "26m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.352564} +{"loss": 0.84058523, "grad_norm": 4.04798174, "learning_rate": 3.94e-06, "token_acc": 0.75214824, "epoch": 1.71088861, "global_step/max_steps": "684/800", "percentage": "85.50%", "elapsed_time": "2h 32m 14s", "remaining_time": "25m 49s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354131} +{"loss": 0.6040501, "grad_norm": 3.37283874, "learning_rate": 3.88e-06, "token_acc": 0.81643507, "epoch": 1.71339174, "global_step/max_steps": "685/800", "percentage": "85.62%", "elapsed_time": "2h 32m 23s", "remaining_time": "25m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347609} +{"loss": 0.88312078, "grad_norm": 4.26987076, "learning_rate": 3.81e-06, "token_acc": 0.73578079, "epoch": 1.71589487, "global_step/max_steps": "686/800", "percentage": "85.75%", "elapsed_time": "2h 32m 41s", "remaining_time": "25m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354147} +{"loss": 0.83607841, "grad_norm": 2.93204522, "learning_rate": 3.75e-06, "token_acc": 0.74961013, "epoch": 1.718398, "global_step/max_steps": "687/800", "percentage": "85.88%", "elapsed_time": "2h 32m 58s", "remaining_time": "25m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359147} +{"loss": 0.70110863, "grad_norm": 1.57190108, "learning_rate": 3.68e-06, "token_acc": 0.78883825, "epoch": 1.72090113, "global_step/max_steps": "688/800", "percentage": "86.00%", "elapsed_time": "2h 33m 7s", "remaining_time": "24m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.352587} +{"loss": 0.69824028, "grad_norm": 4.48365116, "learning_rate": 3.62e-06, "token_acc": 0.78683992, "epoch": 1.72340426, "global_step/max_steps": "689/800", "percentage": "86.12%", "elapsed_time": "2h 33m 15s", "remaining_time": "24m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345931} +{"loss": 0.7384522, "grad_norm": 1.82357287, "learning_rate": 3.56e-06, "token_acc": 0.7768056, "epoch": 1.72590738, "global_step/max_steps": "690/800", "percentage": "86.25%", "elapsed_time": "2h 33m 25s", "remaining_time": "24m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.340182} +{"loss": 0.6786567, "grad_norm": 16.56992722, "learning_rate": 3.49e-06, "token_acc": 0.79620279, "epoch": 1.72841051, "global_step/max_steps": "691/800", "percentage": "86.38%", "elapsed_time": "2h 33m 43s", "remaining_time": "24m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347943} +{"loss": 0.61439741, "grad_norm": 1.59508169, "learning_rate": 3.43e-06, "token_acc": 0.81298213, "epoch": 1.73091364, "global_step/max_steps": "692/800", "percentage": "86.50%", "elapsed_time": "2h 33m 55s", "remaining_time": "24m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345142} +{"loss": 0.68243331, "grad_norm": 3.72209692, "learning_rate": 3.37e-06, "token_acc": 0.79380198, "epoch": 1.73341677, "global_step/max_steps": "693/800", "percentage": "86.62%", "elapsed_time": "2h 34m 6s", "remaining_time": "23m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.341384} +{"loss": 0.80881995, "grad_norm": 1.56058025, "learning_rate": 3.31e-06, "token_acc": 0.75400811, "epoch": 1.7359199, "global_step/max_steps": "694/800", "percentage": "86.75%", "elapsed_time": "2h 34m 25s", "remaining_time": "23m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.350386} +{"loss": 0.77798837, "grad_norm": 1.33835649, "learning_rate": 3.25e-06, "token_acc": 0.76836116, "epoch": 1.73842303, "global_step/max_steps": "695/800", "percentage": "86.88%", "elapsed_time": "2h 34m 33s", "remaining_time": "23m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.343145} +{"loss": 0.79463506, "grad_norm": 1.56425166, "learning_rate": 3.19e-06, "token_acc": 0.76055154, "epoch": 1.74092616, "global_step/max_steps": "696/800", "percentage": "87.00%", "elapsed_time": "2h 34m 49s", "remaining_time": "23m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345699} +{"loss": 0.70236588, "grad_norm": 5.63988781, "learning_rate": 3.13e-06, "token_acc": 0.78816431, "epoch": 1.74342929, "global_step/max_steps": "697/800", "percentage": "87.12%", "elapsed_time": "2h 34m 57s", "remaining_time": "22m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.339282} +{"loss": 0.8359921, "grad_norm": 1.86141765, "learning_rate": 3.07e-06, "token_acc": 0.74918809, "epoch": 1.74593242, "global_step/max_steps": "698/800", "percentage": "87.25%", "elapsed_time": "2h 35m 14s", "remaining_time": "22m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.343972} +{"loss": 0.80662137, "grad_norm": 1.09110451, "learning_rate": 3.01e-06, "token_acc": 0.76440612, "epoch": 1.74843554, "global_step/max_steps": "699/800", "percentage": "87.38%", "elapsed_time": "2h 35m 26s", "remaining_time": "22m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342211} +{"loss": 0.89126801, "grad_norm": 2.40928674, "learning_rate": 2.95e-06, "token_acc": 0.73886994, "epoch": 1.75093867, "global_step/max_steps": "700/800", "percentage": "87.50%", "elapsed_time": "2h 35m 44s", "remaining_time": "22m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.34845} +{"loss": 0.82822287, "grad_norm": 1.57863748, "learning_rate": 2.89e-06, "token_acc": 0.7533897, "epoch": 1.7534418, "global_step/max_steps": "701/800", "percentage": "87.62%", "elapsed_time": "2h 36m 9s", "remaining_time": "22m 3s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.365623} +{"loss": 0.83256507, "grad_norm": 1.18554688, "learning_rate": 2.84e-06, "token_acc": 0.75138307, "epoch": 1.75594493, "global_step/max_steps": "702/800", "percentage": "87.75%", "elapsed_time": "2h 36m 23s", "remaining_time": "21m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.365489} +{"loss": 0.68651319, "grad_norm": 1.31400764, "learning_rate": 2.78e-06, "token_acc": 0.78942261, "epoch": 1.75844806, "global_step/max_steps": "703/800", "percentage": "87.88%", "elapsed_time": "2h 36m 36s", "remaining_time": "21m 36s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.364991} +{"loss": 0.81788898, "grad_norm": 3.9431529, "learning_rate": 2.72e-06, "token_acc": 0.7603732, "epoch": 1.76095119, "global_step/max_steps": "704/800", "percentage": "88.00%", "elapsed_time": "2h 36m 49s", "remaining_time": "21m 23s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.364807} +{"loss": 0.77024901, "grad_norm": 1.63559389, "learning_rate": 2.67e-06, "token_acc": 0.77340578, "epoch": 1.76345432, "global_step/max_steps": "705/800", "percentage": "88.12%", "elapsed_time": "2h 36m 59s", "remaining_time": "21m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35969} +{"loss": 0.73639548, "grad_norm": 2.67201543, "learning_rate": 2.61e-06, "token_acc": 0.78208767, "epoch": 1.76595745, "global_step/max_steps": "706/800", "percentage": "88.25%", "elapsed_time": "2h 37m 8s", "remaining_time": "20m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35387} +{"loss": 0.7284835, "grad_norm": 7.57129717, "learning_rate": 2.56e-06, "token_acc": 0.78195723, "epoch": 1.76846058, "global_step/max_steps": "707/800", "percentage": "88.38%", "elapsed_time": "2h 37m 19s", "remaining_time": "20m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.350627} +{"loss": 0.88151079, "grad_norm": 1.20054185, "learning_rate": 2.51e-06, "token_acc": 0.73623188, "epoch": 1.7709637, "global_step/max_steps": "708/800", "percentage": "88.50%", "elapsed_time": "2h 37m 39s", "remaining_time": "20m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359585} +{"loss": 0.89690107, "grad_norm": 5.68209362, "learning_rate": 2.45e-06, "token_acc": 0.73368052, "epoch": 1.77346683, "global_step/max_steps": "709/800", "percentage": "88.62%", "elapsed_time": "2h 37m 52s", "remaining_time": "20m 16s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.360181} +{"loss": 0.71721745, "grad_norm": 7.47842598, "learning_rate": 2.4e-06, "token_acc": 0.784951, "epoch": 1.77596996, "global_step/max_steps": "710/800", "percentage": "88.75%", "elapsed_time": "2h 38m 3s", "remaining_time": "20m 2s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356592} +{"loss": 0.74010682, "grad_norm": 2.17053246, "learning_rate": 2.35e-06, "token_acc": 0.77476116, "epoch": 1.77847309, "global_step/max_steps": "711/800", "percentage": "88.88%", "elapsed_time": "2h 38m 27s", "remaining_time": "19m 50s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.371964} +{"loss": 0.88657856, "grad_norm": 2.00002789, "learning_rate": 2.3e-06, "token_acc": 0.742957, "epoch": 1.78097622, "global_step/max_steps": "712/800", "percentage": "89.00%", "elapsed_time": "2h 38m 40s", "remaining_time": "19m 37s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.37143} +{"loss": 0.72707945, "grad_norm": 4.48851347, "learning_rate": 2.25e-06, "token_acc": 0.77920137, "epoch": 1.78347935, "global_step/max_steps": "713/800", "percentage": "89.12%", "elapsed_time": "2h 38m 54s", "remaining_time": "19m 23s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.372324} +{"loss": 0.90312803, "grad_norm": 1.38572407, "learning_rate": 2.19e-06, "token_acc": 0.73003954, "epoch": 1.78598248, "global_step/max_steps": "714/800", "percentage": "89.25%", "elapsed_time": "2h 39m 9s", "remaining_time": "19m 10s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.374173} +{"loss": 0.74873775, "grad_norm": 3.12873149, "learning_rate": 2.14e-06, "token_acc": 0.7762605, "epoch": 1.78848561, "global_step/max_steps": "715/800", "percentage": "89.38%", "elapsed_time": "2h 39m 18s", "remaining_time": "18m 56s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367149} +{"loss": 0.72097343, "grad_norm": 2.14258623, "learning_rate": 2.1e-06, "token_acc": 0.78164044, "epoch": 1.79098874, "global_step/max_steps": "716/800", "percentage": "89.50%", "elapsed_time": "2h 39m 33s", "remaining_time": "18m 43s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.370328} +{"loss": 0.86238217, "grad_norm": 16.06658936, "learning_rate": 2.05e-06, "token_acc": 0.74516602, "epoch": 1.79349186, "global_step/max_steps": "717/800", "percentage": "89.62%", "elapsed_time": "2h 39m 41s", "remaining_time": "18m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.362034} +{"loss": 0.77734804, "grad_norm": 1.36629808, "learning_rate": 2e-06, "token_acc": 0.76373185, "epoch": 1.79599499, "global_step/max_steps": "718/800", "percentage": "89.75%", "elapsed_time": "2h 39m 49s", "remaining_time": "18m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.355087} +{"loss": 0.75792199, "grad_norm": 1.70264971, "learning_rate": 1.95e-06, "token_acc": 0.77066162, "epoch": 1.79849812, "global_step/max_steps": "719/800", "percentage": "89.88%", "elapsed_time": "2h 39m 59s", "remaining_time": "18m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.350993} +{"loss": 0.61161101, "grad_norm": 2.08888841, "learning_rate": 1.9e-06, "token_acc": 0.81287333, "epoch": 1.80100125, "global_step/max_steps": "720/800", "percentage": "90.00%", "elapsed_time": "2h 40m 7s", "remaining_time": "17m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.343606} +{"loss": 0.62284184, "grad_norm": 4.99309874, "learning_rate": 1.86e-06, "token_acc": 0.80835779, "epoch": 1.80350438, "global_step/max_steps": "721/800", "percentage": "90.12%", "elapsed_time": "2h 40m 24s", "remaining_time": "17m 35s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.348358} +{"loss": 0.87290162, "grad_norm": 2.13548994, "learning_rate": 1.81e-06, "token_acc": 0.74060207, "epoch": 1.80600751, "global_step/max_steps": "722/800", "percentage": "90.25%", "elapsed_time": "2h 40m 38s", "remaining_time": "17m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.349352} +{"loss": 0.82688421, "grad_norm": 3.67724967, "learning_rate": 1.76e-06, "token_acc": 0.74972967, "epoch": 1.80851064, "global_step/max_steps": "723/800", "percentage": "90.38%", "elapsed_time": "2h 40m 59s", "remaining_time": "17m 9s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35899} +{"loss": 0.7343685, "grad_norm": 3.93253112, "learning_rate": 1.72e-06, "token_acc": 0.77905458, "epoch": 1.81101377, "global_step/max_steps": "724/800", "percentage": "90.50%", "elapsed_time": "2h 41m 10s", "remaining_time": "16m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356031} +{"loss": 0.74640214, "grad_norm": 2.14867091, "learning_rate": 1.68e-06, "token_acc": 0.77830941, "epoch": 1.8135169, "global_step/max_steps": "725/800", "percentage": "90.62%", "elapsed_time": "2h 41m 22s", "remaining_time": "16m 42s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.354414} +{"loss": 0.78989863, "grad_norm": 1.59821367, "learning_rate": 1.63e-06, "token_acc": 0.76369479, "epoch": 1.81602003, "global_step/max_steps": "726/800", "percentage": "90.75%", "elapsed_time": "2h 41m 39s", "remaining_time": "16m 29s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359357} +{"loss": 0.78929698, "grad_norm": 1.4377147, "learning_rate": 1.59e-06, "token_acc": 0.76850183, "epoch": 1.81852315, "global_step/max_steps": "727/800", "percentage": "90.88%", "elapsed_time": "2h 41m 52s", "remaining_time": "16m 15s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.359208} +{"loss": 0.71800256, "grad_norm": 2.15322804, "learning_rate": 1.55e-06, "token_acc": 0.78967995, "epoch": 1.82102628, "global_step/max_steps": "728/800", "percentage": "91.00%", "elapsed_time": "2h 42m 1s", "remaining_time": "16m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353111} +{"loss": 0.79740238, "grad_norm": 28.96261787, "learning_rate": 1.5e-06, "token_acc": 0.75655783, "epoch": 1.82352941, "global_step/max_steps": "729/800", "percentage": "91.12%", "elapsed_time": "2h 42m 10s", "remaining_time": "15m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.346775} +{"loss": 0.74139005, "grad_norm": 1.57167745, "learning_rate": 1.46e-06, "token_acc": 0.78534757, "epoch": 1.82603254, "global_step/max_steps": "730/800", "percentage": "91.25%", "elapsed_time": "2h 42m 20s", "remaining_time": "15m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342236} +{"loss": 0.86001861, "grad_norm": 1.46421874, "learning_rate": 1.42e-06, "token_acc": 0.74511016, "epoch": 1.82853567, "global_step/max_steps": "731/800", "percentage": "91.38%", "elapsed_time": "2h 42m 50s", "remaining_time": "15m 22s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.365755} +{"loss": 0.72319627, "grad_norm": 2.91245627, "learning_rate": 1.38e-06, "token_acc": 0.77872501, "epoch": 1.8310388, "global_step/max_steps": "732/800", "percentage": "91.50%", "elapsed_time": "2h 42m 59s", "remaining_time": "15m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.358991} +{"loss": 0.74764663, "grad_norm": 3.19018841, "learning_rate": 1.34e-06, "token_acc": 0.78365844, "epoch": 1.83354193, "global_step/max_steps": "733/800", "percentage": "91.62%", "elapsed_time": "2h 43m 9s", "remaining_time": "14m 55s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.355131} +{"loss": 0.82979715, "grad_norm": 2.42747211, "learning_rate": 1.3e-06, "token_acc": 0.75390646, "epoch": 1.83604506, "global_step/max_steps": "734/800", "percentage": "91.75%", "elapsed_time": "2h 43m 21s", "remaining_time": "14m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35296} +{"loss": 0.88511676, "grad_norm": 1.42491841, "learning_rate": 1.26e-06, "token_acc": 0.73761527, "epoch": 1.83854819, "global_step/max_steps": "735/800", "percentage": "91.88%", "elapsed_time": "2h 43m 35s", "remaining_time": "14m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353151} +{"loss": 0.8166061, "grad_norm": 4.43198586, "learning_rate": 1.22e-06, "token_acc": 0.75206691, "epoch": 1.84105131, "global_step/max_steps": "736/800", "percentage": "92.00%", "elapsed_time": "2h 43m 46s", "remaining_time": "14m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.351047} +{"loss": 0.63225567, "grad_norm": 1.88080943, "learning_rate": 1.19e-06, "token_acc": 0.81047041, "epoch": 1.84355444, "global_step/max_steps": "737/800", "percentage": "92.12%", "elapsed_time": "2h 43m 57s", "remaining_time": "14m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347383} +{"loss": 0.69627005, "grad_norm": 3.05234456, "learning_rate": 1.15e-06, "token_acc": 0.79000853, "epoch": 1.84605757, "global_step/max_steps": "738/800", "percentage": "92.25%", "elapsed_time": "2h 44m 8s", "remaining_time": "13m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.343885} +{"loss": 0.72714365, "grad_norm": 1.59440374, "learning_rate": 1.11e-06, "token_acc": 0.77642688, "epoch": 1.8485607, "global_step/max_steps": "739/800", "percentage": "92.38%", "elapsed_time": "2h 44m 15s", "remaining_time": "13m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.335679} +{"loss": 0.74026692, "grad_norm": 3.14758992, "learning_rate": 1.08e-06, "token_acc": 0.77584067, "epoch": 1.85106383, "global_step/max_steps": "740/800", "percentage": "92.50%", "elapsed_time": "2h 44m 28s", "remaining_time": "13m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.335127} +{"loss": 0.8103016, "grad_norm": 2.14675283, "learning_rate": 1.04e-06, "token_acc": 0.75858897, "epoch": 1.85356696, "global_step/max_steps": "741/800", "percentage": "92.62%", "elapsed_time": "2h 44m 54s", "remaining_time": "13m 8s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.352175} +{"loss": 0.72300994, "grad_norm": 1.21080697, "learning_rate": 1.01e-06, "token_acc": 0.78452142, "epoch": 1.85607009, "global_step/max_steps": "742/800", "percentage": "92.75%", "elapsed_time": "2h 45m 2s", "remaining_time": "12m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345179} +{"loss": 0.81228781, "grad_norm": 5.58225012, "learning_rate": 9.7e-07, "token_acc": 0.75866829, "epoch": 1.85857322, "global_step/max_steps": "743/800", "percentage": "92.88%", "elapsed_time": "2h 45m 17s", "remaining_time": "12m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347426} +{"loss": 0.69515717, "grad_norm": 3.02706456, "learning_rate": 9.4e-07, "token_acc": 0.78792923, "epoch": 1.86107635, "global_step/max_steps": "744/800", "percentage": "93.00%", "elapsed_time": "2h 45m 30s", "remaining_time": "12m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.346789} +{"loss": 0.88610637, "grad_norm": 2.49889874, "learning_rate": 9.1e-07, "token_acc": 0.73795475, "epoch": 1.86357947, "global_step/max_steps": "745/800", "percentage": "93.12%", "elapsed_time": "2h 45m 46s", "remaining_time": "12m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.349893} +{"loss": 0.75447655, "grad_norm": 1.50293517, "learning_rate": 8.7e-07, "token_acc": 0.77084004, "epoch": 1.8660826, "global_step/max_steps": "746/800", "percentage": "93.25%", "elapsed_time": "2h 45m 55s", "remaining_time": "12m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.344193} +{"loss": 0.72237307, "grad_norm": 2.52443528, "learning_rate": 8.4e-07, "token_acc": 0.77967966, "epoch": 1.86858573, "global_step/max_steps": "747/800", "percentage": "93.38%", "elapsed_time": "2h 46m 6s", "remaining_time": "11m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.341364} +{"loss": 0.89612794, "grad_norm": 1.2327714, "learning_rate": 8.1e-07, "token_acc": 0.73514878, "epoch": 1.87108886, "global_step/max_steps": "748/800", "percentage": "93.50%", "elapsed_time": "2h 46m 20s", "remaining_time": "11m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342471} +{"loss": 0.80911613, "grad_norm": 10.95998383, "learning_rate": 7.8e-07, "token_acc": 0.75471944, "epoch": 1.87359199, "global_step/max_steps": "749/800", "percentage": "93.62%", "elapsed_time": "2h 46m 36s", "remaining_time": "11m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345489} +{"loss": 0.73641807, "grad_norm": 1.74642086, "learning_rate": 7.5e-07, "token_acc": 0.78178721, "epoch": 1.87609512, "global_step/max_steps": "750/800", "percentage": "93.75%", "elapsed_time": "2h 46m 47s", "remaining_time": "11m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.342703} +{"loss": 0.78978276, "grad_norm": 2.18234944, "learning_rate": 7.2e-07, "token_acc": 0.76644388, "epoch": 1.87859825, "global_step/max_steps": "751/800", "percentage": "93.88%", "elapsed_time": "2h 47m 11s", "remaining_time": "10m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356463} +{"loss": 0.6580134, "grad_norm": 8.03107357, "learning_rate": 6.9e-07, "token_acc": 0.7999625, "epoch": 1.88110138, "global_step/max_steps": "752/800", "percentage": "94.00%", "elapsed_time": "2h 47m 19s", "remaining_time": "10m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.350028} +{"loss": 0.91014892, "grad_norm": 1.56583476, "learning_rate": 6.6e-07, "token_acc": 0.73749091, "epoch": 1.88360451, "global_step/max_steps": "753/800", "percentage": "94.12%", "elapsed_time": "2h 47m 35s", "remaining_time": "10m 28s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.352793} +{"loss": 0.88750899, "grad_norm": 1.17531729, "learning_rate": 6.3e-07, "token_acc": 0.73394678, "epoch": 1.88610763, "global_step/max_steps": "754/800", "percentage": "94.25%", "elapsed_time": "2h 47m 52s", "remaining_time": "10m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.357598} +{"loss": 0.74881887, "grad_norm": 1.63433254, "learning_rate": 6.1e-07, "token_acc": 0.77444975, "epoch": 1.88861076, "global_step/max_steps": "755/800", "percentage": "94.38%", "elapsed_time": "2h 48m 4s", "remaining_time": "10m 1s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.356239} +{"loss": 0.76451701, "grad_norm": 1.99084747, "learning_rate": 5.8e-07, "token_acc": 0.77151488, "epoch": 1.89111389, "global_step/max_steps": "756/800", "percentage": "94.50%", "elapsed_time": "2h 48m 15s", "remaining_time": "9m 48s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353046} +{"loss": 0.78670859, "grad_norm": 6.01297998, "learning_rate": 5.5e-07, "token_acc": 0.76290299, "epoch": 1.89361702, "global_step/max_steps": "757/800", "percentage": "94.62%", "elapsed_time": "2h 48m 24s", "remaining_time": "9m 34s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.34787} +{"loss": 0.69768775, "grad_norm": 2.57164001, "learning_rate": 5.3e-07, "token_acc": 0.78849693, "epoch": 1.89612015, "global_step/max_steps": "758/800", "percentage": "94.75%", "elapsed_time": "2h 48m 38s", "remaining_time": "9m 21s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.348293} +{"loss": 0.79286051, "grad_norm": 2.40277171, "learning_rate": 5e-07, "token_acc": 0.76696671, "epoch": 1.89862328, "global_step/max_steps": "759/800", "percentage": "94.88%", "elapsed_time": "2h 48m 47s", "remaining_time": "9m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.34239} +{"loss": 0.78593904, "grad_norm": 2.02215838, "learning_rate": 4.8e-07, "token_acc": 0.75804314, "epoch": 1.90112641, "global_step/max_steps": "760/800", "percentage": "95.00%", "elapsed_time": "2h 49m 4s", "remaining_time": "8m 54s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.347144} +{"loss": 0.73818374, "grad_norm": 6.25407124, "learning_rate": 4.6e-07, "token_acc": 0.77400699, "epoch": 1.90362954, "global_step/max_steps": "761/800", "percentage": "95.12%", "elapsed_time": "2h 49m 22s", "remaining_time": "8m 41s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.35391} +{"loss": 0.74263787, "grad_norm": 4.32570601, "learning_rate": 4.3e-07, "token_acc": 0.7737384, "epoch": 1.90613267, "global_step/max_steps": "762/800", "percentage": "95.25%", "elapsed_time": "2h 49m 34s", "remaining_time": "8m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.351664} +{"loss": 0.73142266, "grad_norm": 2.26558471, "learning_rate": 4.1e-07, "token_acc": 0.7758732, "epoch": 1.90863579, "global_step/max_steps": "763/800", "percentage": "95.38%", "elapsed_time": "2h 49m 43s", "remaining_time": "8m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.346198} +{"loss": 0.62909365, "grad_norm": 5.33900499, "learning_rate": 3.9e-07, "token_acc": 0.80642947, "epoch": 1.91113892, "global_step/max_steps": "764/800", "percentage": "95.50%", "elapsed_time": "2h 49m 50s", "remaining_time": "8m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.337224} +{"loss": 0.76393557, "grad_norm": 9.27521133, "learning_rate": 3.7e-07, "token_acc": 0.76695527, "epoch": 1.91364205, "global_step/max_steps": "765/800", "percentage": "95.62%", "elapsed_time": "2h 50m 4s", "remaining_time": "7m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.338558} +{"loss": 0.75399828, "grad_norm": 1.54199171, "learning_rate": 3.5e-07, "token_acc": 0.7762047, "epoch": 1.91614518, "global_step/max_steps": "766/800", "percentage": "95.75%", "elapsed_time": "2h 50m 16s", "remaining_time": "7m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.337067} +{"loss": 0.82360065, "grad_norm": 1.0237546, "learning_rate": 3.3e-07, "token_acc": 0.75168039, "epoch": 1.91864831, "global_step/max_steps": "767/800", "percentage": "95.88%", "elapsed_time": "2h 50m 30s", "remaining_time": "7m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.33759} +{"loss": 0.72202957, "grad_norm": 3.61296916, "learning_rate": 3.1e-07, "token_acc": 0.78618858, "epoch": 1.92115144, "global_step/max_steps": "768/800", "percentage": "96.00%", "elapsed_time": "2h 50m 41s", "remaining_time": "7m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.334604} +{"loss": 0.80478126, "grad_norm": 2.24483156, "learning_rate": 2.9e-07, "token_acc": 0.75963391, "epoch": 1.92365457, "global_step/max_steps": "769/800", "percentage": "96.12%", "elapsed_time": "2h 50m 56s", "remaining_time": "6m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.336782} +{"loss": 0.62718189, "grad_norm": 4.78059673, "learning_rate": 2.7e-07, "token_acc": 0.8130531, "epoch": 1.9261577, "global_step/max_steps": "770/800", "percentage": "96.25%", "elapsed_time": "2h 51m 4s", "remaining_time": "6m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.329783} +{"loss": 0.81441951, "grad_norm": 2.87138867, "learning_rate": 2.5e-07, "token_acc": 0.75710259, "epoch": 1.92866083, "global_step/max_steps": "771/800", "percentage": "96.38%", "elapsed_time": "2h 51m 23s", "remaining_time": "6m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.337413} +{"loss": 0.62523305, "grad_norm": 3.79346752, "learning_rate": 2.4e-07, "token_acc": 0.8169553, "epoch": 1.93116395, "global_step/max_steps": "772/800", "percentage": "96.50%", "elapsed_time": "2h 51m 32s", "remaining_time": "6m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.331391} +{"loss": 0.80039412, "grad_norm": 2.77464986, "learning_rate": 2.2e-07, "token_acc": 0.7631566, "epoch": 1.93366708, "global_step/max_steps": "773/800", "percentage": "96.62%", "elapsed_time": "2h 51m 48s", "remaining_time": "6m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.335389} +{"loss": 0.84931064, "grad_norm": 1.8860054, "learning_rate": 2e-07, "token_acc": 0.74802421, "epoch": 1.93617021, "global_step/max_steps": "774/800", "percentage": "96.75%", "elapsed_time": "2h 52m 2s", "remaining_time": "5m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.336418} +{"loss": 0.76197028, "grad_norm": 2.04924202, "learning_rate": 1.9e-07, "token_acc": 0.77460597, "epoch": 1.93867334, "global_step/max_steps": "775/800", "percentage": "96.88%", "elapsed_time": "2h 52m 15s", "remaining_time": "5m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.33606} +{"loss": 0.74790502, "grad_norm": 3.82982993, "learning_rate": 1.7e-07, "token_acc": 0.77693507, "epoch": 1.94117647, "global_step/max_steps": "776/800", "percentage": "97.00%", "elapsed_time": "2h 52m 25s", "remaining_time": "5m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.330661} +{"loss": 0.77926981, "grad_norm": 2.15355301, "learning_rate": 1.6e-07, "token_acc": 0.76596002, "epoch": 1.9436796, "global_step/max_steps": "777/800", "percentage": "97.12%", "elapsed_time": "2h 52m 39s", "remaining_time": "5m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.331434} +{"loss": 0.65200841, "grad_norm": 2.54869747, "learning_rate": 1.5e-07, "token_acc": 0.8017939, "epoch": 1.94618273, "global_step/max_steps": "778/800", "percentage": "97.25%", "elapsed_time": "2h 52m 49s", "remaining_time": "4m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.327445} +{"loss": 0.69993019, "grad_norm": 1.52979362, "learning_rate": 1.3e-07, "token_acc": 0.78590883, "epoch": 1.94868586, "global_step/max_steps": "779/800", "percentage": "97.38%", "elapsed_time": "2h 52m 58s", "remaining_time": "4m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.322202} +{"loss": 0.86541522, "grad_norm": 1.55459225, "learning_rate": 1.2e-07, "token_acc": 0.74511615, "epoch": 1.95118899, "global_step/max_steps": "780/800", "percentage": "97.50%", "elapsed_time": "2h 53m 15s", "remaining_time": "4m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.327082} +{"loss": 0.78530031, "grad_norm": 9.16854382, "learning_rate": 1.1e-07, "token_acc": 0.75895623, "epoch": 1.95369212, "global_step/max_steps": "781/800", "percentage": "97.62%", "elapsed_time": "2h 53m 44s", "remaining_time": "4m 14s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.346802} +{"loss": 0.74364346, "grad_norm": 1.92680216, "learning_rate": 1e-07, "token_acc": 0.77096439, "epoch": 1.95619524, "global_step/max_steps": "782/800", "percentage": "97.75%", "elapsed_time": "2h 54m 2s", "remaining_time": "4m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.353331} +{"loss": 0.62131321, "grad_norm": 7.40035629, "learning_rate": 9e-08, "token_acc": 0.8069788, "epoch": 1.95869837, "global_step/max_steps": "783/800", "percentage": "97.88%", "elapsed_time": "2h 54m 10s", "remaining_time": "3m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.345813} +{"loss": 0.71740305, "grad_norm": 1.72101843, "learning_rate": 8e-08, "token_acc": 0.78252339, "epoch": 1.9612015, "global_step/max_steps": "784/800", "percentage": "98.00%", "elapsed_time": "2h 54m 19s", "remaining_time": "3m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.340301} +{"loss": 0.72764277, "grad_norm": 1.6718781, "learning_rate": 7e-08, "token_acc": 0.78068379, "epoch": 1.96370463, "global_step/max_steps": "785/800", "percentage": "98.12%", "elapsed_time": "2h 54m 28s", "remaining_time": "3m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.33514} +{"loss": 0.81670988, "grad_norm": 1.5906117, "learning_rate": 6e-08, "token_acc": 0.75732752, "epoch": 1.96620776, "global_step/max_steps": "786/800", "percentage": "98.25%", "elapsed_time": "2h 54m 36s", "remaining_time": "3m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.328649} +{"loss": 0.62959689, "grad_norm": 1.75760806, "learning_rate": 5e-08, "token_acc": 0.80756176, "epoch": 1.96871089, "global_step/max_steps": "787/800", "percentage": "98.38%", "elapsed_time": "2h 54m 46s", "remaining_time": "2m 53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.323987} +{"loss": 0.7649188, "grad_norm": 1.97240865, "learning_rate": 4e-08, "token_acc": 0.7695281, "epoch": 1.97121402, "global_step/max_steps": "788/800", "percentage": "98.50%", "elapsed_time": "2h 54m 58s", "remaining_time": "2m 40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.322805} +{"loss": 0.77311081, "grad_norm": 2.09827185, "learning_rate": 4e-08, "token_acc": 0.7673325, "epoch": 1.97371715, "global_step/max_steps": "789/800", "percentage": "98.62%", "elapsed_time": "2h 55m 13s", "remaining_time": "2m 27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.324878} +{"loss": 0.73009902, "grad_norm": 1.57964134, "learning_rate": 3e-08, "token_acc": 0.78007635, "epoch": 1.97622028, "global_step/max_steps": "790/800", "percentage": "98.75%", "elapsed_time": "2h 55m 27s", "remaining_time": "2m 13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.324714} +{"loss": 0.68283337, "grad_norm": 5.34392071, "learning_rate": 2e-08, "token_acc": 0.79138756, "epoch": 1.9787234, "global_step/max_steps": "791/800", "percentage": "98.88%", "elapsed_time": "2h 55m 49s", "remaining_time": "2m 0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.3361} +{"loss": 0.77767587, "grad_norm": 2.44962907, "learning_rate": 2e-08, "token_acc": 0.76762519, "epoch": 1.98122653, "global_step/max_steps": "792/800", "percentage": "99.00%", "elapsed_time": "2h 56m 3s", "remaining_time": "1m 47s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.337715} +{"loss": 0.88150316, "grad_norm": 9.14457989, "learning_rate": 1e-08, "token_acc": 0.73567217, "epoch": 1.98372966, "global_step/max_steps": "793/800", "percentage": "99.12%", "elapsed_time": "2h 56m 22s", "remaining_time": "1m 33s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.34441} +{"loss": 0.86855412, "grad_norm": 1.39385736, "learning_rate": 1e-08, "token_acc": 0.74162921, "epoch": 1.98623279, "global_step/max_steps": "794/800", "percentage": "99.25%", "elapsed_time": "2h 56m 39s", "remaining_time": "1m 20s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.348424} +{"loss": 0.66886204, "grad_norm": 3.32138062, "learning_rate": 1e-08, "token_acc": 0.79948524, "epoch": 1.98873592, "global_step/max_steps": "795/800", "percentage": "99.38%", "elapsed_time": "2h 56m 50s", "remaining_time": "1m 7s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.346002} +{"loss": 0.87696141, "grad_norm": 1.39878607, "learning_rate": 0.0, "token_acc": 0.74545847, "epoch": 1.99123905, "global_step/max_steps": "796/800", "percentage": "99.50%", "elapsed_time": "2h 56m 60s", "remaining_time": "53s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.341477} +{"loss": 0.7640627, "grad_norm": 1.95222473, "learning_rate": 0.0, "token_acc": 0.77142393, "epoch": 1.99374218, "global_step/max_steps": "797/800", "percentage": "99.62%", "elapsed_time": "2h 57m 11s", "remaining_time": "40s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.338916} +{"loss": 0.72370291, "grad_norm": 4.59567976, "learning_rate": 0.0, "token_acc": 0.78289665, "epoch": 1.99624531, "global_step/max_steps": "798/800", "percentage": "99.75%", "elapsed_time": "2h 57m 21s", "remaining_time": "27s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.33519} +{"loss": 0.74084681, "grad_norm": 1.3017118, "learning_rate": 0.0, "token_acc": 0.77862495, "epoch": 1.99874844, "global_step/max_steps": "799/800", "percentage": "99.88%", "elapsed_time": "2h 57m 38s", "remaining_time": "13s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.339017} +{"loss": 0.82609046, "grad_norm": 1.64432454, "learning_rate": 0.0, "token_acc": 0.7600863, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 57m 45s", "remaining_time": "0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.330781} +{"eval_loss": 0.53971583, "eval_runtime": 3.2047, "eval_samples_per_second": 3.744, "eval_steps_per_second": 0.624, "eval_token_acc": 0.755941, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 57m 48s", "remaining_time": "0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.334799} +{"train_runtime": 10694.1372, "train_samples_per_second": 2.392, "train_steps_per_second": 0.075, "total_flos": 4.2251231089288806e+18, "train_loss": 0.87354431, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "2h 58m 14s", "remaining_time": "0s", "memory(GiB)": 77.19, "train_speed(s/it)": 13.367669} +{"model_parameter_info": "PeftModelForCausalLM: 8343.6882M Params (51.5215M Trainable [0.6175%]), 0.0019M Buffers.", "last_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800", "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/checkpoint-800", "best_metric": 0.53971583, "global_step": 800, "log_history": [{"loss": 1.4557902812957764, "grad_norm": 7.8950982093811035, "learning_rate": 3.125e-07, "token_acc": 0.6572501632919661, "epoch": 0.0025031289111389237, "step": 1}, {"loss": 1.501842737197876, "grad_norm": 5.087953090667725, "learning_rate": 6.25e-07, "token_acc": 0.6372176822598289, "epoch": 0.0050062578222778474, "step": 2}, {"loss": 1.4857144355773926, "grad_norm": 10.051658630371094, "learning_rate": 9.375e-07, "token_acc": 0.6451390326364452, "epoch": 0.007509386733416771, "step": 3}, {"loss": 1.4438570737838745, "grad_norm": 2.0114636421203613, "learning_rate": 1.25e-06, "token_acc": 0.6557932163214628, "epoch": 0.010012515644555695, "step": 4}, {"loss": 1.478323221206665, "grad_norm": 1.340759038925171, "learning_rate": 1.5625e-06, "token_acc": 0.6383258353131477, "epoch": 0.012515644555694618, "step": 5}, {"loss": 1.467094898223877, "grad_norm": 1.9858087301254272, "learning_rate": 1.875e-06, "token_acc": 0.6425992779783394, "epoch": 0.015018773466833541, "step": 6}, {"loss": 1.4478201866149902, "grad_norm": 4.05888032913208, "learning_rate": 2.1875e-06, "token_acc": 0.6590269733576039, "epoch": 0.017521902377972465, "step": 7}, {"loss": 1.4324607849121094, "grad_norm": 1.7842193841934204, "learning_rate": 2.5e-06, "token_acc": 0.6515308296305313, "epoch": 0.02002503128911139, "step": 8}, {"loss": 1.5404188632965088, "grad_norm": 1.832907795906067, "learning_rate": 2.8125e-06, "token_acc": 0.6198423322921315, "epoch": 0.02252816020025031, "step": 9}, {"loss": 1.5408222675323486, "grad_norm": 1.766298770904541, "learning_rate": 3.125e-06, "token_acc": 0.6189591644081732, "epoch": 0.025031289111389236, "step": 10}, {"loss": 1.5104762315750122, "grad_norm": 1.6790711879730225, "learning_rate": 3.4375000000000005e-06, "token_acc": 0.625929823288218, "epoch": 0.02753441802252816, "step": 11}, {"loss": 1.4653594493865967, "grad_norm": 4.442141056060791, "learning_rate": 3.75e-06, "token_acc": 0.6531566141631451, "epoch": 0.030037546933667083, "step": 12}, {"loss": 1.4969990253448486, "grad_norm": 1.7403733730316162, "learning_rate": 4.0625000000000005e-06, "token_acc": 0.6385409694999522, "epoch": 0.03254067584480601, "step": 13}, {"loss": 1.4600821733474731, "grad_norm": 2.5656747817993164, "learning_rate": 4.375e-06, "token_acc": 0.6697823145984504, "epoch": 0.03504380475594493, "step": 14}, {"loss": 1.4708112478256226, "grad_norm": 3.5080008506774902, "learning_rate": 4.6875000000000004e-06, "token_acc": 0.672, "epoch": 0.03754693366708386, "step": 15}, {"loss": 1.429203987121582, "grad_norm": 3.7129623889923096, "learning_rate": 5e-06, "token_acc": 0.6813838550247117, "epoch": 0.04005006257822278, "step": 16}, {"loss": 1.512415885925293, "grad_norm": 2.3268940448760986, "learning_rate": 5.3125e-06, "token_acc": 0.6315401203041653, "epoch": 0.0425531914893617, "step": 17}, {"loss": 1.451557993888855, "grad_norm": 2.3350868225097656, "learning_rate": 5.625e-06, "token_acc": 0.6523656776263032, "epoch": 0.04505632040050062, "step": 18}, {"loss": 1.4157341718673706, "grad_norm": 2.7687199115753174, "learning_rate": 5.9375e-06, "token_acc": 0.6632555400132518, "epoch": 0.04755944931163955, "step": 19}, {"loss": 1.4978222846984863, "grad_norm": 5.971182346343994, "learning_rate": 6.25e-06, "token_acc": 0.6449075630252101, "epoch": 0.05006257822277847, "step": 20}, {"loss": 1.5118396282196045, "grad_norm": 13.349177360534668, "learning_rate": 6.5625e-06, "token_acc": 0.6337731455815501, "epoch": 0.052565707133917394, "step": 21}, {"loss": 1.4671411514282227, "grad_norm": 2.401188611984253, "learning_rate": 6.875000000000001e-06, "token_acc": 0.6508435329143235, "epoch": 0.05506883604505632, "step": 22}, {"loss": 1.4463262557983398, "grad_norm": 3.039811849594116, "learning_rate": 7.187499999999999e-06, "token_acc": 0.6521815519765739, "epoch": 0.057571964956195244, "step": 23}, {"loss": 1.4922974109649658, "grad_norm": 1.9413557052612305, "learning_rate": 7.5e-06, "token_acc": 0.6576568432471525, "epoch": 0.060075093867334166, "step": 24}, {"loss": 1.4638800621032715, "grad_norm": 2.3279271125793457, "learning_rate": 7.8125e-06, "token_acc": 0.6408039991668403, "epoch": 0.0625782227784731, "step": 25}, {"loss": 1.4635385274887085, "grad_norm": 2.4672555923461914, "learning_rate": 8.125000000000001e-06, "token_acc": 0.642543217111046, "epoch": 0.06508135168961202, "step": 26}, {"loss": 1.4971613883972168, "grad_norm": 4.2855987548828125, "learning_rate": 8.437500000000002e-06, "token_acc": 0.643646613752689, "epoch": 0.06758448060075094, "step": 27}, {"loss": 1.4926515817642212, "grad_norm": 4.303065299987793, "learning_rate": 8.75e-06, "token_acc": 0.6576081719186663, "epoch": 0.07008760951188986, "step": 28}, {"loss": 1.4479061365127563, "grad_norm": 4.372646808624268, "learning_rate": 9.0625e-06, "token_acc": 0.6445522674865488, "epoch": 0.07259073842302878, "step": 29}, {"loss": 1.410093069076538, "grad_norm": 2.5289852619171143, "learning_rate": 9.375000000000001e-06, "token_acc": 0.6521535141221733, "epoch": 0.07509386733416772, "step": 30}, {"loss": 1.425238847732544, "grad_norm": 1.4264651536941528, "learning_rate": 9.6875e-06, "token_acc": 0.6520223888478192, "epoch": 0.07759699624530664, "step": 31}, {"loss": 1.4446736574172974, "grad_norm": 2.838380813598633, "learning_rate": 1e-05, "token_acc": 0.6348325214304595, "epoch": 0.08010012515644556, "step": 32}, {"loss": 1.4461638927459717, "grad_norm": 2.671543836593628, "learning_rate": 1.03125e-05, "token_acc": 0.6419955498301909, "epoch": 0.08260325406758448, "step": 33}, {"loss": 1.355449914932251, "grad_norm": 1.9914096593856812, "learning_rate": 1.0625e-05, "token_acc": 0.670728126834997, "epoch": 0.0851063829787234, "step": 34}, {"loss": 1.3718912601470947, "grad_norm": 5.0682525634765625, "learning_rate": 1.09375e-05, "token_acc": 0.6667121046892039, "epoch": 0.08760951188986232, "step": 35}, {"loss": 1.4107385873794556, "grad_norm": 7.020368576049805, "learning_rate": 1.125e-05, "token_acc": 0.6550262102991058, "epoch": 0.09011264080100125, "step": 36}, {"loss": 1.4824004173278809, "grad_norm": 1.664873719215393, "learning_rate": 1.1562500000000002e-05, "token_acc": 0.6308479165622023, "epoch": 0.09261576971214018, "step": 37}, {"loss": 1.3098841905593872, "grad_norm": 2.0821597576141357, "learning_rate": 1.1875e-05, "token_acc": 0.6657222884002447, "epoch": 0.0951188986232791, "step": 38}, {"loss": 1.41942298412323, "grad_norm": 1.4780006408691406, "learning_rate": 1.21875e-05, "token_acc": 0.6341868972397738, "epoch": 0.09762202753441802, "step": 39}, {"loss": 1.334580898284912, "grad_norm": 8.251653671264648, "learning_rate": 1.25e-05, "token_acc": 0.6723917672107877, "epoch": 0.10012515644555695, "step": 40}, {"loss": 1.3334863185882568, "grad_norm": 2.3996059894561768, "learning_rate": 1.28125e-05, "token_acc": 0.6682704982863169, "epoch": 0.10262828535669587, "step": 41}, {"loss": 1.3246387243270874, "grad_norm": 8.757278442382812, "learning_rate": 1.3125e-05, "token_acc": 0.6669556991959641, "epoch": 0.10513141426783479, "step": 42}, {"loss": 1.344756841659546, "grad_norm": 1.0424623489379883, "learning_rate": 1.34375e-05, "token_acc": 0.6592281155670547, "epoch": 0.10763454317897372, "step": 43}, {"loss": 1.3171751499176025, "grad_norm": 3.8542351722717285, "learning_rate": 1.3750000000000002e-05, "token_acc": 0.6736935627170665, "epoch": 0.11013767209011265, "step": 44}, {"loss": 1.3416380882263184, "grad_norm": 25.883697509765625, "learning_rate": 1.4062500000000001e-05, "token_acc": 0.6597396665905458, "epoch": 0.11264080100125157, "step": 45}, {"loss": 1.2994325160980225, "grad_norm": 2.754948139190674, "learning_rate": 1.4374999999999999e-05, "token_acc": 0.6748487114979261, "epoch": 0.11514392991239049, "step": 46}, {"loss": 1.2871052026748657, "grad_norm": 17.700273513793945, "learning_rate": 1.4687500000000001e-05, "token_acc": 0.6900871459694989, "epoch": 0.11764705882352941, "step": 47}, {"loss": 1.3259053230285645, "grad_norm": 2.1236982345581055, "learning_rate": 1.5e-05, "token_acc": 0.6648348053647367, "epoch": 0.12015018773466833, "step": 48}, {"loss": 1.3459126949310303, "grad_norm": 2.8360397815704346, "learning_rate": 1.5312500000000003e-05, "token_acc": 0.6621909900865856, "epoch": 0.12265331664580725, "step": 49}, {"loss": 1.1977975368499756, "grad_norm": 1.8516582250595093, "learning_rate": 1.5625e-05, "token_acc": 0.6965541315513888, "epoch": 0.1251564455569462, "step": 50}, {"loss": 1.337214708328247, "grad_norm": 2.6509554386138916, "learning_rate": 1.59375e-05, "token_acc": 0.6660699367466285, "epoch": 0.1276595744680851, "step": 51}, {"loss": 1.3174633979797363, "grad_norm": 1.3980388641357422, "learning_rate": 1.6250000000000002e-05, "token_acc": 0.6557162021165599, "epoch": 0.13016270337922403, "step": 52}, {"loss": 1.3363032341003418, "grad_norm": 2.930096387863159, "learning_rate": 1.65625e-05, "token_acc": 0.6643487563519658, "epoch": 0.13266583229036297, "step": 53}, {"loss": 1.2738587856292725, "grad_norm": 1.6149736642837524, "learning_rate": 1.6875000000000004e-05, "token_acc": 0.6713186201780416, "epoch": 0.13516896120150187, "step": 54}, {"loss": 1.3153185844421387, "grad_norm": 1.9161509275436401, "learning_rate": 1.71875e-05, "token_acc": 0.6600835945663532, "epoch": 0.1376720901126408, "step": 55}, {"loss": 1.328718662261963, "grad_norm": 1.3378994464874268, "learning_rate": 1.75e-05, "token_acc": 0.6626896519329231, "epoch": 0.14017521902377972, "step": 56}, {"loss": 1.2075698375701904, "grad_norm": 2.1358327865600586, "learning_rate": 1.7812500000000003e-05, "token_acc": 0.6894359429289569, "epoch": 0.14267834793491865, "step": 57}, {"loss": 1.211951494216919, "grad_norm": 3.4085142612457275, "learning_rate": 1.8125e-05, "token_acc": 0.6959001782531195, "epoch": 0.14518147684605756, "step": 58}, {"loss": 1.1932858228683472, "grad_norm": 2.7778501510620117, "learning_rate": 1.84375e-05, "token_acc": 0.6946308724832215, "epoch": 0.1476846057571965, "step": 59}, {"loss": 1.2468700408935547, "grad_norm": 2.009060859680176, "learning_rate": 1.8750000000000002e-05, "token_acc": 0.6771944009298095, "epoch": 0.15018773466833543, "step": 60}, {"loss": 1.260186791419983, "grad_norm": 5.27526330947876, "learning_rate": 1.90625e-05, "token_acc": 0.6741093689401075, "epoch": 0.15269086357947434, "step": 61}, {"loss": 1.2611782550811768, "grad_norm": 2.183293342590332, "learning_rate": 1.9375e-05, "token_acc": 0.670921220067096, "epoch": 0.15519399249061328, "step": 62}, {"loss": 1.212986707687378, "grad_norm": 1.8381351232528687, "learning_rate": 1.96875e-05, "token_acc": 0.691640625, "epoch": 0.15769712140175218, "step": 63}, {"loss": 1.240574598312378, "grad_norm": 2.4578311443328857, "learning_rate": 2e-05, "token_acc": 0.6715244487056568, "epoch": 0.16020025031289112, "step": 64}, {"loss": 1.2548034191131592, "grad_norm": 3.24009108543396, "learning_rate": 2.0312500000000002e-05, "token_acc": 0.6654780476933363, "epoch": 0.16270337922403003, "step": 65}, {"loss": 1.2446942329406738, "grad_norm": 4.743288993835449, "learning_rate": 2.0625e-05, "token_acc": 0.6764411159748959, "epoch": 0.16520650813516896, "step": 66}, {"loss": 1.18748140335083, "grad_norm": 2.8019979000091553, "learning_rate": 2.09375e-05, "token_acc": 0.7129500268672757, "epoch": 0.1677096370463079, "step": 67}, {"loss": 1.2521979808807373, "grad_norm": 2.299891471862793, "learning_rate": 2.125e-05, "token_acc": 0.675844505309692, "epoch": 0.1702127659574468, "step": 68}, {"loss": 1.203750491142273, "grad_norm": 12.295174598693848, "learning_rate": 2.1562500000000002e-05, "token_acc": 0.6892914653784219, "epoch": 0.17271589486858574, "step": 69}, {"loss": 1.1940397024154663, "grad_norm": 1.9590011835098267, "learning_rate": 2.1875e-05, "token_acc": 0.6833531308331919, "epoch": 0.17521902377972465, "step": 70}, {"loss": 1.224703073501587, "grad_norm": 1.3522539138793945, "learning_rate": 2.21875e-05, "token_acc": 0.6722795201010313, "epoch": 0.17772215269086358, "step": 71}, {"loss": 1.209501028060913, "grad_norm": 5.405593395233154, "learning_rate": 2.25e-05, "token_acc": 0.6863064396743154, "epoch": 0.1802252816020025, "step": 72}, {"loss": 1.0670784711837769, "grad_norm": 2.510359525680542, "learning_rate": 2.28125e-05, "token_acc": 0.7204571243313341, "epoch": 0.18272841051314143, "step": 73}, {"loss": 1.1720937490463257, "grad_norm": 3.786830186843872, "learning_rate": 2.3125000000000003e-05, "token_acc": 0.6966354109211252, "epoch": 0.18523153942428036, "step": 74}, {"loss": 1.1647639274597168, "grad_norm": 7.54746675491333, "learning_rate": 2.34375e-05, "token_acc": 0.6920582186362917, "epoch": 0.18773466833541927, "step": 75}, {"loss": 1.01552414894104, "grad_norm": 3.6000797748565674, "learning_rate": 2.375e-05, "token_acc": 0.7369100727870392, "epoch": 0.1902377972465582, "step": 76}, {"loss": 1.1755733489990234, "grad_norm": 2.196979522705078, "learning_rate": 2.4062500000000002e-05, "token_acc": 0.689888875320552, "epoch": 0.1927409261576971, "step": 77}, {"loss": 1.196420431137085, "grad_norm": 2.5549845695495605, "learning_rate": 2.4375e-05, "token_acc": 0.6777883196289268, "epoch": 0.19524405506883605, "step": 78}, {"loss": 1.2095775604248047, "grad_norm": 2.397491455078125, "learning_rate": 2.4687500000000004e-05, "token_acc": 0.6770092547491476, "epoch": 0.19774718397997496, "step": 79}, {"loss": 1.215873122215271, "grad_norm": 2.3734941482543945, "learning_rate": 2.5e-05, "token_acc": 0.6735724510895499, "epoch": 0.2002503128911139, "step": 80}, {"loss": 1.159612774848938, "grad_norm": 6.307923316955566, "learning_rate": 2.53125e-05, "token_acc": 0.6885863267670915, "epoch": 0.20275344180225283, "step": 81}, {"loss": 1.244891881942749, "grad_norm": 1.9825963973999023, "learning_rate": 2.5625e-05, "token_acc": 0.6620401337792642, "epoch": 0.20525657071339173, "step": 82}, {"loss": 1.1396539211273193, "grad_norm": 3.535176992416382, "learning_rate": 2.5937500000000004e-05, "token_acc": 0.6885533874566776, "epoch": 0.20775969962453067, "step": 83}, {"loss": 1.159801959991455, "grad_norm": 1.6742156744003296, "learning_rate": 2.625e-05, "token_acc": 0.6944472387083794, "epoch": 0.21026282853566958, "step": 84}, {"loss": 1.0350620746612549, "grad_norm": 2.6573984622955322, "learning_rate": 2.6562500000000002e-05, "token_acc": 0.7238356649548433, "epoch": 0.2127659574468085, "step": 85}, {"loss": 1.162409782409668, "grad_norm": 8.295306205749512, "learning_rate": 2.6875e-05, "token_acc": 0.6927952399430862, "epoch": 0.21526908635794745, "step": 86}, {"loss": 1.0885825157165527, "grad_norm": 2.998918294906616, "learning_rate": 2.71875e-05, "token_acc": 0.7137596899224806, "epoch": 0.21777221526908636, "step": 87}, {"loss": 1.0828857421875, "grad_norm": 1.8655437231063843, "learning_rate": 2.7500000000000004e-05, "token_acc": 0.7061748303433447, "epoch": 0.2202753441802253, "step": 88}, {"loss": 1.1780362129211426, "grad_norm": 1.323335886001587, "learning_rate": 2.7812500000000002e-05, "token_acc": 0.6848311201719103, "epoch": 0.2227784730913642, "step": 89}, {"loss": 0.9686488509178162, "grad_norm": 5.304930210113525, "learning_rate": 2.8125000000000003e-05, "token_acc": 0.7363368421052632, "epoch": 0.22528160200250313, "step": 90}, {"loss": 1.0577869415283203, "grad_norm": 9.773175239562988, "learning_rate": 2.84375e-05, "token_acc": 0.7114267269205939, "epoch": 0.22778473091364204, "step": 91}, {"loss": 1.145928978919983, "grad_norm": 2.9195711612701416, "learning_rate": 2.8749999999999997e-05, "token_acc": 0.6888570610140361, "epoch": 0.23028785982478098, "step": 92}, {"loss": 1.0008058547973633, "grad_norm": 4.456406116485596, "learning_rate": 2.9062500000000005e-05, "token_acc": 0.7271467433146847, "epoch": 0.2327909887359199, "step": 93}, {"loss": 1.1630926132202148, "grad_norm": 1.3492659330368042, "learning_rate": 2.9375000000000003e-05, "token_acc": 0.6865543948126801, "epoch": 0.23529411764705882, "step": 94}, {"loss": 1.0794365406036377, "grad_norm": 33.28302001953125, "learning_rate": 2.96875e-05, "token_acc": 0.6955025569946949, "epoch": 0.23779724655819776, "step": 95}, {"loss": 0.981617271900177, "grad_norm": 4.188589572906494, "learning_rate": 3e-05, "token_acc": 0.7421242124212422, "epoch": 0.24030037546933666, "step": 96}, {"loss": 1.1217559576034546, "grad_norm": 4.019721031188965, "learning_rate": 3.0312499999999998e-05, "token_acc": 0.6885376192158248, "epoch": 0.2428035043804756, "step": 97}, {"loss": 1.1427521705627441, "grad_norm": 3.235391616821289, "learning_rate": 3.0625000000000006e-05, "token_acc": 0.6908890062917247, "epoch": 0.2453066332916145, "step": 98}, {"loss": 1.0406608581542969, "grad_norm": 2.8775594234466553, "learning_rate": 3.09375e-05, "token_acc": 0.7161332040090527, "epoch": 0.24780976220275344, "step": 99}, {"loss": 1.0470802783966064, "grad_norm": 3.2784032821655273, "learning_rate": 3.125e-05, "token_acc": 0.7107116506807968, "epoch": 0.2503128911138924, "step": 100}, {"loss": 1.1033154726028442, "grad_norm": 10.006264686584473, "learning_rate": 3.15625e-05, "token_acc": 0.6993850520340587, "epoch": 0.2528160200250313, "step": 101}, {"loss": 1.0931888818740845, "grad_norm": 3.128004789352417, "learning_rate": 3.1875e-05, "token_acc": 0.6994311184094775, "epoch": 0.2553191489361702, "step": 102}, {"loss": 1.0672286748886108, "grad_norm": 1.6552213430404663, "learning_rate": 3.21875e-05, "token_acc": 0.7047883009372379, "epoch": 0.25782227784730916, "step": 103}, {"loss": 1.0013254880905151, "grad_norm": 2.4581258296966553, "learning_rate": 3.2500000000000004e-05, "token_acc": 0.7210549515133705, "epoch": 0.26032540675844806, "step": 104}, {"loss": 1.057444453239441, "grad_norm": 1.6132698059082031, "learning_rate": 3.2812500000000005e-05, "token_acc": 0.7100988496444881, "epoch": 0.26282853566958697, "step": 105}, {"loss": 1.123189926147461, "grad_norm": 1.5642213821411133, "learning_rate": 3.3125e-05, "token_acc": 0.6890246836356637, "epoch": 0.26533166458072593, "step": 106}, {"loss": 1.0398962497711182, "grad_norm": 2.402168035507202, "learning_rate": 3.34375e-05, "token_acc": 0.7146073548475131, "epoch": 0.26783479349186484, "step": 107}, {"loss": 0.9815630316734314, "grad_norm": 6.666412830352783, "learning_rate": 3.375000000000001e-05, "token_acc": 0.7229632010284429, "epoch": 0.27033792240300375, "step": 108}, {"loss": 1.0755481719970703, "grad_norm": 2.724987030029297, "learning_rate": 3.40625e-05, "token_acc": 0.6945715806279936, "epoch": 0.27284105131414266, "step": 109}, {"loss": 1.0846197605133057, "grad_norm": 2.264068841934204, "learning_rate": 3.4375e-05, "token_acc": 0.7066835081553078, "epoch": 0.2753441802252816, "step": 110}, {"loss": 0.964267373085022, "grad_norm": 2.5315089225769043, "learning_rate": 3.46875e-05, "token_acc": 0.7342624854819977, "epoch": 0.27784730913642053, "step": 111}, {"loss": 0.9664145708084106, "grad_norm": 15.30518627166748, "learning_rate": 3.5e-05, "token_acc": 0.7298946944798443, "epoch": 0.28035043804755944, "step": 112}, {"loss": 1.0291664600372314, "grad_norm": 2.818232297897339, "learning_rate": 3.5312500000000005e-05, "token_acc": 0.7168817487490123, "epoch": 0.2828535669586984, "step": 113}, {"loss": 1.0101385116577148, "grad_norm": 7.732123851776123, "learning_rate": 3.5625000000000005e-05, "token_acc": 0.717198464186416, "epoch": 0.2853566958698373, "step": 114}, {"loss": 1.1273301839828491, "grad_norm": 3.8363802433013916, "learning_rate": 3.59375e-05, "token_acc": 0.688773189101754, "epoch": 0.2878598247809762, "step": 115}, {"loss": 1.044485092163086, "grad_norm": 3.1989147663116455, "learning_rate": 3.625e-05, "token_acc": 0.7092324805339266, "epoch": 0.2903629536921151, "step": 116}, {"loss": 0.8934916257858276, "grad_norm": 2.878786087036133, "learning_rate": 3.65625e-05, "token_acc": 0.7590650284686844, "epoch": 0.2928660826032541, "step": 117}, {"loss": 1.0810887813568115, "grad_norm": 2.4027316570281982, "learning_rate": 3.6875e-05, "token_acc": 0.700803104619199, "epoch": 0.295369211514393, "step": 118}, {"loss": 1.0755298137664795, "grad_norm": 2.034160852432251, "learning_rate": 3.71875e-05, "token_acc": 0.7013630188017707, "epoch": 0.2978723404255319, "step": 119}, {"loss": 0.9945212602615356, "grad_norm": 4.220553874969482, "learning_rate": 3.7500000000000003e-05, "token_acc": 0.7199625446245684, "epoch": 0.30037546933667086, "step": 120}, {"loss": 1.0152537822723389, "grad_norm": 2.564206600189209, "learning_rate": 3.78125e-05, "token_acc": 0.7179334916864608, "epoch": 0.30287859824780977, "step": 121}, {"loss": 0.9843083024024963, "grad_norm": 1.7850531339645386, "learning_rate": 3.8125e-05, "token_acc": 0.7254917512690355, "epoch": 0.3053817271589487, "step": 122}, {"loss": 1.0854582786560059, "grad_norm": 3.826921224594116, "learning_rate": 3.8437500000000006e-05, "token_acc": 0.6981124383382934, "epoch": 0.3078848560700876, "step": 123}, {"loss": 1.029062032699585, "grad_norm": 2.541259765625, "learning_rate": 3.875e-05, "token_acc": 0.7140036666196588, "epoch": 0.31038798498122655, "step": 124}, {"loss": 0.9238264560699463, "grad_norm": 2.901413917541504, "learning_rate": 3.90625e-05, "token_acc": 0.7398554752640356, "epoch": 0.31289111389236546, "step": 125}, {"loss": 0.9085039496421814, "grad_norm": 3.516462564468384, "learning_rate": 3.9375e-05, "token_acc": 0.7436048965808358, "epoch": 0.31539424280350437, "step": 126}, {"loss": 0.8704398274421692, "grad_norm": 19.986804962158203, "learning_rate": 3.96875e-05, "token_acc": 0.7592660550458715, "epoch": 0.31789737171464333, "step": 127}, {"loss": 1.0086506605148315, "grad_norm": 2.4190216064453125, "learning_rate": 4e-05, "token_acc": 0.7155834613586267, "epoch": 0.32040050062578224, "step": 128}, {"loss": 0.9949646592140198, "grad_norm": 10.030716896057129, "learning_rate": 4.0312500000000004e-05, "token_acc": 0.7203355704697987, "epoch": 0.32290362953692114, "step": 129}, {"loss": 0.9811956882476807, "grad_norm": 12.682878494262695, "learning_rate": 4.0625000000000005e-05, "token_acc": 0.7252892752288297, "epoch": 0.32540675844806005, "step": 130}, {"loss": 0.8768625259399414, "grad_norm": 2.5325679779052734, "learning_rate": 4.09375e-05, "token_acc": 0.7590881616440722, "epoch": 0.327909887359199, "step": 131}, {"loss": 0.976413905620575, "grad_norm": 3.471003532409668, "learning_rate": 4.125e-05, "token_acc": 0.7229185085027823, "epoch": 0.3304130162703379, "step": 132}, {"loss": 1.0195640325546265, "grad_norm": 2.5259780883789062, "learning_rate": 4.156250000000001e-05, "token_acc": 0.7145907169392374, "epoch": 0.33291614518147683, "step": 133}, {"loss": 0.9508498311042786, "grad_norm": 2.968695640563965, "learning_rate": 4.1875e-05, "token_acc": 0.7329253710346768, "epoch": 0.3354192740926158, "step": 134}, {"loss": 0.877600371837616, "grad_norm": 6.434828281402588, "learning_rate": 4.21875e-05, "token_acc": 0.7561930872417507, "epoch": 0.3379224030037547, "step": 135}, {"loss": 1.044579267501831, "grad_norm": 2.5651018619537354, "learning_rate": 4.25e-05, "token_acc": 0.7108454096075035, "epoch": 0.3404255319148936, "step": 136}, {"loss": 1.0095362663269043, "grad_norm": 2.949556589126587, "learning_rate": 4.28125e-05, "token_acc": 0.716402739139739, "epoch": 0.3429286608260325, "step": 137}, {"loss": 0.8357698917388916, "grad_norm": 5.174262046813965, "learning_rate": 4.3125000000000005e-05, "token_acc": 0.7733576272902115, "epoch": 0.3454317897371715, "step": 138}, {"loss": 0.951337456703186, "grad_norm": 2.26728892326355, "learning_rate": 4.3437500000000006e-05, "token_acc": 0.7335539120280264, "epoch": 0.3479349186483104, "step": 139}, {"loss": 0.895291805267334, "grad_norm": 10.75383186340332, "learning_rate": 4.375e-05, "token_acc": 0.7494621262704948, "epoch": 0.3504380475594493, "step": 140}, {"loss": 0.8901827335357666, "grad_norm": 16.128704071044922, "learning_rate": 4.40625e-05, "token_acc": 0.7465124430424115, "epoch": 0.35294117647058826, "step": 141}, {"loss": 1.0329668521881104, "grad_norm": 9.271828651428223, "learning_rate": 4.4375e-05, "token_acc": 0.7120498030388295, "epoch": 0.35544430538172717, "step": 142}, {"loss": 0.8827842473983765, "grad_norm": 4.020982265472412, "learning_rate": 4.46875e-05, "token_acc": 0.7564152259865106, "epoch": 0.3579474342928661, "step": 143}, {"loss": 0.9577807784080505, "grad_norm": 2.2052903175354004, "learning_rate": 4.5e-05, "token_acc": 0.7318331737418874, "epoch": 0.360450563204005, "step": 144}, {"loss": 0.9372326135635376, "grad_norm": 1.911048173904419, "learning_rate": 4.5312500000000004e-05, "token_acc": 0.7335442645325393, "epoch": 0.36295369211514394, "step": 145}, {"loss": 0.9250544309616089, "grad_norm": 2.1569759845733643, "learning_rate": 4.5625e-05, "token_acc": 0.7350609269408822, "epoch": 0.36545682102628285, "step": 146}, {"loss": 0.8544453382492065, "grad_norm": 90.4991455078125, "learning_rate": 4.59375e-05, "token_acc": 0.755140870837907, "epoch": 0.36795994993742176, "step": 147}, {"loss": 0.9220091700553894, "grad_norm": 4.5008697509765625, "learning_rate": 4.6250000000000006e-05, "token_acc": 0.7407507914970601, "epoch": 0.3704630788485607, "step": 148}, {"loss": 1.0421748161315918, "grad_norm": 1.819976806640625, "learning_rate": 4.65625e-05, "token_acc": 0.7048270166100762, "epoch": 0.37296620775969963, "step": 149}, {"loss": 0.9764658212661743, "grad_norm": 2.314004898071289, "learning_rate": 4.6875e-05, "token_acc": 0.7197187404463466, "epoch": 0.37546933667083854, "step": 150}, {"loss": 1.020967721939087, "grad_norm": 1.502142310142517, "learning_rate": 4.71875e-05, "token_acc": 0.7136980898179974, "epoch": 0.37797246558197745, "step": 151}, {"loss": 0.8627139925956726, "grad_norm": 2.8821356296539307, "learning_rate": 4.75e-05, "token_acc": 0.7503271575177354, "epoch": 0.3804755944931164, "step": 152}, {"loss": 1.0209362506866455, "grad_norm": 5.202376365661621, "learning_rate": 4.7812500000000003e-05, "token_acc": 0.7102290932393464, "epoch": 0.3829787234042553, "step": 153}, {"loss": 0.8892765641212463, "grad_norm": 2.1695210933685303, "learning_rate": 4.8125000000000004e-05, "token_acc": 0.746233887249573, "epoch": 0.3854818523153942, "step": 154}, {"loss": 0.9921320080757141, "grad_norm": 1.2071388959884644, "learning_rate": 4.8437500000000005e-05, "token_acc": 0.7195179708467084, "epoch": 0.3879849812265332, "step": 155}, {"loss": 0.8882246613502502, "grad_norm": 3.7766385078430176, "learning_rate": 4.875e-05, "token_acc": 0.7476656291685193, "epoch": 0.3904881101376721, "step": 156}, {"loss": 0.9586931467056274, "grad_norm": 4.709662437438965, "learning_rate": 4.90625e-05, "token_acc": 0.7263681592039801, "epoch": 0.392991239048811, "step": 157}, {"loss": 0.8552154302597046, "grad_norm": 4.0463080406188965, "learning_rate": 4.937500000000001e-05, "token_acc": 0.7541220115416323, "epoch": 0.3954943679599499, "step": 158}, {"loss": 0.8899470567703247, "grad_norm": 2.8410274982452393, "learning_rate": 4.96875e-05, "token_acc": 0.7499725304911549, "epoch": 0.3979974968710889, "step": 159}, {"loss": 0.9451851844787598, "grad_norm": 2.9422967433929443, "learning_rate": 5e-05, "token_acc": 0.7286368400728196, "epoch": 0.4005006257822278, "step": 160}, {"loss": 0.8761780858039856, "grad_norm": 3.18597412109375, "learning_rate": 4.9999698804181425e-05, "token_acc": 0.7598903251077164, "epoch": 0.4030037546933667, "step": 161}, {"loss": 0.8826810121536255, "grad_norm": 1.9840060472488403, "learning_rate": 4.9998795223983205e-05, "token_acc": 0.744661338923097, "epoch": 0.40550688360450565, "step": 162}, {"loss": 0.8482328653335571, "grad_norm": 21.6531925201416, "learning_rate": 4.99972892811777e-05, "token_acc": 0.7538179596823458, "epoch": 0.40801001251564456, "step": 163}, {"loss": 1.031351089477539, "grad_norm": 2.402557373046875, "learning_rate": 4.9995181012051625e-05, "token_acc": 0.7049064787205205, "epoch": 0.41051314142678347, "step": 164}, {"loss": 0.9314454793930054, "grad_norm": 2.2513351440429688, "learning_rate": 4.9992470467405104e-05, "token_acc": 0.7308264872911727, "epoch": 0.4130162703379224, "step": 165}, {"loss": 0.9550535678863525, "grad_norm": 1.2842321395874023, "learning_rate": 4.998915771255053e-05, "token_acc": 0.7228157276475021, "epoch": 0.41551939924906134, "step": 166}, {"loss": 0.8689353466033936, "grad_norm": 2.6976544857025146, "learning_rate": 4.9985242827310936e-05, "token_acc": 0.7488272087568413, "epoch": 0.41802252816020025, "step": 167}, {"loss": 0.9480851888656616, "grad_norm": 1.9013776779174805, "learning_rate": 4.9980725906018074e-05, "token_acc": 0.7256708860759493, "epoch": 0.42052565707133915, "step": 168}, {"loss": 0.792317807674408, "grad_norm": 2.0147554874420166, "learning_rate": 4.9975607057510185e-05, "token_acc": 0.77470701416827, "epoch": 0.4230287859824781, "step": 169}, {"loss": 0.8363028168678284, "grad_norm": 5.95169734954834, "learning_rate": 4.996988640512931e-05, "token_acc": 0.7643083597530452, "epoch": 0.425531914893617, "step": 170}, {"loss": 0.8463314175605774, "grad_norm": 3.004988670349121, "learning_rate": 4.99635640867184e-05, "token_acc": 0.7617599713825791, "epoch": 0.42803504380475593, "step": 171}, {"loss": 0.8169602751731873, "grad_norm": 6.122714996337891, "learning_rate": 4.9956640254617906e-05, "token_acc": 0.7588180032453669, "epoch": 0.4305381727158949, "step": 172}, {"loss": 1.0029940605163574, "grad_norm": 2.14045786857605, "learning_rate": 4.994911507566217e-05, "token_acc": 0.712219074598678, "epoch": 0.4330413016270338, "step": 173}, {"loss": 0.9134575128555298, "grad_norm": 1.9638121128082275, "learning_rate": 4.99409887311754e-05, "token_acc": 0.7453976298725498, "epoch": 0.4355444305381727, "step": 174}, {"loss": 0.8294797539710999, "grad_norm": 6.963588237762451, "learning_rate": 4.993226141696726e-05, "token_acc": 0.7652689152233364, "epoch": 0.4380475594493116, "step": 175}, {"loss": 0.9168058037757874, "grad_norm": 2.013535261154175, "learning_rate": 4.99229333433282e-05, "token_acc": 0.7364463791056589, "epoch": 0.4405506883604506, "step": 176}, {"loss": 0.862735390663147, "grad_norm": 1.502765417098999, "learning_rate": 4.991300473502437e-05, "token_acc": 0.7555572888230248, "epoch": 0.4430538172715895, "step": 177}, {"loss": 1.006132960319519, "grad_norm": 2.0426056385040283, "learning_rate": 4.9902475831292185e-05, "token_acc": 0.711357628807904, "epoch": 0.4455569461827284, "step": 178}, {"loss": 0.8480299711227417, "grad_norm": 2.3713955879211426, "learning_rate": 4.9891346885832586e-05, "token_acc": 0.7630771926750197, "epoch": 0.44806007509386736, "step": 179}, {"loss": 0.9099956750869751, "grad_norm": 1.9472578763961792, "learning_rate": 4.987961816680492e-05, "token_acc": 0.744568097509274, "epoch": 0.45056320400500627, "step": 180}, {"loss": 0.8087277412414551, "grad_norm": 5.378758907318115, "learning_rate": 4.986728995682049e-05, "token_acc": 0.7657945736434109, "epoch": 0.4530663329161452, "step": 181}, {"loss": 0.9494457244873047, "grad_norm": 1.7415252923965454, "learning_rate": 4.9854362552935706e-05, "token_acc": 0.7285589688923345, "epoch": 0.4555694618272841, "step": 182}, {"loss": 0.9584786295890808, "grad_norm": 3.286355495452881, "learning_rate": 4.984083626664497e-05, "token_acc": 0.729500568710578, "epoch": 0.45807259073842305, "step": 183}, {"loss": 0.9425086975097656, "grad_norm": 1.2414660453796387, "learning_rate": 4.982671142387316e-05, "token_acc": 0.7302265729123582, "epoch": 0.46057571964956195, "step": 184}, {"loss": 0.8545800447463989, "grad_norm": 2.1618587970733643, "learning_rate": 4.981198836496775e-05, "token_acc": 0.7508434073657576, "epoch": 0.46307884856070086, "step": 185}, {"loss": 1.0033760070800781, "grad_norm": 2.7464194297790527, "learning_rate": 4.979666744469065e-05, "token_acc": 0.7168112389213652, "epoch": 0.4655819774718398, "step": 186}, {"loss": 0.8726233839988708, "grad_norm": 2.1117477416992188, "learning_rate": 4.978074903220963e-05, "token_acc": 0.7512896094325718, "epoch": 0.46808510638297873, "step": 187}, {"loss": 0.9832717776298523, "grad_norm": 2.3225831985473633, "learning_rate": 4.976423351108943e-05, "token_acc": 0.7242706131078224, "epoch": 0.47058823529411764, "step": 188}, {"loss": 0.8374819755554199, "grad_norm": 1.5692338943481445, "learning_rate": 4.9747121279282525e-05, "token_acc": 0.7515348246418743, "epoch": 0.47309136420525655, "step": 189}, {"loss": 0.8508638143539429, "grad_norm": 2.915736436843872, "learning_rate": 4.972941274911953e-05, "token_acc": 0.7552318044323724, "epoch": 0.4755944931163955, "step": 190}, {"loss": 0.8711614608764648, "grad_norm": 2.509810209274292, "learning_rate": 4.971110834729925e-05, "token_acc": 0.748834597023308, "epoch": 0.4780976220275344, "step": 191}, {"loss": 0.8127565383911133, "grad_norm": 38.909141540527344, "learning_rate": 4.9692208514878444e-05, "token_acc": 0.7634650994283874, "epoch": 0.4806007509386733, "step": 192}, {"loss": 0.8236993551254272, "grad_norm": 2.6864702701568604, "learning_rate": 4.9672713707261146e-05, "token_acc": 0.7607028125614633, "epoch": 0.4831038798498123, "step": 193}, {"loss": 0.9363845586776733, "grad_norm": 1.8782848119735718, "learning_rate": 4.965262439418772e-05, "token_acc": 0.7292962883501395, "epoch": 0.4856070087609512, "step": 194}, {"loss": 0.7871609926223755, "grad_norm": 15.927218437194824, "learning_rate": 4.963194105972353e-05, "token_acc": 0.7660380466112163, "epoch": 0.4881101376720901, "step": 195}, {"loss": 0.8945263028144836, "grad_norm": 5.428698539733887, "learning_rate": 4.9610664202247294e-05, "token_acc": 0.733186463496726, "epoch": 0.490613266583229, "step": 196}, {"loss": 0.8039653897285461, "grad_norm": 4.436823844909668, "learning_rate": 4.958879433443904e-05, "token_acc": 0.767208630907157, "epoch": 0.493116395494368, "step": 197}, {"loss": 0.993769109249115, "grad_norm": 1.1804406642913818, "learning_rate": 4.95663319832678e-05, "token_acc": 0.7182901803257216, "epoch": 0.4956195244055069, "step": 198}, {"loss": 0.8885359764099121, "grad_norm": 34.3048095703125, "learning_rate": 4.954327768997886e-05, "token_acc": 0.7376394368941498, "epoch": 0.4981226533166458, "step": 199}, {"loss": 0.8299421072006226, "grad_norm": 3.2417330741882324, "learning_rate": 4.951963201008076e-05, "token_acc": 0.7590844540974021, "epoch": 0.5006257822277848, "step": 200}, {"loss": 0.8799647092819214, "grad_norm": 1.7213491201400757, "learning_rate": 4.949539551333191e-05, "token_acc": 0.7460959726876146, "epoch": 0.5031289111389237, "step": 201}, {"loss": 0.7674298286437988, "grad_norm": 3.129983901977539, "learning_rate": 4.947056878372681e-05, "token_acc": 0.7778585271317829, "epoch": 0.5056320400500626, "step": 202}, {"loss": 0.8905498385429382, "grad_norm": 1.7732640504837036, "learning_rate": 4.944515241948204e-05, "token_acc": 0.7450012817226352, "epoch": 0.5081351689612015, "step": 203}, {"loss": 0.9746031761169434, "grad_norm": 1.5776193141937256, "learning_rate": 4.9419147033021814e-05, "token_acc": 0.7222505091649695, "epoch": 0.5106382978723404, "step": 204}, {"loss": 0.8019765019416809, "grad_norm": 2.398367166519165, "learning_rate": 4.9392553250963215e-05, "token_acc": 0.7681595784719608, "epoch": 0.5131414267834794, "step": 205}, {"loss": 0.9508465528488159, "grad_norm": 2.5589308738708496, "learning_rate": 4.936537171410113e-05, "token_acc": 0.7260439407311069, "epoch": 0.5156445556946183, "step": 206}, {"loss": 0.8822273015975952, "grad_norm": 30.68482780456543, "learning_rate": 4.933760307739277e-05, "token_acc": 0.7461445679331438, "epoch": 0.5181476846057572, "step": 207}, {"loss": 0.7858006954193115, "grad_norm": 1.6417980194091797, "learning_rate": 4.9309248009941914e-05, "token_acc": 0.7672451193058568, "epoch": 0.5206508135168961, "step": 208}, {"loss": 0.9309002757072449, "grad_norm": 1.7159936428070068, "learning_rate": 4.92803071949828e-05, "token_acc": 0.7286675639300134, "epoch": 0.523153942428035, "step": 209}, {"loss": 0.9468393921852112, "grad_norm": 2.5000967979431152, "learning_rate": 4.9250781329863606e-05, "token_acc": 0.7337789370720574, "epoch": 0.5256570713391739, "step": 210}, {"loss": 0.9223999977111816, "grad_norm": 4.127990245819092, "learning_rate": 4.92206711260297e-05, "token_acc": 0.7299156498239292, "epoch": 0.5281602002503129, "step": 211}, {"loss": 0.9442908763885498, "grad_norm": 2.085132598876953, "learning_rate": 4.9189977309006495e-05, "token_acc": 0.728492959925731, "epoch": 0.5306633291614519, "step": 212}, {"loss": 0.8923409581184387, "grad_norm": 1.8777406215667725, "learning_rate": 4.915870061838193e-05, "token_acc": 0.7408707865168539, "epoch": 0.5331664580725908, "step": 213}, {"loss": 0.8582785725593567, "grad_norm": 1.6103774309158325, "learning_rate": 4.912684180778869e-05, "token_acc": 0.7472986748216106, "epoch": 0.5356695869837297, "step": 214}, {"loss": 0.980675220489502, "grad_norm": 5.4966020584106445, "learning_rate": 4.9094401644886e-05, "token_acc": 0.7182641448950152, "epoch": 0.5381727158948686, "step": 215}, {"loss": 0.9365415573120117, "grad_norm": 2.9030697345733643, "learning_rate": 4.906138091134118e-05, "token_acc": 0.730092204526404, "epoch": 0.5406758448060075, "step": 216}, {"loss": 0.738396942615509, "grad_norm": 4.844046115875244, "learning_rate": 4.90277804028108e-05, "token_acc": 0.7914989692745656, "epoch": 0.5431789737171464, "step": 217}, {"loss": 0.9523649215698242, "grad_norm": 1.5353028774261475, "learning_rate": 4.8993600928921434e-05, "token_acc": 0.7237939963556153, "epoch": 0.5456821026282853, "step": 218}, {"loss": 0.7531812787055969, "grad_norm": 32.93247604370117, "learning_rate": 4.8958843313250294e-05, "token_acc": 0.7850740452065471, "epoch": 0.5481852315394243, "step": 219}, {"loss": 0.8953914642333984, "grad_norm": 2.059149742126465, "learning_rate": 4.892350839330522e-05, "token_acc": 0.7396288209606987, "epoch": 0.5506883604505632, "step": 220}, {"loss": 0.8436079025268555, "grad_norm": 3.8497390747070312, "learning_rate": 4.888759702050466e-05, "token_acc": 0.7543846828412745, "epoch": 0.5531914893617021, "step": 221}, {"loss": 0.8814166188240051, "grad_norm": 1.9176925420761108, "learning_rate": 4.885111006015701e-05, "token_acc": 0.7467446887026201, "epoch": 0.5556946182728411, "step": 222}, {"loss": 0.8513644337654114, "grad_norm": 1.9749252796173096, "learning_rate": 4.881404839143988e-05, "token_acc": 0.7457374830852503, "epoch": 0.55819774718398, "step": 223}, {"loss": 0.8055661916732788, "grad_norm": 4.914273262023926, "learning_rate": 4.877641290737884e-05, "token_acc": 0.7624061257546753, "epoch": 0.5607008760951189, "step": 224}, {"loss": 0.8872958421707153, "grad_norm": 31.535110473632812, "learning_rate": 4.873820451482592e-05, "token_acc": 0.7492080569003646, "epoch": 0.5632040050062578, "step": 225}, {"loss": 0.8905588388442993, "grad_norm": 2.174323320388794, "learning_rate": 4.8699424134437765e-05, "token_acc": 0.7426990645676478, "epoch": 0.5657071339173968, "step": 226}, {"loss": 0.8442504405975342, "grad_norm": 2.537534713745117, "learning_rate": 4.8660072700653445e-05, "token_acc": 0.759594451701188, "epoch": 0.5682102628285357, "step": 227}, {"loss": 0.8962931632995605, "grad_norm": 2.5602848529815674, "learning_rate": 4.862015116167196e-05, "token_acc": 0.7412289395441031, "epoch": 0.5707133917396746, "step": 228}, {"loss": 0.8395902514457703, "grad_norm": 7.3618927001953125, "learning_rate": 4.857966047942933e-05, "token_acc": 0.7582629846902275, "epoch": 0.5732165206508135, "step": 229}, {"loss": 0.8951698541641235, "grad_norm": 3.7751402854919434, "learning_rate": 4.853860162957552e-05, "token_acc": 0.7401862711279752, "epoch": 0.5757196495619524, "step": 230}, {"loss": 0.6874003410339355, "grad_norm": 1.730199933052063, "learning_rate": 4.849697560145083e-05, "token_acc": 0.7996880161497523, "epoch": 0.5782227784730913, "step": 231}, {"loss": 0.8303564190864563, "grad_norm": 1.931376576423645, "learning_rate": 4.8454783398062106e-05, "token_acc": 0.7600831909678378, "epoch": 0.5807259073842302, "step": 232}, {"loss": 0.8384573459625244, "grad_norm": 2.0311784744262695, "learning_rate": 4.8412026036058566e-05, "token_acc": 0.7549541998443393, "epoch": 0.5832290362953693, "step": 233}, {"loss": 0.8069633841514587, "grad_norm": 1.0220412015914917, "learning_rate": 4.836870454570731e-05, "token_acc": 0.7599480377410092, "epoch": 0.5857321652065082, "step": 234}, {"loss": 0.8110902309417725, "grad_norm": 3.729283571243286, "learning_rate": 4.8324819970868473e-05, "token_acc": 0.7580623121071332, "epoch": 0.5882352941176471, "step": 235}, {"loss": 0.856610894203186, "grad_norm": 1.758043646812439, "learning_rate": 4.828037336897009e-05, "token_acc": 0.746238951003922, "epoch": 0.590738423028786, "step": 236}, {"loss": 0.9790533781051636, "grad_norm": 4.306615829467773, "learning_rate": 4.8235365810982615e-05, "token_acc": 0.7135992011483493, "epoch": 0.5932415519399249, "step": 237}, {"loss": 0.7993966937065125, "grad_norm": 1.5020512342453003, "learning_rate": 4.8189798381393104e-05, "token_acc": 0.7609775641025641, "epoch": 0.5957446808510638, "step": 238}, {"loss": 0.8823633193969727, "grad_norm": 1.6187368631362915, "learning_rate": 4.81436721781791e-05, "token_acc": 0.7474736257634648, "epoch": 0.5982478097622027, "step": 239}, {"loss": 0.8518728017807007, "grad_norm": 2.4625823497772217, "learning_rate": 4.8096988312782174e-05, "token_acc": 0.748145340336817, "epoch": 0.6007509386733417, "step": 240}, {"loss": 0.6972458362579346, "grad_norm": 5.807409286499023, "learning_rate": 4.8049747910081117e-05, "token_acc": 0.7948159442387279, "epoch": 0.6032540675844806, "step": 241}, {"loss": 0.9044586420059204, "grad_norm": 2.591768503189087, "learning_rate": 4.8001952108364876e-05, "token_acc": 0.7324852097326632, "epoch": 0.6057571964956195, "step": 242}, {"loss": 0.9304581880569458, "grad_norm": 2.5517194271087646, "learning_rate": 4.79536020593051e-05, "token_acc": 0.727802037845706, "epoch": 0.6082603254067585, "step": 243}, {"loss": 0.8499206304550171, "grad_norm": 2.617535352706909, "learning_rate": 4.7904698927928406e-05, "token_acc": 0.7519966664351692, "epoch": 0.6107634543178974, "step": 244}, {"loss": 0.9406691789627075, "grad_norm": 1.3205288648605347, "learning_rate": 4.785524389258827e-05, "token_acc": 0.7282037303843308, "epoch": 0.6132665832290363, "step": 245}, {"loss": 0.8956192135810852, "grad_norm": 1.9039998054504395, "learning_rate": 4.7805238144936694e-05, "token_acc": 0.7330732381846017, "epoch": 0.6157697121401752, "step": 246}, {"loss": 0.7765395641326904, "grad_norm": 2.1243889331817627, "learning_rate": 4.7754682889895446e-05, "token_acc": 0.7724535218643624, "epoch": 0.6182728410513142, "step": 247}, {"loss": 0.8932359218597412, "grad_norm": 1.0170472860336304, "learning_rate": 4.7703579345627035e-05, "token_acc": 0.7361666956673046, "epoch": 0.6207759699624531, "step": 248}, {"loss": 0.9077604413032532, "grad_norm": 1.2093161344528198, "learning_rate": 4.765192874350537e-05, "token_acc": 0.734278362150693, "epoch": 0.623279098873592, "step": 249}, {"loss": 0.7469887733459473, "grad_norm": 6.2834248542785645, "learning_rate": 4.759973232808609e-05, "token_acc": 0.7800094891665349, "epoch": 0.6257822277847309, "step": 250}, {"loss": 0.8440943360328674, "grad_norm": 3.575439453125, "learning_rate": 4.7546991357076544e-05, "token_acc": 0.7537353459505018, "epoch": 0.6282853566958698, "step": 251}, {"loss": 0.8843530416488647, "grad_norm": 2.0179975032806396, "learning_rate": 4.749370710130554e-05, "token_acc": 0.7379267277268943, "epoch": 0.6307884856070087, "step": 252}, {"loss": 0.8424524068832397, "grad_norm": 1.3368704319000244, "learning_rate": 4.7439880844692675e-05, "token_acc": 0.7527279941802791, "epoch": 0.6332916145181476, "step": 253}, {"loss": 0.7525070905685425, "grad_norm": 7.156957149505615, "learning_rate": 4.738551388421743e-05, "token_acc": 0.7739664347114203, "epoch": 0.6357947434292867, "step": 254}, {"loss": 0.720240592956543, "grad_norm": 7.08997106552124, "learning_rate": 4.7330607529887884e-05, "token_acc": 0.7869349503858876, "epoch": 0.6382978723404256, "step": 255}, {"loss": 0.822435736656189, "grad_norm": 2.1491920948028564, "learning_rate": 4.72751631047092e-05, "token_acc": 0.7558427895092809, "epoch": 0.6408010012515645, "step": 256}, {"loss": 0.7940695285797119, "grad_norm": 4.267916679382324, "learning_rate": 4.721918194465169e-05, "token_acc": 0.7643436685018835, "epoch": 0.6433041301627034, "step": 257}, {"loss": 0.7873713374137878, "grad_norm": 3.5891292095184326, "learning_rate": 4.7162665398618664e-05, "token_acc": 0.7648121955052648, "epoch": 0.6458072590738423, "step": 258}, {"loss": 0.8356124758720398, "grad_norm": 2.214632749557495, "learning_rate": 4.7105614828413906e-05, "token_acc": 0.7503839773914112, "epoch": 0.6483103879849812, "step": 259}, {"loss": 0.8771319389343262, "grad_norm": 2.8201630115509033, "learning_rate": 4.7048031608708876e-05, "token_acc": 0.7445221131872564, "epoch": 0.6508135168961201, "step": 260}, {"loss": 0.9190523624420166, "grad_norm": 1.4439845085144043, "learning_rate": 4.698991712700958e-05, "token_acc": 0.7323772975156534, "epoch": 0.6533166458072591, "step": 261}, {"loss": 0.7340889573097229, "grad_norm": 4.227046489715576, "learning_rate": 4.693127278362311e-05, "token_acc": 0.7861572132044501, "epoch": 0.655819774718398, "step": 262}, {"loss": 0.905823826789856, "grad_norm": 1.6055476665496826, "learning_rate": 4.687209999162396e-05, "token_acc": 0.7359950479727638, "epoch": 0.6583229036295369, "step": 263}, {"loss": 0.9699968099594116, "grad_norm": 7.083006858825684, "learning_rate": 4.681240017681993e-05, "token_acc": 0.7199773578333188, "epoch": 0.6608260325406758, "step": 264}, {"loss": 0.8051294684410095, "grad_norm": 2.4387781620025635, "learning_rate": 4.6752174777717786e-05, "token_acc": 0.7680182752712735, "epoch": 0.6633291614518148, "step": 265}, {"loss": 0.8352447748184204, "grad_norm": 1.6597864627838135, "learning_rate": 4.6691425245488607e-05, "token_acc": 0.7523210168857872, "epoch": 0.6658322903629537, "step": 266}, {"loss": 0.952012300491333, "grad_norm": 3.9788217544555664, "learning_rate": 4.6630153043932784e-05, "token_acc": 0.7299187373027035, "epoch": 0.6683354192740926, "step": 267}, {"loss": 0.8457879424095154, "grad_norm": 2.355642080307007, "learning_rate": 4.65683596494448e-05, "token_acc": 0.7541639391955779, "epoch": 0.6708385481852316, "step": 268}, {"loss": 0.8699308037757874, "grad_norm": 5.1823248863220215, "learning_rate": 4.650604655097761e-05, "token_acc": 0.7468877351644058, "epoch": 0.6733416770963705, "step": 269}, {"loss": 0.8364484906196594, "grad_norm": 4.252589702606201, "learning_rate": 4.6443215250006806e-05, "token_acc": 0.7554215137153526, "epoch": 0.6758448060075094, "step": 270}, {"loss": 0.8568819165229797, "grad_norm": 1.3415782451629639, "learning_rate": 4.637986726049438e-05, "token_acc": 0.7485356078511972, "epoch": 0.6783479349186483, "step": 271}, {"loss": 0.8769652843475342, "grad_norm": 1.7074843645095825, "learning_rate": 4.6316004108852305e-05, "token_acc": 0.7422730723348877, "epoch": 0.6808510638297872, "step": 272}, {"loss": 0.8192580938339233, "grad_norm": 4.651581287384033, "learning_rate": 4.6251627333905724e-05, "token_acc": 0.7577268895757235, "epoch": 0.6833541927409261, "step": 273}, {"loss": 0.7910339832305908, "grad_norm": 4.706144332885742, "learning_rate": 4.618673848685586e-05, "token_acc": 0.7648066904304908, "epoch": 0.685857321652065, "step": 274}, {"loss": 0.8216524720191956, "grad_norm": 2.0272216796875, "learning_rate": 4.612133913124268e-05, "token_acc": 0.7571758072783188, "epoch": 0.688360450563204, "step": 275}, {"loss": 0.8251311779022217, "grad_norm": 1.8787137269973755, "learning_rate": 4.6055430842907167e-05, "token_acc": 0.7546209639681797, "epoch": 0.690863579474343, "step": 276}, {"loss": 0.9141278266906738, "grad_norm": 1.8774858713150024, "learning_rate": 4.59890152099534e-05, "token_acc": 0.732027338182084, "epoch": 0.6933667083854819, "step": 277}, {"loss": 0.8628591299057007, "grad_norm": 3.588717460632324, "learning_rate": 4.5922093832710236e-05, "token_acc": 0.7456560481176209, "epoch": 0.6958698372966208, "step": 278}, {"loss": 0.8396396040916443, "grad_norm": 2.5552499294281006, "learning_rate": 4.585466832369281e-05, "token_acc": 0.7532559149120903, "epoch": 0.6983729662077597, "step": 279}, {"loss": 0.7853731513023376, "grad_norm": 2.4589977264404297, "learning_rate": 4.5786740307563636e-05, "token_acc": 0.7682845427672357, "epoch": 0.7008760951188986, "step": 280}, {"loss": 0.9314486980438232, "grad_norm": 2.5455079078674316, "learning_rate": 4.5718311421093454e-05, "token_acc": 0.7245133049187882, "epoch": 0.7033792240300375, "step": 281}, {"loss": 0.8583184480667114, "grad_norm": 2.683380365371704, "learning_rate": 4.5649383313121827e-05, "token_acc": 0.7450482731163531, "epoch": 0.7058823529411765, "step": 282}, {"loss": 0.8894494771957397, "grad_norm": 1.3633437156677246, "learning_rate": 4.55799576445174e-05, "token_acc": 0.739060801921867, "epoch": 0.7083854818523154, "step": 283}, {"loss": 0.7389158606529236, "grad_norm": 4.674302101135254, "learning_rate": 4.551003608813784e-05, "token_acc": 0.7801253772927792, "epoch": 0.7108886107634543, "step": 284}, {"loss": 0.7430102825164795, "grad_norm": 2.4775431156158447, "learning_rate": 4.5439620328789593e-05, "token_acc": 0.7866531850353893, "epoch": 0.7133917396745932, "step": 285}, {"loss": 0.7329319715499878, "grad_norm": 2.010530471801758, "learning_rate": 4.536871206318723e-05, "token_acc": 0.7800226159065209, "epoch": 0.7158948685857321, "step": 286}, {"loss": 0.9150421619415283, "grad_norm": 3.449420213699341, "learning_rate": 4.529731299991262e-05, "token_acc": 0.7355081881985963, "epoch": 0.718397997496871, "step": 287}, {"loss": 0.8455727100372314, "grad_norm": 1.9925580024719238, "learning_rate": 4.522542485937369e-05, "token_acc": 0.7526455026455027, "epoch": 0.72090112640801, "step": 288}, {"loss": 0.9501767158508301, "grad_norm": 1.939789891242981, "learning_rate": 4.5153049373763026e-05, "token_acc": 0.7274806559929924, "epoch": 0.723404255319149, "step": 289}, {"loss": 0.828056275844574, "grad_norm": 1.328555941581726, "learning_rate": 4.508018828701612e-05, "token_acc": 0.7555241836484164, "epoch": 0.7259073842302879, "step": 290}, {"loss": 0.8774980902671814, "grad_norm": 2.5277862548828125, "learning_rate": 4.500684335476936e-05, "token_acc": 0.7489495798319328, "epoch": 0.7284105131414268, "step": 291}, {"loss": 0.9148298501968384, "grad_norm": 1.7016732692718506, "learning_rate": 4.493301634431768e-05, "token_acc": 0.735104948969767, "epoch": 0.7309136420525657, "step": 292}, {"loss": 0.8074817061424255, "grad_norm": 4.40346097946167, "learning_rate": 4.485870903457204e-05, "token_acc": 0.7590221897098268, "epoch": 0.7334167709637046, "step": 293}, {"loss": 0.8893970251083374, "grad_norm": 5.940386772155762, "learning_rate": 4.478392321601651e-05, "token_acc": 0.7431922534891121, "epoch": 0.7359198998748435, "step": 294}, {"loss": 0.7381858825683594, "grad_norm": 4.992410182952881, "learning_rate": 4.470866069066516e-05, "token_acc": 0.7853381258881551, "epoch": 0.7384230287859824, "step": 295}, {"loss": 0.838369607925415, "grad_norm": 5.966536998748779, "learning_rate": 4.463292327201862e-05, "token_acc": 0.754148620370821, "epoch": 0.7409261576971214, "step": 296}, {"loss": 0.8503720760345459, "grad_norm": 1.494193434715271, "learning_rate": 4.455671278502042e-05, "token_acc": 0.7541888163649821, "epoch": 0.7434292866082604, "step": 297}, {"loss": 0.7552746534347534, "grad_norm": 4.080326080322266, "learning_rate": 4.4480031066012916e-05, "token_acc": 0.7728544776119403, "epoch": 0.7459324155193993, "step": 298}, {"loss": 0.8308608531951904, "grad_norm": 1.7464518547058105, "learning_rate": 4.44028799626932e-05, "token_acc": 0.7577373937852757, "epoch": 0.7484355444305382, "step": 299}, {"loss": 0.8492376208305359, "grad_norm": 2.6353917121887207, "learning_rate": 4.4325261334068426e-05, "token_acc": 0.7513898676689375, "epoch": 0.7509386733416771, "step": 300}, {"loss": 0.9122411608695984, "grad_norm": 5.348440647125244, "learning_rate": 4.4247177050411114e-05, "token_acc": 0.7296964163433006, "epoch": 0.753441802252816, "step": 301}, {"loss": 0.8476892113685608, "grad_norm": 3.4473955631256104, "learning_rate": 4.416862899321404e-05, "token_acc": 0.7541979056942809, "epoch": 0.7559449311639549, "step": 302}, {"loss": 0.8833868503570557, "grad_norm": 1.6045217514038086, "learning_rate": 4.408961905514491e-05, "token_acc": 0.7396542108198549, "epoch": 0.7584480600750939, "step": 303}, {"loss": 0.7998722195625305, "grad_norm": 2.6573829650878906, "learning_rate": 4.401014914000078e-05, "token_acc": 0.7661461586508432, "epoch": 0.7609511889862328, "step": 304}, {"loss": 0.8530205488204956, "grad_norm": 2.9124984741210938, "learning_rate": 4.393022116266212e-05, "token_acc": 0.7466014447414823, "epoch": 0.7634543178973717, "step": 305}, {"loss": 0.806631863117218, "grad_norm": 13.436267852783203, "learning_rate": 4.384983704904674e-05, "token_acc": 0.7660835876966424, "epoch": 0.7659574468085106, "step": 306}, {"loss": 0.8307251334190369, "grad_norm": 4.7447686195373535, "learning_rate": 4.376899873606336e-05, "token_acc": 0.7573671342169604, "epoch": 0.7684605757196495, "step": 307}, {"loss": 0.7642802000045776, "grad_norm": 2.38670015335083, "learning_rate": 4.3687708171564925e-05, "token_acc": 0.7765166340508807, "epoch": 0.7709637046307884, "step": 308}, {"loss": 0.8567044138908386, "grad_norm": 1.7410259246826172, "learning_rate": 4.360596731430168e-05, "token_acc": 0.7521028037383177, "epoch": 0.7734668335419274, "step": 309}, {"loss": 0.9223236441612244, "grad_norm": 4.307875156402588, "learning_rate": 4.352377813387398e-05, "token_acc": 0.7292516473172262, "epoch": 0.7759699624530664, "step": 310}, {"loss": 0.685102641582489, "grad_norm": 3.766094207763672, "learning_rate": 4.3441142610684824e-05, "token_acc": 0.7947743004777226, "epoch": 0.7784730913642053, "step": 311}, {"loss": 0.7940619587898254, "grad_norm": 1.5777055025100708, "learning_rate": 4.335806273589214e-05, "token_acc": 0.7673673517230601, "epoch": 0.7809762202753442, "step": 312}, {"loss": 0.7358657121658325, "grad_norm": 4.047732353210449, "learning_rate": 4.3274540511360793e-05, "token_acc": 0.782784, "epoch": 0.7834793491864831, "step": 313}, {"loss": 0.8665168881416321, "grad_norm": 1.3510150909423828, "learning_rate": 4.319057794961437e-05, "token_acc": 0.7442531173127491, "epoch": 0.785982478097622, "step": 314}, {"loss": 0.7996443510055542, "grad_norm": 2.992387056350708, "learning_rate": 4.310617707378668e-05, "token_acc": 0.7625912988250239, "epoch": 0.7884856070087609, "step": 315}, {"loss": 0.8834421038627625, "grad_norm": 1.5894449949264526, "learning_rate": 4.302133991757297e-05, "token_acc": 0.7416610344690494, "epoch": 0.7909887359198998, "step": 316}, {"loss": 0.842120885848999, "grad_norm": 3.1843483448028564, "learning_rate": 4.2936068525181e-05, "token_acc": 0.7479250534267681, "epoch": 0.7934918648310388, "step": 317}, {"loss": 0.9776566028594971, "grad_norm": 1.8540269136428833, "learning_rate": 4.285036495128171e-05, "token_acc": 0.7195618838992333, "epoch": 0.7959949937421777, "step": 318}, {"loss": 0.8031361103057861, "grad_norm": 2.9334137439727783, "learning_rate": 4.276423126095974e-05, "token_acc": 0.7604228218764362, "epoch": 0.7984981226533167, "step": 319}, {"loss": 0.9410305023193359, "grad_norm": 1.6915321350097656, "learning_rate": 4.267766952966369e-05, "token_acc": 0.7282994213179018, "epoch": 0.8010012515644556, "step": 320}, {"loss": 0.9005149602890015, "grad_norm": 5.01201057434082, "learning_rate": 4.259068184315608e-05, "token_acc": 0.7376341577228185, "epoch": 0.8035043804755945, "step": 321}, {"loss": 0.7451943755149841, "grad_norm": 1.6810280084609985, "learning_rate": 4.250327029746309e-05, "token_acc": 0.781010719754977, "epoch": 0.8060075093867334, "step": 322}, {"loss": 0.740115761756897, "grad_norm": 5.86810827255249, "learning_rate": 4.24154369988241e-05, "token_acc": 0.7834601819194357, "epoch": 0.8085106382978723, "step": 323}, {"loss": 0.9164939522743225, "grad_norm": 1.2761876583099365, "learning_rate": 4.23271840636409e-05, "token_acc": 0.7285148767718044, "epoch": 0.8110137672090113, "step": 324}, {"loss": 0.7663041353225708, "grad_norm": 2.3560471534729004, "learning_rate": 4.223851361842668e-05, "token_acc": 0.7738841185116423, "epoch": 0.8135168961201502, "step": 325}, {"loss": 0.6357040405273438, "grad_norm": 3.6525771617889404, "learning_rate": 4.214942779975482e-05, "token_acc": 0.8093354430379747, "epoch": 0.8160200250312891, "step": 326}, {"loss": 0.9620451927185059, "grad_norm": 1.9545413255691528, "learning_rate": 4.205992875420742e-05, "token_acc": 0.7203116924422535, "epoch": 0.818523153942428, "step": 327}, {"loss": 0.8111364841461182, "grad_norm": 2.913717269897461, "learning_rate": 4.197001863832355e-05, "token_acc": 0.75743935983996, "epoch": 0.8210262828535669, "step": 328}, {"loss": 0.9955106973648071, "grad_norm": 1.9858478307724, "learning_rate": 4.187969961854726e-05, "token_acc": 0.7128412537917088, "epoch": 0.8235294117647058, "step": 329}, {"loss": 0.7481118440628052, "grad_norm": 6.050736904144287, "learning_rate": 4.178897387117546e-05, "token_acc": 0.7825464949928469, "epoch": 0.8260325406758448, "step": 330}, {"loss": 0.6872880458831787, "grad_norm": 1.8267136812210083, "learning_rate": 4.169784358230541e-05, "token_acc": 0.7973193262090201, "epoch": 0.8285356695869838, "step": 331}, {"loss": 0.7994587421417236, "grad_norm": 2.2636425495147705, "learning_rate": 4.1606310947782044e-05, "token_acc": 0.7658987358018353, "epoch": 0.8310387984981227, "step": 332}, {"loss": 0.7354224920272827, "grad_norm": 3.7548258304595947, "learning_rate": 4.151437817314513e-05, "token_acc": 0.7824889408229697, "epoch": 0.8335419274092616, "step": 333}, {"loss": 0.8958951830863953, "grad_norm": 2.3976776599884033, "learning_rate": 4.142204747357604e-05, "token_acc": 0.7402859448864292, "epoch": 0.8360450563204005, "step": 334}, {"loss": 0.8891469240188599, "grad_norm": 1.5932167768478394, "learning_rate": 4.1329321073844415e-05, "token_acc": 0.7463272467733302, "epoch": 0.8385481852315394, "step": 335}, {"loss": 0.7546243667602539, "grad_norm": 1.8860996961593628, "learning_rate": 4.123620120825459e-05, "token_acc": 0.7755037783375315, "epoch": 0.8410513141426783, "step": 336}, {"loss": 0.8346970081329346, "grad_norm": 3.2070868015289307, "learning_rate": 4.114269012059169e-05, "token_acc": 0.7553981106612686, "epoch": 0.8435544430538173, "step": 337}, {"loss": 0.8280372619628906, "grad_norm": 1.9174991846084595, "learning_rate": 4.104879006406758e-05, "token_acc": 0.7614895430407133, "epoch": 0.8460575719649562, "step": 338}, {"loss": 0.6412019729614258, "grad_norm": 7.967592716217041, "learning_rate": 4.095450330126663e-05, "token_acc": 0.8135894699395233, "epoch": 0.8485607008760951, "step": 339}, {"loss": 0.7411476373672485, "grad_norm": 1.8168036937713623, "learning_rate": 4.085983210409114e-05, "token_acc": 0.7818817070127277, "epoch": 0.851063829787234, "step": 340}, {"loss": 0.8266500234603882, "grad_norm": 5.3374481201171875, "learning_rate": 4.07647787537066e-05, "token_acc": 0.7557682359027419, "epoch": 0.853566958698373, "step": 341}, {"loss": 0.7055239677429199, "grad_norm": 6.361590385437012, "learning_rate": 4.066934554048674e-05, "token_acc": 0.7837323608688759, "epoch": 0.8560700876095119, "step": 342}, {"loss": 0.8333171606063843, "grad_norm": 4.529880046844482, "learning_rate": 4.0573534763958355e-05, "token_acc": 0.7545928944170419, "epoch": 0.8585732165206508, "step": 343}, {"loss": 0.8767172694206238, "grad_norm": 7.685861587524414, "learning_rate": 4.047734873274586e-05, "token_acc": 0.7442405662503945, "epoch": 0.8610763454317898, "step": 344}, {"loss": 0.8583240509033203, "grad_norm": 3.9726321697235107, "learning_rate": 4.038078976451567e-05, "token_acc": 0.7489155540532928, "epoch": 0.8635794743429287, "step": 345}, {"loss": 0.7588601112365723, "grad_norm": 1.581453800201416, "learning_rate": 4.028386018592041e-05, "token_acc": 0.7785956964892412, "epoch": 0.8660826032540676, "step": 346}, {"loss": 0.8237013816833496, "grad_norm": 3.0492961406707764, "learning_rate": 4.018656233254278e-05, "token_acc": 0.7580033277870216, "epoch": 0.8685857321652065, "step": 347}, {"loss": 0.7148709297180176, "grad_norm": 1.490657091140747, "learning_rate": 4.008889854883929e-05, "token_acc": 0.7866251062623972, "epoch": 0.8710888610763454, "step": 348}, {"loss": 0.8905333280563354, "grad_norm": 2.604755401611328, "learning_rate": 3.999087118808381e-05, "token_acc": 0.7405912450255827, "epoch": 0.8735919899874843, "step": 349}, {"loss": 0.9194896817207336, "grad_norm": 9.451438903808594, "learning_rate": 3.9892482612310836e-05, "token_acc": 0.7317846328538986, "epoch": 0.8760951188986232, "step": 350}, {"loss": 0.9222493171691895, "grad_norm": 1.6283177137374878, "learning_rate": 3.979373519225858e-05, "token_acc": 0.7324363188167625, "epoch": 0.8785982478097623, "step": 351}, {"loss": 0.8873315453529358, "grad_norm": 1.01435124874115, "learning_rate": 3.969463130731183e-05, "token_acc": 0.7386921685189971, "epoch": 0.8811013767209012, "step": 352}, {"loss": 0.8865751028060913, "grad_norm": 1.6070590019226074, "learning_rate": 3.959517334544466e-05, "token_acc": 0.7350283279486819, "epoch": 0.8836045056320401, "step": 353}, {"loss": 0.8619804382324219, "grad_norm": 2.5121443271636963, "learning_rate": 3.949536370316285e-05, "token_acc": 0.7479302448476308, "epoch": 0.886107634543179, "step": 354}, {"loss": 0.9314793348312378, "grad_norm": 1.3835835456848145, "learning_rate": 3.939520478544614e-05, "token_acc": 0.7263123142951469, "epoch": 0.8886107634543179, "step": 355}, {"loss": 0.8991205096244812, "grad_norm": 2.486131191253662, "learning_rate": 3.9294699005690305e-05, "token_acc": 0.7395881270133456, "epoch": 0.8911138923654568, "step": 356}, {"loss": 0.8544954061508179, "grad_norm": 2.7008180618286133, "learning_rate": 3.919384878564902e-05, "token_acc": 0.7505512359289777, "epoch": 0.8936170212765957, "step": 357}, {"loss": 0.7513941526412964, "grad_norm": 2.08654522895813, "learning_rate": 3.909265655537542e-05, "token_acc": 0.7819888236136983, "epoch": 0.8961201501877347, "step": 358}, {"loss": 0.7608502507209778, "grad_norm": 1.9756476879119873, "learning_rate": 3.899112475316366e-05, "token_acc": 0.772964191430312, "epoch": 0.8986232790988736, "step": 359}, {"loss": 0.8417959213256836, "grad_norm": 1.3755425214767456, "learning_rate": 3.888925582549006e-05, "token_acc": 0.7520785670442498, "epoch": 0.9011264080100125, "step": 360}, {"loss": 0.8518916368484497, "grad_norm": 2.1407554149627686, "learning_rate": 3.8787052226954234e-05, "token_acc": 0.7552394806314315, "epoch": 0.9036295369211514, "step": 361}, {"loss": 0.8237797021865845, "grad_norm": 4.228549003601074, "learning_rate": 3.868451642021992e-05, "token_acc": 0.7532420091324201, "epoch": 0.9061326658322904, "step": 362}, {"loss": 0.7693901062011719, "grad_norm": 2.090517044067383, "learning_rate": 3.8581650875955585e-05, "token_acc": 0.7751344989912575, "epoch": 0.9086357947434293, "step": 363}, {"loss": 0.6950187683105469, "grad_norm": 2.4747915267944336, "learning_rate": 3.847845807277502e-05, "token_acc": 0.7874652915509719, "epoch": 0.9111389236545682, "step": 364}, {"loss": 0.8348764181137085, "grad_norm": 1.813559651374817, "learning_rate": 3.8374940497177434e-05, "token_acc": 0.7503848566052796, "epoch": 0.9136420525657072, "step": 365}, {"loss": 0.809190571308136, "grad_norm": 1.9585214853286743, "learning_rate": 3.827110064348773e-05, "token_acc": 0.7566013071895424, "epoch": 0.9161451814768461, "step": 366}, {"loss": 0.8659224510192871, "grad_norm": 1.5872814655303955, "learning_rate": 3.816694101379631e-05, "token_acc": 0.7458495340369068, "epoch": 0.918648310387985, "step": 367}, {"loss": 0.6858774423599243, "grad_norm": 3.7991831302642822, "learning_rate": 3.8062464117898724e-05, "token_acc": 0.7921834567680913, "epoch": 0.9211514392991239, "step": 368}, {"loss": 0.9242225289344788, "grad_norm": 11.759095191955566, "learning_rate": 3.795767247323533e-05, "token_acc": 0.7271716902285054, "epoch": 0.9236545682102628, "step": 369}, {"loss": 0.7550444006919861, "grad_norm": 5.795279502868652, "learning_rate": 3.785256860483054e-05, "token_acc": 0.7739854877721043, "epoch": 0.9261576971214017, "step": 370}, {"loss": 0.8427231311798096, "grad_norm": 2.1931843757629395, "learning_rate": 3.774715504523202e-05, "token_acc": 0.7499619926012264, "epoch": 0.9286608260325406, "step": 371}, {"loss": 0.9125556945800781, "grad_norm": 1.1604092121124268, "learning_rate": 3.764143433444962e-05, "token_acc": 0.7275495750708215, "epoch": 0.9311639549436797, "step": 372}, {"loss": 0.8157449960708618, "grad_norm": 8.955742835998535, "learning_rate": 3.753540901989423e-05, "token_acc": 0.7604572450348043, "epoch": 0.9336670838548186, "step": 373}, {"loss": 0.9126226902008057, "grad_norm": 6.911311626434326, "learning_rate": 3.742908165631636e-05, "token_acc": 0.731775132504996, "epoch": 0.9361702127659575, "step": 374}, {"loss": 0.8590577244758606, "grad_norm": 1.0974699258804321, "learning_rate": 3.7322454805744605e-05, "token_acc": 0.7466798810703666, "epoch": 0.9386733416770964, "step": 375}, {"loss": 0.8356927037239075, "grad_norm": 17.13771629333496, "learning_rate": 3.721553103742388e-05, "token_acc": 0.7555617044825678, "epoch": 0.9411764705882353, "step": 376}, {"loss": 0.7597782611846924, "grad_norm": 1.2535425424575806, "learning_rate": 3.710831292775353e-05, "token_acc": 0.7681555758128229, "epoch": 0.9436795994993742, "step": 377}, {"loss": 0.7276159524917603, "grad_norm": 2.29099702835083, "learning_rate": 3.7000803060225284e-05, "token_acc": 0.7826947105372761, "epoch": 0.9461827284105131, "step": 378}, {"loss": 0.9814828634262085, "grad_norm": 2.584505319595337, "learning_rate": 3.689300402536093e-05, "token_acc": 0.7160717395089674, "epoch": 0.9486858573216521, "step": 379}, {"loss": 0.8274613618850708, "grad_norm": 1.3225842714309692, "learning_rate": 3.678491842064995e-05, "token_acc": 0.7544784652521916, "epoch": 0.951188986232791, "step": 380}, {"loss": 0.8384053707122803, "grad_norm": 3.4567878246307373, "learning_rate": 3.6676548850486915e-05, "token_acc": 0.7518606937227917, "epoch": 0.9536921151439299, "step": 381}, {"loss": 0.7467086315155029, "grad_norm": 3.5069363117218018, "learning_rate": 3.6567897926108756e-05, "token_acc": 0.7784389823199656, "epoch": 0.9561952440550688, "step": 382}, {"loss": 0.7556321620941162, "grad_norm": 1349.64501953125, "learning_rate": 3.645896826553178e-05, "token_acc": 0.7752317780960277, "epoch": 0.9586983729662077, "step": 383}, {"loss": 0.6211893558502197, "grad_norm": 2.6709060668945312, "learning_rate": 3.634976249348867e-05, "token_acc": 0.8125134148959005, "epoch": 0.9612015018773467, "step": 384}, {"loss": 0.8058912754058838, "grad_norm": 1.6858121156692505, "learning_rate": 3.624028324136517e-05, "token_acc": 0.7628393692433814, "epoch": 0.9637046307884856, "step": 385}, {"loss": 0.8431601524353027, "grad_norm": 1.219348430633545, "learning_rate": 3.613053314713671e-05, "token_acc": 0.7487229170336446, "epoch": 0.9662077596996246, "step": 386}, {"loss": 0.9082483053207397, "grad_norm": 1.4409899711608887, "learning_rate": 3.602051485530486e-05, "token_acc": 0.729979941367073, "epoch": 0.9687108886107635, "step": 387}, {"loss": 0.7665495872497559, "grad_norm": 1.596650242805481, "learning_rate": 3.591023101683355e-05, "token_acc": 0.7712696559774772, "epoch": 0.9712140175219024, "step": 388}, {"loss": 0.9287350177764893, "grad_norm": 1.0858607292175293, "learning_rate": 3.57996842890853e-05, "token_acc": 0.7277777777777777, "epoch": 0.9737171464330413, "step": 389}, {"loss": 0.6690181493759155, "grad_norm": 14.8970365524292, "learning_rate": 3.568887733575706e-05, "token_acc": 0.8004053765735012, "epoch": 0.9762202753441802, "step": 390}, {"loss": 0.8137506246566772, "grad_norm": 5.169677734375, "learning_rate": 3.55778128268161e-05, "token_acc": 0.7589914103629815, "epoch": 0.9787234042553191, "step": 391}, {"loss": 0.7818809747695923, "grad_norm": 1.0652302503585815, "learning_rate": 3.54664934384357e-05, "token_acc": 0.7646431342125679, "epoch": 0.981226533166458, "step": 392}, {"loss": 0.790520429611206, "grad_norm": 3.2523343563079834, "learning_rate": 3.5354921852930594e-05, "token_acc": 0.7665671262469026, "epoch": 0.983729662077597, "step": 393}, {"loss": 0.7343300580978394, "grad_norm": 1.9948564767837524, "learning_rate": 3.5243100758692386e-05, "token_acc": 0.7801844119693807, "epoch": 0.986232790988736, "step": 394}, {"loss": 0.823872447013855, "grad_norm": 8.779631614685059, "learning_rate": 3.513103285012475e-05, "token_acc": 0.7562481836675385, "epoch": 0.9887359198998749, "step": 395}, {"loss": 0.7353721857070923, "grad_norm": 3.0845484733581543, "learning_rate": 3.5018720827578524e-05, "token_acc": 0.7806098875712305, "epoch": 0.9912390488110138, "step": 396}, {"loss": 0.7633687257766724, "grad_norm": 1.4457420110702515, "learning_rate": 3.4906167397286646e-05, "token_acc": 0.7762840122363549, "epoch": 0.9937421777221527, "step": 397}, {"loss": 0.7144147157669067, "grad_norm": 3.5868849754333496, "learning_rate": 3.47933752712989e-05, "token_acc": 0.789120029455081, "epoch": 0.9962453066332916, "step": 398}, {"loss": 0.8580281734466553, "grad_norm": 2.74013614654541, "learning_rate": 3.468034716741664e-05, "token_acc": 0.7488521853198974, "epoch": 0.9987484355444305, "step": 399}, {"loss": 0.7465000152587891, "grad_norm": 2.7789676189422607, "learning_rate": 3.456708580912725e-05, "token_acc": 0.7748026089941641, "epoch": 1.0, "step": 400}, {"loss": 0.7482450008392334, "grad_norm": 2.5083093643188477, "learning_rate": 3.4453593925538515e-05, "token_acc": 0.7756680731364276, "epoch": 1.002503128911139, "step": 401}, {"loss": 0.8512796759605408, "grad_norm": 1.5304547548294067, "learning_rate": 3.433987425131291e-05, "token_acc": 0.7466814693247091, "epoch": 1.0050062578222778, "step": 402}, {"loss": 0.7484120726585388, "grad_norm": 3.557460308074951, "learning_rate": 3.4225929526601664e-05, "token_acc": 0.7753919962555581, "epoch": 1.0075093867334168, "step": 403}, {"loss": 0.6399465799331665, "grad_norm": 5.367844581604004, "learning_rate": 3.411176249697875e-05, "token_acc": 0.8064121850319669, "epoch": 1.0100125156445556, "step": 404}, {"loss": 0.7572115659713745, "grad_norm": 2.309791326522827, "learning_rate": 3.399737591337471e-05, "token_acc": 0.778211361310133, "epoch": 1.0125156445556946, "step": 405}, {"loss": 0.7999943494796753, "grad_norm": 10.43783950805664, "learning_rate": 3.388277253201041e-05, "token_acc": 0.7620247990189399, "epoch": 1.0150187734668334, "step": 406}, {"loss": 0.8064647912979126, "grad_norm": 4.304990768432617, "learning_rate": 3.3767955114330586e-05, "token_acc": 0.7639428499812007, "epoch": 1.0175219023779725, "step": 407}, {"loss": 0.8383949398994446, "grad_norm": 1.3805936574935913, "learning_rate": 3.365292642693732e-05, "token_acc": 0.7478151048244506, "epoch": 1.0200250312891115, "step": 408}, {"loss": 0.6969519257545471, "grad_norm": 2.6776158809661865, "learning_rate": 3.353768924152341e-05, "token_acc": 0.7909162786611614, "epoch": 1.0225281602002503, "step": 409}, {"loss": 0.9484398365020752, "grad_norm": 1.1812976598739624, "learning_rate": 3.34222463348055e-05, "token_acc": 0.7265209203307951, "epoch": 1.0250312891113893, "step": 410}, {"loss": 0.7456188797950745, "grad_norm": 7.378384113311768, "learning_rate": 3.330660048845727e-05, "token_acc": 0.7744972966405443, "epoch": 1.027534418022528, "step": 411}, {"loss": 0.8864508867263794, "grad_norm": 2.924264669418335, "learning_rate": 3.319075448904234e-05, "token_acc": 0.7376894683106887, "epoch": 1.0300375469336671, "step": 412}, {"loss": 0.6419383883476257, "grad_norm": 2.464365005493164, "learning_rate": 3.307471112794715e-05, "token_acc": 0.8134543953776311, "epoch": 1.032540675844806, "step": 413}, {"loss": 0.7585772275924683, "grad_norm": 5.192070007324219, "learning_rate": 3.2958473201313744e-05, "token_acc": 0.7764367456694391, "epoch": 1.035043804755945, "step": 414}, {"loss": 0.8554524183273315, "grad_norm": 2.1468076705932617, "learning_rate": 3.284204350997229e-05, "token_acc": 0.7464255019923431, "epoch": 1.037546933667084, "step": 415}, {"loss": 0.819720447063446, "grad_norm": 1.838391661643982, "learning_rate": 3.272542485937369e-05, "token_acc": 0.7565149747180085, "epoch": 1.0400500625782227, "step": 416}, {"loss": 0.8727908730506897, "grad_norm": 1.1302598714828491, "learning_rate": 3.260862005952193e-05, "token_acc": 0.7423896933074906, "epoch": 1.0425531914893618, "step": 417}, {"loss": 0.8348588943481445, "grad_norm": 1.2645598649978638, "learning_rate": 3.2491631924906416e-05, "token_acc": 0.7506860706860707, "epoch": 1.0450563204005006, "step": 418}, {"loss": 0.673876941204071, "grad_norm": 3.1367015838623047, "learning_rate": 3.23744632744341e-05, "token_acc": 0.7934364744491327, "epoch": 1.0475594493116396, "step": 419}, {"loss": 0.6246871948242188, "grad_norm": 10.951983451843262, "learning_rate": 3.225711693136156e-05, "token_acc": 0.8066268332428028, "epoch": 1.0500625782227784, "step": 420}, {"loss": 0.8184407949447632, "grad_norm": 3.3616561889648438, "learning_rate": 3.2139595723227054e-05, "token_acc": 0.7584331756487909, "epoch": 1.0525657071339174, "step": 421}, {"loss": 0.8076139688491821, "grad_norm": 1.6267706155776978, "learning_rate": 3.202190248178231e-05, "token_acc": 0.7578792160717577, "epoch": 1.0550688360450564, "step": 422}, {"loss": 0.6964325308799744, "grad_norm": 2.607529878616333, "learning_rate": 3.190404004292427e-05, "token_acc": 0.7924243768295929, "epoch": 1.0575719649561952, "step": 423}, {"loss": 0.8571556806564331, "grad_norm": 2.781243085861206, "learning_rate": 3.178601124662686e-05, "token_acc": 0.7462099943851769, "epoch": 1.0600750938673342, "step": 424}, {"loss": 0.758177638053894, "grad_norm": 1.86491858959198, "learning_rate": 3.1667818936872465e-05, "token_acc": 0.7680104961832062, "epoch": 1.062578222778473, "step": 425}, {"loss": 0.7757034301757812, "grad_norm": 2.1224405765533447, "learning_rate": 3.154946596158344e-05, "token_acc": 0.7722524774573699, "epoch": 1.065081351689612, "step": 426}, {"loss": 0.8123703002929688, "grad_norm": 1.8863650560379028, "learning_rate": 3.14309551725535e-05, "token_acc": 0.7639742969667657, "epoch": 1.0675844806007508, "step": 427}, {"loss": 0.7848698496818542, "grad_norm": 2.3641357421875, "learning_rate": 3.131228942537895e-05, "token_acc": 0.7647326852976913, "epoch": 1.0700876095118899, "step": 428}, {"loss": 0.7829238176345825, "grad_norm": 2.3047101497650146, "learning_rate": 3.119347157938996e-05, "token_acc": 0.7659560681656191, "epoch": 1.0725907384230289, "step": 429}, {"loss": 0.7950413227081299, "grad_norm": 2.6143319606781006, "learning_rate": 3.10745044975816e-05, "token_acc": 0.768625959038742, "epoch": 1.0750938673341677, "step": 430}, {"loss": 0.8089693784713745, "grad_norm": 1.3800603151321411, "learning_rate": 3.095539104654487e-05, "token_acc": 0.7642110762800418, "epoch": 1.0775969962453067, "step": 431}, {"loss": 0.8975304365158081, "grad_norm": 4.631928443908691, "learning_rate": 3.083613409639764e-05, "token_acc": 0.7377950351206317, "epoch": 1.0801001251564455, "step": 432}, {"loss": 0.8314036726951599, "grad_norm": 1.7472598552703857, "learning_rate": 3.071673652071549e-05, "token_acc": 0.7511785954815404, "epoch": 1.0826032540675845, "step": 433}, {"loss": 0.6671078205108643, "grad_norm": 3.089261054992676, "learning_rate": 3.0597201196462463e-05, "token_acc": 0.7968802528071001, "epoch": 1.0851063829787233, "step": 434}, {"loss": 0.8389818668365479, "grad_norm": 1.2681653499603271, "learning_rate": 3.0477531003921745e-05, "token_acc": 0.7532440676213618, "epoch": 1.0876095118898623, "step": 435}, {"loss": 0.740587055683136, "grad_norm": 1.615865707397461, "learning_rate": 3.035772882662627e-05, "token_acc": 0.7783269677226091, "epoch": 1.0901126408010013, "step": 436}, {"loss": 0.8281398415565491, "grad_norm": 1.1586065292358398, "learning_rate": 3.0237797551289228e-05, "token_acc": 0.7543171893608575, "epoch": 1.0926157697121401, "step": 437}, {"loss": 0.8269925117492676, "grad_norm": 1.2768690586090088, "learning_rate": 3.0117740067734495e-05, "token_acc": 0.752611147056105, "epoch": 1.0951188986232792, "step": 438}, {"loss": 0.6553794145584106, "grad_norm": 1.6892045736312866, "learning_rate": 2.9997559268827048e-05, "token_acc": 0.8029715762273901, "epoch": 1.097622027534418, "step": 439}, {"loss": 0.5059342384338379, "grad_norm": 11.613991737365723, "learning_rate": 2.9877258050403212e-05, "token_acc": 0.8454545454545455, "epoch": 1.100125156445557, "step": 440}, {"loss": 0.8626140356063843, "grad_norm": 1.2692391872406006, "learning_rate": 2.97568393112009e-05, "token_acc": 0.7472961054634916, "epoch": 1.1026282853566958, "step": 441}, {"loss": 0.637244701385498, "grad_norm": 10.773530006408691, "learning_rate": 2.963630595278977e-05, "token_acc": 0.8053183229813664, "epoch": 1.1051314142678348, "step": 442}, {"loss": 0.7247684001922607, "grad_norm": 4.59783411026001, "learning_rate": 2.9515660879501316e-05, "token_acc": 0.7837734769758795, "epoch": 1.1076345431789738, "step": 443}, {"loss": 0.8562126159667969, "grad_norm": 1.9800934791564941, "learning_rate": 2.9394906998358868e-05, "token_acc": 0.7429015397655035, "epoch": 1.1101376720901126, "step": 444}, {"loss": 0.7898328304290771, "grad_norm": 1.0154430866241455, "learning_rate": 2.9274047219007534e-05, "token_acc": 0.7574374230611407, "epoch": 1.1126408010012516, "step": 445}, {"loss": 0.8542905449867249, "grad_norm": 0.9506177306175232, "learning_rate": 2.9153084453644135e-05, "token_acc": 0.7462486726072303, "epoch": 1.1151439299123904, "step": 446}, {"loss": 0.7725399732589722, "grad_norm": 1.8862485885620117, "learning_rate": 2.9032021616947015e-05, "token_acc": 0.76569290197972, "epoch": 1.1176470588235294, "step": 447}, {"loss": 0.7496145367622375, "grad_norm": 2.745835065841675, "learning_rate": 2.8910861626005776e-05, "token_acc": 0.7733351163412677, "epoch": 1.1201501877346682, "step": 448}, {"loss": 0.6059656143188477, "grad_norm": 5.342070579528809, "learning_rate": 2.878960740025103e-05, "token_acc": 0.8215033744472888, "epoch": 1.1226533166458073, "step": 449}, {"loss": 0.6715121865272522, "grad_norm": 2.0042543411254883, "learning_rate": 2.8668261861384045e-05, "token_acc": 0.7972053027588678, "epoch": 1.1251564455569463, "step": 450}, {"loss": 0.7005834579467773, "grad_norm": 3.369508981704712, "learning_rate": 2.854682793330633e-05, "token_acc": 0.7925215723873442, "epoch": 1.127659574468085, "step": 451}, {"loss": 0.6925271153450012, "grad_norm": 2.255542516708374, "learning_rate": 2.8425308542049206e-05, "token_acc": 0.7939376553834385, "epoch": 1.130162703379224, "step": 452}, {"loss": 0.8258252143859863, "grad_norm": 1.9074103832244873, "learning_rate": 2.8303706615703253e-05, "token_acc": 0.7546308043643746, "epoch": 1.1326658322903629, "step": 453}, {"loss": 0.9210749864578247, "grad_norm": 1.9372538328170776, "learning_rate": 2.8182025084347836e-05, "token_acc": 0.7282898919262556, "epoch": 1.135168961201502, "step": 454}, {"loss": 0.695602536201477, "grad_norm": 2.819469928741455, "learning_rate": 2.8060266879980408e-05, "token_acc": 0.7881796251623678, "epoch": 1.1376720901126407, "step": 455}, {"loss": 0.7463157176971436, "grad_norm": 1.7250150442123413, "learning_rate": 2.7938434936445945e-05, "token_acc": 0.7749062109212171, "epoch": 1.1401752190237797, "step": 456}, {"loss": 0.787858247756958, "grad_norm": 2.6007657051086426, "learning_rate": 2.7816532189366197e-05, "token_acc": 0.7616864037040335, "epoch": 1.1426783479349187, "step": 457}, {"loss": 0.7881502509117126, "grad_norm": 2.298821210861206, "learning_rate": 2.7694561576068985e-05, "token_acc": 0.7664104482688252, "epoch": 1.1451814768460575, "step": 458}, {"loss": 0.8358293175697327, "grad_norm": 7.818414211273193, "learning_rate": 2.757252603551741e-05, "token_acc": 0.7499888487443687, "epoch": 1.1476846057571966, "step": 459}, {"loss": 0.8736441731452942, "grad_norm": 0.8642250299453735, "learning_rate": 2.7450428508239024e-05, "token_acc": 0.7447342910020269, "epoch": 1.1501877346683353, "step": 460}, {"loss": 0.8240588903427124, "grad_norm": 2.3678836822509766, "learning_rate": 2.7328271936254995e-05, "token_acc": 0.7507011866235167, "epoch": 1.1526908635794744, "step": 461}, {"loss": 0.8616459369659424, "grad_norm": 4.159181594848633, "learning_rate": 2.7206059263009244e-05, "token_acc": 0.7484583250447583, "epoch": 1.1551939924906134, "step": 462}, {"loss": 0.8544602394104004, "grad_norm": 2.0485188961029053, "learning_rate": 2.7083793433297438e-05, "token_acc": 0.7434052757793765, "epoch": 1.1576971214017522, "step": 463}, {"loss": 0.9081782102584839, "grad_norm": 3.685590982437134, "learning_rate": 2.6961477393196126e-05, "token_acc": 0.7326156444122791, "epoch": 1.1602002503128912, "step": 464}, {"loss": 0.7107387185096741, "grad_norm": 2.547394037246704, "learning_rate": 2.683911408999169e-05, "token_acc": 0.7819461633663366, "epoch": 1.16270337922403, "step": 465}, {"loss": 0.6490302085876465, "grad_norm": 4.8121209144592285, "learning_rate": 2.6716706472109342e-05, "token_acc": 0.8037789324515824, "epoch": 1.165206508135169, "step": 466}, {"loss": 0.5259852409362793, "grad_norm": 14.578204154968262, "learning_rate": 2.659425748904212e-05, "token_acc": 0.8461106745987204, "epoch": 1.1677096370463078, "step": 467}, {"loss": 0.7505219578742981, "grad_norm": 8.176078796386719, "learning_rate": 2.6471770091279724e-05, "token_acc": 0.7776547651997416, "epoch": 1.1702127659574468, "step": 468}, {"loss": 0.7255773544311523, "grad_norm": 3.2051355838775635, "learning_rate": 2.6349247230237552e-05, "token_acc": 0.7867267333260082, "epoch": 1.1727158948685856, "step": 469}, {"loss": 0.8417118787765503, "grad_norm": 1.626749038696289, "learning_rate": 2.6226691858185454e-05, "token_acc": 0.7481726244117353, "epoch": 1.1752190237797246, "step": 470}, {"loss": 0.7143338918685913, "grad_norm": 6.1625142097473145, "learning_rate": 2.6104106928176687e-05, "token_acc": 0.782307525795512, "epoch": 1.1777221526908637, "step": 471}, {"loss": 0.8743295669555664, "grad_norm": 1.209688425064087, "learning_rate": 2.598149539397672e-05, "token_acc": 0.7435388711951131, "epoch": 1.1802252816020025, "step": 472}, {"loss": 0.7911447286605835, "grad_norm": 4.4833550453186035, "learning_rate": 2.585886020999206e-05, "token_acc": 0.7650904203323559, "epoch": 1.1827284105131415, "step": 473}, {"loss": 0.8273140788078308, "grad_norm": 1.926804780960083, "learning_rate": 2.5736204331199088e-05, "token_acc": 0.7583581805493879, "epoch": 1.1852315394242803, "step": 474}, {"loss": 0.8174236416816711, "grad_norm": 1.872205376625061, "learning_rate": 2.561353071307281e-05, "token_acc": 0.7558880252469172, "epoch": 1.1877346683354193, "step": 475}, {"loss": 0.6719313263893127, "grad_norm": 3.878399610519409, "learning_rate": 2.5490842311515707e-05, "token_acc": 0.7988101223395341, "epoch": 1.1902377972465583, "step": 476}, {"loss": 0.7724275588989258, "grad_norm": 1.8818238973617554, "learning_rate": 2.5368142082786466e-05, "token_acc": 0.773079355042681, "epoch": 1.1927409261576971, "step": 477}, {"loss": 0.9049360752105713, "grad_norm": 2.963927745819092, "learning_rate": 2.5245432983428747e-05, "token_acc": 0.7339738348323794, "epoch": 1.1952440550688361, "step": 478}, {"loss": 0.8529146313667297, "grad_norm": 2.7415409088134766, "learning_rate": 2.5122717970199956e-05, "token_acc": 0.7456251892219194, "epoch": 1.197747183979975, "step": 479}, {"loss": 0.7292277812957764, "grad_norm": 1.6160272359848022, "learning_rate": 2.5e-05, "token_acc": 0.7809226832973535, "epoch": 1.200250312891114, "step": 480}, {"loss": 0.7619751691818237, "grad_norm": 1.343587875366211, "learning_rate": 2.4877282029800053e-05, "token_acc": 0.7706236189540879, "epoch": 1.2027534418022527, "step": 481}, {"loss": 0.8524097204208374, "grad_norm": 1.3238308429718018, "learning_rate": 2.4754567016571263e-05, "token_acc": 0.7446827604774298, "epoch": 1.2052565707133918, "step": 482}, {"loss": 0.7500920295715332, "grad_norm": 3.7486040592193604, "learning_rate": 2.4631857917213543e-05, "token_acc": 0.7754705144291092, "epoch": 1.2077596996245306, "step": 483}, {"loss": 0.8324809074401855, "grad_norm": 2.8402061462402344, "learning_rate": 2.4509157688484295e-05, "token_acc": 0.7528833831695857, "epoch": 1.2102628285356696, "step": 484}, {"loss": 0.8428285717964172, "grad_norm": 3.4831743240356445, "learning_rate": 2.4386469286927196e-05, "token_acc": 0.7473346542126615, "epoch": 1.2127659574468086, "step": 485}, {"loss": 0.9696469306945801, "grad_norm": 1.403225302696228, "learning_rate": 2.426379566880092e-05, "token_acc": 0.71866889465638, "epoch": 1.2152690863579474, "step": 486}, {"loss": 0.8492543697357178, "grad_norm": 1.4889639616012573, "learning_rate": 2.414113979000794e-05, "token_acc": 0.7504687579182081, "epoch": 1.2177722152690864, "step": 487}, {"loss": 0.7114861607551575, "grad_norm": 2.625995397567749, "learning_rate": 2.4018504606023293e-05, "token_acc": 0.7869125090383224, "epoch": 1.2202753441802252, "step": 488}, {"loss": 0.8308013677597046, "grad_norm": 1.7950961589813232, "learning_rate": 2.389589307182332e-05, "token_acc": 0.7517450509211581, "epoch": 1.2227784730913642, "step": 489}, {"loss": 0.6955065727233887, "grad_norm": 2.1624467372894287, "learning_rate": 2.3773308141814552e-05, "token_acc": 0.7887615628883059, "epoch": 1.2252816020025032, "step": 490}, {"loss": 0.8983242511749268, "grad_norm": 8.656285285949707, "learning_rate": 2.365075276976245e-05, "token_acc": 0.7329764252841175, "epoch": 1.227784730913642, "step": 491}, {"loss": 0.6728692650794983, "grad_norm": 2.0143282413482666, "learning_rate": 2.3528229908720272e-05, "token_acc": 0.7958803160791974, "epoch": 1.230287859824781, "step": 492}, {"loss": 0.7883687615394592, "grad_norm": 7.166861534118652, "learning_rate": 2.3405742510957894e-05, "token_acc": 0.7684217714949122, "epoch": 1.2327909887359199, "step": 493}, {"loss": 0.7245194911956787, "grad_norm": 2.849721908569336, "learning_rate": 2.328329352789066e-05, "token_acc": 0.7787610619469026, "epoch": 1.2352941176470589, "step": 494}, {"loss": 0.8468673825263977, "grad_norm": 5.236846923828125, "learning_rate": 2.3160885910008318e-05, "token_acc": 0.7493651103731197, "epoch": 1.2377972465581977, "step": 495}, {"loss": 0.8326257467269897, "grad_norm": 1.2859762907028198, "learning_rate": 2.303852260680388e-05, "token_acc": 0.7531454639099404, "epoch": 1.2403003754693367, "step": 496}, {"loss": 0.6319226622581482, "grad_norm": 1.9283963441848755, "learning_rate": 2.291620656670256e-05, "token_acc": 0.8054604261796042, "epoch": 1.2428035043804755, "step": 497}, {"loss": 0.6995894908905029, "grad_norm": 3.758319616317749, "learning_rate": 2.279394073699077e-05, "token_acc": 0.7890441061057919, "epoch": 1.2453066332916145, "step": 498}, {"loss": 0.7224262356758118, "grad_norm": 1.2176576852798462, "learning_rate": 2.267172806374501e-05, "token_acc": 0.7844820331566102, "epoch": 1.2478097622027535, "step": 499}, {"loss": 0.5559295415878296, "grad_norm": 2.0414905548095703, "learning_rate": 2.2549571491760986e-05, "token_acc": 0.830029368575624, "epoch": 1.2503128911138923, "step": 500}, {"loss": 0.6197410225868225, "grad_norm": 2.3053483963012695, "learning_rate": 2.2427473964482598e-05, "token_acc": 0.8072528564331843, "epoch": 1.2528160200250313, "step": 501}, {"loss": 0.8683875799179077, "grad_norm": 2.062232494354248, "learning_rate": 2.2305438423931017e-05, "token_acc": 0.743580453783796, "epoch": 1.2553191489361701, "step": 502}, {"loss": 0.9356937408447266, "grad_norm": 0.8906859755516052, "learning_rate": 2.2183467810633812e-05, "token_acc": 0.7245146004492445, "epoch": 1.2578222778473092, "step": 503}, {"loss": 0.6747022867202759, "grad_norm": 3.9231433868408203, "learning_rate": 2.2061565063554064e-05, "token_acc": 0.7981907419882591, "epoch": 1.2603254067584482, "step": 504}, {"loss": 0.7441482543945312, "grad_norm": 2.7428345680236816, "learning_rate": 2.1939733120019598e-05, "token_acc": 0.7742395794217048, "epoch": 1.262828535669587, "step": 505}, {"loss": 0.6530448198318481, "grad_norm": 1.9277092218399048, "learning_rate": 2.1817974915652173e-05, "token_acc": 0.7975220638153429, "epoch": 1.265331664580726, "step": 506}, {"loss": 0.6860779523849487, "grad_norm": 1.6292767524719238, "learning_rate": 2.1696293384296746e-05, "token_acc": 0.7898953564421191, "epoch": 1.2678347934918648, "step": 507}, {"loss": 0.8034096956253052, "grad_norm": 2.6792891025543213, "learning_rate": 2.1574691457950803e-05, "token_acc": 0.7567851055460862, "epoch": 1.2703379224030038, "step": 508}, {"loss": 0.7841708064079285, "grad_norm": 2.100313425064087, "learning_rate": 2.1453172066693673e-05, "token_acc": 0.7575472165766123, "epoch": 1.2728410513141426, "step": 509}, {"loss": 0.8183025121688843, "grad_norm": 2.4685211181640625, "learning_rate": 2.1331738138615958e-05, "token_acc": 0.7573227392094808, "epoch": 1.2753441802252816, "step": 510}, {"loss": 0.7484889030456543, "grad_norm": 6.109943389892578, "learning_rate": 2.1210392599748974e-05, "token_acc": 0.7755445227418322, "epoch": 1.2778473091364204, "step": 511}, {"loss": 0.8298561573028564, "grad_norm": 1.9834048748016357, "learning_rate": 2.1089138373994223e-05, "token_acc": 0.7505842708842871, "epoch": 1.2803504380475594, "step": 512}, {"loss": 0.8005748987197876, "grad_norm": 2.403406858444214, "learning_rate": 2.0967978383052994e-05, "token_acc": 0.758890922109953, "epoch": 1.2828535669586985, "step": 513}, {"loss": 0.7584190368652344, "grad_norm": 1.7540974617004395, "learning_rate": 2.0846915546355868e-05, "token_acc": 0.7752175818671342, "epoch": 1.2853566958698373, "step": 514}, {"loss": 0.8561462163925171, "grad_norm": 3.21459698677063, "learning_rate": 2.0725952780992468e-05, "token_acc": 0.7418676224239354, "epoch": 1.2878598247809763, "step": 515}, {"loss": 0.7925042510032654, "grad_norm": 1.681273341178894, "learning_rate": 2.0605093001641138e-05, "token_acc": 0.7639773324764854, "epoch": 1.290362953692115, "step": 516}, {"loss": 0.8750126361846924, "grad_norm": 1.0431792736053467, "learning_rate": 2.048433912049868e-05, "token_acc": 0.7400191632066433, "epoch": 1.292866082603254, "step": 517}, {"loss": 0.7869176864624023, "grad_norm": 4.3631911277771, "learning_rate": 2.036369404721023e-05, "token_acc": 0.7620188403443235, "epoch": 1.295369211514393, "step": 518}, {"loss": 0.8369603753089905, "grad_norm": 1.3742365837097168, "learning_rate": 2.0243160688799105e-05, "token_acc": 0.7513550803193062, "epoch": 1.297872340425532, "step": 519}, {"loss": 0.86566162109375, "grad_norm": 0.8509203791618347, "learning_rate": 2.0122741949596797e-05, "token_acc": 0.7443547816238408, "epoch": 1.300375469336671, "step": 520}, {"loss": 0.8384143114089966, "grad_norm": 1.0245444774627686, "learning_rate": 2.0002440731172958e-05, "token_acc": 0.748472884386174, "epoch": 1.3028785982478097, "step": 521}, {"loss": 0.7885670065879822, "grad_norm": 1.5151759386062622, "learning_rate": 1.988225993226551e-05, "token_acc": 0.7661560384752405, "epoch": 1.3053817271589487, "step": 522}, {"loss": 0.7875890731811523, "grad_norm": 4.340545177459717, "learning_rate": 1.976220244871079e-05, "token_acc": 0.764338076757223, "epoch": 1.3078848560700875, "step": 523}, {"loss": 0.8240665793418884, "grad_norm": 1.4497512578964233, "learning_rate": 1.9642271173373737e-05, "token_acc": 0.7531088719587122, "epoch": 1.3103879849812266, "step": 524}, {"loss": 0.7155791521072388, "grad_norm": 4.8524088859558105, "learning_rate": 1.9522468996078258e-05, "token_acc": 0.7859528907922912, "epoch": 1.3128911138923653, "step": 525}, {"loss": 0.8229907155036926, "grad_norm": 1.4243345260620117, "learning_rate": 1.940279880353754e-05, "token_acc": 0.7575123417042283, "epoch": 1.3153942428035044, "step": 526}, {"loss": 0.8167639374732971, "grad_norm": 1.1557880640029907, "learning_rate": 1.9283263479284514e-05, "token_acc": 0.7524916943521595, "epoch": 1.3178973717146434, "step": 527}, {"loss": 0.7714104056358337, "grad_norm": 2.145895004272461, "learning_rate": 1.9163865903602374e-05, "token_acc": 0.7715271647540326, "epoch": 1.3204005006257822, "step": 528}, {"loss": 0.8628207445144653, "grad_norm": 1.0105962753295898, "learning_rate": 1.9044608953455138e-05, "token_acc": 0.7388354186717998, "epoch": 1.3229036295369212, "step": 529}, {"loss": 0.8422914743423462, "grad_norm": 1.6246225833892822, "learning_rate": 1.8925495502418406e-05, "token_acc": 0.7541976188053322, "epoch": 1.32540675844806, "step": 530}, {"loss": 0.6368581056594849, "grad_norm": 1.6991968154907227, "learning_rate": 1.880652842061004e-05, "token_acc": 0.8030737554231929, "epoch": 1.327909887359199, "step": 531}, {"loss": 0.9611953496932983, "grad_norm": 1.9977556467056274, "learning_rate": 1.868771057462105e-05, "token_acc": 0.7224977890567924, "epoch": 1.330413016270338, "step": 532}, {"loss": 0.779466450214386, "grad_norm": 1.7200034856796265, "learning_rate": 1.8569044827446515e-05, "token_acc": 0.7697901384193404, "epoch": 1.3329161451814768, "step": 533}, {"loss": 0.8787710070610046, "grad_norm": 2.9292917251586914, "learning_rate": 1.8450534038416568e-05, "token_acc": 0.7420819370878824, "epoch": 1.3354192740926158, "step": 534}, {"loss": 0.7538915276527405, "grad_norm": 1.74767005443573, "learning_rate": 1.8332181063127545e-05, "token_acc": 0.7723708164122672, "epoch": 1.3379224030037546, "step": 535}, {"loss": 0.8347668647766113, "grad_norm": 2.842759132385254, "learning_rate": 1.8213988753373146e-05, "token_acc": 0.7466009191880506, "epoch": 1.3404255319148937, "step": 536}, {"loss": 0.813193678855896, "grad_norm": 1.0351887941360474, "learning_rate": 1.809595995707573e-05, "token_acc": 0.756039689387403, "epoch": 1.3429286608260325, "step": 537}, {"loss": 0.7035706043243408, "grad_norm": 2.1326282024383545, "learning_rate": 1.7978097518217703e-05, "token_acc": 0.7871062158206886, "epoch": 1.3454317897371715, "step": 538}, {"loss": 0.6484057903289795, "grad_norm": 1.6530029773712158, "learning_rate": 1.7860404276772945e-05, "token_acc": 0.8037213327563825, "epoch": 1.3479349186483103, "step": 539}, {"loss": 0.8277699947357178, "grad_norm": 1.397707462310791, "learning_rate": 1.7742883068638447e-05, "token_acc": 0.7495398833065747, "epoch": 1.3504380475594493, "step": 540}, {"loss": 0.8146207332611084, "grad_norm": 2.410323143005371, "learning_rate": 1.762553672556591e-05, "token_acc": 0.7571063829787235, "epoch": 1.3529411764705883, "step": 541}, {"loss": 0.7210761904716492, "grad_norm": 1.910866379737854, "learning_rate": 1.7508368075093583e-05, "token_acc": 0.7774188701923077, "epoch": 1.355444305381727, "step": 542}, {"loss": 0.6522407531738281, "grad_norm": 11.782573699951172, "learning_rate": 1.7391379940478076e-05, "token_acc": 0.8072419561153202, "epoch": 1.3579474342928661, "step": 543}, {"loss": 0.7852916121482849, "grad_norm": 1.7913554906845093, "learning_rate": 1.7274575140626318e-05, "token_acc": 0.7610718065845914, "epoch": 1.360450563204005, "step": 544}, {"loss": 0.7586523294448853, "grad_norm": 1.8758189678192139, "learning_rate": 1.7157956490027717e-05, "token_acc": 0.7717872152178722, "epoch": 1.362953692115144, "step": 545}, {"loss": 0.6757744550704956, "grad_norm": 3.353968858718872, "learning_rate": 1.704152679868626e-05, "token_acc": 0.793317610062893, "epoch": 1.365456821026283, "step": 546}, {"loss": 0.8068370819091797, "grad_norm": 1.8377400636672974, "learning_rate": 1.6925288872052843e-05, "token_acc": 0.7570990806945863, "epoch": 1.3679599499374218, "step": 547}, {"loss": 0.8233660459518433, "grad_norm": 1.3780946731567383, "learning_rate": 1.6809245510957665e-05, "token_acc": 0.7505704506560182, "epoch": 1.3704630788485608, "step": 548}, {"loss": 0.7289072871208191, "grad_norm": 5.142945766448975, "learning_rate": 1.6693399511542735e-05, "token_acc": 0.7812933869199854, "epoch": 1.3729662077596996, "step": 549}, {"loss": 0.7236466407775879, "grad_norm": 1.773954153060913, "learning_rate": 1.65777536651945e-05, "token_acc": 0.7810041481905307, "epoch": 1.3754693366708386, "step": 550}, {"loss": 0.8042117357254028, "grad_norm": 3.5997884273529053, "learning_rate": 1.6462310758476595e-05, "token_acc": 0.7581943081452405, "epoch": 1.3779724655819774, "step": 551}, {"loss": 0.8300492167472839, "grad_norm": 0.8696406483650208, "learning_rate": 1.6347073573062672e-05, "token_acc": 0.7506484670663776, "epoch": 1.3804755944931164, "step": 552}, {"loss": 0.748427152633667, "grad_norm": 1.5040565729141235, "learning_rate": 1.6232044885669427e-05, "token_acc": 0.7755393724903015, "epoch": 1.3829787234042552, "step": 553}, {"loss": 0.703101634979248, "grad_norm": 7.286196708679199, "learning_rate": 1.6117227467989602e-05, "token_acc": 0.7881292820971105, "epoch": 1.3854818523153942, "step": 554}, {"loss": 0.8726459741592407, "grad_norm": 1.6359056234359741, "learning_rate": 1.6002624086625294e-05, "token_acc": 0.7418959244573438, "epoch": 1.3879849812265332, "step": 555}, {"loss": 0.7041570544242859, "grad_norm": 5.042118549346924, "learning_rate": 1.588823750302126e-05, "token_acc": 0.7845845042151747, "epoch": 1.390488110137672, "step": 556}, {"loss": 0.8025046586990356, "grad_norm": 1.9065269231796265, "learning_rate": 1.577407047339834e-05, "token_acc": 0.7626718792127258, "epoch": 1.392991239048811, "step": 557}, {"loss": 0.6778990030288696, "grad_norm": 1.8250200748443604, "learning_rate": 1.5660125748687094e-05, "token_acc": 0.7909020418712845, "epoch": 1.3954943679599499, "step": 558}, {"loss": 0.8701958656311035, "grad_norm": 2.2167229652404785, "learning_rate": 1.5546406074461488e-05, "token_acc": 0.7410597648595689, "epoch": 1.3979974968710889, "step": 559}, {"loss": 0.8122137784957886, "grad_norm": 3.1135730743408203, "learning_rate": 1.5432914190872757e-05, "token_acc": 0.7573019661325151, "epoch": 1.400500625782228, "step": 560}, {"loss": 0.7499758005142212, "grad_norm": 1.591567039489746, "learning_rate": 1.5319652832583362e-05, "token_acc": 0.7801376009572241, "epoch": 1.4030037546933667, "step": 561}, {"loss": 0.7822006940841675, "grad_norm": 2.626103401184082, "learning_rate": 1.5206624728701103e-05, "token_acc": 0.7697957003605288, "epoch": 1.4055068836045057, "step": 562}, {"loss": 0.8059190511703491, "grad_norm": 1.4338953495025635, "learning_rate": 1.5093832602713365e-05, "token_acc": 0.7583813140593736, "epoch": 1.4080100125156445, "step": 563}, {"loss": 0.956562876701355, "grad_norm": 2.3067641258239746, "learning_rate": 1.498127917242148e-05, "token_acc": 0.7224202015557344, "epoch": 1.4105131414267835, "step": 564}, {"loss": 0.7793439030647278, "grad_norm": 4.148603439331055, "learning_rate": 1.4868967149875257e-05, "token_acc": 0.7708575412502905, "epoch": 1.4130162703379223, "step": 565}, {"loss": 0.8436172008514404, "grad_norm": 3.040891170501709, "learning_rate": 1.4756899241307615e-05, "token_acc": 0.7491851498529295, "epoch": 1.4155193992490613, "step": 566}, {"loss": 0.7122055292129517, "grad_norm": 6.971378803253174, "learning_rate": 1.4645078147069402e-05, "token_acc": 0.7875359934183463, "epoch": 1.4180225281602001, "step": 567}, {"loss": 0.7449221611022949, "grad_norm": 2.5589678287506104, "learning_rate": 1.4533506561564306e-05, "token_acc": 0.7731634868045242, "epoch": 1.4205256570713392, "step": 568}, {"loss": 0.8547236323356628, "grad_norm": 3.4065513610839844, "learning_rate": 1.4422187173183899e-05, "token_acc": 0.7475447402880838, "epoch": 1.4230287859824782, "step": 569}, {"loss": 0.7997812628746033, "grad_norm": 2.0447330474853516, "learning_rate": 1.4311122664242954e-05, "token_acc": 0.7587858644117503, "epoch": 1.425531914893617, "step": 570}, {"loss": 0.7676827907562256, "grad_norm": 19.273677825927734, "learning_rate": 1.4200315710914705e-05, "token_acc": 0.77000777000777, "epoch": 1.428035043804756, "step": 571}, {"loss": 0.7329694032669067, "grad_norm": 3.677581548690796, "learning_rate": 1.4089768983166444e-05, "token_acc": 0.7787445286644603, "epoch": 1.4305381727158948, "step": 572}, {"loss": 0.6624218225479126, "grad_norm": 2.750782012939453, "learning_rate": 1.3979485144695158e-05, "token_acc": 0.7990237205400046, "epoch": 1.4330413016270338, "step": 573}, {"loss": 0.7868748903274536, "grad_norm": 1.7288239002227783, "learning_rate": 1.38694668528633e-05, "token_acc": 0.7691857059168131, "epoch": 1.4355444305381728, "step": 574}, {"loss": 0.8554753661155701, "grad_norm": 1.542420744895935, "learning_rate": 1.3759716758634832e-05, "token_acc": 0.7459746488523467, "epoch": 1.4380475594493116, "step": 575}, {"loss": 0.8055590987205505, "grad_norm": 1.5799529552459717, "learning_rate": 1.3650237506511331e-05, "token_acc": 0.7627781853753974, "epoch": 1.4405506883604506, "step": 576}, {"loss": 0.8156087398529053, "grad_norm": 2.379765748977661, "learning_rate": 1.3541031734468212e-05, "token_acc": 0.7587134194568943, "epoch": 1.4430538172715894, "step": 577}, {"loss": 0.6562641859054565, "grad_norm": 5.061030864715576, "learning_rate": 1.3432102073891251e-05, "token_acc": 0.8027216563700117, "epoch": 1.4455569461827285, "step": 578}, {"loss": 0.6440657377243042, "grad_norm": 3.107051372528076, "learning_rate": 1.3323451149513092e-05, "token_acc": 0.806850025947068, "epoch": 1.4480600750938675, "step": 579}, {"loss": 0.7621431350708008, "grad_norm": 1.5127389430999756, "learning_rate": 1.3215081579350058e-05, "token_acc": 0.7777696579947384, "epoch": 1.4505632040050063, "step": 580}, {"loss": 0.7451849579811096, "grad_norm": 3.7916858196258545, "learning_rate": 1.3106995974639084e-05, "token_acc": 0.7728736170461863, "epoch": 1.453066332916145, "step": 581}, {"loss": 0.9144057035446167, "grad_norm": 1.4253214597702026, "learning_rate": 1.2999196939774722e-05, "token_acc": 0.7358452790902539, "epoch": 1.455569461827284, "step": 582}, {"loss": 0.6499612331390381, "grad_norm": 2.429523229598999, "learning_rate": 1.2891687072246472e-05, "token_acc": 0.8022828400077384, "epoch": 1.458072590738423, "step": 583}, {"loss": 0.8545807600021362, "grad_norm": 1.506866693496704, "learning_rate": 1.2784468962576136e-05, "token_acc": 0.7438212275161334, "epoch": 1.460575719649562, "step": 584}, {"loss": 0.7255370020866394, "grad_norm": 1.14063560962677, "learning_rate": 1.2677545194255402e-05, "token_acc": 0.7810890120639061, "epoch": 1.463078848560701, "step": 585}, {"loss": 0.7315889000892639, "grad_norm": 2.096499443054199, "learning_rate": 1.2570918343683635e-05, "token_acc": 0.7754388468674183, "epoch": 1.4655819774718397, "step": 586}, {"loss": 0.8230787515640259, "grad_norm": 5.344691753387451, "learning_rate": 1.2464590980105776e-05, "token_acc": 0.7523631400697569, "epoch": 1.4680851063829787, "step": 587}, {"loss": 0.676746129989624, "grad_norm": 1.977255940437317, "learning_rate": 1.235856566555039e-05, "token_acc": 0.7930442637759711, "epoch": 1.4705882352941178, "step": 588}, {"loss": 0.7244657278060913, "grad_norm": 1.3346836566925049, "learning_rate": 1.2252844954767984e-05, "token_acc": 0.7811462961921368, "epoch": 1.4730913642052565, "step": 589}, {"loss": 0.6661178469657898, "grad_norm": 3.2221341133117676, "learning_rate": 1.2147431395169459e-05, "token_acc": 0.7992459076696707, "epoch": 1.4755944931163956, "step": 590}, {"loss": 0.744454026222229, "grad_norm": 4.241289138793945, "learning_rate": 1.2042327526764669e-05, "token_acc": 0.7769393863806435, "epoch": 1.4780976220275344, "step": 591}, {"loss": 0.6379393339157104, "grad_norm": 7.127607822418213, "learning_rate": 1.1937535882101281e-05, "token_acc": 0.8044160942100098, "epoch": 1.4806007509386734, "step": 592}, {"loss": 0.7646165490150452, "grad_norm": 1.677003264427185, "learning_rate": 1.1833058986203705e-05, "token_acc": 0.7687584863333137, "epoch": 1.4831038798498124, "step": 593}, {"loss": 0.8055639266967773, "grad_norm": 1.2843506336212158, "learning_rate": 1.1728899356512265e-05, "token_acc": 0.7631550337029789, "epoch": 1.4856070087609512, "step": 594}, {"loss": 0.7198688983917236, "grad_norm": 1.2286913394927979, "learning_rate": 1.1625059502822574e-05, "token_acc": 0.7768950480855386, "epoch": 1.48811013767209, "step": 595}, {"loss": 0.6652401685714722, "grad_norm": 4.122060298919678, "learning_rate": 1.1521541927224994e-05, "token_acc": 0.7982724491632176, "epoch": 1.490613266583229, "step": 596}, {"loss": 0.8203213214874268, "grad_norm": 3.4319710731506348, "learning_rate": 1.1418349124044405e-05, "token_acc": 0.7535128506463645, "epoch": 1.493116395494368, "step": 597}, {"loss": 0.8763255476951599, "grad_norm": 1.9524973630905151, "learning_rate": 1.1315483579780095e-05, "token_acc": 0.7429590926468714, "epoch": 1.4956195244055068, "step": 598}, {"loss": 0.7097381949424744, "grad_norm": 2.4943723678588867, "learning_rate": 1.1212947773045767e-05, "token_acc": 0.7815607985480943, "epoch": 1.4981226533166458, "step": 599}, {"loss": 0.7615182399749756, "grad_norm": 21.619144439697266, "learning_rate": 1.1110744174509952e-05, "token_acc": 0.7687875878101784, "epoch": 1.5006257822277846, "step": 600}, {"loss": 0.7482010722160339, "grad_norm": 1.6322247982025146, "learning_rate": 1.100887524683635e-05, "token_acc": 0.7713472485768501, "epoch": 1.5031289111389237, "step": 601}, {"loss": 0.8905367851257324, "grad_norm": 1.0364089012145996, "learning_rate": 1.090734344462458e-05, "token_acc": 0.7401884180917088, "epoch": 1.5056320400500627, "step": 602}, {"loss": 0.7736368179321289, "grad_norm": 4.594523906707764, "learning_rate": 1.0806151214350995e-05, "token_acc": 0.7722505668934241, "epoch": 1.5081351689612015, "step": 603}, {"loss": 0.744308590888977, "grad_norm": 1.897789478302002, "learning_rate": 1.0705300994309697e-05, "token_acc": 0.7725912143030499, "epoch": 1.5106382978723403, "step": 604}, {"loss": 0.6907957196235657, "grad_norm": 3.5902726650238037, "learning_rate": 1.0604795214553868e-05, "token_acc": 0.7894978216005504, "epoch": 1.5131414267834793, "step": 605}, {"loss": 0.8940221071243286, "grad_norm": 1.7016520500183105, "learning_rate": 1.0504636296837161e-05, "token_acc": 0.7394552473548756, "epoch": 1.5156445556946183, "step": 606}, {"loss": 0.8362439870834351, "grad_norm": 1.5157966613769531, "learning_rate": 1.0404826654555342e-05, "token_acc": 0.7472730147020077, "epoch": 1.5181476846057573, "step": 607}, {"loss": 0.786865234375, "grad_norm": 2.323500871658325, "learning_rate": 1.0305368692688174e-05, "token_acc": 0.764400989515844, "epoch": 1.5206508135168961, "step": 608}, {"loss": 0.7950047254562378, "grad_norm": 74.33378601074219, "learning_rate": 1.0206264807741434e-05, "token_acc": 0.7578022799476734, "epoch": 1.523153942428035, "step": 609}, {"loss": 0.6147444248199463, "grad_norm": 3.3788833618164062, "learning_rate": 1.0107517387689166e-05, "token_acc": 0.815751960085531, "epoch": 1.525657071339174, "step": 610}, {"loss": 0.6397148966789246, "grad_norm": 2.66544771194458, "learning_rate": 1.0009128811916197e-05, "token_acc": 0.7999815990431502, "epoch": 1.528160200250313, "step": 611}, {"loss": 0.7612807750701904, "grad_norm": 1.6965497732162476, "learning_rate": 9.911101451160715e-06, "token_acc": 0.7722021881303098, "epoch": 1.530663329161452, "step": 612}, {"loss": 0.65788334608078, "grad_norm": 2.2254910469055176, "learning_rate": 9.813437667457229e-06, "token_acc": 0.8018885221855518, "epoch": 1.5331664580725908, "step": 613}, {"loss": 0.8385921716690063, "grad_norm": 1.936301350593567, "learning_rate": 9.716139814079595e-06, "token_acc": 0.7499523416153016, "epoch": 1.5356695869837296, "step": 614}, {"loss": 0.7441162467002869, "grad_norm": 3.259331703186035, "learning_rate": 9.619210235484333e-06, "token_acc": 0.7762369996848408, "epoch": 1.5381727158948686, "step": 615}, {"loss": 0.7276872992515564, "grad_norm": 3.5360541343688965, "learning_rate": 9.522651267254149e-06, "token_acc": 0.7725686181183563, "epoch": 1.5406758448060076, "step": 616}, {"loss": 0.702145516872406, "grad_norm": 1.201682209968567, "learning_rate": 9.426465236041651e-06, "token_acc": 0.7885718382563809, "epoch": 1.5431789737171464, "step": 617}, {"loss": 0.7966522574424744, "grad_norm": 1.1223235130310059, "learning_rate": 9.330654459513266e-06, "token_acc": 0.7599822756141992, "epoch": 1.5456821026282852, "step": 618}, {"loss": 0.8100804090499878, "grad_norm": 2.9685420989990234, "learning_rate": 9.235221246293405e-06, "token_acc": 0.756401384083045, "epoch": 1.5481852315394242, "step": 619}, {"loss": 0.7754491567611694, "grad_norm": 2.115173578262329, "learning_rate": 9.140167895908867e-06, "token_acc": 0.7694536716375716, "epoch": 1.5506883604505632, "step": 620}, {"loss": 0.815934419631958, "grad_norm": 1.030800700187683, "learning_rate": 9.04549669873337e-06, "token_acc": 0.7545691906005222, "epoch": 1.5531914893617023, "step": 621}, {"loss": 0.6096709966659546, "grad_norm": 9.539032936096191, "learning_rate": 8.951209935932426e-06, "token_acc": 0.8140929535232384, "epoch": 1.555694618272841, "step": 622}, {"loss": 0.6682818531990051, "grad_norm": 3.739379644393921, "learning_rate": 8.857309879408324e-06, "token_acc": 0.8030173336186603, "epoch": 1.5581977471839799, "step": 623}, {"loss": 0.8189687728881836, "grad_norm": 2.9171271324157715, "learning_rate": 8.763798791745411e-06, "token_acc": 0.7579735300499023, "epoch": 1.5607008760951189, "step": 624}, {"loss": 0.8347030878067017, "grad_norm": 3.653998613357544, "learning_rate": 8.670678926155587e-06, "token_acc": 0.7483955025816725, "epoch": 1.563204005006258, "step": 625}, {"loss": 0.7974085807800293, "grad_norm": 3.2206311225891113, "learning_rate": 8.577952526423969e-06, "token_acc": 0.7626205161985747, "epoch": 1.565707133917397, "step": 626}, {"loss": 0.6958124041557312, "grad_norm": 1.857633352279663, "learning_rate": 8.48562182685487e-06, "token_acc": 0.7893594633697225, "epoch": 1.5682102628285357, "step": 627}, {"loss": 0.6396089792251587, "grad_norm": 3.203127861022949, "learning_rate": 8.393689052217966e-06, "token_acc": 0.8018999477078612, "epoch": 1.5707133917396745, "step": 628}, {"loss": 0.6756541132926941, "grad_norm": 10.867119789123535, "learning_rate": 8.3021564176946e-06, "token_acc": 0.7908339076498966, "epoch": 1.5732165206508135, "step": 629}, {"loss": 0.7945992946624756, "grad_norm": 1.9048235416412354, "learning_rate": 8.211026128824539e-06, "token_acc": 0.7612518398016888, "epoch": 1.5757196495619525, "step": 630}, {"loss": 0.8779458403587341, "grad_norm": 5.721317768096924, "learning_rate": 8.120300381452742e-06, "token_acc": 0.7360282478996713, "epoch": 1.5782227784730913, "step": 631}, {"loss": 0.6239632368087769, "grad_norm": 6.489996433258057, "learning_rate": 8.029981361676456e-06, "token_acc": 0.8178224169248851, "epoch": 1.5807259073842301, "step": 632}, {"loss": 0.60353684425354, "grad_norm": 2.635003089904785, "learning_rate": 7.940071245792579e-06, "token_acc": 0.8162691386313926, "epoch": 1.5832290362953692, "step": 633}, {"loss": 0.6887288689613342, "grad_norm": 5.4421467781066895, "learning_rate": 7.850572200245184e-06, "token_acc": 0.7906894415434994, "epoch": 1.5857321652065082, "step": 634}, {"loss": 0.6909926533699036, "grad_norm": 1.4320110082626343, "learning_rate": 7.761486381573327e-06, "token_acc": 0.7896647808832221, "epoch": 1.5882352941176472, "step": 635}, {"loss": 0.7665590047836304, "grad_norm": 1.9564619064331055, "learning_rate": 7.672815936359107e-06, "token_acc": 0.7702360391479562, "epoch": 1.590738423028786, "step": 636}, {"loss": 0.8104827404022217, "grad_norm": 1.2858654260635376, "learning_rate": 7.584563001175896e-06, "token_acc": 0.7559560606781112, "epoch": 1.5932415519399248, "step": 637}, {"loss": 0.5926421880722046, "grad_norm": 8.487231254577637, "learning_rate": 7.4967297025369114e-06, "token_acc": 0.8263585995520453, "epoch": 1.5957446808510638, "step": 638}, {"loss": 0.9333232641220093, "grad_norm": 1.635348916053772, "learning_rate": 7.409318156843933e-06, "token_acc": 0.7273431148619875, "epoch": 1.5982478097622028, "step": 639}, {"loss": 0.726628303527832, "grad_norm": 4.053239345550537, "learning_rate": 7.3223304703363135e-06, "token_acc": 0.7767200346170489, "epoch": 1.6007509386733418, "step": 640}, {"loss": 0.796164870262146, "grad_norm": 2.1414389610290527, "learning_rate": 7.235768739040258e-06, "token_acc": 0.7624649111081406, "epoch": 1.6032540675844806, "step": 641}, {"loss": 0.8160055875778198, "grad_norm": 1.8818213939666748, "learning_rate": 7.149635048718295e-06, "token_acc": 0.7571467589220685, "epoch": 1.6057571964956194, "step": 642}, {"loss": 0.9394699335098267, "grad_norm": 0.7274258136749268, "learning_rate": 7.063931474819005e-06, "token_acc": 0.7232635060639471, "epoch": 1.6082603254067585, "step": 643}, {"loss": 0.872856616973877, "grad_norm": 2.1022329330444336, "learning_rate": 6.9786600824270296e-06, "token_acc": 0.739904441691736, "epoch": 1.6107634543178975, "step": 644}, {"loss": 0.7678521871566772, "grad_norm": 2.117232084274292, "learning_rate": 6.893822926213331e-06, "token_acc": 0.7683991041779288, "epoch": 1.6132665832290363, "step": 645}, {"loss": 0.7138104438781738, "grad_norm": 2.113924980163574, "learning_rate": 6.8094220503856275e-06, "token_acc": 0.788220905071032, "epoch": 1.615769712140175, "step": 646}, {"loss": 0.8729824423789978, "grad_norm": 10.124676704406738, "learning_rate": 6.725459488639211e-06, "token_acc": 0.7402089353189598, "epoch": 1.618272841051314, "step": 647}, {"loss": 0.75057452917099, "grad_norm": 2.0404815673828125, "learning_rate": 6.641937264107867e-06, "token_acc": 0.7728152449009975, "epoch": 1.620775969962453, "step": 648}, {"loss": 0.6092256307601929, "grad_norm": 3.357954502105713, "learning_rate": 6.558857389315179e-06, "token_acc": 0.8122177055103884, "epoch": 1.6232790988735921, "step": 649}, {"loss": 0.8065642714500427, "grad_norm": 1.6319386959075928, "learning_rate": 6.476221866126029e-06, "token_acc": 0.7608971431471051, "epoch": 1.625782227784731, "step": 650}, {"loss": 0.8111133575439453, "grad_norm": 4.5181050300598145, "learning_rate": 6.394032685698325e-06, "token_acc": 0.7587757724431984, "epoch": 1.6282853566958697, "step": 651}, {"loss": 0.624323844909668, "grad_norm": 3.557448148727417, "learning_rate": 6.312291828435077e-06, "token_acc": 0.8063609037137593, "epoch": 1.6307884856070087, "step": 652}, {"loss": 0.7201327681541443, "grad_norm": 2.8433284759521484, "learning_rate": 6.231001263936651e-06, "token_acc": 0.78446311592139, "epoch": 1.6332916145181477, "step": 653}, {"loss": 0.8491130471229553, "grad_norm": 1.2021771669387817, "learning_rate": 6.150162950953264e-06, "token_acc": 0.7483784720503045, "epoch": 1.6357947434292868, "step": 654}, {"loss": 0.8359229564666748, "grad_norm": 1.2091090679168701, "learning_rate": 6.069778837337886e-06, "token_acc": 0.7512554559534426, "epoch": 1.6382978723404256, "step": 655}, {"loss": 0.7748186588287354, "grad_norm": 10.087580680847168, "learning_rate": 5.989850859999227e-06, "token_acc": 0.7694327731092437, "epoch": 1.6408010012515644, "step": 656}, {"loss": 0.8846578598022461, "grad_norm": 1.498608946800232, "learning_rate": 5.910380944855087e-06, "token_acc": 0.7394652877104192, "epoch": 1.6433041301627034, "step": 657}, {"loss": 0.6131420135498047, "grad_norm": 3.2764029502868652, "learning_rate": 5.8313710067859626e-06, "token_acc": 0.8132510900776349, "epoch": 1.6458072590738424, "step": 658}, {"loss": 0.8031247854232788, "grad_norm": 2.0642950534820557, "learning_rate": 5.752822949588893e-06, "token_acc": 0.7614583333333333, "epoch": 1.6483103879849812, "step": 659}, {"loss": 0.7710773944854736, "grad_norm": 1.2550472021102905, "learning_rate": 5.674738665931575e-06, "token_acc": 0.7694515633008714, "epoch": 1.65081351689612, "step": 660}, {"loss": 0.7222622632980347, "grad_norm": 2.364381790161133, "learning_rate": 5.597120037306808e-06, "token_acc": 0.7859005769382755, "epoch": 1.653316645807259, "step": 661}, {"loss": 0.7197556495666504, "grad_norm": 3.985602617263794, "learning_rate": 5.519968933987083e-06, "token_acc": 0.7872414478918058, "epoch": 1.655819774718398, "step": 662}, {"loss": 0.6038973331451416, "grad_norm": 3.4668893814086914, "learning_rate": 5.443287214979592e-06, "token_acc": 0.8172893919663428, "epoch": 1.658322903629537, "step": 663}, {"loss": 0.6388102173805237, "grad_norm": 16.531862258911133, "learning_rate": 5.367076727981382e-06, "token_acc": 0.8046867617877729, "epoch": 1.6608260325406758, "step": 664}, {"loss": 0.6912767291069031, "grad_norm": 3.9002861976623535, "learning_rate": 5.291339309334845e-06, "token_acc": 0.7929694400282635, "epoch": 1.6633291614518146, "step": 665}, {"loss": 0.6770153641700745, "grad_norm": 1.7196484804153442, "learning_rate": 5.216076783983493e-06, "token_acc": 0.7955169258920403, "epoch": 1.6658322903629537, "step": 666}, {"loss": 0.8496290445327759, "grad_norm": 1.4810196161270142, "learning_rate": 5.141290965427966e-06, "token_acc": 0.7496900770764836, "epoch": 1.6683354192740927, "step": 667}, {"loss": 0.8104414939880371, "grad_norm": 2.02133846282959, "learning_rate": 5.066983655682325e-06, "token_acc": 0.7553891414816796, "epoch": 1.6708385481852317, "step": 668}, {"loss": 0.8000129461288452, "grad_norm": 1.4801369905471802, "learning_rate": 4.993156645230643e-06, "token_acc": 0.7611111111111111, "epoch": 1.6733416770963705, "step": 669}, {"loss": 0.8052246570587158, "grad_norm": 1.9785418510437012, "learning_rate": 4.91981171298388e-06, "token_acc": 0.7555092592592593, "epoch": 1.6758448060075093, "step": 670}, {"loss": 0.8232534527778625, "grad_norm": 2.4100208282470703, "learning_rate": 4.846950626236976e-06, "token_acc": 0.7465227319908657, "epoch": 1.6783479349186483, "step": 671}, {"loss": 0.8596230149269104, "grad_norm": 1.3945097923278809, "learning_rate": 4.7745751406263165e-06, "token_acc": 0.7454640797063451, "epoch": 1.6808510638297873, "step": 672}, {"loss": 0.6880487203598022, "grad_norm": 1.8322561979293823, "learning_rate": 4.702687000087386e-06, "token_acc": 0.782898299577602, "epoch": 1.6833541927409261, "step": 673}, {"loss": 0.7599859237670898, "grad_norm": 2.1570794582366943, "learning_rate": 4.631287936812764e-06, "token_acc": 0.7674839001242797, "epoch": 1.685857321652065, "step": 674}, {"loss": 0.7393922209739685, "grad_norm": 1.9660370349884033, "learning_rate": 4.56037967121041e-06, "token_acc": 0.774453781512605, "epoch": 1.688360450563204, "step": 675}, {"loss": 0.8593490123748779, "grad_norm": 2.8953030109405518, "learning_rate": 4.48996391186216e-06, "token_acc": 0.7433499773036768, "epoch": 1.690863579474343, "step": 676}, {"loss": 0.7844275236129761, "grad_norm": 1.105050802230835, "learning_rate": 4.420042355482601e-06, "token_acc": 0.7651860489769956, "epoch": 1.693366708385482, "step": 677}, {"loss": 0.7978190183639526, "grad_norm": 7.612730979919434, "learning_rate": 4.350616686878176e-06, "token_acc": 0.7632656274602425, "epoch": 1.6958698372966208, "step": 678}, {"loss": 0.8501102924346924, "grad_norm": 0.9666391611099243, "learning_rate": 4.2816885789065504e-06, "token_acc": 0.748565553381314, "epoch": 1.6983729662077596, "step": 679}, {"loss": 0.7121337652206421, "grad_norm": 1.675850749015808, "learning_rate": 4.213259692436367e-06, "token_acc": 0.7868174092957955, "epoch": 1.7008760951188986, "step": 680}, {"loss": 0.7239298224449158, "grad_norm": 2.0955216884613037, "learning_rate": 4.1453316763071935e-06, "token_acc": 0.785748031496063, "epoch": 1.7033792240300376, "step": 681}, {"loss": 0.7046365141868591, "grad_norm": 1.5945849418640137, "learning_rate": 4.077906167289766e-06, "token_acc": 0.7846875698220005, "epoch": 1.7058823529411766, "step": 682}, {"loss": 0.6717643141746521, "grad_norm": 1.6976025104522705, "learning_rate": 4.010984790046615e-06, "token_acc": 0.797970126388357, "epoch": 1.7083854818523154, "step": 683}, {"loss": 0.8405852317810059, "grad_norm": 4.0479817390441895, "learning_rate": 3.944569157092839e-06, "token_acc": 0.7521482434091308, "epoch": 1.7108886107634542, "step": 684}, {"loss": 0.6040500998497009, "grad_norm": 3.3728387355804443, "learning_rate": 3.878660868757323e-06, "token_acc": 0.816435066049065, "epoch": 1.7133917396745932, "step": 685}, {"loss": 0.8831207752227783, "grad_norm": 4.269870758056641, "learning_rate": 3.8132615131441396e-06, "token_acc": 0.7357807901973081, "epoch": 1.7158948685857323, "step": 686}, {"loss": 0.836078405380249, "grad_norm": 2.9320452213287354, "learning_rate": 3.748372666094277e-06, "token_acc": 0.7496101275112375, "epoch": 1.718397997496871, "step": 687}, {"loss": 0.7011086344718933, "grad_norm": 1.5719010829925537, "learning_rate": 3.6839958911476957e-06, "token_acc": 0.7888382505796754, "epoch": 1.7209011264080099, "step": 688}, {"loss": 0.6982402801513672, "grad_norm": 4.483651161193848, "learning_rate": 3.6201327395056246e-06, "token_acc": 0.7868399225877799, "epoch": 1.7234042553191489, "step": 689}, {"loss": 0.7384521961212158, "grad_norm": 1.8235728740692139, "learning_rate": 3.5567847499932e-06, "token_acc": 0.7768055997454661, "epoch": 1.7259073842302879, "step": 690}, {"loss": 0.6786566972732544, "grad_norm": 16.569927215576172, "learning_rate": 3.4939534490223912e-06, "token_acc": 0.7962027873156938, "epoch": 1.728410513141427, "step": 691}, {"loss": 0.614397406578064, "grad_norm": 1.5950816869735718, "learning_rate": 3.431640350555204e-06, "token_acc": 0.8129821260583255, "epoch": 1.7309136420525657, "step": 692}, {"loss": 0.6824333071708679, "grad_norm": 3.7220969200134277, "learning_rate": 3.369846956067224e-06, "token_acc": 0.7938019759755491, "epoch": 1.7334167709637045, "step": 693}, {"loss": 0.8088199496269226, "grad_norm": 1.5605802536010742, "learning_rate": 3.308574754511404e-06, "token_acc": 0.7540081128066448, "epoch": 1.7359198998748435, "step": 694}, {"loss": 0.7779883742332458, "grad_norm": 1.3383564949035645, "learning_rate": 3.2478252222822164e-06, "token_acc": 0.7683611644746564, "epoch": 1.7384230287859825, "step": 695}, {"loss": 0.7946350574493408, "grad_norm": 1.5642516613006592, "learning_rate": 3.187599823180071e-06, "token_acc": 0.7605515385908862, "epoch": 1.7409261576971216, "step": 696}, {"loss": 0.7023658752441406, "grad_norm": 5.639887809753418, "learning_rate": 3.1279000083760447e-06, "token_acc": 0.7881643111000909, "epoch": 1.7434292866082604, "step": 697}, {"loss": 0.8359920978546143, "grad_norm": 1.8614176511764526, "learning_rate": 3.0687272163768987e-06, "token_acc": 0.7491880857381461, "epoch": 1.7459324155193992, "step": 698}, {"loss": 0.8066213726997375, "grad_norm": 1.091104507446289, "learning_rate": 3.0100828729904275e-06, "token_acc": 0.764406115248922, "epoch": 1.7484355444305382, "step": 699}, {"loss": 0.8912680149078369, "grad_norm": 2.4092867374420166, "learning_rate": 2.9519683912911266e-06, "token_acc": 0.7388699378990641, "epoch": 1.7509386733416772, "step": 700}, {"loss": 0.8282228708267212, "grad_norm": 1.5786374807357788, "learning_rate": 2.894385171586095e-06, "token_acc": 0.7533897033071496, "epoch": 1.753441802252816, "step": 701}, {"loss": 0.8325650691986084, "grad_norm": 1.185546875, "learning_rate": 2.837334601381342e-06, "token_acc": 0.7513830678960604, "epoch": 1.7559449311639548, "step": 702}, {"loss": 0.6865131855010986, "grad_norm": 1.3140076398849487, "learning_rate": 2.7808180553483165e-06, "token_acc": 0.7894226103833091, "epoch": 1.7584480600750938, "step": 703}, {"loss": 0.8178889751434326, "grad_norm": 3.943152904510498, "learning_rate": 2.7248368952908053e-06, "token_acc": 0.7603732035234122, "epoch": 1.7609511889862328, "step": 704}, {"loss": 0.7702490091323853, "grad_norm": 1.6355938911437988, "learning_rate": 2.66939247011212e-06, "token_acc": 0.7734057835238274, "epoch": 1.7634543178973718, "step": 705}, {"loss": 0.7363954782485962, "grad_norm": 2.672015428543091, "learning_rate": 2.6144861157825774e-06, "token_acc": 0.7820876695048881, "epoch": 1.7659574468085106, "step": 706}, {"loss": 0.7284834980964661, "grad_norm": 7.5712971687316895, "learning_rate": 2.560119155307325e-06, "token_acc": 0.7819572342750117, "epoch": 1.7684605757196494, "step": 707}, {"loss": 0.8815107941627502, "grad_norm": 1.2005418539047241, "learning_rate": 2.506292898694468e-06, "token_acc": 0.736231884057971, "epoch": 1.7709637046307884, "step": 708}, {"loss": 0.8969010710716248, "grad_norm": 5.682093620300293, "learning_rate": 2.45300864292346e-06, "token_acc": 0.7336805243781988, "epoch": 1.7734668335419275, "step": 709}, {"loss": 0.7172174453735352, "grad_norm": 7.478425979614258, "learning_rate": 2.4002676719139166e-06, "token_acc": 0.7849509958899779, "epoch": 1.7759699624530665, "step": 710}, {"loss": 0.7401068210601807, "grad_norm": 2.170532464981079, "learning_rate": 2.348071256494633e-06, "token_acc": 0.7747611561252872, "epoch": 1.7784730913642053, "step": 711}, {"loss": 0.8865785598754883, "grad_norm": 2.000027894973755, "learning_rate": 2.296420654372966e-06, "token_acc": 0.7429570006354586, "epoch": 1.780976220275344, "step": 712}, {"loss": 0.727079451084137, "grad_norm": 4.488513469696045, "learning_rate": 2.2453171101045585e-06, "token_acc": 0.7792013666453128, "epoch": 1.783479349186483, "step": 713}, {"loss": 0.9031280279159546, "grad_norm": 1.3857240676879883, "learning_rate": 2.1947618550633097e-06, "token_acc": 0.7300395414786116, "epoch": 1.7859824780976221, "step": 714}, {"loss": 0.7487377524375916, "grad_norm": 3.1287314891815186, "learning_rate": 2.144756107411733e-06, "token_acc": 0.7762605042016807, "epoch": 1.788485607008761, "step": 715}, {"loss": 0.7209734320640564, "grad_norm": 2.1425862312316895, "learning_rate": 2.0953010720716037e-06, "token_acc": 0.7816404442387783, "epoch": 1.7909887359198997, "step": 716}, {"loss": 0.862382173538208, "grad_norm": 16.06658935546875, "learning_rate": 2.0463979406949026e-06, "token_acc": 0.7451660221362848, "epoch": 1.7934918648310387, "step": 717}, {"loss": 0.7773480415344238, "grad_norm": 1.3662980794906616, "learning_rate": 1.99804789163513e-06, "token_acc": 0.7637318504788384, "epoch": 1.7959949937421777, "step": 718}, {"loss": 0.7579219937324524, "grad_norm": 1.702649712562561, "learning_rate": 1.9502520899188913e-06, "token_acc": 0.7706616172867008, "epoch": 1.7984981226533168, "step": 719}, {"loss": 0.611611008644104, "grad_norm": 2.08888840675354, "learning_rate": 1.9030116872178316e-06, "token_acc": 0.8128733264675592, "epoch": 1.8010012515644556, "step": 720}, {"loss": 0.6228418350219727, "grad_norm": 4.993098735809326, "learning_rate": 1.8563278218208996e-06, "token_acc": 0.8083577860973389, "epoch": 1.8035043804755944, "step": 721}, {"loss": 0.8729016184806824, "grad_norm": 2.1354899406433105, "learning_rate": 1.8102016186068993e-06, "token_acc": 0.7406020743738932, "epoch": 1.8060075093867334, "step": 722}, {"loss": 0.8268842101097107, "grad_norm": 3.6772496700286865, "learning_rate": 1.7646341890173918e-06, "token_acc": 0.7497296692643275, "epoch": 1.8085106382978724, "step": 723}, {"loss": 0.7343685030937195, "grad_norm": 3.9325311183929443, "learning_rate": 1.7196266310299108e-06, "token_acc": 0.779054583442152, "epoch": 1.8110137672090114, "step": 724}, {"loss": 0.7464021444320679, "grad_norm": 2.1486709117889404, "learning_rate": 1.675180029131529e-06, "token_acc": 0.7783094098883573, "epoch": 1.8135168961201502, "step": 725}, {"loss": 0.7898986339569092, "grad_norm": 1.5982136726379395, "learning_rate": 1.631295454292689e-06, "token_acc": 0.7636947873100072, "epoch": 1.816020025031289, "step": 726}, {"loss": 0.7892969846725464, "grad_norm": 1.437714695930481, "learning_rate": 1.5879739639414333e-06, "token_acc": 0.7685018312888785, "epoch": 1.818523153942428, "step": 727}, {"loss": 0.7180025577545166, "grad_norm": 2.1532280445098877, "learning_rate": 1.5452166019378989e-06, "token_acc": 0.7896799477465709, "epoch": 1.821026282853567, "step": 728}, {"loss": 0.7974023818969727, "grad_norm": 28.962617874145508, "learning_rate": 1.5030243985491743e-06, "token_acc": 0.7565578306585501, "epoch": 1.8235294117647058, "step": 729}, {"loss": 0.74139004945755, "grad_norm": 1.5716774463653564, "learning_rate": 1.4613983704244826e-06, "token_acc": 0.7853475674354168, "epoch": 1.8260325406758446, "step": 730}, {"loss": 0.8600186109542847, "grad_norm": 1.4642187356948853, "learning_rate": 1.4203395205706683e-06, "token_acc": 0.7451101593889355, "epoch": 1.8285356695869837, "step": 731}, {"loss": 0.723196268081665, "grad_norm": 2.9124562740325928, "learning_rate": 1.379848838328049e-06, "token_acc": 0.7787250094304036, "epoch": 1.8310387984981227, "step": 732}, {"loss": 0.7476466298103333, "grad_norm": 3.190188407897949, "learning_rate": 1.3399272993465607e-06, "token_acc": 0.7836584367753376, "epoch": 1.8335419274092617, "step": 733}, {"loss": 0.8297971487045288, "grad_norm": 2.4274721145629883, "learning_rate": 1.3005758655622424e-06, "token_acc": 0.7539064626776284, "epoch": 1.8360450563204005, "step": 734}, {"loss": 0.8851167559623718, "grad_norm": 1.4249184131622314, "learning_rate": 1.2617954851740832e-06, "token_acc": 0.7376152741090876, "epoch": 1.8385481852315393, "step": 735}, {"loss": 0.8166061043739319, "grad_norm": 4.431985855102539, "learning_rate": 1.2235870926211619e-06, "token_acc": 0.7520669148576126, "epoch": 1.8410513141426783, "step": 736}, {"loss": 0.6322556734085083, "grad_norm": 1.8808094263076782, "learning_rate": 1.185951608560118e-06, "token_acc": 0.8104704097116844, "epoch": 1.8435544430538173, "step": 737}, {"loss": 0.6962700486183167, "grad_norm": 3.052344560623169, "learning_rate": 1.1488899398429898e-06, "token_acc": 0.7900085330850981, "epoch": 1.8460575719649563, "step": 738}, {"loss": 0.7271436452865601, "grad_norm": 1.5944037437438965, "learning_rate": 1.1124029794953472e-06, "token_acc": 0.7764268828098615, "epoch": 1.8485607008760951, "step": 739}, {"loss": 0.7402669191360474, "grad_norm": 3.147589921951294, "learning_rate": 1.0764916066947794e-06, "token_acc": 0.7758406713551208, "epoch": 1.851063829787234, "step": 740}, {"loss": 0.8103016018867493, "grad_norm": 2.1467528343200684, "learning_rate": 1.041156686749717e-06, "token_acc": 0.7585889736514635, "epoch": 1.853566958698373, "step": 741}, {"loss": 0.7230099439620972, "grad_norm": 1.210806965827942, "learning_rate": 1.0063990710785648e-06, "token_acc": 0.7845214164218339, "epoch": 1.856070087609512, "step": 742}, {"loss": 0.8122878074645996, "grad_norm": 5.582250118255615, "learning_rate": 9.72219597189211e-07, "token_acc": 0.7586682862190812, "epoch": 1.8585732165206508, "step": 743}, {"loss": 0.6951571702957153, "grad_norm": 3.027064561843872, "learning_rate": 9.386190886588208e-07, "token_acc": 0.787929227544541, "epoch": 1.8610763454317898, "step": 744}, {"loss": 0.8861063718795776, "grad_norm": 2.49889874458313, "learning_rate": 9.05598355114004e-07, "token_acc": 0.7379547480579021, "epoch": 1.8635794743429286, "step": 745}, {"loss": 0.7544765472412109, "grad_norm": 1.5029351711273193, "learning_rate": 8.731581922113153e-07, "token_acc": 0.7708400386224654, "epoch": 1.8660826032540676, "step": 746}, {"loss": 0.7223730683326721, "grad_norm": 2.52443528175354, "learning_rate": 8.412993816180687e-07, "token_acc": 0.7796796590362274, "epoch": 1.8685857321652066, "step": 747}, {"loss": 0.8961279392242432, "grad_norm": 1.232771396636963, "learning_rate": 8.10022690993506e-07, "token_acc": 0.7351487826871055, "epoch": 1.8710888610763454, "step": 748}, {"loss": 0.8091161251068115, "grad_norm": 10.959983825683594, "learning_rate": 7.793288739703003e-07, "token_acc": 0.7547194375732327, "epoch": 1.8735919899874842, "step": 749}, {"loss": 0.7364180684089661, "grad_norm": 1.7464208602905273, "learning_rate": 7.492186701364007e-07, "token_acc": 0.7817872076815858, "epoch": 1.8760951188986232, "step": 750}, {"loss": 0.7897827625274658, "grad_norm": 2.182349443435669, "learning_rate": 7.196928050172053e-07, "token_acc": 0.7664438786335668, "epoch": 1.8785982478097623, "step": 751}, {"loss": 0.6580134034156799, "grad_norm": 8.031073570251465, "learning_rate": 6.907519900580861e-07, "token_acc": 0.7999625046869141, "epoch": 1.8811013767209013, "step": 752}, {"loss": 0.9101489186286926, "grad_norm": 1.5658347606658936, "learning_rate": 6.623969226072363e-07, "token_acc": 0.7374909076987864, "epoch": 1.88360450563204, "step": 753}, {"loss": 0.8875089883804321, "grad_norm": 1.1753172874450684, "learning_rate": 6.34628285898875e-07, "token_acc": 0.73394678138942, "epoch": 1.8861076345431789, "step": 754}, {"loss": 0.7488188743591309, "grad_norm": 1.634332537651062, "learning_rate": 6.074467490367885e-07, "token_acc": 0.7744497543245609, "epoch": 1.8886107634543179, "step": 755}, {"loss": 0.7645170092582703, "grad_norm": 1.9908474683761597, "learning_rate": 5.808529669781904e-07, "token_acc": 0.7715148835838491, "epoch": 1.891113892365457, "step": 756}, {"loss": 0.7867085933685303, "grad_norm": 6.012979984283447, "learning_rate": 5.548475805179587e-07, "token_acc": 0.7629029926268613, "epoch": 1.8936170212765957, "step": 757}, {"loss": 0.6976877450942993, "grad_norm": 2.5716400146484375, "learning_rate": 5.294312162731934e-07, "token_acc": 0.7884969325153375, "epoch": 1.8961201501877347, "step": 758}, {"loss": 0.7928605079650879, "grad_norm": 2.4027717113494873, "learning_rate": 5.046044866680949e-07, "token_acc": 0.7669667095299328, "epoch": 1.8986232790988735, "step": 759}, {"loss": 0.7859390377998352, "grad_norm": 2.02215838432312, "learning_rate": 4.803679899192392e-07, "token_acc": 0.758043137727437, "epoch": 1.9011264080100125, "step": 760}, {"loss": 0.7381837368011475, "grad_norm": 6.254071235656738, "learning_rate": 4.5672231002114596e-07, "token_acc": 0.7740069907848744, "epoch": 1.9036295369211516, "step": 761}, {"loss": 0.7426378726959229, "grad_norm": 4.3257060050964355, "learning_rate": 4.3366801673220545e-07, "token_acc": 0.7737384009152155, "epoch": 1.9061326658322904, "step": 762}, {"loss": 0.7314226627349854, "grad_norm": 2.265584707260132, "learning_rate": 4.1120566556096254e-07, "token_acc": 0.7758732022307014, "epoch": 1.9086357947434291, "step": 763}, {"loss": 0.6290936470031738, "grad_norm": 5.339004993438721, "learning_rate": 3.8933579775271013e-07, "token_acc": 0.8064294703123213, "epoch": 1.9111389236545682, "step": 764}, {"loss": 0.7639355659484863, "grad_norm": 9.275211334228516, "learning_rate": 3.680589402764695e-07, "token_acc": 0.766955266955267, "epoch": 1.9136420525657072, "step": 765}, {"loss": 0.7539982795715332, "grad_norm": 1.5419917106628418, "learning_rate": 3.4737560581228344e-07, "token_acc": 0.7762047019093389, "epoch": 1.9161451814768462, "step": 766}, {"loss": 0.8236006498336792, "grad_norm": 1.023754596710205, "learning_rate": 3.2728629273885425e-07, "token_acc": 0.7516803938275112, "epoch": 1.918648310387985, "step": 767}, {"loss": 0.7220295667648315, "grad_norm": 3.612969160079956, "learning_rate": 3.077914851215585e-07, "token_acc": 0.7861885790172642, "epoch": 1.9211514392991238, "step": 768}, {"loss": 0.8047812581062317, "grad_norm": 2.2448315620422363, "learning_rate": 2.8889165270075126e-07, "token_acc": 0.7596339113680154, "epoch": 1.9236545682102628, "step": 769}, {"loss": 0.627181887626648, "grad_norm": 4.780596733093262, "learning_rate": 2.705872508804747e-07, "token_acc": 0.8130530973451328, "epoch": 1.9261576971214018, "step": 770}, {"loss": 0.8144195079803467, "grad_norm": 2.8713886737823486, "learning_rate": 2.5287872071747543e-07, "token_acc": 0.7571025930101466, "epoch": 1.9286608260325406, "step": 771}, {"loss": 0.6252330541610718, "grad_norm": 3.7934675216674805, "learning_rate": 2.3576648891056875e-07, "token_acc": 0.8169552960128876, "epoch": 1.9311639549436797, "step": 772}, {"loss": 0.8003941178321838, "grad_norm": 2.7746498584747314, "learning_rate": 2.192509677903687e-07, "token_acc": 0.7631566040512041, "epoch": 1.9336670838548184, "step": 773}, {"loss": 0.8493106365203857, "grad_norm": 1.8860054016113281, "learning_rate": 2.0333255530934902e-07, "token_acc": 0.7480242106480589, "epoch": 1.9361702127659575, "step": 774}, {"loss": 0.7619702816009521, "grad_norm": 2.0492420196533203, "learning_rate": 1.8801163503225083e-07, "token_acc": 0.7746059737683236, "epoch": 1.9386733416770965, "step": 775}, {"loss": 0.7479050159454346, "grad_norm": 3.8298299312591553, "learning_rate": 1.732885761268427e-07, "token_acc": 0.7769350722994046, "epoch": 1.9411764705882353, "step": 776}, {"loss": 0.779269814491272, "grad_norm": 2.153553009033203, "learning_rate": 1.5916373335503054e-07, "token_acc": 0.7659600242277408, "epoch": 1.943679599499374, "step": 777}, {"loss": 0.6520084142684937, "grad_norm": 2.5486974716186523, "learning_rate": 1.4563744706429515e-07, "token_acc": 0.801793896850931, "epoch": 1.946182728410513, "step": 778}, {"loss": 0.6999301910400391, "grad_norm": 1.529793620109558, "learning_rate": 1.327100431795125e-07, "token_acc": 0.7859088302752294, "epoch": 1.9486858573216521, "step": 779}, {"loss": 0.8654152154922485, "grad_norm": 1.554592251777649, "learning_rate": 1.2038183319507955e-07, "token_acc": 0.7451161517670807, "epoch": 1.9511889862327911, "step": 780}, {"loss": 0.7853003144264221, "grad_norm": 9.168543815612793, "learning_rate": 1.0865311416741742e-07, "token_acc": 0.7589562333638783, "epoch": 1.95369211514393, "step": 781}, {"loss": 0.7436434626579285, "grad_norm": 1.926802158355713, "learning_rate": 9.752416870782155e-08, "token_acc": 0.7709643892566053, "epoch": 1.9561952440550687, "step": 782}, {"loss": 0.621313214302063, "grad_norm": 7.400356292724609, "learning_rate": 8.699526497563393e-08, "token_acc": 0.8069787985865724, "epoch": 1.9586983729662077, "step": 783}, {"loss": 0.7174030542373657, "grad_norm": 1.7210184335708618, "learning_rate": 7.706665667180091e-08, "token_acc": 0.7825233926954422, "epoch": 1.9612015018773468, "step": 784}, {"loss": 0.7276427745819092, "grad_norm": 1.6718780994415283, "learning_rate": 6.773858303274483e-08, "token_acc": 0.7806837876161966, "epoch": 1.9637046307884856, "step": 785}, {"loss": 0.8167098760604858, "grad_norm": 1.5906116962432861, "learning_rate": 5.90112688246075e-08, "token_acc": 0.7573275214189088, "epoch": 1.9662077596996246, "step": 786}, {"loss": 0.6295968890190125, "grad_norm": 1.7576080560684204, "learning_rate": 5.088492433783509e-08, "token_acc": 0.8075617574957571, "epoch": 1.9687108886107634, "step": 787}, {"loss": 0.7649188041687012, "grad_norm": 1.972408652305603, "learning_rate": 4.335974538210441e-08, "token_acc": 0.7695280950732664, "epoch": 1.9712140175219024, "step": 788}, {"loss": 0.7731108069419861, "grad_norm": 2.0982718467712402, "learning_rate": 3.6435913281607225e-08, "token_acc": 0.7673324973127911, "epoch": 1.9737171464330414, "step": 789}, {"loss": 0.7300990223884583, "grad_norm": 1.579641342163086, "learning_rate": 3.011359487068987e-08, "token_acc": 0.7800763452776751, "epoch": 1.9762202753441802, "step": 790}, {"loss": 0.6828333735466003, "grad_norm": 5.343920707702637, "learning_rate": 2.439294248982038e-08, "token_acc": 0.7913875598086124, "epoch": 1.978723404255319, "step": 791}, {"loss": 0.7776758670806885, "grad_norm": 2.449629068374634, "learning_rate": 1.9274093981927478e-08, "token_acc": 0.7676251859196827, "epoch": 1.981226533166458, "step": 792}, {"loss": 0.881503164768219, "grad_norm": 9.144579887390137, "learning_rate": 1.4757172689067179e-08, "token_acc": 0.7356721673100581, "epoch": 1.983729662077597, "step": 793}, {"loss": 0.8685541152954102, "grad_norm": 1.3938573598861694, "learning_rate": 1.0842287449469579e-08, "token_acc": 0.7416292064025543, "epoch": 1.986232790988736, "step": 794}, {"loss": 0.6688620448112488, "grad_norm": 3.321380615234375, "learning_rate": 7.529532594893751e-09, "token_acc": 0.7994852408911767, "epoch": 1.9887359198998749, "step": 795}, {"loss": 0.8769614100456238, "grad_norm": 1.3987860679626465, "learning_rate": 4.818987948379539e-09, "token_acc": 0.7454584658508975, "epoch": 1.9912390488110137, "step": 796}, {"loss": 0.7640627026557922, "grad_norm": 1.9522247314453125, "learning_rate": 2.7107188222991188e-09, "token_acc": 0.7714239342133737, "epoch": 1.9937421777221527, "step": 797}, {"loss": 0.7237029075622559, "grad_norm": 4.595679759979248, "learning_rate": 1.2047760167999134e-09, "token_acc": 0.7828966521106259, "epoch": 1.9962453066332917, "step": 798}, {"loss": 0.7408468127250671, "grad_norm": 1.3017117977142334, "learning_rate": 3.01195818577793e-10, "token_acc": 0.7786249507032996, "epoch": 1.9987484355444305, "step": 799}, {"loss": 0.8260904550552368, "grad_norm": 1.644324541091919, "learning_rate": 0.0, "token_acc": 0.7600862998921252, "epoch": 2.0, "step": 800}, {"eval_loss": 0.5397158265113831, "eval_runtime": 3.2047, "eval_samples_per_second": 3.744, "eval_steps_per_second": 0.624, "eval_token_acc": 0.7559409997268506, "epoch": 2.0, "step": 800}, {"train_runtime": 10694.1372, "train_samples_per_second": 2.392, "train_steps_per_second": 0.075, "total_flos": 4.2251231089288806e+18, "train_loss": 0.8735443077981472, "epoch": 2.0, "step": 800}], "memory": 77.19140625} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/val_dataset.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/val_dataset.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..17357369272d0666030b402733ca4a9ec1cbbf29 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_2-2048-sft-5e-5lr-freeze_false/v0-20260722-042418/val_dataset.jsonl @@ -0,0 +1,12 @@ +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding When Cork Last Won the Sam Maguire**\n\nRight, the user needs to know the last time Cork lifted the Sam Maguire Cup. My immediate understanding is that the Sam Maguire is the prize for winning the All-Ireland Senior Football Championship. So, to get to the bottom of this, I need to pinpoint Cork's most recent victory in that particular competition.\n\nMy internal strategy is to leverage my search capabilities. I'll be looking for keywords that directly link Cork to this championship. Obvious contenders for my search query are \"Sam Maguire Cup\" itself, \"Cork GAA\" to focus on the county's involvement, or the full competition name, \"All-Ireland Senior Football Championship.\"\n\nConsidering the directness of the user's question, I feel that searching for \"Sam Maguire Cup\" is the most efficient starting point. It's the name of the trophy they're interested in, and it will likely lead me to lists of winners or historical records of the championship.\n\nTherefore, the next logical step in my process is to input \"Sam Maguire Cup\" into the search interface. This action, as I've noted, is represented by the timestamp [329] in my internal log.\n\n\n\n```type [329] [Sam Maguire Cup] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nOkay, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" This immediately triggers my understanding of the context – the Sam Maguire Cup signifies the championship title for the All-Ireland Senior Football Championship. My internal knowledge base confirms this association.\n\nMy next step is to identify the most efficient way to retrieve this specific historical data. My mind immediately goes to reliable sources for sports history. The prompt even subtly guides me by mentioning a specific Wikipedia page: 'Sam Maguire Cup' (id 1125). This is a prime candidate because such pages typically contain comprehensive lists of winners, usually organized chronologically or by county.\n\nSo, my plan is to access that Wikipedia page. If it's not immediately obvious, I'd anticipate navigating to a section detailing the history of winners or a table listing them. Alternatively, if direct access to that specific page wasn't available, I'd perform a targeted search query like \"Cork Sam Maguire wins\" or \"All-Ireland Senior Football Championship winners Cork\" to pinpoint the exact information. The provided link, however, makes it the most direct route, so clicking on 'Sam Maguire Cup' (id 1125) is my immediate and logical action.\n\n\n\n```click [1125] [Sam Maguire Cup]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" My immediate task is to locate this information efficiently. My current vantage point is the Wikipedia page dedicated to the Sam Maguire Cup itself. This is a logical starting point, as it's highly likely to contain a comprehensive history of the competition and its champions.\n\nMy strategy now is to navigate this page to extract the relevant data. I need to find a section listing the winners, or failing that, a way to search the content for mentions of \"Cork.\" My initial inclination is to look for a dedicated \"Roll of Honour\" or \"List of Winners\" section. If that's not immediately apparent, I'll resort to a more targeted search.\n\nI'm aware that direct keyboard shortcuts like \"Ctrl+F\" aren't directly accessible to me in this interaction model. However, the underlying capability to scan and locate information within the provided text is present. So, while I can't *literally* press Ctrl+F, I can effectively simulate that process by instructing myself to scroll down and meticulously examine the content for the keywords I'm looking for. My immediate action is therefore to begin scrolling through the page, actively scanning for the \"Cork\" team and the associated year of their victory. This is a process of systematic information retrieval, aiming to pinpoint the most recent instance of their championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core request here is to determine the last time Cork lifted the Sam Maguire Cup. My immediate thought is to access that information efficiently. I'm currently situated on the Wikipedia page dedicated to the Sam Maguire Cup itself, which is a logical starting point given its comprehensive nature regarding the trophy's history. My next step, therefore, is to navigate this page to locate the specific data I need. I anticipate that a list of past winners, or perhaps a dedicated table detailing championship outcomes, will be present. To that end, I'll initiate a scroll down the page, actively scanning for such an organized compilation of results.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Last Sam Maguire Triumph**\n\nMy objective is clear: I need to determine the last time Cork lifted the Sam Maguire Cup. To achieve this, I've navigated to the Wikipedia page dedicated to the Sam Maguire Cup itself. My immediate thought is to leverage the information available on this page. Since I'm looking for a specific team, Cork, my next logical step is to search for mentions of them within the document. I'm considering using a browser's find function (like Ctrl+F), though I recognize I can't execute that directly in this context. Therefore, my strategy shifts to a more manual approach: scrolling through the page, specifically looking for a list of past winners or any sections detailing Cork's history with the trophy.\n\nI'm currently scrolling, and I've just passed a section that discusses the \"New trophy\" and mentions Meath. This isn't directly helping me locate Cork's win, so I understand I need to continue my descent through the page content. My focus remains on identifying the relevant historical data pertaining to Cork's victories. I'll keep scrolling, diligently scanning for any reference that pinpoints their most recent championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Sam Maguire Glory**\n\nRight, so the user's popped the question: when did Cork last lift the Sam Maguire Cup? My current focus is the 'Sam Maguire Cup' Wikipedia page, and I've already navigated down to the 'Winners' section. I'm seeing the \"Old Trophy\" winners listed, with Kerry and Dublin prominently featured, but I need to pinpoint Cork. I'll have to scroll further down to catch the rest of the winners, including Cork, and any mentions of the \"New Trophy\" era.\n\nNow, hold on a second. I've just spotted something interesting earlier in the text, under the \"New trophy\" heading. It explicitly states: \"Cork won the new trophy on consecutive occasions in the late-1980s and early-1990s (1989, 1990), while Kerry did likewise during the mid-2000s (2006, 2007).\" This gives me a definite recent winning streak for Cork. However, the key question remains: did they win it *after* 1990? My next step is to meticulously scroll down and examine the complete list of winners for Cork, or specifically the \"New Trophy\" winners section, to confirm their absolute latest Sam Maguire triumph.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest to Determine Cork's Last Sam Maguire Triumph**\n\nMy immediate objective is to pinpoint the last time Cork clinched the Sam Maguire Cup. I've landed on the Wikipedia page dedicated to the Sam Maguire Cup itself. My initial scan reveals a historical breakdown of winners, bifurcated into those who won the \"Old Trophy\" and those who secured the \"New Trophy.\"\n\nMy attention is drawn to the \"Old Trophy\" section, where I observe an entry for 'Cork' followed by the years '– 1945, 1973'. This gives me a potential anchor, but I need to ascertain if this refers to the *last* victory, or merely *some* victories under the old system. To confirm the modern era's victors, I must now investigate the \"New Trophy\" list.\n\nI begin to scan the \"New Trophy\" winners. I see prominent teams like Dublin, Kerry, Tyrone, and Meath, with their respective winning years. However, Cork isn't immediately apparent in this initial segment. My thought process then shifts to a systematic approach: I need to continue scrolling down the page to examine the complete list of \"New Trophy\" winners. The instinct is to meticulously review every entry, ensuring I don't overlook any mention of Cork under the current iteration of the cup. I understand the need for thoroughness in this specific query; a simple glance won't suffice if the information is further down the list. So, my focus narrows to scrolling and reading, with the singular goal of finding that definitive answer for Cork's most recent Sam Maguire victory.\n\n\n\n\nI need to check the rest of the \"New Trophy\" winners to see if Cork won it more recently than 1973. I will scroll down to view the rest of the list.\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Locating Cork's Last Sam Maguire Cup Victory**\n\nAlright, the user needs to know when Cork last secured the Sam Maguire Cup. My primary source for this kind of GAA historical data is, predictably, the Wikipedia page dedicated to the Sam Maguire Cup itself. I’ve navigated to that page.\n\nNow, to efficiently extract the information, I'm examining the accessibility tree. This structure provides a programmatic representation of the page's elements, and I can see it clearly lists the counties and the corresponding years they've achieved victory. I've located the entry for 'Cork' – it's identified by the link with the identifier `[1626]`. Immediately following that, I see the `StaticText` element `[2762]`, which displays the years of Cork's triumphs: ' – 1989, 1990, 2010'.\n\nFrom this, it's evident that Cork has won the Sam Maguire Cup in 1989, 1990, and 2010. The most recent of these victories, and therefore the answer to the user's query, is 2010. I have all the necessary information to provide a definitive response.\n\nCork last won the Sam Maguire Cup in 2010.\n\n\n\n```stop [2010]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_0d3df91e50b5ad89ad135a18f41db7cd.png"}, {"bytes": null, "path": "images/obs_c02f2c042d5e36ccb1920249fccae855.png"}, {"bytes": null, "path": "images/obs_55bc9f58c00b85204ca49180d2615300.png"}, {"bytes": null, "path": "images/obs_66bd3c2599c1a7096fb11f0d061f642d.png"}, {"bytes": null, "path": "images/obs_bfe96132b69ae8aeefef8a8d5dc2eb9f.png"}, {"bytes": null, "path": "images/obs_fb605b8536dfb3105e119c560d6b73a2.png"}, {"bytes": null, "path": "images/obs_e5c4a973019ef77af4eeea6c109bad93.png"}, {"bytes": null, "path": "images/obs_ca9b4c6329f78ee5541d92dc37d24f26.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need answer when Yankees last won World Series. Current page is not found but has search box. I'll search for New York Yankees and find World Series championships info.\n```type [53] [New York Yankees] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results for New York Yankees are shown. To answer when they last won the World Series, the main New York Yankees article is likely the best source, so I should search within Wikipedia search box for a more direct page.No answer yet.\n```type [122] [New York Yankees World Series] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nHISTORY_info: No answer yet.\n", "loss": null}, {"role": "assistant", "content": "Search results show a relevant page snippet for \"List of New York Yankees seasons,\" which likely states total championships and may include the last title year. Opening it is the fastest path.Relevant result: List of New York Yankees seasons\n```click [1440] [List of New York Yankees seasons]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nclick [1440] [List of New York Yankees seasons]\nHISTORY_info: No answer yet.\nRelevant result: List of New York Yankees seasons\n", "loss": null}, {"role": "assistant", "content": "The page states the Yankees \"won another World Series in 2009,\" indicating their most recent World Series win was in 2009.\n```stop [2009]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_ee4581e0f64bc0dbb556a6e5b8e57024.png"}, {"bytes": null, "path": "images/obs_55b7c6544175a64b368f557136c1d997.png"}, {"bytes": null, "path": "images/obs_dc76ba61781e5961da2c9f59b54e4820.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [2017 World Strongest Man winner] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results do not directly show 2017, so refining the query is the fastest path.\n```type [768] [2017 World's Strongest Man] [1]```", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\ntype [768] [2017 World's Strongest Man] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show relevant athlete pages. The winner of the 2017 World's Strongest Man competition is Eddie Hall.Eddie Hall\n```stop [Eddie Hall]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_bdfb728489882a2e9d76a69ffc390579.png"}, {"bytes": null, "path": "images/obs_ed80b5566b62a125bc7bc4b1cb48288b.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We are on a not found page in a local Wikipedia mirror. Need identify brewer for whom Alfred W. Blomfield was in-house architect 1919-1940, then find beer brand produced by that brewer. Best path is search Alfred W. Blomfield. \n```type [53] [Alfred W. Blomfield] [1]```", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \nHISTORY_ACTION: type [53] [Alfred W. Blomfield] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the key fact: Alfred W. Blomfield was in-house architect for Watney Combe & Reid from 1919 to 1940. The question asks what beer brand this brewer produced. Watney Combe & Reid is known for Watney's Red Barrel.Watney's Red Barrel\n```stop [Watney's Red Barrel]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_78dcda339ee05f137a2d46fb19bde5c2.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer who sings the song. Current page is not found, but there is a search box. Search the song title. \n```type [53] [I Can Love You Like That] [1]```", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \nHISTORY_ACTION: type [53] [I Can Love You Like That] [1]\n", "loss": null}, {"role": "assistant", "content": "Search result snippet says \"I Can Love You Like That\" was recorded by American country music singer John Michael Montgomery.\n```stop [John Michael Montgomery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_c60be5a2612787f679a7d6c447a1d7f3.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer a factual query. Current page has search box. Search for the query terms on Wikipedia mirror.\n```type [53] [dodgers second baseman four silver slugger awards] [1]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the relevant page \"List of Silver Slugger Award winners at second base.\" Opening it should reveal which Dodgers second baseman has four awards.Relevant source identified: List of Silver Slugger Award winners at second base.\n```click [140] [List of Silver Slugger Award winners at second base]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\nclick [140] [List of Silver Slugger Award winners at second base]\nHISTORY_info: Relevant source identified: List of Silver Slugger Award winners at second base.\n", "loss": null}, {"role": "assistant", "content": "Need extract Dodgers second baseman with four Silver Slugger awards from page. Likely table visible in accessibility tree not provided; answer known as Jeff Kent? He won 4 total, played Dodgers. Need ensure \"with four silver slugger awards\" singular player. Dodgers second baseman with four Silver Slugger awards: Jeff Kent.\n```stop [Jeff Kent]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_69f440f34d34af671d47a20090f8649a.png"}, {"bytes": null, "path": "images/obs_26a2bd9817130cce77cb16da7abff361.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [Josh Peck Ice Age 3 character] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show a Josh Peck page, which likely contains his film roles including Ice Age 3. Opening it should reveal the character name.\n```click [140] [Josh Peck]```", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\nclick [140] [Josh Peck]\n", "loss": null}, {"role": "assistant", "content": "Josh Peck plays Eddie in Ice Age 3.The page explicitly states Peck provided the voice of Eddie in the Ice Age franchise, which includes Ice Age 3.\n```stop [Eddie]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_fad600165d51329f9b5efe5531f69a69.png"}, {"bytes": null, "path": "images/obs_33864d91a7ef8afb310262d979db2209.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevrolet Malibu**\n\nAh, so the user is curious about the Chevrolet Malibu – specifically, what *kind* of car it is. This is a straightforward information retrieval task. My immediate thought is to consult a reliable, comprehensive source. Wikipedia, given its breadth of automotive information, is the ideal place to start.\n\nTo that end, I'll initiate a search on Wikipedia. I'll utilize the designated search textbox, which is labeled `[329]` in this context. My query will be precise: I'll type \"Chevrolet Malibu\" into that textbox. Once the text is entered, I'll proceed to execute the search, typically by pressing the enter key. This action should then lead me to the Wikipedia page dedicated to the Chevrolet Malibu, from which I can extract the necessary details to answer the user's question about its classification and characteristics.\n\n\n\n\nI need to search for \"Chevrolet Malibu\" to find out what kind of car it is. The search box has ID 329.\n\n```type [329] [Chevrolet Malibu] [1]```", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \nHISTORY_ACTION: type [329] [Chevrolet Malibu] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevy Malibu's Vehicle Class**\n\nRight, so the user's core question is pretty straightforward: \"What kind of car is a Chevy Malibu?\" My initial impulse is to dive straight into the search results and find the definitive answer.\n\nScanning the first result, I see \"Chevrolet Malibu.\" This is a good start, and the accompanying snippet immediately provides what I need: \"The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nMy immediate thought is, \"Perfect, there it is. It's a mid-size car. I can just tell them that and be done.\" I even mentally prepare to just stop right there.\n\nHowever, as someone who values precision and thoroughness, especially when dealing with technical classifications, I decide it's prudent to just quickly double-check that snippet. It's a small thing, but reinforcing the certainty is important. So, I re-read it carefully: \"Chevrolet Malibu The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nYes, absolutely confirmed. The information is clear and unambiguous. The Malibu is, without question, a mid-size car, with a history of production spanning a couple of significant periods.\n\nAt this point, the conclusion is firm and well-supported by the evidence. I have precisely what's needed to answer the user's query. I can now confidently stop the process, knowing I've accurately identified the vehicle's classification.\n\n**Conclusion:** The Chevrolet Malibu is a mid-size car.\n\n\n\n```stop [mid-size car]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_821ba7176362b505d344917dba1f1b5a.png"}, {"bytes": null, "path": "images/obs_300b080495ff41dcc58f6d656b9f2593.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search likely for film A Christmas Story. Use search box.\n```type [53] [A Christmas Story family last name] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show the relevant page is likely the film or musical page. I should open the main \"A Christmas Story\" article directly by URL to find the family's surname.\n```goto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]```", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\ngoto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]\n", "loss": null}, {"role": "assistant", "content": "The family in A Christmas Story has the last name Parker.The plot text says “adult Ralphie Parker,” indicating the family’s last name.\n```stop [Parker]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_f5796d0cd2c3c76bf1721d4cb71697dd.png"}, {"bytes": null, "path": "images/obs_7546c67a613360c3fbe8321491e9ce2a.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search capital city philippines. Use search box.\n```type [53] [capital city of the Philippines] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \nHISTORY_ACTION: type [53] [capital city of the Philippines] [1]\n", "loss": null}, {"role": "assistant", "content": "Manila is the capital city of the Philippines.\n```stop [Manila]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a092b654fbe598fffad3ab58a28694a5.png"}, {"bytes": null, "path": "images/obs_4ce44a5ff98fb7b5672fcdc807fe12b9.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search for Vidushi Shashikala Dani. Use search box.\n```type [53] [Vidushi Shashikala Dani] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \nHISTORY_ACTION: type [53] [Vidushi Shashikala Dani] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show the relevant page \"Shashikala Dani.\" The snippet mentions she is a Jaltarang musician. To answer the question about the category of instrument she is the only All India Radio exponent of, I can infer from the linked Jal tarang page snippet that Jal tarang is classified as a percussion instrument.Percussion instrument\n```stop [Percussion instrument]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_adee30babf5ae245035574e710682042.png"}, {"bytes": null, "path": "images/obs_e8911999dba23dea1da60ec654d8166a.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need find which state-run lottery began in 1986 and was featured in TV show Flamingo Fortune. Likely search Wikipedia offline. \n```type [53] [Flamingo Fortune lottery 1986 state-run] [1]```", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \nHISTORY_ACTION: type [53] [Flamingo Fortune lottery 1986 state-run] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show a relevant page: \"Florida Lottery.\" The objective asks which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune. That strongly suggests the answer is the Florida Lottery. Florida Lottery\n```stop [Florida Lottery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_c84d4d6b46a5ccf0ddd19b5f6cf90280.png"}, {"bytes": null, "path": "images/obs_e9d9d94c8e35d135b65c335ad1a569a4.png"}]}