diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/TRAINING_COMPLETED b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/TRAINING_COMPLETED deleted file mode 100644 index e69de29bb2d1d6434b8b29ae775ad8c2e48c5391..0000000000000000000000000000000000000000 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/args.json deleted file mode 100644 index 1909feadab03c3c6a278a320adc0267c146443a5..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/args.json +++ /dev/null @@ -1,387 +0,0 @@ -{ - "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "overwrite_output_dir": false, - "do_train": false, - "do_eval": false, - "do_predict": false, - "eval_strategy": "steps", - "prediction_loss_only": false, - "per_device_train_batch_size": 1, - "per_device_eval_batch_size": 1, - "per_gpu_train_batch_size": null, - "per_gpu_eval_batch_size": null, - "gradient_accumulation_steps": 4, - "eval_accumulation_steps": null, - "eval_delay": 0, - "torch_empty_cache_steps": null, - "learning_rate": 5e-05, - "weight_decay": 0.1, - "adam_beta1": 0.9, - "adam_beta2": 0.95, - "adam_epsilon": 1e-08, - "max_grad_norm": 1.0, - "num_train_epochs": 2.0, - "max_steps": -1, - "lr_scheduler_type": "cosine", - "lr_scheduler_kwargs": null, - "warmup_ratio": 0.2, - "warmup_steps": 0, - "log_level": "passive", - "log_level_replica": "warning", - "log_on_each_node": true, - "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs", - "logging_strategy": "steps", - "logging_first_step": true, - "logging_steps": 1, - "logging_nan_inf_filter": true, - "save_strategy": "steps", - "save_steps": 10.0, - "save_total_limit": 3, - "save_safetensors": true, - "save_on_each_node": false, - "save_only_model": false, - "restore_callback_states_from_checkpoint": false, - "no_cuda": false, - "use_cpu": false, - "use_mps_device": false, - "seed": 42, - "data_seed": 42, - "jit_mode_eval": false, - "use_ipex": false, - "bf16": true, - "fp16": false, - "fp16_opt_level": "O1", - "half_precision_backend": "auto", - "bf16_full_eval": false, - "fp16_full_eval": false, - "tf32": null, - "local_rank": 0, - "ddp_backend": null, - "tpu_num_cores": null, - "tpu_metrics_debug": false, - "debug": null, - "dataloader_drop_last": false, - "eval_steps": 2000.0, - "dataloader_num_workers": 4, - "dataloader_prefetch_factor": null, - "past_index": -1, - "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "disable_tqdm": null, - "remove_unused_columns": true, - "label_names": null, - "load_best_model_at_end": false, - "metric_for_best_model": "loss", - "greater_is_better": false, - "ignore_data_skip": false, - "fsdp": [], - "fsdp_min_num_params": 0, - "fsdp_config": null, - "fsdp_transformer_layer_cls_to_wrap": null, - "accelerator_config": { - "dispatch_batches": false - }, - "deepspeed": { - "fp16": { - "enabled": "auto", - "loss_scale": 0, - "loss_scale_window": 1000, - "initial_scale_power": 16, - "hysteresis": 2, - "min_loss_scale": 1 - }, - "bf16": { - "enabled": "auto" - }, - "zero_optimization": { - "stage": 2, - "offload_optimizer": { - "device": "none", - "pin_memory": true - }, - "allgather_partitions": true, - "allgather_bucket_size": 200000000.0, - "overlap_comm": false, - "reduce_scatter": true, - "reduce_bucket_size": 200000000.0, - "contiguous_gradients": true - }, - "gradient_accumulation_steps": "auto", - "gradient_clipping": "auto", - "steps_per_print": 2000, - "train_batch_size": "auto", - "train_micro_batch_size_per_gpu": "auto", - "wall_clock_breakdown": false - }, - "label_smoothing_factor": 0.0, - "optim": "adamw_torch", - "optim_args": null, - "adafactor": false, - "group_by_length": false, - "length_column_name": "length", - "report_to": [ - "none" - ], - "ddp_find_unused_parameters": null, - "ddp_bucket_cap_mb": null, - "ddp_broadcast_buffers": null, - "dataloader_pin_memory": true, - "dataloader_persistent_workers": false, - "skip_memory_metrics": true, - "use_legacy_prediction_loop": false, - "push_to_hub": false, - "resume_from_checkpoint": null, - "hub_model_id": null, - "hub_strategy": "every_save", - "hub_token": null, - "hub_private_repo": null, - "hub_always_push": false, - "hub_revision": null, - "gradient_checkpointing": true, - "gradient_checkpointing_kwargs": null, - "include_inputs_for_metrics": false, - "include_for_metrics": [], - "eval_do_concat_batches": true, - "fp16_backend": "auto", - "push_to_hub_model_id": null, - "push_to_hub_organization": null, - "push_to_hub_token": null, - "mp_parameters": "", - "auto_find_batch_size": false, - "full_determinism": false, - "torchdynamo": null, - "ray_scope": "last", - "ddp_timeout": 18000000, - "torch_compile": false, - "torch_compile_backend": null, - "torch_compile_mode": null, - "include_tokens_per_second": false, - "include_num_input_tokens_seen": false, - "neftune_noise_alpha": null, - "optim_target_modules": null, - "batch_eval_metrics": false, - "eval_on_start": false, - "use_liger_kernel": false, - "liger_kernel_config": null, - "eval_use_gather_object": false, - "average_tokens_across_devices": true, - "sortish_sampler": false, - "predict_with_generate": false, - "generation_max_length": null, - "generation_num_beams": null, - "generation_config": null, - "tuner_backend": "peft", - "vit_gradient_checkpointing": null, - "router_aux_loss_coef": 0.0, - "enable_dft_loss": false, - "enable_channel_loss": false, - "check_model": true, - "acc_strategy": "token", - "train_dataloader_shuffle": true, - "max_epochs": null, - "aligner_lr": null, - "vit_lr": null, - "use_logits_to_keep": null, - "ds3_gather_for_generation": true, - "resume_only_model": false, - "optimizer": null, - "loss_type": null, - "metric": null, - "eval_use_evalscope": false, - "eval_dataset": [], - "eval_dataset_args": null, - "eval_limit": null, - "eval_generation_config": null, - "extra_eval_args": null, - "use_flash_ckpt": false, - "use_ray": false, - "ray_exp_name": null, - "device_groups": null, - "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "model_type": "qwen2_5_vl", - "model_revision": null, - "task_type": "causal_lm", - "torch_dtype": "bfloat16", - "attn_impl": null, - "new_special_tokens": [], - "num_labels": null, - "problem_type": null, - "rope_scaling": null, - "device_map": null, - "max_memory": {}, - "max_model_len": null, - "local_repo_path": null, - "init_strategy": null, - "template": "qwen2_5_vl", - "system": null, - "max_length": 24576, - "truncation_strategy": "delete", - "max_pixels": null, - "agent_template": null, - "norm_bbox": null, - "use_chat_template": true, - "padding_side": "right", - "padding_free": false, - "loss_scale": "default", - "sequence_parallel_size": 1, - "template_backend": "swift", - "response_prefix": null, - "enable_thinking": null, - "add_non_thinking_prefix": true, - "dataset": [ - "data.jsonl" - ], - "val_dataset": [], - "cached_dataset": [], - "cached_val_dataset": [], - "split_dataset_ratio": 0.001, - "dataset_num_proc": 8, - "load_from_cache_file": false, - "dataset_shuffle": true, - "val_dataset_shuffle": false, - "streaming": false, - "interleave_prob": null, - "stopping_strategy": "first_exhausted", - "shuffle_buffer_size": 1000, - "download_mode": "reuse_dataset_if_exists", - "columns": {}, - "strict": false, - "model_name": null, - "model_author": null, - "custom_dataset_info": [], - "quant_method": null, - "quant_bits": null, - "hqq_axis": null, - "bnb_4bit_compute_dtype": "bfloat16", - "bnb_4bit_quant_type": "nf4", - "bnb_4bit_use_double_quant": true, - "bnb_4bit_quant_storage": null, - "max_new_tokens": 64, - "temperature": 0.0, - "top_k": null, - "top_p": null, - "repetition_penalty": null, - "num_beams": 1, - "stream": false, - "stop_words": [], - "logprobs": false, - "top_logprobs": null, - "structured_outputs_regex": null, - "ckpt_dir": null, - "lora_modules": [], - "train_type": "lora", - "adapters": [], - "external_plugins": [], - "model_kwargs": {}, - "load_args": false, - "load_data_args": false, - "packing": false, - "packing_length": null, - "packing_num_proc": 1, - "lazy_tokenize": true, - "custom_register_path": [], - "use_hf": false, - "ignore_args_error": false, - "use_swift_lora": false, - "freeze_parameters": [], - "freeze_parameters_regex": null, - "freeze_parameters_ratio": 0.0, - "trainable_parameters": [], - "trainable_parameters_regex": null, - "freeze_llm": false, - "freeze_vit": false, - "freeze_aligner": true, - "target_modules": [ - "all-linear" - ], - "target_regex": null, - "target_parameters": null, - "modules_to_save": [], - "lora_rank": 16, - "lora_alpha": 32, - "lora_dropout": 0.05, - "lora_bias": "none", - "lora_dtype": null, - "lorap_lr_ratio": null, - "use_rslora": false, - "use_dora": false, - "lora_ga_batch_size": 2, - "lora_ga_iters": 2, - "lora_ga_max_length": 1024, - "lora_ga_direction": "ArB2r", - "lora_ga_scale": "stable", - "lora_ga_stable_gamma": 16, - "init_weights": true, - "fourier_n_frequency": 2000, - "fourier_scaling": 300.0, - "boft_block_size": 4, - "boft_block_num": 0, - "boft_n_butterfly_factor": 1, - "boft_dropout": 0.0, - "vera_rank": 256, - "vera_projection_prng_key": 0, - "vera_dropout": 0.0, - "vera_d_initial": 0.1, - "adapter_act": "gelu", - "adapter_length": 128, - "use_galore": false, - "galore_target_modules": null, - "galore_rank": 128, - "galore_update_proj_gap": 50, - "galore_scale": 1.0, - "galore_proj_type": "std", - "galore_optim_per_parameter": false, - "galore_with_embedding": false, - "galore_quantization": false, - "galore_proj_quant": false, - "galore_proj_bits": 4, - "galore_proj_group_size": 256, - "galore_cos_threshold": 0.4, - "galore_gamma_proj": 2, - "galore_queue_size": 5, - "adalora_target_r": 8, - "adalora_init_r": 12, - "adalora_tinit": 0, - "adalora_tfinal": 0, - "adalora_deltaT": 1, - "adalora_beta1": 0.85, - "adalora_beta2": 0.85, - "adalora_orth_reg_weight": 0.5, - "llamapro_num_new_blocks": 4, - "llamapro_num_groups": null, - "lisa_activated_layers": 0, - "lisa_step_interval": 20, - "reft_layer_key": null, - "reft_layers": null, - "reft_rank": 4, - "reft_intervention_type": "LoreftIntervention", - "reft_args": null, - "swanlab_token": null, - "swanlab_project": "ms-swift", - "swanlab_workspace": null, - "swanlab_exp_name": null, - "swanlab_notification_method": null, - "swanlab_webhook_url": null, - "swanlab_secret": null, - "swanlab_sender_email": null, - "swanlab_receiver_email": null, - "swanlab_smtp_server": null, - "swanlab_smtp_port": null, - "swanlab_email_language": "zh", - "swanlab_mode": "cloud", - "add_version": true, - "create_checkpoint_symlink": false, - "zero_hpz_partition_size": null, - "deepspeed_autotp_size": null, - "early_stop_interval": null, - "rank": 0, - "global_world_size": 8, - "local_world_size": 8, - "model_suffix": "Qwen2.5-VL-7B-Instruct", - "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", - "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", - "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "_val_dataset_exists": true, - "hub": "", - "evaluation_strategy": "steps", - "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" -} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/README.md deleted file mode 100644 index 7b99d5d44c922653ec55877d9b54ddd70fbde852..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/README.md +++ /dev/null @@ -1,207 +0,0 @@ ---- -base_model: /workspace/models/Qwen2.5-VL-7B-Instruct -library_name: peft -pipeline_tag: text-generation -tags: -- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct -- lora -- transformers ---- - -# Model Card for Model ID - - - - - -## Model Details - -### Model Description - - - - - -- **Developed by:** [More Information Needed] -- **Funded by [optional]:** [More Information Needed] -- **Shared by [optional]:** [More Information Needed] -- **Model type:** [More Information Needed] -- **Language(s) (NLP):** [More Information Needed] -- **License:** [More Information Needed] -- **Finetuned from model [optional]:** [More Information Needed] - -### Model Sources [optional] - - - -- **Repository:** [More Information Needed] -- **Paper [optional]:** [More Information Needed] -- **Demo [optional]:** [More Information Needed] - -## Uses - - - -### Direct Use - - - -[More Information Needed] - -### Downstream Use [optional] - - - -[More Information Needed] - -### Out-of-Scope Use - - - -[More Information Needed] - -## Bias, Risks, and Limitations - - - -[More Information Needed] - -### Recommendations - - - -Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. - -## How to Get Started with the Model - -Use the code below to get started with the model. - -[More Information Needed] - -## Training Details - -### Training Data - - - -[More Information Needed] - -### Training Procedure - - - -#### Preprocessing [optional] - -[More Information Needed] - - -#### Training Hyperparameters - -- **Training regime:** [More Information Needed] - -#### Speeds, Sizes, Times [optional] - - - -[More Information Needed] - -## Evaluation - - - -### Testing Data, Factors & Metrics - -#### Testing Data - - - -[More Information Needed] - -#### Factors - - - -[More Information Needed] - -#### Metrics - - - -[More Information Needed] - -### Results - -[More Information Needed] - -#### Summary - - - -## Model Examination [optional] - - - -[More Information Needed] - -## Environmental Impact - - - -Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). - -- **Hardware Type:** [More Information Needed] -- **Hours used:** [More Information Needed] -- **Cloud Provider:** [More Information Needed] -- **Compute Region:** [More Information Needed] -- **Carbon Emitted:** [More Information Needed] - -## Technical Specifications [optional] - -### Model Architecture and Objective - -[More Information Needed] - -### Compute Infrastructure - -[More Information Needed] - -#### Hardware - -[More Information Needed] - -#### Software - -[More Information Needed] - -## Citation [optional] - - - -**BibTeX:** - -[More Information Needed] - -**APA:** - -[More Information Needed] - -## Glossary [optional] - - - -[More Information Needed] - -## More Information [optional] - -[More Information Needed] - -## Model Card Authors [optional] - -[More Information Needed] - -## Model Card Contact - -[More Information Needed] -### Framework versions - -- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/adapter_config.json deleted file mode 100644 index 8c337dd8e89f56ebe74fe6e4391a40917e12ff4e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/adapter_config.json +++ /dev/null @@ -1,34 +0,0 @@ -{ - "alpha_pattern": {}, - "auto_mapping": null, - "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "bias": "none", - "corda_config": null, - "eva_config": null, - "exclude_modules": null, - "fan_in_fan_out": false, - "inference_mode": true, - "init_lora_weights": true, - "layer_replication": null, - "layers_pattern": null, - "layers_to_transform": null, - "loftq_config": {}, - "lora_alpha": 32, - "lora_bias": false, - "lora_dropout": 0.05, - "megatron_config": null, - "megatron_core": "megatron.core", - "modules_to_save": [], - "peft_type": "LORA", - "qalora_group_size": 16, - "r": 16, - "rank_pattern": {}, - "revision": null, - "target_modules": "^(model\\.language_model(?=\\.).*\\.(down_proj|q_proj|gate_proj|k_proj|up_proj|v_proj|o_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|gate_proj|attn.proj|up_proj|mlp.0|qkv|mlp.2))$", - "target_parameters": null, - "task_type": "CAUSAL_LM", - "trainable_token_indices": null, - "use_dora": false, - "use_qalora": false, - "use_rslora": false -} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/adapter_model.safetensors deleted file mode 100644 index 7972f1d6d8f2e8014363b1ef4036421d9ba32e40..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/adapter_model.safetensors +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5f7c3cc387712691d39f0ed0db64e64ee2e58a0b78b99ae55ae2f20854f1ec9d -size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/additional_config.json deleted file mode 100644 index bbe5159d1d10a158affb4d328c70025d891e16d8..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/additional_config.json +++ /dev/null @@ -1 +0,0 @@ -{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/args.json deleted file mode 100644 index 1909feadab03c3c6a278a320adc0267c146443a5..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/args.json +++ /dev/null @@ -1,387 +0,0 @@ -{ - "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "overwrite_output_dir": false, - "do_train": false, - "do_eval": false, - "do_predict": false, - "eval_strategy": "steps", - "prediction_loss_only": false, - "per_device_train_batch_size": 1, - "per_device_eval_batch_size": 1, - "per_gpu_train_batch_size": null, - "per_gpu_eval_batch_size": null, - "gradient_accumulation_steps": 4, - "eval_accumulation_steps": null, - "eval_delay": 0, - "torch_empty_cache_steps": null, - "learning_rate": 5e-05, - "weight_decay": 0.1, - "adam_beta1": 0.9, - "adam_beta2": 0.95, - "adam_epsilon": 1e-08, - "max_grad_norm": 1.0, - "num_train_epochs": 2.0, - "max_steps": -1, - "lr_scheduler_type": "cosine", - "lr_scheduler_kwargs": null, - "warmup_ratio": 0.2, - "warmup_steps": 0, - "log_level": "passive", - "log_level_replica": "warning", - "log_on_each_node": true, - "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs", - "logging_strategy": "steps", - "logging_first_step": true, - "logging_steps": 1, - "logging_nan_inf_filter": true, - "save_strategy": "steps", - "save_steps": 10.0, - "save_total_limit": 3, - "save_safetensors": true, - "save_on_each_node": false, - "save_only_model": false, - "restore_callback_states_from_checkpoint": false, - "no_cuda": false, - "use_cpu": false, - "use_mps_device": false, - "seed": 42, - "data_seed": 42, - "jit_mode_eval": false, - "use_ipex": false, - "bf16": true, - "fp16": false, - "fp16_opt_level": "O1", - "half_precision_backend": "auto", - "bf16_full_eval": false, - "fp16_full_eval": false, - "tf32": null, - "local_rank": 0, - "ddp_backend": null, - "tpu_num_cores": null, - "tpu_metrics_debug": false, - "debug": null, - "dataloader_drop_last": false, - "eval_steps": 2000.0, - "dataloader_num_workers": 4, - "dataloader_prefetch_factor": null, - "past_index": -1, - "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "disable_tqdm": null, - "remove_unused_columns": true, - "label_names": null, - "load_best_model_at_end": false, - "metric_for_best_model": "loss", - "greater_is_better": false, - "ignore_data_skip": false, - "fsdp": [], - "fsdp_min_num_params": 0, - "fsdp_config": null, - "fsdp_transformer_layer_cls_to_wrap": null, - "accelerator_config": { - "dispatch_batches": false - }, - "deepspeed": { - "fp16": { - "enabled": "auto", - "loss_scale": 0, - "loss_scale_window": 1000, - "initial_scale_power": 16, - "hysteresis": 2, - "min_loss_scale": 1 - }, - "bf16": { - "enabled": "auto" - }, - "zero_optimization": { - "stage": 2, - "offload_optimizer": { - "device": "none", - "pin_memory": true - }, - "allgather_partitions": true, - "allgather_bucket_size": 200000000.0, - "overlap_comm": false, - "reduce_scatter": true, - "reduce_bucket_size": 200000000.0, - "contiguous_gradients": true - }, - "gradient_accumulation_steps": "auto", - "gradient_clipping": "auto", - "steps_per_print": 2000, - "train_batch_size": "auto", - "train_micro_batch_size_per_gpu": "auto", - "wall_clock_breakdown": false - }, - "label_smoothing_factor": 0.0, - "optim": "adamw_torch", - "optim_args": null, - "adafactor": false, - "group_by_length": false, - "length_column_name": "length", - "report_to": [ - "none" - ], - "ddp_find_unused_parameters": null, - "ddp_bucket_cap_mb": null, - "ddp_broadcast_buffers": null, - "dataloader_pin_memory": true, - "dataloader_persistent_workers": false, - "skip_memory_metrics": true, - "use_legacy_prediction_loop": false, - "push_to_hub": false, - "resume_from_checkpoint": null, - "hub_model_id": null, - "hub_strategy": "every_save", - "hub_token": null, - "hub_private_repo": null, - "hub_always_push": false, - "hub_revision": null, - "gradient_checkpointing": true, - "gradient_checkpointing_kwargs": null, - "include_inputs_for_metrics": false, - "include_for_metrics": [], - "eval_do_concat_batches": true, - "fp16_backend": "auto", - "push_to_hub_model_id": null, - "push_to_hub_organization": null, - "push_to_hub_token": null, - "mp_parameters": "", - "auto_find_batch_size": false, - "full_determinism": false, - "torchdynamo": null, - "ray_scope": "last", - "ddp_timeout": 18000000, - "torch_compile": false, - "torch_compile_backend": null, - "torch_compile_mode": null, - "include_tokens_per_second": false, - "include_num_input_tokens_seen": false, - "neftune_noise_alpha": null, - "optim_target_modules": null, - "batch_eval_metrics": false, - "eval_on_start": false, - "use_liger_kernel": false, - "liger_kernel_config": null, - "eval_use_gather_object": false, - "average_tokens_across_devices": true, - "sortish_sampler": false, - "predict_with_generate": false, - "generation_max_length": null, - "generation_num_beams": null, - "generation_config": null, - "tuner_backend": "peft", - "vit_gradient_checkpointing": null, - "router_aux_loss_coef": 0.0, - "enable_dft_loss": false, - "enable_channel_loss": false, - "check_model": true, - "acc_strategy": "token", - "train_dataloader_shuffle": true, - "max_epochs": null, - "aligner_lr": null, - "vit_lr": null, - "use_logits_to_keep": null, - "ds3_gather_for_generation": true, - "resume_only_model": false, - "optimizer": null, - "loss_type": null, - "metric": null, - "eval_use_evalscope": false, - "eval_dataset": [], - "eval_dataset_args": null, - "eval_limit": null, - "eval_generation_config": null, - "extra_eval_args": null, - "use_flash_ckpt": false, - "use_ray": false, - "ray_exp_name": null, - "device_groups": null, - "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "model_type": "qwen2_5_vl", - "model_revision": null, - "task_type": "causal_lm", - "torch_dtype": "bfloat16", - "attn_impl": null, - "new_special_tokens": [], - "num_labels": null, - "problem_type": null, - "rope_scaling": null, - "device_map": null, - "max_memory": {}, - "max_model_len": null, - "local_repo_path": null, - "init_strategy": null, - "template": "qwen2_5_vl", - "system": null, - "max_length": 24576, - "truncation_strategy": "delete", - "max_pixels": null, - "agent_template": null, - "norm_bbox": null, - "use_chat_template": true, - "padding_side": "right", - "padding_free": false, - "loss_scale": "default", - "sequence_parallel_size": 1, - "template_backend": "swift", - "response_prefix": null, - "enable_thinking": null, - "add_non_thinking_prefix": true, - "dataset": [ - "data.jsonl" - ], - "val_dataset": [], - "cached_dataset": [], - "cached_val_dataset": [], - "split_dataset_ratio": 0.001, - "dataset_num_proc": 8, - "load_from_cache_file": false, - "dataset_shuffle": true, - "val_dataset_shuffle": false, - "streaming": false, - "interleave_prob": null, - "stopping_strategy": "first_exhausted", - "shuffle_buffer_size": 1000, - "download_mode": "reuse_dataset_if_exists", - "columns": {}, - "strict": false, - "model_name": null, - "model_author": null, - "custom_dataset_info": [], - "quant_method": null, - "quant_bits": null, - "hqq_axis": null, - "bnb_4bit_compute_dtype": "bfloat16", - "bnb_4bit_quant_type": "nf4", - "bnb_4bit_use_double_quant": true, - "bnb_4bit_quant_storage": null, - "max_new_tokens": 64, - "temperature": 0.0, - "top_k": null, - "top_p": null, - "repetition_penalty": null, - "num_beams": 1, - "stream": false, - "stop_words": [], - "logprobs": false, - "top_logprobs": null, - "structured_outputs_regex": null, - "ckpt_dir": null, - "lora_modules": [], - "train_type": "lora", - "adapters": [], - "external_plugins": [], - "model_kwargs": {}, - "load_args": false, - "load_data_args": false, - "packing": false, - "packing_length": null, - "packing_num_proc": 1, - "lazy_tokenize": true, - "custom_register_path": [], - "use_hf": false, - "ignore_args_error": false, - "use_swift_lora": false, - "freeze_parameters": [], - "freeze_parameters_regex": null, - "freeze_parameters_ratio": 0.0, - "trainable_parameters": [], - "trainable_parameters_regex": null, - "freeze_llm": false, - "freeze_vit": false, - "freeze_aligner": true, - "target_modules": [ - "all-linear" - ], - "target_regex": null, - "target_parameters": null, - "modules_to_save": [], - "lora_rank": 16, - "lora_alpha": 32, - "lora_dropout": 0.05, - "lora_bias": "none", - "lora_dtype": null, - "lorap_lr_ratio": null, - "use_rslora": false, - "use_dora": false, - "lora_ga_batch_size": 2, - "lora_ga_iters": 2, - "lora_ga_max_length": 1024, - "lora_ga_direction": "ArB2r", - "lora_ga_scale": "stable", - "lora_ga_stable_gamma": 16, - "init_weights": true, - "fourier_n_frequency": 2000, - "fourier_scaling": 300.0, - "boft_block_size": 4, - "boft_block_num": 0, - "boft_n_butterfly_factor": 1, - "boft_dropout": 0.0, - "vera_rank": 256, - "vera_projection_prng_key": 0, - "vera_dropout": 0.0, - "vera_d_initial": 0.1, - "adapter_act": "gelu", - "adapter_length": 128, - "use_galore": false, - "galore_target_modules": null, - "galore_rank": 128, - "galore_update_proj_gap": 50, - "galore_scale": 1.0, - "galore_proj_type": "std", - "galore_optim_per_parameter": false, - "galore_with_embedding": false, - "galore_quantization": false, - "galore_proj_quant": false, - "galore_proj_bits": 4, - "galore_proj_group_size": 256, - "galore_cos_threshold": 0.4, - "galore_gamma_proj": 2, - "galore_queue_size": 5, - "adalora_target_r": 8, - "adalora_init_r": 12, - "adalora_tinit": 0, - "adalora_tfinal": 0, - "adalora_deltaT": 1, - "adalora_beta1": 0.85, - "adalora_beta2": 0.85, - "adalora_orth_reg_weight": 0.5, - "llamapro_num_new_blocks": 4, - "llamapro_num_groups": null, - "lisa_activated_layers": 0, - "lisa_step_interval": 20, - "reft_layer_key": null, - "reft_layers": null, - "reft_rank": 4, - "reft_intervention_type": "LoreftIntervention", - "reft_args": null, - "swanlab_token": null, - "swanlab_project": "ms-swift", - "swanlab_workspace": null, - "swanlab_exp_name": null, - "swanlab_notification_method": null, - "swanlab_webhook_url": null, - "swanlab_secret": null, - "swanlab_sender_email": null, - "swanlab_receiver_email": null, - "swanlab_smtp_server": null, - "swanlab_smtp_port": null, - "swanlab_email_language": "zh", - "swanlab_mode": "cloud", - "add_version": true, - "create_checkpoint_symlink": false, - "zero_hpz_partition_size": null, - "deepspeed_autotp_size": null, - "early_stop_interval": null, - "rank": 0, - "global_world_size": 8, - "local_world_size": 8, - "model_suffix": "Qwen2.5-VL-7B-Instruct", - "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", - "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", - "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "_val_dataset_exists": true, - "hub": "", - "evaluation_strategy": "steps", - "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" -} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt deleted file mode 100644 index 09dba074d6e843bd98d1e7395bb80d31dada305a..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f13bc4cc2ade7265f850bbed9e35f34c93e035d0054a24dad70a56b5d21d62a5 -size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt deleted file mode 100644 index a89bb714587d988ed4a7166008a09667b6e31325..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d1824a2e3d7dd384eeeb9bf90879bb73e694ba08c3aa742476f6c72d1e0b05d3 -size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt deleted file mode 100644 index 3e0bd2fcb31dab42271783f697dcbc57aaa58593..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:965a8d3c2ff84cf2be1cd7d97d7233813bff3da3c727f31a16fbb8e361565275 -size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt deleted file mode 100644 index 578c29662194dffea4106743077445d661005952..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6c95d5e04337d614c0d101062d1f9994567182869f08bedcb87aeae38e73e0d9 -size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt deleted file mode 100644 index 48d6f795babc08ac71d67e0c9bba7a01440279a5..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c22b866bc6198e4f51ecd8507fe2af544933071985b62d2c9fdd1c3d9df402a1 -size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt deleted file mode 100644 index 9ecae76def7e880a9fce468242b4f44645c3cd78..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:bba912266a060284d515c4ccd4cfc46d06b350f7bf1cbc64eaf0c031bce67277 -size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt deleted file mode 100644 index dfca0b9909d07a81b570d37d0baf7827457cbb0e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a856663791277ccd85af52854af456950501fe5a14a34c9b35f8aff5bf0194de -size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt deleted file mode 100644 index dc8685130bf81fcca4f81a47dd3ca89572f15006..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6789184e5aa224654ec300e55977cdc4b3dcd74573c250d2ccc40e922c66a91d -size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/mp_rank_00_model_states.pt deleted file mode 100644 index 6995d7e787e2f88b95de6310e44a110213660297..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/global_step780/mp_rank_00_model_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:04285c94a97f081b3917639e9ff6c02172a4058c54c3e9ee70353b484ee0a0e2 -size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/latest deleted file mode 100644 index 1ec3dad1fcdbec2feb24a2594f56f8ac93ca6ae6..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/latest +++ /dev/null @@ -1 +0,0 @@ -global_step780 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_0.pth deleted file mode 100644 index ca389b9d6911f8305e473057cf7721963b39d8af..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_0.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f99581ade31b31835a3932ed26c57953507ce4e9a8e976ef7ac5bc33a20b2f79 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_1.pth deleted file mode 100644 index a098462f3ab218db4e7e8bc712ea6ad90a36d6ff..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_1.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:90323ea597d7c881b223489c60c1ba8de3b21e1371cbf69020a046cced5ae755 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_2.pth deleted file mode 100644 index 181cca477f62b02864bd091a0ac61c704fe2cc61..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_2.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0358e9895eb318c6d1b2782b1d49c8d857d960a294dd5555eebae08e955ba4f7 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_3.pth deleted file mode 100644 index b37c0a6c67f68fd55cbd48ec8b061206ad15d2ed..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_3.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:ac59e405a7157bec526c91cf9b6eccac92f547e5c61278b08bbb751abc2b78d9 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_4.pth deleted file mode 100644 index 5b40d4a97a2be026d5296c0cfb1cc7f5ca178d2b..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_4.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6cf3fcc7ae05b3b7744267eaac592d0015488e915cf1ba63eecc781215cb620f -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_5.pth deleted file mode 100644 index f665f068840ce8795dba8edfc49a037efbfab0d6..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_5.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:9081c1b8fb2d521f31ad9dcc4104a4e7e6c0b371ce0a8285b676f91502c8ab83 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_6.pth deleted file mode 100644 index c617dab8edc79526ab32a17062247174fac82d34..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_6.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:110a3d3243b8f6cb38ea42800e081dfe1fbf874a6a4e0e039a7e8266837f6fb2 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_7.pth deleted file mode 100644 index 25550fd3bb5c005dde20633e7a0eaa4951c349c2..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/rng_state_7.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e4dfe3c433197f0e1b9446dfff7c5a821e289e1e99cc799423ea58795f83781e -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/scheduler.pt deleted file mode 100644 index 372669d5d6117ac9bc43efff9bc091a403d26fbc..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/scheduler.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:fbb84c2c585c8df368024c404ab725c0b20622db0462431267332163768c002e -size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/trainer_state.json deleted file mode 100644 index 09ece706f6d5bfd54430f99326ba189269d9211f..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/trainer_state.json +++ /dev/null @@ -1,6274 +0,0 @@ -{ - "best_global_step": null, - "best_metric": null, - "best_model_checkpoint": null, - "epoch": 1.9511889862327911, - "eval_steps": 2000, - "global_step": 780, - "is_hyper_param_search": false, - "is_local_process_zero": true, - "is_world_process_zero": true, - "log_history": [ - { - "epoch": 0.0025031289111389237, - "grad_norm": 1.7986857891082764, - "learning_rate": 3.125e-07, - "loss": 1.4494528770446777, - "step": 1, - "token_acc": 0.6592913128674069 - }, - { - "epoch": 0.0050062578222778474, - "grad_norm": 1.6583799123764038, - "learning_rate": 6.25e-07, - "loss": 1.4986588954925537, - "step": 2, - "token_acc": 0.6386976385046007 - }, - { - "epoch": 0.007509386733416771, - "grad_norm": 2.0358657836914062, - "learning_rate": 9.375e-07, - "loss": 1.4801826477050781, - "step": 3, - "token_acc": 0.6456910232526047 - }, - { - "epoch": 0.010012515644555695, - "grad_norm": 2.9915387630462646, - "learning_rate": 1.25e-06, - "loss": 1.4314780235290527, - "step": 4, - "token_acc": 0.657655623906541 - }, - { - "epoch": 0.012515644555694618, - "grad_norm": 3.6695473194122314, - "learning_rate": 1.5625e-06, - "loss": 1.4699971675872803, - "step": 5, - "token_acc": 0.6388313198200475 - }, - { - "epoch": 0.015018773466833541, - "grad_norm": 3.4062535762786865, - "learning_rate": 1.875e-06, - "loss": 1.459728479385376, - "step": 6, - "token_acc": 0.6437672541940964 - }, - { - "epoch": 0.017521902377972465, - "grad_norm": 4.477782249450684, - "learning_rate": 2.1875e-06, - "loss": 1.4375343322753906, - "step": 7, - "token_acc": 0.6586960119146119 - }, - { - "epoch": 0.02002503128911139, - "grad_norm": 7.962740898132324, - "learning_rate": 2.5e-06, - "loss": 1.4262611865997314, - "step": 8, - "token_acc": 0.655122040294601 - }, - { - "epoch": 0.02252816020025031, - "grad_norm": 1.1610136032104492, - "learning_rate": 2.8125e-06, - "loss": 1.5507800579071045, - "step": 9, - "token_acc": 0.6221771018936726 - }, - { - "epoch": 0.025031289111389236, - "grad_norm": 2.3185999393463135, - "learning_rate": 3.125e-06, - "loss": 1.536710262298584, - "step": 10, - "token_acc": 0.6201467766984379 - }, - { - "epoch": 0.02753441802252816, - "grad_norm": 1.7153717279434204, - "learning_rate": 3.4375000000000005e-06, - "loss": 1.5054551362991333, - "step": 11, - "token_acc": 0.6262201095830763 - }, - { - "epoch": 0.030037546933667083, - "grad_norm": 2.102219343185425, - "learning_rate": 3.75e-06, - "loss": 1.4586467742919922, - "step": 12, - "token_acc": 0.6540530157510565 - }, - { - "epoch": 0.03254067584480601, - "grad_norm": 1.5630065202713013, - "learning_rate": 4.0625000000000005e-06, - "loss": 1.4890741109848022, - "step": 13, - "token_acc": 0.6405010039200688 - }, - { - "epoch": 0.03504380475594493, - "grad_norm": 33.184234619140625, - "learning_rate": 4.375e-06, - "loss": 1.4462761878967285, - "step": 14, - "token_acc": 0.6706432173164433 - }, - { - "epoch": 0.03754693366708386, - "grad_norm": 1.8826276063919067, - "learning_rate": 4.6875000000000004e-06, - "loss": 1.4586151838302612, - "step": 15, - "token_acc": 0.6705066666666667 - }, - { - "epoch": 0.04005006257822278, - "grad_norm": 8.024161338806152, - "learning_rate": 5e-06, - "loss": 1.4168506860733032, - "step": 16, - "token_acc": 0.6805052169137836 - }, - { - "epoch": 0.0425531914893617, - "grad_norm": 2.216902732849121, - "learning_rate": 5.3125e-06, - "loss": 1.5086560249328613, - "step": 17, - "token_acc": 0.6336965157189877 - }, - { - "epoch": 0.04505632040050062, - "grad_norm": 2.044179916381836, - "learning_rate": 5.625e-06, - "loss": 1.4445496797561646, - "step": 18, - "token_acc": 0.65391224653454 - }, - { - "epoch": 0.04755944931163955, - "grad_norm": 3.586271286010742, - "learning_rate": 5.9375e-06, - "loss": 1.408017635345459, - "step": 19, - "token_acc": 0.6634764043289406 - }, - { - "epoch": 0.05006257822277847, - "grad_norm": 5.328360080718994, - "learning_rate": 6.25e-06, - "loss": 1.489911437034607, - "step": 20, - "token_acc": 0.6468571428571429 - }, - { - "epoch": 0.052565707133917394, - "grad_norm": 5.333054542541504, - "learning_rate": 6.5625e-06, - "loss": 1.5072444677352905, - "step": 21, - "token_acc": 0.6348264774365229 - }, - { - "epoch": 0.05506883604505632, - "grad_norm": 2.1628494262695312, - "learning_rate": 6.875000000000001e-06, - "loss": 1.4629909992218018, - "step": 22, - "token_acc": 0.6488587495865035 - }, - { - "epoch": 0.057571964956195244, - "grad_norm": 1.1275200843811035, - "learning_rate": 7.187499999999999e-06, - "loss": 1.4386491775512695, - "step": 23, - "token_acc": 0.6535871156661787 - }, - { - "epoch": 0.060075093867334166, - "grad_norm": 1.3719394207000732, - "learning_rate": 7.5e-06, - "loss": 1.4821865558624268, - "step": 24, - "token_acc": 0.6603688302296149 - }, - { - "epoch": 0.0625782227784731, - "grad_norm": 4.841657638549805, - "learning_rate": 7.8125e-06, - "loss": 1.4570186138153076, - "step": 25, - "token_acc": 0.641376796500729 - }, - { - "epoch": 0.06508135168961202, - "grad_norm": 5.441135406494141, - "learning_rate": 8.125000000000001e-06, - "loss": 1.4552083015441895, - "step": 26, - "token_acc": 0.6444476999707003 - }, - { - "epoch": 0.06758448060075094, - "grad_norm": 5.626768589019775, - "learning_rate": 8.437500000000002e-06, - "loss": 1.4883147478103638, - "step": 27, - "token_acc": 0.6449818262740152 - }, - { - "epoch": 0.07008760951188986, - "grad_norm": 2.280463695526123, - "learning_rate": 8.75e-06, - "loss": 1.482466459274292, - "step": 28, - "token_acc": 0.6569336031608365 - }, - { - "epoch": 0.07259073842302878, - "grad_norm": 1.4831247329711914, - "learning_rate": 9.0625e-06, - "loss": 1.4435244798660278, - "step": 29, - "token_acc": 0.6449365872405841 - }, - { - "epoch": 0.07509386733416772, - "grad_norm": 2.1460583209991455, - "learning_rate": 9.375000000000001e-06, - "loss": 1.4155304431915283, - "step": 30, - "token_acc": 0.6572798819478604 - }, - { - "epoch": 0.07759699624530664, - "grad_norm": 3.4287304878234863, - "learning_rate": 9.6875e-06, - "loss": 1.4242777824401855, - "step": 31, - "token_acc": 0.6509663111204985 - }, - { - "epoch": 0.08010012515644556, - "grad_norm": 1.7512478828430176, - "learning_rate": 1e-05, - "loss": 1.4408752918243408, - "step": 32, - "token_acc": 0.6373248744382765 - }, - { - "epoch": 0.08260325406758448, - "grad_norm": 2.4649264812469482, - "learning_rate": 1.03125e-05, - "loss": 1.4433287382125854, - "step": 33, - "token_acc": 0.6401217941210915 - }, - { - "epoch": 0.0851063829787234, - "grad_norm": 3.863513946533203, - "learning_rate": 1.0625e-05, - "loss": 1.3532931804656982, - "step": 34, - "token_acc": 0.6718291250733999 - }, - { - "epoch": 0.08760951188986232, - "grad_norm": 2.388653516769409, - "learning_rate": 1.09375e-05, - "loss": 1.368670105934143, - "step": 35, - "token_acc": 0.6668484187568157 - }, - { - "epoch": 0.09011264080100125, - "grad_norm": 13.738019943237305, - "learning_rate": 1.125e-05, - "loss": 1.4073092937469482, - "step": 36, - "token_acc": 0.6551803885291397 - }, - { - "epoch": 0.09261576971214018, - "grad_norm": 1.3637429475784302, - "learning_rate": 1.1562500000000002e-05, - "loss": 1.4829626083374023, - "step": 37, - "token_acc": 0.632803489946347 - }, - { - "epoch": 0.0951188986232791, - "grad_norm": 1.6325939893722534, - "learning_rate": 1.1875e-05, - "loss": 1.3899552822113037, - "step": 38, - "token_acc": 0.6505426646706587 - }, - { - "epoch": 0.09762202753441802, - "grad_norm": 1.8122252225875854, - "learning_rate": 1.21875e-05, - "loss": 1.4045588970184326, - "step": 39, - "token_acc": 0.6430427054373091 - }, - { - "epoch": 0.10012515644555695, - "grad_norm": 3.8704774379730225, - "learning_rate": 1.25e-05, - "loss": 1.328863501548767, - "step": 40, - "token_acc": 0.6735982966643009 - }, - { - "epoch": 0.10262828535669587, - "grad_norm": 2.2901201248168945, - "learning_rate": 1.28125e-05, - "loss": 1.3276169300079346, - "step": 41, - "token_acc": 0.6693909833904561 - }, - { - "epoch": 0.10513141426783479, - "grad_norm": 4.91914176940918, - "learning_rate": 1.3125e-05, - "loss": 1.3163728713989258, - "step": 42, - "token_acc": 0.670345262494088 - }, - { - "epoch": 0.10763454317897372, - "grad_norm": 2.1690850257873535, - "learning_rate": 1.34375e-05, - "loss": 1.3434736728668213, - "step": 43, - "token_acc": 0.6614920224234584 - }, - { - "epoch": 0.11013767209011265, - "grad_norm": 2.672122001647949, - "learning_rate": 1.3750000000000002e-05, - "loss": 1.314670205116272, - "step": 44, - "token_acc": 0.6749050965188595 - }, - { - "epoch": 0.11264080100125157, - "grad_norm": 2.7474703788757324, - "learning_rate": 1.4062500000000001e-05, - "loss": 1.3387380838394165, - "step": 45, - "token_acc": 0.6603486336302048 - }, - { - "epoch": 0.11514392991239049, - "grad_norm": 3.5926313400268555, - "learning_rate": 1.4374999999999999e-05, - "loss": 1.2919178009033203, - "step": 46, - "token_acc": 0.6762086081457809 - }, - { - "epoch": 0.11764705882352941, - "grad_norm": 3.3131020069122314, - "learning_rate": 1.4687500000000001e-05, - "loss": 1.2780070304870605, - "step": 47, - "token_acc": 0.6928104575163399 - }, - { - "epoch": 0.12015018773466833, - "grad_norm": 2.7729618549346924, - "learning_rate": 1.5e-05, - "loss": 1.321435809135437, - "step": 48, - "token_acc": 0.6654236179260713 - }, - { - "epoch": 0.12265331664580725, - "grad_norm": 3.3950774669647217, - "learning_rate": 1.5312500000000003e-05, - "loss": 1.341125249862671, - "step": 49, - "token_acc": 0.6776592884667085 - }, - { - "epoch": 0.1251564455569462, - "grad_norm": 1.6991623640060425, - "learning_rate": 1.5625e-05, - "loss": 1.2597063779830933, - "step": 50, - "token_acc": 0.68832675794848 - }, - { - "epoch": 0.1276595744680851, - "grad_norm": 2.190904378890991, - "learning_rate": 1.59375e-05, - "loss": 1.3336235284805298, - "step": 51, - "token_acc": 0.6667860126506743 - }, - { - "epoch": 0.13016270337922403, - "grad_norm": 1.2699120044708252, - "learning_rate": 1.6250000000000002e-05, - "loss": 1.3078663349151611, - "step": 52, - "token_acc": 0.6601299948297511 - }, - { - "epoch": 0.13266583229036297, - "grad_norm": 2.1954216957092285, - "learning_rate": 1.65625e-05, - "loss": 1.3297888040542603, - "step": 53, - "token_acc": 0.6636132655790318 - }, - { - "epoch": 0.13516896120150187, - "grad_norm": 1.4788720607757568, - "learning_rate": 1.6875000000000004e-05, - "loss": 1.2633283138275146, - "step": 54, - "token_acc": 0.6728486646884273 - }, - { - "epoch": 0.1376720901126408, - "grad_norm": 1.2756942510604858, - "learning_rate": 1.71875e-05, - "loss": 1.3134421110153198, - "step": 55, - "token_acc": 0.6597701149425287 - }, - { - "epoch": 0.14017521902377972, - "grad_norm": 1.5058810710906982, - "learning_rate": 1.75e-05, - "loss": 1.320970058441162, - "step": 56, - "token_acc": 0.6619850627084409 - }, - { - "epoch": 0.14267834793491865, - "grad_norm": 8.395251274108887, - "learning_rate": 1.7812500000000003e-05, - "loss": 1.199589729309082, - "step": 57, - "token_acc": 0.6902491313668958 - }, - { - "epoch": 0.14518147684605756, - "grad_norm": 1.2147586345672607, - "learning_rate": 1.8125e-05, - "loss": 1.200380802154541, - "step": 58, - "token_acc": 0.6993761140819964 - }, - { - "epoch": 0.1476846057571965, - "grad_norm": 7.152925491333008, - "learning_rate": 1.84375e-05, - "loss": 1.1884859800338745, - "step": 59, - "token_acc": 0.6956748695003728 - }, - { - "epoch": 0.15018773466833543, - "grad_norm": 1.761688470840454, - "learning_rate": 1.8750000000000002e-05, - "loss": 1.2416102886199951, - "step": 60, - "token_acc": 0.6780534640456819 - }, - { - "epoch": 0.15269086357947434, - "grad_norm": 1.4128592014312744, - "learning_rate": 1.90625e-05, - "loss": 1.2558822631835938, - "step": 61, - "token_acc": 0.6748296304504404 - }, - { - "epoch": 0.15519399249061328, - "grad_norm": 5.176482677459717, - "learning_rate": 1.9375e-05, - "loss": 1.2571231126785278, - "step": 62, - "token_acc": 0.6723865345312922 - }, - { - "epoch": 0.15769712140175218, - "grad_norm": 2.6499240398406982, - "learning_rate": 1.96875e-05, - "loss": 1.2110214233398438, - "step": 63, - "token_acc": 0.693203125 - }, - { - "epoch": 0.16020025031289112, - "grad_norm": 4.237362861633301, - "learning_rate": 2e-05, - "loss": 1.2331520318984985, - "step": 64, - "token_acc": 0.6743368488334931 - }, - { - "epoch": 0.16270337922403003, - "grad_norm": 1.8324310779571533, - "learning_rate": 2.0312500000000002e-05, - "loss": 1.251111388206482, - "step": 65, - "token_acc": 0.6659237798083352 - }, - { - "epoch": 0.16520650813516896, - "grad_norm": 4.525329113006592, - "learning_rate": 2.0625e-05, - "loss": 1.2055377960205078, - "step": 66, - "token_acc": 0.6863984270767503 - }, - { - "epoch": 0.1677096370463079, - "grad_norm": 6.051656246185303, - "learning_rate": 2.09375e-05, - "loss": 1.1731817722320557, - "step": 67, - "token_acc": 0.7137023105857067 - }, - { - "epoch": 0.1702127659574468, - "grad_norm": 4.812889099121094, - "learning_rate": 2.125e-05, - "loss": 1.2493493556976318, - "step": 68, - "token_acc": 0.6750756811301716 - }, - { - "epoch": 0.17271589486858574, - "grad_norm": 7.175212860107422, - "learning_rate": 2.1562500000000002e-05, - "loss": 1.1924042701721191, - "step": 69, - "token_acc": 0.6935587761674719 - }, - { - "epoch": 0.17521902377972465, - "grad_norm": 3.6862568855285645, - "learning_rate": 2.1875e-05, - "loss": 1.1937012672424316, - "step": 70, - "token_acc": 0.6821087165563663 - }, - { - "epoch": 0.17772215269086358, - "grad_norm": 1.5228620767593384, - "learning_rate": 2.21875e-05, - "loss": 1.1624102592468262, - "step": 71, - "token_acc": 0.6929272132735861 - }, - { - "epoch": 0.1802252816020025, - "grad_norm": 4.755965232849121, - "learning_rate": 2.25e-05, - "loss": 1.2102301120758057, - "step": 72, - "token_acc": 0.6871946706143597 - }, - { - "epoch": 0.18272841051314143, - "grad_norm": 5.966728687286377, - "learning_rate": 2.28125e-05, - "loss": 1.0677056312561035, - "step": 73, - "token_acc": 0.7211055276381909 - }, - { - "epoch": 0.18523153942428036, - "grad_norm": 1.5221632719039917, - "learning_rate": 2.3125000000000003e-05, - "loss": 1.1764060258865356, - "step": 74, - "token_acc": 0.6962217319360177 - }, - { - "epoch": 0.18773466833541927, - "grad_norm": 2.7929961681365967, - "learning_rate": 2.34375e-05, - "loss": 1.1629931926727295, - "step": 75, - "token_acc": 0.6944312608764436 - }, - { - "epoch": 0.1902377972465582, - "grad_norm": 2.37900447845459, - "learning_rate": 2.375e-05, - "loss": 1.0149047374725342, - "step": 76, - "token_acc": 0.7393754402441888 - }, - { - "epoch": 0.1927409261576971, - "grad_norm": 1.0842740535736084, - "learning_rate": 2.4062500000000002e-05, - "loss": 1.1768832206726074, - "step": 77, - "token_acc": 0.6881792648675051 - }, - { - "epoch": 0.19524405506883605, - "grad_norm": 3.4930760860443115, - "learning_rate": 2.4375e-05, - "loss": 1.1979458332061768, - "step": 78, - "token_acc": 0.679685852835758 - }, - { - "epoch": 0.19774718397997496, - "grad_norm": 1.6366428136825562, - "learning_rate": 2.4687500000000004e-05, - "loss": 1.2089760303497314, - "step": 79, - "token_acc": 0.6773502191914271 - }, - { - "epoch": 0.2002503128911139, - "grad_norm": 2.1552915573120117, - "learning_rate": 2.5e-05, - "loss": 1.215577483177185, - "step": 80, - "token_acc": 0.6731748051534914 - }, - { - "epoch": 0.20275344180225283, - "grad_norm": 1.2128065824508667, - "learning_rate": 2.53125e-05, - "loss": 1.1573808193206787, - "step": 81, - "token_acc": 0.6900347624565469 - }, - { - "epoch": 0.20525657071339173, - "grad_norm": 1.3834235668182373, - "learning_rate": 2.5625e-05, - "loss": 1.2300320863723755, - "step": 82, - "token_acc": 0.6683756510416666 - }, - { - "epoch": 0.20775969962453067, - "grad_norm": 2.470287799835205, - "learning_rate": 2.5937500000000004e-05, - "loss": 1.0792181491851807, - "step": 83, - "token_acc": 0.705793164445006 - }, - { - "epoch": 0.21026282853566958, - "grad_norm": 1.6145744323730469, - "learning_rate": 2.625e-05, - "loss": 1.1585354804992676, - "step": 84, - "token_acc": 0.6947993159641888 - }, - { - "epoch": 0.2127659574468085, - "grad_norm": 4.214087963104248, - "learning_rate": 2.6562500000000002e-05, - "loss": 1.0336159467697144, - "step": 85, - "token_acc": 0.7254294315565787 - }, - { - "epoch": 0.21526908635794745, - "grad_norm": 2.9351229667663574, - "learning_rate": 2.6875e-05, - "loss": 1.1614649295806885, - "step": 86, - "token_acc": 0.6926658905704307 - }, - { - "epoch": 0.21777221526908636, - "grad_norm": 8.310845375061035, - "learning_rate": 2.71875e-05, - "loss": 1.0881564617156982, - "step": 87, - "token_acc": 0.7154069767441861 - }, - { - "epoch": 0.2202753441802253, - "grad_norm": 1.372636318206787, - "learning_rate": 2.7500000000000004e-05, - "loss": 1.0820119380950928, - "step": 88, - "token_acc": 0.7062420210978969 - }, - { - "epoch": 0.2227784730913642, - "grad_norm": 0.9730624556541443, - "learning_rate": 2.7812500000000002e-05, - "loss": 1.1775951385498047, - "step": 89, - "token_acc": 0.6864290043528569 - }, - { - "epoch": 0.22528160200250313, - "grad_norm": 32.95426559448242, - "learning_rate": 2.8125000000000003e-05, - "loss": 0.9602251052856445, - "step": 90, - "token_acc": 0.7386105263157895 - }, - { - "epoch": 0.22778473091364204, - "grad_norm": 1.8376237154006958, - "learning_rate": 2.84375e-05, - "loss": 1.0506157875061035, - "step": 91, - "token_acc": 0.7134351911627573 - }, - { - "epoch": 0.23028785982478098, - "grad_norm": 3.1153717041015625, - "learning_rate": 2.8749999999999997e-05, - "loss": 1.1409003734588623, - "step": 92, - "token_acc": 0.6888570610140361 - }, - { - "epoch": 0.2327909887359199, - "grad_norm": 4.867130756378174, - "learning_rate": 2.9062500000000005e-05, - "loss": 0.9956814050674438, - "step": 93, - "token_acc": 0.7277626648873377 - }, - { - "epoch": 0.23529411764705882, - "grad_norm": 1.4865891933441162, - "learning_rate": 2.9375000000000003e-05, - "loss": 1.158729076385498, - "step": 94, - "token_acc": 0.688175432276657 - }, - { - "epoch": 0.23779724655819776, - "grad_norm": 4.895930290222168, - "learning_rate": 2.96875e-05, - "loss": 1.0074833631515503, - "step": 95, - "token_acc": 0.7172348866922198 - }, - { - "epoch": 0.24030037546933666, - "grad_norm": 11.321675300598145, - "learning_rate": 3e-05, - "loss": 0.9759230613708496, - "step": 96, - "token_acc": 0.7422142214221422 - }, - { - "epoch": 0.2428035043804756, - "grad_norm": 5.278805255889893, - "learning_rate": 3.0312499999999998e-05, - "loss": 1.1167738437652588, - "step": 97, - "token_acc": 0.6905687036382904 - }, - { - "epoch": 0.2453066332916145, - "grad_norm": 11.173495292663574, - "learning_rate": 3.0625000000000006e-05, - "loss": 1.1424094438552856, - "step": 98, - "token_acc": 0.691369290620047 - }, - { - "epoch": 0.24780976220275344, - "grad_norm": 2.3526344299316406, - "learning_rate": 3.09375e-05, - "loss": 1.041211485862732, - "step": 99, - "token_acc": 0.7146459747817653 - }, - { - "epoch": 0.2503128911138924, - "grad_norm": 2.7857418060302734, - "learning_rate": 3.125e-05, - "loss": 1.0442692041397095, - "step": 100, - "token_acc": 0.711717754376551 - }, - { - "epoch": 0.2528160200250313, - "grad_norm": 79.83805084228516, - "learning_rate": 3.15625e-05, - "loss": 1.1021206378936768, - "step": 101, - "token_acc": 0.7008632923368022 - }, - { - "epoch": 0.2553191489361702, - "grad_norm": 2.249223232269287, - "learning_rate": 3.1875e-05, - "loss": 1.0893476009368896, - "step": 102, - "token_acc": 0.7009559556624245 - }, - { - "epoch": 0.25782227784730916, - "grad_norm": 3.4049673080444336, - "learning_rate": 3.21875e-05, - "loss": 1.0653949975967407, - "step": 103, - "token_acc": 0.7043142117355312 - }, - { - "epoch": 0.26032540675844806, - "grad_norm": 2.0676321983337402, - "learning_rate": 3.2500000000000004e-05, - "loss": 0.9971442818641663, - "step": 104, - "token_acc": 0.7209080223332354 - }, - { - "epoch": 0.26282853566958697, - "grad_norm": 3.04028058052063, - "learning_rate": 3.2812500000000005e-05, - "loss": 1.0553109645843506, - "step": 105, - "token_acc": 0.7107347245505521 - }, - { - "epoch": 0.26533166458072593, - "grad_norm": 3.4072177410125732, - "learning_rate": 3.3125e-05, - "loss": 1.1222078800201416, - "step": 106, - "token_acc": 0.6884954048982341 - }, - { - "epoch": 0.26783479349186484, - "grad_norm": 4.250513553619385, - "learning_rate": 3.34375e-05, - "loss": 1.0399558544158936, - "step": 107, - "token_acc": 0.715698983420891 - }, - { - "epoch": 0.27033792240300375, - "grad_norm": 1.5310983657836914, - "learning_rate": 3.375000000000001e-05, - "loss": 0.97971510887146, - "step": 108, - "token_acc": 0.7238202367561197 - }, - { - "epoch": 0.27284105131414266, - "grad_norm": 1.164379358291626, - "learning_rate": 3.40625e-05, - "loss": 1.0755829811096191, - "step": 109, - "token_acc": 0.6932410856838744 - }, - { - "epoch": 0.2753441802252816, - "grad_norm": 5.060781002044678, - "learning_rate": 3.4375e-05, - "loss": 1.0854302644729614, - "step": 110, - "token_acc": 0.7054753144049646 - }, - { - "epoch": 0.27784730913642053, - "grad_norm": 3.0165348052978516, - "learning_rate": 3.46875e-05, - "loss": 0.9611892700195312, - "step": 111, - "token_acc": 0.7338753387533875 - }, - { - "epoch": 0.28035043804755944, - "grad_norm": 5.620553970336914, - "learning_rate": 3.5e-05, - "loss": 0.9679099321365356, - "step": 112, - "token_acc": 0.7282849285666376 - }, - { - "epoch": 0.2828535669586984, - "grad_norm": 3.3517661094665527, - "learning_rate": 3.5312500000000005e-05, - "loss": 1.0258841514587402, - "step": 113, - "token_acc": 0.7185277850934949 - }, - { - "epoch": 0.2853566958698373, - "grad_norm": 4.1862382888793945, - "learning_rate": 3.5625000000000005e-05, - "loss": 1.0116548538208008, - "step": 114, - "token_acc": 0.7171322653250364 - }, - { - "epoch": 0.2878598247809762, - "grad_norm": 4.775069713592529, - "learning_rate": 3.59375e-05, - "loss": 0.9625561833381653, - "step": 115, - "token_acc": 0.7378043781257686 - }, - { - "epoch": 0.2903629536921151, - "grad_norm": 2.4339494705200195, - "learning_rate": 3.625e-05, - "loss": 1.0401370525360107, - "step": 116, - "token_acc": 0.710567296996663 - }, - { - "epoch": 0.2928660826032541, - "grad_norm": 2.8357059955596924, - "learning_rate": 3.65625e-05, - "loss": 0.8899033069610596, - "step": 117, - "token_acc": 0.760463490160823 - }, - { - "epoch": 0.295369211514393, - "grad_norm": 3.8368427753448486, - "learning_rate": 3.6875e-05, - "loss": 1.0864536762237549, - "step": 118, - "token_acc": 0.7004258071470921 - }, - { - "epoch": 0.2978723404255319, - "grad_norm": 2.6409614086151123, - "learning_rate": 3.71875e-05, - "loss": 1.0734574794769287, - "step": 119, - "token_acc": 0.7024148661086033 - }, - { - "epoch": 0.30037546933667086, - "grad_norm": 2.4843125343322754, - "learning_rate": 3.7500000000000003e-05, - "loss": 0.9885290861129761, - "step": 120, - "token_acc": 0.7214841692514777 - }, - { - "epoch": 0.30287859824780977, - "grad_norm": 3.219529628753662, - "learning_rate": 3.78125e-05, - "loss": 1.0155832767486572, - "step": 121, - "token_acc": 0.7182897862232779 - }, - { - "epoch": 0.3053817271589487, - "grad_norm": 4.397768020629883, - "learning_rate": 3.8125e-05, - "loss": 0.9772403836250305, - "step": 122, - "token_acc": 0.7289815989847716 - }, - { - "epoch": 0.3078848560700876, - "grad_norm": 7.476251125335693, - "learning_rate": 3.8437500000000006e-05, - "loss": 1.0845521688461304, - "step": 123, - "token_acc": 0.700028537649313 - }, - { - "epoch": 0.31038798498122655, - "grad_norm": 2.454371929168701, - "learning_rate": 3.875e-05, - "loss": 1.0315274000167847, - "step": 124, - "token_acc": 0.714497250035256 - }, - { - "epoch": 0.31289111389236546, - "grad_norm": 2.123765230178833, - "learning_rate": 3.90625e-05, - "loss": 0.9268566370010376, - "step": 125, - "token_acc": 0.7407587548638133 - }, - { - "epoch": 0.31539424280350437, - "grad_norm": 4.286694526672363, - "learning_rate": 3.9375e-05, - "loss": 0.9085225462913513, - "step": 126, - "token_acc": 0.7448712536935416 - }, - { - "epoch": 0.31789737171464333, - "grad_norm": 2.3730971813201904, - "learning_rate": 3.96875e-05, - "loss": 0.8727496266365051, - "step": 127, - "token_acc": 0.7622018348623854 - }, - { - "epoch": 0.32040050062578224, - "grad_norm": 2.70272159576416, - "learning_rate": 4e-05, - "loss": 1.0061339139938354, - "step": 128, - "token_acc": 0.7129116291496894 - }, - { - "epoch": 0.32290362953692114, - "grad_norm": 2.363917112350464, - "learning_rate": 4.0312500000000004e-05, - "loss": 1.0005316734313965, - "step": 129, - "token_acc": 0.7205369127516779 - }, - { - "epoch": 0.32540675844806005, - "grad_norm": 5.393451690673828, - "learning_rate": 4.0625000000000005e-05, - "loss": 0.9804684519767761, - "step": 130, - "token_acc": 0.7264981866328939 - }, - { - "epoch": 0.327909887359199, - "grad_norm": 4.67309045791626, - "learning_rate": 4.09375e-05, - "loss": 0.877933144569397, - "step": 131, - "token_acc": 0.76021068992315 - }, - { - "epoch": 0.3304130162703379, - "grad_norm": 2.624901533126831, - "learning_rate": 4.125e-05, - "loss": 0.9735865592956543, - "step": 132, - "token_acc": 0.7238545946227053 - }, - { - "epoch": 0.33291614518147683, - "grad_norm": 2.829728126525879, - "learning_rate": 4.156250000000001e-05, - "loss": 1.0161550045013428, - "step": 133, - "token_acc": 0.7142064135957983 - }, - { - "epoch": 0.3354192740926158, - "grad_norm": 2.408121109008789, - "learning_rate": 4.1875e-05, - "loss": 0.9492026567459106, - "step": 134, - "token_acc": 0.736371949075051 - }, - { - "epoch": 0.3379224030037547, - "grad_norm": 2.7580509185791016, - "learning_rate": 4.21875e-05, - "loss": 0.8693875670433044, - "step": 135, - "token_acc": 0.7559972583961617 - }, - { - "epoch": 0.3404255319148936, - "grad_norm": 2.2704222202301025, - "learning_rate": 4.25e-05, - "loss": 0.9372125864028931, - "step": 136, - "token_acc": 0.7337290802460306 - }, - { - "epoch": 0.3429286608260325, - "grad_norm": 4.360070705413818, - "learning_rate": 4.28125e-05, - "loss": 1.0078935623168945, - "step": 137, - "token_acc": 0.7146907768029104 - }, - { - "epoch": 0.3454317897371715, - "grad_norm": 13.713053703308105, - "learning_rate": 4.3125000000000005e-05, - "loss": 0.8341250419616699, - "step": 138, - "token_acc": 0.7732564024698856 - }, - { - "epoch": 0.3479349186483104, - "grad_norm": 4.248615264892578, - "learning_rate": 4.3437500000000006e-05, - "loss": 0.9521622657775879, - "step": 139, - "token_acc": 0.7330997794213053 - }, - { - "epoch": 0.3504380475594493, - "grad_norm": 4.988142013549805, - "learning_rate": 4.375e-05, - "loss": 0.893964409828186, - "step": 140, - "token_acc": 0.7476815787521329 - }, - { - "epoch": 0.35294117647058826, - "grad_norm": 3.864096164703369, - "learning_rate": 4.40625e-05, - "loss": 0.8878812789916992, - "step": 141, - "token_acc": 0.7459516298633018 - }, - { - "epoch": 0.35544430538172717, - "grad_norm": 4.250646591186523, - "learning_rate": 4.4375e-05, - "loss": 1.029758334159851, - "step": 142, - "token_acc": 0.7136325267304445 - }, - { - "epoch": 0.3579474342928661, - "grad_norm": 4.437873363494873, - "learning_rate": 4.46875e-05, - "loss": 0.8827238082885742, - "step": 143, - "token_acc": 0.7566478021552059 - }, - { - "epoch": 0.360450563204005, - "grad_norm": 2.903998613357544, - "learning_rate": 4.5e-05, - "loss": 0.9520173072814941, - "step": 144, - "token_acc": 0.731939568039153 - }, - { - "epoch": 0.36295369211514394, - "grad_norm": 4.129173755645752, - "learning_rate": 4.5312500000000004e-05, - "loss": 0.9319078922271729, - "step": 145, - "token_acc": 0.7331720330045288 - }, - { - "epoch": 0.36545682102628285, - "grad_norm": 6.249156951904297, - "learning_rate": 4.5625e-05, - "loss": 0.9192413091659546, - "step": 146, - "token_acc": 0.7346352365242378 - }, - { - "epoch": 0.36795994993742176, - "grad_norm": 2.8188090324401855, - "learning_rate": 4.59375e-05, - "loss": 0.8454147577285767, - "step": 147, - "token_acc": 0.7561653860226857 - }, - { - "epoch": 0.3704630788485607, - "grad_norm": 20.902667999267578, - "learning_rate": 4.6250000000000006e-05, - "loss": 0.9139873385429382, - "step": 148, - "token_acc": 0.7434644957033016 - }, - { - "epoch": 0.37296620775969963, - "grad_norm": 3.022164821624756, - "learning_rate": 4.65625e-05, - "loss": 1.0368843078613281, - "step": 149, - "token_acc": 0.7042305221620629 - }, - { - "epoch": 0.37546933667083854, - "grad_norm": 2.9987237453460693, - "learning_rate": 4.6875e-05, - "loss": 0.9745063185691833, - "step": 150, - "token_acc": 0.7196575970651177 - }, - { - "epoch": 0.37797246558197745, - "grad_norm": 2.3661983013153076, - "learning_rate": 4.71875e-05, - "loss": 1.0234860181808472, - "step": 151, - "token_acc": 0.7121767059221277 - }, - { - "epoch": 0.3804755944931164, - "grad_norm": 2.627258777618408, - "learning_rate": 4.75e-05, - "loss": 0.8604807257652283, - "step": 152, - "token_acc": 0.7513602865211103 - }, - { - "epoch": 0.3829787234042553, - "grad_norm": 2.5150792598724365, - "learning_rate": 4.7812500000000003e-05, - "loss": 1.01763916015625, - "step": 153, - "token_acc": 0.7111102210829863 - }, - { - "epoch": 0.3854818523153942, - "grad_norm": 55.79320526123047, - "learning_rate": 4.8125000000000004e-05, - "loss": 0.8841659426689148, - "step": 154, - "token_acc": 0.7480198788631776 - }, - { - "epoch": 0.3879849812265332, - "grad_norm": 3.121655225753784, - "learning_rate": 4.8437500000000005e-05, - "loss": 0.9884188175201416, - "step": 155, - "token_acc": 0.7213071620270484 - }, - { - "epoch": 0.3904881101376721, - "grad_norm": 2.309528112411499, - "learning_rate": 4.875e-05, - "loss": 0.8871731758117676, - "step": 156, - "token_acc": 0.7475174151474729 - }, - { - "epoch": 0.392991239048811, - "grad_norm": 1.564784049987793, - "learning_rate": 4.90625e-05, - "loss": 0.9550650119781494, - "step": 157, - "token_acc": 0.7262110500130924 - }, - { - "epoch": 0.3954943679599499, - "grad_norm": 4.770287036895752, - "learning_rate": 4.937500000000001e-05, - "loss": 0.8485426902770996, - "step": 158, - "token_acc": 0.755221214619401 - }, - { - "epoch": 0.3979974968710889, - "grad_norm": 2.7487730979919434, - "learning_rate": 4.96875e-05, - "loss": 0.8821752667427063, - "step": 159, - "token_acc": 0.7515657620041754 - }, - { - "epoch": 0.4005006257822278, - "grad_norm": 1.9737449884414673, - "learning_rate": 5e-05, - "loss": 0.9395763874053955, - "step": 160, - "token_acc": 0.7279748441551277 - }, - { - "epoch": 0.4030037546933667, - "grad_norm": 4.472081184387207, - "learning_rate": 4.9999698804181425e-05, - "loss": 0.8686919808387756, - "step": 161, - "token_acc": 0.7603603603603604 - }, - { - "epoch": 0.40550688360450565, - "grad_norm": 3.6379482746124268, - "learning_rate": 4.9998795223983205e-05, - "loss": 0.8725775480270386, - "step": 162, - "token_acc": 0.7472160356347439 - }, - { - "epoch": 0.40801001251564456, - "grad_norm": 3.493037700653076, - "learning_rate": 4.99972892811777e-05, - "loss": 0.847150981426239, - "step": 163, - "token_acc": 0.7538943188759927 - }, - { - "epoch": 0.41051314142678347, - "grad_norm": 1.912611722946167, - "learning_rate": 4.9995181012051625e-05, - "loss": 0.9739137887954712, - "step": 164, - "token_acc": 0.7212982399483288 - }, - { - "epoch": 0.4130162703379224, - "grad_norm": 11.750629425048828, - "learning_rate": 4.9992470467405104e-05, - "loss": 0.926494300365448, - "step": 165, - "token_acc": 0.7324805645917186 - }, - { - "epoch": 0.41551939924906134, - "grad_norm": 1.79902982711792, - "learning_rate": 4.998915771255053e-05, - "loss": 0.9524897336959839, - "step": 166, - "token_acc": 0.7259630302761647 - }, - { - "epoch": 0.41802252816020025, - "grad_norm": 1.653032660484314, - "learning_rate": 4.9985242827310936e-05, - "loss": 0.8616597652435303, - "step": 167, - "token_acc": 0.7509121709669012 - }, - { - "epoch": 0.42052565707133915, - "grad_norm": 3.853633165359497, - "learning_rate": 4.9980725906018074e-05, - "loss": 0.9457658529281616, - "step": 168, - "token_acc": 0.7262784810126582 - }, - { - "epoch": 0.4230287859824781, - "grad_norm": 2.9848127365112305, - "learning_rate": 4.9975607057510185e-05, - "loss": 0.7890052795410156, - "step": 169, - "token_acc": 0.7754066818261326 - }, - { - "epoch": 0.425531914893617, - "grad_norm": 5.078474521636963, - "learning_rate": 4.996988640512931e-05, - "loss": 0.8364709615707397, - "step": 170, - "token_acc": 0.764642082429501 - }, - { - "epoch": 0.42803504380475593, - "grad_norm": 2.06341814994812, - "learning_rate": 4.99635640867184e-05, - "loss": 0.8439483642578125, - "step": 171, - "token_acc": 0.7607762475406904 - }, - { - "epoch": 0.4305381727158949, - "grad_norm": 2.261368989944458, - "learning_rate": 4.9956640254617906e-05, - "loss": 0.8153511881828308, - "step": 172, - "token_acc": 0.7593304295840806 - }, - { - "epoch": 0.4330413016270338, - "grad_norm": 2.942291736602783, - "learning_rate": 4.994911507566217e-05, - "loss": 0.950925886631012, - "step": 173, - "token_acc": 0.7278411003703169 - }, - { - "epoch": 0.4355444305381727, - "grad_norm": 1.5425530672073364, - "learning_rate": 4.99409887311754e-05, - "loss": 0.9062566161155701, - "step": 174, - "token_acc": 0.7486025191920698 - }, - { - "epoch": 0.4380475594493116, - "grad_norm": 2.6939258575439453, - "learning_rate": 4.993226141696726e-05, - "loss": 0.8227016925811768, - "step": 175, - "token_acc": 0.7661045274992404 - }, - { - "epoch": 0.4405506883604506, - "grad_norm": 5.915945529937744, - "learning_rate": 4.99229333433282e-05, - "loss": 0.9167571067810059, - "step": 176, - "token_acc": 0.7367290406467296 - }, - { - "epoch": 0.4430538172715895, - "grad_norm": 1.6880910396575928, - "learning_rate": 4.991300473502437e-05, - "loss": 0.8607068657875061, - "step": 177, - "token_acc": 0.7547773184618984 - }, - { - "epoch": 0.4455569461827284, - "grad_norm": 1.5918737649917603, - "learning_rate": 4.9902475831292185e-05, - "loss": 1.0075507164001465, - "step": 178, - "token_acc": 0.7130909563634787 - }, - { - "epoch": 0.44806007509386736, - "grad_norm": 5.924171447753906, - "learning_rate": 4.9891346885832586e-05, - "loss": 0.8469476103782654, - "step": 179, - "token_acc": 0.7637781477262771 - }, - { - "epoch": 0.45056320400500627, - "grad_norm": 1.8689627647399902, - "learning_rate": 4.987961816680492e-05, - "loss": 0.9136925935745239, - "step": 180, - "token_acc": 0.7422716834481541 - }, - { - "epoch": 0.4530663329161452, - "grad_norm": 3.0246078968048096, - "learning_rate": 4.986728995682049e-05, - "loss": 0.809701681137085, - "step": 181, - "token_acc": 0.7672480620155039 - }, - { - "epoch": 0.4555694618272841, - "grad_norm": 1.0998661518096924, - "learning_rate": 4.9854362552935706e-05, - "loss": 0.9456962943077087, - "step": 182, - "token_acc": 0.7302064153503246 - }, - { - "epoch": 0.45807259073842305, - "grad_norm": 1.7873152494430542, - "learning_rate": 4.984083626664497e-05, - "loss": 0.9543384909629822, - "step": 183, - "token_acc": 0.7306896908282494 - }, - { - "epoch": 0.46057571964956195, - "grad_norm": 1.8325738906860352, - "learning_rate": 4.982671142387316e-05, - "loss": 0.9392420649528503, - "step": 184, - "token_acc": 0.73054827887311 - }, - { - "epoch": 0.46307884856070086, - "grad_norm": 2.0283353328704834, - "learning_rate": 4.981198836496775e-05, - "loss": 0.8523749709129333, - "step": 185, - "token_acc": 0.7518976665729548 - }, - { - "epoch": 0.4655819774718398, - "grad_norm": 1.8880774974822998, - "learning_rate": 4.979666744469065e-05, - "loss": 1.0026400089263916, - "step": 186, - "token_acc": 0.7179426739581369 - }, - { - "epoch": 0.46808510638297873, - "grad_norm": 1.5821034908294678, - "learning_rate": 4.978074903220963e-05, - "loss": 0.8702259659767151, - "step": 187, - "token_acc": 0.7518054532056005 - }, - { - "epoch": 0.47058823529411764, - "grad_norm": 1.3895519971847534, - "learning_rate": 4.976423351108943e-05, - "loss": 0.9819506406784058, - "step": 188, - "token_acc": 0.7262579281183932 - }, - { - "epoch": 0.47309136420525655, - "grad_norm": 2.175621509552002, - "learning_rate": 4.9747121279282525e-05, - "loss": 0.8391700983047485, - "step": 189, - "token_acc": 0.7537929574483099 - }, - { - "epoch": 0.4755944931163955, - "grad_norm": 1.7478188276290894, - "learning_rate": 4.972941274911953e-05, - "loss": 0.8495551347732544, - "step": 190, - "token_acc": 0.7538736959071548 - }, - { - "epoch": 0.4780976220275344, - "grad_norm": 2.7944796085357666, - "learning_rate": 4.971110834729925e-05, - "loss": 0.8685894012451172, - "step": 191, - "token_acc": 0.7504071889918562 - }, - { - "epoch": 0.4806007509386733, - "grad_norm": 11.889168739318848, - "learning_rate": 4.9692208514878444e-05, - "loss": 0.8083388209342957, - "step": 192, - "token_acc": 0.7642701875855407 - }, - { - "epoch": 0.4831038798498123, - "grad_norm": 13.814888954162598, - "learning_rate": 4.9672713707261146e-05, - "loss": 0.8238387703895569, - "step": 193, - "token_acc": 0.7610306169278175 - }, - { - "epoch": 0.4856070087609512, - "grad_norm": 1.4705616235733032, - "learning_rate": 4.965262439418772e-05, - "loss": 0.9381322860717773, - "step": 194, - "token_acc": 0.7296181077022098 - }, - { - "epoch": 0.4881101376720901, - "grad_norm": 2.106172800064087, - "learning_rate": 4.963194105972353e-05, - "loss": 0.781527042388916, - "step": 195, - "token_acc": 0.7668615663345137 - }, - { - "epoch": 0.490613266583229, - "grad_norm": 1.4520384073257446, - "learning_rate": 4.9610664202247294e-05, - "loss": 0.8901837468147278, - "step": 196, - "token_acc": 0.7357566856373539 - }, - { - "epoch": 0.493116395494368, - "grad_norm": 92.66796112060547, - "learning_rate": 4.958879433443904e-05, - "loss": 0.8004983067512512, - "step": 197, - "token_acc": 0.7666008205439903 - }, - { - "epoch": 0.4956195244055069, - "grad_norm": 3.9278409481048584, - "learning_rate": 4.95663319832678e-05, - "loss": 0.9934076070785522, - "step": 198, - "token_acc": 0.7185084923372484 - }, - { - "epoch": 0.4981226533166458, - "grad_norm": 1.615594506263733, - "learning_rate": 4.954327768997886e-05, - "loss": 0.8867624998092651, - "step": 199, - "token_acc": 0.7388085147839641 - }, - { - "epoch": 0.5006257822277848, - "grad_norm": 2.8862221240997314, - "learning_rate": 4.951963201008076e-05, - "loss": 0.8318412899971008, - "step": 200, - "token_acc": 0.7566619330047615 - }, - { - "epoch": 0.5031289111389237, - "grad_norm": 1.856955885887146, - "learning_rate": 4.949539551333191e-05, - "loss": 0.8780606389045715, - "step": 201, - "token_acc": 0.7452740722007967 - }, - { - "epoch": 0.5056320400500626, - "grad_norm": 1.9028009176254272, - "learning_rate": 4.947056878372681e-05, - "loss": 0.7615805864334106, - "step": 202, - "token_acc": 0.7806040051679587 - }, - { - "epoch": 0.5081351689612015, - "grad_norm": 1.9965895414352417, - "learning_rate": 4.944515241948204e-05, - "loss": 0.8922481536865234, - "step": 203, - "token_acc": 0.7439118174826967 - }, - { - "epoch": 0.5106382978723404, - "grad_norm": 2.4679484367370605, - "learning_rate": 4.9419147033021814e-05, - "loss": 0.9746915102005005, - "step": 204, - "token_acc": 0.7225560081466396 - }, - { - "epoch": 0.5131414267834794, - "grad_norm": 2.7257940769195557, - "learning_rate": 4.9392553250963215e-05, - "loss": 0.802959144115448, - "step": 205, - "token_acc": 0.7686112156567557 - }, - { - "epoch": 0.5156445556946183, - "grad_norm": 3.264042377471924, - "learning_rate": 4.936537171410113e-05, - "loss": 0.9509553909301758, - "step": 206, - "token_acc": 0.7261368386827071 - }, - { - "epoch": 0.5181476846057572, - "grad_norm": 3.4267592430114746, - "learning_rate": 4.933760307739277e-05, - "loss": 0.8793500661849976, - "step": 207, - "token_acc": 0.7480100363384669 - }, - { - "epoch": 0.5206508135168961, - "grad_norm": 4.144317626953125, - "learning_rate": 4.9309248009941914e-05, - "loss": 0.7871251106262207, - "step": 208, - "token_acc": 0.7663051337671728 - }, - { - "epoch": 0.523153942428035, - "grad_norm": 11.039412498474121, - "learning_rate": 4.92803071949828e-05, - "loss": 0.9288915395736694, - "step": 209, - "token_acc": 0.7273755047106326 - }, - { - "epoch": 0.5256570713391739, - "grad_norm": 1.3589577674865723, - "learning_rate": 4.9250781329863606e-05, - "loss": 0.9469587802886963, - "step": 210, - "token_acc": 0.7330181502010651 - }, - { - "epoch": 0.5281602002503129, - "grad_norm": 24.967679977416992, - "learning_rate": 4.92206711260297e-05, - "loss": 0.922472357749939, - "step": 211, - "token_acc": 0.7295061829497994 - }, - { - "epoch": 0.5306633291614519, - "grad_norm": 5.612998008728027, - "learning_rate": 4.9189977309006495e-05, - "loss": 0.9386663436889648, - "step": 212, - "token_acc": 0.729034504100263 - }, - { - "epoch": 0.5331664580725908, - "grad_norm": 2.4214696884155273, - "learning_rate": 4.915870061838193e-05, - "loss": 0.8876584768295288, - "step": 213, - "token_acc": 0.7409878277153558 - }, - { - "epoch": 0.5356695869837297, - "grad_norm": 2.5469002723693848, - "learning_rate": 4.912684180778869e-05, - "loss": 0.8577581644058228, - "step": 214, - "token_acc": 0.7466870540265036 - }, - { - "epoch": 0.5381727158948686, - "grad_norm": 1.8884869813919067, - "learning_rate": 4.9094401644886e-05, - "loss": 0.9847173690795898, - "step": 215, - "token_acc": 0.7160602660682802 - }, - { - "epoch": 0.5406758448060075, - "grad_norm": 1.4721566438674927, - "learning_rate": 4.906138091134118e-05, - "loss": 0.9311186671257019, - "step": 216, - "token_acc": 0.7331803944059646 - }, - { - "epoch": 0.5431789737171464, - "grad_norm": 3.0583348274230957, - "learning_rate": 4.90277804028108e-05, - "loss": 0.7272347807884216, - "step": 217, - "token_acc": 0.7930695985079023 - }, - { - "epoch": 0.5456821026282853, - "grad_norm": 2.5264322757720947, - "learning_rate": 4.8993600928921434e-05, - "loss": 0.861505389213562, - "step": 218, - "token_acc": 0.7481168230474429 - }, - { - "epoch": 0.5481852315394243, - "grad_norm": 1.6603262424468994, - "learning_rate": 4.8958843313250294e-05, - "loss": 0.7447217106819153, - "step": 219, - "token_acc": 0.7862431800467654 - }, - { - "epoch": 0.5506883604505632, - "grad_norm": 1.4868695735931396, - "learning_rate": 4.892350839330522e-05, - "loss": 0.8898584842681885, - "step": 220, - "token_acc": 0.740379366812227 - }, - { - "epoch": 0.5531914893617021, - "grad_norm": 2.699589729309082, - "learning_rate": 4.888759702050466e-05, - "loss": 0.8423305749893188, - "step": 221, - "token_acc": 0.7540192926045016 - }, - { - "epoch": 0.5556946182728411, - "grad_norm": 2.180371046066284, - "learning_rate": 4.885111006015701e-05, - "loss": 0.8793195486068726, - "step": 222, - "token_acc": 0.7477990405398282 - }, - { - "epoch": 0.55819774718398, - "grad_norm": 2.203009605407715, - "learning_rate": 4.881404839143988e-05, - "loss": 0.8497090935707092, - "step": 223, - "token_acc": 0.7462110960757781 - }, - { - "epoch": 0.5607008760951189, - "grad_norm": 1.6231415271759033, - "learning_rate": 4.877641290737884e-05, - "loss": 0.8052700757980347, - "step": 224, - "token_acc": 0.7610808422912678 - }, - { - "epoch": 0.5632040050062578, - "grad_norm": 2.361985445022583, - "learning_rate": 4.873820451482592e-05, - "loss": 0.8841230869293213, - "step": 225, - "token_acc": 0.7496264419341342 - }, - { - "epoch": 0.5657071339173968, - "grad_norm": 3.28450870513916, - "learning_rate": 4.8699424134437765e-05, - "loss": 0.8853447437286377, - "step": 226, - "token_acc": 0.742984257357974 - }, - { - "epoch": 0.5682102628285357, - "grad_norm": 1.5169377326965332, - "learning_rate": 4.8660072700653445e-05, - "loss": 0.8390404582023621, - "step": 227, - "token_acc": 0.7602164582944579 - }, - { - "epoch": 0.5707133917396746, - "grad_norm": 1.017259120941162, - "learning_rate": 4.862015116167196e-05, - "loss": 0.8904134035110474, - "step": 228, - "token_acc": 0.7438553022794846 - }, - { - "epoch": 0.5732165206508135, - "grad_norm": 2.0630033016204834, - "learning_rate": 4.857966047942933e-05, - "loss": 0.8353220820426941, - "step": 229, - "token_acc": 0.7571183288024038 - }, - { - "epoch": 0.5757196495619524, - "grad_norm": 1.721699833869934, - "learning_rate": 4.853860162957552e-05, - "loss": 0.8920808434486389, - "step": 230, - "token_acc": 0.7390824422214557 - }, - { - "epoch": 0.5782227784730913, - "grad_norm": 2.038731575012207, - "learning_rate": 4.849697560145083e-05, - "loss": 0.6845712065696716, - "step": 231, - "token_acc": 0.8008808955771701 - }, - { - "epoch": 0.5807259073842302, - "grad_norm": 2.1230990886688232, - "learning_rate": 4.8454783398062106e-05, - "loss": 0.8267085552215576, - "step": 232, - "token_acc": 0.7581519720716037 - }, - { - "epoch": 0.5832290362953693, - "grad_norm": 3.591655969619751, - "learning_rate": 4.8412026036058566e-05, - "loss": 0.8310796022415161, - "step": 233, - "token_acc": 0.7544153744836257 - }, - { - "epoch": 0.5857321652065082, - "grad_norm": 36.25672149658203, - "learning_rate": 4.836870454570731e-05, - "loss": 0.8032848238945007, - "step": 234, - "token_acc": 0.7607001230685081 - }, - { - "epoch": 0.5882352941176471, - "grad_norm": 1.4401963949203491, - "learning_rate": 4.8324819970868473e-05, - "loss": 0.8128241896629333, - "step": 235, - "token_acc": 0.757310740639519 - }, - { - "epoch": 0.590738423028786, - "grad_norm": 10.958834648132324, - "learning_rate": 4.828037336897009e-05, - "loss": 0.8540234565734863, - "step": 236, - "token_acc": 0.74524380963531 - }, - { - "epoch": 0.5932415519399249, - "grad_norm": 3.50199556350708, - "learning_rate": 4.8235365810982615e-05, - "loss": 0.9761826992034912, - "step": 237, - "token_acc": 0.7167197154090994 - }, - { - "epoch": 0.5957446808510638, - "grad_norm": 3.497457504272461, - "learning_rate": 4.8189798381393104e-05, - "loss": 0.7976563572883606, - "step": 238, - "token_acc": 0.7626602564102564 - }, - { - "epoch": 0.5982478097622027, - "grad_norm": 3.2434616088867188, - "learning_rate": 4.81436721781791e-05, - "loss": 0.8806981444358826, - "step": 239, - "token_acc": 0.7481954469739034 - }, - { - "epoch": 0.6007509386733417, - "grad_norm": 3.4984254837036133, - "learning_rate": 4.8096988312782174e-05, - "loss": 0.8493468761444092, - "step": 240, - "token_acc": 0.7490117506904207 - }, - { - "epoch": 0.6032540675844806, - "grad_norm": 1.4711133241653442, - "learning_rate": 4.8049747910081117e-05, - "loss": 0.6916333436965942, - "step": 241, - "token_acc": 0.794162491831845 - }, - { - "epoch": 0.6057571964956195, - "grad_norm": 1.8549391031265259, - "learning_rate": 4.8001952108364876e-05, - "loss": 0.9032708406448364, - "step": 242, - "token_acc": 0.7342644900137895 - }, - { - "epoch": 0.6082603254067585, - "grad_norm": 1.721065878868103, - "learning_rate": 4.79536020593051e-05, - "loss": 0.9230173826217651, - "step": 243, - "token_acc": 0.7311291328758578 - }, - { - "epoch": 0.6107634543178974, - "grad_norm": 2.2300896644592285, - "learning_rate": 4.7904698927928406e-05, - "loss": 0.8387856483459473, - "step": 244, - "token_acc": 0.7520661157024794 - }, - { - "epoch": 0.6132665832290363, - "grad_norm": 1.5376681089401245, - "learning_rate": 4.785524389258827e-05, - "loss": 0.9396567344665527, - "step": 245, - "token_acc": 0.7290214555507963 - }, - { - "epoch": 0.6157697121401752, - "grad_norm": 3.0389626026153564, - "learning_rate": 4.7805238144936694e-05, - "loss": 0.8885030150413513, - "step": 246, - "token_acc": 0.7354931107709023 - }, - { - "epoch": 0.6182728410513142, - "grad_norm": 4.214961051940918, - "learning_rate": 4.7754682889895446e-05, - "loss": 0.7742225527763367, - "step": 247, - "token_acc": 0.7741118966570656 - }, - { - "epoch": 0.6207759699624531, - "grad_norm": 1.702107310295105, - "learning_rate": 4.7703579345627035e-05, - "loss": 0.8894025683403015, - "step": 248, - "token_acc": 0.7381677396902732 - }, - { - "epoch": 0.623279098873592, - "grad_norm": 1.6989673376083374, - "learning_rate": 4.765192874350537e-05, - "loss": 0.9064431190490723, - "step": 249, - "token_acc": 0.7365355965870616 - }, - { - "epoch": 0.6257822277847309, - "grad_norm": 1.8439379930496216, - "learning_rate": 4.759973232808609e-05, - "loss": 0.744268536567688, - "step": 250, - "token_acc": 0.7793768780642101 - }, - { - "epoch": 0.6282853566958698, - "grad_norm": 4.3568434715271, - "learning_rate": 4.7546991357076544e-05, - "loss": 0.8421927690505981, - "step": 251, - "token_acc": 0.7551911730901847 - }, - { - "epoch": 0.6307884856070087, - "grad_norm": 1.580527663230896, - "learning_rate": 4.749370710130554e-05, - "loss": 0.8805860280990601, - "step": 252, - "token_acc": 0.7404246461282264 - }, - { - "epoch": 0.6332916145181476, - "grad_norm": 5.8950724601745605, - "learning_rate": 4.7439880844692675e-05, - "loss": 0.8358674049377441, - "step": 253, - "token_acc": 0.753058660141525 - }, - { - "epoch": 0.6357947434292867, - "grad_norm": 2.4937312602996826, - "learning_rate": 4.738551388421743e-05, - "loss": 0.7486670017242432, - "step": 254, - "token_acc": 0.7726565697912403 - }, - { - "epoch": 0.6382978723404256, - "grad_norm": 2.2410449981689453, - "learning_rate": 4.7330607529887884e-05, - "loss": 0.7166397571563721, - "step": 255, - "token_acc": 0.787853730246233 - }, - { - "epoch": 0.6408010012515645, - "grad_norm": 0.9600523114204407, - "learning_rate": 4.72751631047092e-05, - "loss": 0.817680835723877, - "step": 256, - "token_acc": 0.7578717967986773 - }, - { - "epoch": 0.6433041301627034, - "grad_norm": 1.6403498649597168, - "learning_rate": 4.721918194465169e-05, - "loss": 0.7929844260215759, - "step": 257, - "token_acc": 0.7647058823529411 - }, - { - "epoch": 0.6458072590738423, - "grad_norm": 2.6843879222869873, - "learning_rate": 4.7162665398618664e-05, - "loss": 0.7781978249549866, - "step": 258, - "token_acc": 0.7685840012572686 - }, - { - "epoch": 0.6483103879849812, - "grad_norm": 1.1330469846725464, - "learning_rate": 4.7105614828413906e-05, - "loss": 0.828113317489624, - "step": 259, - "token_acc": 0.7519813233396817 - }, - { - "epoch": 0.6508135168961201, - "grad_norm": 1.6353662014007568, - "learning_rate": 4.7048031608708876e-05, - "loss": 0.8706427812576294, - "step": 260, - "token_acc": 0.7472778599274096 - }, - { - "epoch": 0.6533166458072591, - "grad_norm": 1.700364112854004, - "learning_rate": 4.698991712700958e-05, - "loss": 0.9167036414146423, - "step": 261, - "token_acc": 0.7337103615431226 - }, - { - "epoch": 0.655819774718398, - "grad_norm": 4.744112968444824, - "learning_rate": 4.693127278362311e-05, - "loss": 0.7307888269424438, - "step": 262, - "token_acc": 0.7857924493890206 - }, - { - "epoch": 0.6583229036295369, - "grad_norm": 2.0567502975463867, - "learning_rate": 4.687209999162396e-05, - "loss": 0.9097830057144165, - "step": 263, - "token_acc": 0.7335190343546889 - }, - { - "epoch": 0.6608260325406758, - "grad_norm": 1.584566593170166, - "learning_rate": 4.681240017681993e-05, - "loss": 0.9686288833618164, - "step": 264, - "token_acc": 0.7200644430897849 - }, - { - "epoch": 0.6633291614518148, - "grad_norm": 3.126399278640747, - "learning_rate": 4.6752174777717786e-05, - "loss": 0.8048110604286194, - "step": 265, - "token_acc": 0.7667047401484866 - }, - { - "epoch": 0.6658322903629537, - "grad_norm": 3.089082717895508, - "learning_rate": 4.6691425245488607e-05, - "loss": 0.8348573446273804, - "step": 266, - "token_acc": 0.7527571811327809 - }, - { - "epoch": 0.6683354192740926, - "grad_norm": 0.9253506660461426, - "learning_rate": 4.6630153043932784e-05, - "loss": 0.9513870477676392, - "step": 267, - "token_acc": 0.730309423347398 - }, - { - "epoch": 0.6708385481852316, - "grad_norm": 1.5841699838638306, - "learning_rate": 4.65683596494448e-05, - "loss": 0.8438987731933594, - "step": 268, - "token_acc": 0.7552549276311005 - }, - { - "epoch": 0.6733416770963705, - "grad_norm": 1.369858980178833, - "learning_rate": 4.650604655097761e-05, - "loss": 0.8666725158691406, - "step": 269, - "token_acc": 0.7492324010495172 - }, - { - "epoch": 0.6758448060075094, - "grad_norm": 2.27767276763916, - "learning_rate": 4.6443215250006806e-05, - "loss": 0.8292583227157593, - "step": 270, - "token_acc": 0.7594427689214419 - }, - { - "epoch": 0.6783479349186483, - "grad_norm": 1.3438291549682617, - "learning_rate": 4.637986726049438e-05, - "loss": 0.7024565935134888, - "step": 271, - "token_acc": 0.78654883163571 - }, - { - "epoch": 0.6808510638297872, - "grad_norm": 2.168410301208496, - "learning_rate": 4.6316004108852305e-05, - "loss": 0.8539745807647705, - "step": 272, - "token_acc": 0.7467631908673257 - }, - { - "epoch": 0.6833541927409261, - "grad_norm": 2.0540430545806885, - "learning_rate": 4.6251627333905724e-05, - "loss": 0.8134692907333374, - "step": 273, - "token_acc": 0.7603259342511941 - }, - { - "epoch": 0.685857321652065, - "grad_norm": 7.12939977645874, - "learning_rate": 4.618673848685586e-05, - "loss": 0.7887545824050903, - "step": 274, - "token_acc": 0.7652179873868933 - }, - { - "epoch": 0.688360450563204, - "grad_norm": 2.2455780506134033, - "learning_rate": 4.612133913124268e-05, - "loss": 0.7140970230102539, - "step": 275, - "token_acc": 0.7912922649374711 - }, - { - "epoch": 0.690863579474343, - "grad_norm": 2.3021907806396484, - "learning_rate": 4.6055430842907167e-05, - "loss": 0.8248931169509888, - "step": 276, - "token_acc": 0.756960692559663 - }, - { - "epoch": 0.6933667083854819, - "grad_norm": 1.2665908336639404, - "learning_rate": 4.59890152099534e-05, - "loss": 0.9142659306526184, - "step": 277, - "token_acc": 0.731113628887833 - }, - { - "epoch": 0.6958698372966208, - "grad_norm": 1.3562812805175781, - "learning_rate": 4.5922093832710236e-05, - "loss": 0.8612058162689209, - "step": 278, - "token_acc": 0.7461015816440187 - }, - { - "epoch": 0.6983729662077597, - "grad_norm": 1.548026204109192, - "learning_rate": 4.585466832369281e-05, - "loss": 0.7588024139404297, - "step": 279, - "token_acc": 0.7776190118071745 - }, - { - "epoch": 0.7008760951188986, - "grad_norm": 4.4971442222595215, - "learning_rate": 4.5786740307563636e-05, - "loss": 0.7747074365615845, - "step": 280, - "token_acc": 0.7710498712691904 - }, - { - "epoch": 0.7033792240300375, - "grad_norm": 2.4977355003356934, - "learning_rate": 4.5718311421093454e-05, - "loss": 0.928239107131958, - "step": 281, - "token_acc": 0.7275659486234305 - }, - { - "epoch": 0.7058823529411765, - "grad_norm": 1.2182586193084717, - "learning_rate": 4.5649383313121827e-05, - "loss": 0.856454074382782, - "step": 282, - "token_acc": 0.7467900865930128 - }, - { - "epoch": 0.7083854818523154, - "grad_norm": 5.53813362121582, - "learning_rate": 4.55799576445174e-05, - "loss": 0.8874952793121338, - "step": 283, - "token_acc": 0.7408339529828977 - }, - { - "epoch": 0.7108886107634543, - "grad_norm": 1.754224181175232, - "learning_rate": 4.551003608813784e-05, - "loss": 0.7295838594436646, - "step": 284, - "token_acc": 0.7820602120578902 - }, - { - "epoch": 0.7133917396745932, - "grad_norm": 1.7745537757873535, - "learning_rate": 4.5439620328789593e-05, - "loss": 0.7359857559204102, - "step": 285, - "token_acc": 0.7874957869902258 - }, - { - "epoch": 0.7158948685857321, - "grad_norm": 1.9047404527664185, - "learning_rate": 4.536871206318723e-05, - "loss": 0.7301020622253418, - "step": 286, - "token_acc": 0.780550320392009 - }, - { - "epoch": 0.718397997496871, - "grad_norm": 2.520000696182251, - "learning_rate": 4.529731299991262e-05, - "loss": 0.9152336120605469, - "step": 287, - "token_acc": 0.7370678450740837 - }, - { - "epoch": 0.72090112640801, - "grad_norm": 1.596307635307312, - "learning_rate": 4.522542485937369e-05, - "loss": 0.8424668908119202, - "step": 288, - "token_acc": 0.7530345471521942 - }, - { - "epoch": 0.723404255319149, - "grad_norm": 1.1966215372085571, - "learning_rate": 4.5153049373763026e-05, - "loss": 0.9505821466445923, - "step": 289, - "token_acc": 0.7279186335101465 - }, - { - "epoch": 0.7259073842302879, - "grad_norm": 1.554336428642273, - "learning_rate": 4.508018828701612e-05, - "loss": 0.8248058557510376, - "step": 290, - "token_acc": 0.7543579671004174 - }, - { - "epoch": 0.7284105131414268, - "grad_norm": 1.557536005973816, - "learning_rate": 4.500684335476936e-05, - "loss": 0.8745982646942139, - "step": 291, - "token_acc": 0.7485994397759104 - }, - { - "epoch": 0.7309136420525657, - "grad_norm": 1.5448335409164429, - "learning_rate": 4.493301634431768e-05, - "loss": 0.9151402711868286, - "step": 292, - "token_acc": 0.7357596764875795 - }, - { - "epoch": 0.7334167709637046, - "grad_norm": 1.980355143547058, - "learning_rate": 4.485870903457204e-05, - "loss": 0.8075742125511169, - "step": 293, - "token_acc": 0.7581687393318702 - }, - { - "epoch": 0.7359198998748435, - "grad_norm": 5.846746921539307, - "learning_rate": 4.478392321601651e-05, - "loss": 0.8880358934402466, - "step": 294, - "token_acc": 0.7426012638087012 - }, - { - "epoch": 0.7384230287859824, - "grad_norm": 1.4618793725967407, - "learning_rate": 4.470866069066516e-05, - "loss": 0.7289685606956482, - "step": 295, - "token_acc": 0.7879294491348324 - }, - { - "epoch": 0.7409261576971214, - "grad_norm": 2.9660937786102295, - "learning_rate": 4.463292327201862e-05, - "loss": 0.7348141074180603, - "step": 296, - "token_acc": 0.7806614266646893 - }, - { - "epoch": 0.7434292866082604, - "grad_norm": 1.2741750478744507, - "learning_rate": 4.455671278502042e-05, - "loss": 0.8414113521575928, - "step": 297, - "token_acc": 0.75607294260144 - }, - { - "epoch": 0.7459324155193993, - "grad_norm": 3.9552199840545654, - "learning_rate": 4.4480031066012916e-05, - "loss": 0.7518953084945679, - "step": 298, - "token_acc": 0.773398631840796 - }, - { - "epoch": 0.7484355444305382, - "grad_norm": 2.206568479537964, - "learning_rate": 4.44028799626932e-05, - "loss": 0.8302481174468994, - "step": 299, - "token_acc": 0.7567450226384668 - }, - { - "epoch": 0.7509386733416771, - "grad_norm": 3.6707959175109863, - "learning_rate": 4.4325261334068426e-05, - "loss": 0.8474286794662476, - "step": 300, - "token_acc": 0.7506851460339833 - }, - { - "epoch": 0.753441802252816, - "grad_norm": 2.34222149848938, - "learning_rate": 4.4247177050411114e-05, - "loss": 0.9115549325942993, - "step": 301, - "token_acc": 0.7319790002282583 - }, - { - "epoch": 0.7559449311639549, - "grad_norm": 6.066429615020752, - "learning_rate": 4.416862899321404e-05, - "loss": 0.8453834056854248, - "step": 302, - "token_acc": 0.7548794844785922 - }, - { - "epoch": 0.7584480600750939, - "grad_norm": 1.178998589515686, - "learning_rate": 4.408961905514491e-05, - "loss": 0.8790225386619568, - "step": 303, - "token_acc": 0.7391522587841606 - }, - { - "epoch": 0.7609511889862328, - "grad_norm": 1.5657821893692017, - "learning_rate": 4.401014914000078e-05, - "loss": 0.7956516146659851, - "step": 304, - "token_acc": 0.765209244222361 - }, - { - "epoch": 0.7634543178973717, - "grad_norm": 2.5777835845947266, - "learning_rate": 4.393022116266212e-05, - "loss": 0.8482795357704163, - "step": 305, - "token_acc": 0.7480234343893977 - }, - { - "epoch": 0.7659574468085106, - "grad_norm": 4.338641166687012, - "learning_rate": 4.384983704904674e-05, - "loss": 0.7993297576904297, - "step": 306, - "token_acc": 0.7676097675510684 - }, - { - "epoch": 0.7684605757196495, - "grad_norm": 1.3926159143447876, - "learning_rate": 4.376899873606336e-05, - "loss": 0.8258683681488037, - "step": 307, - "token_acc": 0.7580105520525029 - }, - { - "epoch": 0.7709637046307884, - "grad_norm": 9.875060081481934, - "learning_rate": 4.3687708171564925e-05, - "loss": 0.7596441507339478, - "step": 308, - "token_acc": 0.7771428571428571 - }, - { - "epoch": 0.7734668335419274, - "grad_norm": 1.8181976079940796, - "learning_rate": 4.360596731430168e-05, - "loss": 0.8504893183708191, - "step": 309, - "token_acc": 0.7549649532710281 - }, - { - "epoch": 0.7759699624530664, - "grad_norm": 5.018813610076904, - "learning_rate": 4.352377813387398e-05, - "loss": 0.9177985191345215, - "step": 310, - "token_acc": 0.7289770944461876 - }, - { - "epoch": 0.7784730913642053, - "grad_norm": 2.401106595993042, - "learning_rate": 4.3441142610684824e-05, - "loss": 0.6803118586540222, - "step": 311, - "token_acc": 0.7968216827532417 - }, - { - "epoch": 0.7809762202753442, - "grad_norm": 3.502769947052002, - "learning_rate": 4.335806273589214e-05, - "loss": 0.7872037887573242, - "step": 312, - "token_acc": 0.766976635148863 - }, - { - "epoch": 0.7834793491864831, - "grad_norm": 1.664228916168213, - "learning_rate": 4.3274540511360793e-05, - "loss": 0.7319408655166626, - "step": 313, - "token_acc": 0.785088 - }, - { - "epoch": 0.785982478097622, - "grad_norm": 2.36742901802063, - "learning_rate": 4.319057794961437e-05, - "loss": 0.8201429843902588, - "step": 314, - "token_acc": 0.7595295142670442 - }, - { - "epoch": 0.7884856070087609, - "grad_norm": 2.8248369693756104, - "learning_rate": 4.310617707378668e-05, - "loss": 0.7904696464538574, - "step": 315, - "token_acc": 0.7644966656081296 - }, - { - "epoch": 0.7909887359198998, - "grad_norm": 2.83573317527771, - "learning_rate": 4.302133991757297e-05, - "loss": 0.8798209428787231, - "step": 316, - "token_acc": 0.7432513020315669 - }, - { - "epoch": 0.7934918648310388, - "grad_norm": 4.348333358764648, - "learning_rate": 4.2936068525181e-05, - "loss": 0.809928834438324, - "step": 317, - "token_acc": 0.7573623559539052 - }, - { - "epoch": 0.7959949937421777, - "grad_norm": 2.1033623218536377, - "learning_rate": 4.285036495128171e-05, - "loss": 0.7483210563659668, - "step": 318, - "token_acc": 0.7732790525536639 - }, - { - "epoch": 0.7984981226533167, - "grad_norm": 3.518192768096924, - "learning_rate": 4.276423126095974e-05, - "loss": 0.6489171385765076, - "step": 319, - "token_acc": 0.8053108482255222 - }, - { - "epoch": 0.8010012515644556, - "grad_norm": 1.2720087766647339, - "learning_rate": 4.267766952966369e-05, - "loss": 0.9405392408370972, - "step": 320, - "token_acc": 0.7279260780287474 - }, - { - "epoch": 0.8035043804755945, - "grad_norm": 16.282249450683594, - "learning_rate": 4.259068184315608e-05, - "loss": 0.9003595113754272, - "step": 321, - "token_acc": 0.7375758282781147 - }, - { - "epoch": 0.8060075093867334, - "grad_norm": 7.009720802307129, - "learning_rate": 4.250327029746309e-05, - "loss": 0.7392456531524658, - "step": 322, - "token_acc": 0.780937796251732 - }, - { - "epoch": 0.8085106382978723, - "grad_norm": 3.936666488647461, - "learning_rate": 4.24154369988241e-05, - "loss": 0.736973226070404, - "step": 323, - "token_acc": 0.7849452385372192 - }, - { - "epoch": 0.8110137672090113, - "grad_norm": 2.0168962478637695, - "learning_rate": 4.23271840636409e-05, - "loss": 0.9145832657814026, - "step": 324, - "token_acc": 0.7297918528923509 - }, - { - "epoch": 0.8135168961201502, - "grad_norm": 9.376174926757812, - "learning_rate": 4.223851361842668e-05, - "loss": 0.7650183439254761, - "step": 325, - "token_acc": 0.7717954668523246 - }, - { - "epoch": 0.8160200250312891, - "grad_norm": 1.8221909999847412, - "learning_rate": 4.214942779975482e-05, - "loss": 0.6287510395050049, - "step": 326, - "token_acc": 0.8086431962025317 - }, - { - "epoch": 0.818523153942428, - "grad_norm": 1.7132198810577393, - "learning_rate": 4.205992875420742e-05, - "loss": 0.9601121544837952, - "step": 327, - "token_acc": 0.7224585536516519 - }, - { - "epoch": 0.8210262828535669, - "grad_norm": 1.228062391281128, - "learning_rate": 4.197001863832355e-05, - "loss": 0.8077439069747925, - "step": 328, - "token_acc": 0.7587896974243561 - }, - { - "epoch": 0.8235294117647058, - "grad_norm": 1.1111897230148315, - "learning_rate": 4.187969961854726e-05, - "loss": 0.8680287599563599, - "step": 329, - "token_acc": 0.7438457841619053 - }, - { - "epoch": 0.8260325406758448, - "grad_norm": 2.42224383354187, - "learning_rate": 4.178897387117546e-05, - "loss": 0.7376724481582642, - "step": 330, - "token_acc": 0.7866793832459068 - }, - { - "epoch": 0.8285356695869838, - "grad_norm": 3.612968683242798, - "learning_rate": 4.169784358230541e-05, - "loss": 0.6727076768875122, - "step": 331, - "token_acc": 0.8009418583589929 - }, - { - "epoch": 0.8310387984981227, - "grad_norm": 4.89116907119751, - "learning_rate": 4.1606310947782044e-05, - "loss": 0.7970181703567505, - "step": 332, - "token_acc": 0.764037733427453 - }, - { - "epoch": 0.8335419274092616, - "grad_norm": 12.484292984008789, - "learning_rate": 4.151437817314513e-05, - "loss": 0.7304867506027222, - "step": 333, - "token_acc": 0.7838243886153076 - }, - { - "epoch": 0.8360450563204005, - "grad_norm": 1.9448401927947998, - "learning_rate": 4.142204747357604e-05, - "loss": 0.8944374918937683, - "step": 334, - "token_acc": 0.7394788423844114 - }, - { - "epoch": 0.8385481852315394, - "grad_norm": 1.2170294523239136, - "learning_rate": 4.1329321073844415e-05, - "loss": 0.8854318261146545, - "step": 335, - "token_acc": 0.7471004579789449 - }, - { - "epoch": 0.8410513141426783, - "grad_norm": 2.639364242553711, - "learning_rate": 4.123620120825459e-05, - "loss": 0.7527574300765991, - "step": 336, - "token_acc": 0.7784949622166247 - }, - { - "epoch": 0.8435544430538173, - "grad_norm": 2.7264010906219482, - "learning_rate": 4.114269012059169e-05, - "loss": 0.8323843479156494, - "step": 337, - "token_acc": 0.7546558704453441 - }, - { - "epoch": 0.8460575719649562, - "grad_norm": 2.749450922012329, - "learning_rate": 4.104879006406758e-05, - "loss": 0.8271874785423279, - "step": 338, - "token_acc": 0.7616862256605258 - }, - { - "epoch": 0.8485607008760951, - "grad_norm": 3.2195448875427246, - "learning_rate": 4.095450330126663e-05, - "loss": 0.6345349550247192, - "step": 339, - "token_acc": 0.8157239416577731 - }, - { - "epoch": 0.851063829787234, - "grad_norm": 2.691843032836914, - "learning_rate": 4.085983210409114e-05, - "loss": 0.7386264801025391, - "step": 340, - "token_acc": 0.7827135845603527 - }, - { - "epoch": 0.853566958698373, - "grad_norm": 1.2783466577529907, - "learning_rate": 4.07647787537066e-05, - "loss": 0.8243026733398438, - "step": 341, - "token_acc": 0.7568028970512157 - }, - { - "epoch": 0.8560700876095119, - "grad_norm": 4.061293601989746, - "learning_rate": 4.066934554048674e-05, - "loss": 0.6981653571128845, - "step": 342, - "token_acc": 0.7869034406215316 - }, - { - "epoch": 0.8585732165206508, - "grad_norm": 1.5013890266418457, - "learning_rate": 4.0573534763958355e-05, - "loss": 0.8307587504386902, - "step": 343, - "token_acc": 0.7530202301808564 - }, - { - "epoch": 0.8610763454317898, - "grad_norm": 1.6979941129684448, - "learning_rate": 4.047734873274586e-05, - "loss": 0.8721674084663391, - "step": 344, - "token_acc": 0.7437897299490555 - }, - { - "epoch": 0.8635794743429287, - "grad_norm": 1.435498595237732, - "learning_rate": 4.038078976451567e-05, - "loss": 0.853046715259552, - "step": 345, - "token_acc": 0.7511126133738945 - }, - { - "epoch": 0.8660826032540676, - "grad_norm": 1.627124309539795, - "learning_rate": 4.028386018592041e-05, - "loss": 0.75436931848526, - "step": 346, - "token_acc": 0.7807899207248018 - }, - { - "epoch": 0.8685857321652065, - "grad_norm": 1.9693089723587036, - "learning_rate": 4.018656233254278e-05, - "loss": 0.8141796588897705, - "step": 347, - "token_acc": 0.7617304492512479 - }, - { - "epoch": 0.8710888610763454, - "grad_norm": 1.6429239511489868, - "learning_rate": 4.008889854883929e-05, - "loss": 0.7092435956001282, - "step": 348, - "token_acc": 0.7868140171908945 - }, - { - "epoch": 0.8735919899874843, - "grad_norm": 7.14348030090332, - "learning_rate": 3.999087118808381e-05, - "loss": 0.8962076306343079, - "step": 349, - "token_acc": 0.7408736260607096 - }, - { - "epoch": 0.8760951188986232, - "grad_norm": 2.5628302097320557, - "learning_rate": 3.9892482612310836e-05, - "loss": 0.9180400967597961, - "step": 350, - "token_acc": 0.7306018168054504 - }, - { - "epoch": 0.8785982478097623, - "grad_norm": 1.3269526958465576, - "learning_rate": 3.979373519225858e-05, - "loss": 0.9172283411026001, - "step": 351, - "token_acc": 0.7335147904683649 - }, - { - "epoch": 0.8811013767209012, - "grad_norm": 1.101183533668518, - "learning_rate": 3.969463130731183e-05, - "loss": 0.8858950138092041, - "step": 352, - "token_acc": 0.7399414146635651 - }, - { - "epoch": 0.8836045056320401, - "grad_norm": 1.8363860845565796, - "learning_rate": 3.959517334544466e-05, - "loss": 0.8181067705154419, - "step": 353, - "token_acc": 0.7508903586873569 - }, - { - "epoch": 0.886107634543179, - "grad_norm": 2.2015419006347656, - "learning_rate": 3.949536370316285e-05, - "loss": 0.8596831560134888, - "step": 354, - "token_acc": 0.7492807233867653 - }, - { - "epoch": 0.8886107634543179, - "grad_norm": 1.0442819595336914, - "learning_rate": 3.939520478544614e-05, - "loss": 0.9282140731811523, - "step": 355, - "token_acc": 0.7278686978257793 - }, - { - "epoch": 0.8911138923654568, - "grad_norm": 1.5046483278274536, - "learning_rate": 3.9294699005690305e-05, - "loss": 0.8907036781311035, - "step": 356, - "token_acc": 0.7428094799815923 - }, - { - "epoch": 0.8936170212765957, - "grad_norm": 1.1432298421859741, - "learning_rate": 3.919384878564902e-05, - "loss": 0.8503479957580566, - "step": 357, - "token_acc": 0.7529302541487757 - }, - { - "epoch": 0.8961201501877347, - "grad_norm": 3.0036914348602295, - "learning_rate": 3.909265655537542e-05, - "loss": 0.7433081865310669, - "step": 358, - "token_acc": 0.7839231981659264 - }, - { - "epoch": 0.8986232790988736, - "grad_norm": 4.806852340698242, - "learning_rate": 3.899112475316366e-05, - "loss": 0.7551373243331909, - "step": 359, - "token_acc": 0.7743180125905368 - }, - { - "epoch": 0.9011264080100125, - "grad_norm": 1.2542036771774292, - "learning_rate": 3.888925582549006e-05, - "loss": 0.8357230424880981, - "step": 360, - "token_acc": 0.7519669661291223 - }, - { - "epoch": 0.9036295369211514, - "grad_norm": 1.6473242044448853, - "learning_rate": 3.8787052226954234e-05, - "loss": 0.8465045690536499, - "step": 361, - "token_acc": 0.7557243682991218 - }, - { - "epoch": 0.9061326658322904, - "grad_norm": 13.783917427062988, - "learning_rate": 3.868451642021992e-05, - "loss": 0.822354793548584, - "step": 362, - "token_acc": 0.7519634703196347 - }, - { - "epoch": 0.9086357947434293, - "grad_norm": 1.7439008951187134, - "learning_rate": 3.8581650875955585e-05, - "loss": 0.7651307582855225, - "step": 363, - "token_acc": 0.7751344989912575 - }, - { - "epoch": 0.9111389236545682, - "grad_norm": 1.6299248933792114, - "learning_rate": 3.847845807277502e-05, - "loss": 0.6929699182510376, - "step": 364, - "token_acc": 0.7872272907576359 - }, - { - "epoch": 0.9136420525657072, - "grad_norm": 2.1659955978393555, - "learning_rate": 3.8374940497177434e-05, - "loss": 0.735326886177063, - "step": 365, - "token_acc": 0.7798106242978655 - }, - { - "epoch": 0.9161451814768461, - "grad_norm": 2.080213785171509, - "learning_rate": 3.827110064348773e-05, - "loss": 0.8066057562828064, - "step": 366, - "token_acc": 0.757124183006536 - }, - { - "epoch": 0.918648310387985, - "grad_norm": 2.8970141410827637, - "learning_rate": 3.816694101379631e-05, - "loss": 0.8618408441543579, - "step": 367, - "token_acc": 0.7464049867308523 - }, - { - "epoch": 0.9211514392991239, - "grad_norm": 1.7472279071807861, - "learning_rate": 3.8062464117898724e-05, - "loss": 0.6792800426483154, - "step": 368, - "token_acc": 0.7940572856250557 - }, - { - "epoch": 0.9236545682102628, - "grad_norm": 5.283840656280518, - "learning_rate": 3.795767247323533e-05, - "loss": 0.9245332479476929, - "step": 369, - "token_acc": 0.7269049524317596 - }, - { - "epoch": 0.9261576971214017, - "grad_norm": 1.9213547706604004, - "learning_rate": 3.785256860483054e-05, - "loss": 0.7491408586502075, - "step": 370, - "token_acc": 0.7738063244647496 - }, - { - "epoch": 0.9286608260325406, - "grad_norm": 1.4675709009170532, - "learning_rate": 3.774715504523202e-05, - "loss": 0.8408378958702087, - "step": 371, - "token_acc": 0.7509755232351898 - }, - { - "epoch": 0.9311639549436797, - "grad_norm": 1.2374870777130127, - "learning_rate": 3.764143433444962e-05, - "loss": 0.9089862704277039, - "step": 372, - "token_acc": 0.7278328611898017 - }, - { - "epoch": 0.9336670838548186, - "grad_norm": 2.368098497390747, - "learning_rate": 3.753540901989423e-05, - "loss": 0.8130977153778076, - "step": 373, - "token_acc": 0.7584136918066288 - }, - { - "epoch": 0.9361702127659575, - "grad_norm": 4.070181846618652, - "learning_rate": 3.742908165631636e-05, - "loss": 0.8318907618522644, - "step": 374, - "token_acc": 0.7538795370857444 - }, - { - "epoch": 0.9386733416770964, - "grad_norm": 3.8024885654449463, - "learning_rate": 3.7322454805744605e-05, - "loss": 0.8522058725357056, - "step": 375, - "token_acc": 0.7481334654773704 - }, - { - "epoch": 0.9411764705882353, - "grad_norm": 8.243106842041016, - "learning_rate": 3.721553103742388e-05, - "loss": 0.7708778381347656, - "step": 376, - "token_acc": 0.7737909516380655 - }, - { - "epoch": 0.9436795994993742, - "grad_norm": 1.9439160823822021, - "learning_rate": 3.710831292775353e-05, - "loss": 0.7590352296829224, - "step": 377, - "token_acc": 0.7700546946216955 - }, - { - "epoch": 0.9461827284105131, - "grad_norm": 3.2804136276245117, - "learning_rate": 3.7000803060225284e-05, - "loss": 0.7222952842712402, - "step": 378, - "token_acc": 0.7838400666389005 - }, - { - "epoch": 0.9486858573216521, - "grad_norm": 1.783825159072876, - "learning_rate": 3.689300402536093e-05, - "loss": 0.820694088935852, - "step": 379, - "token_acc": 0.7568910159326346 - }, - { - "epoch": 0.951188986232791, - "grad_norm": 1.5094672441482544, - "learning_rate": 3.678491842064995e-05, - "loss": 0.8228154182434082, - "step": 380, - "token_acc": 0.7563206708169229 - }, - { - "epoch": 0.9536921151439299, - "grad_norm": 1.2823344469070435, - "learning_rate": 3.6676548850486915e-05, - "loss": 0.8268698453903198, - "step": 381, - "token_acc": 0.7545756682113935 - }, - { - "epoch": 0.9561952440550688, - "grad_norm": 2.020446538925171, - "learning_rate": 3.6567897926108756e-05, - "loss": 0.7393025159835815, - "step": 382, - "token_acc": 0.7798188874514878 - }, - { - "epoch": 0.9586983729662077, - "grad_norm": 1.6527626514434814, - "learning_rate": 3.645896826553178e-05, - "loss": 0.7484114766120911, - "step": 383, - "token_acc": 0.7755332780583403 - }, - { - "epoch": 0.9612015018773467, - "grad_norm": 1.587301254272461, - "learning_rate": 3.634976249348867e-05, - "loss": 0.6126949787139893, - "step": 384, - "token_acc": 0.8158403090792016 - }, - { - "epoch": 0.9637046307884856, - "grad_norm": 5.484954833984375, - "learning_rate": 3.624028324136517e-05, - "loss": 0.7998955249786377, - "step": 385, - "token_acc": 0.7629840381926026 - }, - { - "epoch": 0.9662077596996246, - "grad_norm": 1.513581395149231, - "learning_rate": 3.613053314713671e-05, - "loss": 0.7720030546188354, - "step": 386, - "token_acc": 0.767228370221328 - }, - { - "epoch": 0.9687108886107635, - "grad_norm": 3.6025302410125732, - "learning_rate": 3.602051485530486e-05, - "loss": 0.9072454571723938, - "step": 387, - "token_acc": 0.7304942652882785 - }, - { - "epoch": 0.9712140175219024, - "grad_norm": 1.7113579511642456, - "learning_rate": 3.591023101683355e-05, - "loss": 0.7592995166778564, - "step": 388, - "token_acc": 0.7736043397651583 - }, - { - "epoch": 0.9737171464330413, - "grad_norm": 1.5886659622192383, - "learning_rate": 3.57996842890853e-05, - "loss": 0.9248221516609192, - "step": 389, - "token_acc": 0.7291666666666666 - }, - { - "epoch": 0.9762202753441802, - "grad_norm": 1.904639482498169, - "learning_rate": 3.568887733575706e-05, - "loss": 0.6640578508377075, - "step": 390, - "token_acc": 0.8030723277149563 - }, - { - "epoch": 0.9787234042553191, - "grad_norm": 4.676436424255371, - "learning_rate": 3.55778128268161e-05, - "loss": 0.8066322803497314, - "step": 391, - "token_acc": 0.7604322527015794 - }, - { - "epoch": 0.981226533166458, - "grad_norm": 2.244272470474243, - "learning_rate": 3.54664934384357e-05, - "loss": 0.7747057676315308, - "step": 392, - "token_acc": 0.7657098525989139 - }, - { - "epoch": 0.983729662077597, - "grad_norm": 3.2416160106658936, - "learning_rate": 3.5354921852930594e-05, - "loss": 0.7859742045402527, - "step": 393, - "token_acc": 0.7659952983035772 - }, - { - "epoch": 0.986232790988736, - "grad_norm": 3.806647300720215, - "learning_rate": 3.5243100758692386e-05, - "loss": 0.7290835976600647, - "step": 394, - "token_acc": 0.7793145441892833 - }, - { - "epoch": 0.9887359198998749, - "grad_norm": 2.6771068572998047, - "learning_rate": 3.513103285012475e-05, - "loss": 0.8180262446403503, - "step": 395, - "token_acc": 0.7598081952920662 - }, - { - "epoch": 0.9912390488110138, - "grad_norm": 1.7483131885528564, - "learning_rate": 3.5018720827578524e-05, - "loss": 0.7300944328308105, - "step": 396, - "token_acc": 0.7814569536423841 - }, - { - "epoch": 0.9937421777221527, - "grad_norm": 1.995330572128296, - "learning_rate": 3.4906167397286646e-05, - "loss": 0.7564259767532349, - "step": 397, - "token_acc": 0.7783770729351152 - }, - { - "epoch": 0.9962453066332916, - "grad_norm": 2.2668654918670654, - "learning_rate": 3.47933752712989e-05, - "loss": 0.7041178941726685, - "step": 398, - "token_acc": 0.7913291605301914 - }, - { - "epoch": 0.9987484355444305, - "grad_norm": 1.306915283203125, - "learning_rate": 3.468034716741664e-05, - "loss": 0.8539732694625854, - "step": 399, - "token_acc": 0.7481962912169817 - }, - { - "epoch": 1.0, - "grad_norm": 1.7704166173934937, - "learning_rate": 3.456708580912725e-05, - "loss": 0.7418760061264038, - "step": 400, - "token_acc": 0.776519052523172 - }, - { - "epoch": 1.002503128911139, - "grad_norm": 43.9930305480957, - "learning_rate": 3.4453593925538515e-05, - "loss": 0.7428221702575684, - "step": 401, - "token_acc": 0.7772024037846823 - }, - { - "epoch": 1.0050062578222778, - "grad_norm": 1.5584815740585327, - "learning_rate": 3.433987425131291e-05, - "loss": 0.8528105616569519, - "step": 402, - "token_acc": 0.7449437659892841 - }, - { - "epoch": 1.0075093867334168, - "grad_norm": 7.336424350738525, - "learning_rate": 3.4225929526601664e-05, - "loss": 0.7428395748138428, - "step": 403, - "token_acc": 0.7766206412356658 - }, - { - "epoch": 1.0100125156445556, - "grad_norm": 1.4825217723846436, - "learning_rate": 3.411176249697875e-05, - "loss": 0.631352424621582, - "step": 404, - "token_acc": 0.8065062053403536 - }, - { - "epoch": 1.0125156445556946, - "grad_norm": 1.484767198562622, - "learning_rate": 3.399737591337471e-05, - "loss": 0.7537027597427368, - "step": 405, - "token_acc": 0.7765481064483112 - }, - { - "epoch": 1.0150187734668334, - "grad_norm": 2.6845622062683105, - "learning_rate": 3.388277253201041e-05, - "loss": 0.796688437461853, - "step": 406, - "token_acc": 0.7627060907480583 - }, - { - "epoch": 1.0175219023779725, - "grad_norm": 2.6031534671783447, - "learning_rate": 3.3767955114330586e-05, - "loss": 0.8054678440093994, - "step": 407, - "token_acc": 0.764444165935581 - }, - { - "epoch": 1.0200250312891115, - "grad_norm": 1.357327938079834, - "learning_rate": 3.365292642693732e-05, - "loss": 0.8387413024902344, - "step": 408, - "token_acc": 0.7472088911341248 - }, - { - "epoch": 1.0225281602002503, - "grad_norm": 2.586324453353882, - "learning_rate": 3.353768924152341e-05, - "loss": 0.6938782930374146, - "step": 409, - "token_acc": 0.7910919792673284 - }, - { - "epoch": 1.0250312891113893, - "grad_norm": 1.2863296270370483, - "learning_rate": 3.34222463348055e-05, - "loss": 0.9054546356201172, - "step": 410, - "token_acc": 0.7378970871815691 - }, - { - "epoch": 1.027534418022528, - "grad_norm": 1.5208131074905396, - "learning_rate": 3.330660048845727e-05, - "loss": 0.7409943342208862, - "step": 411, - "token_acc": 0.7748617945446814 - }, - { - "epoch": 1.0300375469336671, - "grad_norm": 1.7728694677352905, - "learning_rate": 3.319075448904234e-05, - "loss": 0.8802088499069214, - "step": 412, - "token_acc": 0.737257519830362 - }, - { - "epoch": 1.032540675844806, - "grad_norm": 2.1131184101104736, - "learning_rate": 3.307471112794715e-05, - "loss": 0.6349403262138367, - "step": 413, - "token_acc": 0.8154147750722245 - }, - { - "epoch": 1.035043804755945, - "grad_norm": 2.6038410663604736, - "learning_rate": 3.2958473201313744e-05, - "loss": 0.7536982893943787, - "step": 414, - "token_acc": 0.7783753361265712 - }, - { - "epoch": 1.037546933667084, - "grad_norm": 0.7469914555549622, - "learning_rate": 3.284204350997229e-05, - "loss": 0.8465015888214111, - "step": 415, - "token_acc": 0.7492382217360731 - }, - { - "epoch": 1.0400500625782227, - "grad_norm": 2.318094253540039, - "learning_rate": 3.272542485937369e-05, - "loss": 0.8175340294837952, - "step": 416, - "token_acc": 0.7576262710451742 - }, - { - "epoch": 1.0425531914893618, - "grad_norm": 2.7602827548980713, - "learning_rate": 3.260862005952193e-05, - "loss": 0.8715943098068237, - "step": 417, - "token_acc": 0.743643826245582 - }, - { - "epoch": 1.0450563204005006, - "grad_norm": 1.7321751117706299, - "learning_rate": 3.2491631924906416e-05, - "loss": 0.7801544070243835, - "step": 418, - "token_acc": 0.7639452626696045 - }, - { - "epoch": 1.0475594493116396, - "grad_norm": 30.08856201171875, - "learning_rate": 3.23744632744341e-05, - "loss": 0.6660053730010986, - "step": 419, - "token_acc": 0.7974683544303798 - }, - { - "epoch": 1.0500625782227784, - "grad_norm": 10.824769973754883, - "learning_rate": 3.225711693136156e-05, - "loss": 0.6206501722335815, - "step": 420, - "token_acc": 0.8082563824008691 - }, - { - "epoch": 1.0525657071339174, - "grad_norm": 6.584616661071777, - "learning_rate": 3.2139595723227054e-05, - "loss": 0.8174914121627808, - "step": 421, - "token_acc": 0.7598479154692958 - }, - { - "epoch": 1.0550688360450564, - "grad_norm": 1.7321393489837646, - "learning_rate": 3.202190248178231e-05, - "loss": 0.802627682685852, - "step": 422, - "token_acc": 0.7602137986115377 - }, - { - "epoch": 1.0575719649561952, - "grad_norm": 1.9569984674453735, - "learning_rate": 3.190404004292427e-05, - "loss": 0.6920569539070129, - "step": 423, - "token_acc": 0.7928679144859399 - }, - { - "epoch": 1.0600750938673342, - "grad_norm": 1.5589165687561035, - "learning_rate": 3.178601124662686e-05, - "loss": 0.8527140021324158, - "step": 424, - "token_acc": 0.7463035747707281 - }, - { - "epoch": 1.062578222778473, - "grad_norm": 4.186975002288818, - "learning_rate": 3.1667818936872465e-05, - "loss": 0.7492550015449524, - "step": 425, - "token_acc": 0.7705152671755725 - }, - { - "epoch": 1.065081351689612, - "grad_norm": 1.757791519165039, - "learning_rate": 3.154946596158344e-05, - "loss": 0.7724304795265198, - "step": 426, - "token_acc": 0.7690384787072583 - }, - { - "epoch": 1.0675844806007508, - "grad_norm": 3.0420734882354736, - "learning_rate": 3.14309551725535e-05, - "loss": 0.8095215559005737, - "step": 427, - "token_acc": 0.7658398397015131 - }, - { - "epoch": 1.0700876095118899, - "grad_norm": 1.704030156135559, - "learning_rate": 3.131228942537895e-05, - "loss": 0.6501023173332214, - "step": 428, - "token_acc": 0.8044284859365649 - }, - { - "epoch": 1.0725907384230289, - "grad_norm": 2.9102675914764404, - "learning_rate": 3.119347157938996e-05, - "loss": 0.7734176516532898, - "step": 429, - "token_acc": 0.7695846562560746 - }, - { - "epoch": 1.0750938673341677, - "grad_norm": 1.7218647003173828, - "learning_rate": 3.10745044975816e-05, - "loss": 0.7924395799636841, - "step": 430, - "token_acc": 0.769767294401116 - }, - { - "epoch": 1.0775969962453067, - "grad_norm": 3.255305051803589, - "learning_rate": 3.095539104654487e-05, - "loss": 0.8065544366836548, - "step": 431, - "token_acc": 0.76478578892372 - }, - { - "epoch": 1.0801001251564455, - "grad_norm": 1.2878748178482056, - "learning_rate": 3.083613409639764e-05, - "loss": 0.8923381567001343, - "step": 432, - "token_acc": 0.7387548536276777 - }, - { - "epoch": 1.0826032540675845, - "grad_norm": 1.4100399017333984, - "learning_rate": 3.071673652071549e-05, - "loss": 0.8253895044326782, - "step": 433, - "token_acc": 0.7540562052286781 - }, - { - "epoch": 1.0851063829787233, - "grad_norm": 1.6869633197784424, - "learning_rate": 3.0597201196462463e-05, - "loss": 0.6606812477111816, - "step": 434, - "token_acc": 0.7974853761850332 - }, - { - "epoch": 1.0876095118898623, - "grad_norm": 1.2705729007720947, - "learning_rate": 3.0477531003921745e-05, - "loss": 0.8390290141105652, - "step": 435, - "token_acc": 0.7539678436643747 - }, - { - "epoch": 1.0901126408010013, - "grad_norm": 4.0343170166015625, - "learning_rate": 3.035772882662627e-05, - "loss": 0.7374899387359619, - "step": 436, - "token_acc": 0.7784767467984722 - }, - { - "epoch": 1.0926157697121401, - "grad_norm": 31.51459503173828, - "learning_rate": 3.0237797551289228e-05, - "loss": 0.8265960812568665, - "step": 437, - "token_acc": 0.754416435093291 - }, - { - "epoch": 1.0951188986232792, - "grad_norm": 1.898342251777649, - "learning_rate": 3.0117740067734495e-05, - "loss": 0.8250342607498169, - "step": 438, - "token_acc": 0.7517792771975229 - }, - { - "epoch": 1.097622027534418, - "grad_norm": 1.7603737115859985, - "learning_rate": 2.9997559268827048e-05, - "loss": 0.6548107266426086, - "step": 439, - "token_acc": 0.802406330749354 - }, - { - "epoch": 1.100125156445557, - "grad_norm": 1.681059718132019, - "learning_rate": 2.9877258050403212e-05, - "loss": 0.49500739574432373, - "step": 440, - "token_acc": 0.8484848484848485 - }, - { - "epoch": 1.1026282853566958, - "grad_norm": 2.323869228363037, - "learning_rate": 2.97568393112009e-05, - "loss": 0.8611985445022583, - "step": 441, - "token_acc": 0.7459963793343546 - }, - { - "epoch": 1.1051314142678348, - "grad_norm": 3.4705965518951416, - "learning_rate": 2.963630595278977e-05, - "loss": 0.6335822343826294, - "step": 442, - "token_acc": 0.8075504658385093 - }, - { - "epoch": 1.1076345431789738, - "grad_norm": 1.9544960260391235, - "learning_rate": 2.9515660879501316e-05, - "loss": 0.7141144275665283, - "step": 443, - "token_acc": 0.7871103060348937 - }, - { - "epoch": 1.1101376720901126, - "grad_norm": 2.912339687347412, - "learning_rate": 2.9394906998358868e-05, - "loss": 0.8509359359741211, - "step": 444, - "token_acc": 0.7441022743325328 - }, - { - "epoch": 1.1126408010012516, - "grad_norm": 0.9381941556930542, - "learning_rate": 2.9274047219007534e-05, - "loss": 0.7909557819366455, - "step": 445, - "token_acc": 0.7587197373820271 - }, - { - "epoch": 1.1151439299123904, - "grad_norm": 1.41623055934906, - "learning_rate": 2.9153084453644135e-05, - "loss": 0.8439774513244629, - "step": 446, - "token_acc": 0.7494344152546285 - }, - { - "epoch": 1.1176470588235294, - "grad_norm": 1.3373831510543823, - "learning_rate": 2.9032021616947015e-05, - "loss": 0.7694572806358337, - "step": 447, - "token_acc": 0.7675036214389184 - }, - { - "epoch": 1.1201501877346682, - "grad_norm": 1.8616464138031006, - "learning_rate": 2.8910861626005776e-05, - "loss": 0.7465448975563049, - "step": 448, - "token_acc": 0.7760096282428457 - }, - { - "epoch": 1.1226533166458073, - "grad_norm": 2.0417370796203613, - "learning_rate": 2.878960740025103e-05, - "loss": 0.5976338386535645, - "step": 449, - "token_acc": 0.8209215731905981 - }, - { - "epoch": 1.1251564455569463, - "grad_norm": 1.513850450515747, - "learning_rate": 2.8668261861384045e-05, - "loss": 0.6721420288085938, - "step": 450, - "token_acc": 0.7959154424937298 - }, - { - "epoch": 1.127659574468085, - "grad_norm": 2.1121175289154053, - "learning_rate": 2.854682793330633e-05, - "loss": 0.6924934387207031, - "step": 451, - "token_acc": 0.7926174496644295 - }, - { - "epoch": 1.130162703379224, - "grad_norm": 1.8427212238311768, - "learning_rate": 2.8425308542049206e-05, - "loss": 0.6902682185173035, - "step": 452, - "token_acc": 0.7945113788487282 - }, - { - "epoch": 1.1326658322903629, - "grad_norm": 2.8109426498413086, - "learning_rate": 2.8303706615703253e-05, - "loss": 0.8199548721313477, - "step": 453, - "token_acc": 0.7543770616594773 - }, - { - "epoch": 1.135168961201502, - "grad_norm": 2.637247085571289, - "learning_rate": 2.8182025084347836e-05, - "loss": 0.9140053391456604, - "step": 454, - "token_acc": 0.7342447756291826 - }, - { - "epoch": 1.1376720901126407, - "grad_norm": 2.070204734802246, - "learning_rate": 2.8060266879980408e-05, - "loss": 0.6925473213195801, - "step": 455, - "token_acc": 0.7881796251623678 - }, - { - "epoch": 1.1401752190237797, - "grad_norm": 1.8393173217773438, - "learning_rate": 2.7938434936445945e-05, - "loss": 0.7441434860229492, - "step": 456, - "token_acc": 0.7766430457134917 - }, - { - "epoch": 1.1426783479349187, - "grad_norm": 4.779657363891602, - "learning_rate": 2.7816532189366197e-05, - "loss": 0.7810814380645752, - "step": 457, - "token_acc": 0.7622206393019322 - }, - { - "epoch": 1.1451814768460575, - "grad_norm": 1.8170710802078247, - "learning_rate": 2.7694561576068985e-05, - "loss": 0.7876262664794922, - "step": 458, - "token_acc": 0.7685871709407524 - }, - { - "epoch": 1.1476846057571966, - "grad_norm": 0.9989718794822693, - "learning_rate": 2.757252603551741e-05, - "loss": 0.8328777551651001, - "step": 459, - "token_acc": 0.7498996386993175 - }, - { - "epoch": 1.1501877346683353, - "grad_norm": 4.568758964538574, - "learning_rate": 2.7450428508239024e-05, - "loss": 0.8748979568481445, - "step": 460, - "token_acc": 0.7450868070855733 - }, - { - "epoch": 1.1526908635794744, - "grad_norm": 8.470266342163086, - "learning_rate": 2.7328271936254995e-05, - "loss": 0.8182597756385803, - "step": 461, - "token_acc": 0.7555555555555555 - }, - { - "epoch": 1.1551939924906134, - "grad_norm": 1.7657190561294556, - "learning_rate": 2.7206059263009244e-05, - "loss": 0.7683885097503662, - "step": 462, - "token_acc": 0.7742563247150404 - }, - { - "epoch": 1.1576971214017522, - "grad_norm": 5.895107746124268, - "learning_rate": 2.7083793433297438e-05, - "loss": 0.8530595302581787, - "step": 463, - "token_acc": 0.7451071400943761 - }, - { - "epoch": 1.1602002503128912, - "grad_norm": 1.7480491399765015, - "learning_rate": 2.6961477393196126e-05, - "loss": 0.7786663174629211, - "step": 464, - "token_acc": 0.7678157443806068 - }, - { - "epoch": 1.16270337922403, - "grad_norm": 2.044475793838501, - "learning_rate": 2.683911408999169e-05, - "loss": 0.7121521830558777, - "step": 465, - "token_acc": 0.7803991336633663 - }, - { - "epoch": 1.165206508135169, - "grad_norm": 5.003326416015625, - "learning_rate": 2.6716706472109342e-05, - "loss": 0.6376701593399048, - "step": 466, - "token_acc": 0.8067076051015588 - }, - { - "epoch": 1.1677096370463078, - "grad_norm": 12.686973571777344, - "learning_rate": 2.659425748904212e-05, - "loss": 0.5150684118270874, - "step": 467, - "token_acc": 0.8459984285553934 - }, - { - "epoch": 1.1702127659574468, - "grad_norm": 3.0933218002319336, - "learning_rate": 2.6471770091279724e-05, - "loss": 0.7467551827430725, - "step": 468, - "token_acc": 0.7779315435003229 - }, - { - "epoch": 1.1727158948685856, - "grad_norm": 5.490667819976807, - "learning_rate": 2.6349247230237552e-05, - "loss": 0.7138000130653381, - "step": 469, - "token_acc": 0.7884847818920998 - }, - { - "epoch": 1.1752190237797246, - "grad_norm": 1.2807576656341553, - "learning_rate": 2.6226691858185454e-05, - "loss": 0.8333462476730347, - "step": 470, - "token_acc": 0.749974967457695 - }, - { - "epoch": 1.1777221526908637, - "grad_norm": 10.077444076538086, - "learning_rate": 2.6104106928176687e-05, - "loss": 0.7134934067726135, - "step": 471, - "token_acc": 0.781946749404719 - }, - { - "epoch": 1.1802252816020025, - "grad_norm": 1.7063714265823364, - "learning_rate": 2.598149539397672e-05, - "loss": 0.8703588247299194, - "step": 472, - "token_acc": 0.7454706834438469 - }, - { - "epoch": 1.1827284105131415, - "grad_norm": 1.9840588569641113, - "learning_rate": 2.585886020999206e-05, - "loss": 0.7841652035713196, - "step": 473, - "token_acc": 0.7653958944281525 - }, - { - "epoch": 1.1852315394242803, - "grad_norm": 1.917015552520752, - "learning_rate": 2.5736204331199088e-05, - "loss": 0.8311939835548401, - "step": 474, - "token_acc": 0.7580409820465648 - }, - { - "epoch": 1.1877346683354193, - "grad_norm": 1.1762555837631226, - "learning_rate": 2.561353071307281e-05, - "loss": 0.8065941333770752, - "step": 475, - "token_acc": 0.7605049383437554 - }, - { - "epoch": 1.1902377972465583, - "grad_norm": 2.9361069202423096, - "learning_rate": 2.5490842311515707e-05, - "loss": 0.6642436385154724, - "step": 476, - "token_acc": 0.8024132730015083 - }, - { - "epoch": 1.1927409261576971, - "grad_norm": 4.613530158996582, - "learning_rate": 2.5368142082786466e-05, - "loss": 0.7668801546096802, - "step": 477, - "token_acc": 0.7748182105595953 - }, - { - "epoch": 1.1952440550688361, - "grad_norm": 1.097956657409668, - "learning_rate": 2.5245432983428747e-05, - "loss": 0.9035181999206543, - "step": 478, - "token_acc": 0.7342191332788226 - }, - { - "epoch": 1.197747183979975, - "grad_norm": 1.8363292217254639, - "learning_rate": 2.5122717970199956e-05, - "loss": 0.851319432258606, - "step": 479, - "token_acc": 0.7467151074780503 - }, - { - "epoch": 1.200250312891114, - "grad_norm": 1.2292267084121704, - "learning_rate": 2.5e-05, - "loss": 0.7173365354537964, - "step": 480, - "token_acc": 0.7852402654513473 - }, - { - "epoch": 1.2027534418022527, - "grad_norm": 1.13339102268219, - "learning_rate": 2.4877282029800053e-05, - "loss": 0.7570571899414062, - "step": 481, - "token_acc": 0.7718512153204027 - }, - { - "epoch": 1.2052565707133918, - "grad_norm": 2.553258180618286, - "learning_rate": 2.4754567016571263e-05, - "loss": 0.8463850021362305, - "step": 482, - "token_acc": 0.7462981243830207 - }, - { - "epoch": 1.2077596996245306, - "grad_norm": 1.9682620763778687, - "learning_rate": 2.4631857917213543e-05, - "loss": 0.7410565614700317, - "step": 483, - "token_acc": 0.7786700125470515 - }, - { - "epoch": 1.2102628285356696, - "grad_norm": 1.0788750648498535, - "learning_rate": 2.4509157688484295e-05, - "loss": 0.8274058103561401, - "step": 484, - "token_acc": 0.7513348996155489 - }, - { - "epoch": 1.2127659574468086, - "grad_norm": 1.1234153509140015, - "learning_rate": 2.4386469286927196e-05, - "loss": 0.8381744027137756, - "step": 485, - "token_acc": 0.7476648740447212 - }, - { - "epoch": 1.2152690863579474, - "grad_norm": 2.8939898014068604, - "learning_rate": 2.426379566880092e-05, - "loss": 0.8004180192947388, - "step": 486, - "token_acc": 0.7646108937333085 - }, - { - "epoch": 1.2177722152690864, - "grad_norm": 3.46976637840271, - "learning_rate": 2.414113979000794e-05, - "loss": 0.8478291034698486, - "step": 487, - "token_acc": 0.7513809354887752 - }, - { - "epoch": 1.2202753441802252, - "grad_norm": 2.4108669757843018, - "learning_rate": 2.4018504606023293e-05, - "loss": 0.7109798192977905, - "step": 488, - "token_acc": 0.7838756326825741 - }, - { - "epoch": 1.2227784730913642, - "grad_norm": 5.502831935882568, - "learning_rate": 2.389589307182332e-05, - "loss": 0.8232313394546509, - "step": 489, - "token_acc": 0.7541480718617691 - }, - { - "epoch": 1.2252816020025032, - "grad_norm": 5.164613246917725, - "learning_rate": 2.3773308141814552e-05, - "loss": 0.6895003914833069, - "step": 490, - "token_acc": 0.7904873671130747 - }, - { - "epoch": 1.227784730913642, - "grad_norm": 2.992577314376831, - "learning_rate": 2.365075276976245e-05, - "loss": 0.8953061699867249, - "step": 491, - "token_acc": 0.7334460411383489 - }, - { - "epoch": 1.230287859824781, - "grad_norm": 3.0780115127563477, - "learning_rate": 2.3528229908720272e-05, - "loss": 0.6675305962562561, - "step": 492, - "token_acc": 0.7988102636952854 - }, - { - "epoch": 1.2327909887359199, - "grad_norm": 2.8056156635284424, - "learning_rate": 2.3405742510957894e-05, - "loss": 0.7906989455223083, - "step": 493, - "token_acc": 0.7683424382822764 - }, - { - "epoch": 1.2352941176470589, - "grad_norm": 1.3469887971878052, - "learning_rate": 2.328329352789066e-05, - "loss": 0.7190076112747192, - "step": 494, - "token_acc": 0.7788229469645399 - }, - { - "epoch": 1.2377972465581977, - "grad_norm": 2.318279981613159, - "learning_rate": 2.3160885910008318e-05, - "loss": 0.8477081060409546, - "step": 495, - "token_acc": 0.7479976557921469 - }, - { - "epoch": 1.2403003754693367, - "grad_norm": 1.66133713722229, - "learning_rate": 2.303852260680388e-05, - "loss": 0.8301971554756165, - "step": 496, - "token_acc": 0.7531454639099404 - }, - { - "epoch": 1.2428035043804755, - "grad_norm": 1.978458285331726, - "learning_rate": 2.291620656670256e-05, - "loss": 0.6246353387832642, - "step": 497, - "token_acc": 0.8072678843226788 - }, - { - "epoch": 1.2453066332916145, - "grad_norm": 2.763749837875366, - "learning_rate": 2.279394073699077e-05, - "loss": 0.6929395198822021, - "step": 498, - "token_acc": 0.7917909276408727 - }, - { - "epoch": 1.2478097622027535, - "grad_norm": 1.4526376724243164, - "learning_rate": 2.267172806374501e-05, - "loss": 0.7163282632827759, - "step": 499, - "token_acc": 0.7838088024909534 - }, - { - "epoch": 1.2503128911138923, - "grad_norm": 3.438523530960083, - "learning_rate": 2.2549571491760986e-05, - "loss": 0.5449392795562744, - "step": 500, - "token_acc": 0.833210964268233 - }, - { - "epoch": 1.2528160200250313, - "grad_norm": 13.278526306152344, - "learning_rate": 2.2427473964482598e-05, - "loss": 0.6137301921844482, - "step": 501, - "token_acc": 0.8104321907600596 - }, - { - "epoch": 1.2553191489361701, - "grad_norm": 13.62430191040039, - "learning_rate": 2.2305438423931017e-05, - "loss": 0.8686969876289368, - "step": 502, - "token_acc": 0.7442144830397174 - }, - { - "epoch": 1.2578222778473092, - "grad_norm": 1.8806519508361816, - "learning_rate": 2.2183467810633812e-05, - "loss": 0.9271630048751831, - "step": 503, - "token_acc": 0.7262685005692483 - }, - { - "epoch": 1.2603254067584482, - "grad_norm": 2.0833258628845215, - "learning_rate": 2.2061565063554064e-05, - "loss": 0.6759613752365112, - "step": 504, - "token_acc": 0.7969396593205659 - }, - { - "epoch": 1.262828535669587, - "grad_norm": 6.389394760131836, - "learning_rate": 2.1939733120019598e-05, - "loss": 0.7384915351867676, - "step": 505, - "token_acc": 0.774990612091626 - }, - { - "epoch": 1.265331664580726, - "grad_norm": 3.0592896938323975, - "learning_rate": 2.1817974915652173e-05, - "loss": 0.6458410024642944, - "step": 506, - "token_acc": 0.802019687712152 - }, - { - "epoch": 1.2678347934918648, - "grad_norm": 1.639441728591919, - "learning_rate": 2.1696293384296746e-05, - "loss": 0.6861962080001831, - "step": 507, - "token_acc": 0.7907946370176586 - }, - { - "epoch": 1.2703379224030038, - "grad_norm": 2.1521527767181396, - "learning_rate": 2.1574691457950803e-05, - "loss": 0.7988197803497314, - "step": 508, - "token_acc": 0.7582929067785499 - }, - { - "epoch": 1.2728410513141426, - "grad_norm": 1.5150588750839233, - "learning_rate": 2.1453172066693673e-05, - "loss": 0.783989667892456, - "step": 509, - "token_acc": 0.7560105090963168 - }, - { - "epoch": 1.2753441802252816, - "grad_norm": 1.526321530342102, - "learning_rate": 2.1331738138615958e-05, - "loss": 0.8146979808807373, - "step": 510, - "token_acc": 0.7611608645882432 - }, - { - "epoch": 1.2778473091364204, - "grad_norm": 1.9988254308700562, - "learning_rate": 2.1210392599748974e-05, - "loss": 0.7470281720161438, - "step": 511, - "token_acc": 0.7786675208199871 - }, - { - "epoch": 1.2803504380475594, - "grad_norm": 3.260591745376587, - "learning_rate": 2.1089138373994223e-05, - "loss": 0.8237022161483765, - "step": 512, - "token_acc": 0.7528670036415023 - }, - { - "epoch": 1.2828535669586985, - "grad_norm": 1.7635042667388916, - "learning_rate": 2.0967978383052994e-05, - "loss": 0.7945007681846619, - "step": 513, - "token_acc": 0.7593285066433288 - }, - { - "epoch": 1.2853566958698373, - "grad_norm": 1.5511478185653687, - "learning_rate": 2.0846915546355868e-05, - "loss": 0.7554317712783813, - "step": 514, - "token_acc": 0.7748419009454637 - }, - { - "epoch": 1.2878598247809763, - "grad_norm": 4.115737438201904, - "learning_rate": 2.0725952780992468e-05, - "loss": 0.8068946003913879, - "step": 515, - "token_acc": 0.7541250542770299 - }, - { - "epoch": 1.290362953692115, - "grad_norm": 3.031116247177124, - "learning_rate": 2.0605093001641138e-05, - "loss": 0.7863394021987915, - "step": 516, - "token_acc": 0.7686510486650698 - }, - { - "epoch": 1.292866082603254, - "grad_norm": 1.5909842252731323, - "learning_rate": 2.048433912049868e-05, - "loss": 0.8729851245880127, - "step": 517, - "token_acc": 0.7407537527946343 - }, - { - "epoch": 1.295369211514393, - "grad_norm": 2.6750752925872803, - "learning_rate": 2.036369404721023e-05, - "loss": 0.7303407788276672, - "step": 518, - "token_acc": 0.7781297955546755 - }, - { - "epoch": 1.297872340425532, - "grad_norm": 0.9692606329917908, - "learning_rate": 2.0243160688799105e-05, - "loss": 0.8290165066719055, - "step": 519, - "token_acc": 0.7519956637429782 - }, - { - "epoch": 1.300375469336671, - "grad_norm": 2.2219390869140625, - "learning_rate": 2.0122741949596797e-05, - "loss": 0.8760692477226257, - "step": 520, - "token_acc": 0.7430098393147873 - }, - { - "epoch": 1.3028785982478097, - "grad_norm": 0.8866194486618042, - "learning_rate": 2.0002440731172958e-05, - "loss": 0.8369796276092529, - "step": 521, - "token_acc": 0.747876936829559 - }, - { - "epoch": 1.3053817271589487, - "grad_norm": 3.6789374351501465, - "learning_rate": 1.988225993226551e-05, - "loss": 0.7882047891616821, - "step": 522, - "token_acc": 0.767794798717492 - }, - { - "epoch": 1.3078848560700875, - "grad_norm": 2.0599172115325928, - "learning_rate": 1.976220244871079e-05, - "loss": 0.7839165925979614, - "step": 523, - "token_acc": 0.767715969527095 - }, - { - "epoch": 1.3103879849812266, - "grad_norm": 1.2310124635696411, - "learning_rate": 1.9642271173373737e-05, - "loss": 0.830912172794342, - "step": 524, - "token_acc": 0.7497665274023102 - }, - { - "epoch": 1.3128911138923653, - "grad_norm": 1.4539384841918945, - "learning_rate": 1.9522468996078258e-05, - "loss": 0.7132511138916016, - "step": 525, - "token_acc": 0.7868950749464668 - }, - { - "epoch": 1.3153942428035044, - "grad_norm": 5.704746723175049, - "learning_rate": 1.940279880353754e-05, - "loss": 0.8210383653640747, - "step": 526, - "token_acc": 0.7561708521141876 - }, - { - "epoch": 1.3178973717146434, - "grad_norm": 2.1198251247406006, - "learning_rate": 1.9283263479284514e-05, - "loss": 0.8160667419433594, - "step": 527, - "token_acc": 0.7549833887043189 - }, - { - "epoch": 1.3204005006257822, - "grad_norm": 1.768844723701477, - "learning_rate": 1.9163865903602374e-05, - "loss": 0.7602739930152893, - "step": 528, - "token_acc": 0.7743359280956584 - }, - { - "epoch": 1.3229036295369212, - "grad_norm": 3.8136727809906006, - "learning_rate": 1.9044608953455138e-05, - "loss": 0.7949267625808716, - "step": 529, - "token_acc": 0.7604166666666666 - }, - { - "epoch": 1.32540675844806, - "grad_norm": 1.3969098329544067, - "learning_rate": 1.8925495502418406e-05, - "loss": 0.8395500779151917, - "step": 530, - "token_acc": 0.7547573013127099 - }, - { - "epoch": 1.327909887359199, - "grad_norm": 2.3602702617645264, - "learning_rate": 1.880652842061004e-05, - "loss": 0.6325199604034424, - "step": 531, - "token_acc": 0.8049121258916097 - }, - { - "epoch": 1.330413016270338, - "grad_norm": 6.827362537384033, - "learning_rate": 1.868771057462105e-05, - "loss": 0.8032347559928894, - "step": 532, - "token_acc": 0.7577628688475925 - }, - { - "epoch": 1.3329161451814768, - "grad_norm": 2.2116971015930176, - "learning_rate": 1.8569044827446515e-05, - "loss": 0.7727822065353394, - "step": 533, - "token_acc": 0.770619378707661 - }, - { - "epoch": 1.3354192740926158, - "grad_norm": 1.6953080892562866, - "learning_rate": 1.8450534038416568e-05, - "loss": 0.8702293634414673, - "step": 534, - "token_acc": 0.7410009728677981 - }, - { - "epoch": 1.3379224030037546, - "grad_norm": 9.758813858032227, - "learning_rate": 1.8332181063127545e-05, - "loss": 0.7461093664169312, - "step": 535, - "token_acc": 0.7749614899873967 - }, - { - "epoch": 1.3404255319148937, - "grad_norm": 1.1418122053146362, - "learning_rate": 1.8213988753373146e-05, - "loss": 0.8273798227310181, - "step": 536, - "token_acc": 0.7499042512447338 - }, - { - "epoch": 1.3429286608260325, - "grad_norm": 1.871590256690979, - "learning_rate": 1.809595995707573e-05, - "loss": 0.8071326017379761, - "step": 537, - "token_acc": 0.7567946505608283 - }, - { - "epoch": 1.3454317897371715, - "grad_norm": 1.5790642499923706, - "learning_rate": 1.7978097518217703e-05, - "loss": 0.7012978196144104, - "step": 538, - "token_acc": 0.7855657398136024 - }, - { - "epoch": 1.3479349186483103, - "grad_norm": 2.052522659301758, - "learning_rate": 1.7860404276772945e-05, - "loss": 0.6337273120880127, - "step": 539, - "token_acc": 0.8069234097793163 - }, - { - "epoch": 1.3504380475594493, - "grad_norm": 1.3587812185287476, - "learning_rate": 1.7742883068638447e-05, - "loss": 0.8248769640922546, - "step": 540, - "token_acc": 0.7510279202725457 - }, - { - "epoch": 1.3529411764705883, - "grad_norm": 1.5436736345291138, - "learning_rate": 1.762553672556591e-05, - "loss": 0.8075623512268066, - "step": 541, - "token_acc": 0.7595460992907801 - }, - { - "epoch": 1.355444305381727, - "grad_norm": 2.2767934799194336, - "learning_rate": 1.7508368075093583e-05, - "loss": 0.7209601402282715, - "step": 542, - "token_acc": 0.7783203125 - }, - { - "epoch": 1.3579474342928661, - "grad_norm": 2.0432751178741455, - "learning_rate": 1.7391379940478076e-05, - "loss": 0.6441476345062256, - "step": 543, - "token_acc": 0.8064547869723507 - }, - { - "epoch": 1.360450563204005, - "grad_norm": 1.801803708076477, - "learning_rate": 1.7274575140626318e-05, - "loss": 0.7840845584869385, - "step": 544, - "token_acc": 0.7625759010640075 - }, - { - "epoch": 1.362953692115144, - "grad_norm": 2.2576844692230225, - "learning_rate": 1.7157956490027717e-05, - "loss": 0.754980742931366, - "step": 545, - "token_acc": 0.772340190223402 - }, - { - "epoch": 1.365456821026283, - "grad_norm": 7.710822105407715, - "learning_rate": 1.704152679868626e-05, - "loss": 0.6724915504455566, - "step": 546, - "token_acc": 0.7948899371069182 - }, - { - "epoch": 1.3679599499374218, - "grad_norm": 1.566840410232544, - "learning_rate": 1.6925288872052843e-05, - "loss": 0.805724024772644, - "step": 547, - "token_acc": 0.7583758937691522 - }, - { - "epoch": 1.3704630788485608, - "grad_norm": 2.7354047298431396, - "learning_rate": 1.6809245510957665e-05, - "loss": 0.8180174231529236, - "step": 548, - "token_acc": 0.7519490397413957 - }, - { - "epoch": 1.3729662077596996, - "grad_norm": 1.5053433179855347, - "learning_rate": 1.6693399511542735e-05, - "loss": 0.7254161834716797, - "step": 549, - "token_acc": 0.7824625502374863 - }, - { - "epoch": 1.3754693366708386, - "grad_norm": 1.9936115741729736, - "learning_rate": 1.65777536651945e-05, - "loss": 0.719433605670929, - "step": 550, - "token_acc": 0.7820769560863968 - }, - { - "epoch": 1.3779724655819774, - "grad_norm": 1.4493017196655273, - "learning_rate": 1.6462310758476595e-05, - "loss": 0.803730845451355, - "step": 551, - "token_acc": 0.7597644749754662 - }, - { - "epoch": 1.3804755944931164, - "grad_norm": 1.2181215286254883, - "learning_rate": 1.6347073573062672e-05, - "loss": 0.81937575340271, - "step": 552, - "token_acc": 0.7521792745673342 - }, - { - "epoch": 1.3829787234042552, - "grad_norm": 4.488533020019531, - "learning_rate": 1.6232044885669427e-05, - "loss": 0.7404607534408569, - "step": 553, - "token_acc": 0.7772408629959845 - }, - { - "epoch": 1.3854818523153942, - "grad_norm": 2.061286449432373, - "learning_rate": 1.6117227467989602e-05, - "loss": 0.6969904899597168, - "step": 554, - "token_acc": 0.7908102472445636 - }, - { - "epoch": 1.3879849812265332, - "grad_norm": 5.560731410980225, - "learning_rate": 1.6002624086625294e-05, - "loss": 0.8753557801246643, - "step": 555, - "token_acc": 0.7392388505089319 - }, - { - "epoch": 1.390488110137672, - "grad_norm": 2.4644906520843506, - "learning_rate": 1.588823750302126e-05, - "loss": 0.6984307169914246, - "step": 556, - "token_acc": 0.783540746688077 - }, - { - "epoch": 1.392991239048811, - "grad_norm": 6.086837291717529, - "learning_rate": 1.577407047339834e-05, - "loss": 0.7918856739997864, - "step": 557, - "token_acc": 0.7626044755998922 - }, - { - "epoch": 1.3954943679599499, - "grad_norm": 40.485443115234375, - "learning_rate": 1.5660125748687094e-05, - "loss": 0.6759528517723083, - "step": 558, - "token_acc": 0.7896958731799776 - }, - { - "epoch": 1.3979974968710889, - "grad_norm": 4.204066753387451, - "learning_rate": 1.5546406074461488e-05, - "loss": 0.8734142184257507, - "step": 559, - "token_acc": 0.7402841280209014 - }, - { - "epoch": 1.400500625782228, - "grad_norm": 1.534205436706543, - "learning_rate": 1.5432914190872757e-05, - "loss": 0.8061844110488892, - "step": 560, - "token_acc": 0.7598022502557109 - }, - { - "epoch": 1.4030037546933667, - "grad_norm": 2.5760042667388916, - "learning_rate": 1.5319652832583362e-05, - "loss": 0.7462766170501709, - "step": 561, - "token_acc": 0.7805115166018546 - }, - { - "epoch": 1.4055068836045057, - "grad_norm": 1.2807033061981201, - "learning_rate": 1.5206624728701103e-05, - "loss": 0.7794641256332397, - "step": 562, - "token_acc": 0.7705968754172787 - }, - { - "epoch": 1.4080100125156445, - "grad_norm": 1.3814904689788818, - "learning_rate": 1.5093832602713365e-05, - "loss": 0.8049334287643433, - "step": 563, - "token_acc": 0.7605047164032831 - }, - { - "epoch": 1.4105131414267835, - "grad_norm": 1.4789693355560303, - "learning_rate": 1.498127917242148e-05, - "loss": 0.6792148351669312, - "step": 564, - "token_acc": 0.7961648382041118 - }, - { - "epoch": 1.4130162703379223, - "grad_norm": 1.7311301231384277, - "learning_rate": 1.4868967149875257e-05, - "loss": 0.7710389494895935, - "step": 565, - "token_acc": 0.7728716399411264 - }, - { - "epoch": 1.4155193992490613, - "grad_norm": 1.134136438369751, - "learning_rate": 1.4756899241307615e-05, - "loss": 0.7549833059310913, - "step": 566, - "token_acc": 0.7709425608761505 - }, - { - "epoch": 1.4180225281602001, - "grad_norm": 2.795325994491577, - "learning_rate": 1.4645078147069402e-05, - "loss": 0.7068973183631897, - "step": 567, - "token_acc": 0.7866447278211984 - }, - { - "epoch": 1.4205256570713392, - "grad_norm": 2.4004311561584473, - "learning_rate": 1.4533506561564306e-05, - "loss": 0.7402547001838684, - "step": 568, - "token_acc": 0.7732777333485662 - }, - { - "epoch": 1.4230287859824782, - "grad_norm": 1.9645004272460938, - "learning_rate": 1.4422187173183899e-05, - "loss": 0.746313214302063, - "step": 569, - "token_acc": 0.7786008859019398 - }, - { - "epoch": 1.425531914893617, - "grad_norm": 7.375904560089111, - "learning_rate": 1.4311122664242954e-05, - "loss": 0.7958496809005737, - "step": 570, - "token_acc": 0.7603988464734347 - }, - { - "epoch": 1.428035043804756, - "grad_norm": 1.696038007736206, - "learning_rate": 1.4200315710914705e-05, - "loss": 0.7623685002326965, - "step": 571, - "token_acc": 0.7718207718207718 - }, - { - "epoch": 1.4305381727158948, - "grad_norm": 1.9560589790344238, - "learning_rate": 1.4089768983166444e-05, - "loss": 0.7280702590942383, - "step": 572, - "token_acc": 0.7799722429806768 - }, - { - "epoch": 1.4330413016270338, - "grad_norm": 2.5953147411346436, - "learning_rate": 1.3979485144695158e-05, - "loss": 0.654486894607544, - "step": 573, - "token_acc": 0.8006254290290595 - }, - { - "epoch": 1.4355444305381728, - "grad_norm": 1.1697745323181152, - "learning_rate": 1.38694668528633e-05, - "loss": 0.7936983108520508, - "step": 574, - "token_acc": 0.7653046280023433 - }, - { - "epoch": 1.4380475594493116, - "grad_norm": 2.1148157119750977, - "learning_rate": 1.3759716758634832e-05, - "loss": 0.8053967952728271, - "step": 575, - "token_acc": 0.7594241535590509 - }, - { - "epoch": 1.4405506883604506, - "grad_norm": 2.3193156719207764, - "learning_rate": 1.3650237506511331e-05, - "loss": 0.8046903610229492, - "step": 576, - "token_acc": 0.7616776718023966 - }, - { - "epoch": 1.4430538172715894, - "grad_norm": 4.965387344360352, - "learning_rate": 1.3541031734468212e-05, - "loss": 0.809991180896759, - "step": 577, - "token_acc": 0.7585025046137622 - }, - { - "epoch": 1.4455569461827285, - "grad_norm": 2.777501106262207, - "learning_rate": 1.3432102073891251e-05, - "loss": 0.6487606763839722, - "step": 578, - "token_acc": 0.8072299215227918 - }, - { - "epoch": 1.4480600750938675, - "grad_norm": 1.8217853307724, - "learning_rate": 1.3323451149513092e-05, - "loss": 0.6385177969932556, - "step": 579, - "token_acc": 0.8078879086663207 - }, - { - "epoch": 1.4505632040050063, - "grad_norm": 1.6126281023025513, - "learning_rate": 1.3215081579350058e-05, - "loss": 0.7538764476776123, - "step": 580, - "token_acc": 0.7765273311897106 - }, - { - "epoch": 1.453066332916145, - "grad_norm": 1.229370355606079, - "learning_rate": 1.3106995974639084e-05, - "loss": 0.7376300096511841, - "step": 581, - "token_acc": 0.7732833811391442 - }, - { - "epoch": 1.455569461827284, - "grad_norm": 1.6918634176254272, - "learning_rate": 1.2999196939774722e-05, - "loss": 0.9147740602493286, - "step": 582, - "token_acc": 0.7359253623768719 - }, - { - "epoch": 1.458072590738423, - "grad_norm": 6.232097625732422, - "learning_rate": 1.2891687072246472e-05, - "loss": 0.6440097093582153, - "step": 583, - "token_acc": 0.8036370671309732 - }, - { - "epoch": 1.460575719649562, - "grad_norm": 1.3691867589950562, - "learning_rate": 1.2784468962576136e-05, - "loss": 0.8547953963279724, - "step": 584, - "token_acc": 0.7434093093505424 - }, - { - "epoch": 1.463078848560701, - "grad_norm": 5.270246982574463, - "learning_rate": 1.2677545194255402e-05, - "loss": 0.7240179181098938, - "step": 585, - "token_acc": 0.7812846429735898 - }, - { - "epoch": 1.4655819774718397, - "grad_norm": 4.639716148376465, - "learning_rate": 1.2570918343683635e-05, - "loss": 0.7307671308517456, - "step": 586, - "token_acc": 0.7740117025831311 - }, - { - "epoch": 1.4680851063829787, - "grad_norm": 4.015777111053467, - "learning_rate": 1.2464590980105776e-05, - "loss": 0.8232721090316772, - "step": 587, - "token_acc": 0.7514532679573371 - }, - { - "epoch": 1.4705882352941178, - "grad_norm": 3.1545369625091553, - "learning_rate": 1.235856566555039e-05, - "loss": 0.6684552431106567, - "step": 588, - "token_acc": 0.7926829268292683 - }, - { - "epoch": 1.4730913642052565, - "grad_norm": 1.4123514890670776, - "learning_rate": 1.2252844954767984e-05, - "loss": 0.7221212983131409, - "step": 589, - "token_acc": 0.7806400809944316 - }, - { - "epoch": 1.4755944931163956, - "grad_norm": 2.0935285091400146, - "learning_rate": 1.2147431395169459e-05, - "loss": 0.6654121279716492, - "step": 590, - "token_acc": 0.7983262828765864 - }, - { - "epoch": 1.4780976220275344, - "grad_norm": 2.06630277633667, - "learning_rate": 1.2042327526764669e-05, - "loss": 0.7412019371986389, - "step": 591, - "token_acc": 0.7778124220503866 - }, - { - "epoch": 1.4806007509386734, - "grad_norm": 6.0032639503479, - "learning_rate": 1.1937535882101281e-05, - "loss": 0.6372846364974976, - "step": 592, - "token_acc": 0.803729146221786 - }, - { - "epoch": 1.4831038798498124, - "grad_norm": 4.389716148376465, - "learning_rate": 1.1833058986203705e-05, - "loss": 0.682616114616394, - "step": 593, - "token_acc": 0.7952238805970149 - }, - { - "epoch": 1.4856070087609512, - "grad_norm": 1.7360910177230835, - "learning_rate": 1.1728899356512265e-05, - "loss": 0.8019569516181946, - "step": 594, - "token_acc": 0.7640247879973907 - }, - { - "epoch": 1.48811013767209, - "grad_norm": 1.4876583814620972, - "learning_rate": 1.1625059502822574e-05, - "loss": 0.7209570407867432, - "step": 595, - "token_acc": 0.7803595962009438 - }, - { - "epoch": 1.490613266583229, - "grad_norm": 3.0514919757843018, - "learning_rate": 1.1521541927224994e-05, - "loss": 0.663855791091919, - "step": 596, - "token_acc": 0.801151700557855 - }, - { - "epoch": 1.493116395494368, - "grad_norm": 3.3372299671173096, - "learning_rate": 1.1418349124044405e-05, - "loss": 0.7273604273796082, - "step": 597, - "token_acc": 0.778789224393132 - }, - { - "epoch": 1.4956195244055068, - "grad_norm": 2.397977590560913, - "learning_rate": 1.1315483579780095e-05, - "loss": 0.884240984916687, - "step": 598, - "token_acc": 0.7410475340894609 - }, - { - "epoch": 1.4981226533166458, - "grad_norm": 2.4129981994628906, - "learning_rate": 1.1212947773045767e-05, - "loss": 0.6984825134277344, - "step": 599, - "token_acc": 0.786497277676951 - }, - { - "epoch": 1.5006257822277846, - "grad_norm": 0.9863743782043457, - "learning_rate": 1.1110744174509952e-05, - "loss": 0.7607206702232361, - "step": 600, - "token_acc": 0.7653004497902663 - }, - { - "epoch": 1.5031289111389237, - "grad_norm": 2.9565539360046387, - "learning_rate": 1.100887524683635e-05, - "loss": 0.7446565628051758, - "step": 601, - "token_acc": 0.773600569259962 - }, - { - "epoch": 1.5056320400500627, - "grad_norm": 1.515296220779419, - "learning_rate": 1.090734344462458e-05, - "loss": 0.888853132724762, - "step": 602, - "token_acc": 0.739697280885833 - }, - { - "epoch": 1.5081351689612015, - "grad_norm": 3.071218729019165, - "learning_rate": 1.0806151214350995e-05, - "loss": 0.7655630707740784, - "step": 603, - "token_acc": 0.7740929705215419 - }, - { - "epoch": 1.5106382978723403, - "grad_norm": 1.503035068511963, - "learning_rate": 1.0705300994309697e-05, - "loss": 0.747133731842041, - "step": 604, - "token_acc": 0.7726721139066418 - }, - { - "epoch": 1.5131414267834793, - "grad_norm": 1.4292892217636108, - "learning_rate": 1.0604795214553868e-05, - "loss": 0.6887509822845459, - "step": 605, - "token_acc": 0.7898035618741879 - }, - { - "epoch": 1.5156445556946183, - "grad_norm": 4.256486415863037, - "learning_rate": 1.0504636296837161e-05, - "loss": 0.8068586587905884, - "step": 606, - "token_acc": 0.7587569703860105 - }, - { - "epoch": 1.5181476846057573, - "grad_norm": 1.5744963884353638, - "learning_rate": 1.0404826654555342e-05, - "loss": 0.833703875541687, - "step": 607, - "token_acc": 0.7490119618485536 - }, - { - "epoch": 1.5206508135168961, - "grad_norm": 1.4943774938583374, - "learning_rate": 1.0305368692688174e-05, - "loss": 0.7888246178627014, - "step": 608, - "token_acc": 0.7641653905053599 - }, - { - "epoch": 1.523153942428035, - "grad_norm": 4.295377254486084, - "learning_rate": 1.0206264807741434e-05, - "loss": 0.7990449666976929, - "step": 609, - "token_acc": 0.7550613592474926 - }, - { - "epoch": 1.525657071339174, - "grad_norm": 1.5696173906326294, - "learning_rate": 1.0107517387689166e-05, - "loss": 0.6105284690856934, - "step": 610, - "token_acc": 0.8193157519600855 - }, - { - "epoch": 1.528160200250313, - "grad_norm": 1.4100733995437622, - "learning_rate": 1.0009128811916197e-05, - "loss": 0.6308101415634155, - "step": 611, - "token_acc": 0.8020977090808722 - }, - { - "epoch": 1.530663329161452, - "grad_norm": 1.636954426765442, - "learning_rate": 9.911101451160715e-06, - "loss": 0.7580888867378235, - "step": 612, - "token_acc": 0.7740969378399853 - }, - { - "epoch": 1.5331664580725908, - "grad_norm": 3.3348324298858643, - "learning_rate": 9.813437667457229e-06, - "loss": 0.6496917605400085, - "step": 613, - "token_acc": 0.8047304730473047 - }, - { - "epoch": 1.5356695869837296, - "grad_norm": 1.2093946933746338, - "learning_rate": 9.716139814079595e-06, - "loss": 0.8330615758895874, - "step": 614, - "token_acc": 0.7514138654127216 - }, - { - "epoch": 1.5381727158948686, - "grad_norm": 2.5762991905212402, - "learning_rate": 9.619210235484333e-06, - "loss": 0.7363358736038208, - "step": 615, - "token_acc": 0.7768673179955877 - }, - { - "epoch": 1.5406758448060076, - "grad_norm": 3.4001667499542236, - "learning_rate": 9.522651267254149e-06, - "loss": 0.7240384221076965, - "step": 616, - "token_acc": 0.7739171822941456 - }, - { - "epoch": 1.5431789737171464, - "grad_norm": 82.21798706054688, - "learning_rate": 9.426465236041651e-06, - "loss": 0.6950215697288513, - "step": 617, - "token_acc": 0.7900774304559793 - }, - { - "epoch": 1.5456821026282852, - "grad_norm": 1.1821529865264893, - "learning_rate": 9.330654459513266e-06, - "loss": 0.7954156398773193, - "step": 618, - "token_acc": 0.7626409334843188 - }, - { - "epoch": 1.5481852315394242, - "grad_norm": 2.2667031288146973, - "learning_rate": 9.235221246293405e-06, - "loss": 0.8089542388916016, - "step": 619, - "token_acc": 0.7574625144175318 - }, - { - "epoch": 1.5506883604505632, - "grad_norm": 1.9918934106826782, - "learning_rate": 9.140167895908867e-06, - "loss": 0.7781422138214111, - "step": 620, - "token_acc": 0.7674040568238037 - }, - { - "epoch": 1.5531914893617023, - "grad_norm": 3.942108631134033, - "learning_rate": 9.04549669873337e-06, - "loss": 0.8120257258415222, - "step": 621, - "token_acc": 0.7560487380330723 - }, - { - "epoch": 1.555694618272841, - "grad_norm": 1.7937588691711426, - "learning_rate": 8.951209935932426e-06, - "loss": 0.607784628868103, - "step": 622, - "token_acc": 0.8156992932105376 - }, - { - "epoch": 1.5581977471839799, - "grad_norm": 2.8172223567962646, - "learning_rate": 8.857309879408324e-06, - "loss": 0.6648784875869751, - "step": 623, - "token_acc": 0.80419430772523 - }, - { - "epoch": 1.5607008760951189, - "grad_norm": 3.8440911769866943, - "learning_rate": 8.763798791745411e-06, - "loss": 0.8074014186859131, - "step": 624, - "token_acc": 0.7604686482968106 - }, - { - "epoch": 1.563204005006258, - "grad_norm": 1.895396113395691, - "learning_rate": 8.670678926155587e-06, - "loss": 0.8305899500846863, - "step": 625, - "token_acc": 0.7504222361627177 - }, - { - "epoch": 1.565707133917397, - "grad_norm": 4.063203811645508, - "learning_rate": 8.577952526423969e-06, - "loss": 0.7936282157897949, - "step": 626, - "token_acc": 0.7642972633091802 - }, - { - "epoch": 1.5682102628285357, - "grad_norm": 2.0519766807556152, - "learning_rate": 8.48562182685487e-06, - "loss": 0.6997530460357666, - "step": 627, - "token_acc": 0.7890964093121137 - }, - { - "epoch": 1.5707133917396745, - "grad_norm": 1.731513500213623, - "learning_rate": 8.393689052217966e-06, - "loss": 0.6370196342468262, - "step": 628, - "token_acc": 0.8046017082098658 - }, - { - "epoch": 1.5732165206508135, - "grad_norm": 4.366064548492432, - "learning_rate": 8.3021564176946e-06, - "loss": 0.665263295173645, - "step": 629, - "token_acc": 0.7946243969676086 - }, - { - "epoch": 1.5757196495619525, - "grad_norm": 4.512490272521973, - "learning_rate": 8.211026128824539e-06, - "loss": 0.799260139465332, - "step": 630, - "token_acc": 0.7595476024479045 - }, - { - "epoch": 1.5782227784730913, - "grad_norm": 1.7154865264892578, - "learning_rate": 8.120300381452742e-06, - "loss": 0.8500877618789673, - "step": 631, - "token_acc": 0.7461655662772981 - }, - { - "epoch": 1.5807259073842301, - "grad_norm": 6.622365951538086, - "learning_rate": 8.029981361676456e-06, - "loss": 0.6213138103485107, - "step": 632, - "token_acc": 0.818997756170531 - }, - { - "epoch": 1.5832290362953692, - "grad_norm": 2.634678363800049, - "learning_rate": 7.940071245792579e-06, - "loss": 0.5984349250793457, - "step": 633, - "token_acc": 0.8174148526195189 - }, - { - "epoch": 1.5857321652065082, - "grad_norm": 3.43933367729187, - "learning_rate": 7.850572200245184e-06, - "loss": 0.6845875978469849, - "step": 634, - "token_acc": 0.7913089653951677 - }, - { - "epoch": 1.5882352941176472, - "grad_norm": 1.6064105033874512, - "learning_rate": 7.761486381573327e-06, - "loss": 0.688270092010498, - "step": 635, - "token_acc": 0.7903402854006586 - }, - { - "epoch": 1.590738423028786, - "grad_norm": 5.203895092010498, - "learning_rate": 7.672815936359107e-06, - "loss": 0.7587708234786987, - "step": 636, - "token_acc": 0.7722510074841681 - }, - { - "epoch": 1.5932415519399248, - "grad_norm": 1.948972225189209, - "learning_rate": 7.584563001175896e-06, - "loss": 0.8170541524887085, - "step": 637, - "token_acc": 0.754481905939417 - }, - { - "epoch": 1.5957446808510638, - "grad_norm": 4.16902494430542, - "learning_rate": 7.4967297025369114e-06, - "loss": 0.5899007320404053, - "step": 638, - "token_acc": 0.8284804903925498 - }, - { - "epoch": 1.5982478097622028, - "grad_norm": 0.9599528312683105, - "learning_rate": 7.409318156843933e-06, - "loss": 0.9341171979904175, - "step": 639, - "token_acc": 0.7272269753397081 - }, - { - "epoch": 1.6007509386733418, - "grad_norm": 1.6862908601760864, - "learning_rate": 7.3223304703363135e-06, - "loss": 0.7237805128097534, - "step": 640, - "token_acc": 0.7798726587129876 - }, - { - "epoch": 1.6032540675844806, - "grad_norm": 9.259711265563965, - "learning_rate": 7.235768739040258e-06, - "loss": 0.7982171177864075, - "step": 641, - "token_acc": 0.7613955353562358 - }, - { - "epoch": 1.6057571964956194, - "grad_norm": 2.008246660232544, - "learning_rate": 7.149635048718295e-06, - "loss": 0.8156529068946838, - "step": 642, - "token_acc": 0.755189366351056 - }, - { - "epoch": 1.6082603254067585, - "grad_norm": 5.8708086013793945, - "learning_rate": 7.063931474819005e-06, - "loss": 0.9388906955718994, - "step": 643, - "token_acc": 0.7229799968498977 - }, - { - "epoch": 1.6107634543178975, - "grad_norm": 1.3190078735351562, - "learning_rate": 6.9786600824270296e-06, - "loss": 0.8693231344223022, - "step": 644, - "token_acc": 0.7392319943372855 - }, - { - "epoch": 1.6132665832290363, - "grad_norm": 4.078483581542969, - "learning_rate": 6.893822926213331e-06, - "loss": 0.7646411657333374, - "step": 645, - "token_acc": 0.7693258166653796 - }, - { - "epoch": 1.615769712140175, - "grad_norm": 2.5179286003112793, - "learning_rate": 6.8094220503856275e-06, - "loss": 0.7106481790542603, - "step": 646, - "token_acc": 0.7891617273497037 - }, - { - "epoch": 1.618272841051314, - "grad_norm": 5.133343696594238, - "learning_rate": 6.725459488639211e-06, - "loss": 0.8767869472503662, - "step": 647, - "token_acc": 0.740031118026228 - }, - { - "epoch": 1.620775969962453, - "grad_norm": 8.591869354248047, - "learning_rate": 6.641937264107867e-06, - "loss": 0.7623345851898193, - "step": 648, - "token_acc": 0.7718807508281192 - }, - { - "epoch": 1.6232790988735921, - "grad_norm": 2.7604572772979736, - "learning_rate": 6.558857389315179e-06, - "loss": 0.5968680381774902, - "step": 649, - "token_acc": 0.8168473351400181 - }, - { - "epoch": 1.625782227784731, - "grad_norm": 2.0458874702453613, - "learning_rate": 6.476221866126029e-06, - "loss": 0.8066359162330627, - "step": 650, - "token_acc": 0.7615060638351855 - }, - { - "epoch": 1.6282853566958697, - "grad_norm": 4.87338924407959, - "learning_rate": 6.394032685698325e-06, - "loss": 0.8087641000747681, - "step": 651, - "token_acc": 0.7571403539512879 - }, - { - "epoch": 1.6307884856070087, - "grad_norm": 4.343956470489502, - "learning_rate": 6.312291828435077e-06, - "loss": 0.6187503933906555, - "step": 652, - "token_acc": 0.8083971686221274 - }, - { - "epoch": 1.6332916145181477, - "grad_norm": 1.9018688201904297, - "learning_rate": 6.231001263936651e-06, - "loss": 0.7172440886497498, - "step": 653, - "token_acc": 0.785246368555967 - }, - { - "epoch": 1.6357947434292868, - "grad_norm": 2.832977294921875, - "learning_rate": 6.150162950953264e-06, - "loss": 0.8469364643096924, - "step": 654, - "token_acc": 0.7480813982274596 - }, - { - "epoch": 1.6382978723404256, - "grad_norm": 3.063286304473877, - "learning_rate": 6.069778837337886e-06, - "loss": 0.8357624411582947, - "step": 655, - "token_acc": 0.750551461960858 - }, - { - "epoch": 1.6408010012515644, - "grad_norm": 1.9779434204101562, - "learning_rate": 5.989850859999227e-06, - "loss": 0.7701696157455444, - "step": 656, - "token_acc": 0.7706332533013205 - }, - { - "epoch": 1.6433041301627034, - "grad_norm": 1.5771499872207642, - "learning_rate": 5.910380944855087e-06, - "loss": 0.8876208662986755, - "step": 657, - "token_acc": 0.7388784978178751 - }, - { - "epoch": 1.6458072590738424, - "grad_norm": 3.870481491088867, - "learning_rate": 5.8313710067859626e-06, - "loss": 0.6020152568817139, - "step": 658, - "token_acc": 0.8167606083164948 - }, - { - "epoch": 1.6483103879849812, - "grad_norm": 12.5064115524292, - "learning_rate": 5.752822949588893e-06, - "loss": 0.797656774520874, - "step": 659, - "token_acc": 0.763301282051282 - }, - { - "epoch": 1.65081351689612, - "grad_norm": 1.7182737588882446, - "learning_rate": 5.674738665931575e-06, - "loss": 0.7682387828826904, - "step": 660, - "token_acc": 0.7715017939518196 - }, - { - "epoch": 1.653316645807259, - "grad_norm": 7.001367092132568, - "learning_rate": 5.597120037306808e-06, - "loss": 0.7216060757637024, - "step": 661, - "token_acc": 0.7849521852525093 - }, - { - "epoch": 1.655819774718398, - "grad_norm": 1.8173643350601196, - "learning_rate": 5.519968933987083e-06, - "loss": 0.7159848213195801, - "step": 662, - "token_acc": 0.7893794749403341 - }, - { - "epoch": 1.658322903629537, - "grad_norm": 8.282748222351074, - "learning_rate": 5.443287214979592e-06, - "loss": 0.5917546153068542, - "step": 663, - "token_acc": 0.8188921165982169 - }, - { - "epoch": 1.6608260325406758, - "grad_norm": 2.099350690841675, - "learning_rate": 5.367076727981382e-06, - "loss": 0.636560320854187, - "step": 664, - "token_acc": 0.8062931115940659 - }, - { - "epoch": 1.6633291614518146, - "grad_norm": 4.317834854125977, - "learning_rate": 5.291339309334845e-06, - "loss": 0.6860729455947876, - "step": 665, - "token_acc": 0.7957957957957958 - }, - { - "epoch": 1.6658322903629537, - "grad_norm": 5.11480712890625, - "learning_rate": 5.216076783983493e-06, - "loss": 0.6779101490974426, - "step": 666, - "token_acc": 0.7967749313815188 - }, - { - "epoch": 1.6683354192740927, - "grad_norm": 1.5895123481750488, - "learning_rate": 5.141290965427966e-06, - "loss": 0.8478509187698364, - "step": 667, - "token_acc": 0.7479652886325662 - }, - { - "epoch": 1.6708385481852317, - "grad_norm": 3.479113817214966, - "learning_rate": 5.066983655682325e-06, - "loss": 0.8040021657943726, - "step": 668, - "token_acc": 0.7578496924311313 - }, - { - "epoch": 1.6733416770963705, - "grad_norm": 1.4634630680084229, - "learning_rate": 4.993156645230643e-06, - "loss": 0.799077033996582, - "step": 669, - "token_acc": 0.7607260726072608 - }, - { - "epoch": 1.6758448060075093, - "grad_norm": 6.28387451171875, - "learning_rate": 4.91981171298388e-06, - "loss": 0.7174551486968994, - "step": 670, - "token_acc": 0.7794550810014728 - }, - { - "epoch": 1.6783479349186483, - "grad_norm": 3.8518054485321045, - "learning_rate": 4.846950626236976e-06, - "loss": 0.8177169561386108, - "step": 671, - "token_acc": 0.7455885405854266 - }, - { - "epoch": 1.6808510638297873, - "grad_norm": 3.1458609104156494, - "learning_rate": 4.7745751406263165e-06, - "loss": 0.7765710353851318, - "step": 672, - "token_acc": 0.7667461521786256 - }, - { - "epoch": 1.6833541927409261, - "grad_norm": 1.782895565032959, - "learning_rate": 4.702687000087386e-06, - "loss": 0.687012791633606, - "step": 673, - "token_acc": 0.7832773746344633 - }, - { - "epoch": 1.685857321652065, - "grad_norm": 2.870626449584961, - "learning_rate": 4.631287936812764e-06, - "loss": 0.755160927772522, - "step": 674, - "token_acc": 0.7690091515083042 - }, - { - "epoch": 1.688360450563204, - "grad_norm": 2.437972068786621, - "learning_rate": 4.56037967121041e-06, - "loss": 0.7369386553764343, - "step": 675, - "token_acc": 0.7773949579831932 - }, - { - "epoch": 1.690863579474343, - "grad_norm": 1.6886603832244873, - "learning_rate": 4.48996391186216e-06, - "loss": 0.8560739755630493, - "step": 676, - "token_acc": 0.7430776214253291 - }, - { - "epoch": 1.693366708385482, - "grad_norm": 21.07199478149414, - "learning_rate": 4.420042355482601e-06, - "loss": 0.781265377998352, - "step": 677, - "token_acc": 0.7665111841407823 - }, - { - "epoch": 1.6958698372966208, - "grad_norm": 1.2242755889892578, - "learning_rate": 4.350616686878176e-06, - "loss": 0.7612134218215942, - "step": 678, - "token_acc": 0.7721851406061933 - }, - { - "epoch": 1.6983729662077596, - "grad_norm": 0.8354982733726501, - "learning_rate": 4.2816885789065504e-06, - "loss": 0.8463018536567688, - "step": 679, - "token_acc": 0.7483333886106597 - }, - { - "epoch": 1.7008760951188986, - "grad_norm": 2.063284397125244, - "learning_rate": 4.213259692436367e-06, - "loss": 0.7081665992736816, - "step": 680, - "token_acc": 0.7886647454370798 - }, - { - "epoch": 1.7033792240300376, - "grad_norm": 3.285679578781128, - "learning_rate": 4.1453316763071935e-06, - "loss": 0.7210719585418701, - "step": 681, - "token_acc": 0.7862992125984252 - }, - { - "epoch": 1.7058823529411766, - "grad_norm": 2.652149200439453, - "learning_rate": 4.077906167289766e-06, - "loss": 0.7026036977767944, - "step": 682, - "token_acc": 0.7869218738363 - }, - { - "epoch": 1.7083854818523154, - "grad_norm": 4.502437114715576, - "learning_rate": 4.010984790046615e-06, - "loss": 0.6683995723724365, - "step": 683, - "token_acc": 0.8000765990042129 - }, - { - "epoch": 1.7108886107634542, - "grad_norm": 1.6601204872131348, - "learning_rate": 3.944569157092839e-06, - "loss": 0.8401004672050476, - "step": 684, - "token_acc": 0.7523236102180394 - }, - { - "epoch": 1.7133917396745932, - "grad_norm": 2.283055067062378, - "learning_rate": 3.878660868757323e-06, - "loss": 0.6021827459335327, - "step": 685, - "token_acc": 0.8168639560816606 - }, - { - "epoch": 1.7158948685857323, - "grad_norm": 4.256300449371338, - "learning_rate": 3.8132615131441396e-06, - "loss": 0.8827997446060181, - "step": 686, - "token_acc": 0.7379034203290077 - }, - { - "epoch": 1.718397997496871, - "grad_norm": 2.741607189178467, - "learning_rate": 3.748372666094277e-06, - "loss": 0.8296160697937012, - "step": 687, - "token_acc": 0.7515824236308596 - }, - { - "epoch": 1.7209011264080099, - "grad_norm": 2.7922463417053223, - "learning_rate": 3.6839958911476957e-06, - "loss": 0.6963903307914734, - "step": 688, - "token_acc": 0.7873990565283441 - }, - { - "epoch": 1.7234042553191489, - "grad_norm": 3.104214668273926, - "learning_rate": 3.6201327395056246e-06, - "loss": 0.6887581944465637, - "step": 689, - "token_acc": 0.7897428808404755 - }, - { - "epoch": 1.7259073842302879, - "grad_norm": 1.7422378063201904, - "learning_rate": 3.5567847499932e-06, - "loss": 0.7376011610031128, - "step": 690, - "token_acc": 0.7791123130766784 - }, - { - "epoch": 1.728410513141427, - "grad_norm": 4.056087017059326, - "learning_rate": 3.4939534490223912e-06, - "loss": 0.6779285669326782, - "step": 691, - "token_acc": 0.7956978388204403 - }, - { - "epoch": 1.7309136420525657, - "grad_norm": 2.119060754776001, - "learning_rate": 3.431640350555204e-06, - "loss": 0.607970118522644, - "step": 692, - "token_acc": 0.8137347130761995 - }, - { - "epoch": 1.7334167709637045, - "grad_norm": 3.5627596378326416, - "learning_rate": 3.369846956067224e-06, - "loss": 0.6902151703834534, - "step": 693, - "token_acc": 0.7917407065178762 - }, - { - "epoch": 1.7359198998748435, - "grad_norm": 1.4984737634658813, - "learning_rate": 3.308574754511404e-06, - "loss": 0.7758938074111938, - "step": 694, - "token_acc": 0.762149109568367 - }, - { - "epoch": 1.7384230287859825, - "grad_norm": 1.5274784564971924, - "learning_rate": 3.2478252222822164e-06, - "loss": 0.7710534930229187, - "step": 695, - "token_acc": 0.7703561400916211 - }, - { - "epoch": 1.7409261576971216, - "grad_norm": 2.8826518058776855, - "learning_rate": 3.187599823180071e-06, - "loss": 0.7928391098976135, - "step": 696, - "token_acc": 0.7606636399304971 - }, - { - "epoch": 1.7434292866082604, - "grad_norm": 2.2529659271240234, - "learning_rate": 3.1279000083760447e-06, - "loss": 0.6973885297775269, - "step": 697, - "token_acc": 0.7895693858996611 - }, - { - "epoch": 1.7459324155193992, - "grad_norm": 2.2448058128356934, - "learning_rate": 3.0687272163768987e-06, - "loss": 0.743259072303772, - "step": 698, - "token_acc": 0.7773190556057283 - }, - { - "epoch": 1.7484355444305382, - "grad_norm": 1.8807514905929565, - "learning_rate": 3.0100828729904275e-06, - "loss": 0.8025498390197754, - "step": 699, - "token_acc": 0.7638834444008885 - }, - { - "epoch": 1.7509386733416772, - "grad_norm": 1.153306245803833, - "learning_rate": 2.9519683912911266e-06, - "loss": 0.893805980682373, - "step": 700, - "token_acc": 0.7385200734715298 - }, - { - "epoch": 1.753441802252816, - "grad_norm": 2.2380430698394775, - "learning_rate": 2.894385171586095e-06, - "loss": 0.8276506662368774, - "step": 701, - "token_acc": 0.7531895732225947 - }, - { - "epoch": 1.7559449311639548, - "grad_norm": 1.6930055618286133, - "learning_rate": 2.837334601381342e-06, - "loss": 0.8278867602348328, - "step": 702, - "token_acc": 0.7534786253143336 - }, - { - "epoch": 1.7584480600750938, - "grad_norm": 3.543760061264038, - "learning_rate": 2.7808180553483165e-06, - "loss": 0.6783448457717896, - "step": 703, - "token_acc": 0.7924724474942816 - }, - { - "epoch": 1.7609511889862328, - "grad_norm": 1.704220175743103, - "learning_rate": 2.7248368952908053e-06, - "loss": 0.8161231279373169, - "step": 704, - "token_acc": 0.7625753361149745 - }, - { - "epoch": 1.7634543178973718, - "grad_norm": 1.620800256729126, - "learning_rate": 2.66939247011212e-06, - "loss": 0.768420934677124, - "step": 705, - "token_acc": 0.7742177253138467 - }, - { - "epoch": 1.7659574468085106, - "grad_norm": 1.7285171747207642, - "learning_rate": 2.6144861157825774e-06, - "loss": 0.7348212003707886, - "step": 706, - "token_acc": 0.7808262377798801 - }, - { - "epoch": 1.7684605757196494, - "grad_norm": 1.4333690404891968, - "learning_rate": 2.560119155307325e-06, - "loss": 0.7314651608467102, - "step": 707, - "token_acc": 0.7796940845949742 - }, - { - "epoch": 1.7709637046307884, - "grad_norm": 1.7918055057525635, - "learning_rate": 2.506292898694468e-06, - "loss": 0.8795416355133057, - "step": 708, - "token_acc": 0.737824045723617 - }, - { - "epoch": 1.7734668335419275, - "grad_norm": 2.1157777309417725, - "learning_rate": 2.45300864292346e-06, - "loss": 0.894432783126831, - "step": 709, - "token_acc": 0.7341743737092574 - }, - { - "epoch": 1.7759699624530665, - "grad_norm": 1.042678713798523, - "learning_rate": 2.4002676719139166e-06, - "loss": 0.717205822467804, - "step": 710, - "token_acc": 0.7850774581093898 - }, - { - "epoch": 1.7784730913642053, - "grad_norm": 2.729677200317383, - "learning_rate": 2.348071256494633e-06, - "loss": 0.738883376121521, - "step": 711, - "token_acc": 0.774821622929012 - }, - { - "epoch": 1.780976220275344, - "grad_norm": 1.8060981035232544, - "learning_rate": 2.296420654372966e-06, - "loss": 0.8860949277877808, - "step": 712, - "token_acc": 0.7436983689896208 - }, - { - "epoch": 1.783479349186483, - "grad_norm": 1.4554176330566406, - "learning_rate": 2.2453171101045585e-06, - "loss": 0.7235304713249207, - "step": 713, - "token_acc": 0.7811943910598619 - }, - { - "epoch": 1.7859824780976221, - "grad_norm": 2.336805820465088, - "learning_rate": 2.1947618550633097e-06, - "loss": 0.778596818447113, - "step": 714, - "token_acc": 0.7634328358208955 - }, - { - "epoch": 1.788485607008761, - "grad_norm": 3.8445966243743896, - "learning_rate": 2.144756107411733e-06, - "loss": 0.7483553886413574, - "step": 715, - "token_acc": 0.7775210084033614 - }, - { - "epoch": 1.7909887359198997, - "grad_norm": 2.3585619926452637, - "learning_rate": 2.0953010720716037e-06, - "loss": 0.716320276260376, - "step": 716, - "token_acc": 0.7816982878297085 - }, - { - "epoch": 1.7934918648310387, - "grad_norm": 1.595811128616333, - "learning_rate": 2.0463979406949026e-06, - "loss": 0.8576230406761169, - "step": 717, - "token_acc": 0.746366182157621 - }, - { - "epoch": 1.7959949937421777, - "grad_norm": 1.7587617635726929, - "learning_rate": 1.99804789163513e-06, - "loss": 0.7772994041442871, - "step": 718, - "token_acc": 0.7629286376274328 - }, - { - "epoch": 1.7984981226533168, - "grad_norm": 1.4931272268295288, - "learning_rate": 1.9502520899188913e-06, - "loss": 0.7527475357055664, - "step": 719, - "token_acc": 0.7721652929382936 - }, - { - "epoch": 1.8010012515644556, - "grad_norm": 1.531715750694275, - "learning_rate": 1.9030116872178316e-06, - "loss": 0.6039245128631592, - "step": 720, - "token_acc": 0.8160659114315139 - }, - { - "epoch": 1.8035043804755944, - "grad_norm": 2.856832265853882, - "learning_rate": 1.8563278218208996e-06, - "loss": 0.6180843114852905, - "step": 721, - "token_acc": 0.8108873823737731 - }, - { - "epoch": 1.8060075093867334, - "grad_norm": 1.1132346391677856, - "learning_rate": 1.8102016186068993e-06, - "loss": 0.8737172484397888, - "step": 722, - "token_acc": 0.7398431570958766 - }, - { - "epoch": 1.8085106382978724, - "grad_norm": 6.132575511932373, - "learning_rate": 1.7646341890173918e-06, - "loss": 0.8254008293151855, - "step": 723, - "token_acc": 0.751407584175398 - }, - { - "epoch": 1.8110137672090114, - "grad_norm": 2.00321102142334, - "learning_rate": 1.7196266310299108e-06, - "loss": 0.733837902545929, - "step": 724, - "token_acc": 0.7794028031687995 - }, - { - "epoch": 1.8135168961201502, - "grad_norm": 6.0143303871154785, - "learning_rate": 1.675180029131529e-06, - "loss": 0.7438793778419495, - "step": 725, - "token_acc": 0.7769918868317037 - }, - { - "epoch": 1.816020025031289, - "grad_norm": 2.49967885017395, - "learning_rate": 1.631295454292689e-06, - "loss": 0.7499393224716187, - "step": 726, - "token_acc": 0.775504799735187 - }, - { - "epoch": 1.818523153942428, - "grad_norm": 1.4528077840805054, - "learning_rate": 1.5879739639414333e-06, - "loss": 0.7836969494819641, - "step": 727, - "token_acc": 0.7696645543863729 - }, - { - "epoch": 1.821026282853567, - "grad_norm": 22.462095260620117, - "learning_rate": 1.5452166019378989e-06, - "loss": 0.7196674942970276, - "step": 728, - "token_acc": 0.7898250961608244 - }, - { - "epoch": 1.8235294117647058, - "grad_norm": 3.007601737976074, - "learning_rate": 1.5030243985491743e-06, - "loss": 0.7916804552078247, - "step": 729, - "token_acc": 0.7576646375207526 - }, - { - "epoch": 1.8260325406758446, - "grad_norm": 2.6443252563476562, - "learning_rate": 1.4613983704244826e-06, - "loss": 0.7311182022094727, - "step": 730, - "token_acc": 0.7860810039931546 - }, - { - "epoch": 1.8285356695869837, - "grad_norm": 1.2065683603286743, - "learning_rate": 1.4203395205706683e-06, - "loss": 0.7740092277526855, - "step": 731, - "token_acc": 0.7687374985292388 - }, - { - "epoch": 1.8310387984981227, - "grad_norm": 1.1605993509292603, - "learning_rate": 1.379848838328049e-06, - "loss": 0.7189797163009644, - "step": 732, - "token_acc": 0.7794039984911354 - }, - { - "epoch": 1.8335419274092617, - "grad_norm": 1.9326108694076538, - "learning_rate": 1.3399272993465607e-06, - "loss": 0.7424600124359131, - "step": 733, - "token_acc": 0.7825671804665121 - }, - { - "epoch": 1.8360450563204005, - "grad_norm": 2.958646535873413, - "learning_rate": 1.3005758655622424e-06, - "loss": 0.8237686157226562, - "step": 734, - "token_acc": 0.7547775902433712 - }, - { - "epoch": 1.8385481852315393, - "grad_norm": 1.700523018836975, - "learning_rate": 1.2617954851740832e-06, - "loss": 0.8861091136932373, - "step": 735, - "token_acc": 0.7374762500579267 - }, - { - "epoch": 1.8410513141426783, - "grad_norm": 1.633963942527771, - "learning_rate": 1.2235870926211619e-06, - "loss": 0.8130168914794922, - "step": 736, - "token_acc": 0.7547261035633128 - }, - { - "epoch": 1.8435544430538173, - "grad_norm": 3.219843864440918, - "learning_rate": 1.185951608560118e-06, - "loss": 0.6266460418701172, - "step": 737, - "token_acc": 0.8112291350531108 - }, - { - "epoch": 1.8460575719649563, - "grad_norm": 2.2112655639648438, - "learning_rate": 1.1488899398429898e-06, - "loss": 0.6900491118431091, - "step": 738, - "token_acc": 0.7942750756341633 - }, - { - "epoch": 1.8485607008760951, - "grad_norm": 6.101293563842773, - "learning_rate": 1.1124029794953472e-06, - "loss": 0.7254830598831177, - "step": 739, - "token_acc": 0.7787065180682202 - }, - { - "epoch": 1.851063829787234, - "grad_norm": 2.3905293941497803, - "learning_rate": 1.0764916066947794e-06, - "loss": 0.7382086515426636, - "step": 740, - "token_acc": 0.7783818923231488 - }, - { - "epoch": 1.853566958698373, - "grad_norm": 1.8113223314285278, - "learning_rate": 1.041156686749717e-06, - "loss": 0.811902642250061, - "step": 741, - "token_acc": 0.7596169453010875 - }, - { - "epoch": 1.856070087609512, - "grad_norm": 4.407388687133789, - "learning_rate": 1.0063990710785648e-06, - "loss": 0.7142600417137146, - "step": 742, - "token_acc": 0.7852945724447193 - }, - { - "epoch": 1.8585732165206508, - "grad_norm": 1.1643099784851074, - "learning_rate": 9.72219597189211e-07, - "loss": 0.8047236204147339, - "step": 743, - "token_acc": 0.7600485865724381 - }, - { - "epoch": 1.8610763454317898, - "grad_norm": 2.4160287380218506, - "learning_rate": 9.386190886588208e-07, - "loss": 0.6937112808227539, - "step": 744, - "token_acc": 0.7878059305838111 - }, - { - "epoch": 1.8635794743429286, - "grad_norm": 1.315184473991394, - "learning_rate": 9.05598355114004e-07, - "loss": 0.876803994178772, - "step": 745, - "token_acc": 0.7401197096404466 - }, - { - "epoch": 1.8660826032540676, - "grad_norm": 2.9270501136779785, - "learning_rate": 8.731581922113153e-07, - "loss": 0.7580727338790894, - "step": 746, - "token_acc": 0.7737367235275185 - }, - { - "epoch": 1.8685857321652066, - "grad_norm": 1.6372531652450562, - "learning_rate": 8.412993816180687e-07, - "loss": 0.7181699275970459, - "step": 747, - "token_acc": 0.779748401732316 - }, - { - "epoch": 1.8710888610763454, - "grad_norm": 1.4564203023910522, - "learning_rate": 8.10022690993506e-07, - "loss": 0.8921884298324585, - "step": 748, - "token_acc": 0.7377817853922453 - }, - { - "epoch": 1.8735919899874842, - "grad_norm": 4.111305236816406, - "learning_rate": 7.793288739703003e-07, - "loss": 0.8103642463684082, - "step": 749, - "token_acc": 0.7564119255305298 - }, - { - "epoch": 1.8760951188986232, - "grad_norm": 2.841183662414551, - "learning_rate": 7.492186701364007e-07, - "loss": 0.7386457920074463, - "step": 750, - "token_acc": 0.7820195137060555 - }, - { - "epoch": 1.8785982478097623, - "grad_norm": 2.0187108516693115, - "learning_rate": 7.196928050172053e-07, - "loss": 0.7814586758613586, - "step": 751, - "token_acc": 0.7652768936982813 - }, - { - "epoch": 1.8811013767209013, - "grad_norm": 3.561798334121704, - "learning_rate": 6.907519900580861e-07, - "loss": 0.6460806131362915, - "step": 752, - "token_acc": 0.8037120359955006 - }, - { - "epoch": 1.88360450563204, - "grad_norm": 3.151549816131592, - "learning_rate": 6.623969226072363e-07, - "loss": 0.7674912214279175, - "step": 753, - "token_acc": 0.7724372607401105 - }, - { - "epoch": 1.8861076345431789, - "grad_norm": 2.0892200469970703, - "learning_rate": 6.34628285898875e-07, - "loss": 0.8482470512390137, - "step": 754, - "token_acc": 0.7474721941354904 - }, - { - "epoch": 1.8886107634543179, - "grad_norm": 1.6496350765228271, - "learning_rate": 6.074467490367885e-07, - "loss": 0.7435787320137024, - "step": 755, - "token_acc": 0.7757959211146261 - }, - { - "epoch": 1.891113892365457, - "grad_norm": 1.8355616331100464, - "learning_rate": 5.808529669781904e-07, - "loss": 0.7615770101547241, - "step": 756, - "token_acc": 0.7705570291777188 - }, - { - "epoch": 1.8936170212765957, - "grad_norm": 2.422044277191162, - "learning_rate": 5.548475805179587e-07, - "loss": 0.7810842394828796, - "step": 757, - "token_acc": 0.7644932774324129 - }, - { - "epoch": 1.8961201501877347, - "grad_norm": 2.868595838546753, - "learning_rate": 5.294312162731934e-07, - "loss": 0.6938495635986328, - "step": 758, - "token_acc": 0.788420245398773 - }, - { - "epoch": 1.8986232790988735, - "grad_norm": 4.853105545043945, - "learning_rate": 5.046044866680949e-07, - "loss": 0.791533887386322, - "step": 759, - "token_acc": 0.7672524646378054 - }, - { - "epoch": 1.9011264080100125, - "grad_norm": 1.6451623439788818, - "learning_rate": 4.803679899192392e-07, - "loss": 0.7878414988517761, - "step": 760, - "token_acc": 0.761115797083986 - }, - { - "epoch": 1.9036295369211516, - "grad_norm": 1.6281623840332031, - "learning_rate": 4.5672231002114596e-07, - "loss": 0.7406682968139648, - "step": 761, - "token_acc": 0.7717826501429933 - }, - { - "epoch": 1.9061326658322904, - "grad_norm": 1.777449131011963, - "learning_rate": 4.3366801673220545e-07, - "loss": 0.7335410118103027, - "step": 762, - "token_acc": 0.7766620058472099 - }, - { - "epoch": 1.9086357947434291, - "grad_norm": 2.0511081218719482, - "learning_rate": 4.1120566556096254e-07, - "loss": 0.7191562652587891, - "step": 763, - "token_acc": 0.777927795714705 - }, - { - "epoch": 1.9111389236545682, - "grad_norm": 34.73859786987305, - "learning_rate": 3.8933579775271013e-07, - "loss": 0.6233887672424316, - "step": 764, - "token_acc": 0.8098615719025283 - }, - { - "epoch": 1.9136420525657072, - "grad_norm": 4.507017612457275, - "learning_rate": 3.680589402764695e-07, - "loss": 0.7649139761924744, - "step": 765, - "token_acc": 0.7664914450628736 - }, - { - "epoch": 1.9161451814768462, - "grad_norm": 1.5273257493972778, - "learning_rate": 3.4737560581228344e-07, - "loss": 0.7493445873260498, - "step": 766, - "token_acc": 0.7755552669177815 - }, - { - "epoch": 1.918648310387985, - "grad_norm": 1.2997462749481201, - "learning_rate": 3.2728629273885425e-07, - "loss": 0.8165085315704346, - "step": 767, - "token_acc": 0.7531951150241408 - }, - { - "epoch": 1.9211514392991238, - "grad_norm": 2.502765655517578, - "learning_rate": 3.077914851215585e-07, - "loss": 0.7242743372917175, - "step": 768, - "token_acc": 0.7824535192563081 - }, - { - "epoch": 1.9236545682102628, - "grad_norm": 2.90618896484375, - "learning_rate": 2.8889165270075126e-07, - "loss": 0.6685161590576172, - "step": 769, - "token_acc": 0.7950128346167951 - }, - { - "epoch": 1.9261576971214018, - "grad_norm": 2.6155359745025635, - "learning_rate": 2.705872508804747e-07, - "loss": 0.6183698177337646, - "step": 770, - "token_acc": 0.8151649235720032 - }, - { - "epoch": 1.9286608260325406, - "grad_norm": 2.363255500793457, - "learning_rate": 2.5287872071747543e-07, - "loss": 0.8080651760101318, - "step": 771, - "token_acc": 0.7587373167981961 - }, - { - "epoch": 1.9311639549436797, - "grad_norm": 8.026527404785156, - "learning_rate": 2.3576648891056875e-07, - "loss": 0.6179733276367188, - "step": 772, - "token_acc": 0.8178614579138139 - }, - { - "epoch": 1.9336670838548184, - "grad_norm": 3.891880512237549, - "learning_rate": 2.192509677903687e-07, - "loss": 0.785454273223877, - "step": 773, - "token_acc": 0.7663445975771249 - }, - { - "epoch": 1.9361702127659575, - "grad_norm": 0.9011037945747375, - "learning_rate": 2.0333255530934902e-07, - "loss": 0.8462287187576294, - "step": 774, - "token_acc": 0.7474073788503798 - }, - { - "epoch": 1.9386733416770965, - "grad_norm": 1.7468829154968262, - "learning_rate": 1.8801163503225083e-07, - "loss": 0.755885124206543, - "step": 775, - "token_acc": 0.7779124876005731 - }, - { - "epoch": 1.9411764705882353, - "grad_norm": 16.33168601989746, - "learning_rate": 1.732885761268427e-07, - "loss": 0.742058515548706, - "step": 776, - "token_acc": 0.7788488800680465 - }, - { - "epoch": 1.943679599499374, - "grad_norm": 19.74774932861328, - "learning_rate": 1.5916373335503054e-07, - "loss": 0.7660764455795288, - "step": 777, - "token_acc": 0.7678982434887947 - }, - { - "epoch": 1.946182728410513, - "grad_norm": 1.5675026178359985, - "learning_rate": 1.4563744706429515e-07, - "loss": 0.6421328783035278, - "step": 778, - "token_acc": 0.8060836501901141 - }, - { - "epoch": 1.9486858573216521, - "grad_norm": 1.9018704891204834, - "learning_rate": 1.327100431795125e-07, - "loss": 0.6940315961837769, - "step": 779, - "token_acc": 0.789420871559633 - }, - { - "epoch": 1.9511889862327911, - "grad_norm": 1.971119999885559, - "learning_rate": 1.2038183319507955e-07, - "loss": 0.8620060086250305, - "step": 780, - "token_acc": 0.7449793013787677 - } - ], - "logging_steps": 1, - "max_steps": 800, - "num_input_tokens_seen": 0, - "num_train_epochs": 2, - "save_steps": 10, - "stateful_callbacks": { - "TrainerControl": { - "args": { - "should_epoch_stop": false, - "should_evaluate": false, - "should_log": false, - "should_save": true, - "should_training_stop": false - }, - "attributes": {} - } - }, - "total_flos": 4.478199832879563e+18, - "train_batch_size": 1, - "trial_name": null, - "trial_params": null -} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/training_args.bin deleted file mode 100644 index b5dfe97fa8d66e2d8ab6fe9886964ee4d0bc636e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/training_args.bin +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b9a50cc53a1f7e3013bc39de6123df9ac0ed7377e31847b3f7c939c24348054e -size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/zero_to_fp32.py deleted file mode 100644 index 5995d6e6f04e43b989587aa9022a3aef0c66d694..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-780/zero_to_fp32.py +++ /dev/null @@ -1,760 +0,0 @@ -#!/usr/bin/env python - -# Copyright (c) Microsoft Corporation. -# SPDX-License-Identifier: Apache-2.0 - -# DeepSpeed Team - -# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets -# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in -# the future. Once extracted, the weights don't require DeepSpeed and can be used in any -# application. -# -# example: -# python zero_to_fp32.py . output_dir/ -# or -# python zero_to_fp32.py . output_dir/ --safe_serialization - -import argparse -import torch -import glob -import math -import os -import re -import gc -import json -import numpy as np -from tqdm import tqdm -from collections import OrderedDict -from dataclasses import dataclass - -# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with -# DeepSpeed data structures it has to be available in the current python environment. -from deepspeed.utils import logger -from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, - FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, - FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) - - -@dataclass -class zero_model_state: - buffers: dict() - param_shapes: dict() - shared_params: list - ds_version: int - frozen_param_shapes: dict() - frozen_param_fragments: dict() - - -debug = 0 - -# load to cpu -device = torch.device('cpu') - - -def atoi(text): - return int(text) if text.isdigit() else text - - -def natural_keys(text): - ''' - alist.sort(key=natural_keys) sorts in human order - http://nedbatchelder.com/blog/200712/human_sorting.html - (See Toothy's implementation in the comments) - ''' - return [atoi(c) for c in re.split(r'(\d+)', text)] - - -def get_model_state_file(checkpoint_dir, zero_stage): - if not os.path.isdir(checkpoint_dir): - raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") - - # there should be only one file - if zero_stage <= 2: - file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") - elif zero_stage == 3: - file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") - - if not os.path.exists(file): - raise FileNotFoundError(f"can't find model states file at '{file}'") - - return file - - -def get_checkpoint_files(checkpoint_dir, glob_pattern): - # XXX: need to test that this simple glob rule works for multi-node setup too - ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) - - if len(ckpt_files) == 0: - raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") - - return ckpt_files - - -def get_optim_files(checkpoint_dir): - return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") - - -def get_model_state_files(checkpoint_dir): - return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") - - -def parse_model_states(files): - zero_model_states = [] - for file in files: - state_dict = torch.load(file, map_location=device, weights_only=False) - - if BUFFER_NAMES not in state_dict: - raise ValueError(f"{file} is not a model state checkpoint") - buffer_names = state_dict[BUFFER_NAMES] - if debug: - print("Found buffers:", buffer_names) - - # recover just the buffers while restoring them to fp32 if they were saved in fp16 - buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} - param_shapes = state_dict[PARAM_SHAPES] - - # collect parameters that are included in param_shapes - param_names = [] - for s in param_shapes: - for name in s.keys(): - param_names.append(name) - - # update with frozen parameters - frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) - if frozen_param_shapes is not None: - if debug: - print(f"Found frozen_param_shapes: {frozen_param_shapes}") - param_names += list(frozen_param_shapes.keys()) - - # handle shared params - shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] - - ds_version = state_dict.get(DS_VERSION, None) - - frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) - - z_model_state = zero_model_state(buffers=buffers, - param_shapes=param_shapes, - shared_params=shared_params, - ds_version=ds_version, - frozen_param_shapes=frozen_param_shapes, - frozen_param_fragments=frozen_param_fragments) - zero_model_states.append(z_model_state) - - return zero_model_states - - -def parse_optim_states(files, ds_checkpoint_dir): - total_files = len(files) - state_dicts = [] - for f in tqdm(files, desc='Loading checkpoint shards'): - state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) - # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights - # and also handle the case where it was already removed by another helper script - state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) - state_dicts.append(state_dict) - - if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: - raise ValueError(f"{files[0]} is not a zero checkpoint") - zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] - world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] - - # For ZeRO-2 each param group can have different partition_count as data parallelism for expert - # parameters can be different from data parallelism for non-expert parameters. So we can just - # use the max of the partition_count to get the dp world_size. - - if type(world_size) is list: - world_size = max(world_size) - - if world_size != total_files: - raise ValueError( - f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " - "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." - ) - - # the groups are named differently in each stage - if zero_stage <= 2: - fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS - elif zero_stage == 3: - fp32_groups_key = FP32_FLAT_GROUPS - else: - raise ValueError(f"unknown zero stage {zero_stage}") - - fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] - return zero_stage, world_size, fp32_flat_groups - - -def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): - """ - Returns fp32 state_dict reconstructed from ds checkpoint - - Args: - - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) - - """ - print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") - - optim_files = get_optim_files(ds_checkpoint_dir) - zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) - print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") - - model_files = get_model_state_files(ds_checkpoint_dir) - - zero_model_states = parse_model_states(model_files) - print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') - - if zero_stage <= 2: - return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters) - elif zero_stage == 3: - return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters) - - -def _zero2_merge_frozen_params(state_dict, zero_model_states): - if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: - return - - frozen_param_shapes = zero_model_states[0].frozen_param_shapes - frozen_param_fragments = zero_model_states[0].frozen_param_fragments - - if debug: - num_elem = sum(s.numel() for s in frozen_param_shapes.values()) - print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') - - wanted_params = len(frozen_param_shapes) - wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) - avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) - print(f'Frozen params: Have {avail_numel} numels to process.') - print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') - - total_params = 0 - total_numel = 0 - for name, shape in frozen_param_shapes.items(): - total_params += 1 - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - - state_dict[name] = frozen_param_fragments[name] - - if debug: - print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") - - print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") - - -def _has_callable(obj, fn): - attr = getattr(obj, fn, None) - return callable(attr) - - -def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): - param_shapes = zero_model_states[0].param_shapes - - # Reconstruction protocol: - # - # XXX: document this - - if debug: - for i in range(world_size): - for j in range(len(fp32_flat_groups[0])): - print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") - - # XXX: memory usage doubles here (zero2) - num_param_groups = len(fp32_flat_groups[0]) - merged_single_partition_of_fp32_groups = [] - for i in range(num_param_groups): - merged_partitions = [sd[i] for sd in fp32_flat_groups] - full_single_fp32_vector = torch.cat(merged_partitions, 0) - merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) - avail_numel = sum( - [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) - - if debug: - wanted_params = sum([len(shapes) for shapes in param_shapes]) - wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) - # not asserting if there is a mismatch due to possible padding - print(f"Have {avail_numel} numels to process.") - print(f"Need {wanted_numel} numels in {wanted_params} params.") - - # params - # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support - # out-of-core computing solution - total_numel = 0 - total_params = 0 - for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): - offset = 0 - avail_numel = full_single_fp32_vector.numel() - for name, shape in shapes.items(): - - unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) - total_numel += unpartitioned_numel - total_params += 1 - - if debug: - print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") - state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) - offset += unpartitioned_numel - - # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and - # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex - # paddings performed in the code it's almost impossible to predict the exact numbers w/o the - # live optimizer object, so we are checking that the numbers are within the right range - align_to = 2 * world_size - - def zero2_align(x): - return align_to * math.ceil(x / align_to) - - if debug: - print(f"original offset={offset}, avail_numel={avail_numel}") - - offset = zero2_align(offset) - avail_numel = zero2_align(avail_numel) - - if debug: - print(f"aligned offset={offset}, avail_numel={avail_numel}") - - # Sanity check - if offset != avail_numel: - raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") - - print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") - - -def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters): - state_dict = OrderedDict() - - # buffers - buffers = zero_model_states[0].buffers - state_dict.update(buffers) - if debug: - print(f"added {len(buffers)} buffers") - - if not exclude_frozen_parameters: - _zero2_merge_frozen_params(state_dict, zero_model_states) - - _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) - - # recover shared parameters - for pair in zero_model_states[0].shared_params: - if pair[1] in state_dict: - state_dict[pair[0]] = state_dict[pair[1]] - - return state_dict - - -def zero3_partitioned_param_info(unpartitioned_numel, world_size): - remainder = unpartitioned_numel % world_size - padding_numel = (world_size - remainder) if remainder else 0 - partitioned_numel = math.ceil(unpartitioned_numel / world_size) - return partitioned_numel, padding_numel - - -def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): - if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: - return - - if debug: - for i in range(world_size): - num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) - print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') - - frozen_param_shapes = zero_model_states[0].frozen_param_shapes - wanted_params = len(frozen_param_shapes) - wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) - avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size - print(f'Frozen params: Have {avail_numel} numels to process.') - print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') - - total_params = 0 - total_numel = 0 - for name, shape in zero_model_states[0].frozen_param_shapes.items(): - total_params += 1 - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - - param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) - state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) - - partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) - - if debug: - print( - f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" - ) - - print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") - - -class GatheredTensor: - """ - A pseudo tensor that collects partitioned weights. - It is more memory efficient when there are multiple groups. - """ - - def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): - self.flat_groups = flat_groups - self.flat_groups_offset = flat_groups_offset - self.offset = offset - self.partitioned_numel = partitioned_numel - self.shape = shape - self.dtype = self.flat_groups[0][0].dtype - - def contiguous(self): - """ - Merge partitioned weights from flat_groups into a single tensor. - """ - end_idx = self.offset + self.partitioned_numel - world_size = len(self.flat_groups) - pad_flat_param_chunks = [] - - for rank_i in range(world_size): - # for each rank, we need to collect weights from related group/groups - flat_groups_at_rank_i = self.flat_groups[rank_i] - start_group_id = None - end_group_id = None - for group_id in range(len(self.flat_groups_offset)): - if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: - start_group_id = group_id - if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: - end_group_id = group_id - break - # collect weights from related group/groups - for group_id in range(start_group_id, end_group_id + 1): - flat_tensor = flat_groups_at_rank_i[group_id] - start_offset = self.offset - self.flat_groups_offset[group_id] - end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] - pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) - - # collect weights from all ranks - pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) - param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() - return param - - -def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): - param_shapes = zero_model_states[0].param_shapes - avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size - - # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each - # param, re-consolidating each param, while dealing with padding if any - - # merge list of dicts, preserving order - param_shapes = {k: v for d in param_shapes for k, v in d.items()} - - if debug: - for i in range(world_size): - print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") - - wanted_params = len(param_shapes) - wanted_numel = sum(shape.numel() for shape in param_shapes.values()) - # not asserting if there is a mismatch due to possible padding - avail_numel = fp32_flat_groups[0].numel() * world_size - print(f"Trainable params: Have {avail_numel} numels to process.") - print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") - - # params - # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support - # out-of-core computing solution - offset = 0 - total_numel = 0 - total_params = 0 - flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) - for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - total_params += 1 - partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) - - if debug: - print( - f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" - ) - - # memory efficient tensor - tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) - state_dict[name] = tensor - offset += partitioned_numel - - offset *= world_size - - # Sanity check - if offset != avail_numel: - raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") - - print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") - - -def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters): - state_dict = OrderedDict() - - # buffers - buffers = zero_model_states[0].buffers - state_dict.update(buffers) - if debug: - print(f"added {len(buffers)} buffers") - - if not exclude_frozen_parameters: - _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) - - _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) - - # recover shared parameters - for pair in zero_model_states[0].shared_params: - if pair[1] in state_dict: - state_dict[pair[0]] = state_dict[pair[1]] - - return state_dict - - -def to_torch_tensor(state_dict, return_empty_tensor=False): - """ - Convert state_dict of GatheredTensor to torch tensor - """ - torch_state_dict = {} - converted_tensors = {} - for name, tensor in state_dict.items(): - tensor_id = id(tensor) - if tensor_id in converted_tensors: # shared tensors - shared_tensor = torch_state_dict[converted_tensors[tensor_id]] - torch_state_dict[name] = shared_tensor - else: - converted_tensors[tensor_id] = name - if return_empty_tensor: - torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) - else: - torch_state_dict[name] = tensor.contiguous() - return torch_state_dict - - -def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, - tag=None, - exclude_frozen_parameters=False, - lazy_mode=False): - """ - Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with - ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example - via a model hub. - - Args: - - ``checkpoint_dir``: path to the desired checkpoint folder - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` - - ``exclude_frozen_parameters``: exclude frozen parameters - - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. - Convert the pesduo tensor to torch tensor by ``.contiguous()`` - - Returns: - - pytorch ``state_dict`` - - A typical usage might be :: - - from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint - # do the training and checkpoint saving - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu - model = model.cpu() # move to cpu - model.load_state_dict(state_dict) - # submit to model hub or save the model to share with others - - In this example the ``model`` will no longer be usable in the deepspeed context of the same - application. i.e. you will need to re-initialize the deepspeed engine, since - ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. - - If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. - - Note: the above usage may not work if your application doesn't have sufficient free CPU memory. - You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with - the checkpoint. Or you can load state_dict in lazy mode :: - - from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu - for name, lazy_tensor in state_dict.item(): - tensor = lazy_tensor.contiguous() # to cpu - print(name, tensor) - # del tensor to release memory if it no longer in use - """ - if tag is None: - latest_path = os.path.join(checkpoint_dir, 'latest') - if os.path.isfile(latest_path): - with open(latest_path, 'r') as fd: - tag = fd.read().strip() - else: - raise ValueError(f"Unable to find 'latest' file at {latest_path}") - - ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) - - if not os.path.isdir(ds_checkpoint_dir): - raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") - - state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) - if lazy_mode: - return state_dict - else: - return to_torch_tensor(state_dict) - - -def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, - output_dir, - max_shard_size="5GB", - safe_serialization=False, - tag=None, - exclude_frozen_parameters=False): - """ - Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be - loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. - - Args: - - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) - - ``output_dir``: directory to the pytorch fp32 state_dict output files - - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB - - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` - - ``exclude_frozen_parameters``: exclude frozen parameters - """ - - # Dependency pre-check - if safe_serialization: - try: - from safetensors.torch import save_file - except ImportError: - print('If you want to use `safe_serialization`, please `pip install safetensors`') - raise - if max_shard_size is not None: - try: - from huggingface_hub import split_torch_state_dict_into_shards - except ImportError: - print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') - raise - - # Convert zero checkpoint to state_dict - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, - tag, - exclude_frozen_parameters, - lazy_mode=True) - - # Shard the model if it is too big. - weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" - if max_shard_size is not None: - filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") - # an memory-efficient approach for sharding - empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) - state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, - filename_pattern=filename_pattern, - max_shard_size=max_shard_size) - else: - from collections import namedtuple - StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) - state_dict_split = StateDictSplit(is_sharded=False, - filename_to_tensors={weights_name: list(state_dict.keys())}) - - # Save the model by shard - os.makedirs(output_dir, exist_ok=True) - filename_to_tensors = state_dict_split.filename_to_tensors.items() - for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): - shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} - shard_state_dict = to_torch_tensor(shard_state_dict) - output_path = os.path.join(output_dir, shard_file) - if safe_serialization: - save_file(shard_state_dict, output_path, metadata={"format": "pt"}) - else: - torch.save(shard_state_dict, output_path) - # release the memory of current shard - for tensor_name in list(shard_state_dict.keys()): - del state_dict[tensor_name] - del shard_state_dict[tensor_name] - del shard_state_dict - gc.collect() - - # Save index if sharded - if state_dict_split.is_sharded: - index = { - "metadata": state_dict_split.metadata, - "weight_map": state_dict_split.tensor_to_filename, - } - save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" - save_index_file = os.path.join(output_dir, save_index_file) - with open(save_index_file, "w", encoding="utf-8") as f: - content = json.dumps(index, indent=2, sort_keys=True) + "\n" - f.write(content) - - -def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): - """ - 1. Put the provided model to cpu - 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` - 3. Load it into the provided model - - Args: - - ``model``: the model object to update - - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` - - Returns: - - ``model`: modified model - - Make sure you have plenty of CPU memory available before you call this function. If you don't - have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it - conveniently placed for you in the checkpoint folder. - - A typical usage might be :: - - from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint - model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) - # submit to model hub or save the model to share with others - - Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context - of the same application. i.e. you will need to re-initialize the deepspeed engine, since - ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. - - """ - logger.info("Extracting fp32 weights") - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) - - logger.info("Overwriting model with fp32 weights") - model = model.cpu() - model.load_state_dict(state_dict, strict=False) - - return model - - -if __name__ == "__main__": - parser = argparse.ArgumentParser() - parser.add_argument("checkpoint_dir", - type=str, - help="path to the desired checkpoint folder, e.g., path/checkpoint-12") - parser.add_argument("output_dir", - type=str, - help="directory to the pytorch fp32 state_dict output files" - "(e.g. path/checkpoint-12-output/)") - parser.add_argument( - "--max_shard_size", - type=str, - default="5GB", - help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" - "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" - "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" - "without CPU OOM issues.") - parser.add_argument( - "--safe_serialization", - default=False, - action='store_true', - help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") - parser.add_argument("-t", - "--tag", - type=str, - default=None, - help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") - parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") - parser.add_argument("-d", "--debug", action='store_true', help="enable debug") - args = parser.parse_args() - - debug = args.debug - - convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, - args.output_dir, - max_shard_size=args.max_shard_size, - safe_serialization=args.safe_serialization, - tag=args.tag, - exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/README.md deleted file mode 100644 index 7b99d5d44c922653ec55877d9b54ddd70fbde852..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/README.md +++ /dev/null @@ -1,207 +0,0 @@ ---- -base_model: /workspace/models/Qwen2.5-VL-7B-Instruct -library_name: peft -pipeline_tag: text-generation -tags: -- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct -- lora -- transformers ---- - -# Model Card for Model ID - - - - - -## Model Details - -### Model Description - - - - - -- **Developed by:** [More Information Needed] -- **Funded by [optional]:** [More Information Needed] -- **Shared by [optional]:** [More Information Needed] -- **Model type:** [More Information Needed] -- **Language(s) (NLP):** [More Information Needed] -- **License:** [More Information Needed] -- **Finetuned from model [optional]:** [More Information Needed] - -### Model Sources [optional] - - - -- **Repository:** [More Information Needed] -- **Paper [optional]:** [More Information Needed] -- **Demo [optional]:** [More Information Needed] - -## Uses - - - -### Direct Use - - - -[More Information Needed] - -### Downstream Use [optional] - - - -[More Information Needed] - -### Out-of-Scope Use - - - -[More Information Needed] - -## Bias, Risks, and Limitations - - - -[More Information Needed] - -### Recommendations - - - -Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. - -## How to Get Started with the Model - -Use the code below to get started with the model. - -[More Information Needed] - -## Training Details - -### Training Data - - - -[More Information Needed] - -### Training Procedure - - - -#### Preprocessing [optional] - -[More Information Needed] - - -#### Training Hyperparameters - -- **Training regime:** [More Information Needed] - -#### Speeds, Sizes, Times [optional] - - - -[More Information Needed] - -## Evaluation - - - -### Testing Data, Factors & Metrics - -#### Testing Data - - - -[More Information Needed] - -#### Factors - - - -[More Information Needed] - -#### Metrics - - - -[More Information Needed] - -### Results - -[More Information Needed] - -#### Summary - - - -## Model Examination [optional] - - - -[More Information Needed] - -## Environmental Impact - - - -Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). - -- **Hardware Type:** [More Information Needed] -- **Hours used:** [More Information Needed] -- **Cloud Provider:** [More Information Needed] -- **Compute Region:** [More Information Needed] -- **Carbon Emitted:** [More Information Needed] - -## Technical Specifications [optional] - -### Model Architecture and Objective - -[More Information Needed] - -### Compute Infrastructure - -[More Information Needed] - -#### Hardware - -[More Information Needed] - -#### Software - -[More Information Needed] - -## Citation [optional] - - - -**BibTeX:** - -[More Information Needed] - -**APA:** - -[More Information Needed] - -## Glossary [optional] - - - -[More Information Needed] - -## More Information [optional] - -[More Information Needed] - -## Model Card Authors [optional] - -[More Information Needed] - -## Model Card Contact - -[More Information Needed] -### Framework versions - -- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/adapter_config.json deleted file mode 100644 index 8c337dd8e89f56ebe74fe6e4391a40917e12ff4e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/adapter_config.json +++ /dev/null @@ -1,34 +0,0 @@ -{ - "alpha_pattern": {}, - "auto_mapping": null, - "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "bias": "none", - "corda_config": null, - "eva_config": null, - "exclude_modules": null, - "fan_in_fan_out": false, - "inference_mode": true, - "init_lora_weights": true, - "layer_replication": null, - "layers_pattern": null, - "layers_to_transform": null, - "loftq_config": {}, - "lora_alpha": 32, - "lora_bias": false, - "lora_dropout": 0.05, - "megatron_config": null, - "megatron_core": "megatron.core", - "modules_to_save": [], - "peft_type": "LORA", - "qalora_group_size": 16, - "r": 16, - "rank_pattern": {}, - "revision": null, - "target_modules": "^(model\\.language_model(?=\\.).*\\.(down_proj|q_proj|gate_proj|k_proj|up_proj|v_proj|o_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|gate_proj|attn.proj|up_proj|mlp.0|qkv|mlp.2))$", - "target_parameters": null, - "task_type": "CAUSAL_LM", - "trainable_token_indices": null, - "use_dora": false, - "use_qalora": false, - "use_rslora": false -} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/adapter_model.safetensors deleted file mode 100644 index e1ae16124f6e48bbdace66be998f2d83997af750..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/adapter_model.safetensors +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:e3d95f619a2fd7907f87f196c35ddbde03074ba3500914a130deae454570469f -size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/additional_config.json deleted file mode 100644 index bbe5159d1d10a158affb4d328c70025d891e16d8..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/additional_config.json +++ /dev/null @@ -1 +0,0 @@ -{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/args.json deleted file mode 100644 index 1909feadab03c3c6a278a320adc0267c146443a5..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/args.json +++ /dev/null @@ -1,387 +0,0 @@ -{ - "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "overwrite_output_dir": false, - "do_train": false, - "do_eval": false, - "do_predict": false, - "eval_strategy": "steps", - "prediction_loss_only": false, - "per_device_train_batch_size": 1, - "per_device_eval_batch_size": 1, - "per_gpu_train_batch_size": null, - "per_gpu_eval_batch_size": null, - "gradient_accumulation_steps": 4, - "eval_accumulation_steps": null, - "eval_delay": 0, - "torch_empty_cache_steps": null, - "learning_rate": 5e-05, - "weight_decay": 0.1, - "adam_beta1": 0.9, - "adam_beta2": 0.95, - "adam_epsilon": 1e-08, - "max_grad_norm": 1.0, - "num_train_epochs": 2.0, - "max_steps": -1, - "lr_scheduler_type": "cosine", - "lr_scheduler_kwargs": null, - "warmup_ratio": 0.2, - "warmup_steps": 0, - "log_level": "passive", - "log_level_replica": "warning", - "log_on_each_node": true, - "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs", - "logging_strategy": "steps", - "logging_first_step": true, - "logging_steps": 1, - "logging_nan_inf_filter": true, - "save_strategy": "steps", - "save_steps": 10.0, - "save_total_limit": 3, - "save_safetensors": true, - "save_on_each_node": false, - "save_only_model": false, - "restore_callback_states_from_checkpoint": false, - "no_cuda": false, - "use_cpu": false, - "use_mps_device": false, - "seed": 42, - "data_seed": 42, - "jit_mode_eval": false, - "use_ipex": false, - "bf16": true, - "fp16": false, - "fp16_opt_level": "O1", - "half_precision_backend": "auto", - "bf16_full_eval": false, - "fp16_full_eval": false, - "tf32": null, - "local_rank": 0, - "ddp_backend": null, - "tpu_num_cores": null, - "tpu_metrics_debug": false, - "debug": null, - "dataloader_drop_last": false, - "eval_steps": 2000.0, - "dataloader_num_workers": 4, - "dataloader_prefetch_factor": null, - "past_index": -1, - "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "disable_tqdm": null, - "remove_unused_columns": true, - "label_names": null, - "load_best_model_at_end": false, - "metric_for_best_model": "loss", - "greater_is_better": false, - "ignore_data_skip": false, - "fsdp": [], - "fsdp_min_num_params": 0, - "fsdp_config": null, - "fsdp_transformer_layer_cls_to_wrap": null, - "accelerator_config": { - "dispatch_batches": false - }, - "deepspeed": { - "fp16": { - "enabled": "auto", - "loss_scale": 0, - "loss_scale_window": 1000, - "initial_scale_power": 16, - "hysteresis": 2, - "min_loss_scale": 1 - }, - "bf16": { - "enabled": "auto" - }, - "zero_optimization": { - "stage": 2, - "offload_optimizer": { - "device": "none", - "pin_memory": true - }, - "allgather_partitions": true, - "allgather_bucket_size": 200000000.0, - "overlap_comm": false, - "reduce_scatter": true, - "reduce_bucket_size": 200000000.0, - "contiguous_gradients": true - }, - "gradient_accumulation_steps": "auto", - "gradient_clipping": "auto", - "steps_per_print": 2000, - "train_batch_size": "auto", - "train_micro_batch_size_per_gpu": "auto", - "wall_clock_breakdown": false - }, - "label_smoothing_factor": 0.0, - "optim": "adamw_torch", - "optim_args": null, - "adafactor": false, - "group_by_length": false, - "length_column_name": "length", - "report_to": [ - "none" - ], - "ddp_find_unused_parameters": null, - "ddp_bucket_cap_mb": null, - "ddp_broadcast_buffers": null, - "dataloader_pin_memory": true, - "dataloader_persistent_workers": false, - "skip_memory_metrics": true, - "use_legacy_prediction_loop": false, - "push_to_hub": false, - "resume_from_checkpoint": null, - "hub_model_id": null, - "hub_strategy": "every_save", - "hub_token": null, - "hub_private_repo": null, - "hub_always_push": false, - "hub_revision": null, - "gradient_checkpointing": true, - "gradient_checkpointing_kwargs": null, - "include_inputs_for_metrics": false, - "include_for_metrics": [], - "eval_do_concat_batches": true, - "fp16_backend": "auto", - "push_to_hub_model_id": null, - "push_to_hub_organization": null, - "push_to_hub_token": null, - "mp_parameters": "", - "auto_find_batch_size": false, - "full_determinism": false, - "torchdynamo": null, - "ray_scope": "last", - "ddp_timeout": 18000000, - "torch_compile": false, - "torch_compile_backend": null, - "torch_compile_mode": null, - "include_tokens_per_second": false, - "include_num_input_tokens_seen": false, - "neftune_noise_alpha": null, - "optim_target_modules": null, - "batch_eval_metrics": false, - "eval_on_start": false, - "use_liger_kernel": false, - "liger_kernel_config": null, - "eval_use_gather_object": false, - "average_tokens_across_devices": true, - "sortish_sampler": false, - "predict_with_generate": false, - "generation_max_length": null, - "generation_num_beams": null, - "generation_config": null, - "tuner_backend": "peft", - "vit_gradient_checkpointing": null, - "router_aux_loss_coef": 0.0, - "enable_dft_loss": false, - "enable_channel_loss": false, - "check_model": true, - "acc_strategy": "token", - "train_dataloader_shuffle": true, - "max_epochs": null, - "aligner_lr": null, - "vit_lr": null, - "use_logits_to_keep": null, - "ds3_gather_for_generation": true, - "resume_only_model": false, - "optimizer": null, - "loss_type": null, - "metric": null, - "eval_use_evalscope": false, - "eval_dataset": [], - "eval_dataset_args": null, - "eval_limit": null, - "eval_generation_config": null, - "extra_eval_args": null, - "use_flash_ckpt": false, - "use_ray": false, - "ray_exp_name": null, - "device_groups": null, - "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "model_type": "qwen2_5_vl", - "model_revision": null, - "task_type": "causal_lm", - "torch_dtype": "bfloat16", - "attn_impl": null, - "new_special_tokens": [], - "num_labels": null, - "problem_type": null, - "rope_scaling": null, - "device_map": null, - "max_memory": {}, - "max_model_len": null, - "local_repo_path": null, - "init_strategy": null, - "template": "qwen2_5_vl", - "system": null, - "max_length": 24576, - "truncation_strategy": "delete", - "max_pixels": null, - "agent_template": null, - "norm_bbox": null, - "use_chat_template": true, - "padding_side": "right", - "padding_free": false, - "loss_scale": "default", - "sequence_parallel_size": 1, - "template_backend": "swift", - "response_prefix": null, - "enable_thinking": null, - "add_non_thinking_prefix": true, - "dataset": [ - "data.jsonl" - ], - "val_dataset": [], - "cached_dataset": [], - "cached_val_dataset": [], - "split_dataset_ratio": 0.001, - "dataset_num_proc": 8, - "load_from_cache_file": false, - "dataset_shuffle": true, - "val_dataset_shuffle": false, - "streaming": false, - "interleave_prob": null, - "stopping_strategy": "first_exhausted", - "shuffle_buffer_size": 1000, - "download_mode": "reuse_dataset_if_exists", - "columns": {}, - "strict": false, - "model_name": null, - "model_author": null, - "custom_dataset_info": [], - "quant_method": null, - "quant_bits": null, - "hqq_axis": null, - "bnb_4bit_compute_dtype": "bfloat16", - "bnb_4bit_quant_type": "nf4", - "bnb_4bit_use_double_quant": true, - "bnb_4bit_quant_storage": null, - "max_new_tokens": 64, - "temperature": 0.0, - "top_k": null, - "top_p": null, - "repetition_penalty": null, - "num_beams": 1, - "stream": false, - "stop_words": [], - "logprobs": false, - "top_logprobs": null, - "structured_outputs_regex": null, - "ckpt_dir": null, - "lora_modules": [], - "train_type": "lora", - "adapters": [], - "external_plugins": [], - "model_kwargs": {}, - "load_args": false, - "load_data_args": false, - "packing": false, - "packing_length": null, - "packing_num_proc": 1, - "lazy_tokenize": true, - "custom_register_path": [], - "use_hf": false, - "ignore_args_error": false, - "use_swift_lora": false, - "freeze_parameters": [], - "freeze_parameters_regex": null, - "freeze_parameters_ratio": 0.0, - "trainable_parameters": [], - "trainable_parameters_regex": null, - "freeze_llm": false, - "freeze_vit": false, - "freeze_aligner": true, - "target_modules": [ - "all-linear" - ], - "target_regex": null, - "target_parameters": null, - "modules_to_save": [], - "lora_rank": 16, - "lora_alpha": 32, - "lora_dropout": 0.05, - "lora_bias": "none", - "lora_dtype": null, - "lorap_lr_ratio": null, - "use_rslora": false, - "use_dora": false, - "lora_ga_batch_size": 2, - "lora_ga_iters": 2, - "lora_ga_max_length": 1024, - "lora_ga_direction": "ArB2r", - "lora_ga_scale": "stable", - "lora_ga_stable_gamma": 16, - "init_weights": true, - "fourier_n_frequency": 2000, - "fourier_scaling": 300.0, - "boft_block_size": 4, - "boft_block_num": 0, - "boft_n_butterfly_factor": 1, - "boft_dropout": 0.0, - "vera_rank": 256, - "vera_projection_prng_key": 0, - "vera_dropout": 0.0, - "vera_d_initial": 0.1, - "adapter_act": "gelu", - "adapter_length": 128, - "use_galore": false, - "galore_target_modules": null, - "galore_rank": 128, - "galore_update_proj_gap": 50, - "galore_scale": 1.0, - "galore_proj_type": "std", - "galore_optim_per_parameter": false, - "galore_with_embedding": false, - "galore_quantization": false, - "galore_proj_quant": false, - "galore_proj_bits": 4, - "galore_proj_group_size": 256, - "galore_cos_threshold": 0.4, - "galore_gamma_proj": 2, - "galore_queue_size": 5, - "adalora_target_r": 8, - "adalora_init_r": 12, - "adalora_tinit": 0, - "adalora_tfinal": 0, - "adalora_deltaT": 1, - "adalora_beta1": 0.85, - "adalora_beta2": 0.85, - "adalora_orth_reg_weight": 0.5, - "llamapro_num_new_blocks": 4, - "llamapro_num_groups": null, - "lisa_activated_layers": 0, - "lisa_step_interval": 20, - "reft_layer_key": null, - "reft_layers": null, - "reft_rank": 4, - "reft_intervention_type": "LoreftIntervention", - "reft_args": null, - "swanlab_token": null, - "swanlab_project": "ms-swift", - "swanlab_workspace": null, - "swanlab_exp_name": null, - "swanlab_notification_method": null, - "swanlab_webhook_url": null, - "swanlab_secret": null, - "swanlab_sender_email": null, - "swanlab_receiver_email": null, - "swanlab_smtp_server": null, - "swanlab_smtp_port": null, - "swanlab_email_language": "zh", - "swanlab_mode": "cloud", - "add_version": true, - "create_checkpoint_symlink": false, - "zero_hpz_partition_size": null, - "deepspeed_autotp_size": null, - "early_stop_interval": null, - "rank": 0, - "global_world_size": 8, - "local_world_size": 8, - "model_suffix": "Qwen2.5-VL-7B-Instruct", - "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", - "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", - "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "_val_dataset_exists": true, - "hub": "", - "evaluation_strategy": "steps", - "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" -} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt deleted file mode 100644 index 0bb25d0e48a13b2264f017b682c3750255876e7a..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5b2af223938269d15142922df840590b94ab43bbd2d154559d8d26f91c3d7f7b -size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt deleted file mode 100644 index 1cfe3666f5402650abe1a3a2a35de6c8e7d5e988..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:997f124b6f4cff921cc74762471d56edd65350d5014e50bd0f4fa6733a09ff78 -size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt deleted file mode 100644 index 4955f0df2c547ae125157268b60214721fb39ced..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0f5962fe2687cb56e41244a7502f2afb2c87767d314106f81c9740ce2a9bbfee -size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt deleted file mode 100644 index 2d78aa266079e029f6e4163d34b5780a0c9d3ddc..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:1c09f787178c953e5898ab63c94da902ae9d929792aa0296e35db8523915d06b -size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt deleted file mode 100644 index bc8527242342616b3eb92cc5632ec18642b84c0e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0098ab355e0953f75e47b1515a83e2c21278112419ea45a80ba442725c789d0e -size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt deleted file mode 100644 index 329792eba8cbbb53b5c334649c8b79713d358128..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2d256d4dbe2476089911682235abd7eb503b50003781cb444f13928bb70972cb -size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt deleted file mode 100644 index 5d40c115c6096f635d020b62d6c9637090ff5aed..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3a360382c3f34c970a9ff8b775f4aecb5c0828ecb367a6002eeeb9a102f93392 -size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt deleted file mode 100644 index f3f3a0fac258b66c405617ee55db18d7f6f8bf93..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:01a0785e7291baf623f2b87d2e4d8f8ef25f6a629a715067eb8a37f697060cd4 -size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/mp_rank_00_model_states.pt deleted file mode 100644 index 63b483208e56e7b7d9e33ecfeb918627909e8155..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/global_step790/mp_rank_00_model_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:60fb72236b0e23a1a509c024306289da4caa440a31a099a9b08a34a0da5d96fb -size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/latest deleted file mode 100644 index 4063e09c8e977daac7183734788b33f1e7c57532..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/latest +++ /dev/null @@ -1 +0,0 @@ -global_step790 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_0.pth deleted file mode 100644 index 01a5f3b64d6c3723ca733da3c32069c92b1d7ccd..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_0.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:08e51edaea42a29959349d1de7df3c605c67f59b50b03e4c38a81909eb8e392d -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_1.pth deleted file mode 100644 index 810d71c645ae8be36490a3ebeb4af98d278bcc3c..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_1.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b2aa0ca8ddcc4efc261a49f3d4ae969158aa683881946f804ff21dd4f7653455 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_2.pth deleted file mode 100644 index 5057311b8537949b0e5b9636ed127a95953a1b62..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_2.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2301483c82e8ce4474daa3d2d2eff8435d43c12e2faac640c846d3477e98a43e -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_3.pth deleted file mode 100644 index 6f95ef057073d60aa7cfdf0c8af3ed9682fe8a03..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_3.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:290255bdfe291204b90aa1bac80223378b7913c9ed8947f92da4f737505dd915 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_4.pth deleted file mode 100644 index dda4b729eb8b58b011f6beae0a237ad46600ed33..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_4.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:564f9b2e48ff4a6d56ebdd5f2cbdbb5cccb7723ba1b28897a1509d8f9b347180 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_5.pth deleted file mode 100644 index a6afeca49522a85509c075191d0bb6eadd8b2826..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_5.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:6fcafa18978309d00e52bacdc1beeba35515740a222c3812fc111f8315128312 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_6.pth deleted file mode 100644 index 33963dc161bdda884e60ef814f1901044f759510..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_6.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3c2318bdf96e5ccec5b3d9e816e83bf8f3ea752a6f1540d0c34711cbe1f7e4d6 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_7.pth deleted file mode 100644 index 5be6068a4af8d2a48fbf412e943aad87d740d506..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/rng_state_7.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f6b02024079d6847a6a3afa6da18a27f5b31101fa49a766a25b8e8bb3d3753b0 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/scheduler.pt deleted file mode 100644 index a9a2d9bb4e829f08f192e2dd4d91dc944579ace9..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/scheduler.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d41f6995235eb5427339d2fc8cc042254d91f00a2b7526717fd1bc7cec9e2ada -size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/trainer_state.json deleted file mode 100644 index c3f899b23d19ad1ad1efa1acd0d2aeb15573dd62..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/trainer_state.json +++ /dev/null @@ -1,6354 +0,0 @@ -{ - "best_global_step": null, - "best_metric": null, - "best_model_checkpoint": null, - "epoch": 1.9762202753441802, - "eval_steps": 2000, - "global_step": 790, - "is_hyper_param_search": false, - "is_local_process_zero": true, - "is_world_process_zero": true, - "log_history": [ - { - "epoch": 0.0025031289111389237, - "grad_norm": 1.7986857891082764, - "learning_rate": 3.125e-07, - "loss": 1.4494528770446777, - "step": 1, - "token_acc": 0.6592913128674069 - }, - { - "epoch": 0.0050062578222778474, - "grad_norm": 1.6583799123764038, - "learning_rate": 6.25e-07, - "loss": 1.4986588954925537, - "step": 2, - "token_acc": 0.6386976385046007 - }, - { - "epoch": 0.007509386733416771, - "grad_norm": 2.0358657836914062, - "learning_rate": 9.375e-07, - "loss": 1.4801826477050781, - "step": 3, - "token_acc": 0.6456910232526047 - }, - { - "epoch": 0.010012515644555695, - "grad_norm": 2.9915387630462646, - "learning_rate": 1.25e-06, - "loss": 1.4314780235290527, - "step": 4, - "token_acc": 0.657655623906541 - }, - { - "epoch": 0.012515644555694618, - "grad_norm": 3.6695473194122314, - "learning_rate": 1.5625e-06, - "loss": 1.4699971675872803, - "step": 5, - "token_acc": 0.6388313198200475 - }, - { - "epoch": 0.015018773466833541, - "grad_norm": 3.4062535762786865, - "learning_rate": 1.875e-06, - "loss": 1.459728479385376, - "step": 6, - "token_acc": 0.6437672541940964 - }, - { - "epoch": 0.017521902377972465, - "grad_norm": 4.477782249450684, - "learning_rate": 2.1875e-06, - "loss": 1.4375343322753906, - "step": 7, - "token_acc": 0.6586960119146119 - }, - { - "epoch": 0.02002503128911139, - "grad_norm": 7.962740898132324, - "learning_rate": 2.5e-06, - "loss": 1.4262611865997314, - "step": 8, - "token_acc": 0.655122040294601 - }, - { - "epoch": 0.02252816020025031, - "grad_norm": 1.1610136032104492, - "learning_rate": 2.8125e-06, - "loss": 1.5507800579071045, - "step": 9, - "token_acc": 0.6221771018936726 - }, - { - "epoch": 0.025031289111389236, - "grad_norm": 2.3185999393463135, - "learning_rate": 3.125e-06, - "loss": 1.536710262298584, - "step": 10, - "token_acc": 0.6201467766984379 - }, - { - "epoch": 0.02753441802252816, - "grad_norm": 1.7153717279434204, - "learning_rate": 3.4375000000000005e-06, - "loss": 1.5054551362991333, - "step": 11, - "token_acc": 0.6262201095830763 - }, - { - "epoch": 0.030037546933667083, - "grad_norm": 2.102219343185425, - "learning_rate": 3.75e-06, - "loss": 1.4586467742919922, - "step": 12, - "token_acc": 0.6540530157510565 - }, - { - "epoch": 0.03254067584480601, - "grad_norm": 1.5630065202713013, - "learning_rate": 4.0625000000000005e-06, - "loss": 1.4890741109848022, - "step": 13, - "token_acc": 0.6405010039200688 - }, - { - "epoch": 0.03504380475594493, - "grad_norm": 33.184234619140625, - "learning_rate": 4.375e-06, - "loss": 1.4462761878967285, - "step": 14, - "token_acc": 0.6706432173164433 - }, - { - "epoch": 0.03754693366708386, - "grad_norm": 1.8826276063919067, - "learning_rate": 4.6875000000000004e-06, - "loss": 1.4586151838302612, - "step": 15, - "token_acc": 0.6705066666666667 - }, - { - "epoch": 0.04005006257822278, - "grad_norm": 8.024161338806152, - "learning_rate": 5e-06, - "loss": 1.4168506860733032, - "step": 16, - "token_acc": 0.6805052169137836 - }, - { - "epoch": 0.0425531914893617, - "grad_norm": 2.216902732849121, - "learning_rate": 5.3125e-06, - "loss": 1.5086560249328613, - "step": 17, - "token_acc": 0.6336965157189877 - }, - { - "epoch": 0.04505632040050062, - "grad_norm": 2.044179916381836, - "learning_rate": 5.625e-06, - "loss": 1.4445496797561646, - "step": 18, - "token_acc": 0.65391224653454 - }, - { - "epoch": 0.04755944931163955, - "grad_norm": 3.586271286010742, - "learning_rate": 5.9375e-06, - "loss": 1.408017635345459, - "step": 19, - "token_acc": 0.6634764043289406 - }, - { - "epoch": 0.05006257822277847, - "grad_norm": 5.328360080718994, - "learning_rate": 6.25e-06, - "loss": 1.489911437034607, - "step": 20, - "token_acc": 0.6468571428571429 - }, - { - "epoch": 0.052565707133917394, - "grad_norm": 5.333054542541504, - "learning_rate": 6.5625e-06, - "loss": 1.5072444677352905, - "step": 21, - "token_acc": 0.6348264774365229 - }, - { - "epoch": 0.05506883604505632, - "grad_norm": 2.1628494262695312, - "learning_rate": 6.875000000000001e-06, - "loss": 1.4629909992218018, - "step": 22, - "token_acc": 0.6488587495865035 - }, - { - "epoch": 0.057571964956195244, - "grad_norm": 1.1275200843811035, - "learning_rate": 7.187499999999999e-06, - "loss": 1.4386491775512695, - "step": 23, - "token_acc": 0.6535871156661787 - }, - { - "epoch": 0.060075093867334166, - "grad_norm": 1.3719394207000732, - "learning_rate": 7.5e-06, - "loss": 1.4821865558624268, - "step": 24, - "token_acc": 0.6603688302296149 - }, - { - "epoch": 0.0625782227784731, - "grad_norm": 4.841657638549805, - "learning_rate": 7.8125e-06, - "loss": 1.4570186138153076, - "step": 25, - "token_acc": 0.641376796500729 - }, - { - "epoch": 0.06508135168961202, - "grad_norm": 5.441135406494141, - "learning_rate": 8.125000000000001e-06, - "loss": 1.4552083015441895, - "step": 26, - "token_acc": 0.6444476999707003 - }, - { - "epoch": 0.06758448060075094, - "grad_norm": 5.626768589019775, - "learning_rate": 8.437500000000002e-06, - "loss": 1.4883147478103638, - "step": 27, - "token_acc": 0.6449818262740152 - }, - { - "epoch": 0.07008760951188986, - "grad_norm": 2.280463695526123, - "learning_rate": 8.75e-06, - "loss": 1.482466459274292, - "step": 28, - "token_acc": 0.6569336031608365 - }, - { - "epoch": 0.07259073842302878, - "grad_norm": 1.4831247329711914, - "learning_rate": 9.0625e-06, - "loss": 1.4435244798660278, - "step": 29, - "token_acc": 0.6449365872405841 - }, - { - "epoch": 0.07509386733416772, - "grad_norm": 2.1460583209991455, - "learning_rate": 9.375000000000001e-06, - "loss": 1.4155304431915283, - "step": 30, - "token_acc": 0.6572798819478604 - }, - { - "epoch": 0.07759699624530664, - "grad_norm": 3.4287304878234863, - "learning_rate": 9.6875e-06, - "loss": 1.4242777824401855, - "step": 31, - "token_acc": 0.6509663111204985 - }, - { - "epoch": 0.08010012515644556, - "grad_norm": 1.7512478828430176, - "learning_rate": 1e-05, - "loss": 1.4408752918243408, - "step": 32, - "token_acc": 0.6373248744382765 - }, - { - "epoch": 0.08260325406758448, - "grad_norm": 2.4649264812469482, - "learning_rate": 1.03125e-05, - "loss": 1.4433287382125854, - "step": 33, - "token_acc": 0.6401217941210915 - }, - { - "epoch": 0.0851063829787234, - "grad_norm": 3.863513946533203, - "learning_rate": 1.0625e-05, - "loss": 1.3532931804656982, - "step": 34, - "token_acc": 0.6718291250733999 - }, - { - "epoch": 0.08760951188986232, - "grad_norm": 2.388653516769409, - "learning_rate": 1.09375e-05, - "loss": 1.368670105934143, - "step": 35, - "token_acc": 0.6668484187568157 - }, - { - "epoch": 0.09011264080100125, - "grad_norm": 13.738019943237305, - "learning_rate": 1.125e-05, - "loss": 1.4073092937469482, - "step": 36, - "token_acc": 0.6551803885291397 - }, - { - "epoch": 0.09261576971214018, - "grad_norm": 1.3637429475784302, - "learning_rate": 1.1562500000000002e-05, - "loss": 1.4829626083374023, - "step": 37, - "token_acc": 0.632803489946347 - }, - { - "epoch": 0.0951188986232791, - "grad_norm": 1.6325939893722534, - "learning_rate": 1.1875e-05, - "loss": 1.3899552822113037, - "step": 38, - "token_acc": 0.6505426646706587 - }, - { - "epoch": 0.09762202753441802, - "grad_norm": 1.8122252225875854, - "learning_rate": 1.21875e-05, - "loss": 1.4045588970184326, - "step": 39, - "token_acc": 0.6430427054373091 - }, - { - "epoch": 0.10012515644555695, - "grad_norm": 3.8704774379730225, - "learning_rate": 1.25e-05, - "loss": 1.328863501548767, - "step": 40, - "token_acc": 0.6735982966643009 - }, - { - "epoch": 0.10262828535669587, - "grad_norm": 2.2901201248168945, - "learning_rate": 1.28125e-05, - "loss": 1.3276169300079346, - "step": 41, - "token_acc": 0.6693909833904561 - }, - { - "epoch": 0.10513141426783479, - "grad_norm": 4.91914176940918, - "learning_rate": 1.3125e-05, - "loss": 1.3163728713989258, - "step": 42, - "token_acc": 0.670345262494088 - }, - { - "epoch": 0.10763454317897372, - "grad_norm": 2.1690850257873535, - "learning_rate": 1.34375e-05, - "loss": 1.3434736728668213, - "step": 43, - "token_acc": 0.6614920224234584 - }, - { - "epoch": 0.11013767209011265, - "grad_norm": 2.672122001647949, - "learning_rate": 1.3750000000000002e-05, - "loss": 1.314670205116272, - "step": 44, - "token_acc": 0.6749050965188595 - }, - { - "epoch": 0.11264080100125157, - "grad_norm": 2.7474703788757324, - "learning_rate": 1.4062500000000001e-05, - "loss": 1.3387380838394165, - "step": 45, - "token_acc": 0.6603486336302048 - }, - { - "epoch": 0.11514392991239049, - "grad_norm": 3.5926313400268555, - "learning_rate": 1.4374999999999999e-05, - "loss": 1.2919178009033203, - "step": 46, - "token_acc": 0.6762086081457809 - }, - { - "epoch": 0.11764705882352941, - "grad_norm": 3.3131020069122314, - "learning_rate": 1.4687500000000001e-05, - "loss": 1.2780070304870605, - "step": 47, - "token_acc": 0.6928104575163399 - }, - { - "epoch": 0.12015018773466833, - "grad_norm": 2.7729618549346924, - "learning_rate": 1.5e-05, - "loss": 1.321435809135437, - "step": 48, - "token_acc": 0.6654236179260713 - }, - { - "epoch": 0.12265331664580725, - "grad_norm": 3.3950774669647217, - "learning_rate": 1.5312500000000003e-05, - "loss": 1.341125249862671, - "step": 49, - "token_acc": 0.6776592884667085 - }, - { - "epoch": 0.1251564455569462, - "grad_norm": 1.6991623640060425, - "learning_rate": 1.5625e-05, - "loss": 1.2597063779830933, - "step": 50, - "token_acc": 0.68832675794848 - }, - { - "epoch": 0.1276595744680851, - "grad_norm": 2.190904378890991, - "learning_rate": 1.59375e-05, - "loss": 1.3336235284805298, - "step": 51, - "token_acc": 0.6667860126506743 - }, - { - "epoch": 0.13016270337922403, - "grad_norm": 1.2699120044708252, - "learning_rate": 1.6250000000000002e-05, - "loss": 1.3078663349151611, - "step": 52, - "token_acc": 0.6601299948297511 - }, - { - "epoch": 0.13266583229036297, - "grad_norm": 2.1954216957092285, - "learning_rate": 1.65625e-05, - "loss": 1.3297888040542603, - "step": 53, - "token_acc": 0.6636132655790318 - }, - { - "epoch": 0.13516896120150187, - "grad_norm": 1.4788720607757568, - "learning_rate": 1.6875000000000004e-05, - "loss": 1.2633283138275146, - "step": 54, - "token_acc": 0.6728486646884273 - }, - { - "epoch": 0.1376720901126408, - "grad_norm": 1.2756942510604858, - "learning_rate": 1.71875e-05, - "loss": 1.3134421110153198, - "step": 55, - "token_acc": 0.6597701149425287 - }, - { - "epoch": 0.14017521902377972, - "grad_norm": 1.5058810710906982, - "learning_rate": 1.75e-05, - "loss": 1.320970058441162, - "step": 56, - "token_acc": 0.6619850627084409 - }, - { - "epoch": 0.14267834793491865, - "grad_norm": 8.395251274108887, - "learning_rate": 1.7812500000000003e-05, - "loss": 1.199589729309082, - "step": 57, - "token_acc": 0.6902491313668958 - }, - { - "epoch": 0.14518147684605756, - "grad_norm": 1.2147586345672607, - "learning_rate": 1.8125e-05, - "loss": 1.200380802154541, - "step": 58, - "token_acc": 0.6993761140819964 - }, - { - "epoch": 0.1476846057571965, - "grad_norm": 7.152925491333008, - "learning_rate": 1.84375e-05, - "loss": 1.1884859800338745, - "step": 59, - "token_acc": 0.6956748695003728 - }, - { - "epoch": 0.15018773466833543, - "grad_norm": 1.761688470840454, - "learning_rate": 1.8750000000000002e-05, - "loss": 1.2416102886199951, - "step": 60, - "token_acc": 0.6780534640456819 - }, - { - "epoch": 0.15269086357947434, - "grad_norm": 1.4128592014312744, - "learning_rate": 1.90625e-05, - "loss": 1.2558822631835938, - "step": 61, - "token_acc": 0.6748296304504404 - }, - { - "epoch": 0.15519399249061328, - "grad_norm": 5.176482677459717, - "learning_rate": 1.9375e-05, - "loss": 1.2571231126785278, - "step": 62, - "token_acc": 0.6723865345312922 - }, - { - "epoch": 0.15769712140175218, - "grad_norm": 2.6499240398406982, - "learning_rate": 1.96875e-05, - "loss": 1.2110214233398438, - "step": 63, - "token_acc": 0.693203125 - }, - { - "epoch": 0.16020025031289112, - "grad_norm": 4.237362861633301, - "learning_rate": 2e-05, - "loss": 1.2331520318984985, - "step": 64, - "token_acc": 0.6743368488334931 - }, - { - "epoch": 0.16270337922403003, - "grad_norm": 1.8324310779571533, - "learning_rate": 2.0312500000000002e-05, - "loss": 1.251111388206482, - "step": 65, - "token_acc": 0.6659237798083352 - }, - { - "epoch": 0.16520650813516896, - "grad_norm": 4.525329113006592, - "learning_rate": 2.0625e-05, - "loss": 1.2055377960205078, - "step": 66, - "token_acc": 0.6863984270767503 - }, - { - "epoch": 0.1677096370463079, - "grad_norm": 6.051656246185303, - "learning_rate": 2.09375e-05, - "loss": 1.1731817722320557, - "step": 67, - "token_acc": 0.7137023105857067 - }, - { - "epoch": 0.1702127659574468, - "grad_norm": 4.812889099121094, - "learning_rate": 2.125e-05, - "loss": 1.2493493556976318, - "step": 68, - "token_acc": 0.6750756811301716 - }, - { - "epoch": 0.17271589486858574, - "grad_norm": 7.175212860107422, - "learning_rate": 2.1562500000000002e-05, - "loss": 1.1924042701721191, - "step": 69, - "token_acc": 0.6935587761674719 - }, - { - "epoch": 0.17521902377972465, - "grad_norm": 3.6862568855285645, - "learning_rate": 2.1875e-05, - "loss": 1.1937012672424316, - "step": 70, - "token_acc": 0.6821087165563663 - }, - { - "epoch": 0.17772215269086358, - "grad_norm": 1.5228620767593384, - "learning_rate": 2.21875e-05, - "loss": 1.1624102592468262, - "step": 71, - "token_acc": 0.6929272132735861 - }, - { - "epoch": 0.1802252816020025, - "grad_norm": 4.755965232849121, - "learning_rate": 2.25e-05, - "loss": 1.2102301120758057, - "step": 72, - "token_acc": 0.6871946706143597 - }, - { - "epoch": 0.18272841051314143, - "grad_norm": 5.966728687286377, - "learning_rate": 2.28125e-05, - "loss": 1.0677056312561035, - "step": 73, - "token_acc": 0.7211055276381909 - }, - { - "epoch": 0.18523153942428036, - "grad_norm": 1.5221632719039917, - "learning_rate": 2.3125000000000003e-05, - "loss": 1.1764060258865356, - "step": 74, - "token_acc": 0.6962217319360177 - }, - { - "epoch": 0.18773466833541927, - "grad_norm": 2.7929961681365967, - "learning_rate": 2.34375e-05, - "loss": 1.1629931926727295, - "step": 75, - "token_acc": 0.6944312608764436 - }, - { - "epoch": 0.1902377972465582, - "grad_norm": 2.37900447845459, - "learning_rate": 2.375e-05, - "loss": 1.0149047374725342, - "step": 76, - "token_acc": 0.7393754402441888 - }, - { - "epoch": 0.1927409261576971, - "grad_norm": 1.0842740535736084, - "learning_rate": 2.4062500000000002e-05, - "loss": 1.1768832206726074, - "step": 77, - "token_acc": 0.6881792648675051 - }, - { - "epoch": 0.19524405506883605, - "grad_norm": 3.4930760860443115, - "learning_rate": 2.4375e-05, - "loss": 1.1979458332061768, - "step": 78, - "token_acc": 0.679685852835758 - }, - { - "epoch": 0.19774718397997496, - "grad_norm": 1.6366428136825562, - "learning_rate": 2.4687500000000004e-05, - "loss": 1.2089760303497314, - "step": 79, - "token_acc": 0.6773502191914271 - }, - { - "epoch": 0.2002503128911139, - "grad_norm": 2.1552915573120117, - "learning_rate": 2.5e-05, - "loss": 1.215577483177185, - "step": 80, - "token_acc": 0.6731748051534914 - }, - { - "epoch": 0.20275344180225283, - "grad_norm": 1.2128065824508667, - "learning_rate": 2.53125e-05, - "loss": 1.1573808193206787, - "step": 81, - "token_acc": 0.6900347624565469 - }, - { - "epoch": 0.20525657071339173, - "grad_norm": 1.3834235668182373, - "learning_rate": 2.5625e-05, - "loss": 1.2300320863723755, - "step": 82, - "token_acc": 0.6683756510416666 - }, - { - "epoch": 0.20775969962453067, - "grad_norm": 2.470287799835205, - "learning_rate": 2.5937500000000004e-05, - "loss": 1.0792181491851807, - "step": 83, - "token_acc": 0.705793164445006 - }, - { - "epoch": 0.21026282853566958, - "grad_norm": 1.6145744323730469, - "learning_rate": 2.625e-05, - "loss": 1.1585354804992676, - "step": 84, - "token_acc": 0.6947993159641888 - }, - { - "epoch": 0.2127659574468085, - "grad_norm": 4.214087963104248, - "learning_rate": 2.6562500000000002e-05, - "loss": 1.0336159467697144, - "step": 85, - "token_acc": 0.7254294315565787 - }, - { - "epoch": 0.21526908635794745, - "grad_norm": 2.9351229667663574, - "learning_rate": 2.6875e-05, - "loss": 1.1614649295806885, - "step": 86, - "token_acc": 0.6926658905704307 - }, - { - "epoch": 0.21777221526908636, - "grad_norm": 8.310845375061035, - "learning_rate": 2.71875e-05, - "loss": 1.0881564617156982, - "step": 87, - "token_acc": 0.7154069767441861 - }, - { - "epoch": 0.2202753441802253, - "grad_norm": 1.372636318206787, - "learning_rate": 2.7500000000000004e-05, - "loss": 1.0820119380950928, - "step": 88, - "token_acc": 0.7062420210978969 - }, - { - "epoch": 0.2227784730913642, - "grad_norm": 0.9730624556541443, - "learning_rate": 2.7812500000000002e-05, - "loss": 1.1775951385498047, - "step": 89, - "token_acc": 0.6864290043528569 - }, - { - "epoch": 0.22528160200250313, - "grad_norm": 32.95426559448242, - "learning_rate": 2.8125000000000003e-05, - "loss": 0.9602251052856445, - "step": 90, - "token_acc": 0.7386105263157895 - }, - { - "epoch": 0.22778473091364204, - "grad_norm": 1.8376237154006958, - "learning_rate": 2.84375e-05, - "loss": 1.0506157875061035, - "step": 91, - "token_acc": 0.7134351911627573 - }, - { - "epoch": 0.23028785982478098, - "grad_norm": 3.1153717041015625, - "learning_rate": 2.8749999999999997e-05, - "loss": 1.1409003734588623, - "step": 92, - "token_acc": 0.6888570610140361 - }, - { - "epoch": 0.2327909887359199, - "grad_norm": 4.867130756378174, - "learning_rate": 2.9062500000000005e-05, - "loss": 0.9956814050674438, - "step": 93, - "token_acc": 0.7277626648873377 - }, - { - "epoch": 0.23529411764705882, - "grad_norm": 1.4865891933441162, - "learning_rate": 2.9375000000000003e-05, - "loss": 1.158729076385498, - "step": 94, - "token_acc": 0.688175432276657 - }, - { - "epoch": 0.23779724655819776, - "grad_norm": 4.895930290222168, - "learning_rate": 2.96875e-05, - "loss": 1.0074833631515503, - "step": 95, - "token_acc": 0.7172348866922198 - }, - { - "epoch": 0.24030037546933666, - "grad_norm": 11.321675300598145, - "learning_rate": 3e-05, - "loss": 0.9759230613708496, - "step": 96, - "token_acc": 0.7422142214221422 - }, - { - "epoch": 0.2428035043804756, - "grad_norm": 5.278805255889893, - "learning_rate": 3.0312499999999998e-05, - "loss": 1.1167738437652588, - "step": 97, - "token_acc": 0.6905687036382904 - }, - { - "epoch": 0.2453066332916145, - "grad_norm": 11.173495292663574, - "learning_rate": 3.0625000000000006e-05, - "loss": 1.1424094438552856, - "step": 98, - "token_acc": 0.691369290620047 - }, - { - "epoch": 0.24780976220275344, - "grad_norm": 2.3526344299316406, - "learning_rate": 3.09375e-05, - "loss": 1.041211485862732, - "step": 99, - "token_acc": 0.7146459747817653 - }, - { - "epoch": 0.2503128911138924, - "grad_norm": 2.7857418060302734, - "learning_rate": 3.125e-05, - "loss": 1.0442692041397095, - "step": 100, - "token_acc": 0.711717754376551 - }, - { - "epoch": 0.2528160200250313, - "grad_norm": 79.83805084228516, - "learning_rate": 3.15625e-05, - "loss": 1.1021206378936768, - "step": 101, - "token_acc": 0.7008632923368022 - }, - { - "epoch": 0.2553191489361702, - "grad_norm": 2.249223232269287, - "learning_rate": 3.1875e-05, - "loss": 1.0893476009368896, - "step": 102, - "token_acc": 0.7009559556624245 - }, - { - "epoch": 0.25782227784730916, - "grad_norm": 3.4049673080444336, - "learning_rate": 3.21875e-05, - "loss": 1.0653949975967407, - "step": 103, - "token_acc": 0.7043142117355312 - }, - { - "epoch": 0.26032540675844806, - "grad_norm": 2.0676321983337402, - "learning_rate": 3.2500000000000004e-05, - "loss": 0.9971442818641663, - "step": 104, - "token_acc": 0.7209080223332354 - }, - { - "epoch": 0.26282853566958697, - "grad_norm": 3.04028058052063, - "learning_rate": 3.2812500000000005e-05, - "loss": 1.0553109645843506, - "step": 105, - "token_acc": 0.7107347245505521 - }, - { - "epoch": 0.26533166458072593, - "grad_norm": 3.4072177410125732, - "learning_rate": 3.3125e-05, - "loss": 1.1222078800201416, - "step": 106, - "token_acc": 0.6884954048982341 - }, - { - "epoch": 0.26783479349186484, - "grad_norm": 4.250513553619385, - "learning_rate": 3.34375e-05, - "loss": 1.0399558544158936, - "step": 107, - "token_acc": 0.715698983420891 - }, - { - "epoch": 0.27033792240300375, - "grad_norm": 1.5310983657836914, - "learning_rate": 3.375000000000001e-05, - "loss": 0.97971510887146, - "step": 108, - "token_acc": 0.7238202367561197 - }, - { - "epoch": 0.27284105131414266, - "grad_norm": 1.164379358291626, - "learning_rate": 3.40625e-05, - "loss": 1.0755829811096191, - "step": 109, - "token_acc": 0.6932410856838744 - }, - { - "epoch": 0.2753441802252816, - "grad_norm": 5.060781002044678, - "learning_rate": 3.4375e-05, - "loss": 1.0854302644729614, - "step": 110, - "token_acc": 0.7054753144049646 - }, - { - "epoch": 0.27784730913642053, - "grad_norm": 3.0165348052978516, - "learning_rate": 3.46875e-05, - "loss": 0.9611892700195312, - "step": 111, - "token_acc": 0.7338753387533875 - }, - { - "epoch": 0.28035043804755944, - "grad_norm": 5.620553970336914, - "learning_rate": 3.5e-05, - "loss": 0.9679099321365356, - "step": 112, - "token_acc": 0.7282849285666376 - }, - { - "epoch": 0.2828535669586984, - "grad_norm": 3.3517661094665527, - "learning_rate": 3.5312500000000005e-05, - "loss": 1.0258841514587402, - "step": 113, - "token_acc": 0.7185277850934949 - }, - { - "epoch": 0.2853566958698373, - "grad_norm": 4.1862382888793945, - "learning_rate": 3.5625000000000005e-05, - "loss": 1.0116548538208008, - "step": 114, - "token_acc": 0.7171322653250364 - }, - { - "epoch": 0.2878598247809762, - "grad_norm": 4.775069713592529, - "learning_rate": 3.59375e-05, - "loss": 0.9625561833381653, - "step": 115, - "token_acc": 0.7378043781257686 - }, - { - "epoch": 0.2903629536921151, - "grad_norm": 2.4339494705200195, - "learning_rate": 3.625e-05, - "loss": 1.0401370525360107, - "step": 116, - "token_acc": 0.710567296996663 - }, - { - "epoch": 0.2928660826032541, - "grad_norm": 2.8357059955596924, - "learning_rate": 3.65625e-05, - "loss": 0.8899033069610596, - "step": 117, - "token_acc": 0.760463490160823 - }, - { - "epoch": 0.295369211514393, - "grad_norm": 3.8368427753448486, - "learning_rate": 3.6875e-05, - "loss": 1.0864536762237549, - "step": 118, - "token_acc": 0.7004258071470921 - }, - { - "epoch": 0.2978723404255319, - "grad_norm": 2.6409614086151123, - "learning_rate": 3.71875e-05, - "loss": 1.0734574794769287, - "step": 119, - "token_acc": 0.7024148661086033 - }, - { - "epoch": 0.30037546933667086, - "grad_norm": 2.4843125343322754, - "learning_rate": 3.7500000000000003e-05, - "loss": 0.9885290861129761, - "step": 120, - "token_acc": 0.7214841692514777 - }, - { - "epoch": 0.30287859824780977, - "grad_norm": 3.219529628753662, - "learning_rate": 3.78125e-05, - "loss": 1.0155832767486572, - "step": 121, - "token_acc": 0.7182897862232779 - }, - { - "epoch": 0.3053817271589487, - "grad_norm": 4.397768020629883, - "learning_rate": 3.8125e-05, - "loss": 0.9772403836250305, - "step": 122, - "token_acc": 0.7289815989847716 - }, - { - "epoch": 0.3078848560700876, - "grad_norm": 7.476251125335693, - "learning_rate": 3.8437500000000006e-05, - "loss": 1.0845521688461304, - "step": 123, - "token_acc": 0.700028537649313 - }, - { - "epoch": 0.31038798498122655, - "grad_norm": 2.454371929168701, - "learning_rate": 3.875e-05, - "loss": 1.0315274000167847, - "step": 124, - "token_acc": 0.714497250035256 - }, - { - "epoch": 0.31289111389236546, - "grad_norm": 2.123765230178833, - "learning_rate": 3.90625e-05, - "loss": 0.9268566370010376, - "step": 125, - "token_acc": 0.7407587548638133 - }, - { - "epoch": 0.31539424280350437, - "grad_norm": 4.286694526672363, - "learning_rate": 3.9375e-05, - "loss": 0.9085225462913513, - "step": 126, - "token_acc": 0.7448712536935416 - }, - { - "epoch": 0.31789737171464333, - "grad_norm": 2.3730971813201904, - "learning_rate": 3.96875e-05, - "loss": 0.8727496266365051, - "step": 127, - "token_acc": 0.7622018348623854 - }, - { - "epoch": 0.32040050062578224, - "grad_norm": 2.70272159576416, - "learning_rate": 4e-05, - "loss": 1.0061339139938354, - "step": 128, - "token_acc": 0.7129116291496894 - }, - { - "epoch": 0.32290362953692114, - "grad_norm": 2.363917112350464, - "learning_rate": 4.0312500000000004e-05, - "loss": 1.0005316734313965, - "step": 129, - "token_acc": 0.7205369127516779 - }, - { - "epoch": 0.32540675844806005, - "grad_norm": 5.393451690673828, - "learning_rate": 4.0625000000000005e-05, - "loss": 0.9804684519767761, - "step": 130, - "token_acc": 0.7264981866328939 - }, - { - "epoch": 0.327909887359199, - "grad_norm": 4.67309045791626, - "learning_rate": 4.09375e-05, - "loss": 0.877933144569397, - "step": 131, - "token_acc": 0.76021068992315 - }, - { - "epoch": 0.3304130162703379, - "grad_norm": 2.624901533126831, - "learning_rate": 4.125e-05, - "loss": 0.9735865592956543, - "step": 132, - "token_acc": 0.7238545946227053 - }, - { - "epoch": 0.33291614518147683, - "grad_norm": 2.829728126525879, - "learning_rate": 4.156250000000001e-05, - "loss": 1.0161550045013428, - "step": 133, - "token_acc": 0.7142064135957983 - }, - { - "epoch": 0.3354192740926158, - "grad_norm": 2.408121109008789, - "learning_rate": 4.1875e-05, - "loss": 0.9492026567459106, - "step": 134, - "token_acc": 0.736371949075051 - }, - { - "epoch": 0.3379224030037547, - "grad_norm": 2.7580509185791016, - "learning_rate": 4.21875e-05, - "loss": 0.8693875670433044, - "step": 135, - "token_acc": 0.7559972583961617 - }, - { - "epoch": 0.3404255319148936, - "grad_norm": 2.2704222202301025, - "learning_rate": 4.25e-05, - "loss": 0.9372125864028931, - "step": 136, - "token_acc": 0.7337290802460306 - }, - { - "epoch": 0.3429286608260325, - "grad_norm": 4.360070705413818, - "learning_rate": 4.28125e-05, - "loss": 1.0078935623168945, - "step": 137, - "token_acc": 0.7146907768029104 - }, - { - "epoch": 0.3454317897371715, - "grad_norm": 13.713053703308105, - "learning_rate": 4.3125000000000005e-05, - "loss": 0.8341250419616699, - "step": 138, - "token_acc": 0.7732564024698856 - }, - { - "epoch": 0.3479349186483104, - "grad_norm": 4.248615264892578, - "learning_rate": 4.3437500000000006e-05, - "loss": 0.9521622657775879, - "step": 139, - "token_acc": 0.7330997794213053 - }, - { - "epoch": 0.3504380475594493, - "grad_norm": 4.988142013549805, - "learning_rate": 4.375e-05, - "loss": 0.893964409828186, - "step": 140, - "token_acc": 0.7476815787521329 - }, - { - "epoch": 0.35294117647058826, - "grad_norm": 3.864096164703369, - "learning_rate": 4.40625e-05, - "loss": 0.8878812789916992, - "step": 141, - "token_acc": 0.7459516298633018 - }, - { - "epoch": 0.35544430538172717, - "grad_norm": 4.250646591186523, - "learning_rate": 4.4375e-05, - "loss": 1.029758334159851, - "step": 142, - "token_acc": 0.7136325267304445 - }, - { - "epoch": 0.3579474342928661, - "grad_norm": 4.437873363494873, - "learning_rate": 4.46875e-05, - "loss": 0.8827238082885742, - "step": 143, - "token_acc": 0.7566478021552059 - }, - { - "epoch": 0.360450563204005, - "grad_norm": 2.903998613357544, - "learning_rate": 4.5e-05, - "loss": 0.9520173072814941, - "step": 144, - "token_acc": 0.731939568039153 - }, - { - "epoch": 0.36295369211514394, - "grad_norm": 4.129173755645752, - "learning_rate": 4.5312500000000004e-05, - "loss": 0.9319078922271729, - "step": 145, - "token_acc": 0.7331720330045288 - }, - { - "epoch": 0.36545682102628285, - "grad_norm": 6.249156951904297, - "learning_rate": 4.5625e-05, - "loss": 0.9192413091659546, - "step": 146, - "token_acc": 0.7346352365242378 - }, - { - "epoch": 0.36795994993742176, - "grad_norm": 2.8188090324401855, - "learning_rate": 4.59375e-05, - "loss": 0.8454147577285767, - "step": 147, - "token_acc": 0.7561653860226857 - }, - { - "epoch": 0.3704630788485607, - "grad_norm": 20.902667999267578, - "learning_rate": 4.6250000000000006e-05, - "loss": 0.9139873385429382, - "step": 148, - "token_acc": 0.7434644957033016 - }, - { - "epoch": 0.37296620775969963, - "grad_norm": 3.022164821624756, - "learning_rate": 4.65625e-05, - "loss": 1.0368843078613281, - "step": 149, - "token_acc": 0.7042305221620629 - }, - { - "epoch": 0.37546933667083854, - "grad_norm": 2.9987237453460693, - "learning_rate": 4.6875e-05, - "loss": 0.9745063185691833, - "step": 150, - "token_acc": 0.7196575970651177 - }, - { - "epoch": 0.37797246558197745, - "grad_norm": 2.3661983013153076, - "learning_rate": 4.71875e-05, - "loss": 1.0234860181808472, - "step": 151, - "token_acc": 0.7121767059221277 - }, - { - "epoch": 0.3804755944931164, - "grad_norm": 2.627258777618408, - "learning_rate": 4.75e-05, - "loss": 0.8604807257652283, - "step": 152, - "token_acc": 0.7513602865211103 - }, - { - "epoch": 0.3829787234042553, - "grad_norm": 2.5150792598724365, - "learning_rate": 4.7812500000000003e-05, - "loss": 1.01763916015625, - "step": 153, - "token_acc": 0.7111102210829863 - }, - { - "epoch": 0.3854818523153942, - "grad_norm": 55.79320526123047, - "learning_rate": 4.8125000000000004e-05, - "loss": 0.8841659426689148, - "step": 154, - "token_acc": 0.7480198788631776 - }, - { - "epoch": 0.3879849812265332, - "grad_norm": 3.121655225753784, - "learning_rate": 4.8437500000000005e-05, - "loss": 0.9884188175201416, - "step": 155, - "token_acc": 0.7213071620270484 - }, - { - "epoch": 0.3904881101376721, - "grad_norm": 2.309528112411499, - "learning_rate": 4.875e-05, - "loss": 0.8871731758117676, - "step": 156, - "token_acc": 0.7475174151474729 - }, - { - "epoch": 0.392991239048811, - "grad_norm": 1.564784049987793, - "learning_rate": 4.90625e-05, - "loss": 0.9550650119781494, - "step": 157, - "token_acc": 0.7262110500130924 - }, - { - "epoch": 0.3954943679599499, - "grad_norm": 4.770287036895752, - "learning_rate": 4.937500000000001e-05, - "loss": 0.8485426902770996, - "step": 158, - "token_acc": 0.755221214619401 - }, - { - "epoch": 0.3979974968710889, - "grad_norm": 2.7487730979919434, - "learning_rate": 4.96875e-05, - "loss": 0.8821752667427063, - "step": 159, - "token_acc": 0.7515657620041754 - }, - { - "epoch": 0.4005006257822278, - "grad_norm": 1.9737449884414673, - "learning_rate": 5e-05, - "loss": 0.9395763874053955, - "step": 160, - "token_acc": 0.7279748441551277 - }, - { - "epoch": 0.4030037546933667, - "grad_norm": 4.472081184387207, - "learning_rate": 4.9999698804181425e-05, - "loss": 0.8686919808387756, - "step": 161, - "token_acc": 0.7603603603603604 - }, - { - "epoch": 0.40550688360450565, - "grad_norm": 3.6379482746124268, - "learning_rate": 4.9998795223983205e-05, - "loss": 0.8725775480270386, - "step": 162, - "token_acc": 0.7472160356347439 - }, - { - "epoch": 0.40801001251564456, - "grad_norm": 3.493037700653076, - "learning_rate": 4.99972892811777e-05, - "loss": 0.847150981426239, - "step": 163, - "token_acc": 0.7538943188759927 - }, - { - "epoch": 0.41051314142678347, - "grad_norm": 1.912611722946167, - "learning_rate": 4.9995181012051625e-05, - "loss": 0.9739137887954712, - "step": 164, - "token_acc": 0.7212982399483288 - }, - { - "epoch": 0.4130162703379224, - "grad_norm": 11.750629425048828, - "learning_rate": 4.9992470467405104e-05, - "loss": 0.926494300365448, - "step": 165, - "token_acc": 0.7324805645917186 - }, - { - "epoch": 0.41551939924906134, - "grad_norm": 1.79902982711792, - "learning_rate": 4.998915771255053e-05, - "loss": 0.9524897336959839, - "step": 166, - "token_acc": 0.7259630302761647 - }, - { - "epoch": 0.41802252816020025, - "grad_norm": 1.653032660484314, - "learning_rate": 4.9985242827310936e-05, - "loss": 0.8616597652435303, - "step": 167, - "token_acc": 0.7509121709669012 - }, - { - "epoch": 0.42052565707133915, - "grad_norm": 3.853633165359497, - "learning_rate": 4.9980725906018074e-05, - "loss": 0.9457658529281616, - "step": 168, - "token_acc": 0.7262784810126582 - }, - { - "epoch": 0.4230287859824781, - "grad_norm": 2.9848127365112305, - "learning_rate": 4.9975607057510185e-05, - "loss": 0.7890052795410156, - "step": 169, - "token_acc": 0.7754066818261326 - }, - { - "epoch": 0.425531914893617, - "grad_norm": 5.078474521636963, - "learning_rate": 4.996988640512931e-05, - "loss": 0.8364709615707397, - "step": 170, - "token_acc": 0.764642082429501 - }, - { - "epoch": 0.42803504380475593, - "grad_norm": 2.06341814994812, - "learning_rate": 4.99635640867184e-05, - "loss": 0.8439483642578125, - "step": 171, - "token_acc": 0.7607762475406904 - }, - { - "epoch": 0.4305381727158949, - "grad_norm": 2.261368989944458, - "learning_rate": 4.9956640254617906e-05, - "loss": 0.8153511881828308, - "step": 172, - "token_acc": 0.7593304295840806 - }, - { - "epoch": 0.4330413016270338, - "grad_norm": 2.942291736602783, - "learning_rate": 4.994911507566217e-05, - "loss": 0.950925886631012, - "step": 173, - "token_acc": 0.7278411003703169 - }, - { - "epoch": 0.4355444305381727, - "grad_norm": 1.5425530672073364, - "learning_rate": 4.99409887311754e-05, - "loss": 0.9062566161155701, - "step": 174, - "token_acc": 0.7486025191920698 - }, - { - "epoch": 0.4380475594493116, - "grad_norm": 2.6939258575439453, - "learning_rate": 4.993226141696726e-05, - "loss": 0.8227016925811768, - "step": 175, - "token_acc": 0.7661045274992404 - }, - { - "epoch": 0.4405506883604506, - "grad_norm": 5.915945529937744, - "learning_rate": 4.99229333433282e-05, - "loss": 0.9167571067810059, - "step": 176, - "token_acc": 0.7367290406467296 - }, - { - "epoch": 0.4430538172715895, - "grad_norm": 1.6880910396575928, - "learning_rate": 4.991300473502437e-05, - "loss": 0.8607068657875061, - "step": 177, - "token_acc": 0.7547773184618984 - }, - { - "epoch": 0.4455569461827284, - "grad_norm": 1.5918737649917603, - "learning_rate": 4.9902475831292185e-05, - "loss": 1.0075507164001465, - "step": 178, - "token_acc": 0.7130909563634787 - }, - { - "epoch": 0.44806007509386736, - "grad_norm": 5.924171447753906, - "learning_rate": 4.9891346885832586e-05, - "loss": 0.8469476103782654, - "step": 179, - "token_acc": 0.7637781477262771 - }, - { - "epoch": 0.45056320400500627, - "grad_norm": 1.8689627647399902, - "learning_rate": 4.987961816680492e-05, - "loss": 0.9136925935745239, - "step": 180, - "token_acc": 0.7422716834481541 - }, - { - "epoch": 0.4530663329161452, - "grad_norm": 3.0246078968048096, - "learning_rate": 4.986728995682049e-05, - "loss": 0.809701681137085, - "step": 181, - "token_acc": 0.7672480620155039 - }, - { - "epoch": 0.4555694618272841, - "grad_norm": 1.0998661518096924, - "learning_rate": 4.9854362552935706e-05, - "loss": 0.9456962943077087, - "step": 182, - "token_acc": 0.7302064153503246 - }, - { - "epoch": 0.45807259073842305, - "grad_norm": 1.7873152494430542, - "learning_rate": 4.984083626664497e-05, - "loss": 0.9543384909629822, - "step": 183, - "token_acc": 0.7306896908282494 - }, - { - "epoch": 0.46057571964956195, - "grad_norm": 1.8325738906860352, - "learning_rate": 4.982671142387316e-05, - "loss": 0.9392420649528503, - "step": 184, - "token_acc": 0.73054827887311 - }, - { - "epoch": 0.46307884856070086, - "grad_norm": 2.0283353328704834, - "learning_rate": 4.981198836496775e-05, - "loss": 0.8523749709129333, - "step": 185, - "token_acc": 0.7518976665729548 - }, - { - "epoch": 0.4655819774718398, - "grad_norm": 1.8880774974822998, - "learning_rate": 4.979666744469065e-05, - "loss": 1.0026400089263916, - "step": 186, - "token_acc": 0.7179426739581369 - }, - { - "epoch": 0.46808510638297873, - "grad_norm": 1.5821034908294678, - "learning_rate": 4.978074903220963e-05, - "loss": 0.8702259659767151, - "step": 187, - "token_acc": 0.7518054532056005 - }, - { - "epoch": 0.47058823529411764, - "grad_norm": 1.3895519971847534, - "learning_rate": 4.976423351108943e-05, - "loss": 0.9819506406784058, - "step": 188, - "token_acc": 0.7262579281183932 - }, - { - "epoch": 0.47309136420525655, - "grad_norm": 2.175621509552002, - "learning_rate": 4.9747121279282525e-05, - "loss": 0.8391700983047485, - "step": 189, - "token_acc": 0.7537929574483099 - }, - { - "epoch": 0.4755944931163955, - "grad_norm": 1.7478188276290894, - "learning_rate": 4.972941274911953e-05, - "loss": 0.8495551347732544, - "step": 190, - "token_acc": 0.7538736959071548 - }, - { - "epoch": 0.4780976220275344, - "grad_norm": 2.7944796085357666, - "learning_rate": 4.971110834729925e-05, - "loss": 0.8685894012451172, - "step": 191, - "token_acc": 0.7504071889918562 - }, - { - "epoch": 0.4806007509386733, - "grad_norm": 11.889168739318848, - "learning_rate": 4.9692208514878444e-05, - "loss": 0.8083388209342957, - "step": 192, - "token_acc": 0.7642701875855407 - }, - { - "epoch": 0.4831038798498123, - "grad_norm": 13.814888954162598, - "learning_rate": 4.9672713707261146e-05, - "loss": 0.8238387703895569, - "step": 193, - "token_acc": 0.7610306169278175 - }, - { - "epoch": 0.4856070087609512, - "grad_norm": 1.4705616235733032, - "learning_rate": 4.965262439418772e-05, - "loss": 0.9381322860717773, - "step": 194, - "token_acc": 0.7296181077022098 - }, - { - "epoch": 0.4881101376720901, - "grad_norm": 2.106172800064087, - "learning_rate": 4.963194105972353e-05, - "loss": 0.781527042388916, - "step": 195, - "token_acc": 0.7668615663345137 - }, - { - "epoch": 0.490613266583229, - "grad_norm": 1.4520384073257446, - "learning_rate": 4.9610664202247294e-05, - "loss": 0.8901837468147278, - "step": 196, - "token_acc": 0.7357566856373539 - }, - { - "epoch": 0.493116395494368, - "grad_norm": 92.66796112060547, - "learning_rate": 4.958879433443904e-05, - "loss": 0.8004983067512512, - "step": 197, - "token_acc": 0.7666008205439903 - }, - { - "epoch": 0.4956195244055069, - "grad_norm": 3.9278409481048584, - "learning_rate": 4.95663319832678e-05, - "loss": 0.9934076070785522, - "step": 198, - "token_acc": 0.7185084923372484 - }, - { - "epoch": 0.4981226533166458, - "grad_norm": 1.615594506263733, - "learning_rate": 4.954327768997886e-05, - "loss": 0.8867624998092651, - "step": 199, - "token_acc": 0.7388085147839641 - }, - { - "epoch": 0.5006257822277848, - "grad_norm": 2.8862221240997314, - "learning_rate": 4.951963201008076e-05, - "loss": 0.8318412899971008, - "step": 200, - "token_acc": 0.7566619330047615 - }, - { - "epoch": 0.5031289111389237, - "grad_norm": 1.856955885887146, - "learning_rate": 4.949539551333191e-05, - "loss": 0.8780606389045715, - "step": 201, - "token_acc": 0.7452740722007967 - }, - { - "epoch": 0.5056320400500626, - "grad_norm": 1.9028009176254272, - "learning_rate": 4.947056878372681e-05, - "loss": 0.7615805864334106, - "step": 202, - "token_acc": 0.7806040051679587 - }, - { - "epoch": 0.5081351689612015, - "grad_norm": 1.9965895414352417, - "learning_rate": 4.944515241948204e-05, - "loss": 0.8922481536865234, - "step": 203, - "token_acc": 0.7439118174826967 - }, - { - "epoch": 0.5106382978723404, - "grad_norm": 2.4679484367370605, - "learning_rate": 4.9419147033021814e-05, - "loss": 0.9746915102005005, - "step": 204, - "token_acc": 0.7225560081466396 - }, - { - "epoch": 0.5131414267834794, - "grad_norm": 2.7257940769195557, - "learning_rate": 4.9392553250963215e-05, - "loss": 0.802959144115448, - "step": 205, - "token_acc": 0.7686112156567557 - }, - { - "epoch": 0.5156445556946183, - "grad_norm": 3.264042377471924, - "learning_rate": 4.936537171410113e-05, - "loss": 0.9509553909301758, - "step": 206, - "token_acc": 0.7261368386827071 - }, - { - "epoch": 0.5181476846057572, - "grad_norm": 3.4267592430114746, - "learning_rate": 4.933760307739277e-05, - "loss": 0.8793500661849976, - "step": 207, - "token_acc": 0.7480100363384669 - }, - { - "epoch": 0.5206508135168961, - "grad_norm": 4.144317626953125, - "learning_rate": 4.9309248009941914e-05, - "loss": 0.7871251106262207, - "step": 208, - "token_acc": 0.7663051337671728 - }, - { - "epoch": 0.523153942428035, - "grad_norm": 11.039412498474121, - "learning_rate": 4.92803071949828e-05, - "loss": 0.9288915395736694, - "step": 209, - "token_acc": 0.7273755047106326 - }, - { - "epoch": 0.5256570713391739, - "grad_norm": 1.3589577674865723, - "learning_rate": 4.9250781329863606e-05, - "loss": 0.9469587802886963, - "step": 210, - "token_acc": 0.7330181502010651 - }, - { - "epoch": 0.5281602002503129, - "grad_norm": 24.967679977416992, - "learning_rate": 4.92206711260297e-05, - "loss": 0.922472357749939, - "step": 211, - "token_acc": 0.7295061829497994 - }, - { - "epoch": 0.5306633291614519, - "grad_norm": 5.612998008728027, - "learning_rate": 4.9189977309006495e-05, - "loss": 0.9386663436889648, - "step": 212, - "token_acc": 0.729034504100263 - }, - { - "epoch": 0.5331664580725908, - "grad_norm": 2.4214696884155273, - "learning_rate": 4.915870061838193e-05, - "loss": 0.8876584768295288, - "step": 213, - "token_acc": 0.7409878277153558 - }, - { - "epoch": 0.5356695869837297, - "grad_norm": 2.5469002723693848, - "learning_rate": 4.912684180778869e-05, - "loss": 0.8577581644058228, - "step": 214, - "token_acc": 0.7466870540265036 - }, - { - "epoch": 0.5381727158948686, - "grad_norm": 1.8884869813919067, - "learning_rate": 4.9094401644886e-05, - "loss": 0.9847173690795898, - "step": 215, - "token_acc": 0.7160602660682802 - }, - { - "epoch": 0.5406758448060075, - "grad_norm": 1.4721566438674927, - "learning_rate": 4.906138091134118e-05, - "loss": 0.9311186671257019, - "step": 216, - "token_acc": 0.7331803944059646 - }, - { - "epoch": 0.5431789737171464, - "grad_norm": 3.0583348274230957, - "learning_rate": 4.90277804028108e-05, - "loss": 0.7272347807884216, - "step": 217, - "token_acc": 0.7930695985079023 - }, - { - "epoch": 0.5456821026282853, - "grad_norm": 2.5264322757720947, - "learning_rate": 4.8993600928921434e-05, - "loss": 0.861505389213562, - "step": 218, - "token_acc": 0.7481168230474429 - }, - { - "epoch": 0.5481852315394243, - "grad_norm": 1.6603262424468994, - "learning_rate": 4.8958843313250294e-05, - "loss": 0.7447217106819153, - "step": 219, - "token_acc": 0.7862431800467654 - }, - { - "epoch": 0.5506883604505632, - "grad_norm": 1.4868695735931396, - "learning_rate": 4.892350839330522e-05, - "loss": 0.8898584842681885, - "step": 220, - "token_acc": 0.740379366812227 - }, - { - "epoch": 0.5531914893617021, - "grad_norm": 2.699589729309082, - "learning_rate": 4.888759702050466e-05, - "loss": 0.8423305749893188, - "step": 221, - "token_acc": 0.7540192926045016 - }, - { - "epoch": 0.5556946182728411, - "grad_norm": 2.180371046066284, - "learning_rate": 4.885111006015701e-05, - "loss": 0.8793195486068726, - "step": 222, - "token_acc": 0.7477990405398282 - }, - { - "epoch": 0.55819774718398, - "grad_norm": 2.203009605407715, - "learning_rate": 4.881404839143988e-05, - "loss": 0.8497090935707092, - "step": 223, - "token_acc": 0.7462110960757781 - }, - { - "epoch": 0.5607008760951189, - "grad_norm": 1.6231415271759033, - "learning_rate": 4.877641290737884e-05, - "loss": 0.8052700757980347, - "step": 224, - "token_acc": 0.7610808422912678 - }, - { - "epoch": 0.5632040050062578, - "grad_norm": 2.361985445022583, - "learning_rate": 4.873820451482592e-05, - "loss": 0.8841230869293213, - "step": 225, - "token_acc": 0.7496264419341342 - }, - { - "epoch": 0.5657071339173968, - "grad_norm": 3.28450870513916, - "learning_rate": 4.8699424134437765e-05, - "loss": 0.8853447437286377, - "step": 226, - "token_acc": 0.742984257357974 - }, - { - "epoch": 0.5682102628285357, - "grad_norm": 1.5169377326965332, - "learning_rate": 4.8660072700653445e-05, - "loss": 0.8390404582023621, - "step": 227, - "token_acc": 0.7602164582944579 - }, - { - "epoch": 0.5707133917396746, - "grad_norm": 1.017259120941162, - "learning_rate": 4.862015116167196e-05, - "loss": 0.8904134035110474, - "step": 228, - "token_acc": 0.7438553022794846 - }, - { - "epoch": 0.5732165206508135, - "grad_norm": 2.0630033016204834, - "learning_rate": 4.857966047942933e-05, - "loss": 0.8353220820426941, - "step": 229, - "token_acc": 0.7571183288024038 - }, - { - "epoch": 0.5757196495619524, - "grad_norm": 1.721699833869934, - "learning_rate": 4.853860162957552e-05, - "loss": 0.8920808434486389, - "step": 230, - "token_acc": 0.7390824422214557 - }, - { - "epoch": 0.5782227784730913, - "grad_norm": 2.038731575012207, - "learning_rate": 4.849697560145083e-05, - "loss": 0.6845712065696716, - "step": 231, - "token_acc": 0.8008808955771701 - }, - { - "epoch": 0.5807259073842302, - "grad_norm": 2.1230990886688232, - "learning_rate": 4.8454783398062106e-05, - "loss": 0.8267085552215576, - "step": 232, - "token_acc": 0.7581519720716037 - }, - { - "epoch": 0.5832290362953693, - "grad_norm": 3.591655969619751, - "learning_rate": 4.8412026036058566e-05, - "loss": 0.8310796022415161, - "step": 233, - "token_acc": 0.7544153744836257 - }, - { - "epoch": 0.5857321652065082, - "grad_norm": 36.25672149658203, - "learning_rate": 4.836870454570731e-05, - "loss": 0.8032848238945007, - "step": 234, - "token_acc": 0.7607001230685081 - }, - { - "epoch": 0.5882352941176471, - "grad_norm": 1.4401963949203491, - "learning_rate": 4.8324819970868473e-05, - "loss": 0.8128241896629333, - "step": 235, - "token_acc": 0.757310740639519 - }, - { - "epoch": 0.590738423028786, - "grad_norm": 10.958834648132324, - "learning_rate": 4.828037336897009e-05, - "loss": 0.8540234565734863, - "step": 236, - "token_acc": 0.74524380963531 - }, - { - "epoch": 0.5932415519399249, - "grad_norm": 3.50199556350708, - "learning_rate": 4.8235365810982615e-05, - "loss": 0.9761826992034912, - "step": 237, - "token_acc": 0.7167197154090994 - }, - { - "epoch": 0.5957446808510638, - "grad_norm": 3.497457504272461, - "learning_rate": 4.8189798381393104e-05, - "loss": 0.7976563572883606, - "step": 238, - "token_acc": 0.7626602564102564 - }, - { - "epoch": 0.5982478097622027, - "grad_norm": 3.2434616088867188, - "learning_rate": 4.81436721781791e-05, - "loss": 0.8806981444358826, - "step": 239, - "token_acc": 0.7481954469739034 - }, - { - "epoch": 0.6007509386733417, - "grad_norm": 3.4984254837036133, - "learning_rate": 4.8096988312782174e-05, - "loss": 0.8493468761444092, - "step": 240, - "token_acc": 0.7490117506904207 - }, - { - "epoch": 0.6032540675844806, - "grad_norm": 1.4711133241653442, - "learning_rate": 4.8049747910081117e-05, - "loss": 0.6916333436965942, - "step": 241, - "token_acc": 0.794162491831845 - }, - { - "epoch": 0.6057571964956195, - "grad_norm": 1.8549391031265259, - "learning_rate": 4.8001952108364876e-05, - "loss": 0.9032708406448364, - "step": 242, - "token_acc": 0.7342644900137895 - }, - { - "epoch": 0.6082603254067585, - "grad_norm": 1.721065878868103, - "learning_rate": 4.79536020593051e-05, - "loss": 0.9230173826217651, - "step": 243, - "token_acc": 0.7311291328758578 - }, - { - "epoch": 0.6107634543178974, - "grad_norm": 2.2300896644592285, - "learning_rate": 4.7904698927928406e-05, - "loss": 0.8387856483459473, - "step": 244, - "token_acc": 0.7520661157024794 - }, - { - "epoch": 0.6132665832290363, - "grad_norm": 1.5376681089401245, - "learning_rate": 4.785524389258827e-05, - "loss": 0.9396567344665527, - "step": 245, - "token_acc": 0.7290214555507963 - }, - { - "epoch": 0.6157697121401752, - "grad_norm": 3.0389626026153564, - "learning_rate": 4.7805238144936694e-05, - "loss": 0.8885030150413513, - "step": 246, - "token_acc": 0.7354931107709023 - }, - { - "epoch": 0.6182728410513142, - "grad_norm": 4.214961051940918, - "learning_rate": 4.7754682889895446e-05, - "loss": 0.7742225527763367, - "step": 247, - "token_acc": 0.7741118966570656 - }, - { - "epoch": 0.6207759699624531, - "grad_norm": 1.702107310295105, - "learning_rate": 4.7703579345627035e-05, - "loss": 0.8894025683403015, - "step": 248, - "token_acc": 0.7381677396902732 - }, - { - "epoch": 0.623279098873592, - "grad_norm": 1.6989673376083374, - "learning_rate": 4.765192874350537e-05, - "loss": 0.9064431190490723, - "step": 249, - "token_acc": 0.7365355965870616 - }, - { - "epoch": 0.6257822277847309, - "grad_norm": 1.8439379930496216, - "learning_rate": 4.759973232808609e-05, - "loss": 0.744268536567688, - "step": 250, - "token_acc": 0.7793768780642101 - }, - { - "epoch": 0.6282853566958698, - "grad_norm": 4.3568434715271, - "learning_rate": 4.7546991357076544e-05, - "loss": 0.8421927690505981, - "step": 251, - "token_acc": 0.7551911730901847 - }, - { - "epoch": 0.6307884856070087, - "grad_norm": 1.580527663230896, - "learning_rate": 4.749370710130554e-05, - "loss": 0.8805860280990601, - "step": 252, - "token_acc": 0.7404246461282264 - }, - { - "epoch": 0.6332916145181476, - "grad_norm": 5.8950724601745605, - "learning_rate": 4.7439880844692675e-05, - "loss": 0.8358674049377441, - "step": 253, - "token_acc": 0.753058660141525 - }, - { - "epoch": 0.6357947434292867, - "grad_norm": 2.4937312602996826, - "learning_rate": 4.738551388421743e-05, - "loss": 0.7486670017242432, - "step": 254, - "token_acc": 0.7726565697912403 - }, - { - "epoch": 0.6382978723404256, - "grad_norm": 2.2410449981689453, - "learning_rate": 4.7330607529887884e-05, - "loss": 0.7166397571563721, - "step": 255, - "token_acc": 0.787853730246233 - }, - { - "epoch": 0.6408010012515645, - "grad_norm": 0.9600523114204407, - "learning_rate": 4.72751631047092e-05, - "loss": 0.817680835723877, - "step": 256, - "token_acc": 0.7578717967986773 - }, - { - "epoch": 0.6433041301627034, - "grad_norm": 1.6403498649597168, - "learning_rate": 4.721918194465169e-05, - "loss": 0.7929844260215759, - "step": 257, - "token_acc": 0.7647058823529411 - }, - { - "epoch": 0.6458072590738423, - "grad_norm": 2.6843879222869873, - "learning_rate": 4.7162665398618664e-05, - "loss": 0.7781978249549866, - "step": 258, - "token_acc": 0.7685840012572686 - }, - { - "epoch": 0.6483103879849812, - "grad_norm": 1.1330469846725464, - "learning_rate": 4.7105614828413906e-05, - "loss": 0.828113317489624, - "step": 259, - "token_acc": 0.7519813233396817 - }, - { - "epoch": 0.6508135168961201, - "grad_norm": 1.6353662014007568, - "learning_rate": 4.7048031608708876e-05, - "loss": 0.8706427812576294, - "step": 260, - "token_acc": 0.7472778599274096 - }, - { - "epoch": 0.6533166458072591, - "grad_norm": 1.700364112854004, - "learning_rate": 4.698991712700958e-05, - "loss": 0.9167036414146423, - "step": 261, - "token_acc": 0.7337103615431226 - }, - { - "epoch": 0.655819774718398, - "grad_norm": 4.744112968444824, - "learning_rate": 4.693127278362311e-05, - "loss": 0.7307888269424438, - "step": 262, - "token_acc": 0.7857924493890206 - }, - { - "epoch": 0.6583229036295369, - "grad_norm": 2.0567502975463867, - "learning_rate": 4.687209999162396e-05, - "loss": 0.9097830057144165, - "step": 263, - "token_acc": 0.7335190343546889 - }, - { - "epoch": 0.6608260325406758, - "grad_norm": 1.584566593170166, - "learning_rate": 4.681240017681993e-05, - "loss": 0.9686288833618164, - "step": 264, - "token_acc": 0.7200644430897849 - }, - { - "epoch": 0.6633291614518148, - "grad_norm": 3.126399278640747, - "learning_rate": 4.6752174777717786e-05, - "loss": 0.8048110604286194, - "step": 265, - "token_acc": 0.7667047401484866 - }, - { - "epoch": 0.6658322903629537, - "grad_norm": 3.089082717895508, - "learning_rate": 4.6691425245488607e-05, - "loss": 0.8348573446273804, - "step": 266, - "token_acc": 0.7527571811327809 - }, - { - "epoch": 0.6683354192740926, - "grad_norm": 0.9253506660461426, - "learning_rate": 4.6630153043932784e-05, - "loss": 0.9513870477676392, - "step": 267, - "token_acc": 0.730309423347398 - }, - { - "epoch": 0.6708385481852316, - "grad_norm": 1.5841699838638306, - "learning_rate": 4.65683596494448e-05, - "loss": 0.8438987731933594, - "step": 268, - "token_acc": 0.7552549276311005 - }, - { - "epoch": 0.6733416770963705, - "grad_norm": 1.369858980178833, - "learning_rate": 4.650604655097761e-05, - "loss": 0.8666725158691406, - "step": 269, - "token_acc": 0.7492324010495172 - }, - { - "epoch": 0.6758448060075094, - "grad_norm": 2.27767276763916, - "learning_rate": 4.6443215250006806e-05, - "loss": 0.8292583227157593, - "step": 270, - "token_acc": 0.7594427689214419 - }, - { - "epoch": 0.6783479349186483, - "grad_norm": 1.3438291549682617, - "learning_rate": 4.637986726049438e-05, - "loss": 0.7024565935134888, - "step": 271, - "token_acc": 0.78654883163571 - }, - { - "epoch": 0.6808510638297872, - "grad_norm": 2.168410301208496, - "learning_rate": 4.6316004108852305e-05, - "loss": 0.8539745807647705, - "step": 272, - "token_acc": 0.7467631908673257 - }, - { - "epoch": 0.6833541927409261, - "grad_norm": 2.0540430545806885, - "learning_rate": 4.6251627333905724e-05, - "loss": 0.8134692907333374, - "step": 273, - "token_acc": 0.7603259342511941 - }, - { - "epoch": 0.685857321652065, - "grad_norm": 7.12939977645874, - "learning_rate": 4.618673848685586e-05, - "loss": 0.7887545824050903, - "step": 274, - "token_acc": 0.7652179873868933 - }, - { - "epoch": 0.688360450563204, - "grad_norm": 2.2455780506134033, - "learning_rate": 4.612133913124268e-05, - "loss": 0.7140970230102539, - "step": 275, - "token_acc": 0.7912922649374711 - }, - { - "epoch": 0.690863579474343, - "grad_norm": 2.3021907806396484, - "learning_rate": 4.6055430842907167e-05, - "loss": 0.8248931169509888, - "step": 276, - "token_acc": 0.756960692559663 - }, - { - "epoch": 0.6933667083854819, - "grad_norm": 1.2665908336639404, - "learning_rate": 4.59890152099534e-05, - "loss": 0.9142659306526184, - "step": 277, - "token_acc": 0.731113628887833 - }, - { - "epoch": 0.6958698372966208, - "grad_norm": 1.3562812805175781, - "learning_rate": 4.5922093832710236e-05, - "loss": 0.8612058162689209, - "step": 278, - "token_acc": 0.7461015816440187 - }, - { - "epoch": 0.6983729662077597, - "grad_norm": 1.548026204109192, - "learning_rate": 4.585466832369281e-05, - "loss": 0.7588024139404297, - "step": 279, - "token_acc": 0.7776190118071745 - }, - { - "epoch": 0.7008760951188986, - "grad_norm": 4.4971442222595215, - "learning_rate": 4.5786740307563636e-05, - "loss": 0.7747074365615845, - "step": 280, - "token_acc": 0.7710498712691904 - }, - { - "epoch": 0.7033792240300375, - "grad_norm": 2.4977355003356934, - "learning_rate": 4.5718311421093454e-05, - "loss": 0.928239107131958, - "step": 281, - "token_acc": 0.7275659486234305 - }, - { - "epoch": 0.7058823529411765, - "grad_norm": 1.2182586193084717, - "learning_rate": 4.5649383313121827e-05, - "loss": 0.856454074382782, - "step": 282, - "token_acc": 0.7467900865930128 - }, - { - "epoch": 0.7083854818523154, - "grad_norm": 5.53813362121582, - "learning_rate": 4.55799576445174e-05, - "loss": 0.8874952793121338, - "step": 283, - "token_acc": 0.7408339529828977 - }, - { - "epoch": 0.7108886107634543, - "grad_norm": 1.754224181175232, - "learning_rate": 4.551003608813784e-05, - "loss": 0.7295838594436646, - "step": 284, - "token_acc": 0.7820602120578902 - }, - { - "epoch": 0.7133917396745932, - "grad_norm": 1.7745537757873535, - "learning_rate": 4.5439620328789593e-05, - "loss": 0.7359857559204102, - "step": 285, - "token_acc": 0.7874957869902258 - }, - { - "epoch": 0.7158948685857321, - "grad_norm": 1.9047404527664185, - "learning_rate": 4.536871206318723e-05, - "loss": 0.7301020622253418, - "step": 286, - "token_acc": 0.780550320392009 - }, - { - "epoch": 0.718397997496871, - "grad_norm": 2.520000696182251, - "learning_rate": 4.529731299991262e-05, - "loss": 0.9152336120605469, - "step": 287, - "token_acc": 0.7370678450740837 - }, - { - "epoch": 0.72090112640801, - "grad_norm": 1.596307635307312, - "learning_rate": 4.522542485937369e-05, - "loss": 0.8424668908119202, - "step": 288, - "token_acc": 0.7530345471521942 - }, - { - "epoch": 0.723404255319149, - "grad_norm": 1.1966215372085571, - "learning_rate": 4.5153049373763026e-05, - "loss": 0.9505821466445923, - "step": 289, - "token_acc": 0.7279186335101465 - }, - { - "epoch": 0.7259073842302879, - "grad_norm": 1.554336428642273, - "learning_rate": 4.508018828701612e-05, - "loss": 0.8248058557510376, - "step": 290, - "token_acc": 0.7543579671004174 - }, - { - "epoch": 0.7284105131414268, - "grad_norm": 1.557536005973816, - "learning_rate": 4.500684335476936e-05, - "loss": 0.8745982646942139, - "step": 291, - "token_acc": 0.7485994397759104 - }, - { - "epoch": 0.7309136420525657, - "grad_norm": 1.5448335409164429, - "learning_rate": 4.493301634431768e-05, - "loss": 0.9151402711868286, - "step": 292, - "token_acc": 0.7357596764875795 - }, - { - "epoch": 0.7334167709637046, - "grad_norm": 1.980355143547058, - "learning_rate": 4.485870903457204e-05, - "loss": 0.8075742125511169, - "step": 293, - "token_acc": 0.7581687393318702 - }, - { - "epoch": 0.7359198998748435, - "grad_norm": 5.846746921539307, - "learning_rate": 4.478392321601651e-05, - "loss": 0.8880358934402466, - "step": 294, - "token_acc": 0.7426012638087012 - }, - { - "epoch": 0.7384230287859824, - "grad_norm": 1.4618793725967407, - "learning_rate": 4.470866069066516e-05, - "loss": 0.7289685606956482, - "step": 295, - "token_acc": 0.7879294491348324 - }, - { - "epoch": 0.7409261576971214, - "grad_norm": 2.9660937786102295, - "learning_rate": 4.463292327201862e-05, - "loss": 0.7348141074180603, - "step": 296, - "token_acc": 0.7806614266646893 - }, - { - "epoch": 0.7434292866082604, - "grad_norm": 1.2741750478744507, - "learning_rate": 4.455671278502042e-05, - "loss": 0.8414113521575928, - "step": 297, - "token_acc": 0.75607294260144 - }, - { - "epoch": 0.7459324155193993, - "grad_norm": 3.9552199840545654, - "learning_rate": 4.4480031066012916e-05, - "loss": 0.7518953084945679, - "step": 298, - "token_acc": 0.773398631840796 - }, - { - "epoch": 0.7484355444305382, - "grad_norm": 2.206568479537964, - "learning_rate": 4.44028799626932e-05, - "loss": 0.8302481174468994, - "step": 299, - "token_acc": 0.7567450226384668 - }, - { - "epoch": 0.7509386733416771, - "grad_norm": 3.6707959175109863, - "learning_rate": 4.4325261334068426e-05, - "loss": 0.8474286794662476, - "step": 300, - "token_acc": 0.7506851460339833 - }, - { - "epoch": 0.753441802252816, - "grad_norm": 2.34222149848938, - "learning_rate": 4.4247177050411114e-05, - "loss": 0.9115549325942993, - "step": 301, - "token_acc": 0.7319790002282583 - }, - { - "epoch": 0.7559449311639549, - "grad_norm": 6.066429615020752, - "learning_rate": 4.416862899321404e-05, - "loss": 0.8453834056854248, - "step": 302, - "token_acc": 0.7548794844785922 - }, - { - "epoch": 0.7584480600750939, - "grad_norm": 1.178998589515686, - "learning_rate": 4.408961905514491e-05, - "loss": 0.8790225386619568, - "step": 303, - "token_acc": 0.7391522587841606 - }, - { - "epoch": 0.7609511889862328, - "grad_norm": 1.5657821893692017, - "learning_rate": 4.401014914000078e-05, - "loss": 0.7956516146659851, - "step": 304, - "token_acc": 0.765209244222361 - }, - { - "epoch": 0.7634543178973717, - "grad_norm": 2.5777835845947266, - "learning_rate": 4.393022116266212e-05, - "loss": 0.8482795357704163, - "step": 305, - "token_acc": 0.7480234343893977 - }, - { - "epoch": 0.7659574468085106, - "grad_norm": 4.338641166687012, - "learning_rate": 4.384983704904674e-05, - "loss": 0.7993297576904297, - "step": 306, - "token_acc": 0.7676097675510684 - }, - { - "epoch": 0.7684605757196495, - "grad_norm": 1.3926159143447876, - "learning_rate": 4.376899873606336e-05, - "loss": 0.8258683681488037, - "step": 307, - "token_acc": 0.7580105520525029 - }, - { - "epoch": 0.7709637046307884, - "grad_norm": 9.875060081481934, - "learning_rate": 4.3687708171564925e-05, - "loss": 0.7596441507339478, - "step": 308, - "token_acc": 0.7771428571428571 - }, - { - "epoch": 0.7734668335419274, - "grad_norm": 1.8181976079940796, - "learning_rate": 4.360596731430168e-05, - "loss": 0.8504893183708191, - "step": 309, - "token_acc": 0.7549649532710281 - }, - { - "epoch": 0.7759699624530664, - "grad_norm": 5.018813610076904, - "learning_rate": 4.352377813387398e-05, - "loss": 0.9177985191345215, - "step": 310, - "token_acc": 0.7289770944461876 - }, - { - "epoch": 0.7784730913642053, - "grad_norm": 2.401106595993042, - "learning_rate": 4.3441142610684824e-05, - "loss": 0.6803118586540222, - "step": 311, - "token_acc": 0.7968216827532417 - }, - { - "epoch": 0.7809762202753442, - "grad_norm": 3.502769947052002, - "learning_rate": 4.335806273589214e-05, - "loss": 0.7872037887573242, - "step": 312, - "token_acc": 0.766976635148863 - }, - { - "epoch": 0.7834793491864831, - "grad_norm": 1.664228916168213, - "learning_rate": 4.3274540511360793e-05, - "loss": 0.7319408655166626, - "step": 313, - "token_acc": 0.785088 - }, - { - "epoch": 0.785982478097622, - "grad_norm": 2.36742901802063, - "learning_rate": 4.319057794961437e-05, - "loss": 0.8201429843902588, - "step": 314, - "token_acc": 0.7595295142670442 - }, - { - "epoch": 0.7884856070087609, - "grad_norm": 2.8248369693756104, - "learning_rate": 4.310617707378668e-05, - "loss": 0.7904696464538574, - "step": 315, - "token_acc": 0.7644966656081296 - }, - { - "epoch": 0.7909887359198998, - "grad_norm": 2.83573317527771, - "learning_rate": 4.302133991757297e-05, - "loss": 0.8798209428787231, - "step": 316, - "token_acc": 0.7432513020315669 - }, - { - "epoch": 0.7934918648310388, - "grad_norm": 4.348333358764648, - "learning_rate": 4.2936068525181e-05, - "loss": 0.809928834438324, - "step": 317, - "token_acc": 0.7573623559539052 - }, - { - "epoch": 0.7959949937421777, - "grad_norm": 2.1033623218536377, - "learning_rate": 4.285036495128171e-05, - "loss": 0.7483210563659668, - "step": 318, - "token_acc": 0.7732790525536639 - }, - { - "epoch": 0.7984981226533167, - "grad_norm": 3.518192768096924, - "learning_rate": 4.276423126095974e-05, - "loss": 0.6489171385765076, - "step": 319, - "token_acc": 0.8053108482255222 - }, - { - "epoch": 0.8010012515644556, - "grad_norm": 1.2720087766647339, - "learning_rate": 4.267766952966369e-05, - "loss": 0.9405392408370972, - "step": 320, - "token_acc": 0.7279260780287474 - }, - { - "epoch": 0.8035043804755945, - "grad_norm": 16.282249450683594, - "learning_rate": 4.259068184315608e-05, - "loss": 0.9003595113754272, - "step": 321, - "token_acc": 0.7375758282781147 - }, - { - "epoch": 0.8060075093867334, - "grad_norm": 7.009720802307129, - "learning_rate": 4.250327029746309e-05, - "loss": 0.7392456531524658, - "step": 322, - "token_acc": 0.780937796251732 - }, - { - "epoch": 0.8085106382978723, - "grad_norm": 3.936666488647461, - "learning_rate": 4.24154369988241e-05, - "loss": 0.736973226070404, - "step": 323, - "token_acc": 0.7849452385372192 - }, - { - "epoch": 0.8110137672090113, - "grad_norm": 2.0168962478637695, - "learning_rate": 4.23271840636409e-05, - "loss": 0.9145832657814026, - "step": 324, - "token_acc": 0.7297918528923509 - }, - { - "epoch": 0.8135168961201502, - "grad_norm": 9.376174926757812, - "learning_rate": 4.223851361842668e-05, - "loss": 0.7650183439254761, - "step": 325, - "token_acc": 0.7717954668523246 - }, - { - "epoch": 0.8160200250312891, - "grad_norm": 1.8221909999847412, - "learning_rate": 4.214942779975482e-05, - "loss": 0.6287510395050049, - "step": 326, - "token_acc": 0.8086431962025317 - }, - { - "epoch": 0.818523153942428, - "grad_norm": 1.7132198810577393, - "learning_rate": 4.205992875420742e-05, - "loss": 0.9601121544837952, - "step": 327, - "token_acc": 0.7224585536516519 - }, - { - "epoch": 0.8210262828535669, - "grad_norm": 1.228062391281128, - "learning_rate": 4.197001863832355e-05, - "loss": 0.8077439069747925, - "step": 328, - "token_acc": 0.7587896974243561 - }, - { - "epoch": 0.8235294117647058, - "grad_norm": 1.1111897230148315, - "learning_rate": 4.187969961854726e-05, - "loss": 0.8680287599563599, - "step": 329, - "token_acc": 0.7438457841619053 - }, - { - "epoch": 0.8260325406758448, - "grad_norm": 2.42224383354187, - "learning_rate": 4.178897387117546e-05, - "loss": 0.7376724481582642, - "step": 330, - "token_acc": 0.7866793832459068 - }, - { - "epoch": 0.8285356695869838, - "grad_norm": 3.612968683242798, - "learning_rate": 4.169784358230541e-05, - "loss": 0.6727076768875122, - "step": 331, - "token_acc": 0.8009418583589929 - }, - { - "epoch": 0.8310387984981227, - "grad_norm": 4.89116907119751, - "learning_rate": 4.1606310947782044e-05, - "loss": 0.7970181703567505, - "step": 332, - "token_acc": 0.764037733427453 - }, - { - "epoch": 0.8335419274092616, - "grad_norm": 12.484292984008789, - "learning_rate": 4.151437817314513e-05, - "loss": 0.7304867506027222, - "step": 333, - "token_acc": 0.7838243886153076 - }, - { - "epoch": 0.8360450563204005, - "grad_norm": 1.9448401927947998, - "learning_rate": 4.142204747357604e-05, - "loss": 0.8944374918937683, - "step": 334, - "token_acc": 0.7394788423844114 - }, - { - "epoch": 0.8385481852315394, - "grad_norm": 1.2170294523239136, - "learning_rate": 4.1329321073844415e-05, - "loss": 0.8854318261146545, - "step": 335, - "token_acc": 0.7471004579789449 - }, - { - "epoch": 0.8410513141426783, - "grad_norm": 2.639364242553711, - "learning_rate": 4.123620120825459e-05, - "loss": 0.7527574300765991, - "step": 336, - "token_acc": 0.7784949622166247 - }, - { - "epoch": 0.8435544430538173, - "grad_norm": 2.7264010906219482, - "learning_rate": 4.114269012059169e-05, - "loss": 0.8323843479156494, - "step": 337, - "token_acc": 0.7546558704453441 - }, - { - "epoch": 0.8460575719649562, - "grad_norm": 2.749450922012329, - "learning_rate": 4.104879006406758e-05, - "loss": 0.8271874785423279, - "step": 338, - "token_acc": 0.7616862256605258 - }, - { - "epoch": 0.8485607008760951, - "grad_norm": 3.2195448875427246, - "learning_rate": 4.095450330126663e-05, - "loss": 0.6345349550247192, - "step": 339, - "token_acc": 0.8157239416577731 - }, - { - "epoch": 0.851063829787234, - "grad_norm": 2.691843032836914, - "learning_rate": 4.085983210409114e-05, - "loss": 0.7386264801025391, - "step": 340, - "token_acc": 0.7827135845603527 - }, - { - "epoch": 0.853566958698373, - "grad_norm": 1.2783466577529907, - "learning_rate": 4.07647787537066e-05, - "loss": 0.8243026733398438, - "step": 341, - "token_acc": 0.7568028970512157 - }, - { - "epoch": 0.8560700876095119, - "grad_norm": 4.061293601989746, - "learning_rate": 4.066934554048674e-05, - "loss": 0.6981653571128845, - "step": 342, - "token_acc": 0.7869034406215316 - }, - { - "epoch": 0.8585732165206508, - "grad_norm": 1.5013890266418457, - "learning_rate": 4.0573534763958355e-05, - "loss": 0.8307587504386902, - "step": 343, - "token_acc": 0.7530202301808564 - }, - { - "epoch": 0.8610763454317898, - "grad_norm": 1.6979941129684448, - "learning_rate": 4.047734873274586e-05, - "loss": 0.8721674084663391, - "step": 344, - "token_acc": 0.7437897299490555 - }, - { - "epoch": 0.8635794743429287, - "grad_norm": 1.435498595237732, - "learning_rate": 4.038078976451567e-05, - "loss": 0.853046715259552, - "step": 345, - "token_acc": 0.7511126133738945 - }, - { - "epoch": 0.8660826032540676, - "grad_norm": 1.627124309539795, - "learning_rate": 4.028386018592041e-05, - "loss": 0.75436931848526, - "step": 346, - "token_acc": 0.7807899207248018 - }, - { - "epoch": 0.8685857321652065, - "grad_norm": 1.9693089723587036, - "learning_rate": 4.018656233254278e-05, - "loss": 0.8141796588897705, - "step": 347, - "token_acc": 0.7617304492512479 - }, - { - "epoch": 0.8710888610763454, - "grad_norm": 1.6429239511489868, - "learning_rate": 4.008889854883929e-05, - "loss": 0.7092435956001282, - "step": 348, - "token_acc": 0.7868140171908945 - }, - { - "epoch": 0.8735919899874843, - "grad_norm": 7.14348030090332, - "learning_rate": 3.999087118808381e-05, - "loss": 0.8962076306343079, - "step": 349, - "token_acc": 0.7408736260607096 - }, - { - "epoch": 0.8760951188986232, - "grad_norm": 2.5628302097320557, - "learning_rate": 3.9892482612310836e-05, - "loss": 0.9180400967597961, - "step": 350, - "token_acc": 0.7306018168054504 - }, - { - "epoch": 0.8785982478097623, - "grad_norm": 1.3269526958465576, - "learning_rate": 3.979373519225858e-05, - "loss": 0.9172283411026001, - "step": 351, - "token_acc": 0.7335147904683649 - }, - { - "epoch": 0.8811013767209012, - "grad_norm": 1.101183533668518, - "learning_rate": 3.969463130731183e-05, - "loss": 0.8858950138092041, - "step": 352, - "token_acc": 0.7399414146635651 - }, - { - "epoch": 0.8836045056320401, - "grad_norm": 1.8363860845565796, - "learning_rate": 3.959517334544466e-05, - "loss": 0.8181067705154419, - "step": 353, - "token_acc": 0.7508903586873569 - }, - { - "epoch": 0.886107634543179, - "grad_norm": 2.2015419006347656, - "learning_rate": 3.949536370316285e-05, - "loss": 0.8596831560134888, - "step": 354, - "token_acc": 0.7492807233867653 - }, - { - "epoch": 0.8886107634543179, - "grad_norm": 1.0442819595336914, - "learning_rate": 3.939520478544614e-05, - "loss": 0.9282140731811523, - "step": 355, - "token_acc": 0.7278686978257793 - }, - { - "epoch": 0.8911138923654568, - "grad_norm": 1.5046483278274536, - "learning_rate": 3.9294699005690305e-05, - "loss": 0.8907036781311035, - "step": 356, - "token_acc": 0.7428094799815923 - }, - { - "epoch": 0.8936170212765957, - "grad_norm": 1.1432298421859741, - "learning_rate": 3.919384878564902e-05, - "loss": 0.8503479957580566, - "step": 357, - "token_acc": 0.7529302541487757 - }, - { - "epoch": 0.8961201501877347, - "grad_norm": 3.0036914348602295, - "learning_rate": 3.909265655537542e-05, - "loss": 0.7433081865310669, - "step": 358, - "token_acc": 0.7839231981659264 - }, - { - "epoch": 0.8986232790988736, - "grad_norm": 4.806852340698242, - "learning_rate": 3.899112475316366e-05, - "loss": 0.7551373243331909, - "step": 359, - "token_acc": 0.7743180125905368 - }, - { - "epoch": 0.9011264080100125, - "grad_norm": 1.2542036771774292, - "learning_rate": 3.888925582549006e-05, - "loss": 0.8357230424880981, - "step": 360, - "token_acc": 0.7519669661291223 - }, - { - "epoch": 0.9036295369211514, - "grad_norm": 1.6473242044448853, - "learning_rate": 3.8787052226954234e-05, - "loss": 0.8465045690536499, - "step": 361, - "token_acc": 0.7557243682991218 - }, - { - "epoch": 0.9061326658322904, - "grad_norm": 13.783917427062988, - "learning_rate": 3.868451642021992e-05, - "loss": 0.822354793548584, - "step": 362, - "token_acc": 0.7519634703196347 - }, - { - "epoch": 0.9086357947434293, - "grad_norm": 1.7439008951187134, - "learning_rate": 3.8581650875955585e-05, - "loss": 0.7651307582855225, - "step": 363, - "token_acc": 0.7751344989912575 - }, - { - "epoch": 0.9111389236545682, - "grad_norm": 1.6299248933792114, - "learning_rate": 3.847845807277502e-05, - "loss": 0.6929699182510376, - "step": 364, - "token_acc": 0.7872272907576359 - }, - { - "epoch": 0.9136420525657072, - "grad_norm": 2.1659955978393555, - "learning_rate": 3.8374940497177434e-05, - "loss": 0.735326886177063, - "step": 365, - "token_acc": 0.7798106242978655 - }, - { - "epoch": 0.9161451814768461, - "grad_norm": 2.080213785171509, - "learning_rate": 3.827110064348773e-05, - "loss": 0.8066057562828064, - "step": 366, - "token_acc": 0.757124183006536 - }, - { - "epoch": 0.918648310387985, - "grad_norm": 2.8970141410827637, - "learning_rate": 3.816694101379631e-05, - "loss": 0.8618408441543579, - "step": 367, - "token_acc": 0.7464049867308523 - }, - { - "epoch": 0.9211514392991239, - "grad_norm": 1.7472279071807861, - "learning_rate": 3.8062464117898724e-05, - "loss": 0.6792800426483154, - "step": 368, - "token_acc": 0.7940572856250557 - }, - { - "epoch": 0.9236545682102628, - "grad_norm": 5.283840656280518, - "learning_rate": 3.795767247323533e-05, - "loss": 0.9245332479476929, - "step": 369, - "token_acc": 0.7269049524317596 - }, - { - "epoch": 0.9261576971214017, - "grad_norm": 1.9213547706604004, - "learning_rate": 3.785256860483054e-05, - "loss": 0.7491408586502075, - "step": 370, - "token_acc": 0.7738063244647496 - }, - { - "epoch": 0.9286608260325406, - "grad_norm": 1.4675709009170532, - "learning_rate": 3.774715504523202e-05, - "loss": 0.8408378958702087, - "step": 371, - "token_acc": 0.7509755232351898 - }, - { - "epoch": 0.9311639549436797, - "grad_norm": 1.2374870777130127, - "learning_rate": 3.764143433444962e-05, - "loss": 0.9089862704277039, - "step": 372, - "token_acc": 0.7278328611898017 - }, - { - "epoch": 0.9336670838548186, - "grad_norm": 2.368098497390747, - "learning_rate": 3.753540901989423e-05, - "loss": 0.8130977153778076, - "step": 373, - "token_acc": 0.7584136918066288 - }, - { - "epoch": 0.9361702127659575, - "grad_norm": 4.070181846618652, - "learning_rate": 3.742908165631636e-05, - "loss": 0.8318907618522644, - "step": 374, - "token_acc": 0.7538795370857444 - }, - { - "epoch": 0.9386733416770964, - "grad_norm": 3.8024885654449463, - "learning_rate": 3.7322454805744605e-05, - "loss": 0.8522058725357056, - "step": 375, - "token_acc": 0.7481334654773704 - }, - { - "epoch": 0.9411764705882353, - "grad_norm": 8.243106842041016, - "learning_rate": 3.721553103742388e-05, - "loss": 0.7708778381347656, - "step": 376, - "token_acc": 0.7737909516380655 - }, - { - "epoch": 0.9436795994993742, - "grad_norm": 1.9439160823822021, - "learning_rate": 3.710831292775353e-05, - "loss": 0.7590352296829224, - "step": 377, - "token_acc": 0.7700546946216955 - }, - { - "epoch": 0.9461827284105131, - "grad_norm": 3.2804136276245117, - "learning_rate": 3.7000803060225284e-05, - "loss": 0.7222952842712402, - "step": 378, - "token_acc": 0.7838400666389005 - }, - { - "epoch": 0.9486858573216521, - "grad_norm": 1.783825159072876, - "learning_rate": 3.689300402536093e-05, - "loss": 0.820694088935852, - "step": 379, - "token_acc": 0.7568910159326346 - }, - { - "epoch": 0.951188986232791, - "grad_norm": 1.5094672441482544, - "learning_rate": 3.678491842064995e-05, - "loss": 0.8228154182434082, - "step": 380, - "token_acc": 0.7563206708169229 - }, - { - "epoch": 0.9536921151439299, - "grad_norm": 1.2823344469070435, - "learning_rate": 3.6676548850486915e-05, - "loss": 0.8268698453903198, - "step": 381, - "token_acc": 0.7545756682113935 - }, - { - "epoch": 0.9561952440550688, - "grad_norm": 2.020446538925171, - "learning_rate": 3.6567897926108756e-05, - "loss": 0.7393025159835815, - "step": 382, - "token_acc": 0.7798188874514878 - }, - { - "epoch": 0.9586983729662077, - "grad_norm": 1.6527626514434814, - "learning_rate": 3.645896826553178e-05, - "loss": 0.7484114766120911, - "step": 383, - "token_acc": 0.7755332780583403 - }, - { - "epoch": 0.9612015018773467, - "grad_norm": 1.587301254272461, - "learning_rate": 3.634976249348867e-05, - "loss": 0.6126949787139893, - "step": 384, - "token_acc": 0.8158403090792016 - }, - { - "epoch": 0.9637046307884856, - "grad_norm": 5.484954833984375, - "learning_rate": 3.624028324136517e-05, - "loss": 0.7998955249786377, - "step": 385, - "token_acc": 0.7629840381926026 - }, - { - "epoch": 0.9662077596996246, - "grad_norm": 1.513581395149231, - "learning_rate": 3.613053314713671e-05, - "loss": 0.7720030546188354, - "step": 386, - "token_acc": 0.767228370221328 - }, - { - "epoch": 0.9687108886107635, - "grad_norm": 3.6025302410125732, - "learning_rate": 3.602051485530486e-05, - "loss": 0.9072454571723938, - "step": 387, - "token_acc": 0.7304942652882785 - }, - { - "epoch": 0.9712140175219024, - "grad_norm": 1.7113579511642456, - "learning_rate": 3.591023101683355e-05, - "loss": 0.7592995166778564, - "step": 388, - "token_acc": 0.7736043397651583 - }, - { - "epoch": 0.9737171464330413, - "grad_norm": 1.5886659622192383, - "learning_rate": 3.57996842890853e-05, - "loss": 0.9248221516609192, - "step": 389, - "token_acc": 0.7291666666666666 - }, - { - "epoch": 0.9762202753441802, - "grad_norm": 1.904639482498169, - "learning_rate": 3.568887733575706e-05, - "loss": 0.6640578508377075, - "step": 390, - "token_acc": 0.8030723277149563 - }, - { - "epoch": 0.9787234042553191, - "grad_norm": 4.676436424255371, - "learning_rate": 3.55778128268161e-05, - "loss": 0.8066322803497314, - "step": 391, - "token_acc": 0.7604322527015794 - }, - { - "epoch": 0.981226533166458, - "grad_norm": 2.244272470474243, - "learning_rate": 3.54664934384357e-05, - "loss": 0.7747057676315308, - "step": 392, - "token_acc": 0.7657098525989139 - }, - { - "epoch": 0.983729662077597, - "grad_norm": 3.2416160106658936, - "learning_rate": 3.5354921852930594e-05, - "loss": 0.7859742045402527, - "step": 393, - "token_acc": 0.7659952983035772 - }, - { - "epoch": 0.986232790988736, - "grad_norm": 3.806647300720215, - "learning_rate": 3.5243100758692386e-05, - "loss": 0.7290835976600647, - "step": 394, - "token_acc": 0.7793145441892833 - }, - { - "epoch": 0.9887359198998749, - "grad_norm": 2.6771068572998047, - "learning_rate": 3.513103285012475e-05, - "loss": 0.8180262446403503, - "step": 395, - "token_acc": 0.7598081952920662 - }, - { - "epoch": 0.9912390488110138, - "grad_norm": 1.7483131885528564, - "learning_rate": 3.5018720827578524e-05, - "loss": 0.7300944328308105, - "step": 396, - "token_acc": 0.7814569536423841 - }, - { - "epoch": 0.9937421777221527, - "grad_norm": 1.995330572128296, - "learning_rate": 3.4906167397286646e-05, - "loss": 0.7564259767532349, - "step": 397, - "token_acc": 0.7783770729351152 - }, - { - "epoch": 0.9962453066332916, - "grad_norm": 2.2668654918670654, - "learning_rate": 3.47933752712989e-05, - "loss": 0.7041178941726685, - "step": 398, - "token_acc": 0.7913291605301914 - }, - { - "epoch": 0.9987484355444305, - "grad_norm": 1.306915283203125, - "learning_rate": 3.468034716741664e-05, - "loss": 0.8539732694625854, - "step": 399, - "token_acc": 0.7481962912169817 - }, - { - "epoch": 1.0, - "grad_norm": 1.7704166173934937, - "learning_rate": 3.456708580912725e-05, - "loss": 0.7418760061264038, - "step": 400, - "token_acc": 0.776519052523172 - }, - { - "epoch": 1.002503128911139, - "grad_norm": 43.9930305480957, - "learning_rate": 3.4453593925538515e-05, - "loss": 0.7428221702575684, - "step": 401, - "token_acc": 0.7772024037846823 - }, - { - "epoch": 1.0050062578222778, - "grad_norm": 1.5584815740585327, - "learning_rate": 3.433987425131291e-05, - "loss": 0.8528105616569519, - "step": 402, - "token_acc": 0.7449437659892841 - }, - { - "epoch": 1.0075093867334168, - "grad_norm": 7.336424350738525, - "learning_rate": 3.4225929526601664e-05, - "loss": 0.7428395748138428, - "step": 403, - "token_acc": 0.7766206412356658 - }, - { - "epoch": 1.0100125156445556, - "grad_norm": 1.4825217723846436, - "learning_rate": 3.411176249697875e-05, - "loss": 0.631352424621582, - "step": 404, - "token_acc": 0.8065062053403536 - }, - { - "epoch": 1.0125156445556946, - "grad_norm": 1.484767198562622, - "learning_rate": 3.399737591337471e-05, - "loss": 0.7537027597427368, - "step": 405, - "token_acc": 0.7765481064483112 - }, - { - "epoch": 1.0150187734668334, - "grad_norm": 2.6845622062683105, - "learning_rate": 3.388277253201041e-05, - "loss": 0.796688437461853, - "step": 406, - "token_acc": 0.7627060907480583 - }, - { - "epoch": 1.0175219023779725, - "grad_norm": 2.6031534671783447, - "learning_rate": 3.3767955114330586e-05, - "loss": 0.8054678440093994, - "step": 407, - "token_acc": 0.764444165935581 - }, - { - "epoch": 1.0200250312891115, - "grad_norm": 1.357327938079834, - "learning_rate": 3.365292642693732e-05, - "loss": 0.8387413024902344, - "step": 408, - "token_acc": 0.7472088911341248 - }, - { - "epoch": 1.0225281602002503, - "grad_norm": 2.586324453353882, - "learning_rate": 3.353768924152341e-05, - "loss": 0.6938782930374146, - "step": 409, - "token_acc": 0.7910919792673284 - }, - { - "epoch": 1.0250312891113893, - "grad_norm": 1.2863296270370483, - "learning_rate": 3.34222463348055e-05, - "loss": 0.9054546356201172, - "step": 410, - "token_acc": 0.7378970871815691 - }, - { - "epoch": 1.027534418022528, - "grad_norm": 1.5208131074905396, - "learning_rate": 3.330660048845727e-05, - "loss": 0.7409943342208862, - "step": 411, - "token_acc": 0.7748617945446814 - }, - { - "epoch": 1.0300375469336671, - "grad_norm": 1.7728694677352905, - "learning_rate": 3.319075448904234e-05, - "loss": 0.8802088499069214, - "step": 412, - "token_acc": 0.737257519830362 - }, - { - "epoch": 1.032540675844806, - "grad_norm": 2.1131184101104736, - "learning_rate": 3.307471112794715e-05, - "loss": 0.6349403262138367, - "step": 413, - "token_acc": 0.8154147750722245 - }, - { - "epoch": 1.035043804755945, - "grad_norm": 2.6038410663604736, - "learning_rate": 3.2958473201313744e-05, - "loss": 0.7536982893943787, - "step": 414, - "token_acc": 0.7783753361265712 - }, - { - "epoch": 1.037546933667084, - "grad_norm": 0.7469914555549622, - "learning_rate": 3.284204350997229e-05, - "loss": 0.8465015888214111, - "step": 415, - "token_acc": 0.7492382217360731 - }, - { - "epoch": 1.0400500625782227, - "grad_norm": 2.318094253540039, - "learning_rate": 3.272542485937369e-05, - "loss": 0.8175340294837952, - "step": 416, - "token_acc": 0.7576262710451742 - }, - { - "epoch": 1.0425531914893618, - "grad_norm": 2.7602827548980713, - "learning_rate": 3.260862005952193e-05, - "loss": 0.8715943098068237, - "step": 417, - "token_acc": 0.743643826245582 - }, - { - "epoch": 1.0450563204005006, - "grad_norm": 1.7321751117706299, - "learning_rate": 3.2491631924906416e-05, - "loss": 0.7801544070243835, - "step": 418, - "token_acc": 0.7639452626696045 - }, - { - "epoch": 1.0475594493116396, - "grad_norm": 30.08856201171875, - "learning_rate": 3.23744632744341e-05, - "loss": 0.6660053730010986, - "step": 419, - "token_acc": 0.7974683544303798 - }, - { - "epoch": 1.0500625782227784, - "grad_norm": 10.824769973754883, - "learning_rate": 3.225711693136156e-05, - "loss": 0.6206501722335815, - "step": 420, - "token_acc": 0.8082563824008691 - }, - { - "epoch": 1.0525657071339174, - "grad_norm": 6.584616661071777, - "learning_rate": 3.2139595723227054e-05, - "loss": 0.8174914121627808, - "step": 421, - "token_acc": 0.7598479154692958 - }, - { - "epoch": 1.0550688360450564, - "grad_norm": 1.7321393489837646, - "learning_rate": 3.202190248178231e-05, - "loss": 0.802627682685852, - "step": 422, - "token_acc": 0.7602137986115377 - }, - { - "epoch": 1.0575719649561952, - "grad_norm": 1.9569984674453735, - "learning_rate": 3.190404004292427e-05, - "loss": 0.6920569539070129, - "step": 423, - "token_acc": 0.7928679144859399 - }, - { - "epoch": 1.0600750938673342, - "grad_norm": 1.5589165687561035, - "learning_rate": 3.178601124662686e-05, - "loss": 0.8527140021324158, - "step": 424, - "token_acc": 0.7463035747707281 - }, - { - "epoch": 1.062578222778473, - "grad_norm": 4.186975002288818, - "learning_rate": 3.1667818936872465e-05, - "loss": 0.7492550015449524, - "step": 425, - "token_acc": 0.7705152671755725 - }, - { - "epoch": 1.065081351689612, - "grad_norm": 1.757791519165039, - "learning_rate": 3.154946596158344e-05, - "loss": 0.7724304795265198, - "step": 426, - "token_acc": 0.7690384787072583 - }, - { - "epoch": 1.0675844806007508, - "grad_norm": 3.0420734882354736, - "learning_rate": 3.14309551725535e-05, - "loss": 0.8095215559005737, - "step": 427, - "token_acc": 0.7658398397015131 - }, - { - "epoch": 1.0700876095118899, - "grad_norm": 1.704030156135559, - "learning_rate": 3.131228942537895e-05, - "loss": 0.6501023173332214, - "step": 428, - "token_acc": 0.8044284859365649 - }, - { - "epoch": 1.0725907384230289, - "grad_norm": 2.9102675914764404, - "learning_rate": 3.119347157938996e-05, - "loss": 0.7734176516532898, - "step": 429, - "token_acc": 0.7695846562560746 - }, - { - "epoch": 1.0750938673341677, - "grad_norm": 1.7218647003173828, - "learning_rate": 3.10745044975816e-05, - "loss": 0.7924395799636841, - "step": 430, - "token_acc": 0.769767294401116 - }, - { - "epoch": 1.0775969962453067, - "grad_norm": 3.255305051803589, - "learning_rate": 3.095539104654487e-05, - "loss": 0.8065544366836548, - "step": 431, - "token_acc": 0.76478578892372 - }, - { - "epoch": 1.0801001251564455, - "grad_norm": 1.2878748178482056, - "learning_rate": 3.083613409639764e-05, - "loss": 0.8923381567001343, - "step": 432, - "token_acc": 0.7387548536276777 - }, - { - "epoch": 1.0826032540675845, - "grad_norm": 1.4100399017333984, - "learning_rate": 3.071673652071549e-05, - "loss": 0.8253895044326782, - "step": 433, - "token_acc": 0.7540562052286781 - }, - { - "epoch": 1.0851063829787233, - "grad_norm": 1.6869633197784424, - "learning_rate": 3.0597201196462463e-05, - "loss": 0.6606812477111816, - "step": 434, - "token_acc": 0.7974853761850332 - }, - { - "epoch": 1.0876095118898623, - "grad_norm": 1.2705729007720947, - "learning_rate": 3.0477531003921745e-05, - "loss": 0.8390290141105652, - "step": 435, - "token_acc": 0.7539678436643747 - }, - { - "epoch": 1.0901126408010013, - "grad_norm": 4.0343170166015625, - "learning_rate": 3.035772882662627e-05, - "loss": 0.7374899387359619, - "step": 436, - "token_acc": 0.7784767467984722 - }, - { - "epoch": 1.0926157697121401, - "grad_norm": 31.51459503173828, - "learning_rate": 3.0237797551289228e-05, - "loss": 0.8265960812568665, - "step": 437, - "token_acc": 0.754416435093291 - }, - { - "epoch": 1.0951188986232792, - "grad_norm": 1.898342251777649, - "learning_rate": 3.0117740067734495e-05, - "loss": 0.8250342607498169, - "step": 438, - "token_acc": 0.7517792771975229 - }, - { - "epoch": 1.097622027534418, - "grad_norm": 1.7603737115859985, - "learning_rate": 2.9997559268827048e-05, - "loss": 0.6548107266426086, - "step": 439, - "token_acc": 0.802406330749354 - }, - { - "epoch": 1.100125156445557, - "grad_norm": 1.681059718132019, - "learning_rate": 2.9877258050403212e-05, - "loss": 0.49500739574432373, - "step": 440, - "token_acc": 0.8484848484848485 - }, - { - "epoch": 1.1026282853566958, - "grad_norm": 2.323869228363037, - "learning_rate": 2.97568393112009e-05, - "loss": 0.8611985445022583, - "step": 441, - "token_acc": 0.7459963793343546 - }, - { - "epoch": 1.1051314142678348, - "grad_norm": 3.4705965518951416, - "learning_rate": 2.963630595278977e-05, - "loss": 0.6335822343826294, - "step": 442, - "token_acc": 0.8075504658385093 - }, - { - "epoch": 1.1076345431789738, - "grad_norm": 1.9544960260391235, - "learning_rate": 2.9515660879501316e-05, - "loss": 0.7141144275665283, - "step": 443, - "token_acc": 0.7871103060348937 - }, - { - "epoch": 1.1101376720901126, - "grad_norm": 2.912339687347412, - "learning_rate": 2.9394906998358868e-05, - "loss": 0.8509359359741211, - "step": 444, - "token_acc": 0.7441022743325328 - }, - { - "epoch": 1.1126408010012516, - "grad_norm": 0.9381941556930542, - "learning_rate": 2.9274047219007534e-05, - "loss": 0.7909557819366455, - "step": 445, - "token_acc": 0.7587197373820271 - }, - { - "epoch": 1.1151439299123904, - "grad_norm": 1.41623055934906, - "learning_rate": 2.9153084453644135e-05, - "loss": 0.8439774513244629, - "step": 446, - "token_acc": 0.7494344152546285 - }, - { - "epoch": 1.1176470588235294, - "grad_norm": 1.3373831510543823, - "learning_rate": 2.9032021616947015e-05, - "loss": 0.7694572806358337, - "step": 447, - "token_acc": 0.7675036214389184 - }, - { - "epoch": 1.1201501877346682, - "grad_norm": 1.8616464138031006, - "learning_rate": 2.8910861626005776e-05, - "loss": 0.7465448975563049, - "step": 448, - "token_acc": 0.7760096282428457 - }, - { - "epoch": 1.1226533166458073, - "grad_norm": 2.0417370796203613, - "learning_rate": 2.878960740025103e-05, - "loss": 0.5976338386535645, - "step": 449, - "token_acc": 0.8209215731905981 - }, - { - "epoch": 1.1251564455569463, - "grad_norm": 1.513850450515747, - "learning_rate": 2.8668261861384045e-05, - "loss": 0.6721420288085938, - "step": 450, - "token_acc": 0.7959154424937298 - }, - { - "epoch": 1.127659574468085, - "grad_norm": 2.1121175289154053, - "learning_rate": 2.854682793330633e-05, - "loss": 0.6924934387207031, - "step": 451, - "token_acc": 0.7926174496644295 - }, - { - "epoch": 1.130162703379224, - "grad_norm": 1.8427212238311768, - "learning_rate": 2.8425308542049206e-05, - "loss": 0.6902682185173035, - "step": 452, - "token_acc": 0.7945113788487282 - }, - { - "epoch": 1.1326658322903629, - "grad_norm": 2.8109426498413086, - "learning_rate": 2.8303706615703253e-05, - "loss": 0.8199548721313477, - "step": 453, - "token_acc": 0.7543770616594773 - }, - { - "epoch": 1.135168961201502, - "grad_norm": 2.637247085571289, - "learning_rate": 2.8182025084347836e-05, - "loss": 0.9140053391456604, - "step": 454, - "token_acc": 0.7342447756291826 - }, - { - "epoch": 1.1376720901126407, - "grad_norm": 2.070204734802246, - "learning_rate": 2.8060266879980408e-05, - "loss": 0.6925473213195801, - "step": 455, - "token_acc": 0.7881796251623678 - }, - { - "epoch": 1.1401752190237797, - "grad_norm": 1.8393173217773438, - "learning_rate": 2.7938434936445945e-05, - "loss": 0.7441434860229492, - "step": 456, - "token_acc": 0.7766430457134917 - }, - { - "epoch": 1.1426783479349187, - "grad_norm": 4.779657363891602, - "learning_rate": 2.7816532189366197e-05, - "loss": 0.7810814380645752, - "step": 457, - "token_acc": 0.7622206393019322 - }, - { - "epoch": 1.1451814768460575, - "grad_norm": 1.8170710802078247, - "learning_rate": 2.7694561576068985e-05, - "loss": 0.7876262664794922, - "step": 458, - "token_acc": 0.7685871709407524 - }, - { - "epoch": 1.1476846057571966, - "grad_norm": 0.9989718794822693, - "learning_rate": 2.757252603551741e-05, - "loss": 0.8328777551651001, - "step": 459, - "token_acc": 0.7498996386993175 - }, - { - "epoch": 1.1501877346683353, - "grad_norm": 4.568758964538574, - "learning_rate": 2.7450428508239024e-05, - "loss": 0.8748979568481445, - "step": 460, - "token_acc": 0.7450868070855733 - }, - { - "epoch": 1.1526908635794744, - "grad_norm": 8.470266342163086, - "learning_rate": 2.7328271936254995e-05, - "loss": 0.8182597756385803, - "step": 461, - "token_acc": 0.7555555555555555 - }, - { - "epoch": 1.1551939924906134, - "grad_norm": 1.7657190561294556, - "learning_rate": 2.7206059263009244e-05, - "loss": 0.7683885097503662, - "step": 462, - "token_acc": 0.7742563247150404 - }, - { - "epoch": 1.1576971214017522, - "grad_norm": 5.895107746124268, - "learning_rate": 2.7083793433297438e-05, - "loss": 0.8530595302581787, - "step": 463, - "token_acc": 0.7451071400943761 - }, - { - "epoch": 1.1602002503128912, - "grad_norm": 1.7480491399765015, - "learning_rate": 2.6961477393196126e-05, - "loss": 0.7786663174629211, - "step": 464, - "token_acc": 0.7678157443806068 - }, - { - "epoch": 1.16270337922403, - "grad_norm": 2.044475793838501, - "learning_rate": 2.683911408999169e-05, - "loss": 0.7121521830558777, - "step": 465, - "token_acc": 0.7803991336633663 - }, - { - "epoch": 1.165206508135169, - "grad_norm": 5.003326416015625, - "learning_rate": 2.6716706472109342e-05, - "loss": 0.6376701593399048, - "step": 466, - "token_acc": 0.8067076051015588 - }, - { - "epoch": 1.1677096370463078, - "grad_norm": 12.686973571777344, - "learning_rate": 2.659425748904212e-05, - "loss": 0.5150684118270874, - "step": 467, - "token_acc": 0.8459984285553934 - }, - { - "epoch": 1.1702127659574468, - "grad_norm": 3.0933218002319336, - "learning_rate": 2.6471770091279724e-05, - "loss": 0.7467551827430725, - "step": 468, - "token_acc": 0.7779315435003229 - }, - { - "epoch": 1.1727158948685856, - "grad_norm": 5.490667819976807, - "learning_rate": 2.6349247230237552e-05, - "loss": 0.7138000130653381, - "step": 469, - "token_acc": 0.7884847818920998 - }, - { - "epoch": 1.1752190237797246, - "grad_norm": 1.2807576656341553, - "learning_rate": 2.6226691858185454e-05, - "loss": 0.8333462476730347, - "step": 470, - "token_acc": 0.749974967457695 - }, - { - "epoch": 1.1777221526908637, - "grad_norm": 10.077444076538086, - "learning_rate": 2.6104106928176687e-05, - "loss": 0.7134934067726135, - "step": 471, - "token_acc": 0.781946749404719 - }, - { - "epoch": 1.1802252816020025, - "grad_norm": 1.7063714265823364, - "learning_rate": 2.598149539397672e-05, - "loss": 0.8703588247299194, - "step": 472, - "token_acc": 0.7454706834438469 - }, - { - "epoch": 1.1827284105131415, - "grad_norm": 1.9840588569641113, - "learning_rate": 2.585886020999206e-05, - "loss": 0.7841652035713196, - "step": 473, - "token_acc": 0.7653958944281525 - }, - { - "epoch": 1.1852315394242803, - "grad_norm": 1.917015552520752, - "learning_rate": 2.5736204331199088e-05, - "loss": 0.8311939835548401, - "step": 474, - "token_acc": 0.7580409820465648 - }, - { - "epoch": 1.1877346683354193, - "grad_norm": 1.1762555837631226, - "learning_rate": 2.561353071307281e-05, - "loss": 0.8065941333770752, - "step": 475, - "token_acc": 0.7605049383437554 - }, - { - "epoch": 1.1902377972465583, - "grad_norm": 2.9361069202423096, - "learning_rate": 2.5490842311515707e-05, - "loss": 0.6642436385154724, - "step": 476, - "token_acc": 0.8024132730015083 - }, - { - "epoch": 1.1927409261576971, - "grad_norm": 4.613530158996582, - "learning_rate": 2.5368142082786466e-05, - "loss": 0.7668801546096802, - "step": 477, - "token_acc": 0.7748182105595953 - }, - { - "epoch": 1.1952440550688361, - "grad_norm": 1.097956657409668, - "learning_rate": 2.5245432983428747e-05, - "loss": 0.9035181999206543, - "step": 478, - "token_acc": 0.7342191332788226 - }, - { - "epoch": 1.197747183979975, - "grad_norm": 1.8363292217254639, - "learning_rate": 2.5122717970199956e-05, - "loss": 0.851319432258606, - "step": 479, - "token_acc": 0.7467151074780503 - }, - { - "epoch": 1.200250312891114, - "grad_norm": 1.2292267084121704, - "learning_rate": 2.5e-05, - "loss": 0.7173365354537964, - "step": 480, - "token_acc": 0.7852402654513473 - }, - { - "epoch": 1.2027534418022527, - "grad_norm": 1.13339102268219, - "learning_rate": 2.4877282029800053e-05, - "loss": 0.7570571899414062, - "step": 481, - "token_acc": 0.7718512153204027 - }, - { - "epoch": 1.2052565707133918, - "grad_norm": 2.553258180618286, - "learning_rate": 2.4754567016571263e-05, - "loss": 0.8463850021362305, - "step": 482, - "token_acc": 0.7462981243830207 - }, - { - "epoch": 1.2077596996245306, - "grad_norm": 1.9682620763778687, - "learning_rate": 2.4631857917213543e-05, - "loss": 0.7410565614700317, - "step": 483, - "token_acc": 0.7786700125470515 - }, - { - "epoch": 1.2102628285356696, - "grad_norm": 1.0788750648498535, - "learning_rate": 2.4509157688484295e-05, - "loss": 0.8274058103561401, - "step": 484, - "token_acc": 0.7513348996155489 - }, - { - "epoch": 1.2127659574468086, - "grad_norm": 1.1234153509140015, - "learning_rate": 2.4386469286927196e-05, - "loss": 0.8381744027137756, - "step": 485, - "token_acc": 0.7476648740447212 - }, - { - "epoch": 1.2152690863579474, - "grad_norm": 2.8939898014068604, - "learning_rate": 2.426379566880092e-05, - "loss": 0.8004180192947388, - "step": 486, - "token_acc": 0.7646108937333085 - }, - { - "epoch": 1.2177722152690864, - "grad_norm": 3.46976637840271, - "learning_rate": 2.414113979000794e-05, - "loss": 0.8478291034698486, - "step": 487, - "token_acc": 0.7513809354887752 - }, - { - "epoch": 1.2202753441802252, - "grad_norm": 2.4108669757843018, - "learning_rate": 2.4018504606023293e-05, - "loss": 0.7109798192977905, - "step": 488, - "token_acc": 0.7838756326825741 - }, - { - "epoch": 1.2227784730913642, - "grad_norm": 5.502831935882568, - "learning_rate": 2.389589307182332e-05, - "loss": 0.8232313394546509, - "step": 489, - "token_acc": 0.7541480718617691 - }, - { - "epoch": 1.2252816020025032, - "grad_norm": 5.164613246917725, - "learning_rate": 2.3773308141814552e-05, - "loss": 0.6895003914833069, - "step": 490, - "token_acc": 0.7904873671130747 - }, - { - "epoch": 1.227784730913642, - "grad_norm": 2.992577314376831, - "learning_rate": 2.365075276976245e-05, - "loss": 0.8953061699867249, - "step": 491, - "token_acc": 0.7334460411383489 - }, - { - "epoch": 1.230287859824781, - "grad_norm": 3.0780115127563477, - "learning_rate": 2.3528229908720272e-05, - "loss": 0.6675305962562561, - "step": 492, - "token_acc": 0.7988102636952854 - }, - { - "epoch": 1.2327909887359199, - "grad_norm": 2.8056156635284424, - "learning_rate": 2.3405742510957894e-05, - "loss": 0.7906989455223083, - "step": 493, - "token_acc": 0.7683424382822764 - }, - { - "epoch": 1.2352941176470589, - "grad_norm": 1.3469887971878052, - "learning_rate": 2.328329352789066e-05, - "loss": 0.7190076112747192, - "step": 494, - "token_acc": 0.7788229469645399 - }, - { - "epoch": 1.2377972465581977, - "grad_norm": 2.318279981613159, - "learning_rate": 2.3160885910008318e-05, - "loss": 0.8477081060409546, - "step": 495, - "token_acc": 0.7479976557921469 - }, - { - "epoch": 1.2403003754693367, - "grad_norm": 1.66133713722229, - "learning_rate": 2.303852260680388e-05, - "loss": 0.8301971554756165, - "step": 496, - "token_acc": 0.7531454639099404 - }, - { - "epoch": 1.2428035043804755, - "grad_norm": 1.978458285331726, - "learning_rate": 2.291620656670256e-05, - "loss": 0.6246353387832642, - "step": 497, - "token_acc": 0.8072678843226788 - }, - { - "epoch": 1.2453066332916145, - "grad_norm": 2.763749837875366, - "learning_rate": 2.279394073699077e-05, - "loss": 0.6929395198822021, - "step": 498, - "token_acc": 0.7917909276408727 - }, - { - "epoch": 1.2478097622027535, - "grad_norm": 1.4526376724243164, - "learning_rate": 2.267172806374501e-05, - "loss": 0.7163282632827759, - "step": 499, - "token_acc": 0.7838088024909534 - }, - { - "epoch": 1.2503128911138923, - "grad_norm": 3.438523530960083, - "learning_rate": 2.2549571491760986e-05, - "loss": 0.5449392795562744, - "step": 500, - "token_acc": 0.833210964268233 - }, - { - "epoch": 1.2528160200250313, - "grad_norm": 13.278526306152344, - "learning_rate": 2.2427473964482598e-05, - "loss": 0.6137301921844482, - "step": 501, - "token_acc": 0.8104321907600596 - }, - { - "epoch": 1.2553191489361701, - "grad_norm": 13.62430191040039, - "learning_rate": 2.2305438423931017e-05, - "loss": 0.8686969876289368, - "step": 502, - "token_acc": 0.7442144830397174 - }, - { - "epoch": 1.2578222778473092, - "grad_norm": 1.8806519508361816, - "learning_rate": 2.2183467810633812e-05, - "loss": 0.9271630048751831, - "step": 503, - "token_acc": 0.7262685005692483 - }, - { - "epoch": 1.2603254067584482, - "grad_norm": 2.0833258628845215, - "learning_rate": 2.2061565063554064e-05, - "loss": 0.6759613752365112, - "step": 504, - "token_acc": 0.7969396593205659 - }, - { - "epoch": 1.262828535669587, - "grad_norm": 6.389394760131836, - "learning_rate": 2.1939733120019598e-05, - "loss": 0.7384915351867676, - "step": 505, - "token_acc": 0.774990612091626 - }, - { - "epoch": 1.265331664580726, - "grad_norm": 3.0592896938323975, - "learning_rate": 2.1817974915652173e-05, - "loss": 0.6458410024642944, - "step": 506, - "token_acc": 0.802019687712152 - }, - { - "epoch": 1.2678347934918648, - "grad_norm": 1.639441728591919, - "learning_rate": 2.1696293384296746e-05, - "loss": 0.6861962080001831, - "step": 507, - "token_acc": 0.7907946370176586 - }, - { - "epoch": 1.2703379224030038, - "grad_norm": 2.1521527767181396, - "learning_rate": 2.1574691457950803e-05, - "loss": 0.7988197803497314, - "step": 508, - "token_acc": 0.7582929067785499 - }, - { - "epoch": 1.2728410513141426, - "grad_norm": 1.5150588750839233, - "learning_rate": 2.1453172066693673e-05, - "loss": 0.783989667892456, - "step": 509, - "token_acc": 0.7560105090963168 - }, - { - "epoch": 1.2753441802252816, - "grad_norm": 1.526321530342102, - "learning_rate": 2.1331738138615958e-05, - "loss": 0.8146979808807373, - "step": 510, - "token_acc": 0.7611608645882432 - }, - { - "epoch": 1.2778473091364204, - "grad_norm": 1.9988254308700562, - "learning_rate": 2.1210392599748974e-05, - "loss": 0.7470281720161438, - "step": 511, - "token_acc": 0.7786675208199871 - }, - { - "epoch": 1.2803504380475594, - "grad_norm": 3.260591745376587, - "learning_rate": 2.1089138373994223e-05, - "loss": 0.8237022161483765, - "step": 512, - "token_acc": 0.7528670036415023 - }, - { - "epoch": 1.2828535669586985, - "grad_norm": 1.7635042667388916, - "learning_rate": 2.0967978383052994e-05, - "loss": 0.7945007681846619, - "step": 513, - "token_acc": 0.7593285066433288 - }, - { - "epoch": 1.2853566958698373, - "grad_norm": 1.5511478185653687, - "learning_rate": 2.0846915546355868e-05, - "loss": 0.7554317712783813, - "step": 514, - "token_acc": 0.7748419009454637 - }, - { - "epoch": 1.2878598247809763, - "grad_norm": 4.115737438201904, - "learning_rate": 2.0725952780992468e-05, - "loss": 0.8068946003913879, - "step": 515, - "token_acc": 0.7541250542770299 - }, - { - "epoch": 1.290362953692115, - "grad_norm": 3.031116247177124, - "learning_rate": 2.0605093001641138e-05, - "loss": 0.7863394021987915, - "step": 516, - "token_acc": 0.7686510486650698 - }, - { - "epoch": 1.292866082603254, - "grad_norm": 1.5909842252731323, - "learning_rate": 2.048433912049868e-05, - "loss": 0.8729851245880127, - "step": 517, - "token_acc": 0.7407537527946343 - }, - { - "epoch": 1.295369211514393, - "grad_norm": 2.6750752925872803, - "learning_rate": 2.036369404721023e-05, - "loss": 0.7303407788276672, - "step": 518, - "token_acc": 0.7781297955546755 - }, - { - "epoch": 1.297872340425532, - "grad_norm": 0.9692606329917908, - "learning_rate": 2.0243160688799105e-05, - "loss": 0.8290165066719055, - "step": 519, - "token_acc": 0.7519956637429782 - }, - { - "epoch": 1.300375469336671, - "grad_norm": 2.2219390869140625, - "learning_rate": 2.0122741949596797e-05, - "loss": 0.8760692477226257, - "step": 520, - "token_acc": 0.7430098393147873 - }, - { - "epoch": 1.3028785982478097, - "grad_norm": 0.8866194486618042, - "learning_rate": 2.0002440731172958e-05, - "loss": 0.8369796276092529, - "step": 521, - "token_acc": 0.747876936829559 - }, - { - "epoch": 1.3053817271589487, - "grad_norm": 3.6789374351501465, - "learning_rate": 1.988225993226551e-05, - "loss": 0.7882047891616821, - "step": 522, - "token_acc": 0.767794798717492 - }, - { - "epoch": 1.3078848560700875, - "grad_norm": 2.0599172115325928, - "learning_rate": 1.976220244871079e-05, - "loss": 0.7839165925979614, - "step": 523, - "token_acc": 0.767715969527095 - }, - { - "epoch": 1.3103879849812266, - "grad_norm": 1.2310124635696411, - "learning_rate": 1.9642271173373737e-05, - "loss": 0.830912172794342, - "step": 524, - "token_acc": 0.7497665274023102 - }, - { - "epoch": 1.3128911138923653, - "grad_norm": 1.4539384841918945, - "learning_rate": 1.9522468996078258e-05, - "loss": 0.7132511138916016, - "step": 525, - "token_acc": 0.7868950749464668 - }, - { - "epoch": 1.3153942428035044, - "grad_norm": 5.704746723175049, - "learning_rate": 1.940279880353754e-05, - "loss": 0.8210383653640747, - "step": 526, - "token_acc": 0.7561708521141876 - }, - { - "epoch": 1.3178973717146434, - "grad_norm": 2.1198251247406006, - "learning_rate": 1.9283263479284514e-05, - "loss": 0.8160667419433594, - "step": 527, - "token_acc": 0.7549833887043189 - }, - { - "epoch": 1.3204005006257822, - "grad_norm": 1.768844723701477, - "learning_rate": 1.9163865903602374e-05, - "loss": 0.7602739930152893, - "step": 528, - "token_acc": 0.7743359280956584 - }, - { - "epoch": 1.3229036295369212, - "grad_norm": 3.8136727809906006, - "learning_rate": 1.9044608953455138e-05, - "loss": 0.7949267625808716, - "step": 529, - "token_acc": 0.7604166666666666 - }, - { - "epoch": 1.32540675844806, - "grad_norm": 1.3969098329544067, - "learning_rate": 1.8925495502418406e-05, - "loss": 0.8395500779151917, - "step": 530, - "token_acc": 0.7547573013127099 - }, - { - "epoch": 1.327909887359199, - "grad_norm": 2.3602702617645264, - "learning_rate": 1.880652842061004e-05, - "loss": 0.6325199604034424, - "step": 531, - "token_acc": 0.8049121258916097 - }, - { - "epoch": 1.330413016270338, - "grad_norm": 6.827362537384033, - "learning_rate": 1.868771057462105e-05, - "loss": 0.8032347559928894, - "step": 532, - "token_acc": 0.7577628688475925 - }, - { - "epoch": 1.3329161451814768, - "grad_norm": 2.2116971015930176, - "learning_rate": 1.8569044827446515e-05, - "loss": 0.7727822065353394, - "step": 533, - "token_acc": 0.770619378707661 - }, - { - "epoch": 1.3354192740926158, - "grad_norm": 1.6953080892562866, - "learning_rate": 1.8450534038416568e-05, - "loss": 0.8702293634414673, - "step": 534, - "token_acc": 0.7410009728677981 - }, - { - "epoch": 1.3379224030037546, - "grad_norm": 9.758813858032227, - "learning_rate": 1.8332181063127545e-05, - "loss": 0.7461093664169312, - "step": 535, - "token_acc": 0.7749614899873967 - }, - { - "epoch": 1.3404255319148937, - "grad_norm": 1.1418122053146362, - "learning_rate": 1.8213988753373146e-05, - "loss": 0.8273798227310181, - "step": 536, - "token_acc": 0.7499042512447338 - }, - { - "epoch": 1.3429286608260325, - "grad_norm": 1.871590256690979, - "learning_rate": 1.809595995707573e-05, - "loss": 0.8071326017379761, - "step": 537, - "token_acc": 0.7567946505608283 - }, - { - "epoch": 1.3454317897371715, - "grad_norm": 1.5790642499923706, - "learning_rate": 1.7978097518217703e-05, - "loss": 0.7012978196144104, - "step": 538, - "token_acc": 0.7855657398136024 - }, - { - "epoch": 1.3479349186483103, - "grad_norm": 2.052522659301758, - "learning_rate": 1.7860404276772945e-05, - "loss": 0.6337273120880127, - "step": 539, - "token_acc": 0.8069234097793163 - }, - { - "epoch": 1.3504380475594493, - "grad_norm": 1.3587812185287476, - "learning_rate": 1.7742883068638447e-05, - "loss": 0.8248769640922546, - "step": 540, - "token_acc": 0.7510279202725457 - }, - { - "epoch": 1.3529411764705883, - "grad_norm": 1.5436736345291138, - "learning_rate": 1.762553672556591e-05, - "loss": 0.8075623512268066, - "step": 541, - "token_acc": 0.7595460992907801 - }, - { - "epoch": 1.355444305381727, - "grad_norm": 2.2767934799194336, - "learning_rate": 1.7508368075093583e-05, - "loss": 0.7209601402282715, - "step": 542, - "token_acc": 0.7783203125 - }, - { - "epoch": 1.3579474342928661, - "grad_norm": 2.0432751178741455, - "learning_rate": 1.7391379940478076e-05, - "loss": 0.6441476345062256, - "step": 543, - "token_acc": 0.8064547869723507 - }, - { - "epoch": 1.360450563204005, - "grad_norm": 1.801803708076477, - "learning_rate": 1.7274575140626318e-05, - "loss": 0.7840845584869385, - "step": 544, - "token_acc": 0.7625759010640075 - }, - { - "epoch": 1.362953692115144, - "grad_norm": 2.2576844692230225, - "learning_rate": 1.7157956490027717e-05, - "loss": 0.754980742931366, - "step": 545, - "token_acc": 0.772340190223402 - }, - { - "epoch": 1.365456821026283, - "grad_norm": 7.710822105407715, - "learning_rate": 1.704152679868626e-05, - "loss": 0.6724915504455566, - "step": 546, - "token_acc": 0.7948899371069182 - }, - { - "epoch": 1.3679599499374218, - "grad_norm": 1.566840410232544, - "learning_rate": 1.6925288872052843e-05, - "loss": 0.805724024772644, - "step": 547, - "token_acc": 0.7583758937691522 - }, - { - "epoch": 1.3704630788485608, - "grad_norm": 2.7354047298431396, - "learning_rate": 1.6809245510957665e-05, - "loss": 0.8180174231529236, - "step": 548, - "token_acc": 0.7519490397413957 - }, - { - "epoch": 1.3729662077596996, - "grad_norm": 1.5053433179855347, - "learning_rate": 1.6693399511542735e-05, - "loss": 0.7254161834716797, - "step": 549, - "token_acc": 0.7824625502374863 - }, - { - "epoch": 1.3754693366708386, - "grad_norm": 1.9936115741729736, - "learning_rate": 1.65777536651945e-05, - "loss": 0.719433605670929, - "step": 550, - "token_acc": 0.7820769560863968 - }, - { - "epoch": 1.3779724655819774, - "grad_norm": 1.4493017196655273, - "learning_rate": 1.6462310758476595e-05, - "loss": 0.803730845451355, - "step": 551, - "token_acc": 0.7597644749754662 - }, - { - "epoch": 1.3804755944931164, - "grad_norm": 1.2181215286254883, - "learning_rate": 1.6347073573062672e-05, - "loss": 0.81937575340271, - "step": 552, - "token_acc": 0.7521792745673342 - }, - { - "epoch": 1.3829787234042552, - "grad_norm": 4.488533020019531, - "learning_rate": 1.6232044885669427e-05, - "loss": 0.7404607534408569, - "step": 553, - "token_acc": 0.7772408629959845 - }, - { - "epoch": 1.3854818523153942, - "grad_norm": 2.061286449432373, - "learning_rate": 1.6117227467989602e-05, - "loss": 0.6969904899597168, - "step": 554, - "token_acc": 0.7908102472445636 - }, - { - "epoch": 1.3879849812265332, - "grad_norm": 5.560731410980225, - "learning_rate": 1.6002624086625294e-05, - "loss": 0.8753557801246643, - "step": 555, - "token_acc": 0.7392388505089319 - }, - { - "epoch": 1.390488110137672, - "grad_norm": 2.4644906520843506, - "learning_rate": 1.588823750302126e-05, - "loss": 0.6984307169914246, - "step": 556, - "token_acc": 0.783540746688077 - }, - { - "epoch": 1.392991239048811, - "grad_norm": 6.086837291717529, - "learning_rate": 1.577407047339834e-05, - "loss": 0.7918856739997864, - "step": 557, - "token_acc": 0.7626044755998922 - }, - { - "epoch": 1.3954943679599499, - "grad_norm": 40.485443115234375, - "learning_rate": 1.5660125748687094e-05, - "loss": 0.6759528517723083, - "step": 558, - "token_acc": 0.7896958731799776 - }, - { - "epoch": 1.3979974968710889, - "grad_norm": 4.204066753387451, - "learning_rate": 1.5546406074461488e-05, - "loss": 0.8734142184257507, - "step": 559, - "token_acc": 0.7402841280209014 - }, - { - "epoch": 1.400500625782228, - "grad_norm": 1.534205436706543, - "learning_rate": 1.5432914190872757e-05, - "loss": 0.8061844110488892, - "step": 560, - "token_acc": 0.7598022502557109 - }, - { - "epoch": 1.4030037546933667, - "grad_norm": 2.5760042667388916, - "learning_rate": 1.5319652832583362e-05, - "loss": 0.7462766170501709, - "step": 561, - "token_acc": 0.7805115166018546 - }, - { - "epoch": 1.4055068836045057, - "grad_norm": 1.2807033061981201, - "learning_rate": 1.5206624728701103e-05, - "loss": 0.7794641256332397, - "step": 562, - "token_acc": 0.7705968754172787 - }, - { - "epoch": 1.4080100125156445, - "grad_norm": 1.3814904689788818, - "learning_rate": 1.5093832602713365e-05, - "loss": 0.8049334287643433, - "step": 563, - "token_acc": 0.7605047164032831 - }, - { - "epoch": 1.4105131414267835, - "grad_norm": 1.4789693355560303, - "learning_rate": 1.498127917242148e-05, - "loss": 0.6792148351669312, - "step": 564, - "token_acc": 0.7961648382041118 - }, - { - "epoch": 1.4130162703379223, - "grad_norm": 1.7311301231384277, - "learning_rate": 1.4868967149875257e-05, - "loss": 0.7710389494895935, - "step": 565, - "token_acc": 0.7728716399411264 - }, - { - "epoch": 1.4155193992490613, - "grad_norm": 1.134136438369751, - "learning_rate": 1.4756899241307615e-05, - "loss": 0.7549833059310913, - "step": 566, - "token_acc": 0.7709425608761505 - }, - { - "epoch": 1.4180225281602001, - "grad_norm": 2.795325994491577, - "learning_rate": 1.4645078147069402e-05, - "loss": 0.7068973183631897, - "step": 567, - "token_acc": 0.7866447278211984 - }, - { - "epoch": 1.4205256570713392, - "grad_norm": 2.4004311561584473, - "learning_rate": 1.4533506561564306e-05, - "loss": 0.7402547001838684, - "step": 568, - "token_acc": 0.7732777333485662 - }, - { - "epoch": 1.4230287859824782, - "grad_norm": 1.9645004272460938, - "learning_rate": 1.4422187173183899e-05, - "loss": 0.746313214302063, - "step": 569, - "token_acc": 0.7786008859019398 - }, - { - "epoch": 1.425531914893617, - "grad_norm": 7.375904560089111, - "learning_rate": 1.4311122664242954e-05, - "loss": 0.7958496809005737, - "step": 570, - "token_acc": 0.7603988464734347 - }, - { - "epoch": 1.428035043804756, - "grad_norm": 1.696038007736206, - "learning_rate": 1.4200315710914705e-05, - "loss": 0.7623685002326965, - "step": 571, - "token_acc": 0.7718207718207718 - }, - { - "epoch": 1.4305381727158948, - "grad_norm": 1.9560589790344238, - "learning_rate": 1.4089768983166444e-05, - "loss": 0.7280702590942383, - "step": 572, - "token_acc": 0.7799722429806768 - }, - { - "epoch": 1.4330413016270338, - "grad_norm": 2.5953147411346436, - "learning_rate": 1.3979485144695158e-05, - "loss": 0.654486894607544, - "step": 573, - "token_acc": 0.8006254290290595 - }, - { - "epoch": 1.4355444305381728, - "grad_norm": 1.1697745323181152, - "learning_rate": 1.38694668528633e-05, - "loss": 0.7936983108520508, - "step": 574, - "token_acc": 0.7653046280023433 - }, - { - "epoch": 1.4380475594493116, - "grad_norm": 2.1148157119750977, - "learning_rate": 1.3759716758634832e-05, - "loss": 0.8053967952728271, - "step": 575, - "token_acc": 0.7594241535590509 - }, - { - "epoch": 1.4405506883604506, - "grad_norm": 2.3193156719207764, - "learning_rate": 1.3650237506511331e-05, - "loss": 0.8046903610229492, - "step": 576, - "token_acc": 0.7616776718023966 - }, - { - "epoch": 1.4430538172715894, - "grad_norm": 4.965387344360352, - "learning_rate": 1.3541031734468212e-05, - "loss": 0.809991180896759, - "step": 577, - "token_acc": 0.7585025046137622 - }, - { - "epoch": 1.4455569461827285, - "grad_norm": 2.777501106262207, - "learning_rate": 1.3432102073891251e-05, - "loss": 0.6487606763839722, - "step": 578, - "token_acc": 0.8072299215227918 - }, - { - "epoch": 1.4480600750938675, - "grad_norm": 1.8217853307724, - "learning_rate": 1.3323451149513092e-05, - "loss": 0.6385177969932556, - "step": 579, - "token_acc": 0.8078879086663207 - }, - { - "epoch": 1.4505632040050063, - "grad_norm": 1.6126281023025513, - "learning_rate": 1.3215081579350058e-05, - "loss": 0.7538764476776123, - "step": 580, - "token_acc": 0.7765273311897106 - }, - { - "epoch": 1.453066332916145, - "grad_norm": 1.229370355606079, - "learning_rate": 1.3106995974639084e-05, - "loss": 0.7376300096511841, - "step": 581, - "token_acc": 0.7732833811391442 - }, - { - "epoch": 1.455569461827284, - "grad_norm": 1.6918634176254272, - "learning_rate": 1.2999196939774722e-05, - "loss": 0.9147740602493286, - "step": 582, - "token_acc": 0.7359253623768719 - }, - { - "epoch": 1.458072590738423, - "grad_norm": 6.232097625732422, - "learning_rate": 1.2891687072246472e-05, - "loss": 0.6440097093582153, - "step": 583, - "token_acc": 0.8036370671309732 - }, - { - "epoch": 1.460575719649562, - "grad_norm": 1.3691867589950562, - "learning_rate": 1.2784468962576136e-05, - "loss": 0.8547953963279724, - "step": 584, - "token_acc": 0.7434093093505424 - }, - { - "epoch": 1.463078848560701, - "grad_norm": 5.270246982574463, - "learning_rate": 1.2677545194255402e-05, - "loss": 0.7240179181098938, - "step": 585, - "token_acc": 0.7812846429735898 - }, - { - "epoch": 1.4655819774718397, - "grad_norm": 4.639716148376465, - "learning_rate": 1.2570918343683635e-05, - "loss": 0.7307671308517456, - "step": 586, - "token_acc": 0.7740117025831311 - }, - { - "epoch": 1.4680851063829787, - "grad_norm": 4.015777111053467, - "learning_rate": 1.2464590980105776e-05, - "loss": 0.8232721090316772, - "step": 587, - "token_acc": 0.7514532679573371 - }, - { - "epoch": 1.4705882352941178, - "grad_norm": 3.1545369625091553, - "learning_rate": 1.235856566555039e-05, - "loss": 0.6684552431106567, - "step": 588, - "token_acc": 0.7926829268292683 - }, - { - "epoch": 1.4730913642052565, - "grad_norm": 1.4123514890670776, - "learning_rate": 1.2252844954767984e-05, - "loss": 0.7221212983131409, - "step": 589, - "token_acc": 0.7806400809944316 - }, - { - "epoch": 1.4755944931163956, - "grad_norm": 2.0935285091400146, - "learning_rate": 1.2147431395169459e-05, - "loss": 0.6654121279716492, - "step": 590, - "token_acc": 0.7983262828765864 - }, - { - "epoch": 1.4780976220275344, - "grad_norm": 2.06630277633667, - "learning_rate": 1.2042327526764669e-05, - "loss": 0.7412019371986389, - "step": 591, - "token_acc": 0.7778124220503866 - }, - { - "epoch": 1.4806007509386734, - "grad_norm": 6.0032639503479, - "learning_rate": 1.1937535882101281e-05, - "loss": 0.6372846364974976, - "step": 592, - "token_acc": 0.803729146221786 - }, - { - "epoch": 1.4831038798498124, - "grad_norm": 4.389716148376465, - "learning_rate": 1.1833058986203705e-05, - "loss": 0.682616114616394, - "step": 593, - "token_acc": 0.7952238805970149 - }, - { - "epoch": 1.4856070087609512, - "grad_norm": 1.7360910177230835, - "learning_rate": 1.1728899356512265e-05, - "loss": 0.8019569516181946, - "step": 594, - "token_acc": 0.7640247879973907 - }, - { - "epoch": 1.48811013767209, - "grad_norm": 1.4876583814620972, - "learning_rate": 1.1625059502822574e-05, - "loss": 0.7209570407867432, - "step": 595, - "token_acc": 0.7803595962009438 - }, - { - "epoch": 1.490613266583229, - "grad_norm": 3.0514919757843018, - "learning_rate": 1.1521541927224994e-05, - "loss": 0.663855791091919, - "step": 596, - "token_acc": 0.801151700557855 - }, - { - "epoch": 1.493116395494368, - "grad_norm": 3.3372299671173096, - "learning_rate": 1.1418349124044405e-05, - "loss": 0.7273604273796082, - "step": 597, - "token_acc": 0.778789224393132 - }, - { - "epoch": 1.4956195244055068, - "grad_norm": 2.397977590560913, - "learning_rate": 1.1315483579780095e-05, - "loss": 0.884240984916687, - "step": 598, - "token_acc": 0.7410475340894609 - }, - { - "epoch": 1.4981226533166458, - "grad_norm": 2.4129981994628906, - "learning_rate": 1.1212947773045767e-05, - "loss": 0.6984825134277344, - "step": 599, - "token_acc": 0.786497277676951 - }, - { - "epoch": 1.5006257822277846, - "grad_norm": 0.9863743782043457, - "learning_rate": 1.1110744174509952e-05, - "loss": 0.7607206702232361, - "step": 600, - "token_acc": 0.7653004497902663 - }, - { - "epoch": 1.5031289111389237, - "grad_norm": 2.9565539360046387, - "learning_rate": 1.100887524683635e-05, - "loss": 0.7446565628051758, - "step": 601, - "token_acc": 0.773600569259962 - }, - { - "epoch": 1.5056320400500627, - "grad_norm": 1.515296220779419, - "learning_rate": 1.090734344462458e-05, - "loss": 0.888853132724762, - "step": 602, - "token_acc": 0.739697280885833 - }, - { - "epoch": 1.5081351689612015, - "grad_norm": 3.071218729019165, - "learning_rate": 1.0806151214350995e-05, - "loss": 0.7655630707740784, - "step": 603, - "token_acc": 0.7740929705215419 - }, - { - "epoch": 1.5106382978723403, - "grad_norm": 1.503035068511963, - "learning_rate": 1.0705300994309697e-05, - "loss": 0.747133731842041, - "step": 604, - "token_acc": 0.7726721139066418 - }, - { - "epoch": 1.5131414267834793, - "grad_norm": 1.4292892217636108, - "learning_rate": 1.0604795214553868e-05, - "loss": 0.6887509822845459, - "step": 605, - "token_acc": 0.7898035618741879 - }, - { - "epoch": 1.5156445556946183, - "grad_norm": 4.256486415863037, - "learning_rate": 1.0504636296837161e-05, - "loss": 0.8068586587905884, - "step": 606, - "token_acc": 0.7587569703860105 - }, - { - "epoch": 1.5181476846057573, - "grad_norm": 1.5744963884353638, - "learning_rate": 1.0404826654555342e-05, - "loss": 0.833703875541687, - "step": 607, - "token_acc": 0.7490119618485536 - }, - { - "epoch": 1.5206508135168961, - "grad_norm": 1.4943774938583374, - "learning_rate": 1.0305368692688174e-05, - "loss": 0.7888246178627014, - "step": 608, - "token_acc": 0.7641653905053599 - }, - { - "epoch": 1.523153942428035, - "grad_norm": 4.295377254486084, - "learning_rate": 1.0206264807741434e-05, - "loss": 0.7990449666976929, - "step": 609, - "token_acc": 0.7550613592474926 - }, - { - "epoch": 1.525657071339174, - "grad_norm": 1.5696173906326294, - "learning_rate": 1.0107517387689166e-05, - "loss": 0.6105284690856934, - "step": 610, - "token_acc": 0.8193157519600855 - }, - { - "epoch": 1.528160200250313, - "grad_norm": 1.4100733995437622, - "learning_rate": 1.0009128811916197e-05, - "loss": 0.6308101415634155, - "step": 611, - "token_acc": 0.8020977090808722 - }, - { - "epoch": 1.530663329161452, - "grad_norm": 1.636954426765442, - "learning_rate": 9.911101451160715e-06, - "loss": 0.7580888867378235, - "step": 612, - "token_acc": 0.7740969378399853 - }, - { - "epoch": 1.5331664580725908, - "grad_norm": 3.3348324298858643, - "learning_rate": 9.813437667457229e-06, - "loss": 0.6496917605400085, - "step": 613, - "token_acc": 0.8047304730473047 - }, - { - "epoch": 1.5356695869837296, - "grad_norm": 1.2093946933746338, - "learning_rate": 9.716139814079595e-06, - "loss": 0.8330615758895874, - "step": 614, - "token_acc": 0.7514138654127216 - }, - { - "epoch": 1.5381727158948686, - "grad_norm": 2.5762991905212402, - "learning_rate": 9.619210235484333e-06, - "loss": 0.7363358736038208, - "step": 615, - "token_acc": 0.7768673179955877 - }, - { - "epoch": 1.5406758448060076, - "grad_norm": 3.4001667499542236, - "learning_rate": 9.522651267254149e-06, - "loss": 0.7240384221076965, - "step": 616, - "token_acc": 0.7739171822941456 - }, - { - "epoch": 1.5431789737171464, - "grad_norm": 82.21798706054688, - "learning_rate": 9.426465236041651e-06, - "loss": 0.6950215697288513, - "step": 617, - "token_acc": 0.7900774304559793 - }, - { - "epoch": 1.5456821026282852, - "grad_norm": 1.1821529865264893, - "learning_rate": 9.330654459513266e-06, - "loss": 0.7954156398773193, - "step": 618, - "token_acc": 0.7626409334843188 - }, - { - "epoch": 1.5481852315394242, - "grad_norm": 2.2667031288146973, - "learning_rate": 9.235221246293405e-06, - "loss": 0.8089542388916016, - "step": 619, - "token_acc": 0.7574625144175318 - }, - { - "epoch": 1.5506883604505632, - "grad_norm": 1.9918934106826782, - "learning_rate": 9.140167895908867e-06, - "loss": 0.7781422138214111, - "step": 620, - "token_acc": 0.7674040568238037 - }, - { - "epoch": 1.5531914893617023, - "grad_norm": 3.942108631134033, - "learning_rate": 9.04549669873337e-06, - "loss": 0.8120257258415222, - "step": 621, - "token_acc": 0.7560487380330723 - }, - { - "epoch": 1.555694618272841, - "grad_norm": 1.7937588691711426, - "learning_rate": 8.951209935932426e-06, - "loss": 0.607784628868103, - "step": 622, - "token_acc": 0.8156992932105376 - }, - { - "epoch": 1.5581977471839799, - "grad_norm": 2.8172223567962646, - "learning_rate": 8.857309879408324e-06, - "loss": 0.6648784875869751, - "step": 623, - "token_acc": 0.80419430772523 - }, - { - "epoch": 1.5607008760951189, - "grad_norm": 3.8440911769866943, - "learning_rate": 8.763798791745411e-06, - "loss": 0.8074014186859131, - "step": 624, - "token_acc": 0.7604686482968106 - }, - { - "epoch": 1.563204005006258, - "grad_norm": 1.895396113395691, - "learning_rate": 8.670678926155587e-06, - "loss": 0.8305899500846863, - "step": 625, - "token_acc": 0.7504222361627177 - }, - { - "epoch": 1.565707133917397, - "grad_norm": 4.063203811645508, - "learning_rate": 8.577952526423969e-06, - "loss": 0.7936282157897949, - "step": 626, - "token_acc": 0.7642972633091802 - }, - { - "epoch": 1.5682102628285357, - "grad_norm": 2.0519766807556152, - "learning_rate": 8.48562182685487e-06, - "loss": 0.6997530460357666, - "step": 627, - "token_acc": 0.7890964093121137 - }, - { - "epoch": 1.5707133917396745, - "grad_norm": 1.731513500213623, - "learning_rate": 8.393689052217966e-06, - "loss": 0.6370196342468262, - "step": 628, - "token_acc": 0.8046017082098658 - }, - { - "epoch": 1.5732165206508135, - "grad_norm": 4.366064548492432, - "learning_rate": 8.3021564176946e-06, - "loss": 0.665263295173645, - "step": 629, - "token_acc": 0.7946243969676086 - }, - { - "epoch": 1.5757196495619525, - "grad_norm": 4.512490272521973, - "learning_rate": 8.211026128824539e-06, - "loss": 0.799260139465332, - "step": 630, - "token_acc": 0.7595476024479045 - }, - { - "epoch": 1.5782227784730913, - "grad_norm": 1.7154865264892578, - "learning_rate": 8.120300381452742e-06, - "loss": 0.8500877618789673, - "step": 631, - "token_acc": 0.7461655662772981 - }, - { - "epoch": 1.5807259073842301, - "grad_norm": 6.622365951538086, - "learning_rate": 8.029981361676456e-06, - "loss": 0.6213138103485107, - "step": 632, - "token_acc": 0.818997756170531 - }, - { - "epoch": 1.5832290362953692, - "grad_norm": 2.634678363800049, - "learning_rate": 7.940071245792579e-06, - "loss": 0.5984349250793457, - "step": 633, - "token_acc": 0.8174148526195189 - }, - { - "epoch": 1.5857321652065082, - "grad_norm": 3.43933367729187, - "learning_rate": 7.850572200245184e-06, - "loss": 0.6845875978469849, - "step": 634, - "token_acc": 0.7913089653951677 - }, - { - "epoch": 1.5882352941176472, - "grad_norm": 1.6064105033874512, - "learning_rate": 7.761486381573327e-06, - "loss": 0.688270092010498, - "step": 635, - "token_acc": 0.7903402854006586 - }, - { - "epoch": 1.590738423028786, - "grad_norm": 5.203895092010498, - "learning_rate": 7.672815936359107e-06, - "loss": 0.7587708234786987, - "step": 636, - "token_acc": 0.7722510074841681 - }, - { - "epoch": 1.5932415519399248, - "grad_norm": 1.948972225189209, - "learning_rate": 7.584563001175896e-06, - "loss": 0.8170541524887085, - "step": 637, - "token_acc": 0.754481905939417 - }, - { - "epoch": 1.5957446808510638, - "grad_norm": 4.16902494430542, - "learning_rate": 7.4967297025369114e-06, - "loss": 0.5899007320404053, - "step": 638, - "token_acc": 0.8284804903925498 - }, - { - "epoch": 1.5982478097622028, - "grad_norm": 0.9599528312683105, - "learning_rate": 7.409318156843933e-06, - "loss": 0.9341171979904175, - "step": 639, - "token_acc": 0.7272269753397081 - }, - { - "epoch": 1.6007509386733418, - "grad_norm": 1.6862908601760864, - "learning_rate": 7.3223304703363135e-06, - "loss": 0.7237805128097534, - "step": 640, - "token_acc": 0.7798726587129876 - }, - { - "epoch": 1.6032540675844806, - "grad_norm": 9.259711265563965, - "learning_rate": 7.235768739040258e-06, - "loss": 0.7982171177864075, - "step": 641, - "token_acc": 0.7613955353562358 - }, - { - "epoch": 1.6057571964956194, - "grad_norm": 2.008246660232544, - "learning_rate": 7.149635048718295e-06, - "loss": 0.8156529068946838, - "step": 642, - "token_acc": 0.755189366351056 - }, - { - "epoch": 1.6082603254067585, - "grad_norm": 5.8708086013793945, - "learning_rate": 7.063931474819005e-06, - "loss": 0.9388906955718994, - "step": 643, - "token_acc": 0.7229799968498977 - }, - { - "epoch": 1.6107634543178975, - "grad_norm": 1.3190078735351562, - "learning_rate": 6.9786600824270296e-06, - "loss": 0.8693231344223022, - "step": 644, - "token_acc": 0.7392319943372855 - }, - { - "epoch": 1.6132665832290363, - "grad_norm": 4.078483581542969, - "learning_rate": 6.893822926213331e-06, - "loss": 0.7646411657333374, - "step": 645, - "token_acc": 0.7693258166653796 - }, - { - "epoch": 1.615769712140175, - "grad_norm": 2.5179286003112793, - "learning_rate": 6.8094220503856275e-06, - "loss": 0.7106481790542603, - "step": 646, - "token_acc": 0.7891617273497037 - }, - { - "epoch": 1.618272841051314, - "grad_norm": 5.133343696594238, - "learning_rate": 6.725459488639211e-06, - "loss": 0.8767869472503662, - "step": 647, - "token_acc": 0.740031118026228 - }, - { - "epoch": 1.620775969962453, - "grad_norm": 8.591869354248047, - "learning_rate": 6.641937264107867e-06, - "loss": 0.7623345851898193, - "step": 648, - "token_acc": 0.7718807508281192 - }, - { - "epoch": 1.6232790988735921, - "grad_norm": 2.7604572772979736, - "learning_rate": 6.558857389315179e-06, - "loss": 0.5968680381774902, - "step": 649, - "token_acc": 0.8168473351400181 - }, - { - "epoch": 1.625782227784731, - "grad_norm": 2.0458874702453613, - "learning_rate": 6.476221866126029e-06, - "loss": 0.8066359162330627, - "step": 650, - "token_acc": 0.7615060638351855 - }, - { - "epoch": 1.6282853566958697, - "grad_norm": 4.87338924407959, - "learning_rate": 6.394032685698325e-06, - "loss": 0.8087641000747681, - "step": 651, - "token_acc": 0.7571403539512879 - }, - { - "epoch": 1.6307884856070087, - "grad_norm": 4.343956470489502, - "learning_rate": 6.312291828435077e-06, - "loss": 0.6187503933906555, - "step": 652, - "token_acc": 0.8083971686221274 - }, - { - "epoch": 1.6332916145181477, - "grad_norm": 1.9018688201904297, - "learning_rate": 6.231001263936651e-06, - "loss": 0.7172440886497498, - "step": 653, - "token_acc": 0.785246368555967 - }, - { - "epoch": 1.6357947434292868, - "grad_norm": 2.832977294921875, - "learning_rate": 6.150162950953264e-06, - "loss": 0.8469364643096924, - "step": 654, - "token_acc": 0.7480813982274596 - }, - { - "epoch": 1.6382978723404256, - "grad_norm": 3.063286304473877, - "learning_rate": 6.069778837337886e-06, - "loss": 0.8357624411582947, - "step": 655, - "token_acc": 0.750551461960858 - }, - { - "epoch": 1.6408010012515644, - "grad_norm": 1.9779434204101562, - "learning_rate": 5.989850859999227e-06, - "loss": 0.7701696157455444, - "step": 656, - "token_acc": 0.7706332533013205 - }, - { - "epoch": 1.6433041301627034, - "grad_norm": 1.5771499872207642, - "learning_rate": 5.910380944855087e-06, - "loss": 0.8876208662986755, - "step": 657, - "token_acc": 0.7388784978178751 - }, - { - "epoch": 1.6458072590738424, - "grad_norm": 3.870481491088867, - "learning_rate": 5.8313710067859626e-06, - "loss": 0.6020152568817139, - "step": 658, - "token_acc": 0.8167606083164948 - }, - { - "epoch": 1.6483103879849812, - "grad_norm": 12.5064115524292, - "learning_rate": 5.752822949588893e-06, - "loss": 0.797656774520874, - "step": 659, - "token_acc": 0.763301282051282 - }, - { - "epoch": 1.65081351689612, - "grad_norm": 1.7182737588882446, - "learning_rate": 5.674738665931575e-06, - "loss": 0.7682387828826904, - "step": 660, - "token_acc": 0.7715017939518196 - }, - { - "epoch": 1.653316645807259, - "grad_norm": 7.001367092132568, - "learning_rate": 5.597120037306808e-06, - "loss": 0.7216060757637024, - "step": 661, - "token_acc": 0.7849521852525093 - }, - { - "epoch": 1.655819774718398, - "grad_norm": 1.8173643350601196, - "learning_rate": 5.519968933987083e-06, - "loss": 0.7159848213195801, - "step": 662, - "token_acc": 0.7893794749403341 - }, - { - "epoch": 1.658322903629537, - "grad_norm": 8.282748222351074, - "learning_rate": 5.443287214979592e-06, - "loss": 0.5917546153068542, - "step": 663, - "token_acc": 0.8188921165982169 - }, - { - "epoch": 1.6608260325406758, - "grad_norm": 2.099350690841675, - "learning_rate": 5.367076727981382e-06, - "loss": 0.636560320854187, - "step": 664, - "token_acc": 0.8062931115940659 - }, - { - "epoch": 1.6633291614518146, - "grad_norm": 4.317834854125977, - "learning_rate": 5.291339309334845e-06, - "loss": 0.6860729455947876, - "step": 665, - "token_acc": 0.7957957957957958 - }, - { - "epoch": 1.6658322903629537, - "grad_norm": 5.11480712890625, - "learning_rate": 5.216076783983493e-06, - "loss": 0.6779101490974426, - "step": 666, - "token_acc": 0.7967749313815188 - }, - { - "epoch": 1.6683354192740927, - "grad_norm": 1.5895123481750488, - "learning_rate": 5.141290965427966e-06, - "loss": 0.8478509187698364, - "step": 667, - "token_acc": 0.7479652886325662 - }, - { - "epoch": 1.6708385481852317, - "grad_norm": 3.479113817214966, - "learning_rate": 5.066983655682325e-06, - "loss": 0.8040021657943726, - "step": 668, - "token_acc": 0.7578496924311313 - }, - { - "epoch": 1.6733416770963705, - "grad_norm": 1.4634630680084229, - "learning_rate": 4.993156645230643e-06, - "loss": 0.799077033996582, - "step": 669, - "token_acc": 0.7607260726072608 - }, - { - "epoch": 1.6758448060075093, - "grad_norm": 6.28387451171875, - "learning_rate": 4.91981171298388e-06, - "loss": 0.7174551486968994, - "step": 670, - "token_acc": 0.7794550810014728 - }, - { - "epoch": 1.6783479349186483, - "grad_norm": 3.8518054485321045, - "learning_rate": 4.846950626236976e-06, - "loss": 0.8177169561386108, - "step": 671, - "token_acc": 0.7455885405854266 - }, - { - "epoch": 1.6808510638297873, - "grad_norm": 3.1458609104156494, - "learning_rate": 4.7745751406263165e-06, - "loss": 0.7765710353851318, - "step": 672, - "token_acc": 0.7667461521786256 - }, - { - "epoch": 1.6833541927409261, - "grad_norm": 1.782895565032959, - "learning_rate": 4.702687000087386e-06, - "loss": 0.687012791633606, - "step": 673, - "token_acc": 0.7832773746344633 - }, - { - "epoch": 1.685857321652065, - "grad_norm": 2.870626449584961, - "learning_rate": 4.631287936812764e-06, - "loss": 0.755160927772522, - "step": 674, - "token_acc": 0.7690091515083042 - }, - { - "epoch": 1.688360450563204, - "grad_norm": 2.437972068786621, - "learning_rate": 4.56037967121041e-06, - "loss": 0.7369386553764343, - "step": 675, - "token_acc": 0.7773949579831932 - }, - { - "epoch": 1.690863579474343, - "grad_norm": 1.6886603832244873, - "learning_rate": 4.48996391186216e-06, - "loss": 0.8560739755630493, - "step": 676, - "token_acc": 0.7430776214253291 - }, - { - "epoch": 1.693366708385482, - "grad_norm": 21.07199478149414, - "learning_rate": 4.420042355482601e-06, - "loss": 0.781265377998352, - "step": 677, - "token_acc": 0.7665111841407823 - }, - { - "epoch": 1.6958698372966208, - "grad_norm": 1.2242755889892578, - "learning_rate": 4.350616686878176e-06, - "loss": 0.7612134218215942, - "step": 678, - "token_acc": 0.7721851406061933 - }, - { - "epoch": 1.6983729662077596, - "grad_norm": 0.8354982733726501, - "learning_rate": 4.2816885789065504e-06, - "loss": 0.8463018536567688, - "step": 679, - "token_acc": 0.7483333886106597 - }, - { - "epoch": 1.7008760951188986, - "grad_norm": 2.063284397125244, - "learning_rate": 4.213259692436367e-06, - "loss": 0.7081665992736816, - "step": 680, - "token_acc": 0.7886647454370798 - }, - { - "epoch": 1.7033792240300376, - "grad_norm": 3.285679578781128, - "learning_rate": 4.1453316763071935e-06, - "loss": 0.7210719585418701, - "step": 681, - "token_acc": 0.7862992125984252 - }, - { - "epoch": 1.7058823529411766, - "grad_norm": 2.652149200439453, - "learning_rate": 4.077906167289766e-06, - "loss": 0.7026036977767944, - "step": 682, - "token_acc": 0.7869218738363 - }, - { - "epoch": 1.7083854818523154, - "grad_norm": 4.502437114715576, - "learning_rate": 4.010984790046615e-06, - "loss": 0.6683995723724365, - "step": 683, - "token_acc": 0.8000765990042129 - }, - { - "epoch": 1.7108886107634542, - "grad_norm": 1.6601204872131348, - "learning_rate": 3.944569157092839e-06, - "loss": 0.8401004672050476, - "step": 684, - "token_acc": 0.7523236102180394 - }, - { - "epoch": 1.7133917396745932, - "grad_norm": 2.283055067062378, - "learning_rate": 3.878660868757323e-06, - "loss": 0.6021827459335327, - "step": 685, - "token_acc": 0.8168639560816606 - }, - { - "epoch": 1.7158948685857323, - "grad_norm": 4.256300449371338, - "learning_rate": 3.8132615131441396e-06, - "loss": 0.8827997446060181, - "step": 686, - "token_acc": 0.7379034203290077 - }, - { - "epoch": 1.718397997496871, - "grad_norm": 2.741607189178467, - "learning_rate": 3.748372666094277e-06, - "loss": 0.8296160697937012, - "step": 687, - "token_acc": 0.7515824236308596 - }, - { - "epoch": 1.7209011264080099, - "grad_norm": 2.7922463417053223, - "learning_rate": 3.6839958911476957e-06, - "loss": 0.6963903307914734, - "step": 688, - "token_acc": 0.7873990565283441 - }, - { - "epoch": 1.7234042553191489, - "grad_norm": 3.104214668273926, - "learning_rate": 3.6201327395056246e-06, - "loss": 0.6887581944465637, - "step": 689, - "token_acc": 0.7897428808404755 - }, - { - "epoch": 1.7259073842302879, - "grad_norm": 1.7422378063201904, - "learning_rate": 3.5567847499932e-06, - "loss": 0.7376011610031128, - "step": 690, - "token_acc": 0.7791123130766784 - }, - { - "epoch": 1.728410513141427, - "grad_norm": 4.056087017059326, - "learning_rate": 3.4939534490223912e-06, - "loss": 0.6779285669326782, - "step": 691, - "token_acc": 0.7956978388204403 - }, - { - "epoch": 1.7309136420525657, - "grad_norm": 2.119060754776001, - "learning_rate": 3.431640350555204e-06, - "loss": 0.607970118522644, - "step": 692, - "token_acc": 0.8137347130761995 - }, - { - "epoch": 1.7334167709637045, - "grad_norm": 3.5627596378326416, - "learning_rate": 3.369846956067224e-06, - "loss": 0.6902151703834534, - "step": 693, - "token_acc": 0.7917407065178762 - }, - { - "epoch": 1.7359198998748435, - "grad_norm": 1.4984737634658813, - "learning_rate": 3.308574754511404e-06, - "loss": 0.7758938074111938, - "step": 694, - "token_acc": 0.762149109568367 - }, - { - "epoch": 1.7384230287859825, - "grad_norm": 1.5274784564971924, - "learning_rate": 3.2478252222822164e-06, - "loss": 0.7710534930229187, - "step": 695, - "token_acc": 0.7703561400916211 - }, - { - "epoch": 1.7409261576971216, - "grad_norm": 2.8826518058776855, - "learning_rate": 3.187599823180071e-06, - "loss": 0.7928391098976135, - "step": 696, - "token_acc": 0.7606636399304971 - }, - { - "epoch": 1.7434292866082604, - "grad_norm": 2.2529659271240234, - "learning_rate": 3.1279000083760447e-06, - "loss": 0.6973885297775269, - "step": 697, - "token_acc": 0.7895693858996611 - }, - { - "epoch": 1.7459324155193992, - "grad_norm": 2.2448058128356934, - "learning_rate": 3.0687272163768987e-06, - "loss": 0.743259072303772, - "step": 698, - "token_acc": 0.7773190556057283 - }, - { - "epoch": 1.7484355444305382, - "grad_norm": 1.8807514905929565, - "learning_rate": 3.0100828729904275e-06, - "loss": 0.8025498390197754, - "step": 699, - "token_acc": 0.7638834444008885 - }, - { - "epoch": 1.7509386733416772, - "grad_norm": 1.153306245803833, - "learning_rate": 2.9519683912911266e-06, - "loss": 0.893805980682373, - "step": 700, - "token_acc": 0.7385200734715298 - }, - { - "epoch": 1.753441802252816, - "grad_norm": 2.2380430698394775, - "learning_rate": 2.894385171586095e-06, - "loss": 0.8276506662368774, - "step": 701, - "token_acc": 0.7531895732225947 - }, - { - "epoch": 1.7559449311639548, - "grad_norm": 1.6930055618286133, - "learning_rate": 2.837334601381342e-06, - "loss": 0.8278867602348328, - "step": 702, - "token_acc": 0.7534786253143336 - }, - { - "epoch": 1.7584480600750938, - "grad_norm": 3.543760061264038, - "learning_rate": 2.7808180553483165e-06, - "loss": 0.6783448457717896, - "step": 703, - "token_acc": 0.7924724474942816 - }, - { - "epoch": 1.7609511889862328, - "grad_norm": 1.704220175743103, - "learning_rate": 2.7248368952908053e-06, - "loss": 0.8161231279373169, - "step": 704, - "token_acc": 0.7625753361149745 - }, - { - "epoch": 1.7634543178973718, - "grad_norm": 1.620800256729126, - "learning_rate": 2.66939247011212e-06, - "loss": 0.768420934677124, - "step": 705, - "token_acc": 0.7742177253138467 - }, - { - "epoch": 1.7659574468085106, - "grad_norm": 1.7285171747207642, - "learning_rate": 2.6144861157825774e-06, - "loss": 0.7348212003707886, - "step": 706, - "token_acc": 0.7808262377798801 - }, - { - "epoch": 1.7684605757196494, - "grad_norm": 1.4333690404891968, - "learning_rate": 2.560119155307325e-06, - "loss": 0.7314651608467102, - "step": 707, - "token_acc": 0.7796940845949742 - }, - { - "epoch": 1.7709637046307884, - "grad_norm": 1.7918055057525635, - "learning_rate": 2.506292898694468e-06, - "loss": 0.8795416355133057, - "step": 708, - "token_acc": 0.737824045723617 - }, - { - "epoch": 1.7734668335419275, - "grad_norm": 2.1157777309417725, - "learning_rate": 2.45300864292346e-06, - "loss": 0.894432783126831, - "step": 709, - "token_acc": 0.7341743737092574 - }, - { - "epoch": 1.7759699624530665, - "grad_norm": 1.042678713798523, - "learning_rate": 2.4002676719139166e-06, - "loss": 0.717205822467804, - "step": 710, - "token_acc": 0.7850774581093898 - }, - { - "epoch": 1.7784730913642053, - "grad_norm": 2.729677200317383, - "learning_rate": 2.348071256494633e-06, - "loss": 0.738883376121521, - "step": 711, - "token_acc": 0.774821622929012 - }, - { - "epoch": 1.780976220275344, - "grad_norm": 1.8060981035232544, - "learning_rate": 2.296420654372966e-06, - "loss": 0.8860949277877808, - "step": 712, - "token_acc": 0.7436983689896208 - }, - { - "epoch": 1.783479349186483, - "grad_norm": 1.4554176330566406, - "learning_rate": 2.2453171101045585e-06, - "loss": 0.7235304713249207, - "step": 713, - "token_acc": 0.7811943910598619 - }, - { - "epoch": 1.7859824780976221, - "grad_norm": 2.336805820465088, - "learning_rate": 2.1947618550633097e-06, - "loss": 0.778596818447113, - "step": 714, - "token_acc": 0.7634328358208955 - }, - { - "epoch": 1.788485607008761, - "grad_norm": 3.8445966243743896, - "learning_rate": 2.144756107411733e-06, - "loss": 0.7483553886413574, - "step": 715, - "token_acc": 0.7775210084033614 - }, - { - "epoch": 1.7909887359198997, - "grad_norm": 2.3585619926452637, - "learning_rate": 2.0953010720716037e-06, - "loss": 0.716320276260376, - "step": 716, - "token_acc": 0.7816982878297085 - }, - { - "epoch": 1.7934918648310387, - "grad_norm": 1.595811128616333, - "learning_rate": 2.0463979406949026e-06, - "loss": 0.8576230406761169, - "step": 717, - "token_acc": 0.746366182157621 - }, - { - "epoch": 1.7959949937421777, - "grad_norm": 1.7587617635726929, - "learning_rate": 1.99804789163513e-06, - "loss": 0.7772994041442871, - "step": 718, - "token_acc": 0.7629286376274328 - }, - { - "epoch": 1.7984981226533168, - "grad_norm": 1.4931272268295288, - "learning_rate": 1.9502520899188913e-06, - "loss": 0.7527475357055664, - "step": 719, - "token_acc": 0.7721652929382936 - }, - { - "epoch": 1.8010012515644556, - "grad_norm": 1.531715750694275, - "learning_rate": 1.9030116872178316e-06, - "loss": 0.6039245128631592, - "step": 720, - "token_acc": 0.8160659114315139 - }, - { - "epoch": 1.8035043804755944, - "grad_norm": 2.856832265853882, - "learning_rate": 1.8563278218208996e-06, - "loss": 0.6180843114852905, - "step": 721, - "token_acc": 0.8108873823737731 - }, - { - "epoch": 1.8060075093867334, - "grad_norm": 1.1132346391677856, - "learning_rate": 1.8102016186068993e-06, - "loss": 0.8737172484397888, - "step": 722, - "token_acc": 0.7398431570958766 - }, - { - "epoch": 1.8085106382978724, - "grad_norm": 6.132575511932373, - "learning_rate": 1.7646341890173918e-06, - "loss": 0.8254008293151855, - "step": 723, - "token_acc": 0.751407584175398 - }, - { - "epoch": 1.8110137672090114, - "grad_norm": 2.00321102142334, - "learning_rate": 1.7196266310299108e-06, - "loss": 0.733837902545929, - "step": 724, - "token_acc": 0.7794028031687995 - }, - { - "epoch": 1.8135168961201502, - "grad_norm": 6.0143303871154785, - "learning_rate": 1.675180029131529e-06, - "loss": 0.7438793778419495, - "step": 725, - "token_acc": 0.7769918868317037 - }, - { - "epoch": 1.816020025031289, - "grad_norm": 2.49967885017395, - "learning_rate": 1.631295454292689e-06, - "loss": 0.7499393224716187, - "step": 726, - "token_acc": 0.775504799735187 - }, - { - "epoch": 1.818523153942428, - "grad_norm": 1.4528077840805054, - "learning_rate": 1.5879739639414333e-06, - "loss": 0.7836969494819641, - "step": 727, - "token_acc": 0.7696645543863729 - }, - { - "epoch": 1.821026282853567, - "grad_norm": 22.462095260620117, - "learning_rate": 1.5452166019378989e-06, - "loss": 0.7196674942970276, - "step": 728, - "token_acc": 0.7898250961608244 - }, - { - "epoch": 1.8235294117647058, - "grad_norm": 3.007601737976074, - "learning_rate": 1.5030243985491743e-06, - "loss": 0.7916804552078247, - "step": 729, - "token_acc": 0.7576646375207526 - }, - { - "epoch": 1.8260325406758446, - "grad_norm": 2.6443252563476562, - "learning_rate": 1.4613983704244826e-06, - "loss": 0.7311182022094727, - "step": 730, - "token_acc": 0.7860810039931546 - }, - { - "epoch": 1.8285356695869837, - "grad_norm": 1.2065683603286743, - "learning_rate": 1.4203395205706683e-06, - "loss": 0.7740092277526855, - "step": 731, - "token_acc": 0.7687374985292388 - }, - { - "epoch": 1.8310387984981227, - "grad_norm": 1.1605993509292603, - "learning_rate": 1.379848838328049e-06, - "loss": 0.7189797163009644, - "step": 732, - "token_acc": 0.7794039984911354 - }, - { - "epoch": 1.8335419274092617, - "grad_norm": 1.9326108694076538, - "learning_rate": 1.3399272993465607e-06, - "loss": 0.7424600124359131, - "step": 733, - "token_acc": 0.7825671804665121 - }, - { - "epoch": 1.8360450563204005, - "grad_norm": 2.958646535873413, - "learning_rate": 1.3005758655622424e-06, - "loss": 0.8237686157226562, - "step": 734, - "token_acc": 0.7547775902433712 - }, - { - "epoch": 1.8385481852315393, - "grad_norm": 1.700523018836975, - "learning_rate": 1.2617954851740832e-06, - "loss": 0.8861091136932373, - "step": 735, - "token_acc": 0.7374762500579267 - }, - { - "epoch": 1.8410513141426783, - "grad_norm": 1.633963942527771, - "learning_rate": 1.2235870926211619e-06, - "loss": 0.8130168914794922, - "step": 736, - "token_acc": 0.7547261035633128 - }, - { - "epoch": 1.8435544430538173, - "grad_norm": 3.219843864440918, - "learning_rate": 1.185951608560118e-06, - "loss": 0.6266460418701172, - "step": 737, - "token_acc": 0.8112291350531108 - }, - { - "epoch": 1.8460575719649563, - "grad_norm": 2.2112655639648438, - "learning_rate": 1.1488899398429898e-06, - "loss": 0.6900491118431091, - "step": 738, - "token_acc": 0.7942750756341633 - }, - { - "epoch": 1.8485607008760951, - "grad_norm": 6.101293563842773, - "learning_rate": 1.1124029794953472e-06, - "loss": 0.7254830598831177, - "step": 739, - "token_acc": 0.7787065180682202 - }, - { - "epoch": 1.851063829787234, - "grad_norm": 2.3905293941497803, - "learning_rate": 1.0764916066947794e-06, - "loss": 0.7382086515426636, - "step": 740, - "token_acc": 0.7783818923231488 - }, - { - "epoch": 1.853566958698373, - "grad_norm": 1.8113223314285278, - "learning_rate": 1.041156686749717e-06, - "loss": 0.811902642250061, - "step": 741, - "token_acc": 0.7596169453010875 - }, - { - "epoch": 1.856070087609512, - "grad_norm": 4.407388687133789, - "learning_rate": 1.0063990710785648e-06, - "loss": 0.7142600417137146, - "step": 742, - "token_acc": 0.7852945724447193 - }, - { - "epoch": 1.8585732165206508, - "grad_norm": 1.1643099784851074, - "learning_rate": 9.72219597189211e-07, - "loss": 0.8047236204147339, - "step": 743, - "token_acc": 0.7600485865724381 - }, - { - "epoch": 1.8610763454317898, - "grad_norm": 2.4160287380218506, - "learning_rate": 9.386190886588208e-07, - "loss": 0.6937112808227539, - "step": 744, - "token_acc": 0.7878059305838111 - }, - { - "epoch": 1.8635794743429286, - "grad_norm": 1.315184473991394, - "learning_rate": 9.05598355114004e-07, - "loss": 0.876803994178772, - "step": 745, - "token_acc": 0.7401197096404466 - }, - { - "epoch": 1.8660826032540676, - "grad_norm": 2.9270501136779785, - "learning_rate": 8.731581922113153e-07, - "loss": 0.7580727338790894, - "step": 746, - "token_acc": 0.7737367235275185 - }, - { - "epoch": 1.8685857321652066, - "grad_norm": 1.6372531652450562, - "learning_rate": 8.412993816180687e-07, - "loss": 0.7181699275970459, - "step": 747, - "token_acc": 0.779748401732316 - }, - { - "epoch": 1.8710888610763454, - "grad_norm": 1.4564203023910522, - "learning_rate": 8.10022690993506e-07, - "loss": 0.8921884298324585, - "step": 748, - "token_acc": 0.7377817853922453 - }, - { - "epoch": 1.8735919899874842, - "grad_norm": 4.111305236816406, - "learning_rate": 7.793288739703003e-07, - "loss": 0.8103642463684082, - "step": 749, - "token_acc": 0.7564119255305298 - }, - { - "epoch": 1.8760951188986232, - "grad_norm": 2.841183662414551, - "learning_rate": 7.492186701364007e-07, - "loss": 0.7386457920074463, - "step": 750, - "token_acc": 0.7820195137060555 - }, - { - "epoch": 1.8785982478097623, - "grad_norm": 2.0187108516693115, - "learning_rate": 7.196928050172053e-07, - "loss": 0.7814586758613586, - "step": 751, - "token_acc": 0.7652768936982813 - }, - { - "epoch": 1.8811013767209013, - "grad_norm": 3.561798334121704, - "learning_rate": 6.907519900580861e-07, - "loss": 0.6460806131362915, - "step": 752, - "token_acc": 0.8037120359955006 - }, - { - "epoch": 1.88360450563204, - "grad_norm": 3.151549816131592, - "learning_rate": 6.623969226072363e-07, - "loss": 0.7674912214279175, - "step": 753, - "token_acc": 0.7724372607401105 - }, - { - "epoch": 1.8861076345431789, - "grad_norm": 2.0892200469970703, - "learning_rate": 6.34628285898875e-07, - "loss": 0.8482470512390137, - "step": 754, - "token_acc": 0.7474721941354904 - }, - { - "epoch": 1.8886107634543179, - "grad_norm": 1.6496350765228271, - "learning_rate": 6.074467490367885e-07, - "loss": 0.7435787320137024, - "step": 755, - "token_acc": 0.7757959211146261 - }, - { - "epoch": 1.891113892365457, - "grad_norm": 1.8355616331100464, - "learning_rate": 5.808529669781904e-07, - "loss": 0.7615770101547241, - "step": 756, - "token_acc": 0.7705570291777188 - }, - { - "epoch": 1.8936170212765957, - "grad_norm": 2.422044277191162, - "learning_rate": 5.548475805179587e-07, - "loss": 0.7810842394828796, - "step": 757, - "token_acc": 0.7644932774324129 - }, - { - "epoch": 1.8961201501877347, - "grad_norm": 2.868595838546753, - "learning_rate": 5.294312162731934e-07, - "loss": 0.6938495635986328, - "step": 758, - "token_acc": 0.788420245398773 - }, - { - "epoch": 1.8986232790988735, - "grad_norm": 4.853105545043945, - "learning_rate": 5.046044866680949e-07, - "loss": 0.791533887386322, - "step": 759, - "token_acc": 0.7672524646378054 - }, - { - "epoch": 1.9011264080100125, - "grad_norm": 1.6451623439788818, - "learning_rate": 4.803679899192392e-07, - "loss": 0.7878414988517761, - "step": 760, - "token_acc": 0.761115797083986 - }, - { - "epoch": 1.9036295369211516, - "grad_norm": 1.6281623840332031, - "learning_rate": 4.5672231002114596e-07, - "loss": 0.7406682968139648, - "step": 761, - "token_acc": 0.7717826501429933 - }, - { - "epoch": 1.9061326658322904, - "grad_norm": 1.777449131011963, - "learning_rate": 4.3366801673220545e-07, - "loss": 0.7335410118103027, - "step": 762, - "token_acc": 0.7766620058472099 - }, - { - "epoch": 1.9086357947434291, - "grad_norm": 2.0511081218719482, - "learning_rate": 4.1120566556096254e-07, - "loss": 0.7191562652587891, - "step": 763, - "token_acc": 0.777927795714705 - }, - { - "epoch": 1.9111389236545682, - "grad_norm": 34.73859786987305, - "learning_rate": 3.8933579775271013e-07, - "loss": 0.6233887672424316, - "step": 764, - "token_acc": 0.8098615719025283 - }, - { - "epoch": 1.9136420525657072, - "grad_norm": 4.507017612457275, - "learning_rate": 3.680589402764695e-07, - "loss": 0.7649139761924744, - "step": 765, - "token_acc": 0.7664914450628736 - }, - { - "epoch": 1.9161451814768462, - "grad_norm": 1.5273257493972778, - "learning_rate": 3.4737560581228344e-07, - "loss": 0.7493445873260498, - "step": 766, - "token_acc": 0.7755552669177815 - }, - { - "epoch": 1.918648310387985, - "grad_norm": 1.2997462749481201, - "learning_rate": 3.2728629273885425e-07, - "loss": 0.8165085315704346, - "step": 767, - "token_acc": 0.7531951150241408 - }, - { - "epoch": 1.9211514392991238, - "grad_norm": 2.502765655517578, - "learning_rate": 3.077914851215585e-07, - "loss": 0.7242743372917175, - "step": 768, - "token_acc": 0.7824535192563081 - }, - { - "epoch": 1.9236545682102628, - "grad_norm": 2.90618896484375, - "learning_rate": 2.8889165270075126e-07, - "loss": 0.6685161590576172, - "step": 769, - "token_acc": 0.7950128346167951 - }, - { - "epoch": 1.9261576971214018, - "grad_norm": 2.6155359745025635, - "learning_rate": 2.705872508804747e-07, - "loss": 0.6183698177337646, - "step": 770, - "token_acc": 0.8151649235720032 - }, - { - "epoch": 1.9286608260325406, - "grad_norm": 2.363255500793457, - "learning_rate": 2.5287872071747543e-07, - "loss": 0.8080651760101318, - "step": 771, - "token_acc": 0.7587373167981961 - }, - { - "epoch": 1.9311639549436797, - "grad_norm": 8.026527404785156, - "learning_rate": 2.3576648891056875e-07, - "loss": 0.6179733276367188, - "step": 772, - "token_acc": 0.8178614579138139 - }, - { - "epoch": 1.9336670838548184, - "grad_norm": 3.891880512237549, - "learning_rate": 2.192509677903687e-07, - "loss": 0.785454273223877, - "step": 773, - "token_acc": 0.7663445975771249 - }, - { - "epoch": 1.9361702127659575, - "grad_norm": 0.9011037945747375, - "learning_rate": 2.0333255530934902e-07, - "loss": 0.8462287187576294, - "step": 774, - "token_acc": 0.7474073788503798 - }, - { - "epoch": 1.9386733416770965, - "grad_norm": 1.7468829154968262, - "learning_rate": 1.8801163503225083e-07, - "loss": 0.755885124206543, - "step": 775, - "token_acc": 0.7779124876005731 - }, - { - "epoch": 1.9411764705882353, - "grad_norm": 16.33168601989746, - "learning_rate": 1.732885761268427e-07, - "loss": 0.742058515548706, - "step": 776, - "token_acc": 0.7788488800680465 - }, - { - "epoch": 1.943679599499374, - "grad_norm": 19.74774932861328, - "learning_rate": 1.5916373335503054e-07, - "loss": 0.7660764455795288, - "step": 777, - "token_acc": 0.7678982434887947 - }, - { - "epoch": 1.946182728410513, - "grad_norm": 1.5675026178359985, - "learning_rate": 1.4563744706429515e-07, - "loss": 0.6421328783035278, - "step": 778, - "token_acc": 0.8060836501901141 - }, - { - "epoch": 1.9486858573216521, - "grad_norm": 1.9018704891204834, - "learning_rate": 1.327100431795125e-07, - "loss": 0.6940315961837769, - "step": 779, - "token_acc": 0.789420871559633 - }, - { - "epoch": 1.9511889862327911, - "grad_norm": 1.971119999885559, - "learning_rate": 1.2038183319507955e-07, - "loss": 0.8620060086250305, - "step": 780, - "token_acc": 0.7449793013787677 - }, - { - "epoch": 1.95369211514393, - "grad_norm": 1.246886134147644, - "learning_rate": 1.0865311416741742e-07, - "loss": 0.7828944325447083, - "step": 781, - "token_acc": 0.7600471265872496 - }, - { - "epoch": 1.9561952440550687, - "grad_norm": 1.7200655937194824, - "learning_rate": 9.752416870782155e-08, - "loss": 0.7390601634979248, - "step": 782, - "token_acc": 0.771183195667633 - }, - { - "epoch": 1.9586983729662077, - "grad_norm": 4.742372512817383, - "learning_rate": 8.699526497563393e-08, - "loss": 0.612464964389801, - "step": 783, - "token_acc": 0.8112853356890459 - }, - { - "epoch": 1.9612015018773468, - "grad_norm": 1.3585516214370728, - "learning_rate": 7.706665667180091e-08, - "loss": 0.7104154825210571, - "step": 784, - "token_acc": 0.7835043766978569 - }, - { - "epoch": 1.9637046307884856, - "grad_norm": 2.2985119819641113, - "learning_rate": 6.773858303274483e-08, - "loss": 0.7241730093955994, - "step": 785, - "token_acc": 0.7814715613675752 - }, - { - "epoch": 1.9662077596996246, - "grad_norm": 3.9038970470428467, - "learning_rate": 5.90112688246075e-08, - "loss": 0.8135031461715698, - "step": 786, - "token_acc": 0.7587554486697731 - }, - { - "epoch": 1.9687108886107634, - "grad_norm": 3.519855499267578, - "learning_rate": 5.088492433783509e-08, - "loss": 0.6274003982543945, - "step": 787, - "token_acc": 0.810013200075429 - }, - { - "epoch": 1.9712140175219024, - "grad_norm": 3.2235052585601807, - "learning_rate": 4.335974538210441e-08, - "loss": 0.7641839981079102, - "step": 788, - "token_acc": 0.767855082496827 - }, - { - "epoch": 1.9737171464330414, - "grad_norm": 8.306418418884277, - "learning_rate": 3.6435913281607225e-08, - "loss": 0.76943439245224, - "step": 789, - "token_acc": 0.7673772841275528 - }, - { - "epoch": 1.9762202753441802, - "grad_norm": 2.8990190029144287, - "learning_rate": 3.011359487068987e-08, - "loss": 0.7223886251449585, - "step": 790, - "token_acc": 0.7816155645856422 - } - ], - "logging_steps": 1, - "max_steps": 800, - "num_input_tokens_seen": 0, - "num_train_epochs": 2, - "save_steps": 10, - "stateful_callbacks": { - "TrainerControl": { - "args": { - "should_epoch_stop": false, - "should_evaluate": false, - "should_log": false, - "should_save": true, - "should_training_stop": false - }, - "attributes": {} - } - }, - "total_flos": 4.5353307029456814e+18, - "train_batch_size": 1, - "trial_name": null, - "trial_params": null -} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/training_args.bin deleted file mode 100644 index b5dfe97fa8d66e2d8ab6fe9886964ee4d0bc636e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/training_args.bin +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b9a50cc53a1f7e3013bc39de6123df9ac0ed7377e31847b3f7c939c24348054e -size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/zero_to_fp32.py deleted file mode 100644 index 5995d6e6f04e43b989587aa9022a3aef0c66d694..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-790/zero_to_fp32.py +++ /dev/null @@ -1,760 +0,0 @@ -#!/usr/bin/env python - -# Copyright (c) Microsoft Corporation. -# SPDX-License-Identifier: Apache-2.0 - -# DeepSpeed Team - -# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets -# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in -# the future. Once extracted, the weights don't require DeepSpeed and can be used in any -# application. -# -# example: -# python zero_to_fp32.py . output_dir/ -# or -# python zero_to_fp32.py . output_dir/ --safe_serialization - -import argparse -import torch -import glob -import math -import os -import re -import gc -import json -import numpy as np -from tqdm import tqdm -from collections import OrderedDict -from dataclasses import dataclass - -# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with -# DeepSpeed data structures it has to be available in the current python environment. -from deepspeed.utils import logger -from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, - FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, - FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) - - -@dataclass -class zero_model_state: - buffers: dict() - param_shapes: dict() - shared_params: list - ds_version: int - frozen_param_shapes: dict() - frozen_param_fragments: dict() - - -debug = 0 - -# load to cpu -device = torch.device('cpu') - - -def atoi(text): - return int(text) if text.isdigit() else text - - -def natural_keys(text): - ''' - alist.sort(key=natural_keys) sorts in human order - http://nedbatchelder.com/blog/200712/human_sorting.html - (See Toothy's implementation in the comments) - ''' - return [atoi(c) for c in re.split(r'(\d+)', text)] - - -def get_model_state_file(checkpoint_dir, zero_stage): - if not os.path.isdir(checkpoint_dir): - raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") - - # there should be only one file - if zero_stage <= 2: - file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") - elif zero_stage == 3: - file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") - - if not os.path.exists(file): - raise FileNotFoundError(f"can't find model states file at '{file}'") - - return file - - -def get_checkpoint_files(checkpoint_dir, glob_pattern): - # XXX: need to test that this simple glob rule works for multi-node setup too - ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) - - if len(ckpt_files) == 0: - raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") - - return ckpt_files - - -def get_optim_files(checkpoint_dir): - return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") - - -def get_model_state_files(checkpoint_dir): - return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") - - -def parse_model_states(files): - zero_model_states = [] - for file in files: - state_dict = torch.load(file, map_location=device, weights_only=False) - - if BUFFER_NAMES not in state_dict: - raise ValueError(f"{file} is not a model state checkpoint") - buffer_names = state_dict[BUFFER_NAMES] - if debug: - print("Found buffers:", buffer_names) - - # recover just the buffers while restoring them to fp32 if they were saved in fp16 - buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} - param_shapes = state_dict[PARAM_SHAPES] - - # collect parameters that are included in param_shapes - param_names = [] - for s in param_shapes: - for name in s.keys(): - param_names.append(name) - - # update with frozen parameters - frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) - if frozen_param_shapes is not None: - if debug: - print(f"Found frozen_param_shapes: {frozen_param_shapes}") - param_names += list(frozen_param_shapes.keys()) - - # handle shared params - shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] - - ds_version = state_dict.get(DS_VERSION, None) - - frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) - - z_model_state = zero_model_state(buffers=buffers, - param_shapes=param_shapes, - shared_params=shared_params, - ds_version=ds_version, - frozen_param_shapes=frozen_param_shapes, - frozen_param_fragments=frozen_param_fragments) - zero_model_states.append(z_model_state) - - return zero_model_states - - -def parse_optim_states(files, ds_checkpoint_dir): - total_files = len(files) - state_dicts = [] - for f in tqdm(files, desc='Loading checkpoint shards'): - state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) - # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights - # and also handle the case where it was already removed by another helper script - state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) - state_dicts.append(state_dict) - - if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: - raise ValueError(f"{files[0]} is not a zero checkpoint") - zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] - world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] - - # For ZeRO-2 each param group can have different partition_count as data parallelism for expert - # parameters can be different from data parallelism for non-expert parameters. So we can just - # use the max of the partition_count to get the dp world_size. - - if type(world_size) is list: - world_size = max(world_size) - - if world_size != total_files: - raise ValueError( - f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " - "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." - ) - - # the groups are named differently in each stage - if zero_stage <= 2: - fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS - elif zero_stage == 3: - fp32_groups_key = FP32_FLAT_GROUPS - else: - raise ValueError(f"unknown zero stage {zero_stage}") - - fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] - return zero_stage, world_size, fp32_flat_groups - - -def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): - """ - Returns fp32 state_dict reconstructed from ds checkpoint - - Args: - - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) - - """ - print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") - - optim_files = get_optim_files(ds_checkpoint_dir) - zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) - print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") - - model_files = get_model_state_files(ds_checkpoint_dir) - - zero_model_states = parse_model_states(model_files) - print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') - - if zero_stage <= 2: - return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters) - elif zero_stage == 3: - return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters) - - -def _zero2_merge_frozen_params(state_dict, zero_model_states): - if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: - return - - frozen_param_shapes = zero_model_states[0].frozen_param_shapes - frozen_param_fragments = zero_model_states[0].frozen_param_fragments - - if debug: - num_elem = sum(s.numel() for s in frozen_param_shapes.values()) - print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') - - wanted_params = len(frozen_param_shapes) - wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) - avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) - print(f'Frozen params: Have {avail_numel} numels to process.') - print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') - - total_params = 0 - total_numel = 0 - for name, shape in frozen_param_shapes.items(): - total_params += 1 - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - - state_dict[name] = frozen_param_fragments[name] - - if debug: - print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") - - print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") - - -def _has_callable(obj, fn): - attr = getattr(obj, fn, None) - return callable(attr) - - -def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): - param_shapes = zero_model_states[0].param_shapes - - # Reconstruction protocol: - # - # XXX: document this - - if debug: - for i in range(world_size): - for j in range(len(fp32_flat_groups[0])): - print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") - - # XXX: memory usage doubles here (zero2) - num_param_groups = len(fp32_flat_groups[0]) - merged_single_partition_of_fp32_groups = [] - for i in range(num_param_groups): - merged_partitions = [sd[i] for sd in fp32_flat_groups] - full_single_fp32_vector = torch.cat(merged_partitions, 0) - merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) - avail_numel = sum( - [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) - - if debug: - wanted_params = sum([len(shapes) for shapes in param_shapes]) - wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) - # not asserting if there is a mismatch due to possible padding - print(f"Have {avail_numel} numels to process.") - print(f"Need {wanted_numel} numels in {wanted_params} params.") - - # params - # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support - # out-of-core computing solution - total_numel = 0 - total_params = 0 - for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): - offset = 0 - avail_numel = full_single_fp32_vector.numel() - for name, shape in shapes.items(): - - unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) - total_numel += unpartitioned_numel - total_params += 1 - - if debug: - print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") - state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) - offset += unpartitioned_numel - - # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and - # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex - # paddings performed in the code it's almost impossible to predict the exact numbers w/o the - # live optimizer object, so we are checking that the numbers are within the right range - align_to = 2 * world_size - - def zero2_align(x): - return align_to * math.ceil(x / align_to) - - if debug: - print(f"original offset={offset}, avail_numel={avail_numel}") - - offset = zero2_align(offset) - avail_numel = zero2_align(avail_numel) - - if debug: - print(f"aligned offset={offset}, avail_numel={avail_numel}") - - # Sanity check - if offset != avail_numel: - raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") - - print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") - - -def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters): - state_dict = OrderedDict() - - # buffers - buffers = zero_model_states[0].buffers - state_dict.update(buffers) - if debug: - print(f"added {len(buffers)} buffers") - - if not exclude_frozen_parameters: - _zero2_merge_frozen_params(state_dict, zero_model_states) - - _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) - - # recover shared parameters - for pair in zero_model_states[0].shared_params: - if pair[1] in state_dict: - state_dict[pair[0]] = state_dict[pair[1]] - - return state_dict - - -def zero3_partitioned_param_info(unpartitioned_numel, world_size): - remainder = unpartitioned_numel % world_size - padding_numel = (world_size - remainder) if remainder else 0 - partitioned_numel = math.ceil(unpartitioned_numel / world_size) - return partitioned_numel, padding_numel - - -def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): - if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: - return - - if debug: - for i in range(world_size): - num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) - print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') - - frozen_param_shapes = zero_model_states[0].frozen_param_shapes - wanted_params = len(frozen_param_shapes) - wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) - avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size - print(f'Frozen params: Have {avail_numel} numels to process.') - print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') - - total_params = 0 - total_numel = 0 - for name, shape in zero_model_states[0].frozen_param_shapes.items(): - total_params += 1 - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - - param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) - state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) - - partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) - - if debug: - print( - f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" - ) - - print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") - - -class GatheredTensor: - """ - A pseudo tensor that collects partitioned weights. - It is more memory efficient when there are multiple groups. - """ - - def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): - self.flat_groups = flat_groups - self.flat_groups_offset = flat_groups_offset - self.offset = offset - self.partitioned_numel = partitioned_numel - self.shape = shape - self.dtype = self.flat_groups[0][0].dtype - - def contiguous(self): - """ - Merge partitioned weights from flat_groups into a single tensor. - """ - end_idx = self.offset + self.partitioned_numel - world_size = len(self.flat_groups) - pad_flat_param_chunks = [] - - for rank_i in range(world_size): - # for each rank, we need to collect weights from related group/groups - flat_groups_at_rank_i = self.flat_groups[rank_i] - start_group_id = None - end_group_id = None - for group_id in range(len(self.flat_groups_offset)): - if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: - start_group_id = group_id - if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: - end_group_id = group_id - break - # collect weights from related group/groups - for group_id in range(start_group_id, end_group_id + 1): - flat_tensor = flat_groups_at_rank_i[group_id] - start_offset = self.offset - self.flat_groups_offset[group_id] - end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] - pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) - - # collect weights from all ranks - pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) - param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() - return param - - -def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): - param_shapes = zero_model_states[0].param_shapes - avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size - - # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each - # param, re-consolidating each param, while dealing with padding if any - - # merge list of dicts, preserving order - param_shapes = {k: v for d in param_shapes for k, v in d.items()} - - if debug: - for i in range(world_size): - print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") - - wanted_params = len(param_shapes) - wanted_numel = sum(shape.numel() for shape in param_shapes.values()) - # not asserting if there is a mismatch due to possible padding - avail_numel = fp32_flat_groups[0].numel() * world_size - print(f"Trainable params: Have {avail_numel} numels to process.") - print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") - - # params - # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support - # out-of-core computing solution - offset = 0 - total_numel = 0 - total_params = 0 - flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) - for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - total_params += 1 - partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) - - if debug: - print( - f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" - ) - - # memory efficient tensor - tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) - state_dict[name] = tensor - offset += partitioned_numel - - offset *= world_size - - # Sanity check - if offset != avail_numel: - raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") - - print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") - - -def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters): - state_dict = OrderedDict() - - # buffers - buffers = zero_model_states[0].buffers - state_dict.update(buffers) - if debug: - print(f"added {len(buffers)} buffers") - - if not exclude_frozen_parameters: - _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) - - _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) - - # recover shared parameters - for pair in zero_model_states[0].shared_params: - if pair[1] in state_dict: - state_dict[pair[0]] = state_dict[pair[1]] - - return state_dict - - -def to_torch_tensor(state_dict, return_empty_tensor=False): - """ - Convert state_dict of GatheredTensor to torch tensor - """ - torch_state_dict = {} - converted_tensors = {} - for name, tensor in state_dict.items(): - tensor_id = id(tensor) - if tensor_id in converted_tensors: # shared tensors - shared_tensor = torch_state_dict[converted_tensors[tensor_id]] - torch_state_dict[name] = shared_tensor - else: - converted_tensors[tensor_id] = name - if return_empty_tensor: - torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) - else: - torch_state_dict[name] = tensor.contiguous() - return torch_state_dict - - -def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, - tag=None, - exclude_frozen_parameters=False, - lazy_mode=False): - """ - Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with - ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example - via a model hub. - - Args: - - ``checkpoint_dir``: path to the desired checkpoint folder - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` - - ``exclude_frozen_parameters``: exclude frozen parameters - - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. - Convert the pesduo tensor to torch tensor by ``.contiguous()`` - - Returns: - - pytorch ``state_dict`` - - A typical usage might be :: - - from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint - # do the training and checkpoint saving - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu - model = model.cpu() # move to cpu - model.load_state_dict(state_dict) - # submit to model hub or save the model to share with others - - In this example the ``model`` will no longer be usable in the deepspeed context of the same - application. i.e. you will need to re-initialize the deepspeed engine, since - ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. - - If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. - - Note: the above usage may not work if your application doesn't have sufficient free CPU memory. - You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with - the checkpoint. Or you can load state_dict in lazy mode :: - - from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu - for name, lazy_tensor in state_dict.item(): - tensor = lazy_tensor.contiguous() # to cpu - print(name, tensor) - # del tensor to release memory if it no longer in use - """ - if tag is None: - latest_path = os.path.join(checkpoint_dir, 'latest') - if os.path.isfile(latest_path): - with open(latest_path, 'r') as fd: - tag = fd.read().strip() - else: - raise ValueError(f"Unable to find 'latest' file at {latest_path}") - - ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) - - if not os.path.isdir(ds_checkpoint_dir): - raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") - - state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) - if lazy_mode: - return state_dict - else: - return to_torch_tensor(state_dict) - - -def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, - output_dir, - max_shard_size="5GB", - safe_serialization=False, - tag=None, - exclude_frozen_parameters=False): - """ - Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be - loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. - - Args: - - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) - - ``output_dir``: directory to the pytorch fp32 state_dict output files - - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB - - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` - - ``exclude_frozen_parameters``: exclude frozen parameters - """ - - # Dependency pre-check - if safe_serialization: - try: - from safetensors.torch import save_file - except ImportError: - print('If you want to use `safe_serialization`, please `pip install safetensors`') - raise - if max_shard_size is not None: - try: - from huggingface_hub import split_torch_state_dict_into_shards - except ImportError: - print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') - raise - - # Convert zero checkpoint to state_dict - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, - tag, - exclude_frozen_parameters, - lazy_mode=True) - - # Shard the model if it is too big. - weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" - if max_shard_size is not None: - filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") - # an memory-efficient approach for sharding - empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) - state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, - filename_pattern=filename_pattern, - max_shard_size=max_shard_size) - else: - from collections import namedtuple - StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) - state_dict_split = StateDictSplit(is_sharded=False, - filename_to_tensors={weights_name: list(state_dict.keys())}) - - # Save the model by shard - os.makedirs(output_dir, exist_ok=True) - filename_to_tensors = state_dict_split.filename_to_tensors.items() - for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): - shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} - shard_state_dict = to_torch_tensor(shard_state_dict) - output_path = os.path.join(output_dir, shard_file) - if safe_serialization: - save_file(shard_state_dict, output_path, metadata={"format": "pt"}) - else: - torch.save(shard_state_dict, output_path) - # release the memory of current shard - for tensor_name in list(shard_state_dict.keys()): - del state_dict[tensor_name] - del shard_state_dict[tensor_name] - del shard_state_dict - gc.collect() - - # Save index if sharded - if state_dict_split.is_sharded: - index = { - "metadata": state_dict_split.metadata, - "weight_map": state_dict_split.tensor_to_filename, - } - save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" - save_index_file = os.path.join(output_dir, save_index_file) - with open(save_index_file, "w", encoding="utf-8") as f: - content = json.dumps(index, indent=2, sort_keys=True) + "\n" - f.write(content) - - -def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): - """ - 1. Put the provided model to cpu - 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` - 3. Load it into the provided model - - Args: - - ``model``: the model object to update - - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` - - Returns: - - ``model`: modified model - - Make sure you have plenty of CPU memory available before you call this function. If you don't - have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it - conveniently placed for you in the checkpoint folder. - - A typical usage might be :: - - from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint - model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) - # submit to model hub or save the model to share with others - - Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context - of the same application. i.e. you will need to re-initialize the deepspeed engine, since - ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. - - """ - logger.info("Extracting fp32 weights") - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) - - logger.info("Overwriting model with fp32 weights") - model = model.cpu() - model.load_state_dict(state_dict, strict=False) - - return model - - -if __name__ == "__main__": - parser = argparse.ArgumentParser() - parser.add_argument("checkpoint_dir", - type=str, - help="path to the desired checkpoint folder, e.g., path/checkpoint-12") - parser.add_argument("output_dir", - type=str, - help="directory to the pytorch fp32 state_dict output files" - "(e.g. path/checkpoint-12-output/)") - parser.add_argument( - "--max_shard_size", - type=str, - default="5GB", - help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" - "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" - "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" - "without CPU OOM issues.") - parser.add_argument( - "--safe_serialization", - default=False, - action='store_true', - help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") - parser.add_argument("-t", - "--tag", - type=str, - default=None, - help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") - parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") - parser.add_argument("-d", "--debug", action='store_true', help="enable debug") - args = parser.parse_args() - - debug = args.debug - - convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, - args.output_dir, - max_shard_size=args.max_shard_size, - safe_serialization=args.safe_serialization, - tag=args.tag, - exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/README.md deleted file mode 100644 index 7b99d5d44c922653ec55877d9b54ddd70fbde852..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/README.md +++ /dev/null @@ -1,207 +0,0 @@ ---- -base_model: /workspace/models/Qwen2.5-VL-7B-Instruct -library_name: peft -pipeline_tag: text-generation -tags: -- base_model:adapter:/workspace/models/Qwen2.5-VL-7B-Instruct -- lora -- transformers ---- - -# Model Card for Model ID - - - - - -## Model Details - -### Model Description - - - - - -- **Developed by:** [More Information Needed] -- **Funded by [optional]:** [More Information Needed] -- **Shared by [optional]:** [More Information Needed] -- **Model type:** [More Information Needed] -- **Language(s) (NLP):** [More Information Needed] -- **License:** [More Information Needed] -- **Finetuned from model [optional]:** [More Information Needed] - -### Model Sources [optional] - - - -- **Repository:** [More Information Needed] -- **Paper [optional]:** [More Information Needed] -- **Demo [optional]:** [More Information Needed] - -## Uses - - - -### Direct Use - - - -[More Information Needed] - -### Downstream Use [optional] - - - -[More Information Needed] - -### Out-of-Scope Use - - - -[More Information Needed] - -## Bias, Risks, and Limitations - - - -[More Information Needed] - -### Recommendations - - - -Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. - -## How to Get Started with the Model - -Use the code below to get started with the model. - -[More Information Needed] - -## Training Details - -### Training Data - - - -[More Information Needed] - -### Training Procedure - - - -#### Preprocessing [optional] - -[More Information Needed] - - -#### Training Hyperparameters - -- **Training regime:** [More Information Needed] - -#### Speeds, Sizes, Times [optional] - - - -[More Information Needed] - -## Evaluation - - - -### Testing Data, Factors & Metrics - -#### Testing Data - - - -[More Information Needed] - -#### Factors - - - -[More Information Needed] - -#### Metrics - - - -[More Information Needed] - -### Results - -[More Information Needed] - -#### Summary - - - -## Model Examination [optional] - - - -[More Information Needed] - -## Environmental Impact - - - -Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). - -- **Hardware Type:** [More Information Needed] -- **Hours used:** [More Information Needed] -- **Cloud Provider:** [More Information Needed] -- **Compute Region:** [More Information Needed] -- **Carbon Emitted:** [More Information Needed] - -## Technical Specifications [optional] - -### Model Architecture and Objective - -[More Information Needed] - -### Compute Infrastructure - -[More Information Needed] - -#### Hardware - -[More Information Needed] - -#### Software - -[More Information Needed] - -## Citation [optional] - - - -**BibTeX:** - -[More Information Needed] - -**APA:** - -[More Information Needed] - -## Glossary [optional] - - - -[More Information Needed] - -## More Information [optional] - -[More Information Needed] - -## Model Card Authors [optional] - -[More Information Needed] - -## Model Card Contact - -[More Information Needed] -### Framework versions - -- PEFT 0.17.0 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/adapter_config.json deleted file mode 100644 index 8c337dd8e89f56ebe74fe6e4391a40917e12ff4e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/adapter_config.json +++ /dev/null @@ -1,34 +0,0 @@ -{ - "alpha_pattern": {}, - "auto_mapping": null, - "base_model_name_or_path": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "bias": "none", - "corda_config": null, - "eva_config": null, - "exclude_modules": null, - "fan_in_fan_out": false, - "inference_mode": true, - "init_lora_weights": true, - "layer_replication": null, - "layers_pattern": null, - "layers_to_transform": null, - "loftq_config": {}, - "lora_alpha": 32, - "lora_bias": false, - "lora_dropout": 0.05, - "megatron_config": null, - "megatron_core": "megatron.core", - "modules_to_save": [], - "peft_type": "LORA", - "qalora_group_size": 16, - "r": 16, - "rank_pattern": {}, - "revision": null, - "target_modules": "^(model\\.language_model(?=\\.).*\\.(down_proj|q_proj|gate_proj|k_proj|up_proj|v_proj|o_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(down_proj|gate_proj|attn.proj|up_proj|mlp.0|qkv|mlp.2))$", - "target_parameters": null, - "task_type": "CAUSAL_LM", - "trainable_token_indices": null, - "use_dora": false, - "use_qalora": false, - "use_rslora": false -} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/adapter_model.safetensors deleted file mode 100644 index 2064a9694c91f9ad951536a9cf0023dd33e90f99..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/adapter_model.safetensors +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:4162cb8c32567319932717461370a40b665b7552253eb3c0a9d923e073d25e7b -size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/additional_config.json deleted file mode 100644 index bbe5159d1d10a158affb4d328c70025d891e16d8..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/additional_config.json +++ /dev/null @@ -1 +0,0 @@ -{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/args.json deleted file mode 100644 index 1909feadab03c3c6a278a320adc0267c146443a5..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/args.json +++ /dev/null @@ -1,387 +0,0 @@ -{ - "output_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "overwrite_output_dir": false, - "do_train": false, - "do_eval": false, - "do_predict": false, - "eval_strategy": "steps", - "prediction_loss_only": false, - "per_device_train_batch_size": 1, - "per_device_eval_batch_size": 1, - "per_gpu_train_batch_size": null, - "per_gpu_eval_batch_size": null, - "gradient_accumulation_steps": 4, - "eval_accumulation_steps": null, - "eval_delay": 0, - "torch_empty_cache_steps": null, - "learning_rate": 5e-05, - "weight_decay": 0.1, - "adam_beta1": 0.9, - "adam_beta2": 0.95, - "adam_epsilon": 1e-08, - "max_grad_norm": 1.0, - "num_train_epochs": 2.0, - "max_steps": -1, - "lr_scheduler_type": "cosine", - "lr_scheduler_kwargs": null, - "warmup_ratio": 0.2, - "warmup_steps": 0, - "log_level": "passive", - "log_level_replica": "warning", - "log_on_each_node": true, - "logging_dir": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs", - "logging_strategy": "steps", - "logging_first_step": true, - "logging_steps": 1, - "logging_nan_inf_filter": true, - "save_strategy": "steps", - "save_steps": 10.0, - "save_total_limit": 3, - "save_safetensors": true, - "save_on_each_node": false, - "save_only_model": false, - "restore_callback_states_from_checkpoint": false, - "no_cuda": false, - "use_cpu": false, - "use_mps_device": false, - "seed": 42, - "data_seed": 42, - "jit_mode_eval": false, - "use_ipex": false, - "bf16": true, - "fp16": false, - "fp16_opt_level": "O1", - "half_precision_backend": "auto", - "bf16_full_eval": false, - "fp16_full_eval": false, - "tf32": null, - "local_rank": 0, - "ddp_backend": null, - "tpu_num_cores": null, - "tpu_metrics_debug": false, - "debug": null, - "dataloader_drop_last": false, - "eval_steps": 2000.0, - "dataloader_num_workers": 4, - "dataloader_prefetch_factor": null, - "past_index": -1, - "run_name": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446", - "disable_tqdm": null, - "remove_unused_columns": true, - "label_names": null, - "load_best_model_at_end": false, - "metric_for_best_model": "loss", - "greater_is_better": false, - "ignore_data_skip": false, - "fsdp": [], - "fsdp_min_num_params": 0, - "fsdp_config": null, - "fsdp_transformer_layer_cls_to_wrap": null, - "accelerator_config": { - "dispatch_batches": false - }, - "deepspeed": { - "fp16": { - "enabled": "auto", - "loss_scale": 0, - "loss_scale_window": 1000, - "initial_scale_power": 16, - "hysteresis": 2, - "min_loss_scale": 1 - }, - "bf16": { - "enabled": "auto" - }, - "zero_optimization": { - "stage": 2, - "offload_optimizer": { - "device": "none", - "pin_memory": true - }, - "allgather_partitions": true, - "allgather_bucket_size": 200000000.0, - "overlap_comm": false, - "reduce_scatter": true, - "reduce_bucket_size": 200000000.0, - "contiguous_gradients": true - }, - "gradient_accumulation_steps": "auto", - "gradient_clipping": "auto", - "steps_per_print": 2000, - "train_batch_size": "auto", - "train_micro_batch_size_per_gpu": "auto", - "wall_clock_breakdown": false - }, - "label_smoothing_factor": 0.0, - "optim": "adamw_torch", - "optim_args": null, - "adafactor": false, - "group_by_length": false, - "length_column_name": "length", - "report_to": [ - "none" - ], - "ddp_find_unused_parameters": null, - "ddp_bucket_cap_mb": null, - "ddp_broadcast_buffers": null, - "dataloader_pin_memory": true, - "dataloader_persistent_workers": false, - "skip_memory_metrics": true, - "use_legacy_prediction_loop": false, - "push_to_hub": false, - "resume_from_checkpoint": null, - "hub_model_id": null, - "hub_strategy": "every_save", - "hub_token": null, - "hub_private_repo": null, - "hub_always_push": false, - "hub_revision": null, - "gradient_checkpointing": true, - "gradient_checkpointing_kwargs": null, - "include_inputs_for_metrics": false, - "include_for_metrics": [], - "eval_do_concat_batches": true, - "fp16_backend": "auto", - "push_to_hub_model_id": null, - "push_to_hub_organization": null, - "push_to_hub_token": null, - "mp_parameters": "", - "auto_find_batch_size": false, - "full_determinism": false, - "torchdynamo": null, - "ray_scope": "last", - "ddp_timeout": 18000000, - "torch_compile": false, - "torch_compile_backend": null, - "torch_compile_mode": null, - "include_tokens_per_second": false, - "include_num_input_tokens_seen": false, - "neftune_noise_alpha": null, - "optim_target_modules": null, - "batch_eval_metrics": false, - "eval_on_start": false, - "use_liger_kernel": false, - "liger_kernel_config": null, - "eval_use_gather_object": false, - "average_tokens_across_devices": true, - "sortish_sampler": false, - "predict_with_generate": false, - "generation_max_length": null, - "generation_num_beams": null, - "generation_config": null, - "tuner_backend": "peft", - "vit_gradient_checkpointing": null, - "router_aux_loss_coef": 0.0, - "enable_dft_loss": false, - "enable_channel_loss": false, - "check_model": true, - "acc_strategy": "token", - "train_dataloader_shuffle": true, - "max_epochs": null, - "aligner_lr": null, - "vit_lr": null, - "use_logits_to_keep": null, - "ds3_gather_for_generation": true, - "resume_only_model": false, - "optimizer": null, - "loss_type": null, - "metric": null, - "eval_use_evalscope": false, - "eval_dataset": [], - "eval_dataset_args": null, - "eval_limit": null, - "eval_generation_config": null, - "extra_eval_args": null, - "use_flash_ckpt": false, - "use_ray": false, - "ray_exp_name": null, - "device_groups": null, - "model": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "model_type": "qwen2_5_vl", - "model_revision": null, - "task_type": "causal_lm", - "torch_dtype": "bfloat16", - "attn_impl": null, - "new_special_tokens": [], - "num_labels": null, - "problem_type": null, - "rope_scaling": null, - "device_map": null, - "max_memory": {}, - "max_model_len": null, - "local_repo_path": null, - "init_strategy": null, - "template": "qwen2_5_vl", - "system": null, - "max_length": 24576, - "truncation_strategy": "delete", - "max_pixels": null, - "agent_template": null, - "norm_bbox": null, - "use_chat_template": true, - "padding_side": "right", - "padding_free": false, - "loss_scale": "default", - "sequence_parallel_size": 1, - "template_backend": "swift", - "response_prefix": null, - "enable_thinking": null, - "add_non_thinking_prefix": true, - "dataset": [ - "data.jsonl" - ], - "val_dataset": [], - "cached_dataset": [], - "cached_val_dataset": [], - "split_dataset_ratio": 0.001, - "dataset_num_proc": 8, - "load_from_cache_file": false, - "dataset_shuffle": true, - "val_dataset_shuffle": false, - "streaming": false, - "interleave_prob": null, - "stopping_strategy": "first_exhausted", - "shuffle_buffer_size": 1000, - "download_mode": "reuse_dataset_if_exists", - "columns": {}, - "strict": false, - "model_name": null, - "model_author": null, - "custom_dataset_info": [], - "quant_method": null, - "quant_bits": null, - "hqq_axis": null, - "bnb_4bit_compute_dtype": "bfloat16", - "bnb_4bit_quant_type": "nf4", - "bnb_4bit_use_double_quant": true, - "bnb_4bit_quant_storage": null, - "max_new_tokens": 64, - "temperature": 0.0, - "top_k": null, - "top_p": null, - "repetition_penalty": null, - "num_beams": 1, - "stream": false, - "stop_words": [], - "logprobs": false, - "top_logprobs": null, - "structured_outputs_regex": null, - "ckpt_dir": null, - "lora_modules": [], - "train_type": "lora", - "adapters": [], - "external_plugins": [], - "model_kwargs": {}, - "load_args": false, - "load_data_args": false, - "packing": false, - "packing_length": null, - "packing_num_proc": 1, - "lazy_tokenize": true, - "custom_register_path": [], - "use_hf": false, - "ignore_args_error": false, - "use_swift_lora": false, - "freeze_parameters": [], - "freeze_parameters_regex": null, - "freeze_parameters_ratio": 0.0, - "trainable_parameters": [], - "trainable_parameters_regex": null, - "freeze_llm": false, - "freeze_vit": false, - "freeze_aligner": true, - "target_modules": [ - "all-linear" - ], - "target_regex": null, - "target_parameters": null, - "modules_to_save": [], - "lora_rank": 16, - "lora_alpha": 32, - "lora_dropout": 0.05, - "lora_bias": "none", - "lora_dtype": null, - "lorap_lr_ratio": null, - "use_rslora": false, - "use_dora": false, - "lora_ga_batch_size": 2, - "lora_ga_iters": 2, - "lora_ga_max_length": 1024, - "lora_ga_direction": "ArB2r", - "lora_ga_scale": "stable", - "lora_ga_stable_gamma": 16, - "init_weights": true, - "fourier_n_frequency": 2000, - "fourier_scaling": 300.0, - "boft_block_size": 4, - "boft_block_num": 0, - "boft_n_butterfly_factor": 1, - "boft_dropout": 0.0, - "vera_rank": 256, - "vera_projection_prng_key": 0, - "vera_dropout": 0.0, - "vera_d_initial": 0.1, - "adapter_act": "gelu", - "adapter_length": 128, - "use_galore": false, - "galore_target_modules": null, - "galore_rank": 128, - "galore_update_proj_gap": 50, - "galore_scale": 1.0, - "galore_proj_type": "std", - "galore_optim_per_parameter": false, - "galore_with_embedding": false, - "galore_quantization": false, - "galore_proj_quant": false, - "galore_proj_bits": 4, - "galore_proj_group_size": 256, - "galore_cos_threshold": 0.4, - "galore_gamma_proj": 2, - "galore_queue_size": 5, - "adalora_target_r": 8, - "adalora_init_r": 12, - "adalora_tinit": 0, - "adalora_tfinal": 0, - "adalora_deltaT": 1, - "adalora_beta1": 0.85, - "adalora_beta2": 0.85, - "adalora_orth_reg_weight": 0.5, - "llamapro_num_new_blocks": 4, - "llamapro_num_groups": null, - "lisa_activated_layers": 0, - "lisa_step_interval": 20, - "reft_layer_key": null, - "reft_layers": null, - "reft_rank": 4, - "reft_intervention_type": "LoreftIntervention", - "reft_args": null, - "swanlab_token": null, - "swanlab_project": "ms-swift", - "swanlab_workspace": null, - "swanlab_exp_name": null, - "swanlab_notification_method": null, - "swanlab_webhook_url": null, - "swanlab_secret": null, - "swanlab_sender_email": null, - "swanlab_receiver_email": null, - "swanlab_smtp_server": null, - "swanlab_smtp_port": null, - "swanlab_email_language": "zh", - "swanlab_mode": "cloud", - "add_version": true, - "create_checkpoint_symlink": false, - "zero_hpz_partition_size": null, - "deepspeed_autotp_size": null, - "early_stop_interval": null, - "rank": 0, - "global_world_size": 8, - "local_world_size": 8, - "model_suffix": "Qwen2.5-VL-7B-Instruct", - "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/workspace/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", - "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, is_reranker=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=['vision', 'video'])", - "model_dir": "/workspace/models/Qwen2.5-VL-7B-Instruct", - "_val_dataset_exists": true, - "hub": "", - "evaluation_strategy": "steps", - "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=10, save_total_limit=3, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000, dataloader_num_workers=4, dataloader_prefetch_factor=2, past_index=-1, run_name='/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=[], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, task_type='causal_lm', problem_type=None)" -} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt deleted file mode 100644 index a4c5c7e1eb2fad9f2016f6c676ead8b5e79cfbf3..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:2566620879ba47d3826d9170372953c5bac31d917f3b43a5169c37f76ffc1dfc -size 77307205 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt deleted file mode 100644 index 7443011ff64880ffd44e41425fc1fd41772fbc62..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:323c4d7f9d15fe78e0a4fb3970a06167d24023bedc2a28bd047d1c1880793b26 -size 77304133 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt deleted file mode 100644 index 18a1189ae3b7955c9072247f24a04e60fb820156..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d403054dca6368de40aa3b2a4623f67692957499ec7a4708a1fc50d588eaa8cb -size 77294021 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt deleted file mode 100644 index 21e3a0a14a73362d6815fdd2039696bc4d5e0e15..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:0a0605a660024ab766af1456966271db9f8b9a4e6e7049520e953d8b5dfebae0 -size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt deleted file mode 100644 index 1ff29af9ae8dbbb07e1e462a60ce7dd817954b71..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b98b39adcf1543c1933098731ccb127849973a46a7bbff1dd23605c0897f8628 -size 77294277 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt deleted file mode 100644 index a43b27b55b0211849d944361850a5f4be0b66a9a..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:a541089bd2f912d1734b6d304ea5cc48179cdbe2d8bc7a55a6b8ac980a7d7eac -size 77293957 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt deleted file mode 100644 index 3afd564ec376a2cdfaabf48b04f5625da37853ea..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:47233cb0fb54925b6b0d661a15ca5f0983dd5a42393a3594aca1e4fe48dd64da -size 77294533 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt deleted file mode 100644 index dbe6cbf334ab17010fba7e2606417edc9906e201..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:08505c00ad73d4a163916ab381c6d4c77911e5879b057ed8a552496bb480598d -size 77293829 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/mp_rank_00_model_states.pt deleted file mode 100644 index f815505944cba8ff06907cab45e928a3ad39d642..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/global_step800/mp_rank_00_model_states.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:f01e65d1fe2eedfec3165ea5aa4d64424e7758fe14b91203e6459c99821f3cd2 -size 103652377 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/latest deleted file mode 100644 index 57729c0be88118cbd582c8c68b4149cee821f0b4..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/latest +++ /dev/null @@ -1 +0,0 @@ -global_step800 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_0.pth deleted file mode 100644 index 4f01b06a4b7dfdf59df88717e66ff0b31c26a450..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_0.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:c42a17be32d03aa305718aea86f5912d6fe4892b660984b36b255e33046ec2f4 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_1.pth deleted file mode 100644 index d23bab6d21c361f5e1ddea34e208688b994e2fd8..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_1.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:5298c95f64ff2144dbaa729ef620c6e31eb0a6e18efd5a1195da7adb65c55974 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_2.pth deleted file mode 100644 index 33d48039b5895e49d80bfcf0eee4da24c1b4885f..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_2.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3de21ae0a51315f7ef2c5e0428a5c37045d103fc2e8a7ff0cb8498d3deeafc01 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_3.pth deleted file mode 100644 index 1de2465553fb410eabfddbd94558dfa6c250c461..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_3.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:d3447bcc3265d02a1a879f133624cb5406541b69e30c38b3dd8e16c925e988bd -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_4.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_4.pth deleted file mode 100644 index 5b5cfc31a17e9ae27df17eea2e1296ac64edce61..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_4.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:340c19ae28ae06a1100a2767264af655dcb695e393ca3e8cff800630cb782b39 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_5.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_5.pth deleted file mode 100644 index 6647015bb30af82b7bfe8abdacb3312b19d1eb8d..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_5.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:87a6ed973257915cf871c8fd6dfe02797e55ced927c7c0e0127d6321e88a0ba7 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_6.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_6.pth deleted file mode 100644 index 09e2337c7bd9b0e41d5b6fa65071ac4e9b173458..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_6.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:3fb1aabb8e42a913d68d3fc174f801a07be6bf347be4d086623702d3ab0b0749 -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_7.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_7.pth deleted file mode 100644 index b0b3d59e8d8205c284adbeb7cf8cdcaafaa0aea7..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/rng_state_7.pth +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:91ed770c8b17a0b6cc77a36e82704395608f657422eaa06f3ea5d47a5870300c -size 16389 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/scheduler.pt deleted file mode 100644 index bd91826e9d23f299fdb2bae445a35337089144fa..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/scheduler.pt +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:991fae96e95a86e14f420d2137cda3fb68f453af09b436a8d76fcc42d6c51ba0 -size 1401 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/trainer_state.json deleted file mode 100644 index 29ef233eeeeba9867369e6e632308e839a6ab6a8..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/trainer_state.json +++ /dev/null @@ -1,6443 +0,0 @@ -{ - "best_global_step": 800, - "best_metric": 0.52609098, - "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800", - "epoch": 2.0, - "eval_steps": 2000, - "global_step": 800, - "is_hyper_param_search": false, - "is_local_process_zero": true, - "is_world_process_zero": true, - "log_history": [ - { - "epoch": 0.0025031289111389237, - "grad_norm": 1.7986857891082764, - "learning_rate": 3.125e-07, - "loss": 1.4494528770446777, - "step": 1, - "token_acc": 0.6592913128674069 - }, - { - "epoch": 0.0050062578222778474, - "grad_norm": 1.6583799123764038, - "learning_rate": 6.25e-07, - "loss": 1.4986588954925537, - "step": 2, - "token_acc": 0.6386976385046007 - }, - { - "epoch": 0.007509386733416771, - "grad_norm": 2.0358657836914062, - "learning_rate": 9.375e-07, - "loss": 1.4801826477050781, - "step": 3, - "token_acc": 0.6456910232526047 - }, - { - "epoch": 0.010012515644555695, - "grad_norm": 2.9915387630462646, - "learning_rate": 1.25e-06, - "loss": 1.4314780235290527, - "step": 4, - "token_acc": 0.657655623906541 - }, - { - "epoch": 0.012515644555694618, - "grad_norm": 3.6695473194122314, - "learning_rate": 1.5625e-06, - "loss": 1.4699971675872803, - "step": 5, - "token_acc": 0.6388313198200475 - }, - { - "epoch": 0.015018773466833541, - "grad_norm": 3.4062535762786865, - "learning_rate": 1.875e-06, - "loss": 1.459728479385376, - "step": 6, - "token_acc": 0.6437672541940964 - }, - { - "epoch": 0.017521902377972465, - "grad_norm": 4.477782249450684, - "learning_rate": 2.1875e-06, - "loss": 1.4375343322753906, - "step": 7, - "token_acc": 0.6586960119146119 - }, - { - "epoch": 0.02002503128911139, - "grad_norm": 7.962740898132324, - "learning_rate": 2.5e-06, - "loss": 1.4262611865997314, - "step": 8, - "token_acc": 0.655122040294601 - }, - { - "epoch": 0.02252816020025031, - "grad_norm": 1.1610136032104492, - "learning_rate": 2.8125e-06, - "loss": 1.5507800579071045, - "step": 9, - "token_acc": 0.6221771018936726 - }, - { - "epoch": 0.025031289111389236, - "grad_norm": 2.3185999393463135, - "learning_rate": 3.125e-06, - "loss": 1.536710262298584, - "step": 10, - "token_acc": 0.6201467766984379 - }, - { - "epoch": 0.02753441802252816, - "grad_norm": 1.7153717279434204, - "learning_rate": 3.4375000000000005e-06, - "loss": 1.5054551362991333, - "step": 11, - "token_acc": 0.6262201095830763 - }, - { - "epoch": 0.030037546933667083, - "grad_norm": 2.102219343185425, - "learning_rate": 3.75e-06, - "loss": 1.4586467742919922, - "step": 12, - "token_acc": 0.6540530157510565 - }, - { - "epoch": 0.03254067584480601, - "grad_norm": 1.5630065202713013, - "learning_rate": 4.0625000000000005e-06, - "loss": 1.4890741109848022, - "step": 13, - "token_acc": 0.6405010039200688 - }, - { - "epoch": 0.03504380475594493, - "grad_norm": 33.184234619140625, - "learning_rate": 4.375e-06, - "loss": 1.4462761878967285, - "step": 14, - "token_acc": 0.6706432173164433 - }, - { - "epoch": 0.03754693366708386, - "grad_norm": 1.8826276063919067, - "learning_rate": 4.6875000000000004e-06, - "loss": 1.4586151838302612, - "step": 15, - "token_acc": 0.6705066666666667 - }, - { - "epoch": 0.04005006257822278, - "grad_norm": 8.024161338806152, - "learning_rate": 5e-06, - "loss": 1.4168506860733032, - "step": 16, - "token_acc": 0.6805052169137836 - }, - { - "epoch": 0.0425531914893617, - "grad_norm": 2.216902732849121, - "learning_rate": 5.3125e-06, - "loss": 1.5086560249328613, - "step": 17, - "token_acc": 0.6336965157189877 - }, - { - "epoch": 0.04505632040050062, - "grad_norm": 2.044179916381836, - "learning_rate": 5.625e-06, - "loss": 1.4445496797561646, - "step": 18, - "token_acc": 0.65391224653454 - }, - { - "epoch": 0.04755944931163955, - "grad_norm": 3.586271286010742, - "learning_rate": 5.9375e-06, - "loss": 1.408017635345459, - "step": 19, - "token_acc": 0.6634764043289406 - }, - { - "epoch": 0.05006257822277847, - "grad_norm": 5.328360080718994, - "learning_rate": 6.25e-06, - "loss": 1.489911437034607, - "step": 20, - "token_acc": 0.6468571428571429 - }, - { - "epoch": 0.052565707133917394, - "grad_norm": 5.333054542541504, - "learning_rate": 6.5625e-06, - "loss": 1.5072444677352905, - "step": 21, - "token_acc": 0.6348264774365229 - }, - { - "epoch": 0.05506883604505632, - "grad_norm": 2.1628494262695312, - "learning_rate": 6.875000000000001e-06, - "loss": 1.4629909992218018, - "step": 22, - "token_acc": 0.6488587495865035 - }, - { - "epoch": 0.057571964956195244, - "grad_norm": 1.1275200843811035, - "learning_rate": 7.187499999999999e-06, - "loss": 1.4386491775512695, - "step": 23, - "token_acc": 0.6535871156661787 - }, - { - "epoch": 0.060075093867334166, - "grad_norm": 1.3719394207000732, - "learning_rate": 7.5e-06, - "loss": 1.4821865558624268, - "step": 24, - "token_acc": 0.6603688302296149 - }, - { - "epoch": 0.0625782227784731, - "grad_norm": 4.841657638549805, - "learning_rate": 7.8125e-06, - "loss": 1.4570186138153076, - "step": 25, - "token_acc": 0.641376796500729 - }, - { - "epoch": 0.06508135168961202, - "grad_norm": 5.441135406494141, - "learning_rate": 8.125000000000001e-06, - "loss": 1.4552083015441895, - "step": 26, - "token_acc": 0.6444476999707003 - }, - { - "epoch": 0.06758448060075094, - "grad_norm": 5.626768589019775, - "learning_rate": 8.437500000000002e-06, - "loss": 1.4883147478103638, - "step": 27, - "token_acc": 0.6449818262740152 - }, - { - "epoch": 0.07008760951188986, - "grad_norm": 2.280463695526123, - "learning_rate": 8.75e-06, - "loss": 1.482466459274292, - "step": 28, - "token_acc": 0.6569336031608365 - }, - { - "epoch": 0.07259073842302878, - "grad_norm": 1.4831247329711914, - "learning_rate": 9.0625e-06, - "loss": 1.4435244798660278, - "step": 29, - "token_acc": 0.6449365872405841 - }, - { - "epoch": 0.07509386733416772, - "grad_norm": 2.1460583209991455, - "learning_rate": 9.375000000000001e-06, - "loss": 1.4155304431915283, - "step": 30, - "token_acc": 0.6572798819478604 - }, - { - "epoch": 0.07759699624530664, - "grad_norm": 3.4287304878234863, - "learning_rate": 9.6875e-06, - "loss": 1.4242777824401855, - "step": 31, - "token_acc": 0.6509663111204985 - }, - { - "epoch": 0.08010012515644556, - "grad_norm": 1.7512478828430176, - "learning_rate": 1e-05, - "loss": 1.4408752918243408, - "step": 32, - "token_acc": 0.6373248744382765 - }, - { - "epoch": 0.08260325406758448, - "grad_norm": 2.4649264812469482, - "learning_rate": 1.03125e-05, - "loss": 1.4433287382125854, - "step": 33, - "token_acc": 0.6401217941210915 - }, - { - "epoch": 0.0851063829787234, - "grad_norm": 3.863513946533203, - "learning_rate": 1.0625e-05, - "loss": 1.3532931804656982, - "step": 34, - "token_acc": 0.6718291250733999 - }, - { - "epoch": 0.08760951188986232, - "grad_norm": 2.388653516769409, - "learning_rate": 1.09375e-05, - "loss": 1.368670105934143, - "step": 35, - "token_acc": 0.6668484187568157 - }, - { - "epoch": 0.09011264080100125, - "grad_norm": 13.738019943237305, - "learning_rate": 1.125e-05, - "loss": 1.4073092937469482, - "step": 36, - "token_acc": 0.6551803885291397 - }, - { - "epoch": 0.09261576971214018, - "grad_norm": 1.3637429475784302, - "learning_rate": 1.1562500000000002e-05, - "loss": 1.4829626083374023, - "step": 37, - "token_acc": 0.632803489946347 - }, - { - "epoch": 0.0951188986232791, - "grad_norm": 1.6325939893722534, - "learning_rate": 1.1875e-05, - "loss": 1.3899552822113037, - "step": 38, - "token_acc": 0.6505426646706587 - }, - { - "epoch": 0.09762202753441802, - "grad_norm": 1.8122252225875854, - "learning_rate": 1.21875e-05, - "loss": 1.4045588970184326, - "step": 39, - "token_acc": 0.6430427054373091 - }, - { - "epoch": 0.10012515644555695, - "grad_norm": 3.8704774379730225, - "learning_rate": 1.25e-05, - "loss": 1.328863501548767, - "step": 40, - "token_acc": 0.6735982966643009 - }, - { - "epoch": 0.10262828535669587, - "grad_norm": 2.2901201248168945, - "learning_rate": 1.28125e-05, - "loss": 1.3276169300079346, - "step": 41, - "token_acc": 0.6693909833904561 - }, - { - "epoch": 0.10513141426783479, - "grad_norm": 4.91914176940918, - "learning_rate": 1.3125e-05, - "loss": 1.3163728713989258, - "step": 42, - "token_acc": 0.670345262494088 - }, - { - "epoch": 0.10763454317897372, - "grad_norm": 2.1690850257873535, - "learning_rate": 1.34375e-05, - "loss": 1.3434736728668213, - "step": 43, - "token_acc": 0.6614920224234584 - }, - { - "epoch": 0.11013767209011265, - "grad_norm": 2.672122001647949, - "learning_rate": 1.3750000000000002e-05, - "loss": 1.314670205116272, - "step": 44, - "token_acc": 0.6749050965188595 - }, - { - "epoch": 0.11264080100125157, - "grad_norm": 2.7474703788757324, - "learning_rate": 1.4062500000000001e-05, - "loss": 1.3387380838394165, - "step": 45, - "token_acc": 0.6603486336302048 - }, - { - "epoch": 0.11514392991239049, - "grad_norm": 3.5926313400268555, - "learning_rate": 1.4374999999999999e-05, - "loss": 1.2919178009033203, - "step": 46, - "token_acc": 0.6762086081457809 - }, - { - "epoch": 0.11764705882352941, - "grad_norm": 3.3131020069122314, - "learning_rate": 1.4687500000000001e-05, - "loss": 1.2780070304870605, - "step": 47, - "token_acc": 0.6928104575163399 - }, - { - "epoch": 0.12015018773466833, - "grad_norm": 2.7729618549346924, - "learning_rate": 1.5e-05, - "loss": 1.321435809135437, - "step": 48, - "token_acc": 0.6654236179260713 - }, - { - "epoch": 0.12265331664580725, - "grad_norm": 3.3950774669647217, - "learning_rate": 1.5312500000000003e-05, - "loss": 1.341125249862671, - "step": 49, - "token_acc": 0.6776592884667085 - }, - { - "epoch": 0.1251564455569462, - "grad_norm": 1.6991623640060425, - "learning_rate": 1.5625e-05, - "loss": 1.2597063779830933, - "step": 50, - "token_acc": 0.68832675794848 - }, - { - "epoch": 0.1276595744680851, - "grad_norm": 2.190904378890991, - "learning_rate": 1.59375e-05, - "loss": 1.3336235284805298, - "step": 51, - "token_acc": 0.6667860126506743 - }, - { - "epoch": 0.13016270337922403, - "grad_norm": 1.2699120044708252, - "learning_rate": 1.6250000000000002e-05, - "loss": 1.3078663349151611, - "step": 52, - "token_acc": 0.6601299948297511 - }, - { - "epoch": 0.13266583229036297, - "grad_norm": 2.1954216957092285, - "learning_rate": 1.65625e-05, - "loss": 1.3297888040542603, - "step": 53, - "token_acc": 0.6636132655790318 - }, - { - "epoch": 0.13516896120150187, - "grad_norm": 1.4788720607757568, - "learning_rate": 1.6875000000000004e-05, - "loss": 1.2633283138275146, - "step": 54, - "token_acc": 0.6728486646884273 - }, - { - "epoch": 0.1376720901126408, - "grad_norm": 1.2756942510604858, - "learning_rate": 1.71875e-05, - "loss": 1.3134421110153198, - "step": 55, - "token_acc": 0.6597701149425287 - }, - { - "epoch": 0.14017521902377972, - "grad_norm": 1.5058810710906982, - "learning_rate": 1.75e-05, - "loss": 1.320970058441162, - "step": 56, - "token_acc": 0.6619850627084409 - }, - { - "epoch": 0.14267834793491865, - "grad_norm": 8.395251274108887, - "learning_rate": 1.7812500000000003e-05, - "loss": 1.199589729309082, - "step": 57, - "token_acc": 0.6902491313668958 - }, - { - "epoch": 0.14518147684605756, - "grad_norm": 1.2147586345672607, - "learning_rate": 1.8125e-05, - "loss": 1.200380802154541, - "step": 58, - "token_acc": 0.6993761140819964 - }, - { - "epoch": 0.1476846057571965, - "grad_norm": 7.152925491333008, - "learning_rate": 1.84375e-05, - "loss": 1.1884859800338745, - "step": 59, - "token_acc": 0.6956748695003728 - }, - { - "epoch": 0.15018773466833543, - "grad_norm": 1.761688470840454, - "learning_rate": 1.8750000000000002e-05, - "loss": 1.2416102886199951, - "step": 60, - "token_acc": 0.6780534640456819 - }, - { - "epoch": 0.15269086357947434, - "grad_norm": 1.4128592014312744, - "learning_rate": 1.90625e-05, - "loss": 1.2558822631835938, - "step": 61, - "token_acc": 0.6748296304504404 - }, - { - "epoch": 0.15519399249061328, - "grad_norm": 5.176482677459717, - "learning_rate": 1.9375e-05, - "loss": 1.2571231126785278, - "step": 62, - "token_acc": 0.6723865345312922 - }, - { - "epoch": 0.15769712140175218, - "grad_norm": 2.6499240398406982, - "learning_rate": 1.96875e-05, - "loss": 1.2110214233398438, - "step": 63, - "token_acc": 0.693203125 - }, - { - "epoch": 0.16020025031289112, - "grad_norm": 4.237362861633301, - "learning_rate": 2e-05, - "loss": 1.2331520318984985, - "step": 64, - "token_acc": 0.6743368488334931 - }, - { - "epoch": 0.16270337922403003, - "grad_norm": 1.8324310779571533, - "learning_rate": 2.0312500000000002e-05, - "loss": 1.251111388206482, - "step": 65, - "token_acc": 0.6659237798083352 - }, - { - "epoch": 0.16520650813516896, - "grad_norm": 4.525329113006592, - "learning_rate": 2.0625e-05, - "loss": 1.2055377960205078, - "step": 66, - "token_acc": 0.6863984270767503 - }, - { - "epoch": 0.1677096370463079, - "grad_norm": 6.051656246185303, - "learning_rate": 2.09375e-05, - "loss": 1.1731817722320557, - "step": 67, - "token_acc": 0.7137023105857067 - }, - { - "epoch": 0.1702127659574468, - "grad_norm": 4.812889099121094, - "learning_rate": 2.125e-05, - "loss": 1.2493493556976318, - "step": 68, - "token_acc": 0.6750756811301716 - }, - { - "epoch": 0.17271589486858574, - "grad_norm": 7.175212860107422, - "learning_rate": 2.1562500000000002e-05, - "loss": 1.1924042701721191, - "step": 69, - "token_acc": 0.6935587761674719 - }, - { - "epoch": 0.17521902377972465, - "grad_norm": 3.6862568855285645, - "learning_rate": 2.1875e-05, - "loss": 1.1937012672424316, - "step": 70, - "token_acc": 0.6821087165563663 - }, - { - "epoch": 0.17772215269086358, - "grad_norm": 1.5228620767593384, - "learning_rate": 2.21875e-05, - "loss": 1.1624102592468262, - "step": 71, - "token_acc": 0.6929272132735861 - }, - { - "epoch": 0.1802252816020025, - "grad_norm": 4.755965232849121, - "learning_rate": 2.25e-05, - "loss": 1.2102301120758057, - "step": 72, - "token_acc": 0.6871946706143597 - }, - { - "epoch": 0.18272841051314143, - "grad_norm": 5.966728687286377, - "learning_rate": 2.28125e-05, - "loss": 1.0677056312561035, - "step": 73, - "token_acc": 0.7211055276381909 - }, - { - "epoch": 0.18523153942428036, - "grad_norm": 1.5221632719039917, - "learning_rate": 2.3125000000000003e-05, - "loss": 1.1764060258865356, - "step": 74, - "token_acc": 0.6962217319360177 - }, - { - "epoch": 0.18773466833541927, - "grad_norm": 2.7929961681365967, - "learning_rate": 2.34375e-05, - "loss": 1.1629931926727295, - "step": 75, - "token_acc": 0.6944312608764436 - }, - { - "epoch": 0.1902377972465582, - "grad_norm": 2.37900447845459, - "learning_rate": 2.375e-05, - "loss": 1.0149047374725342, - "step": 76, - "token_acc": 0.7393754402441888 - }, - { - "epoch": 0.1927409261576971, - "grad_norm": 1.0842740535736084, - "learning_rate": 2.4062500000000002e-05, - "loss": 1.1768832206726074, - "step": 77, - "token_acc": 0.6881792648675051 - }, - { - "epoch": 0.19524405506883605, - "grad_norm": 3.4930760860443115, - "learning_rate": 2.4375e-05, - "loss": 1.1979458332061768, - "step": 78, - "token_acc": 0.679685852835758 - }, - { - "epoch": 0.19774718397997496, - "grad_norm": 1.6366428136825562, - "learning_rate": 2.4687500000000004e-05, - "loss": 1.2089760303497314, - "step": 79, - "token_acc": 0.6773502191914271 - }, - { - "epoch": 0.2002503128911139, - "grad_norm": 2.1552915573120117, - "learning_rate": 2.5e-05, - "loss": 1.215577483177185, - "step": 80, - "token_acc": 0.6731748051534914 - }, - { - "epoch": 0.20275344180225283, - "grad_norm": 1.2128065824508667, - "learning_rate": 2.53125e-05, - "loss": 1.1573808193206787, - "step": 81, - "token_acc": 0.6900347624565469 - }, - { - "epoch": 0.20525657071339173, - "grad_norm": 1.3834235668182373, - "learning_rate": 2.5625e-05, - "loss": 1.2300320863723755, - "step": 82, - "token_acc": 0.6683756510416666 - }, - { - "epoch": 0.20775969962453067, - "grad_norm": 2.470287799835205, - "learning_rate": 2.5937500000000004e-05, - "loss": 1.0792181491851807, - "step": 83, - "token_acc": 0.705793164445006 - }, - { - "epoch": 0.21026282853566958, - "grad_norm": 1.6145744323730469, - "learning_rate": 2.625e-05, - "loss": 1.1585354804992676, - "step": 84, - "token_acc": 0.6947993159641888 - }, - { - "epoch": 0.2127659574468085, - "grad_norm": 4.214087963104248, - "learning_rate": 2.6562500000000002e-05, - "loss": 1.0336159467697144, - "step": 85, - "token_acc": 0.7254294315565787 - }, - { - "epoch": 0.21526908635794745, - "grad_norm": 2.9351229667663574, - "learning_rate": 2.6875e-05, - "loss": 1.1614649295806885, - "step": 86, - "token_acc": 0.6926658905704307 - }, - { - "epoch": 0.21777221526908636, - "grad_norm": 8.310845375061035, - "learning_rate": 2.71875e-05, - "loss": 1.0881564617156982, - "step": 87, - "token_acc": 0.7154069767441861 - }, - { - "epoch": 0.2202753441802253, - "grad_norm": 1.372636318206787, - "learning_rate": 2.7500000000000004e-05, - "loss": 1.0820119380950928, - "step": 88, - "token_acc": 0.7062420210978969 - }, - { - "epoch": 0.2227784730913642, - "grad_norm": 0.9730624556541443, - "learning_rate": 2.7812500000000002e-05, - "loss": 1.1775951385498047, - "step": 89, - "token_acc": 0.6864290043528569 - }, - { - "epoch": 0.22528160200250313, - "grad_norm": 32.95426559448242, - "learning_rate": 2.8125000000000003e-05, - "loss": 0.9602251052856445, - "step": 90, - "token_acc": 0.7386105263157895 - }, - { - "epoch": 0.22778473091364204, - "grad_norm": 1.8376237154006958, - "learning_rate": 2.84375e-05, - "loss": 1.0506157875061035, - "step": 91, - "token_acc": 0.7134351911627573 - }, - { - "epoch": 0.23028785982478098, - "grad_norm": 3.1153717041015625, - "learning_rate": 2.8749999999999997e-05, - "loss": 1.1409003734588623, - "step": 92, - "token_acc": 0.6888570610140361 - }, - { - "epoch": 0.2327909887359199, - "grad_norm": 4.867130756378174, - "learning_rate": 2.9062500000000005e-05, - "loss": 0.9956814050674438, - "step": 93, - "token_acc": 0.7277626648873377 - }, - { - "epoch": 0.23529411764705882, - "grad_norm": 1.4865891933441162, - "learning_rate": 2.9375000000000003e-05, - "loss": 1.158729076385498, - "step": 94, - "token_acc": 0.688175432276657 - }, - { - "epoch": 0.23779724655819776, - "grad_norm": 4.895930290222168, - "learning_rate": 2.96875e-05, - "loss": 1.0074833631515503, - "step": 95, - "token_acc": 0.7172348866922198 - }, - { - "epoch": 0.24030037546933666, - "grad_norm": 11.321675300598145, - "learning_rate": 3e-05, - "loss": 0.9759230613708496, - "step": 96, - "token_acc": 0.7422142214221422 - }, - { - "epoch": 0.2428035043804756, - "grad_norm": 5.278805255889893, - "learning_rate": 3.0312499999999998e-05, - "loss": 1.1167738437652588, - "step": 97, - "token_acc": 0.6905687036382904 - }, - { - "epoch": 0.2453066332916145, - "grad_norm": 11.173495292663574, - "learning_rate": 3.0625000000000006e-05, - "loss": 1.1424094438552856, - "step": 98, - "token_acc": 0.691369290620047 - }, - { - "epoch": 0.24780976220275344, - "grad_norm": 2.3526344299316406, - "learning_rate": 3.09375e-05, - "loss": 1.041211485862732, - "step": 99, - "token_acc": 0.7146459747817653 - }, - { - "epoch": 0.2503128911138924, - "grad_norm": 2.7857418060302734, - "learning_rate": 3.125e-05, - "loss": 1.0442692041397095, - "step": 100, - "token_acc": 0.711717754376551 - }, - { - "epoch": 0.2528160200250313, - "grad_norm": 79.83805084228516, - "learning_rate": 3.15625e-05, - "loss": 1.1021206378936768, - "step": 101, - "token_acc": 0.7008632923368022 - }, - { - "epoch": 0.2553191489361702, - "grad_norm": 2.249223232269287, - "learning_rate": 3.1875e-05, - "loss": 1.0893476009368896, - "step": 102, - "token_acc": 0.7009559556624245 - }, - { - "epoch": 0.25782227784730916, - "grad_norm": 3.4049673080444336, - "learning_rate": 3.21875e-05, - "loss": 1.0653949975967407, - "step": 103, - "token_acc": 0.7043142117355312 - }, - { - "epoch": 0.26032540675844806, - "grad_norm": 2.0676321983337402, - "learning_rate": 3.2500000000000004e-05, - "loss": 0.9971442818641663, - "step": 104, - "token_acc": 0.7209080223332354 - }, - { - "epoch": 0.26282853566958697, - "grad_norm": 3.04028058052063, - "learning_rate": 3.2812500000000005e-05, - "loss": 1.0553109645843506, - "step": 105, - "token_acc": 0.7107347245505521 - }, - { - "epoch": 0.26533166458072593, - "grad_norm": 3.4072177410125732, - "learning_rate": 3.3125e-05, - "loss": 1.1222078800201416, - "step": 106, - "token_acc": 0.6884954048982341 - }, - { - "epoch": 0.26783479349186484, - "grad_norm": 4.250513553619385, - "learning_rate": 3.34375e-05, - "loss": 1.0399558544158936, - "step": 107, - "token_acc": 0.715698983420891 - }, - { - "epoch": 0.27033792240300375, - "grad_norm": 1.5310983657836914, - "learning_rate": 3.375000000000001e-05, - "loss": 0.97971510887146, - "step": 108, - "token_acc": 0.7238202367561197 - }, - { - "epoch": 0.27284105131414266, - "grad_norm": 1.164379358291626, - "learning_rate": 3.40625e-05, - "loss": 1.0755829811096191, - "step": 109, - "token_acc": 0.6932410856838744 - }, - { - "epoch": 0.2753441802252816, - "grad_norm": 5.060781002044678, - "learning_rate": 3.4375e-05, - "loss": 1.0854302644729614, - "step": 110, - "token_acc": 0.7054753144049646 - }, - { - "epoch": 0.27784730913642053, - "grad_norm": 3.0165348052978516, - "learning_rate": 3.46875e-05, - "loss": 0.9611892700195312, - "step": 111, - "token_acc": 0.7338753387533875 - }, - { - "epoch": 0.28035043804755944, - "grad_norm": 5.620553970336914, - "learning_rate": 3.5e-05, - "loss": 0.9679099321365356, - "step": 112, - "token_acc": 0.7282849285666376 - }, - { - "epoch": 0.2828535669586984, - "grad_norm": 3.3517661094665527, - "learning_rate": 3.5312500000000005e-05, - "loss": 1.0258841514587402, - "step": 113, - "token_acc": 0.7185277850934949 - }, - { - "epoch": 0.2853566958698373, - "grad_norm": 4.1862382888793945, - "learning_rate": 3.5625000000000005e-05, - "loss": 1.0116548538208008, - "step": 114, - "token_acc": 0.7171322653250364 - }, - { - "epoch": 0.2878598247809762, - "grad_norm": 4.775069713592529, - "learning_rate": 3.59375e-05, - "loss": 0.9625561833381653, - "step": 115, - "token_acc": 0.7378043781257686 - }, - { - "epoch": 0.2903629536921151, - "grad_norm": 2.4339494705200195, - "learning_rate": 3.625e-05, - "loss": 1.0401370525360107, - "step": 116, - "token_acc": 0.710567296996663 - }, - { - "epoch": 0.2928660826032541, - "grad_norm": 2.8357059955596924, - "learning_rate": 3.65625e-05, - "loss": 0.8899033069610596, - "step": 117, - "token_acc": 0.760463490160823 - }, - { - "epoch": 0.295369211514393, - "grad_norm": 3.8368427753448486, - "learning_rate": 3.6875e-05, - "loss": 1.0864536762237549, - "step": 118, - "token_acc": 0.7004258071470921 - }, - { - "epoch": 0.2978723404255319, - "grad_norm": 2.6409614086151123, - "learning_rate": 3.71875e-05, - "loss": 1.0734574794769287, - "step": 119, - "token_acc": 0.7024148661086033 - }, - { - "epoch": 0.30037546933667086, - "grad_norm": 2.4843125343322754, - "learning_rate": 3.7500000000000003e-05, - "loss": 0.9885290861129761, - "step": 120, - "token_acc": 0.7214841692514777 - }, - { - "epoch": 0.30287859824780977, - "grad_norm": 3.219529628753662, - "learning_rate": 3.78125e-05, - "loss": 1.0155832767486572, - "step": 121, - "token_acc": 0.7182897862232779 - }, - { - "epoch": 0.3053817271589487, - "grad_norm": 4.397768020629883, - "learning_rate": 3.8125e-05, - "loss": 0.9772403836250305, - "step": 122, - "token_acc": 0.7289815989847716 - }, - { - "epoch": 0.3078848560700876, - "grad_norm": 7.476251125335693, - "learning_rate": 3.8437500000000006e-05, - "loss": 1.0845521688461304, - "step": 123, - "token_acc": 0.700028537649313 - }, - { - "epoch": 0.31038798498122655, - "grad_norm": 2.454371929168701, - "learning_rate": 3.875e-05, - "loss": 1.0315274000167847, - "step": 124, - "token_acc": 0.714497250035256 - }, - { - "epoch": 0.31289111389236546, - "grad_norm": 2.123765230178833, - "learning_rate": 3.90625e-05, - "loss": 0.9268566370010376, - "step": 125, - "token_acc": 0.7407587548638133 - }, - { - "epoch": 0.31539424280350437, - "grad_norm": 4.286694526672363, - "learning_rate": 3.9375e-05, - "loss": 0.9085225462913513, - "step": 126, - "token_acc": 0.7448712536935416 - }, - { - "epoch": 0.31789737171464333, - "grad_norm": 2.3730971813201904, - "learning_rate": 3.96875e-05, - "loss": 0.8727496266365051, - "step": 127, - "token_acc": 0.7622018348623854 - }, - { - "epoch": 0.32040050062578224, - "grad_norm": 2.70272159576416, - "learning_rate": 4e-05, - "loss": 1.0061339139938354, - "step": 128, - "token_acc": 0.7129116291496894 - }, - { - "epoch": 0.32290362953692114, - "grad_norm": 2.363917112350464, - "learning_rate": 4.0312500000000004e-05, - "loss": 1.0005316734313965, - "step": 129, - "token_acc": 0.7205369127516779 - }, - { - "epoch": 0.32540675844806005, - "grad_norm": 5.393451690673828, - "learning_rate": 4.0625000000000005e-05, - "loss": 0.9804684519767761, - "step": 130, - "token_acc": 0.7264981866328939 - }, - { - "epoch": 0.327909887359199, - "grad_norm": 4.67309045791626, - "learning_rate": 4.09375e-05, - "loss": 0.877933144569397, - "step": 131, - "token_acc": 0.76021068992315 - }, - { - "epoch": 0.3304130162703379, - "grad_norm": 2.624901533126831, - "learning_rate": 4.125e-05, - "loss": 0.9735865592956543, - "step": 132, - "token_acc": 0.7238545946227053 - }, - { - "epoch": 0.33291614518147683, - "grad_norm": 2.829728126525879, - "learning_rate": 4.156250000000001e-05, - "loss": 1.0161550045013428, - "step": 133, - "token_acc": 0.7142064135957983 - }, - { - "epoch": 0.3354192740926158, - "grad_norm": 2.408121109008789, - "learning_rate": 4.1875e-05, - "loss": 0.9492026567459106, - "step": 134, - "token_acc": 0.736371949075051 - }, - { - "epoch": 0.3379224030037547, - "grad_norm": 2.7580509185791016, - "learning_rate": 4.21875e-05, - "loss": 0.8693875670433044, - "step": 135, - "token_acc": 0.7559972583961617 - }, - { - "epoch": 0.3404255319148936, - "grad_norm": 2.2704222202301025, - "learning_rate": 4.25e-05, - "loss": 0.9372125864028931, - "step": 136, - "token_acc": 0.7337290802460306 - }, - { - "epoch": 0.3429286608260325, - "grad_norm": 4.360070705413818, - "learning_rate": 4.28125e-05, - "loss": 1.0078935623168945, - "step": 137, - "token_acc": 0.7146907768029104 - }, - { - "epoch": 0.3454317897371715, - "grad_norm": 13.713053703308105, - "learning_rate": 4.3125000000000005e-05, - "loss": 0.8341250419616699, - "step": 138, - "token_acc": 0.7732564024698856 - }, - { - "epoch": 0.3479349186483104, - "grad_norm": 4.248615264892578, - "learning_rate": 4.3437500000000006e-05, - "loss": 0.9521622657775879, - "step": 139, - "token_acc": 0.7330997794213053 - }, - { - "epoch": 0.3504380475594493, - "grad_norm": 4.988142013549805, - "learning_rate": 4.375e-05, - "loss": 0.893964409828186, - "step": 140, - "token_acc": 0.7476815787521329 - }, - { - "epoch": 0.35294117647058826, - "grad_norm": 3.864096164703369, - "learning_rate": 4.40625e-05, - "loss": 0.8878812789916992, - "step": 141, - "token_acc": 0.7459516298633018 - }, - { - "epoch": 0.35544430538172717, - "grad_norm": 4.250646591186523, - "learning_rate": 4.4375e-05, - "loss": 1.029758334159851, - "step": 142, - "token_acc": 0.7136325267304445 - }, - { - "epoch": 0.3579474342928661, - "grad_norm": 4.437873363494873, - "learning_rate": 4.46875e-05, - "loss": 0.8827238082885742, - "step": 143, - "token_acc": 0.7566478021552059 - }, - { - "epoch": 0.360450563204005, - "grad_norm": 2.903998613357544, - "learning_rate": 4.5e-05, - "loss": 0.9520173072814941, - "step": 144, - "token_acc": 0.731939568039153 - }, - { - "epoch": 0.36295369211514394, - "grad_norm": 4.129173755645752, - "learning_rate": 4.5312500000000004e-05, - "loss": 0.9319078922271729, - "step": 145, - "token_acc": 0.7331720330045288 - }, - { - "epoch": 0.36545682102628285, - "grad_norm": 6.249156951904297, - "learning_rate": 4.5625e-05, - "loss": 0.9192413091659546, - "step": 146, - "token_acc": 0.7346352365242378 - }, - { - "epoch": 0.36795994993742176, - "grad_norm": 2.8188090324401855, - "learning_rate": 4.59375e-05, - "loss": 0.8454147577285767, - "step": 147, - "token_acc": 0.7561653860226857 - }, - { - "epoch": 0.3704630788485607, - "grad_norm": 20.902667999267578, - "learning_rate": 4.6250000000000006e-05, - "loss": 0.9139873385429382, - "step": 148, - "token_acc": 0.7434644957033016 - }, - { - "epoch": 0.37296620775969963, - "grad_norm": 3.022164821624756, - "learning_rate": 4.65625e-05, - "loss": 1.0368843078613281, - "step": 149, - "token_acc": 0.7042305221620629 - }, - { - "epoch": 0.37546933667083854, - "grad_norm": 2.9987237453460693, - "learning_rate": 4.6875e-05, - "loss": 0.9745063185691833, - "step": 150, - "token_acc": 0.7196575970651177 - }, - { - "epoch": 0.37797246558197745, - "grad_norm": 2.3661983013153076, - "learning_rate": 4.71875e-05, - "loss": 1.0234860181808472, - "step": 151, - "token_acc": 0.7121767059221277 - }, - { - "epoch": 0.3804755944931164, - "grad_norm": 2.627258777618408, - "learning_rate": 4.75e-05, - "loss": 0.8604807257652283, - "step": 152, - "token_acc": 0.7513602865211103 - }, - { - "epoch": 0.3829787234042553, - "grad_norm": 2.5150792598724365, - "learning_rate": 4.7812500000000003e-05, - "loss": 1.01763916015625, - "step": 153, - "token_acc": 0.7111102210829863 - }, - { - "epoch": 0.3854818523153942, - "grad_norm": 55.79320526123047, - "learning_rate": 4.8125000000000004e-05, - "loss": 0.8841659426689148, - "step": 154, - "token_acc": 0.7480198788631776 - }, - { - "epoch": 0.3879849812265332, - "grad_norm": 3.121655225753784, - "learning_rate": 4.8437500000000005e-05, - "loss": 0.9884188175201416, - "step": 155, - "token_acc": 0.7213071620270484 - }, - { - "epoch": 0.3904881101376721, - "grad_norm": 2.309528112411499, - "learning_rate": 4.875e-05, - "loss": 0.8871731758117676, - "step": 156, - "token_acc": 0.7475174151474729 - }, - { - "epoch": 0.392991239048811, - "grad_norm": 1.564784049987793, - "learning_rate": 4.90625e-05, - "loss": 0.9550650119781494, - "step": 157, - "token_acc": 0.7262110500130924 - }, - { - "epoch": 0.3954943679599499, - "grad_norm": 4.770287036895752, - "learning_rate": 4.937500000000001e-05, - "loss": 0.8485426902770996, - "step": 158, - "token_acc": 0.755221214619401 - }, - { - "epoch": 0.3979974968710889, - "grad_norm": 2.7487730979919434, - "learning_rate": 4.96875e-05, - "loss": 0.8821752667427063, - "step": 159, - "token_acc": 0.7515657620041754 - }, - { - "epoch": 0.4005006257822278, - "grad_norm": 1.9737449884414673, - "learning_rate": 5e-05, - "loss": 0.9395763874053955, - "step": 160, - "token_acc": 0.7279748441551277 - }, - { - "epoch": 0.4030037546933667, - "grad_norm": 4.472081184387207, - "learning_rate": 4.9999698804181425e-05, - "loss": 0.8686919808387756, - "step": 161, - "token_acc": 0.7603603603603604 - }, - { - "epoch": 0.40550688360450565, - "grad_norm": 3.6379482746124268, - "learning_rate": 4.9998795223983205e-05, - "loss": 0.8725775480270386, - "step": 162, - "token_acc": 0.7472160356347439 - }, - { - "epoch": 0.40801001251564456, - "grad_norm": 3.493037700653076, - "learning_rate": 4.99972892811777e-05, - "loss": 0.847150981426239, - "step": 163, - "token_acc": 0.7538943188759927 - }, - { - "epoch": 0.41051314142678347, - "grad_norm": 1.912611722946167, - "learning_rate": 4.9995181012051625e-05, - "loss": 0.9739137887954712, - "step": 164, - "token_acc": 0.7212982399483288 - }, - { - "epoch": 0.4130162703379224, - "grad_norm": 11.750629425048828, - "learning_rate": 4.9992470467405104e-05, - "loss": 0.926494300365448, - "step": 165, - "token_acc": 0.7324805645917186 - }, - { - "epoch": 0.41551939924906134, - "grad_norm": 1.79902982711792, - "learning_rate": 4.998915771255053e-05, - "loss": 0.9524897336959839, - "step": 166, - "token_acc": 0.7259630302761647 - }, - { - "epoch": 0.41802252816020025, - "grad_norm": 1.653032660484314, - "learning_rate": 4.9985242827310936e-05, - "loss": 0.8616597652435303, - "step": 167, - "token_acc": 0.7509121709669012 - }, - { - "epoch": 0.42052565707133915, - "grad_norm": 3.853633165359497, - "learning_rate": 4.9980725906018074e-05, - "loss": 0.9457658529281616, - "step": 168, - "token_acc": 0.7262784810126582 - }, - { - "epoch": 0.4230287859824781, - "grad_norm": 2.9848127365112305, - "learning_rate": 4.9975607057510185e-05, - "loss": 0.7890052795410156, - "step": 169, - "token_acc": 0.7754066818261326 - }, - { - "epoch": 0.425531914893617, - "grad_norm": 5.078474521636963, - "learning_rate": 4.996988640512931e-05, - "loss": 0.8364709615707397, - "step": 170, - "token_acc": 0.764642082429501 - }, - { - "epoch": 0.42803504380475593, - "grad_norm": 2.06341814994812, - "learning_rate": 4.99635640867184e-05, - "loss": 0.8439483642578125, - "step": 171, - "token_acc": 0.7607762475406904 - }, - { - "epoch": 0.4305381727158949, - "grad_norm": 2.261368989944458, - "learning_rate": 4.9956640254617906e-05, - "loss": 0.8153511881828308, - "step": 172, - "token_acc": 0.7593304295840806 - }, - { - "epoch": 0.4330413016270338, - "grad_norm": 2.942291736602783, - "learning_rate": 4.994911507566217e-05, - "loss": 0.950925886631012, - "step": 173, - "token_acc": 0.7278411003703169 - }, - { - "epoch": 0.4355444305381727, - "grad_norm": 1.5425530672073364, - "learning_rate": 4.99409887311754e-05, - "loss": 0.9062566161155701, - "step": 174, - "token_acc": 0.7486025191920698 - }, - { - "epoch": 0.4380475594493116, - "grad_norm": 2.6939258575439453, - "learning_rate": 4.993226141696726e-05, - "loss": 0.8227016925811768, - "step": 175, - "token_acc": 0.7661045274992404 - }, - { - "epoch": 0.4405506883604506, - "grad_norm": 5.915945529937744, - "learning_rate": 4.99229333433282e-05, - "loss": 0.9167571067810059, - "step": 176, - "token_acc": 0.7367290406467296 - }, - { - "epoch": 0.4430538172715895, - "grad_norm": 1.6880910396575928, - "learning_rate": 4.991300473502437e-05, - "loss": 0.8607068657875061, - "step": 177, - "token_acc": 0.7547773184618984 - }, - { - "epoch": 0.4455569461827284, - "grad_norm": 1.5918737649917603, - "learning_rate": 4.9902475831292185e-05, - "loss": 1.0075507164001465, - "step": 178, - "token_acc": 0.7130909563634787 - }, - { - "epoch": 0.44806007509386736, - "grad_norm": 5.924171447753906, - "learning_rate": 4.9891346885832586e-05, - "loss": 0.8469476103782654, - "step": 179, - "token_acc": 0.7637781477262771 - }, - { - "epoch": 0.45056320400500627, - "grad_norm": 1.8689627647399902, - "learning_rate": 4.987961816680492e-05, - "loss": 0.9136925935745239, - "step": 180, - "token_acc": 0.7422716834481541 - }, - { - "epoch": 0.4530663329161452, - "grad_norm": 3.0246078968048096, - "learning_rate": 4.986728995682049e-05, - "loss": 0.809701681137085, - "step": 181, - "token_acc": 0.7672480620155039 - }, - { - "epoch": 0.4555694618272841, - "grad_norm": 1.0998661518096924, - "learning_rate": 4.9854362552935706e-05, - "loss": 0.9456962943077087, - "step": 182, - "token_acc": 0.7302064153503246 - }, - { - "epoch": 0.45807259073842305, - "grad_norm": 1.7873152494430542, - "learning_rate": 4.984083626664497e-05, - "loss": 0.9543384909629822, - "step": 183, - "token_acc": 0.7306896908282494 - }, - { - "epoch": 0.46057571964956195, - "grad_norm": 1.8325738906860352, - "learning_rate": 4.982671142387316e-05, - "loss": 0.9392420649528503, - "step": 184, - "token_acc": 0.73054827887311 - }, - { - "epoch": 0.46307884856070086, - "grad_norm": 2.0283353328704834, - "learning_rate": 4.981198836496775e-05, - "loss": 0.8523749709129333, - "step": 185, - "token_acc": 0.7518976665729548 - }, - { - "epoch": 0.4655819774718398, - "grad_norm": 1.8880774974822998, - "learning_rate": 4.979666744469065e-05, - "loss": 1.0026400089263916, - "step": 186, - "token_acc": 0.7179426739581369 - }, - { - "epoch": 0.46808510638297873, - "grad_norm": 1.5821034908294678, - "learning_rate": 4.978074903220963e-05, - "loss": 0.8702259659767151, - "step": 187, - "token_acc": 0.7518054532056005 - }, - { - "epoch": 0.47058823529411764, - "grad_norm": 1.3895519971847534, - "learning_rate": 4.976423351108943e-05, - "loss": 0.9819506406784058, - "step": 188, - "token_acc": 0.7262579281183932 - }, - { - "epoch": 0.47309136420525655, - "grad_norm": 2.175621509552002, - "learning_rate": 4.9747121279282525e-05, - "loss": 0.8391700983047485, - "step": 189, - "token_acc": 0.7537929574483099 - }, - { - "epoch": 0.4755944931163955, - "grad_norm": 1.7478188276290894, - "learning_rate": 4.972941274911953e-05, - "loss": 0.8495551347732544, - "step": 190, - "token_acc": 0.7538736959071548 - }, - { - "epoch": 0.4780976220275344, - "grad_norm": 2.7944796085357666, - "learning_rate": 4.971110834729925e-05, - "loss": 0.8685894012451172, - "step": 191, - "token_acc": 0.7504071889918562 - }, - { - "epoch": 0.4806007509386733, - "grad_norm": 11.889168739318848, - "learning_rate": 4.9692208514878444e-05, - "loss": 0.8083388209342957, - "step": 192, - "token_acc": 0.7642701875855407 - }, - { - "epoch": 0.4831038798498123, - "grad_norm": 13.814888954162598, - "learning_rate": 4.9672713707261146e-05, - "loss": 0.8238387703895569, - "step": 193, - "token_acc": 0.7610306169278175 - }, - { - "epoch": 0.4856070087609512, - "grad_norm": 1.4705616235733032, - "learning_rate": 4.965262439418772e-05, - "loss": 0.9381322860717773, - "step": 194, - "token_acc": 0.7296181077022098 - }, - { - "epoch": 0.4881101376720901, - "grad_norm": 2.106172800064087, - "learning_rate": 4.963194105972353e-05, - "loss": 0.781527042388916, - "step": 195, - "token_acc": 0.7668615663345137 - }, - { - "epoch": 0.490613266583229, - "grad_norm": 1.4520384073257446, - "learning_rate": 4.9610664202247294e-05, - "loss": 0.8901837468147278, - "step": 196, - "token_acc": 0.7357566856373539 - }, - { - "epoch": 0.493116395494368, - "grad_norm": 92.66796112060547, - "learning_rate": 4.958879433443904e-05, - "loss": 0.8004983067512512, - "step": 197, - "token_acc": 0.7666008205439903 - }, - { - "epoch": 0.4956195244055069, - "grad_norm": 3.9278409481048584, - "learning_rate": 4.95663319832678e-05, - "loss": 0.9934076070785522, - "step": 198, - "token_acc": 0.7185084923372484 - }, - { - "epoch": 0.4981226533166458, - "grad_norm": 1.615594506263733, - "learning_rate": 4.954327768997886e-05, - "loss": 0.8867624998092651, - "step": 199, - "token_acc": 0.7388085147839641 - }, - { - "epoch": 0.5006257822277848, - "grad_norm": 2.8862221240997314, - "learning_rate": 4.951963201008076e-05, - "loss": 0.8318412899971008, - "step": 200, - "token_acc": 0.7566619330047615 - }, - { - "epoch": 0.5031289111389237, - "grad_norm": 1.856955885887146, - "learning_rate": 4.949539551333191e-05, - "loss": 0.8780606389045715, - "step": 201, - "token_acc": 0.7452740722007967 - }, - { - "epoch": 0.5056320400500626, - "grad_norm": 1.9028009176254272, - "learning_rate": 4.947056878372681e-05, - "loss": 0.7615805864334106, - "step": 202, - "token_acc": 0.7806040051679587 - }, - { - "epoch": 0.5081351689612015, - "grad_norm": 1.9965895414352417, - "learning_rate": 4.944515241948204e-05, - "loss": 0.8922481536865234, - "step": 203, - "token_acc": 0.7439118174826967 - }, - { - "epoch": 0.5106382978723404, - "grad_norm": 2.4679484367370605, - "learning_rate": 4.9419147033021814e-05, - "loss": 0.9746915102005005, - "step": 204, - "token_acc": 0.7225560081466396 - }, - { - "epoch": 0.5131414267834794, - "grad_norm": 2.7257940769195557, - "learning_rate": 4.9392553250963215e-05, - "loss": 0.802959144115448, - "step": 205, - "token_acc": 0.7686112156567557 - }, - { - "epoch": 0.5156445556946183, - "grad_norm": 3.264042377471924, - "learning_rate": 4.936537171410113e-05, - "loss": 0.9509553909301758, - "step": 206, - "token_acc": 0.7261368386827071 - }, - { - "epoch": 0.5181476846057572, - "grad_norm": 3.4267592430114746, - "learning_rate": 4.933760307739277e-05, - "loss": 0.8793500661849976, - "step": 207, - "token_acc": 0.7480100363384669 - }, - { - "epoch": 0.5206508135168961, - "grad_norm": 4.144317626953125, - "learning_rate": 4.9309248009941914e-05, - "loss": 0.7871251106262207, - "step": 208, - "token_acc": 0.7663051337671728 - }, - { - "epoch": 0.523153942428035, - "grad_norm": 11.039412498474121, - "learning_rate": 4.92803071949828e-05, - "loss": 0.9288915395736694, - "step": 209, - "token_acc": 0.7273755047106326 - }, - { - "epoch": 0.5256570713391739, - "grad_norm": 1.3589577674865723, - "learning_rate": 4.9250781329863606e-05, - "loss": 0.9469587802886963, - "step": 210, - "token_acc": 0.7330181502010651 - }, - { - "epoch": 0.5281602002503129, - "grad_norm": 24.967679977416992, - "learning_rate": 4.92206711260297e-05, - "loss": 0.922472357749939, - "step": 211, - "token_acc": 0.7295061829497994 - }, - { - "epoch": 0.5306633291614519, - "grad_norm": 5.612998008728027, - "learning_rate": 4.9189977309006495e-05, - "loss": 0.9386663436889648, - "step": 212, - "token_acc": 0.729034504100263 - }, - { - "epoch": 0.5331664580725908, - "grad_norm": 2.4214696884155273, - "learning_rate": 4.915870061838193e-05, - "loss": 0.8876584768295288, - "step": 213, - "token_acc": 0.7409878277153558 - }, - { - "epoch": 0.5356695869837297, - "grad_norm": 2.5469002723693848, - "learning_rate": 4.912684180778869e-05, - "loss": 0.8577581644058228, - "step": 214, - "token_acc": 0.7466870540265036 - }, - { - "epoch": 0.5381727158948686, - "grad_norm": 1.8884869813919067, - "learning_rate": 4.9094401644886e-05, - "loss": 0.9847173690795898, - "step": 215, - "token_acc": 0.7160602660682802 - }, - { - "epoch": 0.5406758448060075, - "grad_norm": 1.4721566438674927, - "learning_rate": 4.906138091134118e-05, - "loss": 0.9311186671257019, - "step": 216, - "token_acc": 0.7331803944059646 - }, - { - "epoch": 0.5431789737171464, - "grad_norm": 3.0583348274230957, - "learning_rate": 4.90277804028108e-05, - "loss": 0.7272347807884216, - "step": 217, - "token_acc": 0.7930695985079023 - }, - { - "epoch": 0.5456821026282853, - "grad_norm": 2.5264322757720947, - "learning_rate": 4.8993600928921434e-05, - "loss": 0.861505389213562, - "step": 218, - "token_acc": 0.7481168230474429 - }, - { - "epoch": 0.5481852315394243, - "grad_norm": 1.6603262424468994, - "learning_rate": 4.8958843313250294e-05, - "loss": 0.7447217106819153, - "step": 219, - "token_acc": 0.7862431800467654 - }, - { - "epoch": 0.5506883604505632, - "grad_norm": 1.4868695735931396, - "learning_rate": 4.892350839330522e-05, - "loss": 0.8898584842681885, - "step": 220, - "token_acc": 0.740379366812227 - }, - { - "epoch": 0.5531914893617021, - "grad_norm": 2.699589729309082, - "learning_rate": 4.888759702050466e-05, - "loss": 0.8423305749893188, - "step": 221, - "token_acc": 0.7540192926045016 - }, - { - "epoch": 0.5556946182728411, - "grad_norm": 2.180371046066284, - "learning_rate": 4.885111006015701e-05, - "loss": 0.8793195486068726, - "step": 222, - "token_acc": 0.7477990405398282 - }, - { - "epoch": 0.55819774718398, - "grad_norm": 2.203009605407715, - "learning_rate": 4.881404839143988e-05, - "loss": 0.8497090935707092, - "step": 223, - "token_acc": 0.7462110960757781 - }, - { - "epoch": 0.5607008760951189, - "grad_norm": 1.6231415271759033, - "learning_rate": 4.877641290737884e-05, - "loss": 0.8052700757980347, - "step": 224, - "token_acc": 0.7610808422912678 - }, - { - "epoch": 0.5632040050062578, - "grad_norm": 2.361985445022583, - "learning_rate": 4.873820451482592e-05, - "loss": 0.8841230869293213, - "step": 225, - "token_acc": 0.7496264419341342 - }, - { - "epoch": 0.5657071339173968, - "grad_norm": 3.28450870513916, - "learning_rate": 4.8699424134437765e-05, - "loss": 0.8853447437286377, - "step": 226, - "token_acc": 0.742984257357974 - }, - { - "epoch": 0.5682102628285357, - "grad_norm": 1.5169377326965332, - "learning_rate": 4.8660072700653445e-05, - "loss": 0.8390404582023621, - "step": 227, - "token_acc": 0.7602164582944579 - }, - { - "epoch": 0.5707133917396746, - "grad_norm": 1.017259120941162, - "learning_rate": 4.862015116167196e-05, - "loss": 0.8904134035110474, - "step": 228, - "token_acc": 0.7438553022794846 - }, - { - "epoch": 0.5732165206508135, - "grad_norm": 2.0630033016204834, - "learning_rate": 4.857966047942933e-05, - "loss": 0.8353220820426941, - "step": 229, - "token_acc": 0.7571183288024038 - }, - { - "epoch": 0.5757196495619524, - "grad_norm": 1.721699833869934, - "learning_rate": 4.853860162957552e-05, - "loss": 0.8920808434486389, - "step": 230, - "token_acc": 0.7390824422214557 - }, - { - "epoch": 0.5782227784730913, - "grad_norm": 2.038731575012207, - "learning_rate": 4.849697560145083e-05, - "loss": 0.6845712065696716, - "step": 231, - "token_acc": 0.8008808955771701 - }, - { - "epoch": 0.5807259073842302, - "grad_norm": 2.1230990886688232, - "learning_rate": 4.8454783398062106e-05, - "loss": 0.8267085552215576, - "step": 232, - "token_acc": 0.7581519720716037 - }, - { - "epoch": 0.5832290362953693, - "grad_norm": 3.591655969619751, - "learning_rate": 4.8412026036058566e-05, - "loss": 0.8310796022415161, - "step": 233, - "token_acc": 0.7544153744836257 - }, - { - "epoch": 0.5857321652065082, - "grad_norm": 36.25672149658203, - "learning_rate": 4.836870454570731e-05, - "loss": 0.8032848238945007, - "step": 234, - "token_acc": 0.7607001230685081 - }, - { - "epoch": 0.5882352941176471, - "grad_norm": 1.4401963949203491, - "learning_rate": 4.8324819970868473e-05, - "loss": 0.8128241896629333, - "step": 235, - "token_acc": 0.757310740639519 - }, - { - "epoch": 0.590738423028786, - "grad_norm": 10.958834648132324, - "learning_rate": 4.828037336897009e-05, - "loss": 0.8540234565734863, - "step": 236, - "token_acc": 0.74524380963531 - }, - { - "epoch": 0.5932415519399249, - "grad_norm": 3.50199556350708, - "learning_rate": 4.8235365810982615e-05, - "loss": 0.9761826992034912, - "step": 237, - "token_acc": 0.7167197154090994 - }, - { - "epoch": 0.5957446808510638, - "grad_norm": 3.497457504272461, - "learning_rate": 4.8189798381393104e-05, - "loss": 0.7976563572883606, - "step": 238, - "token_acc": 0.7626602564102564 - }, - { - "epoch": 0.5982478097622027, - "grad_norm": 3.2434616088867188, - "learning_rate": 4.81436721781791e-05, - "loss": 0.8806981444358826, - "step": 239, - "token_acc": 0.7481954469739034 - }, - { - "epoch": 0.6007509386733417, - "grad_norm": 3.4984254837036133, - "learning_rate": 4.8096988312782174e-05, - "loss": 0.8493468761444092, - "step": 240, - "token_acc": 0.7490117506904207 - }, - { - "epoch": 0.6032540675844806, - "grad_norm": 1.4711133241653442, - "learning_rate": 4.8049747910081117e-05, - "loss": 0.6916333436965942, - "step": 241, - "token_acc": 0.794162491831845 - }, - { - "epoch": 0.6057571964956195, - "grad_norm": 1.8549391031265259, - "learning_rate": 4.8001952108364876e-05, - "loss": 0.9032708406448364, - "step": 242, - "token_acc": 0.7342644900137895 - }, - { - "epoch": 0.6082603254067585, - "grad_norm": 1.721065878868103, - "learning_rate": 4.79536020593051e-05, - "loss": 0.9230173826217651, - "step": 243, - "token_acc": 0.7311291328758578 - }, - { - "epoch": 0.6107634543178974, - "grad_norm": 2.2300896644592285, - "learning_rate": 4.7904698927928406e-05, - "loss": 0.8387856483459473, - "step": 244, - "token_acc": 0.7520661157024794 - }, - { - "epoch": 0.6132665832290363, - "grad_norm": 1.5376681089401245, - "learning_rate": 4.785524389258827e-05, - "loss": 0.9396567344665527, - "step": 245, - "token_acc": 0.7290214555507963 - }, - { - "epoch": 0.6157697121401752, - "grad_norm": 3.0389626026153564, - "learning_rate": 4.7805238144936694e-05, - "loss": 0.8885030150413513, - "step": 246, - "token_acc": 0.7354931107709023 - }, - { - "epoch": 0.6182728410513142, - "grad_norm": 4.214961051940918, - "learning_rate": 4.7754682889895446e-05, - "loss": 0.7742225527763367, - "step": 247, - "token_acc": 0.7741118966570656 - }, - { - "epoch": 0.6207759699624531, - "grad_norm": 1.702107310295105, - "learning_rate": 4.7703579345627035e-05, - "loss": 0.8894025683403015, - "step": 248, - "token_acc": 0.7381677396902732 - }, - { - "epoch": 0.623279098873592, - "grad_norm": 1.6989673376083374, - "learning_rate": 4.765192874350537e-05, - "loss": 0.9064431190490723, - "step": 249, - "token_acc": 0.7365355965870616 - }, - { - "epoch": 0.6257822277847309, - "grad_norm": 1.8439379930496216, - "learning_rate": 4.759973232808609e-05, - "loss": 0.744268536567688, - "step": 250, - "token_acc": 0.7793768780642101 - }, - { - "epoch": 0.6282853566958698, - "grad_norm": 4.3568434715271, - "learning_rate": 4.7546991357076544e-05, - "loss": 0.8421927690505981, - "step": 251, - "token_acc": 0.7551911730901847 - }, - { - "epoch": 0.6307884856070087, - "grad_norm": 1.580527663230896, - "learning_rate": 4.749370710130554e-05, - "loss": 0.8805860280990601, - "step": 252, - "token_acc": 0.7404246461282264 - }, - { - "epoch": 0.6332916145181476, - "grad_norm": 5.8950724601745605, - "learning_rate": 4.7439880844692675e-05, - "loss": 0.8358674049377441, - "step": 253, - "token_acc": 0.753058660141525 - }, - { - "epoch": 0.6357947434292867, - "grad_norm": 2.4937312602996826, - "learning_rate": 4.738551388421743e-05, - "loss": 0.7486670017242432, - "step": 254, - "token_acc": 0.7726565697912403 - }, - { - "epoch": 0.6382978723404256, - "grad_norm": 2.2410449981689453, - "learning_rate": 4.7330607529887884e-05, - "loss": 0.7166397571563721, - "step": 255, - "token_acc": 0.787853730246233 - }, - { - "epoch": 0.6408010012515645, - "grad_norm": 0.9600523114204407, - "learning_rate": 4.72751631047092e-05, - "loss": 0.817680835723877, - "step": 256, - "token_acc": 0.7578717967986773 - }, - { - "epoch": 0.6433041301627034, - "grad_norm": 1.6403498649597168, - "learning_rate": 4.721918194465169e-05, - "loss": 0.7929844260215759, - "step": 257, - "token_acc": 0.7647058823529411 - }, - { - "epoch": 0.6458072590738423, - "grad_norm": 2.6843879222869873, - "learning_rate": 4.7162665398618664e-05, - "loss": 0.7781978249549866, - "step": 258, - "token_acc": 0.7685840012572686 - }, - { - "epoch": 0.6483103879849812, - "grad_norm": 1.1330469846725464, - "learning_rate": 4.7105614828413906e-05, - "loss": 0.828113317489624, - "step": 259, - "token_acc": 0.7519813233396817 - }, - { - "epoch": 0.6508135168961201, - "grad_norm": 1.6353662014007568, - "learning_rate": 4.7048031608708876e-05, - "loss": 0.8706427812576294, - "step": 260, - "token_acc": 0.7472778599274096 - }, - { - "epoch": 0.6533166458072591, - "grad_norm": 1.700364112854004, - "learning_rate": 4.698991712700958e-05, - "loss": 0.9167036414146423, - "step": 261, - "token_acc": 0.7337103615431226 - }, - { - "epoch": 0.655819774718398, - "grad_norm": 4.744112968444824, - "learning_rate": 4.693127278362311e-05, - "loss": 0.7307888269424438, - "step": 262, - "token_acc": 0.7857924493890206 - }, - { - "epoch": 0.6583229036295369, - "grad_norm": 2.0567502975463867, - "learning_rate": 4.687209999162396e-05, - "loss": 0.9097830057144165, - "step": 263, - "token_acc": 0.7335190343546889 - }, - { - "epoch": 0.6608260325406758, - "grad_norm": 1.584566593170166, - "learning_rate": 4.681240017681993e-05, - "loss": 0.9686288833618164, - "step": 264, - "token_acc": 0.7200644430897849 - }, - { - "epoch": 0.6633291614518148, - "grad_norm": 3.126399278640747, - "learning_rate": 4.6752174777717786e-05, - "loss": 0.8048110604286194, - "step": 265, - "token_acc": 0.7667047401484866 - }, - { - "epoch": 0.6658322903629537, - "grad_norm": 3.089082717895508, - "learning_rate": 4.6691425245488607e-05, - "loss": 0.8348573446273804, - "step": 266, - "token_acc": 0.7527571811327809 - }, - { - "epoch": 0.6683354192740926, - "grad_norm": 0.9253506660461426, - "learning_rate": 4.6630153043932784e-05, - "loss": 0.9513870477676392, - "step": 267, - "token_acc": 0.730309423347398 - }, - { - "epoch": 0.6708385481852316, - "grad_norm": 1.5841699838638306, - "learning_rate": 4.65683596494448e-05, - "loss": 0.8438987731933594, - "step": 268, - "token_acc": 0.7552549276311005 - }, - { - "epoch": 0.6733416770963705, - "grad_norm": 1.369858980178833, - "learning_rate": 4.650604655097761e-05, - "loss": 0.8666725158691406, - "step": 269, - "token_acc": 0.7492324010495172 - }, - { - "epoch": 0.6758448060075094, - "grad_norm": 2.27767276763916, - "learning_rate": 4.6443215250006806e-05, - "loss": 0.8292583227157593, - "step": 270, - "token_acc": 0.7594427689214419 - }, - { - "epoch": 0.6783479349186483, - "grad_norm": 1.3438291549682617, - "learning_rate": 4.637986726049438e-05, - "loss": 0.7024565935134888, - "step": 271, - "token_acc": 0.78654883163571 - }, - { - "epoch": 0.6808510638297872, - "grad_norm": 2.168410301208496, - "learning_rate": 4.6316004108852305e-05, - "loss": 0.8539745807647705, - "step": 272, - "token_acc": 0.7467631908673257 - }, - { - "epoch": 0.6833541927409261, - "grad_norm": 2.0540430545806885, - "learning_rate": 4.6251627333905724e-05, - "loss": 0.8134692907333374, - "step": 273, - "token_acc": 0.7603259342511941 - }, - { - "epoch": 0.685857321652065, - "grad_norm": 7.12939977645874, - "learning_rate": 4.618673848685586e-05, - "loss": 0.7887545824050903, - "step": 274, - "token_acc": 0.7652179873868933 - }, - { - "epoch": 0.688360450563204, - "grad_norm": 2.2455780506134033, - "learning_rate": 4.612133913124268e-05, - "loss": 0.7140970230102539, - "step": 275, - "token_acc": 0.7912922649374711 - }, - { - "epoch": 0.690863579474343, - "grad_norm": 2.3021907806396484, - "learning_rate": 4.6055430842907167e-05, - "loss": 0.8248931169509888, - "step": 276, - "token_acc": 0.756960692559663 - }, - { - "epoch": 0.6933667083854819, - "grad_norm": 1.2665908336639404, - "learning_rate": 4.59890152099534e-05, - "loss": 0.9142659306526184, - "step": 277, - "token_acc": 0.731113628887833 - }, - { - "epoch": 0.6958698372966208, - "grad_norm": 1.3562812805175781, - "learning_rate": 4.5922093832710236e-05, - "loss": 0.8612058162689209, - "step": 278, - "token_acc": 0.7461015816440187 - }, - { - "epoch": 0.6983729662077597, - "grad_norm": 1.548026204109192, - "learning_rate": 4.585466832369281e-05, - "loss": 0.7588024139404297, - "step": 279, - "token_acc": 0.7776190118071745 - }, - { - "epoch": 0.7008760951188986, - "grad_norm": 4.4971442222595215, - "learning_rate": 4.5786740307563636e-05, - "loss": 0.7747074365615845, - "step": 280, - "token_acc": 0.7710498712691904 - }, - { - "epoch": 0.7033792240300375, - "grad_norm": 2.4977355003356934, - "learning_rate": 4.5718311421093454e-05, - "loss": 0.928239107131958, - "step": 281, - "token_acc": 0.7275659486234305 - }, - { - "epoch": 0.7058823529411765, - "grad_norm": 1.2182586193084717, - "learning_rate": 4.5649383313121827e-05, - "loss": 0.856454074382782, - "step": 282, - "token_acc": 0.7467900865930128 - }, - { - "epoch": 0.7083854818523154, - "grad_norm": 5.53813362121582, - "learning_rate": 4.55799576445174e-05, - "loss": 0.8874952793121338, - "step": 283, - "token_acc": 0.7408339529828977 - }, - { - "epoch": 0.7108886107634543, - "grad_norm": 1.754224181175232, - "learning_rate": 4.551003608813784e-05, - "loss": 0.7295838594436646, - "step": 284, - "token_acc": 0.7820602120578902 - }, - { - "epoch": 0.7133917396745932, - "grad_norm": 1.7745537757873535, - "learning_rate": 4.5439620328789593e-05, - "loss": 0.7359857559204102, - "step": 285, - "token_acc": 0.7874957869902258 - }, - { - "epoch": 0.7158948685857321, - "grad_norm": 1.9047404527664185, - "learning_rate": 4.536871206318723e-05, - "loss": 0.7301020622253418, - "step": 286, - "token_acc": 0.780550320392009 - }, - { - "epoch": 0.718397997496871, - "grad_norm": 2.520000696182251, - "learning_rate": 4.529731299991262e-05, - "loss": 0.9152336120605469, - "step": 287, - "token_acc": 0.7370678450740837 - }, - { - "epoch": 0.72090112640801, - "grad_norm": 1.596307635307312, - "learning_rate": 4.522542485937369e-05, - "loss": 0.8424668908119202, - "step": 288, - "token_acc": 0.7530345471521942 - }, - { - "epoch": 0.723404255319149, - "grad_norm": 1.1966215372085571, - "learning_rate": 4.5153049373763026e-05, - "loss": 0.9505821466445923, - "step": 289, - "token_acc": 0.7279186335101465 - }, - { - "epoch": 0.7259073842302879, - "grad_norm": 1.554336428642273, - "learning_rate": 4.508018828701612e-05, - "loss": 0.8248058557510376, - "step": 290, - "token_acc": 0.7543579671004174 - }, - { - "epoch": 0.7284105131414268, - "grad_norm": 1.557536005973816, - "learning_rate": 4.500684335476936e-05, - "loss": 0.8745982646942139, - "step": 291, - "token_acc": 0.7485994397759104 - }, - { - "epoch": 0.7309136420525657, - "grad_norm": 1.5448335409164429, - "learning_rate": 4.493301634431768e-05, - "loss": 0.9151402711868286, - "step": 292, - "token_acc": 0.7357596764875795 - }, - { - "epoch": 0.7334167709637046, - "grad_norm": 1.980355143547058, - "learning_rate": 4.485870903457204e-05, - "loss": 0.8075742125511169, - "step": 293, - "token_acc": 0.7581687393318702 - }, - { - "epoch": 0.7359198998748435, - "grad_norm": 5.846746921539307, - "learning_rate": 4.478392321601651e-05, - "loss": 0.8880358934402466, - "step": 294, - "token_acc": 0.7426012638087012 - }, - { - "epoch": 0.7384230287859824, - "grad_norm": 1.4618793725967407, - "learning_rate": 4.470866069066516e-05, - "loss": 0.7289685606956482, - "step": 295, - "token_acc": 0.7879294491348324 - }, - { - "epoch": 0.7409261576971214, - "grad_norm": 2.9660937786102295, - "learning_rate": 4.463292327201862e-05, - "loss": 0.7348141074180603, - "step": 296, - "token_acc": 0.7806614266646893 - }, - { - "epoch": 0.7434292866082604, - "grad_norm": 1.2741750478744507, - "learning_rate": 4.455671278502042e-05, - "loss": 0.8414113521575928, - "step": 297, - "token_acc": 0.75607294260144 - }, - { - "epoch": 0.7459324155193993, - "grad_norm": 3.9552199840545654, - "learning_rate": 4.4480031066012916e-05, - "loss": 0.7518953084945679, - "step": 298, - "token_acc": 0.773398631840796 - }, - { - "epoch": 0.7484355444305382, - "grad_norm": 2.206568479537964, - "learning_rate": 4.44028799626932e-05, - "loss": 0.8302481174468994, - "step": 299, - "token_acc": 0.7567450226384668 - }, - { - "epoch": 0.7509386733416771, - "grad_norm": 3.6707959175109863, - "learning_rate": 4.4325261334068426e-05, - "loss": 0.8474286794662476, - "step": 300, - "token_acc": 0.7506851460339833 - }, - { - "epoch": 0.753441802252816, - "grad_norm": 2.34222149848938, - "learning_rate": 4.4247177050411114e-05, - "loss": 0.9115549325942993, - "step": 301, - "token_acc": 0.7319790002282583 - }, - { - "epoch": 0.7559449311639549, - "grad_norm": 6.066429615020752, - "learning_rate": 4.416862899321404e-05, - "loss": 0.8453834056854248, - "step": 302, - "token_acc": 0.7548794844785922 - }, - { - "epoch": 0.7584480600750939, - "grad_norm": 1.178998589515686, - "learning_rate": 4.408961905514491e-05, - "loss": 0.8790225386619568, - "step": 303, - "token_acc": 0.7391522587841606 - }, - { - "epoch": 0.7609511889862328, - "grad_norm": 1.5657821893692017, - "learning_rate": 4.401014914000078e-05, - "loss": 0.7956516146659851, - "step": 304, - "token_acc": 0.765209244222361 - }, - { - "epoch": 0.7634543178973717, - "grad_norm": 2.5777835845947266, - "learning_rate": 4.393022116266212e-05, - "loss": 0.8482795357704163, - "step": 305, - "token_acc": 0.7480234343893977 - }, - { - "epoch": 0.7659574468085106, - "grad_norm": 4.338641166687012, - "learning_rate": 4.384983704904674e-05, - "loss": 0.7993297576904297, - "step": 306, - "token_acc": 0.7676097675510684 - }, - { - "epoch": 0.7684605757196495, - "grad_norm": 1.3926159143447876, - "learning_rate": 4.376899873606336e-05, - "loss": 0.8258683681488037, - "step": 307, - "token_acc": 0.7580105520525029 - }, - { - "epoch": 0.7709637046307884, - "grad_norm": 9.875060081481934, - "learning_rate": 4.3687708171564925e-05, - "loss": 0.7596441507339478, - "step": 308, - "token_acc": 0.7771428571428571 - }, - { - "epoch": 0.7734668335419274, - "grad_norm": 1.8181976079940796, - "learning_rate": 4.360596731430168e-05, - "loss": 0.8504893183708191, - "step": 309, - "token_acc": 0.7549649532710281 - }, - { - "epoch": 0.7759699624530664, - "grad_norm": 5.018813610076904, - "learning_rate": 4.352377813387398e-05, - "loss": 0.9177985191345215, - "step": 310, - "token_acc": 0.7289770944461876 - }, - { - "epoch": 0.7784730913642053, - "grad_norm": 2.401106595993042, - "learning_rate": 4.3441142610684824e-05, - "loss": 0.6803118586540222, - "step": 311, - "token_acc": 0.7968216827532417 - }, - { - "epoch": 0.7809762202753442, - "grad_norm": 3.502769947052002, - "learning_rate": 4.335806273589214e-05, - "loss": 0.7872037887573242, - "step": 312, - "token_acc": 0.766976635148863 - }, - { - "epoch": 0.7834793491864831, - "grad_norm": 1.664228916168213, - "learning_rate": 4.3274540511360793e-05, - "loss": 0.7319408655166626, - "step": 313, - "token_acc": 0.785088 - }, - { - "epoch": 0.785982478097622, - "grad_norm": 2.36742901802063, - "learning_rate": 4.319057794961437e-05, - "loss": 0.8201429843902588, - "step": 314, - "token_acc": 0.7595295142670442 - }, - { - "epoch": 0.7884856070087609, - "grad_norm": 2.8248369693756104, - "learning_rate": 4.310617707378668e-05, - "loss": 0.7904696464538574, - "step": 315, - "token_acc": 0.7644966656081296 - }, - { - "epoch": 0.7909887359198998, - "grad_norm": 2.83573317527771, - "learning_rate": 4.302133991757297e-05, - "loss": 0.8798209428787231, - "step": 316, - "token_acc": 0.7432513020315669 - }, - { - "epoch": 0.7934918648310388, - "grad_norm": 4.348333358764648, - "learning_rate": 4.2936068525181e-05, - "loss": 0.809928834438324, - "step": 317, - "token_acc": 0.7573623559539052 - }, - { - "epoch": 0.7959949937421777, - "grad_norm": 2.1033623218536377, - "learning_rate": 4.285036495128171e-05, - "loss": 0.7483210563659668, - "step": 318, - "token_acc": 0.7732790525536639 - }, - { - "epoch": 0.7984981226533167, - "grad_norm": 3.518192768096924, - "learning_rate": 4.276423126095974e-05, - "loss": 0.6489171385765076, - "step": 319, - "token_acc": 0.8053108482255222 - }, - { - "epoch": 0.8010012515644556, - "grad_norm": 1.2720087766647339, - "learning_rate": 4.267766952966369e-05, - "loss": 0.9405392408370972, - "step": 320, - "token_acc": 0.7279260780287474 - }, - { - "epoch": 0.8035043804755945, - "grad_norm": 16.282249450683594, - "learning_rate": 4.259068184315608e-05, - "loss": 0.9003595113754272, - "step": 321, - "token_acc": 0.7375758282781147 - }, - { - "epoch": 0.8060075093867334, - "grad_norm": 7.009720802307129, - "learning_rate": 4.250327029746309e-05, - "loss": 0.7392456531524658, - "step": 322, - "token_acc": 0.780937796251732 - }, - { - "epoch": 0.8085106382978723, - "grad_norm": 3.936666488647461, - "learning_rate": 4.24154369988241e-05, - "loss": 0.736973226070404, - "step": 323, - "token_acc": 0.7849452385372192 - }, - { - "epoch": 0.8110137672090113, - "grad_norm": 2.0168962478637695, - "learning_rate": 4.23271840636409e-05, - "loss": 0.9145832657814026, - "step": 324, - "token_acc": 0.7297918528923509 - }, - { - "epoch": 0.8135168961201502, - "grad_norm": 9.376174926757812, - "learning_rate": 4.223851361842668e-05, - "loss": 0.7650183439254761, - "step": 325, - "token_acc": 0.7717954668523246 - }, - { - "epoch": 0.8160200250312891, - "grad_norm": 1.8221909999847412, - "learning_rate": 4.214942779975482e-05, - "loss": 0.6287510395050049, - "step": 326, - "token_acc": 0.8086431962025317 - }, - { - "epoch": 0.818523153942428, - "grad_norm": 1.7132198810577393, - "learning_rate": 4.205992875420742e-05, - "loss": 0.9601121544837952, - "step": 327, - "token_acc": 0.7224585536516519 - }, - { - "epoch": 0.8210262828535669, - "grad_norm": 1.228062391281128, - "learning_rate": 4.197001863832355e-05, - "loss": 0.8077439069747925, - "step": 328, - "token_acc": 0.7587896974243561 - }, - { - "epoch": 0.8235294117647058, - "grad_norm": 1.1111897230148315, - "learning_rate": 4.187969961854726e-05, - "loss": 0.8680287599563599, - "step": 329, - "token_acc": 0.7438457841619053 - }, - { - "epoch": 0.8260325406758448, - "grad_norm": 2.42224383354187, - "learning_rate": 4.178897387117546e-05, - "loss": 0.7376724481582642, - "step": 330, - "token_acc": 0.7866793832459068 - }, - { - "epoch": 0.8285356695869838, - "grad_norm": 3.612968683242798, - "learning_rate": 4.169784358230541e-05, - "loss": 0.6727076768875122, - "step": 331, - "token_acc": 0.8009418583589929 - }, - { - "epoch": 0.8310387984981227, - "grad_norm": 4.89116907119751, - "learning_rate": 4.1606310947782044e-05, - "loss": 0.7970181703567505, - "step": 332, - "token_acc": 0.764037733427453 - }, - { - "epoch": 0.8335419274092616, - "grad_norm": 12.484292984008789, - "learning_rate": 4.151437817314513e-05, - "loss": 0.7304867506027222, - "step": 333, - "token_acc": 0.7838243886153076 - }, - { - "epoch": 0.8360450563204005, - "grad_norm": 1.9448401927947998, - "learning_rate": 4.142204747357604e-05, - "loss": 0.8944374918937683, - "step": 334, - "token_acc": 0.7394788423844114 - }, - { - "epoch": 0.8385481852315394, - "grad_norm": 1.2170294523239136, - "learning_rate": 4.1329321073844415e-05, - "loss": 0.8854318261146545, - "step": 335, - "token_acc": 0.7471004579789449 - }, - { - "epoch": 0.8410513141426783, - "grad_norm": 2.639364242553711, - "learning_rate": 4.123620120825459e-05, - "loss": 0.7527574300765991, - "step": 336, - "token_acc": 0.7784949622166247 - }, - { - "epoch": 0.8435544430538173, - "grad_norm": 2.7264010906219482, - "learning_rate": 4.114269012059169e-05, - "loss": 0.8323843479156494, - "step": 337, - "token_acc": 0.7546558704453441 - }, - { - "epoch": 0.8460575719649562, - "grad_norm": 2.749450922012329, - "learning_rate": 4.104879006406758e-05, - "loss": 0.8271874785423279, - "step": 338, - "token_acc": 0.7616862256605258 - }, - { - "epoch": 0.8485607008760951, - "grad_norm": 3.2195448875427246, - "learning_rate": 4.095450330126663e-05, - "loss": 0.6345349550247192, - "step": 339, - "token_acc": 0.8157239416577731 - }, - { - "epoch": 0.851063829787234, - "grad_norm": 2.691843032836914, - "learning_rate": 4.085983210409114e-05, - "loss": 0.7386264801025391, - "step": 340, - "token_acc": 0.7827135845603527 - }, - { - "epoch": 0.853566958698373, - "grad_norm": 1.2783466577529907, - "learning_rate": 4.07647787537066e-05, - "loss": 0.8243026733398438, - "step": 341, - "token_acc": 0.7568028970512157 - }, - { - "epoch": 0.8560700876095119, - "grad_norm": 4.061293601989746, - "learning_rate": 4.066934554048674e-05, - "loss": 0.6981653571128845, - "step": 342, - "token_acc": 0.7869034406215316 - }, - { - "epoch": 0.8585732165206508, - "grad_norm": 1.5013890266418457, - "learning_rate": 4.0573534763958355e-05, - "loss": 0.8307587504386902, - "step": 343, - "token_acc": 0.7530202301808564 - }, - { - "epoch": 0.8610763454317898, - "grad_norm": 1.6979941129684448, - "learning_rate": 4.047734873274586e-05, - "loss": 0.8721674084663391, - "step": 344, - "token_acc": 0.7437897299490555 - }, - { - "epoch": 0.8635794743429287, - "grad_norm": 1.435498595237732, - "learning_rate": 4.038078976451567e-05, - "loss": 0.853046715259552, - "step": 345, - "token_acc": 0.7511126133738945 - }, - { - "epoch": 0.8660826032540676, - "grad_norm": 1.627124309539795, - "learning_rate": 4.028386018592041e-05, - "loss": 0.75436931848526, - "step": 346, - "token_acc": 0.7807899207248018 - }, - { - "epoch": 0.8685857321652065, - "grad_norm": 1.9693089723587036, - "learning_rate": 4.018656233254278e-05, - "loss": 0.8141796588897705, - "step": 347, - "token_acc": 0.7617304492512479 - }, - { - "epoch": 0.8710888610763454, - "grad_norm": 1.6429239511489868, - "learning_rate": 4.008889854883929e-05, - "loss": 0.7092435956001282, - "step": 348, - "token_acc": 0.7868140171908945 - }, - { - "epoch": 0.8735919899874843, - "grad_norm": 7.14348030090332, - "learning_rate": 3.999087118808381e-05, - "loss": 0.8962076306343079, - "step": 349, - "token_acc": 0.7408736260607096 - }, - { - "epoch": 0.8760951188986232, - "grad_norm": 2.5628302097320557, - "learning_rate": 3.9892482612310836e-05, - "loss": 0.9180400967597961, - "step": 350, - "token_acc": 0.7306018168054504 - }, - { - "epoch": 0.8785982478097623, - "grad_norm": 1.3269526958465576, - "learning_rate": 3.979373519225858e-05, - "loss": 0.9172283411026001, - "step": 351, - "token_acc": 0.7335147904683649 - }, - { - "epoch": 0.8811013767209012, - "grad_norm": 1.101183533668518, - "learning_rate": 3.969463130731183e-05, - "loss": 0.8858950138092041, - "step": 352, - "token_acc": 0.7399414146635651 - }, - { - "epoch": 0.8836045056320401, - "grad_norm": 1.8363860845565796, - "learning_rate": 3.959517334544466e-05, - "loss": 0.8181067705154419, - "step": 353, - "token_acc": 0.7508903586873569 - }, - { - "epoch": 0.886107634543179, - "grad_norm": 2.2015419006347656, - "learning_rate": 3.949536370316285e-05, - "loss": 0.8596831560134888, - "step": 354, - "token_acc": 0.7492807233867653 - }, - { - "epoch": 0.8886107634543179, - "grad_norm": 1.0442819595336914, - "learning_rate": 3.939520478544614e-05, - "loss": 0.9282140731811523, - "step": 355, - "token_acc": 0.7278686978257793 - }, - { - "epoch": 0.8911138923654568, - "grad_norm": 1.5046483278274536, - "learning_rate": 3.9294699005690305e-05, - "loss": 0.8907036781311035, - "step": 356, - "token_acc": 0.7428094799815923 - }, - { - "epoch": 0.8936170212765957, - "grad_norm": 1.1432298421859741, - "learning_rate": 3.919384878564902e-05, - "loss": 0.8503479957580566, - "step": 357, - "token_acc": 0.7529302541487757 - }, - { - "epoch": 0.8961201501877347, - "grad_norm": 3.0036914348602295, - "learning_rate": 3.909265655537542e-05, - "loss": 0.7433081865310669, - "step": 358, - "token_acc": 0.7839231981659264 - }, - { - "epoch": 0.8986232790988736, - "grad_norm": 4.806852340698242, - "learning_rate": 3.899112475316366e-05, - "loss": 0.7551373243331909, - "step": 359, - "token_acc": 0.7743180125905368 - }, - { - "epoch": 0.9011264080100125, - "grad_norm": 1.2542036771774292, - "learning_rate": 3.888925582549006e-05, - "loss": 0.8357230424880981, - "step": 360, - "token_acc": 0.7519669661291223 - }, - { - "epoch": 0.9036295369211514, - "grad_norm": 1.6473242044448853, - "learning_rate": 3.8787052226954234e-05, - "loss": 0.8465045690536499, - "step": 361, - "token_acc": 0.7557243682991218 - }, - { - "epoch": 0.9061326658322904, - "grad_norm": 13.783917427062988, - "learning_rate": 3.868451642021992e-05, - "loss": 0.822354793548584, - "step": 362, - "token_acc": 0.7519634703196347 - }, - { - "epoch": 0.9086357947434293, - "grad_norm": 1.7439008951187134, - "learning_rate": 3.8581650875955585e-05, - "loss": 0.7651307582855225, - "step": 363, - "token_acc": 0.7751344989912575 - }, - { - "epoch": 0.9111389236545682, - "grad_norm": 1.6299248933792114, - "learning_rate": 3.847845807277502e-05, - "loss": 0.6929699182510376, - "step": 364, - "token_acc": 0.7872272907576359 - }, - { - "epoch": 0.9136420525657072, - "grad_norm": 2.1659955978393555, - "learning_rate": 3.8374940497177434e-05, - "loss": 0.735326886177063, - "step": 365, - "token_acc": 0.7798106242978655 - }, - { - "epoch": 0.9161451814768461, - "grad_norm": 2.080213785171509, - "learning_rate": 3.827110064348773e-05, - "loss": 0.8066057562828064, - "step": 366, - "token_acc": 0.757124183006536 - }, - { - "epoch": 0.918648310387985, - "grad_norm": 2.8970141410827637, - "learning_rate": 3.816694101379631e-05, - "loss": 0.8618408441543579, - "step": 367, - "token_acc": 0.7464049867308523 - }, - { - "epoch": 0.9211514392991239, - "grad_norm": 1.7472279071807861, - "learning_rate": 3.8062464117898724e-05, - "loss": 0.6792800426483154, - "step": 368, - "token_acc": 0.7940572856250557 - }, - { - "epoch": 0.9236545682102628, - "grad_norm": 5.283840656280518, - "learning_rate": 3.795767247323533e-05, - "loss": 0.9245332479476929, - "step": 369, - "token_acc": 0.7269049524317596 - }, - { - "epoch": 0.9261576971214017, - "grad_norm": 1.9213547706604004, - "learning_rate": 3.785256860483054e-05, - "loss": 0.7491408586502075, - "step": 370, - "token_acc": 0.7738063244647496 - }, - { - "epoch": 0.9286608260325406, - "grad_norm": 1.4675709009170532, - "learning_rate": 3.774715504523202e-05, - "loss": 0.8408378958702087, - "step": 371, - "token_acc": 0.7509755232351898 - }, - { - "epoch": 0.9311639549436797, - "grad_norm": 1.2374870777130127, - "learning_rate": 3.764143433444962e-05, - "loss": 0.9089862704277039, - "step": 372, - "token_acc": 0.7278328611898017 - }, - { - "epoch": 0.9336670838548186, - "grad_norm": 2.368098497390747, - "learning_rate": 3.753540901989423e-05, - "loss": 0.8130977153778076, - "step": 373, - "token_acc": 0.7584136918066288 - }, - { - "epoch": 0.9361702127659575, - "grad_norm": 4.070181846618652, - "learning_rate": 3.742908165631636e-05, - "loss": 0.8318907618522644, - "step": 374, - "token_acc": 0.7538795370857444 - }, - { - "epoch": 0.9386733416770964, - "grad_norm": 3.8024885654449463, - "learning_rate": 3.7322454805744605e-05, - "loss": 0.8522058725357056, - "step": 375, - "token_acc": 0.7481334654773704 - }, - { - "epoch": 0.9411764705882353, - "grad_norm": 8.243106842041016, - "learning_rate": 3.721553103742388e-05, - "loss": 0.7708778381347656, - "step": 376, - "token_acc": 0.7737909516380655 - }, - { - "epoch": 0.9436795994993742, - "grad_norm": 1.9439160823822021, - "learning_rate": 3.710831292775353e-05, - "loss": 0.7590352296829224, - "step": 377, - "token_acc": 0.7700546946216955 - }, - { - "epoch": 0.9461827284105131, - "grad_norm": 3.2804136276245117, - "learning_rate": 3.7000803060225284e-05, - "loss": 0.7222952842712402, - "step": 378, - "token_acc": 0.7838400666389005 - }, - { - "epoch": 0.9486858573216521, - "grad_norm": 1.783825159072876, - "learning_rate": 3.689300402536093e-05, - "loss": 0.820694088935852, - "step": 379, - "token_acc": 0.7568910159326346 - }, - { - "epoch": 0.951188986232791, - "grad_norm": 1.5094672441482544, - "learning_rate": 3.678491842064995e-05, - "loss": 0.8228154182434082, - "step": 380, - "token_acc": 0.7563206708169229 - }, - { - "epoch": 0.9536921151439299, - "grad_norm": 1.2823344469070435, - "learning_rate": 3.6676548850486915e-05, - "loss": 0.8268698453903198, - "step": 381, - "token_acc": 0.7545756682113935 - }, - { - "epoch": 0.9561952440550688, - "grad_norm": 2.020446538925171, - "learning_rate": 3.6567897926108756e-05, - "loss": 0.7393025159835815, - "step": 382, - "token_acc": 0.7798188874514878 - }, - { - "epoch": 0.9586983729662077, - "grad_norm": 1.6527626514434814, - "learning_rate": 3.645896826553178e-05, - "loss": 0.7484114766120911, - "step": 383, - "token_acc": 0.7755332780583403 - }, - { - "epoch": 0.9612015018773467, - "grad_norm": 1.587301254272461, - "learning_rate": 3.634976249348867e-05, - "loss": 0.6126949787139893, - "step": 384, - "token_acc": 0.8158403090792016 - }, - { - "epoch": 0.9637046307884856, - "grad_norm": 5.484954833984375, - "learning_rate": 3.624028324136517e-05, - "loss": 0.7998955249786377, - "step": 385, - "token_acc": 0.7629840381926026 - }, - { - "epoch": 0.9662077596996246, - "grad_norm": 1.513581395149231, - "learning_rate": 3.613053314713671e-05, - "loss": 0.7720030546188354, - "step": 386, - "token_acc": 0.767228370221328 - }, - { - "epoch": 0.9687108886107635, - "grad_norm": 3.6025302410125732, - "learning_rate": 3.602051485530486e-05, - "loss": 0.9072454571723938, - "step": 387, - "token_acc": 0.7304942652882785 - }, - { - "epoch": 0.9712140175219024, - "grad_norm": 1.7113579511642456, - "learning_rate": 3.591023101683355e-05, - "loss": 0.7592995166778564, - "step": 388, - "token_acc": 0.7736043397651583 - }, - { - "epoch": 0.9737171464330413, - "grad_norm": 1.5886659622192383, - "learning_rate": 3.57996842890853e-05, - "loss": 0.9248221516609192, - "step": 389, - "token_acc": 0.7291666666666666 - }, - { - "epoch": 0.9762202753441802, - "grad_norm": 1.904639482498169, - "learning_rate": 3.568887733575706e-05, - "loss": 0.6640578508377075, - "step": 390, - "token_acc": 0.8030723277149563 - }, - { - "epoch": 0.9787234042553191, - "grad_norm": 4.676436424255371, - "learning_rate": 3.55778128268161e-05, - "loss": 0.8066322803497314, - "step": 391, - "token_acc": 0.7604322527015794 - }, - { - "epoch": 0.981226533166458, - "grad_norm": 2.244272470474243, - "learning_rate": 3.54664934384357e-05, - "loss": 0.7747057676315308, - "step": 392, - "token_acc": 0.7657098525989139 - }, - { - "epoch": 0.983729662077597, - "grad_norm": 3.2416160106658936, - "learning_rate": 3.5354921852930594e-05, - "loss": 0.7859742045402527, - "step": 393, - "token_acc": 0.7659952983035772 - }, - { - "epoch": 0.986232790988736, - "grad_norm": 3.806647300720215, - "learning_rate": 3.5243100758692386e-05, - "loss": 0.7290835976600647, - "step": 394, - "token_acc": 0.7793145441892833 - }, - { - "epoch": 0.9887359198998749, - "grad_norm": 2.6771068572998047, - "learning_rate": 3.513103285012475e-05, - "loss": 0.8180262446403503, - "step": 395, - "token_acc": 0.7598081952920662 - }, - { - "epoch": 0.9912390488110138, - "grad_norm": 1.7483131885528564, - "learning_rate": 3.5018720827578524e-05, - "loss": 0.7300944328308105, - "step": 396, - "token_acc": 0.7814569536423841 - }, - { - "epoch": 0.9937421777221527, - "grad_norm": 1.995330572128296, - "learning_rate": 3.4906167397286646e-05, - "loss": 0.7564259767532349, - "step": 397, - "token_acc": 0.7783770729351152 - }, - { - "epoch": 0.9962453066332916, - "grad_norm": 2.2668654918670654, - "learning_rate": 3.47933752712989e-05, - "loss": 0.7041178941726685, - "step": 398, - "token_acc": 0.7913291605301914 - }, - { - "epoch": 0.9987484355444305, - "grad_norm": 1.306915283203125, - "learning_rate": 3.468034716741664e-05, - "loss": 0.8539732694625854, - "step": 399, - "token_acc": 0.7481962912169817 - }, - { - "epoch": 1.0, - "grad_norm": 1.7704166173934937, - "learning_rate": 3.456708580912725e-05, - "loss": 0.7418760061264038, - "step": 400, - "token_acc": 0.776519052523172 - }, - { - "epoch": 1.002503128911139, - "grad_norm": 43.9930305480957, - "learning_rate": 3.4453593925538515e-05, - "loss": 0.7428221702575684, - "step": 401, - "token_acc": 0.7772024037846823 - }, - { - "epoch": 1.0050062578222778, - "grad_norm": 1.5584815740585327, - "learning_rate": 3.433987425131291e-05, - "loss": 0.8528105616569519, - "step": 402, - "token_acc": 0.7449437659892841 - }, - { - "epoch": 1.0075093867334168, - "grad_norm": 7.336424350738525, - "learning_rate": 3.4225929526601664e-05, - "loss": 0.7428395748138428, - "step": 403, - "token_acc": 0.7766206412356658 - }, - { - "epoch": 1.0100125156445556, - "grad_norm": 1.4825217723846436, - "learning_rate": 3.411176249697875e-05, - "loss": 0.631352424621582, - "step": 404, - "token_acc": 0.8065062053403536 - }, - { - "epoch": 1.0125156445556946, - "grad_norm": 1.484767198562622, - "learning_rate": 3.399737591337471e-05, - "loss": 0.7537027597427368, - "step": 405, - "token_acc": 0.7765481064483112 - }, - { - "epoch": 1.0150187734668334, - "grad_norm": 2.6845622062683105, - "learning_rate": 3.388277253201041e-05, - "loss": 0.796688437461853, - "step": 406, - "token_acc": 0.7627060907480583 - }, - { - "epoch": 1.0175219023779725, - "grad_norm": 2.6031534671783447, - "learning_rate": 3.3767955114330586e-05, - "loss": 0.8054678440093994, - "step": 407, - "token_acc": 0.764444165935581 - }, - { - "epoch": 1.0200250312891115, - "grad_norm": 1.357327938079834, - "learning_rate": 3.365292642693732e-05, - "loss": 0.8387413024902344, - "step": 408, - "token_acc": 0.7472088911341248 - }, - { - "epoch": 1.0225281602002503, - "grad_norm": 2.586324453353882, - "learning_rate": 3.353768924152341e-05, - "loss": 0.6938782930374146, - "step": 409, - "token_acc": 0.7910919792673284 - }, - { - "epoch": 1.0250312891113893, - "grad_norm": 1.2863296270370483, - "learning_rate": 3.34222463348055e-05, - "loss": 0.9054546356201172, - "step": 410, - "token_acc": 0.7378970871815691 - }, - { - "epoch": 1.027534418022528, - "grad_norm": 1.5208131074905396, - "learning_rate": 3.330660048845727e-05, - "loss": 0.7409943342208862, - "step": 411, - "token_acc": 0.7748617945446814 - }, - { - "epoch": 1.0300375469336671, - "grad_norm": 1.7728694677352905, - "learning_rate": 3.319075448904234e-05, - "loss": 0.8802088499069214, - "step": 412, - "token_acc": 0.737257519830362 - }, - { - "epoch": 1.032540675844806, - "grad_norm": 2.1131184101104736, - "learning_rate": 3.307471112794715e-05, - "loss": 0.6349403262138367, - "step": 413, - "token_acc": 0.8154147750722245 - }, - { - "epoch": 1.035043804755945, - "grad_norm": 2.6038410663604736, - "learning_rate": 3.2958473201313744e-05, - "loss": 0.7536982893943787, - "step": 414, - "token_acc": 0.7783753361265712 - }, - { - "epoch": 1.037546933667084, - "grad_norm": 0.7469914555549622, - "learning_rate": 3.284204350997229e-05, - "loss": 0.8465015888214111, - "step": 415, - "token_acc": 0.7492382217360731 - }, - { - "epoch": 1.0400500625782227, - "grad_norm": 2.318094253540039, - "learning_rate": 3.272542485937369e-05, - "loss": 0.8175340294837952, - "step": 416, - "token_acc": 0.7576262710451742 - }, - { - "epoch": 1.0425531914893618, - "grad_norm": 2.7602827548980713, - "learning_rate": 3.260862005952193e-05, - "loss": 0.8715943098068237, - "step": 417, - "token_acc": 0.743643826245582 - }, - { - "epoch": 1.0450563204005006, - "grad_norm": 1.7321751117706299, - "learning_rate": 3.2491631924906416e-05, - "loss": 0.7801544070243835, - "step": 418, - "token_acc": 0.7639452626696045 - }, - { - "epoch": 1.0475594493116396, - "grad_norm": 30.08856201171875, - "learning_rate": 3.23744632744341e-05, - "loss": 0.6660053730010986, - "step": 419, - "token_acc": 0.7974683544303798 - }, - { - "epoch": 1.0500625782227784, - "grad_norm": 10.824769973754883, - "learning_rate": 3.225711693136156e-05, - "loss": 0.6206501722335815, - "step": 420, - "token_acc": 0.8082563824008691 - }, - { - "epoch": 1.0525657071339174, - "grad_norm": 6.584616661071777, - "learning_rate": 3.2139595723227054e-05, - "loss": 0.8174914121627808, - "step": 421, - "token_acc": 0.7598479154692958 - }, - { - "epoch": 1.0550688360450564, - "grad_norm": 1.7321393489837646, - "learning_rate": 3.202190248178231e-05, - "loss": 0.802627682685852, - "step": 422, - "token_acc": 0.7602137986115377 - }, - { - "epoch": 1.0575719649561952, - "grad_norm": 1.9569984674453735, - "learning_rate": 3.190404004292427e-05, - "loss": 0.6920569539070129, - "step": 423, - "token_acc": 0.7928679144859399 - }, - { - "epoch": 1.0600750938673342, - "grad_norm": 1.5589165687561035, - "learning_rate": 3.178601124662686e-05, - "loss": 0.8527140021324158, - "step": 424, - "token_acc": 0.7463035747707281 - }, - { - "epoch": 1.062578222778473, - "grad_norm": 4.186975002288818, - "learning_rate": 3.1667818936872465e-05, - "loss": 0.7492550015449524, - "step": 425, - "token_acc": 0.7705152671755725 - }, - { - "epoch": 1.065081351689612, - "grad_norm": 1.757791519165039, - "learning_rate": 3.154946596158344e-05, - "loss": 0.7724304795265198, - "step": 426, - "token_acc": 0.7690384787072583 - }, - { - "epoch": 1.0675844806007508, - "grad_norm": 3.0420734882354736, - "learning_rate": 3.14309551725535e-05, - "loss": 0.8095215559005737, - "step": 427, - "token_acc": 0.7658398397015131 - }, - { - "epoch": 1.0700876095118899, - "grad_norm": 1.704030156135559, - "learning_rate": 3.131228942537895e-05, - "loss": 0.6501023173332214, - "step": 428, - "token_acc": 0.8044284859365649 - }, - { - "epoch": 1.0725907384230289, - "grad_norm": 2.9102675914764404, - "learning_rate": 3.119347157938996e-05, - "loss": 0.7734176516532898, - "step": 429, - "token_acc": 0.7695846562560746 - }, - { - "epoch": 1.0750938673341677, - "grad_norm": 1.7218647003173828, - "learning_rate": 3.10745044975816e-05, - "loss": 0.7924395799636841, - "step": 430, - "token_acc": 0.769767294401116 - }, - { - "epoch": 1.0775969962453067, - "grad_norm": 3.255305051803589, - "learning_rate": 3.095539104654487e-05, - "loss": 0.8065544366836548, - "step": 431, - "token_acc": 0.76478578892372 - }, - { - "epoch": 1.0801001251564455, - "grad_norm": 1.2878748178482056, - "learning_rate": 3.083613409639764e-05, - "loss": 0.8923381567001343, - "step": 432, - "token_acc": 0.7387548536276777 - }, - { - "epoch": 1.0826032540675845, - "grad_norm": 1.4100399017333984, - "learning_rate": 3.071673652071549e-05, - "loss": 0.8253895044326782, - "step": 433, - "token_acc": 0.7540562052286781 - }, - { - "epoch": 1.0851063829787233, - "grad_norm": 1.6869633197784424, - "learning_rate": 3.0597201196462463e-05, - "loss": 0.6606812477111816, - "step": 434, - "token_acc": 0.7974853761850332 - }, - { - "epoch": 1.0876095118898623, - "grad_norm": 1.2705729007720947, - "learning_rate": 3.0477531003921745e-05, - "loss": 0.8390290141105652, - "step": 435, - "token_acc": 0.7539678436643747 - }, - { - "epoch": 1.0901126408010013, - "grad_norm": 4.0343170166015625, - "learning_rate": 3.035772882662627e-05, - "loss": 0.7374899387359619, - "step": 436, - "token_acc": 0.7784767467984722 - }, - { - "epoch": 1.0926157697121401, - "grad_norm": 31.51459503173828, - "learning_rate": 3.0237797551289228e-05, - "loss": 0.8265960812568665, - "step": 437, - "token_acc": 0.754416435093291 - }, - { - "epoch": 1.0951188986232792, - "grad_norm": 1.898342251777649, - "learning_rate": 3.0117740067734495e-05, - "loss": 0.8250342607498169, - "step": 438, - "token_acc": 0.7517792771975229 - }, - { - "epoch": 1.097622027534418, - "grad_norm": 1.7603737115859985, - "learning_rate": 2.9997559268827048e-05, - "loss": 0.6548107266426086, - "step": 439, - "token_acc": 0.802406330749354 - }, - { - "epoch": 1.100125156445557, - "grad_norm": 1.681059718132019, - "learning_rate": 2.9877258050403212e-05, - "loss": 0.49500739574432373, - "step": 440, - "token_acc": 0.8484848484848485 - }, - { - "epoch": 1.1026282853566958, - "grad_norm": 2.323869228363037, - "learning_rate": 2.97568393112009e-05, - "loss": 0.8611985445022583, - "step": 441, - "token_acc": 0.7459963793343546 - }, - { - "epoch": 1.1051314142678348, - "grad_norm": 3.4705965518951416, - "learning_rate": 2.963630595278977e-05, - "loss": 0.6335822343826294, - "step": 442, - "token_acc": 0.8075504658385093 - }, - { - "epoch": 1.1076345431789738, - "grad_norm": 1.9544960260391235, - "learning_rate": 2.9515660879501316e-05, - "loss": 0.7141144275665283, - "step": 443, - "token_acc": 0.7871103060348937 - }, - { - "epoch": 1.1101376720901126, - "grad_norm": 2.912339687347412, - "learning_rate": 2.9394906998358868e-05, - "loss": 0.8509359359741211, - "step": 444, - "token_acc": 0.7441022743325328 - }, - { - "epoch": 1.1126408010012516, - "grad_norm": 0.9381941556930542, - "learning_rate": 2.9274047219007534e-05, - "loss": 0.7909557819366455, - "step": 445, - "token_acc": 0.7587197373820271 - }, - { - "epoch": 1.1151439299123904, - "grad_norm": 1.41623055934906, - "learning_rate": 2.9153084453644135e-05, - "loss": 0.8439774513244629, - "step": 446, - "token_acc": 0.7494344152546285 - }, - { - "epoch": 1.1176470588235294, - "grad_norm": 1.3373831510543823, - "learning_rate": 2.9032021616947015e-05, - "loss": 0.7694572806358337, - "step": 447, - "token_acc": 0.7675036214389184 - }, - { - "epoch": 1.1201501877346682, - "grad_norm": 1.8616464138031006, - "learning_rate": 2.8910861626005776e-05, - "loss": 0.7465448975563049, - "step": 448, - "token_acc": 0.7760096282428457 - }, - { - "epoch": 1.1226533166458073, - "grad_norm": 2.0417370796203613, - "learning_rate": 2.878960740025103e-05, - "loss": 0.5976338386535645, - "step": 449, - "token_acc": 0.8209215731905981 - }, - { - "epoch": 1.1251564455569463, - "grad_norm": 1.513850450515747, - "learning_rate": 2.8668261861384045e-05, - "loss": 0.6721420288085938, - "step": 450, - "token_acc": 0.7959154424937298 - }, - { - "epoch": 1.127659574468085, - "grad_norm": 2.1121175289154053, - "learning_rate": 2.854682793330633e-05, - "loss": 0.6924934387207031, - "step": 451, - "token_acc": 0.7926174496644295 - }, - { - "epoch": 1.130162703379224, - "grad_norm": 1.8427212238311768, - "learning_rate": 2.8425308542049206e-05, - "loss": 0.6902682185173035, - "step": 452, - "token_acc": 0.7945113788487282 - }, - { - "epoch": 1.1326658322903629, - "grad_norm": 2.8109426498413086, - "learning_rate": 2.8303706615703253e-05, - "loss": 0.8199548721313477, - "step": 453, - "token_acc": 0.7543770616594773 - }, - { - "epoch": 1.135168961201502, - "grad_norm": 2.637247085571289, - "learning_rate": 2.8182025084347836e-05, - "loss": 0.9140053391456604, - "step": 454, - "token_acc": 0.7342447756291826 - }, - { - "epoch": 1.1376720901126407, - "grad_norm": 2.070204734802246, - "learning_rate": 2.8060266879980408e-05, - "loss": 0.6925473213195801, - "step": 455, - "token_acc": 0.7881796251623678 - }, - { - "epoch": 1.1401752190237797, - "grad_norm": 1.8393173217773438, - "learning_rate": 2.7938434936445945e-05, - "loss": 0.7441434860229492, - "step": 456, - "token_acc": 0.7766430457134917 - }, - { - "epoch": 1.1426783479349187, - "grad_norm": 4.779657363891602, - "learning_rate": 2.7816532189366197e-05, - "loss": 0.7810814380645752, - "step": 457, - "token_acc": 0.7622206393019322 - }, - { - "epoch": 1.1451814768460575, - "grad_norm": 1.8170710802078247, - "learning_rate": 2.7694561576068985e-05, - "loss": 0.7876262664794922, - "step": 458, - "token_acc": 0.7685871709407524 - }, - { - "epoch": 1.1476846057571966, - "grad_norm": 0.9989718794822693, - "learning_rate": 2.757252603551741e-05, - "loss": 0.8328777551651001, - "step": 459, - "token_acc": 0.7498996386993175 - }, - { - "epoch": 1.1501877346683353, - "grad_norm": 4.568758964538574, - "learning_rate": 2.7450428508239024e-05, - "loss": 0.8748979568481445, - "step": 460, - "token_acc": 0.7450868070855733 - }, - { - "epoch": 1.1526908635794744, - "grad_norm": 8.470266342163086, - "learning_rate": 2.7328271936254995e-05, - "loss": 0.8182597756385803, - "step": 461, - "token_acc": 0.7555555555555555 - }, - { - "epoch": 1.1551939924906134, - "grad_norm": 1.7657190561294556, - "learning_rate": 2.7206059263009244e-05, - "loss": 0.7683885097503662, - "step": 462, - "token_acc": 0.7742563247150404 - }, - { - "epoch": 1.1576971214017522, - "grad_norm": 5.895107746124268, - "learning_rate": 2.7083793433297438e-05, - "loss": 0.8530595302581787, - "step": 463, - "token_acc": 0.7451071400943761 - }, - { - "epoch": 1.1602002503128912, - "grad_norm": 1.7480491399765015, - "learning_rate": 2.6961477393196126e-05, - "loss": 0.7786663174629211, - "step": 464, - "token_acc": 0.7678157443806068 - }, - { - "epoch": 1.16270337922403, - "grad_norm": 2.044475793838501, - "learning_rate": 2.683911408999169e-05, - "loss": 0.7121521830558777, - "step": 465, - "token_acc": 0.7803991336633663 - }, - { - "epoch": 1.165206508135169, - "grad_norm": 5.003326416015625, - "learning_rate": 2.6716706472109342e-05, - "loss": 0.6376701593399048, - "step": 466, - "token_acc": 0.8067076051015588 - }, - { - "epoch": 1.1677096370463078, - "grad_norm": 12.686973571777344, - "learning_rate": 2.659425748904212e-05, - "loss": 0.5150684118270874, - "step": 467, - "token_acc": 0.8459984285553934 - }, - { - "epoch": 1.1702127659574468, - "grad_norm": 3.0933218002319336, - "learning_rate": 2.6471770091279724e-05, - "loss": 0.7467551827430725, - "step": 468, - "token_acc": 0.7779315435003229 - }, - { - "epoch": 1.1727158948685856, - "grad_norm": 5.490667819976807, - "learning_rate": 2.6349247230237552e-05, - "loss": 0.7138000130653381, - "step": 469, - "token_acc": 0.7884847818920998 - }, - { - "epoch": 1.1752190237797246, - "grad_norm": 1.2807576656341553, - "learning_rate": 2.6226691858185454e-05, - "loss": 0.8333462476730347, - "step": 470, - "token_acc": 0.749974967457695 - }, - { - "epoch": 1.1777221526908637, - "grad_norm": 10.077444076538086, - "learning_rate": 2.6104106928176687e-05, - "loss": 0.7134934067726135, - "step": 471, - "token_acc": 0.781946749404719 - }, - { - "epoch": 1.1802252816020025, - "grad_norm": 1.7063714265823364, - "learning_rate": 2.598149539397672e-05, - "loss": 0.8703588247299194, - "step": 472, - "token_acc": 0.7454706834438469 - }, - { - "epoch": 1.1827284105131415, - "grad_norm": 1.9840588569641113, - "learning_rate": 2.585886020999206e-05, - "loss": 0.7841652035713196, - "step": 473, - "token_acc": 0.7653958944281525 - }, - { - "epoch": 1.1852315394242803, - "grad_norm": 1.917015552520752, - "learning_rate": 2.5736204331199088e-05, - "loss": 0.8311939835548401, - "step": 474, - "token_acc": 0.7580409820465648 - }, - { - "epoch": 1.1877346683354193, - "grad_norm": 1.1762555837631226, - "learning_rate": 2.561353071307281e-05, - "loss": 0.8065941333770752, - "step": 475, - "token_acc": 0.7605049383437554 - }, - { - "epoch": 1.1902377972465583, - "grad_norm": 2.9361069202423096, - "learning_rate": 2.5490842311515707e-05, - "loss": 0.6642436385154724, - "step": 476, - "token_acc": 0.8024132730015083 - }, - { - "epoch": 1.1927409261576971, - "grad_norm": 4.613530158996582, - "learning_rate": 2.5368142082786466e-05, - "loss": 0.7668801546096802, - "step": 477, - "token_acc": 0.7748182105595953 - }, - { - "epoch": 1.1952440550688361, - "grad_norm": 1.097956657409668, - "learning_rate": 2.5245432983428747e-05, - "loss": 0.9035181999206543, - "step": 478, - "token_acc": 0.7342191332788226 - }, - { - "epoch": 1.197747183979975, - "grad_norm": 1.8363292217254639, - "learning_rate": 2.5122717970199956e-05, - "loss": 0.851319432258606, - "step": 479, - "token_acc": 0.7467151074780503 - }, - { - "epoch": 1.200250312891114, - "grad_norm": 1.2292267084121704, - "learning_rate": 2.5e-05, - "loss": 0.7173365354537964, - "step": 480, - "token_acc": 0.7852402654513473 - }, - { - "epoch": 1.2027534418022527, - "grad_norm": 1.13339102268219, - "learning_rate": 2.4877282029800053e-05, - "loss": 0.7570571899414062, - "step": 481, - "token_acc": 0.7718512153204027 - }, - { - "epoch": 1.2052565707133918, - "grad_norm": 2.553258180618286, - "learning_rate": 2.4754567016571263e-05, - "loss": 0.8463850021362305, - "step": 482, - "token_acc": 0.7462981243830207 - }, - { - "epoch": 1.2077596996245306, - "grad_norm": 1.9682620763778687, - "learning_rate": 2.4631857917213543e-05, - "loss": 0.7410565614700317, - "step": 483, - "token_acc": 0.7786700125470515 - }, - { - "epoch": 1.2102628285356696, - "grad_norm": 1.0788750648498535, - "learning_rate": 2.4509157688484295e-05, - "loss": 0.8274058103561401, - "step": 484, - "token_acc": 0.7513348996155489 - }, - { - "epoch": 1.2127659574468086, - "grad_norm": 1.1234153509140015, - "learning_rate": 2.4386469286927196e-05, - "loss": 0.8381744027137756, - "step": 485, - "token_acc": 0.7476648740447212 - }, - { - "epoch": 1.2152690863579474, - "grad_norm": 2.8939898014068604, - "learning_rate": 2.426379566880092e-05, - "loss": 0.8004180192947388, - "step": 486, - "token_acc": 0.7646108937333085 - }, - { - "epoch": 1.2177722152690864, - "grad_norm": 3.46976637840271, - "learning_rate": 2.414113979000794e-05, - "loss": 0.8478291034698486, - "step": 487, - "token_acc": 0.7513809354887752 - }, - { - "epoch": 1.2202753441802252, - "grad_norm": 2.4108669757843018, - "learning_rate": 2.4018504606023293e-05, - "loss": 0.7109798192977905, - "step": 488, - "token_acc": 0.7838756326825741 - }, - { - "epoch": 1.2227784730913642, - "grad_norm": 5.502831935882568, - "learning_rate": 2.389589307182332e-05, - "loss": 0.8232313394546509, - "step": 489, - "token_acc": 0.7541480718617691 - }, - { - "epoch": 1.2252816020025032, - "grad_norm": 5.164613246917725, - "learning_rate": 2.3773308141814552e-05, - "loss": 0.6895003914833069, - "step": 490, - "token_acc": 0.7904873671130747 - }, - { - "epoch": 1.227784730913642, - "grad_norm": 2.992577314376831, - "learning_rate": 2.365075276976245e-05, - "loss": 0.8953061699867249, - "step": 491, - "token_acc": 0.7334460411383489 - }, - { - "epoch": 1.230287859824781, - "grad_norm": 3.0780115127563477, - "learning_rate": 2.3528229908720272e-05, - "loss": 0.6675305962562561, - "step": 492, - "token_acc": 0.7988102636952854 - }, - { - "epoch": 1.2327909887359199, - "grad_norm": 2.8056156635284424, - "learning_rate": 2.3405742510957894e-05, - "loss": 0.7906989455223083, - "step": 493, - "token_acc": 0.7683424382822764 - }, - { - "epoch": 1.2352941176470589, - "grad_norm": 1.3469887971878052, - "learning_rate": 2.328329352789066e-05, - "loss": 0.7190076112747192, - "step": 494, - "token_acc": 0.7788229469645399 - }, - { - "epoch": 1.2377972465581977, - "grad_norm": 2.318279981613159, - "learning_rate": 2.3160885910008318e-05, - "loss": 0.8477081060409546, - "step": 495, - "token_acc": 0.7479976557921469 - }, - { - "epoch": 1.2403003754693367, - "grad_norm": 1.66133713722229, - "learning_rate": 2.303852260680388e-05, - "loss": 0.8301971554756165, - "step": 496, - "token_acc": 0.7531454639099404 - }, - { - "epoch": 1.2428035043804755, - "grad_norm": 1.978458285331726, - "learning_rate": 2.291620656670256e-05, - "loss": 0.6246353387832642, - "step": 497, - "token_acc": 0.8072678843226788 - }, - { - "epoch": 1.2453066332916145, - "grad_norm": 2.763749837875366, - "learning_rate": 2.279394073699077e-05, - "loss": 0.6929395198822021, - "step": 498, - "token_acc": 0.7917909276408727 - }, - { - "epoch": 1.2478097622027535, - "grad_norm": 1.4526376724243164, - "learning_rate": 2.267172806374501e-05, - "loss": 0.7163282632827759, - "step": 499, - "token_acc": 0.7838088024909534 - }, - { - "epoch": 1.2503128911138923, - "grad_norm": 3.438523530960083, - "learning_rate": 2.2549571491760986e-05, - "loss": 0.5449392795562744, - "step": 500, - "token_acc": 0.833210964268233 - }, - { - "epoch": 1.2528160200250313, - "grad_norm": 13.278526306152344, - "learning_rate": 2.2427473964482598e-05, - "loss": 0.6137301921844482, - "step": 501, - "token_acc": 0.8104321907600596 - }, - { - "epoch": 1.2553191489361701, - "grad_norm": 13.62430191040039, - "learning_rate": 2.2305438423931017e-05, - "loss": 0.8686969876289368, - "step": 502, - "token_acc": 0.7442144830397174 - }, - { - "epoch": 1.2578222778473092, - "grad_norm": 1.8806519508361816, - "learning_rate": 2.2183467810633812e-05, - "loss": 0.9271630048751831, - "step": 503, - "token_acc": 0.7262685005692483 - }, - { - "epoch": 1.2603254067584482, - "grad_norm": 2.0833258628845215, - "learning_rate": 2.2061565063554064e-05, - "loss": 0.6759613752365112, - "step": 504, - "token_acc": 0.7969396593205659 - }, - { - "epoch": 1.262828535669587, - "grad_norm": 6.389394760131836, - "learning_rate": 2.1939733120019598e-05, - "loss": 0.7384915351867676, - "step": 505, - "token_acc": 0.774990612091626 - }, - { - "epoch": 1.265331664580726, - "grad_norm": 3.0592896938323975, - "learning_rate": 2.1817974915652173e-05, - "loss": 0.6458410024642944, - "step": 506, - "token_acc": 0.802019687712152 - }, - { - "epoch": 1.2678347934918648, - "grad_norm": 1.639441728591919, - "learning_rate": 2.1696293384296746e-05, - "loss": 0.6861962080001831, - "step": 507, - "token_acc": 0.7907946370176586 - }, - { - "epoch": 1.2703379224030038, - "grad_norm": 2.1521527767181396, - "learning_rate": 2.1574691457950803e-05, - "loss": 0.7988197803497314, - "step": 508, - "token_acc": 0.7582929067785499 - }, - { - "epoch": 1.2728410513141426, - "grad_norm": 1.5150588750839233, - "learning_rate": 2.1453172066693673e-05, - "loss": 0.783989667892456, - "step": 509, - "token_acc": 0.7560105090963168 - }, - { - "epoch": 1.2753441802252816, - "grad_norm": 1.526321530342102, - "learning_rate": 2.1331738138615958e-05, - "loss": 0.8146979808807373, - "step": 510, - "token_acc": 0.7611608645882432 - }, - { - "epoch": 1.2778473091364204, - "grad_norm": 1.9988254308700562, - "learning_rate": 2.1210392599748974e-05, - "loss": 0.7470281720161438, - "step": 511, - "token_acc": 0.7786675208199871 - }, - { - "epoch": 1.2803504380475594, - "grad_norm": 3.260591745376587, - "learning_rate": 2.1089138373994223e-05, - "loss": 0.8237022161483765, - "step": 512, - "token_acc": 0.7528670036415023 - }, - { - "epoch": 1.2828535669586985, - "grad_norm": 1.7635042667388916, - "learning_rate": 2.0967978383052994e-05, - "loss": 0.7945007681846619, - "step": 513, - "token_acc": 0.7593285066433288 - }, - { - "epoch": 1.2853566958698373, - "grad_norm": 1.5511478185653687, - "learning_rate": 2.0846915546355868e-05, - "loss": 0.7554317712783813, - "step": 514, - "token_acc": 0.7748419009454637 - }, - { - "epoch": 1.2878598247809763, - "grad_norm": 4.115737438201904, - "learning_rate": 2.0725952780992468e-05, - "loss": 0.8068946003913879, - "step": 515, - "token_acc": 0.7541250542770299 - }, - { - "epoch": 1.290362953692115, - "grad_norm": 3.031116247177124, - "learning_rate": 2.0605093001641138e-05, - "loss": 0.7863394021987915, - "step": 516, - "token_acc": 0.7686510486650698 - }, - { - "epoch": 1.292866082603254, - "grad_norm": 1.5909842252731323, - "learning_rate": 2.048433912049868e-05, - "loss": 0.8729851245880127, - "step": 517, - "token_acc": 0.7407537527946343 - }, - { - "epoch": 1.295369211514393, - "grad_norm": 2.6750752925872803, - "learning_rate": 2.036369404721023e-05, - "loss": 0.7303407788276672, - "step": 518, - "token_acc": 0.7781297955546755 - }, - { - "epoch": 1.297872340425532, - "grad_norm": 0.9692606329917908, - "learning_rate": 2.0243160688799105e-05, - "loss": 0.8290165066719055, - "step": 519, - "token_acc": 0.7519956637429782 - }, - { - "epoch": 1.300375469336671, - "grad_norm": 2.2219390869140625, - "learning_rate": 2.0122741949596797e-05, - "loss": 0.8760692477226257, - "step": 520, - "token_acc": 0.7430098393147873 - }, - { - "epoch": 1.3028785982478097, - "grad_norm": 0.8866194486618042, - "learning_rate": 2.0002440731172958e-05, - "loss": 0.8369796276092529, - "step": 521, - "token_acc": 0.747876936829559 - }, - { - "epoch": 1.3053817271589487, - "grad_norm": 3.6789374351501465, - "learning_rate": 1.988225993226551e-05, - "loss": 0.7882047891616821, - "step": 522, - "token_acc": 0.767794798717492 - }, - { - "epoch": 1.3078848560700875, - "grad_norm": 2.0599172115325928, - "learning_rate": 1.976220244871079e-05, - "loss": 0.7839165925979614, - "step": 523, - "token_acc": 0.767715969527095 - }, - { - "epoch": 1.3103879849812266, - "grad_norm": 1.2310124635696411, - "learning_rate": 1.9642271173373737e-05, - "loss": 0.830912172794342, - "step": 524, - "token_acc": 0.7497665274023102 - }, - { - "epoch": 1.3128911138923653, - "grad_norm": 1.4539384841918945, - "learning_rate": 1.9522468996078258e-05, - "loss": 0.7132511138916016, - "step": 525, - "token_acc": 0.7868950749464668 - }, - { - "epoch": 1.3153942428035044, - "grad_norm": 5.704746723175049, - "learning_rate": 1.940279880353754e-05, - "loss": 0.8210383653640747, - "step": 526, - "token_acc": 0.7561708521141876 - }, - { - "epoch": 1.3178973717146434, - "grad_norm": 2.1198251247406006, - "learning_rate": 1.9283263479284514e-05, - "loss": 0.8160667419433594, - "step": 527, - "token_acc": 0.7549833887043189 - }, - { - "epoch": 1.3204005006257822, - "grad_norm": 1.768844723701477, - "learning_rate": 1.9163865903602374e-05, - "loss": 0.7602739930152893, - "step": 528, - "token_acc": 0.7743359280956584 - }, - { - "epoch": 1.3229036295369212, - "grad_norm": 3.8136727809906006, - "learning_rate": 1.9044608953455138e-05, - "loss": 0.7949267625808716, - "step": 529, - "token_acc": 0.7604166666666666 - }, - { - "epoch": 1.32540675844806, - "grad_norm": 1.3969098329544067, - "learning_rate": 1.8925495502418406e-05, - "loss": 0.8395500779151917, - "step": 530, - "token_acc": 0.7547573013127099 - }, - { - "epoch": 1.327909887359199, - "grad_norm": 2.3602702617645264, - "learning_rate": 1.880652842061004e-05, - "loss": 0.6325199604034424, - "step": 531, - "token_acc": 0.8049121258916097 - }, - { - "epoch": 1.330413016270338, - "grad_norm": 6.827362537384033, - "learning_rate": 1.868771057462105e-05, - "loss": 0.8032347559928894, - "step": 532, - "token_acc": 0.7577628688475925 - }, - { - "epoch": 1.3329161451814768, - "grad_norm": 2.2116971015930176, - "learning_rate": 1.8569044827446515e-05, - "loss": 0.7727822065353394, - "step": 533, - "token_acc": 0.770619378707661 - }, - { - "epoch": 1.3354192740926158, - "grad_norm": 1.6953080892562866, - "learning_rate": 1.8450534038416568e-05, - "loss": 0.8702293634414673, - "step": 534, - "token_acc": 0.7410009728677981 - }, - { - "epoch": 1.3379224030037546, - "grad_norm": 9.758813858032227, - "learning_rate": 1.8332181063127545e-05, - "loss": 0.7461093664169312, - "step": 535, - "token_acc": 0.7749614899873967 - }, - { - "epoch": 1.3404255319148937, - "grad_norm": 1.1418122053146362, - "learning_rate": 1.8213988753373146e-05, - "loss": 0.8273798227310181, - "step": 536, - "token_acc": 0.7499042512447338 - }, - { - "epoch": 1.3429286608260325, - "grad_norm": 1.871590256690979, - "learning_rate": 1.809595995707573e-05, - "loss": 0.8071326017379761, - "step": 537, - "token_acc": 0.7567946505608283 - }, - { - "epoch": 1.3454317897371715, - "grad_norm": 1.5790642499923706, - "learning_rate": 1.7978097518217703e-05, - "loss": 0.7012978196144104, - "step": 538, - "token_acc": 0.7855657398136024 - }, - { - "epoch": 1.3479349186483103, - "grad_norm": 2.052522659301758, - "learning_rate": 1.7860404276772945e-05, - "loss": 0.6337273120880127, - "step": 539, - "token_acc": 0.8069234097793163 - }, - { - "epoch": 1.3504380475594493, - "grad_norm": 1.3587812185287476, - "learning_rate": 1.7742883068638447e-05, - "loss": 0.8248769640922546, - "step": 540, - "token_acc": 0.7510279202725457 - }, - { - "epoch": 1.3529411764705883, - "grad_norm": 1.5436736345291138, - "learning_rate": 1.762553672556591e-05, - "loss": 0.8075623512268066, - "step": 541, - "token_acc": 0.7595460992907801 - }, - { - "epoch": 1.355444305381727, - "grad_norm": 2.2767934799194336, - "learning_rate": 1.7508368075093583e-05, - "loss": 0.7209601402282715, - "step": 542, - "token_acc": 0.7783203125 - }, - { - "epoch": 1.3579474342928661, - "grad_norm": 2.0432751178741455, - "learning_rate": 1.7391379940478076e-05, - "loss": 0.6441476345062256, - "step": 543, - "token_acc": 0.8064547869723507 - }, - { - "epoch": 1.360450563204005, - "grad_norm": 1.801803708076477, - "learning_rate": 1.7274575140626318e-05, - "loss": 0.7840845584869385, - "step": 544, - "token_acc": 0.7625759010640075 - }, - { - "epoch": 1.362953692115144, - "grad_norm": 2.2576844692230225, - "learning_rate": 1.7157956490027717e-05, - "loss": 0.754980742931366, - "step": 545, - "token_acc": 0.772340190223402 - }, - { - "epoch": 1.365456821026283, - "grad_norm": 7.710822105407715, - "learning_rate": 1.704152679868626e-05, - "loss": 0.6724915504455566, - "step": 546, - "token_acc": 0.7948899371069182 - }, - { - "epoch": 1.3679599499374218, - "grad_norm": 1.566840410232544, - "learning_rate": 1.6925288872052843e-05, - "loss": 0.805724024772644, - "step": 547, - "token_acc": 0.7583758937691522 - }, - { - "epoch": 1.3704630788485608, - "grad_norm": 2.7354047298431396, - "learning_rate": 1.6809245510957665e-05, - "loss": 0.8180174231529236, - "step": 548, - "token_acc": 0.7519490397413957 - }, - { - "epoch": 1.3729662077596996, - "grad_norm": 1.5053433179855347, - "learning_rate": 1.6693399511542735e-05, - "loss": 0.7254161834716797, - "step": 549, - "token_acc": 0.7824625502374863 - }, - { - "epoch": 1.3754693366708386, - "grad_norm": 1.9936115741729736, - "learning_rate": 1.65777536651945e-05, - "loss": 0.719433605670929, - "step": 550, - "token_acc": 0.7820769560863968 - }, - { - "epoch": 1.3779724655819774, - "grad_norm": 1.4493017196655273, - "learning_rate": 1.6462310758476595e-05, - "loss": 0.803730845451355, - "step": 551, - "token_acc": 0.7597644749754662 - }, - { - "epoch": 1.3804755944931164, - "grad_norm": 1.2181215286254883, - "learning_rate": 1.6347073573062672e-05, - "loss": 0.81937575340271, - "step": 552, - "token_acc": 0.7521792745673342 - }, - { - "epoch": 1.3829787234042552, - "grad_norm": 4.488533020019531, - "learning_rate": 1.6232044885669427e-05, - "loss": 0.7404607534408569, - "step": 553, - "token_acc": 0.7772408629959845 - }, - { - "epoch": 1.3854818523153942, - "grad_norm": 2.061286449432373, - "learning_rate": 1.6117227467989602e-05, - "loss": 0.6969904899597168, - "step": 554, - "token_acc": 0.7908102472445636 - }, - { - "epoch": 1.3879849812265332, - "grad_norm": 5.560731410980225, - "learning_rate": 1.6002624086625294e-05, - "loss": 0.8753557801246643, - "step": 555, - "token_acc": 0.7392388505089319 - }, - { - "epoch": 1.390488110137672, - "grad_norm": 2.4644906520843506, - "learning_rate": 1.588823750302126e-05, - "loss": 0.6984307169914246, - "step": 556, - "token_acc": 0.783540746688077 - }, - { - "epoch": 1.392991239048811, - "grad_norm": 6.086837291717529, - "learning_rate": 1.577407047339834e-05, - "loss": 0.7918856739997864, - "step": 557, - "token_acc": 0.7626044755998922 - }, - { - "epoch": 1.3954943679599499, - "grad_norm": 40.485443115234375, - "learning_rate": 1.5660125748687094e-05, - "loss": 0.6759528517723083, - "step": 558, - "token_acc": 0.7896958731799776 - }, - { - "epoch": 1.3979974968710889, - "grad_norm": 4.204066753387451, - "learning_rate": 1.5546406074461488e-05, - "loss": 0.8734142184257507, - "step": 559, - "token_acc": 0.7402841280209014 - }, - { - "epoch": 1.400500625782228, - "grad_norm": 1.534205436706543, - "learning_rate": 1.5432914190872757e-05, - "loss": 0.8061844110488892, - "step": 560, - "token_acc": 0.7598022502557109 - }, - { - "epoch": 1.4030037546933667, - "grad_norm": 2.5760042667388916, - "learning_rate": 1.5319652832583362e-05, - "loss": 0.7462766170501709, - "step": 561, - "token_acc": 0.7805115166018546 - }, - { - "epoch": 1.4055068836045057, - "grad_norm": 1.2807033061981201, - "learning_rate": 1.5206624728701103e-05, - "loss": 0.7794641256332397, - "step": 562, - "token_acc": 0.7705968754172787 - }, - { - "epoch": 1.4080100125156445, - "grad_norm": 1.3814904689788818, - "learning_rate": 1.5093832602713365e-05, - "loss": 0.8049334287643433, - "step": 563, - "token_acc": 0.7605047164032831 - }, - { - "epoch": 1.4105131414267835, - "grad_norm": 1.4789693355560303, - "learning_rate": 1.498127917242148e-05, - "loss": 0.6792148351669312, - "step": 564, - "token_acc": 0.7961648382041118 - }, - { - "epoch": 1.4130162703379223, - "grad_norm": 1.7311301231384277, - "learning_rate": 1.4868967149875257e-05, - "loss": 0.7710389494895935, - "step": 565, - "token_acc": 0.7728716399411264 - }, - { - "epoch": 1.4155193992490613, - "grad_norm": 1.134136438369751, - "learning_rate": 1.4756899241307615e-05, - "loss": 0.7549833059310913, - "step": 566, - "token_acc": 0.7709425608761505 - }, - { - "epoch": 1.4180225281602001, - "grad_norm": 2.795325994491577, - "learning_rate": 1.4645078147069402e-05, - "loss": 0.7068973183631897, - "step": 567, - "token_acc": 0.7866447278211984 - }, - { - "epoch": 1.4205256570713392, - "grad_norm": 2.4004311561584473, - "learning_rate": 1.4533506561564306e-05, - "loss": 0.7402547001838684, - "step": 568, - "token_acc": 0.7732777333485662 - }, - { - "epoch": 1.4230287859824782, - "grad_norm": 1.9645004272460938, - "learning_rate": 1.4422187173183899e-05, - "loss": 0.746313214302063, - "step": 569, - "token_acc": 0.7786008859019398 - }, - { - "epoch": 1.425531914893617, - "grad_norm": 7.375904560089111, - "learning_rate": 1.4311122664242954e-05, - "loss": 0.7958496809005737, - "step": 570, - "token_acc": 0.7603988464734347 - }, - { - "epoch": 1.428035043804756, - "grad_norm": 1.696038007736206, - "learning_rate": 1.4200315710914705e-05, - "loss": 0.7623685002326965, - "step": 571, - "token_acc": 0.7718207718207718 - }, - { - "epoch": 1.4305381727158948, - "grad_norm": 1.9560589790344238, - "learning_rate": 1.4089768983166444e-05, - "loss": 0.7280702590942383, - "step": 572, - "token_acc": 0.7799722429806768 - }, - { - "epoch": 1.4330413016270338, - "grad_norm": 2.5953147411346436, - "learning_rate": 1.3979485144695158e-05, - "loss": 0.654486894607544, - "step": 573, - "token_acc": 0.8006254290290595 - }, - { - "epoch": 1.4355444305381728, - "grad_norm": 1.1697745323181152, - "learning_rate": 1.38694668528633e-05, - "loss": 0.7936983108520508, - "step": 574, - "token_acc": 0.7653046280023433 - }, - { - "epoch": 1.4380475594493116, - "grad_norm": 2.1148157119750977, - "learning_rate": 1.3759716758634832e-05, - "loss": 0.8053967952728271, - "step": 575, - "token_acc": 0.7594241535590509 - }, - { - "epoch": 1.4405506883604506, - "grad_norm": 2.3193156719207764, - "learning_rate": 1.3650237506511331e-05, - "loss": 0.8046903610229492, - "step": 576, - "token_acc": 0.7616776718023966 - }, - { - "epoch": 1.4430538172715894, - "grad_norm": 4.965387344360352, - "learning_rate": 1.3541031734468212e-05, - "loss": 0.809991180896759, - "step": 577, - "token_acc": 0.7585025046137622 - }, - { - "epoch": 1.4455569461827285, - "grad_norm": 2.777501106262207, - "learning_rate": 1.3432102073891251e-05, - "loss": 0.6487606763839722, - "step": 578, - "token_acc": 0.8072299215227918 - }, - { - "epoch": 1.4480600750938675, - "grad_norm": 1.8217853307724, - "learning_rate": 1.3323451149513092e-05, - "loss": 0.6385177969932556, - "step": 579, - "token_acc": 0.8078879086663207 - }, - { - "epoch": 1.4505632040050063, - "grad_norm": 1.6126281023025513, - "learning_rate": 1.3215081579350058e-05, - "loss": 0.7538764476776123, - "step": 580, - "token_acc": 0.7765273311897106 - }, - { - "epoch": 1.453066332916145, - "grad_norm": 1.229370355606079, - "learning_rate": 1.3106995974639084e-05, - "loss": 0.7376300096511841, - "step": 581, - "token_acc": 0.7732833811391442 - }, - { - "epoch": 1.455569461827284, - "grad_norm": 1.6918634176254272, - "learning_rate": 1.2999196939774722e-05, - "loss": 0.9147740602493286, - "step": 582, - "token_acc": 0.7359253623768719 - }, - { - "epoch": 1.458072590738423, - "grad_norm": 6.232097625732422, - "learning_rate": 1.2891687072246472e-05, - "loss": 0.6440097093582153, - "step": 583, - "token_acc": 0.8036370671309732 - }, - { - "epoch": 1.460575719649562, - "grad_norm": 1.3691867589950562, - "learning_rate": 1.2784468962576136e-05, - "loss": 0.8547953963279724, - "step": 584, - "token_acc": 0.7434093093505424 - }, - { - "epoch": 1.463078848560701, - "grad_norm": 5.270246982574463, - "learning_rate": 1.2677545194255402e-05, - "loss": 0.7240179181098938, - "step": 585, - "token_acc": 0.7812846429735898 - }, - { - "epoch": 1.4655819774718397, - "grad_norm": 4.639716148376465, - "learning_rate": 1.2570918343683635e-05, - "loss": 0.7307671308517456, - "step": 586, - "token_acc": 0.7740117025831311 - }, - { - "epoch": 1.4680851063829787, - "grad_norm": 4.015777111053467, - "learning_rate": 1.2464590980105776e-05, - "loss": 0.8232721090316772, - "step": 587, - "token_acc": 0.7514532679573371 - }, - { - "epoch": 1.4705882352941178, - "grad_norm": 3.1545369625091553, - "learning_rate": 1.235856566555039e-05, - "loss": 0.6684552431106567, - "step": 588, - "token_acc": 0.7926829268292683 - }, - { - "epoch": 1.4730913642052565, - "grad_norm": 1.4123514890670776, - "learning_rate": 1.2252844954767984e-05, - "loss": 0.7221212983131409, - "step": 589, - "token_acc": 0.7806400809944316 - }, - { - "epoch": 1.4755944931163956, - "grad_norm": 2.0935285091400146, - "learning_rate": 1.2147431395169459e-05, - "loss": 0.6654121279716492, - "step": 590, - "token_acc": 0.7983262828765864 - }, - { - "epoch": 1.4780976220275344, - "grad_norm": 2.06630277633667, - "learning_rate": 1.2042327526764669e-05, - "loss": 0.7412019371986389, - "step": 591, - "token_acc": 0.7778124220503866 - }, - { - "epoch": 1.4806007509386734, - "grad_norm": 6.0032639503479, - "learning_rate": 1.1937535882101281e-05, - "loss": 0.6372846364974976, - "step": 592, - "token_acc": 0.803729146221786 - }, - { - "epoch": 1.4831038798498124, - "grad_norm": 4.389716148376465, - "learning_rate": 1.1833058986203705e-05, - "loss": 0.682616114616394, - "step": 593, - "token_acc": 0.7952238805970149 - }, - { - "epoch": 1.4856070087609512, - "grad_norm": 1.7360910177230835, - "learning_rate": 1.1728899356512265e-05, - "loss": 0.8019569516181946, - "step": 594, - "token_acc": 0.7640247879973907 - }, - { - "epoch": 1.48811013767209, - "grad_norm": 1.4876583814620972, - "learning_rate": 1.1625059502822574e-05, - "loss": 0.7209570407867432, - "step": 595, - "token_acc": 0.7803595962009438 - }, - { - "epoch": 1.490613266583229, - "grad_norm": 3.0514919757843018, - "learning_rate": 1.1521541927224994e-05, - "loss": 0.663855791091919, - "step": 596, - "token_acc": 0.801151700557855 - }, - { - "epoch": 1.493116395494368, - "grad_norm": 3.3372299671173096, - "learning_rate": 1.1418349124044405e-05, - "loss": 0.7273604273796082, - "step": 597, - "token_acc": 0.778789224393132 - }, - { - "epoch": 1.4956195244055068, - "grad_norm": 2.397977590560913, - "learning_rate": 1.1315483579780095e-05, - "loss": 0.884240984916687, - "step": 598, - "token_acc": 0.7410475340894609 - }, - { - "epoch": 1.4981226533166458, - "grad_norm": 2.4129981994628906, - "learning_rate": 1.1212947773045767e-05, - "loss": 0.6984825134277344, - "step": 599, - "token_acc": 0.786497277676951 - }, - { - "epoch": 1.5006257822277846, - "grad_norm": 0.9863743782043457, - "learning_rate": 1.1110744174509952e-05, - "loss": 0.7607206702232361, - "step": 600, - "token_acc": 0.7653004497902663 - }, - { - "epoch": 1.5031289111389237, - "grad_norm": 2.9565539360046387, - "learning_rate": 1.100887524683635e-05, - "loss": 0.7446565628051758, - "step": 601, - "token_acc": 0.773600569259962 - }, - { - "epoch": 1.5056320400500627, - "grad_norm": 1.515296220779419, - "learning_rate": 1.090734344462458e-05, - "loss": 0.888853132724762, - "step": 602, - "token_acc": 0.739697280885833 - }, - { - "epoch": 1.5081351689612015, - "grad_norm": 3.071218729019165, - "learning_rate": 1.0806151214350995e-05, - "loss": 0.7655630707740784, - "step": 603, - "token_acc": 0.7740929705215419 - }, - { - "epoch": 1.5106382978723403, - "grad_norm": 1.503035068511963, - "learning_rate": 1.0705300994309697e-05, - "loss": 0.747133731842041, - "step": 604, - "token_acc": 0.7726721139066418 - }, - { - "epoch": 1.5131414267834793, - "grad_norm": 1.4292892217636108, - "learning_rate": 1.0604795214553868e-05, - "loss": 0.6887509822845459, - "step": 605, - "token_acc": 0.7898035618741879 - }, - { - "epoch": 1.5156445556946183, - "grad_norm": 4.256486415863037, - "learning_rate": 1.0504636296837161e-05, - "loss": 0.8068586587905884, - "step": 606, - "token_acc": 0.7587569703860105 - }, - { - "epoch": 1.5181476846057573, - "grad_norm": 1.5744963884353638, - "learning_rate": 1.0404826654555342e-05, - "loss": 0.833703875541687, - "step": 607, - "token_acc": 0.7490119618485536 - }, - { - "epoch": 1.5206508135168961, - "grad_norm": 1.4943774938583374, - "learning_rate": 1.0305368692688174e-05, - "loss": 0.7888246178627014, - "step": 608, - "token_acc": 0.7641653905053599 - }, - { - "epoch": 1.523153942428035, - "grad_norm": 4.295377254486084, - "learning_rate": 1.0206264807741434e-05, - "loss": 0.7990449666976929, - "step": 609, - "token_acc": 0.7550613592474926 - }, - { - "epoch": 1.525657071339174, - "grad_norm": 1.5696173906326294, - "learning_rate": 1.0107517387689166e-05, - "loss": 0.6105284690856934, - "step": 610, - "token_acc": 0.8193157519600855 - }, - { - "epoch": 1.528160200250313, - "grad_norm": 1.4100733995437622, - "learning_rate": 1.0009128811916197e-05, - "loss": 0.6308101415634155, - "step": 611, - "token_acc": 0.8020977090808722 - }, - { - "epoch": 1.530663329161452, - "grad_norm": 1.636954426765442, - "learning_rate": 9.911101451160715e-06, - "loss": 0.7580888867378235, - "step": 612, - "token_acc": 0.7740969378399853 - }, - { - "epoch": 1.5331664580725908, - "grad_norm": 3.3348324298858643, - "learning_rate": 9.813437667457229e-06, - "loss": 0.6496917605400085, - "step": 613, - "token_acc": 0.8047304730473047 - }, - { - "epoch": 1.5356695869837296, - "grad_norm": 1.2093946933746338, - "learning_rate": 9.716139814079595e-06, - "loss": 0.8330615758895874, - "step": 614, - "token_acc": 0.7514138654127216 - }, - { - "epoch": 1.5381727158948686, - "grad_norm": 2.5762991905212402, - "learning_rate": 9.619210235484333e-06, - "loss": 0.7363358736038208, - "step": 615, - "token_acc": 0.7768673179955877 - }, - { - "epoch": 1.5406758448060076, - "grad_norm": 3.4001667499542236, - "learning_rate": 9.522651267254149e-06, - "loss": 0.7240384221076965, - "step": 616, - "token_acc": 0.7739171822941456 - }, - { - "epoch": 1.5431789737171464, - "grad_norm": 82.21798706054688, - "learning_rate": 9.426465236041651e-06, - "loss": 0.6950215697288513, - "step": 617, - "token_acc": 0.7900774304559793 - }, - { - "epoch": 1.5456821026282852, - "grad_norm": 1.1821529865264893, - "learning_rate": 9.330654459513266e-06, - "loss": 0.7954156398773193, - "step": 618, - "token_acc": 0.7626409334843188 - }, - { - "epoch": 1.5481852315394242, - "grad_norm": 2.2667031288146973, - "learning_rate": 9.235221246293405e-06, - "loss": 0.8089542388916016, - "step": 619, - "token_acc": 0.7574625144175318 - }, - { - "epoch": 1.5506883604505632, - "grad_norm": 1.9918934106826782, - "learning_rate": 9.140167895908867e-06, - "loss": 0.7781422138214111, - "step": 620, - "token_acc": 0.7674040568238037 - }, - { - "epoch": 1.5531914893617023, - "grad_norm": 3.942108631134033, - "learning_rate": 9.04549669873337e-06, - "loss": 0.8120257258415222, - "step": 621, - "token_acc": 0.7560487380330723 - }, - { - "epoch": 1.555694618272841, - "grad_norm": 1.7937588691711426, - "learning_rate": 8.951209935932426e-06, - "loss": 0.607784628868103, - "step": 622, - "token_acc": 0.8156992932105376 - }, - { - "epoch": 1.5581977471839799, - "grad_norm": 2.8172223567962646, - "learning_rate": 8.857309879408324e-06, - "loss": 0.6648784875869751, - "step": 623, - "token_acc": 0.80419430772523 - }, - { - "epoch": 1.5607008760951189, - "grad_norm": 3.8440911769866943, - "learning_rate": 8.763798791745411e-06, - "loss": 0.8074014186859131, - "step": 624, - "token_acc": 0.7604686482968106 - }, - { - "epoch": 1.563204005006258, - "grad_norm": 1.895396113395691, - "learning_rate": 8.670678926155587e-06, - "loss": 0.8305899500846863, - "step": 625, - "token_acc": 0.7504222361627177 - }, - { - "epoch": 1.565707133917397, - "grad_norm": 4.063203811645508, - "learning_rate": 8.577952526423969e-06, - "loss": 0.7936282157897949, - "step": 626, - "token_acc": 0.7642972633091802 - }, - { - "epoch": 1.5682102628285357, - "grad_norm": 2.0519766807556152, - "learning_rate": 8.48562182685487e-06, - "loss": 0.6997530460357666, - "step": 627, - "token_acc": 0.7890964093121137 - }, - { - "epoch": 1.5707133917396745, - "grad_norm": 1.731513500213623, - "learning_rate": 8.393689052217966e-06, - "loss": 0.6370196342468262, - "step": 628, - "token_acc": 0.8046017082098658 - }, - { - "epoch": 1.5732165206508135, - "grad_norm": 4.366064548492432, - "learning_rate": 8.3021564176946e-06, - "loss": 0.665263295173645, - "step": 629, - "token_acc": 0.7946243969676086 - }, - { - "epoch": 1.5757196495619525, - "grad_norm": 4.512490272521973, - "learning_rate": 8.211026128824539e-06, - "loss": 0.799260139465332, - "step": 630, - "token_acc": 0.7595476024479045 - }, - { - "epoch": 1.5782227784730913, - "grad_norm": 1.7154865264892578, - "learning_rate": 8.120300381452742e-06, - "loss": 0.8500877618789673, - "step": 631, - "token_acc": 0.7461655662772981 - }, - { - "epoch": 1.5807259073842301, - "grad_norm": 6.622365951538086, - "learning_rate": 8.029981361676456e-06, - "loss": 0.6213138103485107, - "step": 632, - "token_acc": 0.818997756170531 - }, - { - "epoch": 1.5832290362953692, - "grad_norm": 2.634678363800049, - "learning_rate": 7.940071245792579e-06, - "loss": 0.5984349250793457, - "step": 633, - "token_acc": 0.8174148526195189 - }, - { - "epoch": 1.5857321652065082, - "grad_norm": 3.43933367729187, - "learning_rate": 7.850572200245184e-06, - "loss": 0.6845875978469849, - "step": 634, - "token_acc": 0.7913089653951677 - }, - { - "epoch": 1.5882352941176472, - "grad_norm": 1.6064105033874512, - "learning_rate": 7.761486381573327e-06, - "loss": 0.688270092010498, - "step": 635, - "token_acc": 0.7903402854006586 - }, - { - "epoch": 1.590738423028786, - "grad_norm": 5.203895092010498, - "learning_rate": 7.672815936359107e-06, - "loss": 0.7587708234786987, - "step": 636, - "token_acc": 0.7722510074841681 - }, - { - "epoch": 1.5932415519399248, - "grad_norm": 1.948972225189209, - "learning_rate": 7.584563001175896e-06, - "loss": 0.8170541524887085, - "step": 637, - "token_acc": 0.754481905939417 - }, - { - "epoch": 1.5957446808510638, - "grad_norm": 4.16902494430542, - "learning_rate": 7.4967297025369114e-06, - "loss": 0.5899007320404053, - "step": 638, - "token_acc": 0.8284804903925498 - }, - { - "epoch": 1.5982478097622028, - "grad_norm": 0.9599528312683105, - "learning_rate": 7.409318156843933e-06, - "loss": 0.9341171979904175, - "step": 639, - "token_acc": 0.7272269753397081 - }, - { - "epoch": 1.6007509386733418, - "grad_norm": 1.6862908601760864, - "learning_rate": 7.3223304703363135e-06, - "loss": 0.7237805128097534, - "step": 640, - "token_acc": 0.7798726587129876 - }, - { - "epoch": 1.6032540675844806, - "grad_norm": 9.259711265563965, - "learning_rate": 7.235768739040258e-06, - "loss": 0.7982171177864075, - "step": 641, - "token_acc": 0.7613955353562358 - }, - { - "epoch": 1.6057571964956194, - "grad_norm": 2.008246660232544, - "learning_rate": 7.149635048718295e-06, - "loss": 0.8156529068946838, - "step": 642, - "token_acc": 0.755189366351056 - }, - { - "epoch": 1.6082603254067585, - "grad_norm": 5.8708086013793945, - "learning_rate": 7.063931474819005e-06, - "loss": 0.9388906955718994, - "step": 643, - "token_acc": 0.7229799968498977 - }, - { - "epoch": 1.6107634543178975, - "grad_norm": 1.3190078735351562, - "learning_rate": 6.9786600824270296e-06, - "loss": 0.8693231344223022, - "step": 644, - "token_acc": 0.7392319943372855 - }, - { - "epoch": 1.6132665832290363, - "grad_norm": 4.078483581542969, - "learning_rate": 6.893822926213331e-06, - "loss": 0.7646411657333374, - "step": 645, - "token_acc": 0.7693258166653796 - }, - { - "epoch": 1.615769712140175, - "grad_norm": 2.5179286003112793, - "learning_rate": 6.8094220503856275e-06, - "loss": 0.7106481790542603, - "step": 646, - "token_acc": 0.7891617273497037 - }, - { - "epoch": 1.618272841051314, - "grad_norm": 5.133343696594238, - "learning_rate": 6.725459488639211e-06, - "loss": 0.8767869472503662, - "step": 647, - "token_acc": 0.740031118026228 - }, - { - "epoch": 1.620775969962453, - "grad_norm": 8.591869354248047, - "learning_rate": 6.641937264107867e-06, - "loss": 0.7623345851898193, - "step": 648, - "token_acc": 0.7718807508281192 - }, - { - "epoch": 1.6232790988735921, - "grad_norm": 2.7604572772979736, - "learning_rate": 6.558857389315179e-06, - "loss": 0.5968680381774902, - "step": 649, - "token_acc": 0.8168473351400181 - }, - { - "epoch": 1.625782227784731, - "grad_norm": 2.0458874702453613, - "learning_rate": 6.476221866126029e-06, - "loss": 0.8066359162330627, - "step": 650, - "token_acc": 0.7615060638351855 - }, - { - "epoch": 1.6282853566958697, - "grad_norm": 4.87338924407959, - "learning_rate": 6.394032685698325e-06, - "loss": 0.8087641000747681, - "step": 651, - "token_acc": 0.7571403539512879 - }, - { - "epoch": 1.6307884856070087, - "grad_norm": 4.343956470489502, - "learning_rate": 6.312291828435077e-06, - "loss": 0.6187503933906555, - "step": 652, - "token_acc": 0.8083971686221274 - }, - { - "epoch": 1.6332916145181477, - "grad_norm": 1.9018688201904297, - "learning_rate": 6.231001263936651e-06, - "loss": 0.7172440886497498, - "step": 653, - "token_acc": 0.785246368555967 - }, - { - "epoch": 1.6357947434292868, - "grad_norm": 2.832977294921875, - "learning_rate": 6.150162950953264e-06, - "loss": 0.8469364643096924, - "step": 654, - "token_acc": 0.7480813982274596 - }, - { - "epoch": 1.6382978723404256, - "grad_norm": 3.063286304473877, - "learning_rate": 6.069778837337886e-06, - "loss": 0.8357624411582947, - "step": 655, - "token_acc": 0.750551461960858 - }, - { - "epoch": 1.6408010012515644, - "grad_norm": 1.9779434204101562, - "learning_rate": 5.989850859999227e-06, - "loss": 0.7701696157455444, - "step": 656, - "token_acc": 0.7706332533013205 - }, - { - "epoch": 1.6433041301627034, - "grad_norm": 1.5771499872207642, - "learning_rate": 5.910380944855087e-06, - "loss": 0.8876208662986755, - "step": 657, - "token_acc": 0.7388784978178751 - }, - { - "epoch": 1.6458072590738424, - "grad_norm": 3.870481491088867, - "learning_rate": 5.8313710067859626e-06, - "loss": 0.6020152568817139, - "step": 658, - "token_acc": 0.8167606083164948 - }, - { - "epoch": 1.6483103879849812, - "grad_norm": 12.5064115524292, - "learning_rate": 5.752822949588893e-06, - "loss": 0.797656774520874, - "step": 659, - "token_acc": 0.763301282051282 - }, - { - "epoch": 1.65081351689612, - "grad_norm": 1.7182737588882446, - "learning_rate": 5.674738665931575e-06, - "loss": 0.7682387828826904, - "step": 660, - "token_acc": 0.7715017939518196 - }, - { - "epoch": 1.653316645807259, - "grad_norm": 7.001367092132568, - "learning_rate": 5.597120037306808e-06, - "loss": 0.7216060757637024, - "step": 661, - "token_acc": 0.7849521852525093 - }, - { - "epoch": 1.655819774718398, - "grad_norm": 1.8173643350601196, - "learning_rate": 5.519968933987083e-06, - "loss": 0.7159848213195801, - "step": 662, - "token_acc": 0.7893794749403341 - }, - { - "epoch": 1.658322903629537, - "grad_norm": 8.282748222351074, - "learning_rate": 5.443287214979592e-06, - "loss": 0.5917546153068542, - "step": 663, - "token_acc": 0.8188921165982169 - }, - { - "epoch": 1.6608260325406758, - "grad_norm": 2.099350690841675, - "learning_rate": 5.367076727981382e-06, - "loss": 0.636560320854187, - "step": 664, - "token_acc": 0.8062931115940659 - }, - { - "epoch": 1.6633291614518146, - "grad_norm": 4.317834854125977, - "learning_rate": 5.291339309334845e-06, - "loss": 0.6860729455947876, - "step": 665, - "token_acc": 0.7957957957957958 - }, - { - "epoch": 1.6658322903629537, - "grad_norm": 5.11480712890625, - "learning_rate": 5.216076783983493e-06, - "loss": 0.6779101490974426, - "step": 666, - "token_acc": 0.7967749313815188 - }, - { - "epoch": 1.6683354192740927, - "grad_norm": 1.5895123481750488, - "learning_rate": 5.141290965427966e-06, - "loss": 0.8478509187698364, - "step": 667, - "token_acc": 0.7479652886325662 - }, - { - "epoch": 1.6708385481852317, - "grad_norm": 3.479113817214966, - "learning_rate": 5.066983655682325e-06, - "loss": 0.8040021657943726, - "step": 668, - "token_acc": 0.7578496924311313 - }, - { - "epoch": 1.6733416770963705, - "grad_norm": 1.4634630680084229, - "learning_rate": 4.993156645230643e-06, - "loss": 0.799077033996582, - "step": 669, - "token_acc": 0.7607260726072608 - }, - { - "epoch": 1.6758448060075093, - "grad_norm": 6.28387451171875, - "learning_rate": 4.91981171298388e-06, - "loss": 0.7174551486968994, - "step": 670, - "token_acc": 0.7794550810014728 - }, - { - "epoch": 1.6783479349186483, - "grad_norm": 3.8518054485321045, - "learning_rate": 4.846950626236976e-06, - "loss": 0.8177169561386108, - "step": 671, - "token_acc": 0.7455885405854266 - }, - { - "epoch": 1.6808510638297873, - "grad_norm": 3.1458609104156494, - "learning_rate": 4.7745751406263165e-06, - "loss": 0.7765710353851318, - "step": 672, - "token_acc": 0.7667461521786256 - }, - { - "epoch": 1.6833541927409261, - "grad_norm": 1.782895565032959, - "learning_rate": 4.702687000087386e-06, - "loss": 0.687012791633606, - "step": 673, - "token_acc": 0.7832773746344633 - }, - { - "epoch": 1.685857321652065, - "grad_norm": 2.870626449584961, - "learning_rate": 4.631287936812764e-06, - "loss": 0.755160927772522, - "step": 674, - "token_acc": 0.7690091515083042 - }, - { - "epoch": 1.688360450563204, - "grad_norm": 2.437972068786621, - "learning_rate": 4.56037967121041e-06, - "loss": 0.7369386553764343, - "step": 675, - "token_acc": 0.7773949579831932 - }, - { - "epoch": 1.690863579474343, - "grad_norm": 1.6886603832244873, - "learning_rate": 4.48996391186216e-06, - "loss": 0.8560739755630493, - "step": 676, - "token_acc": 0.7430776214253291 - }, - { - "epoch": 1.693366708385482, - "grad_norm": 21.07199478149414, - "learning_rate": 4.420042355482601e-06, - "loss": 0.781265377998352, - "step": 677, - "token_acc": 0.7665111841407823 - }, - { - "epoch": 1.6958698372966208, - "grad_norm": 1.2242755889892578, - "learning_rate": 4.350616686878176e-06, - "loss": 0.7612134218215942, - "step": 678, - "token_acc": 0.7721851406061933 - }, - { - "epoch": 1.6983729662077596, - "grad_norm": 0.8354982733726501, - "learning_rate": 4.2816885789065504e-06, - "loss": 0.8463018536567688, - "step": 679, - "token_acc": 0.7483333886106597 - }, - { - "epoch": 1.7008760951188986, - "grad_norm": 2.063284397125244, - "learning_rate": 4.213259692436367e-06, - "loss": 0.7081665992736816, - "step": 680, - "token_acc": 0.7886647454370798 - }, - { - "epoch": 1.7033792240300376, - "grad_norm": 3.285679578781128, - "learning_rate": 4.1453316763071935e-06, - "loss": 0.7210719585418701, - "step": 681, - "token_acc": 0.7862992125984252 - }, - { - "epoch": 1.7058823529411766, - "grad_norm": 2.652149200439453, - "learning_rate": 4.077906167289766e-06, - "loss": 0.7026036977767944, - "step": 682, - "token_acc": 0.7869218738363 - }, - { - "epoch": 1.7083854818523154, - "grad_norm": 4.502437114715576, - "learning_rate": 4.010984790046615e-06, - "loss": 0.6683995723724365, - "step": 683, - "token_acc": 0.8000765990042129 - }, - { - "epoch": 1.7108886107634542, - "grad_norm": 1.6601204872131348, - "learning_rate": 3.944569157092839e-06, - "loss": 0.8401004672050476, - "step": 684, - "token_acc": 0.7523236102180394 - }, - { - "epoch": 1.7133917396745932, - "grad_norm": 2.283055067062378, - "learning_rate": 3.878660868757323e-06, - "loss": 0.6021827459335327, - "step": 685, - "token_acc": 0.8168639560816606 - }, - { - "epoch": 1.7158948685857323, - "grad_norm": 4.256300449371338, - "learning_rate": 3.8132615131441396e-06, - "loss": 0.8827997446060181, - "step": 686, - "token_acc": 0.7379034203290077 - }, - { - "epoch": 1.718397997496871, - "grad_norm": 2.741607189178467, - "learning_rate": 3.748372666094277e-06, - "loss": 0.8296160697937012, - "step": 687, - "token_acc": 0.7515824236308596 - }, - { - "epoch": 1.7209011264080099, - "grad_norm": 2.7922463417053223, - "learning_rate": 3.6839958911476957e-06, - "loss": 0.6963903307914734, - "step": 688, - "token_acc": 0.7873990565283441 - }, - { - "epoch": 1.7234042553191489, - "grad_norm": 3.104214668273926, - "learning_rate": 3.6201327395056246e-06, - "loss": 0.6887581944465637, - "step": 689, - "token_acc": 0.7897428808404755 - }, - { - "epoch": 1.7259073842302879, - "grad_norm": 1.7422378063201904, - "learning_rate": 3.5567847499932e-06, - "loss": 0.7376011610031128, - "step": 690, - "token_acc": 0.7791123130766784 - }, - { - "epoch": 1.728410513141427, - "grad_norm": 4.056087017059326, - "learning_rate": 3.4939534490223912e-06, - "loss": 0.6779285669326782, - "step": 691, - "token_acc": 0.7956978388204403 - }, - { - "epoch": 1.7309136420525657, - "grad_norm": 2.119060754776001, - "learning_rate": 3.431640350555204e-06, - "loss": 0.607970118522644, - "step": 692, - "token_acc": 0.8137347130761995 - }, - { - "epoch": 1.7334167709637045, - "grad_norm": 3.5627596378326416, - "learning_rate": 3.369846956067224e-06, - "loss": 0.6902151703834534, - "step": 693, - "token_acc": 0.7917407065178762 - }, - { - "epoch": 1.7359198998748435, - "grad_norm": 1.4984737634658813, - "learning_rate": 3.308574754511404e-06, - "loss": 0.7758938074111938, - "step": 694, - "token_acc": 0.762149109568367 - }, - { - "epoch": 1.7384230287859825, - "grad_norm": 1.5274784564971924, - "learning_rate": 3.2478252222822164e-06, - "loss": 0.7710534930229187, - "step": 695, - "token_acc": 0.7703561400916211 - }, - { - "epoch": 1.7409261576971216, - "grad_norm": 2.8826518058776855, - "learning_rate": 3.187599823180071e-06, - "loss": 0.7928391098976135, - "step": 696, - "token_acc": 0.7606636399304971 - }, - { - "epoch": 1.7434292866082604, - "grad_norm": 2.2529659271240234, - "learning_rate": 3.1279000083760447e-06, - "loss": 0.6973885297775269, - "step": 697, - "token_acc": 0.7895693858996611 - }, - { - "epoch": 1.7459324155193992, - "grad_norm": 2.2448058128356934, - "learning_rate": 3.0687272163768987e-06, - "loss": 0.743259072303772, - "step": 698, - "token_acc": 0.7773190556057283 - }, - { - "epoch": 1.7484355444305382, - "grad_norm": 1.8807514905929565, - "learning_rate": 3.0100828729904275e-06, - "loss": 0.8025498390197754, - "step": 699, - "token_acc": 0.7638834444008885 - }, - { - "epoch": 1.7509386733416772, - "grad_norm": 1.153306245803833, - "learning_rate": 2.9519683912911266e-06, - "loss": 0.893805980682373, - "step": 700, - "token_acc": 0.7385200734715298 - }, - { - "epoch": 1.753441802252816, - "grad_norm": 2.2380430698394775, - "learning_rate": 2.894385171586095e-06, - "loss": 0.8276506662368774, - "step": 701, - "token_acc": 0.7531895732225947 - }, - { - "epoch": 1.7559449311639548, - "grad_norm": 1.6930055618286133, - "learning_rate": 2.837334601381342e-06, - "loss": 0.8278867602348328, - "step": 702, - "token_acc": 0.7534786253143336 - }, - { - "epoch": 1.7584480600750938, - "grad_norm": 3.543760061264038, - "learning_rate": 2.7808180553483165e-06, - "loss": 0.6783448457717896, - "step": 703, - "token_acc": 0.7924724474942816 - }, - { - "epoch": 1.7609511889862328, - "grad_norm": 1.704220175743103, - "learning_rate": 2.7248368952908053e-06, - "loss": 0.8161231279373169, - "step": 704, - "token_acc": 0.7625753361149745 - }, - { - "epoch": 1.7634543178973718, - "grad_norm": 1.620800256729126, - "learning_rate": 2.66939247011212e-06, - "loss": 0.768420934677124, - "step": 705, - "token_acc": 0.7742177253138467 - }, - { - "epoch": 1.7659574468085106, - "grad_norm": 1.7285171747207642, - "learning_rate": 2.6144861157825774e-06, - "loss": 0.7348212003707886, - "step": 706, - "token_acc": 0.7808262377798801 - }, - { - "epoch": 1.7684605757196494, - "grad_norm": 1.4333690404891968, - "learning_rate": 2.560119155307325e-06, - "loss": 0.7314651608467102, - "step": 707, - "token_acc": 0.7796940845949742 - }, - { - "epoch": 1.7709637046307884, - "grad_norm": 1.7918055057525635, - "learning_rate": 2.506292898694468e-06, - "loss": 0.8795416355133057, - "step": 708, - "token_acc": 0.737824045723617 - }, - { - "epoch": 1.7734668335419275, - "grad_norm": 2.1157777309417725, - "learning_rate": 2.45300864292346e-06, - "loss": 0.894432783126831, - "step": 709, - "token_acc": 0.7341743737092574 - }, - { - "epoch": 1.7759699624530665, - "grad_norm": 1.042678713798523, - "learning_rate": 2.4002676719139166e-06, - "loss": 0.717205822467804, - "step": 710, - "token_acc": 0.7850774581093898 - }, - { - "epoch": 1.7784730913642053, - "grad_norm": 2.729677200317383, - "learning_rate": 2.348071256494633e-06, - "loss": 0.738883376121521, - "step": 711, - "token_acc": 0.774821622929012 - }, - { - "epoch": 1.780976220275344, - "grad_norm": 1.8060981035232544, - "learning_rate": 2.296420654372966e-06, - "loss": 0.8860949277877808, - "step": 712, - "token_acc": 0.7436983689896208 - }, - { - "epoch": 1.783479349186483, - "grad_norm": 1.4554176330566406, - "learning_rate": 2.2453171101045585e-06, - "loss": 0.7235304713249207, - "step": 713, - "token_acc": 0.7811943910598619 - }, - { - "epoch": 1.7859824780976221, - "grad_norm": 2.336805820465088, - "learning_rate": 2.1947618550633097e-06, - "loss": 0.778596818447113, - "step": 714, - "token_acc": 0.7634328358208955 - }, - { - "epoch": 1.788485607008761, - "grad_norm": 3.8445966243743896, - "learning_rate": 2.144756107411733e-06, - "loss": 0.7483553886413574, - "step": 715, - "token_acc": 0.7775210084033614 - }, - { - "epoch": 1.7909887359198997, - "grad_norm": 2.3585619926452637, - "learning_rate": 2.0953010720716037e-06, - "loss": 0.716320276260376, - "step": 716, - "token_acc": 0.7816982878297085 - }, - { - "epoch": 1.7934918648310387, - "grad_norm": 1.595811128616333, - "learning_rate": 2.0463979406949026e-06, - "loss": 0.8576230406761169, - "step": 717, - "token_acc": 0.746366182157621 - }, - { - "epoch": 1.7959949937421777, - "grad_norm": 1.7587617635726929, - "learning_rate": 1.99804789163513e-06, - "loss": 0.7772994041442871, - "step": 718, - "token_acc": 0.7629286376274328 - }, - { - "epoch": 1.7984981226533168, - "grad_norm": 1.4931272268295288, - "learning_rate": 1.9502520899188913e-06, - "loss": 0.7527475357055664, - "step": 719, - "token_acc": 0.7721652929382936 - }, - { - "epoch": 1.8010012515644556, - "grad_norm": 1.531715750694275, - "learning_rate": 1.9030116872178316e-06, - "loss": 0.6039245128631592, - "step": 720, - "token_acc": 0.8160659114315139 - }, - { - "epoch": 1.8035043804755944, - "grad_norm": 2.856832265853882, - "learning_rate": 1.8563278218208996e-06, - "loss": 0.6180843114852905, - "step": 721, - "token_acc": 0.8108873823737731 - }, - { - "epoch": 1.8060075093867334, - "grad_norm": 1.1132346391677856, - "learning_rate": 1.8102016186068993e-06, - "loss": 0.8737172484397888, - "step": 722, - "token_acc": 0.7398431570958766 - }, - { - "epoch": 1.8085106382978724, - "grad_norm": 6.132575511932373, - "learning_rate": 1.7646341890173918e-06, - "loss": 0.8254008293151855, - "step": 723, - "token_acc": 0.751407584175398 - }, - { - "epoch": 1.8110137672090114, - "grad_norm": 2.00321102142334, - "learning_rate": 1.7196266310299108e-06, - "loss": 0.733837902545929, - "step": 724, - "token_acc": 0.7794028031687995 - }, - { - "epoch": 1.8135168961201502, - "grad_norm": 6.0143303871154785, - "learning_rate": 1.675180029131529e-06, - "loss": 0.7438793778419495, - "step": 725, - "token_acc": 0.7769918868317037 - }, - { - "epoch": 1.816020025031289, - "grad_norm": 2.49967885017395, - "learning_rate": 1.631295454292689e-06, - "loss": 0.7499393224716187, - "step": 726, - "token_acc": 0.775504799735187 - }, - { - "epoch": 1.818523153942428, - "grad_norm": 1.4528077840805054, - "learning_rate": 1.5879739639414333e-06, - "loss": 0.7836969494819641, - "step": 727, - "token_acc": 0.7696645543863729 - }, - { - "epoch": 1.821026282853567, - "grad_norm": 22.462095260620117, - "learning_rate": 1.5452166019378989e-06, - "loss": 0.7196674942970276, - "step": 728, - "token_acc": 0.7898250961608244 - }, - { - "epoch": 1.8235294117647058, - "grad_norm": 3.007601737976074, - "learning_rate": 1.5030243985491743e-06, - "loss": 0.7916804552078247, - "step": 729, - "token_acc": 0.7576646375207526 - }, - { - "epoch": 1.8260325406758446, - "grad_norm": 2.6443252563476562, - "learning_rate": 1.4613983704244826e-06, - "loss": 0.7311182022094727, - "step": 730, - "token_acc": 0.7860810039931546 - }, - { - "epoch": 1.8285356695869837, - "grad_norm": 1.2065683603286743, - "learning_rate": 1.4203395205706683e-06, - "loss": 0.7740092277526855, - "step": 731, - "token_acc": 0.7687374985292388 - }, - { - "epoch": 1.8310387984981227, - "grad_norm": 1.1605993509292603, - "learning_rate": 1.379848838328049e-06, - "loss": 0.7189797163009644, - "step": 732, - "token_acc": 0.7794039984911354 - }, - { - "epoch": 1.8335419274092617, - "grad_norm": 1.9326108694076538, - "learning_rate": 1.3399272993465607e-06, - "loss": 0.7424600124359131, - "step": 733, - "token_acc": 0.7825671804665121 - }, - { - "epoch": 1.8360450563204005, - "grad_norm": 2.958646535873413, - "learning_rate": 1.3005758655622424e-06, - "loss": 0.8237686157226562, - "step": 734, - "token_acc": 0.7547775902433712 - }, - { - "epoch": 1.8385481852315393, - "grad_norm": 1.700523018836975, - "learning_rate": 1.2617954851740832e-06, - "loss": 0.8861091136932373, - "step": 735, - "token_acc": 0.7374762500579267 - }, - { - "epoch": 1.8410513141426783, - "grad_norm": 1.633963942527771, - "learning_rate": 1.2235870926211619e-06, - "loss": 0.8130168914794922, - "step": 736, - "token_acc": 0.7547261035633128 - }, - { - "epoch": 1.8435544430538173, - "grad_norm": 3.219843864440918, - "learning_rate": 1.185951608560118e-06, - "loss": 0.6266460418701172, - "step": 737, - "token_acc": 0.8112291350531108 - }, - { - "epoch": 1.8460575719649563, - "grad_norm": 2.2112655639648438, - "learning_rate": 1.1488899398429898e-06, - "loss": 0.6900491118431091, - "step": 738, - "token_acc": 0.7942750756341633 - }, - { - "epoch": 1.8485607008760951, - "grad_norm": 6.101293563842773, - "learning_rate": 1.1124029794953472e-06, - "loss": 0.7254830598831177, - "step": 739, - "token_acc": 0.7787065180682202 - }, - { - "epoch": 1.851063829787234, - "grad_norm": 2.3905293941497803, - "learning_rate": 1.0764916066947794e-06, - "loss": 0.7382086515426636, - "step": 740, - "token_acc": 0.7783818923231488 - }, - { - "epoch": 1.853566958698373, - "grad_norm": 1.8113223314285278, - "learning_rate": 1.041156686749717e-06, - "loss": 0.811902642250061, - "step": 741, - "token_acc": 0.7596169453010875 - }, - { - "epoch": 1.856070087609512, - "grad_norm": 4.407388687133789, - "learning_rate": 1.0063990710785648e-06, - "loss": 0.7142600417137146, - "step": 742, - "token_acc": 0.7852945724447193 - }, - { - "epoch": 1.8585732165206508, - "grad_norm": 1.1643099784851074, - "learning_rate": 9.72219597189211e-07, - "loss": 0.8047236204147339, - "step": 743, - "token_acc": 0.7600485865724381 - }, - { - "epoch": 1.8610763454317898, - "grad_norm": 2.4160287380218506, - "learning_rate": 9.386190886588208e-07, - "loss": 0.6937112808227539, - "step": 744, - "token_acc": 0.7878059305838111 - }, - { - "epoch": 1.8635794743429286, - "grad_norm": 1.315184473991394, - "learning_rate": 9.05598355114004e-07, - "loss": 0.876803994178772, - "step": 745, - "token_acc": 0.7401197096404466 - }, - { - "epoch": 1.8660826032540676, - "grad_norm": 2.9270501136779785, - "learning_rate": 8.731581922113153e-07, - "loss": 0.7580727338790894, - "step": 746, - "token_acc": 0.7737367235275185 - }, - { - "epoch": 1.8685857321652066, - "grad_norm": 1.6372531652450562, - "learning_rate": 8.412993816180687e-07, - "loss": 0.7181699275970459, - "step": 747, - "token_acc": 0.779748401732316 - }, - { - "epoch": 1.8710888610763454, - "grad_norm": 1.4564203023910522, - "learning_rate": 8.10022690993506e-07, - "loss": 0.8921884298324585, - "step": 748, - "token_acc": 0.7377817853922453 - }, - { - "epoch": 1.8735919899874842, - "grad_norm": 4.111305236816406, - "learning_rate": 7.793288739703003e-07, - "loss": 0.8103642463684082, - "step": 749, - "token_acc": 0.7564119255305298 - }, - { - "epoch": 1.8760951188986232, - "grad_norm": 2.841183662414551, - "learning_rate": 7.492186701364007e-07, - "loss": 0.7386457920074463, - "step": 750, - "token_acc": 0.7820195137060555 - }, - { - "epoch": 1.8785982478097623, - "grad_norm": 2.0187108516693115, - "learning_rate": 7.196928050172053e-07, - "loss": 0.7814586758613586, - "step": 751, - "token_acc": 0.7652768936982813 - }, - { - "epoch": 1.8811013767209013, - "grad_norm": 3.561798334121704, - "learning_rate": 6.907519900580861e-07, - "loss": 0.6460806131362915, - "step": 752, - "token_acc": 0.8037120359955006 - }, - { - "epoch": 1.88360450563204, - "grad_norm": 3.151549816131592, - "learning_rate": 6.623969226072363e-07, - "loss": 0.7674912214279175, - "step": 753, - "token_acc": 0.7724372607401105 - }, - { - "epoch": 1.8861076345431789, - "grad_norm": 2.0892200469970703, - "learning_rate": 6.34628285898875e-07, - "loss": 0.8482470512390137, - "step": 754, - "token_acc": 0.7474721941354904 - }, - { - "epoch": 1.8886107634543179, - "grad_norm": 1.6496350765228271, - "learning_rate": 6.074467490367885e-07, - "loss": 0.7435787320137024, - "step": 755, - "token_acc": 0.7757959211146261 - }, - { - "epoch": 1.891113892365457, - "grad_norm": 1.8355616331100464, - "learning_rate": 5.808529669781904e-07, - "loss": 0.7615770101547241, - "step": 756, - "token_acc": 0.7705570291777188 - }, - { - "epoch": 1.8936170212765957, - "grad_norm": 2.422044277191162, - "learning_rate": 5.548475805179587e-07, - "loss": 0.7810842394828796, - "step": 757, - "token_acc": 0.7644932774324129 - }, - { - "epoch": 1.8961201501877347, - "grad_norm": 2.868595838546753, - "learning_rate": 5.294312162731934e-07, - "loss": 0.6938495635986328, - "step": 758, - "token_acc": 0.788420245398773 - }, - { - "epoch": 1.8986232790988735, - "grad_norm": 4.853105545043945, - "learning_rate": 5.046044866680949e-07, - "loss": 0.791533887386322, - "step": 759, - "token_acc": 0.7672524646378054 - }, - { - "epoch": 1.9011264080100125, - "grad_norm": 1.6451623439788818, - "learning_rate": 4.803679899192392e-07, - "loss": 0.7878414988517761, - "step": 760, - "token_acc": 0.761115797083986 - }, - { - "epoch": 1.9036295369211516, - "grad_norm": 1.6281623840332031, - "learning_rate": 4.5672231002114596e-07, - "loss": 0.7406682968139648, - "step": 761, - "token_acc": 0.7717826501429933 - }, - { - "epoch": 1.9061326658322904, - "grad_norm": 1.777449131011963, - "learning_rate": 4.3366801673220545e-07, - "loss": 0.7335410118103027, - "step": 762, - "token_acc": 0.7766620058472099 - }, - { - "epoch": 1.9086357947434291, - "grad_norm": 2.0511081218719482, - "learning_rate": 4.1120566556096254e-07, - "loss": 0.7191562652587891, - "step": 763, - "token_acc": 0.777927795714705 - }, - { - "epoch": 1.9111389236545682, - "grad_norm": 34.73859786987305, - "learning_rate": 3.8933579775271013e-07, - "loss": 0.6233887672424316, - "step": 764, - "token_acc": 0.8098615719025283 - }, - { - "epoch": 1.9136420525657072, - "grad_norm": 4.507017612457275, - "learning_rate": 3.680589402764695e-07, - "loss": 0.7649139761924744, - "step": 765, - "token_acc": 0.7664914450628736 - }, - { - "epoch": 1.9161451814768462, - "grad_norm": 1.5273257493972778, - "learning_rate": 3.4737560581228344e-07, - "loss": 0.7493445873260498, - "step": 766, - "token_acc": 0.7755552669177815 - }, - { - "epoch": 1.918648310387985, - "grad_norm": 1.2997462749481201, - "learning_rate": 3.2728629273885425e-07, - "loss": 0.8165085315704346, - "step": 767, - "token_acc": 0.7531951150241408 - }, - { - "epoch": 1.9211514392991238, - "grad_norm": 2.502765655517578, - "learning_rate": 3.077914851215585e-07, - "loss": 0.7242743372917175, - "step": 768, - "token_acc": 0.7824535192563081 - }, - { - "epoch": 1.9236545682102628, - "grad_norm": 2.90618896484375, - "learning_rate": 2.8889165270075126e-07, - "loss": 0.6685161590576172, - "step": 769, - "token_acc": 0.7950128346167951 - }, - { - "epoch": 1.9261576971214018, - "grad_norm": 2.6155359745025635, - "learning_rate": 2.705872508804747e-07, - "loss": 0.6183698177337646, - "step": 770, - "token_acc": 0.8151649235720032 - }, - { - "epoch": 1.9286608260325406, - "grad_norm": 2.363255500793457, - "learning_rate": 2.5287872071747543e-07, - "loss": 0.8080651760101318, - "step": 771, - "token_acc": 0.7587373167981961 - }, - { - "epoch": 1.9311639549436797, - "grad_norm": 8.026527404785156, - "learning_rate": 2.3576648891056875e-07, - "loss": 0.6179733276367188, - "step": 772, - "token_acc": 0.8178614579138139 - }, - { - "epoch": 1.9336670838548184, - "grad_norm": 3.891880512237549, - "learning_rate": 2.192509677903687e-07, - "loss": 0.785454273223877, - "step": 773, - "token_acc": 0.7663445975771249 - }, - { - "epoch": 1.9361702127659575, - "grad_norm": 0.9011037945747375, - "learning_rate": 2.0333255530934902e-07, - "loss": 0.8462287187576294, - "step": 774, - "token_acc": 0.7474073788503798 - }, - { - "epoch": 1.9386733416770965, - "grad_norm": 1.7468829154968262, - "learning_rate": 1.8801163503225083e-07, - "loss": 0.755885124206543, - "step": 775, - "token_acc": 0.7779124876005731 - }, - { - "epoch": 1.9411764705882353, - "grad_norm": 16.33168601989746, - "learning_rate": 1.732885761268427e-07, - "loss": 0.742058515548706, - "step": 776, - "token_acc": 0.7788488800680465 - }, - { - "epoch": 1.943679599499374, - "grad_norm": 19.74774932861328, - "learning_rate": 1.5916373335503054e-07, - "loss": 0.7660764455795288, - "step": 777, - "token_acc": 0.7678982434887947 - }, - { - "epoch": 1.946182728410513, - "grad_norm": 1.5675026178359985, - "learning_rate": 1.4563744706429515e-07, - "loss": 0.6421328783035278, - "step": 778, - "token_acc": 0.8060836501901141 - }, - { - "epoch": 1.9486858573216521, - "grad_norm": 1.9018704891204834, - "learning_rate": 1.327100431795125e-07, - "loss": 0.6940315961837769, - "step": 779, - "token_acc": 0.789420871559633 - }, - { - "epoch": 1.9511889862327911, - "grad_norm": 1.971119999885559, - "learning_rate": 1.2038183319507955e-07, - "loss": 0.8620060086250305, - "step": 780, - "token_acc": 0.7449793013787677 - }, - { - "epoch": 1.95369211514393, - "grad_norm": 1.246886134147644, - "learning_rate": 1.0865311416741742e-07, - "loss": 0.7828944325447083, - "step": 781, - "token_acc": 0.7600471265872496 - }, - { - "epoch": 1.9561952440550687, - "grad_norm": 1.7200655937194824, - "learning_rate": 9.752416870782155e-08, - "loss": 0.7390601634979248, - "step": 782, - "token_acc": 0.771183195667633 - }, - { - "epoch": 1.9586983729662077, - "grad_norm": 4.742372512817383, - "learning_rate": 8.699526497563393e-08, - "loss": 0.612464964389801, - "step": 783, - "token_acc": 0.8112853356890459 - }, - { - "epoch": 1.9612015018773468, - "grad_norm": 1.3585516214370728, - "learning_rate": 7.706665667180091e-08, - "loss": 0.7104154825210571, - "step": 784, - "token_acc": 0.7835043766978569 - }, - { - "epoch": 1.9637046307884856, - "grad_norm": 2.2985119819641113, - "learning_rate": 6.773858303274483e-08, - "loss": 0.7241730093955994, - "step": 785, - "token_acc": 0.7814715613675752 - }, - { - "epoch": 1.9662077596996246, - "grad_norm": 3.9038970470428467, - "learning_rate": 5.90112688246075e-08, - "loss": 0.8135031461715698, - "step": 786, - "token_acc": 0.7587554486697731 - }, - { - "epoch": 1.9687108886107634, - "grad_norm": 3.519855499267578, - "learning_rate": 5.088492433783509e-08, - "loss": 0.6274003982543945, - "step": 787, - "token_acc": 0.810013200075429 - }, - { - "epoch": 1.9712140175219024, - "grad_norm": 3.2235052585601807, - "learning_rate": 4.335974538210441e-08, - "loss": 0.7641839981079102, - "step": 788, - "token_acc": 0.767855082496827 - }, - { - "epoch": 1.9737171464330414, - "grad_norm": 8.306418418884277, - "learning_rate": 3.6435913281607225e-08, - "loss": 0.76943439245224, - "step": 789, - "token_acc": 0.7673772841275528 - }, - { - "epoch": 1.9762202753441802, - "grad_norm": 2.8990190029144287, - "learning_rate": 3.011359487068987e-08, - "loss": 0.7223886251449585, - "step": 790, - "token_acc": 0.7816155645856422 - }, - { - "epoch": 1.978723404255319, - "grad_norm": 3.44381046295166, - "learning_rate": 2.439294248982038e-08, - "loss": 0.6798396706581116, - "step": 791, - "token_acc": 0.793859649122807 - }, - { - "epoch": 1.981226533166458, - "grad_norm": 1.2133567333221436, - "learning_rate": 1.9274093981927478e-08, - "loss": 0.7757768630981445, - "step": 792, - "token_acc": 0.7686167575607338 - }, - { - "epoch": 1.983729662077597, - "grad_norm": 1.928825855255127, - "learning_rate": 1.4757172689067179e-08, - "loss": 0.8859593868255615, - "step": 793, - "token_acc": 0.7354176388240784 - }, - { - "epoch": 1.986232790988736, - "grad_norm": 3.1133933067321777, - "learning_rate": 1.0842287449469579e-08, - "loss": 0.864841103553772, - "step": 794, - "token_acc": 0.742889551737176 - }, - { - "epoch": 1.9887359198998749, - "grad_norm": 2.82256817817688, - "learning_rate": 7.529532594893751e-09, - "loss": 0.6630897521972656, - "step": 795, - "token_acc": 0.8035872275396123 - }, - { - "epoch": 1.9912390488110137, - "grad_norm": 4.563235759735107, - "learning_rate": 4.818987948379539e-09, - "loss": 0.8767818212509155, - "step": 796, - "token_acc": 0.7451889386016927 - }, - { - "epoch": 1.9937421777221527, - "grad_norm": 1.437880039215088, - "learning_rate": 2.7107188222991188e-09, - "loss": 0.7609115242958069, - "step": 797, - "token_acc": 0.7742912789439516 - }, - { - "epoch": 1.9962453066332917, - "grad_norm": 3.210721731185913, - "learning_rate": 1.2047760167999134e-09, - "loss": 0.7180628776550293, - "step": 798, - "token_acc": 0.784061135371179 - }, - { - "epoch": 1.9987484355444305, - "grad_norm": 2.385097026824951, - "learning_rate": 3.01195818577793e-10, - "loss": 0.7415761947631836, - "step": 799, - "token_acc": 0.7797423425792034 - }, - { - "epoch": 2.0, - "grad_norm": 3.286750316619873, - "learning_rate": 0.0, - "loss": 0.8255014419555664, - "step": 800, - "token_acc": 0.7639697950377562 - }, - { - "epoch": 2.0, - "eval_loss": 0.5260909795761108, - "eval_runtime": 3.4058, - "eval_samples_per_second": 3.523, - "eval_steps_per_second": 0.587, - "eval_token_acc": 0.7575798962032232, - "step": 800 - } - ], - "logging_steps": 1, - "max_steps": 800, - "num_input_tokens_seen": 0, - "num_train_epochs": 2, - "save_steps": 10, - "stateful_callbacks": { - "TrainerControl": { - "args": { - "should_epoch_stop": false, - "should_evaluate": false, - "should_log": false, - "should_save": true, - "should_training_stop": true - }, - "attributes": {} - } - }, - "total_flos": 4.593508498402181e+18, - "train_batch_size": 1, - "trial_name": null, - "trial_params": null -} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/training_args.bin deleted file mode 100644 index b5dfe97fa8d66e2d8ab6fe9886964ee4d0bc636e..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/training_args.bin +++ /dev/null @@ -1,3 +0,0 @@ -version https://git-lfs.github.com/spec/v1 -oid sha256:b9a50cc53a1f7e3013bc39de6123df9ac0ed7377e31847b3f7c939c24348054e -size 9041 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/zero_to_fp32.py deleted file mode 100644 index 5995d6e6f04e43b989587aa9022a3aef0c66d694..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800/zero_to_fp32.py +++ /dev/null @@ -1,760 +0,0 @@ -#!/usr/bin/env python - -# Copyright (c) Microsoft Corporation. -# SPDX-License-Identifier: Apache-2.0 - -# DeepSpeed Team - -# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets -# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in -# the future. Once extracted, the weights don't require DeepSpeed and can be used in any -# application. -# -# example: -# python zero_to_fp32.py . output_dir/ -# or -# python zero_to_fp32.py . output_dir/ --safe_serialization - -import argparse -import torch -import glob -import math -import os -import re -import gc -import json -import numpy as np -from tqdm import tqdm -from collections import OrderedDict -from dataclasses import dataclass - -# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with -# DeepSpeed data structures it has to be available in the current python environment. -from deepspeed.utils import logger -from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, - FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, - FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) - - -@dataclass -class zero_model_state: - buffers: dict() - param_shapes: dict() - shared_params: list - ds_version: int - frozen_param_shapes: dict() - frozen_param_fragments: dict() - - -debug = 0 - -# load to cpu -device = torch.device('cpu') - - -def atoi(text): - return int(text) if text.isdigit() else text - - -def natural_keys(text): - ''' - alist.sort(key=natural_keys) sorts in human order - http://nedbatchelder.com/blog/200712/human_sorting.html - (See Toothy's implementation in the comments) - ''' - return [atoi(c) for c in re.split(r'(\d+)', text)] - - -def get_model_state_file(checkpoint_dir, zero_stage): - if not os.path.isdir(checkpoint_dir): - raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") - - # there should be only one file - if zero_stage <= 2: - file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") - elif zero_stage == 3: - file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") - - if not os.path.exists(file): - raise FileNotFoundError(f"can't find model states file at '{file}'") - - return file - - -def get_checkpoint_files(checkpoint_dir, glob_pattern): - # XXX: need to test that this simple glob rule works for multi-node setup too - ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) - - if len(ckpt_files) == 0: - raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") - - return ckpt_files - - -def get_optim_files(checkpoint_dir): - return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") - - -def get_model_state_files(checkpoint_dir): - return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") - - -def parse_model_states(files): - zero_model_states = [] - for file in files: - state_dict = torch.load(file, map_location=device, weights_only=False) - - if BUFFER_NAMES not in state_dict: - raise ValueError(f"{file} is not a model state checkpoint") - buffer_names = state_dict[BUFFER_NAMES] - if debug: - print("Found buffers:", buffer_names) - - # recover just the buffers while restoring them to fp32 if they were saved in fp16 - buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} - param_shapes = state_dict[PARAM_SHAPES] - - # collect parameters that are included in param_shapes - param_names = [] - for s in param_shapes: - for name in s.keys(): - param_names.append(name) - - # update with frozen parameters - frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) - if frozen_param_shapes is not None: - if debug: - print(f"Found frozen_param_shapes: {frozen_param_shapes}") - param_names += list(frozen_param_shapes.keys()) - - # handle shared params - shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] - - ds_version = state_dict.get(DS_VERSION, None) - - frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) - - z_model_state = zero_model_state(buffers=buffers, - param_shapes=param_shapes, - shared_params=shared_params, - ds_version=ds_version, - frozen_param_shapes=frozen_param_shapes, - frozen_param_fragments=frozen_param_fragments) - zero_model_states.append(z_model_state) - - return zero_model_states - - -def parse_optim_states(files, ds_checkpoint_dir): - total_files = len(files) - state_dicts = [] - for f in tqdm(files, desc='Loading checkpoint shards'): - state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) - # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights - # and also handle the case where it was already removed by another helper script - state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) - state_dicts.append(state_dict) - - if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: - raise ValueError(f"{files[0]} is not a zero checkpoint") - zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] - world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] - - # For ZeRO-2 each param group can have different partition_count as data parallelism for expert - # parameters can be different from data parallelism for non-expert parameters. So we can just - # use the max of the partition_count to get the dp world_size. - - if type(world_size) is list: - world_size = max(world_size) - - if world_size != total_files: - raise ValueError( - f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " - "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." - ) - - # the groups are named differently in each stage - if zero_stage <= 2: - fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS - elif zero_stage == 3: - fp32_groups_key = FP32_FLAT_GROUPS - else: - raise ValueError(f"unknown zero stage {zero_stage}") - - fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] - return zero_stage, world_size, fp32_flat_groups - - -def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): - """ - Returns fp32 state_dict reconstructed from ds checkpoint - - Args: - - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) - - """ - print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") - - optim_files = get_optim_files(ds_checkpoint_dir) - zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) - print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") - - model_files = get_model_state_files(ds_checkpoint_dir) - - zero_model_states = parse_model_states(model_files) - print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') - - if zero_stage <= 2: - return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters) - elif zero_stage == 3: - return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters) - - -def _zero2_merge_frozen_params(state_dict, zero_model_states): - if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: - return - - frozen_param_shapes = zero_model_states[0].frozen_param_shapes - frozen_param_fragments = zero_model_states[0].frozen_param_fragments - - if debug: - num_elem = sum(s.numel() for s in frozen_param_shapes.values()) - print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') - - wanted_params = len(frozen_param_shapes) - wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) - avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) - print(f'Frozen params: Have {avail_numel} numels to process.') - print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') - - total_params = 0 - total_numel = 0 - for name, shape in frozen_param_shapes.items(): - total_params += 1 - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - - state_dict[name] = frozen_param_fragments[name] - - if debug: - print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") - - print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") - - -def _has_callable(obj, fn): - attr = getattr(obj, fn, None) - return callable(attr) - - -def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): - param_shapes = zero_model_states[0].param_shapes - - # Reconstruction protocol: - # - # XXX: document this - - if debug: - for i in range(world_size): - for j in range(len(fp32_flat_groups[0])): - print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") - - # XXX: memory usage doubles here (zero2) - num_param_groups = len(fp32_flat_groups[0]) - merged_single_partition_of_fp32_groups = [] - for i in range(num_param_groups): - merged_partitions = [sd[i] for sd in fp32_flat_groups] - full_single_fp32_vector = torch.cat(merged_partitions, 0) - merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) - avail_numel = sum( - [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) - - if debug: - wanted_params = sum([len(shapes) for shapes in param_shapes]) - wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) - # not asserting if there is a mismatch due to possible padding - print(f"Have {avail_numel} numels to process.") - print(f"Need {wanted_numel} numels in {wanted_params} params.") - - # params - # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support - # out-of-core computing solution - total_numel = 0 - total_params = 0 - for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): - offset = 0 - avail_numel = full_single_fp32_vector.numel() - for name, shape in shapes.items(): - - unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) - total_numel += unpartitioned_numel - total_params += 1 - - if debug: - print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") - state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) - offset += unpartitioned_numel - - # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and - # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex - # paddings performed in the code it's almost impossible to predict the exact numbers w/o the - # live optimizer object, so we are checking that the numbers are within the right range - align_to = 2 * world_size - - def zero2_align(x): - return align_to * math.ceil(x / align_to) - - if debug: - print(f"original offset={offset}, avail_numel={avail_numel}") - - offset = zero2_align(offset) - avail_numel = zero2_align(avail_numel) - - if debug: - print(f"aligned offset={offset}, avail_numel={avail_numel}") - - # Sanity check - if offset != avail_numel: - raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") - - print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") - - -def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters): - state_dict = OrderedDict() - - # buffers - buffers = zero_model_states[0].buffers - state_dict.update(buffers) - if debug: - print(f"added {len(buffers)} buffers") - - if not exclude_frozen_parameters: - _zero2_merge_frozen_params(state_dict, zero_model_states) - - _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) - - # recover shared parameters - for pair in zero_model_states[0].shared_params: - if pair[1] in state_dict: - state_dict[pair[0]] = state_dict[pair[1]] - - return state_dict - - -def zero3_partitioned_param_info(unpartitioned_numel, world_size): - remainder = unpartitioned_numel % world_size - padding_numel = (world_size - remainder) if remainder else 0 - partitioned_numel = math.ceil(unpartitioned_numel / world_size) - return partitioned_numel, padding_numel - - -def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): - if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: - return - - if debug: - for i in range(world_size): - num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) - print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') - - frozen_param_shapes = zero_model_states[0].frozen_param_shapes - wanted_params = len(frozen_param_shapes) - wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) - avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size - print(f'Frozen params: Have {avail_numel} numels to process.') - print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') - - total_params = 0 - total_numel = 0 - for name, shape in zero_model_states[0].frozen_param_shapes.items(): - total_params += 1 - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - - param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) - state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) - - partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) - - if debug: - print( - f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" - ) - - print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") - - -class GatheredTensor: - """ - A pseudo tensor that collects partitioned weights. - It is more memory efficient when there are multiple groups. - """ - - def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): - self.flat_groups = flat_groups - self.flat_groups_offset = flat_groups_offset - self.offset = offset - self.partitioned_numel = partitioned_numel - self.shape = shape - self.dtype = self.flat_groups[0][0].dtype - - def contiguous(self): - """ - Merge partitioned weights from flat_groups into a single tensor. - """ - end_idx = self.offset + self.partitioned_numel - world_size = len(self.flat_groups) - pad_flat_param_chunks = [] - - for rank_i in range(world_size): - # for each rank, we need to collect weights from related group/groups - flat_groups_at_rank_i = self.flat_groups[rank_i] - start_group_id = None - end_group_id = None - for group_id in range(len(self.flat_groups_offset)): - if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: - start_group_id = group_id - if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: - end_group_id = group_id - break - # collect weights from related group/groups - for group_id in range(start_group_id, end_group_id + 1): - flat_tensor = flat_groups_at_rank_i[group_id] - start_offset = self.offset - self.flat_groups_offset[group_id] - end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] - pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) - - # collect weights from all ranks - pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) - param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() - return param - - -def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): - param_shapes = zero_model_states[0].param_shapes - avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size - - # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each - # param, re-consolidating each param, while dealing with padding if any - - # merge list of dicts, preserving order - param_shapes = {k: v for d in param_shapes for k, v in d.items()} - - if debug: - for i in range(world_size): - print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") - - wanted_params = len(param_shapes) - wanted_numel = sum(shape.numel() for shape in param_shapes.values()) - # not asserting if there is a mismatch due to possible padding - avail_numel = fp32_flat_groups[0].numel() * world_size - print(f"Trainable params: Have {avail_numel} numels to process.") - print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") - - # params - # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support - # out-of-core computing solution - offset = 0 - total_numel = 0 - total_params = 0 - flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) - for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): - unpartitioned_numel = shape.numel() - total_numel += unpartitioned_numel - total_params += 1 - partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) - - if debug: - print( - f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" - ) - - # memory efficient tensor - tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) - state_dict[name] = tensor - offset += partitioned_numel - - offset *= world_size - - # Sanity check - if offset != avail_numel: - raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") - - print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") - - -def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, - exclude_frozen_parameters): - state_dict = OrderedDict() - - # buffers - buffers = zero_model_states[0].buffers - state_dict.update(buffers) - if debug: - print(f"added {len(buffers)} buffers") - - if not exclude_frozen_parameters: - _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) - - _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) - - # recover shared parameters - for pair in zero_model_states[0].shared_params: - if pair[1] in state_dict: - state_dict[pair[0]] = state_dict[pair[1]] - - return state_dict - - -def to_torch_tensor(state_dict, return_empty_tensor=False): - """ - Convert state_dict of GatheredTensor to torch tensor - """ - torch_state_dict = {} - converted_tensors = {} - for name, tensor in state_dict.items(): - tensor_id = id(tensor) - if tensor_id in converted_tensors: # shared tensors - shared_tensor = torch_state_dict[converted_tensors[tensor_id]] - torch_state_dict[name] = shared_tensor - else: - converted_tensors[tensor_id] = name - if return_empty_tensor: - torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) - else: - torch_state_dict[name] = tensor.contiguous() - return torch_state_dict - - -def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, - tag=None, - exclude_frozen_parameters=False, - lazy_mode=False): - """ - Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with - ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example - via a model hub. - - Args: - - ``checkpoint_dir``: path to the desired checkpoint folder - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` - - ``exclude_frozen_parameters``: exclude frozen parameters - - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. - Convert the pesduo tensor to torch tensor by ``.contiguous()`` - - Returns: - - pytorch ``state_dict`` - - A typical usage might be :: - - from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint - # do the training and checkpoint saving - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu - model = model.cpu() # move to cpu - model.load_state_dict(state_dict) - # submit to model hub or save the model to share with others - - In this example the ``model`` will no longer be usable in the deepspeed context of the same - application. i.e. you will need to re-initialize the deepspeed engine, since - ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. - - If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. - - Note: the above usage may not work if your application doesn't have sufficient free CPU memory. - You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with - the checkpoint. Or you can load state_dict in lazy mode :: - - from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu - for name, lazy_tensor in state_dict.item(): - tensor = lazy_tensor.contiguous() # to cpu - print(name, tensor) - # del tensor to release memory if it no longer in use - """ - if tag is None: - latest_path = os.path.join(checkpoint_dir, 'latest') - if os.path.isfile(latest_path): - with open(latest_path, 'r') as fd: - tag = fd.read().strip() - else: - raise ValueError(f"Unable to find 'latest' file at {latest_path}") - - ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) - - if not os.path.isdir(ds_checkpoint_dir): - raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") - - state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) - if lazy_mode: - return state_dict - else: - return to_torch_tensor(state_dict) - - -def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, - output_dir, - max_shard_size="5GB", - safe_serialization=False, - tag=None, - exclude_frozen_parameters=False): - """ - Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be - loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. - - Args: - - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) - - ``output_dir``: directory to the pytorch fp32 state_dict output files - - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB - - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` - - ``exclude_frozen_parameters``: exclude frozen parameters - """ - - # Dependency pre-check - if safe_serialization: - try: - from safetensors.torch import save_file - except ImportError: - print('If you want to use `safe_serialization`, please `pip install safetensors`') - raise - if max_shard_size is not None: - try: - from huggingface_hub import split_torch_state_dict_into_shards - except ImportError: - print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') - raise - - # Convert zero checkpoint to state_dict - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, - tag, - exclude_frozen_parameters, - lazy_mode=True) - - # Shard the model if it is too big. - weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" - if max_shard_size is not None: - filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") - # an memory-efficient approach for sharding - empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) - state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, - filename_pattern=filename_pattern, - max_shard_size=max_shard_size) - else: - from collections import namedtuple - StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) - state_dict_split = StateDictSplit(is_sharded=False, - filename_to_tensors={weights_name: list(state_dict.keys())}) - - # Save the model by shard - os.makedirs(output_dir, exist_ok=True) - filename_to_tensors = state_dict_split.filename_to_tensors.items() - for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): - shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} - shard_state_dict = to_torch_tensor(shard_state_dict) - output_path = os.path.join(output_dir, shard_file) - if safe_serialization: - save_file(shard_state_dict, output_path, metadata={"format": "pt"}) - else: - torch.save(shard_state_dict, output_path) - # release the memory of current shard - for tensor_name in list(shard_state_dict.keys()): - del state_dict[tensor_name] - del shard_state_dict[tensor_name] - del shard_state_dict - gc.collect() - - # Save index if sharded - if state_dict_split.is_sharded: - index = { - "metadata": state_dict_split.metadata, - "weight_map": state_dict_split.tensor_to_filename, - } - save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" - save_index_file = os.path.join(output_dir, save_index_file) - with open(save_index_file, "w", encoding="utf-8") as f: - content = json.dumps(index, indent=2, sort_keys=True) + "\n" - f.write(content) - - -def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): - """ - 1. Put the provided model to cpu - 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` - 3. Load it into the provided model - - Args: - - ``model``: the model object to update - - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) - - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` - - Returns: - - ``model`: modified model - - Make sure you have plenty of CPU memory available before you call this function. If you don't - have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it - conveniently placed for you in the checkpoint folder. - - A typical usage might be :: - - from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint - model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) - # submit to model hub or save the model to share with others - - Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context - of the same application. i.e. you will need to re-initialize the deepspeed engine, since - ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. - - """ - logger.info("Extracting fp32 weights") - state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) - - logger.info("Overwriting model with fp32 weights") - model = model.cpu() - model.load_state_dict(state_dict, strict=False) - - return model - - -if __name__ == "__main__": - parser = argparse.ArgumentParser() - parser.add_argument("checkpoint_dir", - type=str, - help="path to the desired checkpoint folder, e.g., path/checkpoint-12") - parser.add_argument("output_dir", - type=str, - help="directory to the pytorch fp32 state_dict output files" - "(e.g. path/checkpoint-12-output/)") - parser.add_argument( - "--max_shard_size", - type=str, - default="5GB", - help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" - "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" - "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" - "without CPU OOM issues.") - parser.add_argument( - "--safe_serialization", - default=False, - action='store_true', - help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") - parser.add_argument("-t", - "--tag", - type=str, - default=None, - help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") - parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") - parser.add_argument("-d", "--debug", action='store_true', help="enable debug") - args = parser.parse_args() - - debug = args.debug - - convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, - args.output_dir, - max_shard_size=args.max_shard_size, - safe_serialization=args.safe_serialization, - tag=args.tag, - exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/logging.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/logging.jsonl deleted file mode 100644 index 8eca96d3a11ee0dc0a05594ef51ee4a2a1570c18..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/logging.jsonl +++ /dev/null @@ -1,803 +0,0 @@ -{"loss": 1.44945288, "grad_norm": 1.79868579, "learning_rate": 3.1e-07, "token_acc": 0.65929131, "epoch": 0.00250313, "global_step/max_steps": "1/800", "percentage": "0.12%", "elapsed_time": "15s", "remaining_time": "3h 15m 54s", "memory(GiB)": 48.96, "train_speed(s/it)": 14.711509} -{"loss": 1.4986589, "grad_norm": 1.65837991, "learning_rate": 6.3e-07, "token_acc": 0.63869764, "epoch": 0.00500626, "global_step/max_steps": "2/800", "percentage": "0.25%", "elapsed_time": "28s", "remaining_time": "3h 4m 13s", "memory(GiB)": 48.96, "train_speed(s/it)": 13.851253} -{"loss": 1.48018265, "grad_norm": 2.03586578, "learning_rate": 9.4e-07, "token_acc": 0.64569102, "epoch": 0.00750939, "global_step/max_steps": "3/800", "percentage": "0.38%", "elapsed_time": "45s", "remaining_time": "3h 21m 26s", "memory(GiB)": 48.96, "train_speed(s/it)": 15.163817} -{"loss": 1.43147802, "grad_norm": 2.99153876, "learning_rate": 1.25e-06, "token_acc": 0.65765562, "epoch": 0.01001252, "global_step/max_steps": "4/800", "percentage": "0.50%", "elapsed_time": "1m 3s", "remaining_time": "3h 27m 32s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.642993} -{"loss": 1.46999717, "grad_norm": 3.66954732, "learning_rate": 1.56e-06, "token_acc": 0.63883132, "epoch": 0.01251564, "global_step/max_steps": "5/800", "percentage": "0.62%", "elapsed_time": "1m 19s", "remaining_time": "3h 29m 11s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.78762} -{"loss": 1.45972848, "grad_norm": 3.40625358, "learning_rate": 1.88e-06, "token_acc": 0.64376725, "epoch": 0.01501877, "global_step/max_steps": "6/800", "percentage": "0.75%", "elapsed_time": "1m 32s", "remaining_time": "3h 23m 34s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.382617} -{"loss": 1.43753433, "grad_norm": 4.47778225, "learning_rate": 2.19e-06, "token_acc": 0.65869601, "epoch": 0.0175219, "global_step/max_steps": "7/800", "percentage": "0.88%", "elapsed_time": "1m 47s", "remaining_time": "3h 21m 25s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.239845} -{"loss": 1.42626119, "grad_norm": 7.9627409, "learning_rate": 2.5e-06, "token_acc": 0.65512204, "epoch": 0.02002503, "global_step/max_steps": "8/800", "percentage": "1.00%", "elapsed_time": "2m 3s", "remaining_time": "3h 22m 40s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.353324} -{"loss": 1.55078006, "grad_norm": 1.1610136, "learning_rate": 2.81e-06, "token_acc": 0.6221771, "epoch": 0.02252816, "global_step/max_steps": "9/800", "percentage": "1.12%", "elapsed_time": "2m 23s", "remaining_time": "3h 28m 50s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.840897} -{"loss": 1.53671026, "grad_norm": 2.31859994, "learning_rate": 3.13e-06, "token_acc": 0.62014678, "epoch": 0.02503129, "global_step/max_steps": "10/800", "percentage": "1.25%", "elapsed_time": "2m 42s", "remaining_time": "3h 32m 41s", "memory(GiB)": 54.0, "train_speed(s/it)": 16.153405} -{"loss": 1.50545514, "grad_norm": 1.71537173, "learning_rate": 3.44e-06, "token_acc": 0.62622011, "epoch": 0.02753442, "global_step/max_steps": "11/800", "percentage": "1.38%", "elapsed_time": "3m 14s", "remaining_time": "3h 51m 41s", "memory(GiB)": 54.0, "train_speed(s/it)": 17.619041} -{"loss": 1.45864677, "grad_norm": 2.10221934, "learning_rate": 3.75e-06, "token_acc": 0.65405302, "epoch": 0.03003755, "global_step/max_steps": "12/800", "percentage": "1.50%", "elapsed_time": "3m 27s", "remaining_time": "3h 46m 16s", "memory(GiB)": 54.0, "train_speed(s/it)": 17.228778} -{"loss": 1.48907411, "grad_norm": 1.56300652, "learning_rate": 4.06e-06, "token_acc": 0.640501, "epoch": 0.03254068, "global_step/max_steps": "13/800", "percentage": "1.62%", "elapsed_time": "3m 44s", "remaining_time": "3h 46m 2s", "memory(GiB)": 54.0, "train_speed(s/it)": 17.231986} -{"loss": 1.44627619, "grad_norm": 33.18423462, "learning_rate": 4.37e-06, "token_acc": 0.67064322, "epoch": 0.0350438, "global_step/max_steps": "14/800", "percentage": "1.75%", "elapsed_time": "3m 51s", "remaining_time": "3h 36m 29s", "memory(GiB)": 54.0, "train_speed(s/it)": 16.525534} -{"loss": 1.45861518, "grad_norm": 1.88262761, "learning_rate": 4.69e-06, "token_acc": 0.67050667, "epoch": 0.03754693, "global_step/max_steps": "15/800", "percentage": "1.88%", "elapsed_time": "4m 0s", "remaining_time": "3h 29m 46s", "memory(GiB)": 54.0, "train_speed(s/it)": 16.033108} -{"loss": 1.41685069, "grad_norm": 8.02416134, "learning_rate": 5e-06, "token_acc": 0.68050522, "epoch": 0.04005006, "global_step/max_steps": "16/800", "percentage": "2.00%", "elapsed_time": "4m 9s", "remaining_time": "3h 23m 45s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.592527} -{"loss": 1.50865602, "grad_norm": 2.21690273, "learning_rate": 5.31e-06, "token_acc": 0.63369652, "epoch": 0.04255319, "global_step/max_steps": "17/800", "percentage": "2.12%", "elapsed_time": "4m 22s", "remaining_time": "3h 21m 10s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.415306} -{"loss": 1.44454968, "grad_norm": 2.04417992, "learning_rate": 5.63e-06, "token_acc": 0.65391225, "epoch": 0.04505632, "global_step/max_steps": "18/800", "percentage": "2.25%", "elapsed_time": "4m 41s", "remaining_time": "3h 23m 16s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.595349} -{"loss": 1.40801764, "grad_norm": 3.58627129, "learning_rate": 5.94e-06, "token_acc": 0.6634764, "epoch": 0.04755945, "global_step/max_steps": "19/800", "percentage": "2.38%", "elapsed_time": "4m 53s", "remaining_time": "3h 21m 4s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.446766} -{"loss": 1.48991144, "grad_norm": 5.32836008, "learning_rate": 6.25e-06, "token_acc": 0.64685714, "epoch": 0.05006258, "global_step/max_steps": "20/800", "percentage": "2.50%", "elapsed_time": "5m 9s", "remaining_time": "3h 20m 34s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.428315} -{"loss": 1.50724447, "grad_norm": 5.33305454, "learning_rate": 6.56e-06, "token_acc": 0.63482648, "epoch": 0.05256571, "global_step/max_steps": "21/800", "percentage": "2.62%", "elapsed_time": "5m 31s", "remaining_time": "3h 24m 36s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.759107} -{"loss": 1.462991, "grad_norm": 2.16284943, "learning_rate": 6.88e-06, "token_acc": 0.64885875, "epoch": 0.05506884, "global_step/max_steps": "22/800", "percentage": "2.75%", "elapsed_time": "5m 44s", "remaining_time": "3h 22m 45s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.636607} -{"loss": 1.43864918, "grad_norm": 1.12752008, "learning_rate": 7.19e-06, "token_acc": 0.65358712, "epoch": 0.05757196, "global_step/max_steps": "23/800", "percentage": "2.88%", "elapsed_time": "5m 57s", "remaining_time": "3h 20m 56s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.516132} -{"loss": 1.48218656, "grad_norm": 1.37193942, "learning_rate": 7.5e-06, "token_acc": 0.66036883, "epoch": 0.06007509, "global_step/max_steps": "24/800", "percentage": "3.00%", "elapsed_time": "6m 6s", "remaining_time": "3h 17m 15s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.250902} -{"loss": 1.45701861, "grad_norm": 4.84165764, "learning_rate": 7.81e-06, "token_acc": 0.6413768, "epoch": 0.06257822, "global_step/max_steps": "25/800", "percentage": "3.12%", "elapsed_time": "6m 18s", "remaining_time": "3h 15m 13s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.11315} -{"loss": 1.4552083, "grad_norm": 5.44113541, "learning_rate": 8.13e-06, "token_acc": 0.6444477, "epoch": 0.06508135, "global_step/max_steps": "26/800", "percentage": "3.25%", "elapsed_time": "6m 31s", "remaining_time": "3h 13m 56s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.033187} -{"loss": 1.48831475, "grad_norm": 5.62676859, "learning_rate": 8.44e-06, "token_acc": 0.64498183, "epoch": 0.06758448, "global_step/max_steps": "27/800", "percentage": "3.38%", "elapsed_time": "6m 41s", "remaining_time": "3h 11m 6s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.833367} -{"loss": 1.48246646, "grad_norm": 2.2804637, "learning_rate": 8.75e-06, "token_acc": 0.6569336, "epoch": 0.07008761, "global_step/max_steps": "28/800", "percentage": "3.50%", "elapsed_time": "6m 48s", "remaining_time": "3h 7m 35s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.5794} -{"loss": 1.44352448, "grad_norm": 1.48312473, "learning_rate": 9.06e-06, "token_acc": 0.64493659, "epoch": 0.07259074, "global_step/max_steps": "29/800", "percentage": "3.62%", "elapsed_time": "7m 2s", "remaining_time": "3h 6m 59s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.551253} -{"loss": 1.41553044, "grad_norm": 2.14605832, "learning_rate": 9.38e-06, "token_acc": 0.65727988, "epoch": 0.07509387, "global_step/max_steps": "30/800", "percentage": "3.75%", "elapsed_time": "7m 19s", "remaining_time": "3h 7m 55s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.643146} -{"loss": 1.42427778, "grad_norm": 3.42873049, "learning_rate": 9.69e-06, "token_acc": 0.65096631, "epoch": 0.077597, "global_step/max_steps": "31/800", "percentage": "3.88%", "elapsed_time": "7m 45s", "remaining_time": "3h 12m 12s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.996404} -{"loss": 1.44087529, "grad_norm": 1.75124788, "learning_rate": 1e-05, "token_acc": 0.63732487, "epoch": 0.08010013, "global_step/max_steps": "32/800", "percentage": "4.00%", "elapsed_time": "8m 3s", "remaining_time": "3h 13m 20s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.103951} -{"loss": 1.44332874, "grad_norm": 2.46492648, "learning_rate": 1.031e-05, "token_acc": 0.64012179, "epoch": 0.08260325, "global_step/max_steps": "33/800", "percentage": "4.12%", "elapsed_time": "8m 17s", "remaining_time": "3h 12m 22s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.048427} -{"loss": 1.35329318, "grad_norm": 3.86351395, "learning_rate": 1.063e-05, "token_acc": 0.67182913, "epoch": 0.08510638, "global_step/max_steps": "34/800", "percentage": "4.25%", "elapsed_time": "8m 33s", "remaining_time": "3h 12m 30s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.078879} -{"loss": 1.36867011, "grad_norm": 2.38865352, "learning_rate": 1.094e-05, "token_acc": 0.66684842, "epoch": 0.08760951, "global_step/max_steps": "35/800", "percentage": "4.38%", "elapsed_time": "8m 44s", "remaining_time": "3h 10m 59s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.978838} -{"loss": 1.40730929, "grad_norm": 13.73801994, "learning_rate": 1.125e-05, "token_acc": 0.65518039, "epoch": 0.09011264, "global_step/max_steps": "36/800", "percentage": "4.50%", "elapsed_time": "8m 54s", "remaining_time": "3h 8m 44s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.821797} -{"loss": 1.48296261, "grad_norm": 1.36374295, "learning_rate": 1.156e-05, "token_acc": 0.63280349, "epoch": 0.09261577, "global_step/max_steps": "37/800", "percentage": "4.62%", "elapsed_time": "9m 8s", "remaining_time": "3h 8m 24s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.814925} -{"loss": 1.38995528, "grad_norm": 1.63259399, "learning_rate": 1.188e-05, "token_acc": 0.65054266, "epoch": 0.0951189, "global_step/max_steps": "38/800", "percentage": "4.75%", "elapsed_time": "9m 32s", "remaining_time": "3h 11m 12s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.055526} -{"loss": 1.4045589, "grad_norm": 1.81222522, "learning_rate": 1.219e-05, "token_acc": 0.64304271, "epoch": 0.09762203, "global_step/max_steps": "39/800", "percentage": "4.88%", "elapsed_time": "9m 53s", "remaining_time": "3h 13m 1s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.217493} -{"loss": 1.3288635, "grad_norm": 3.87047744, "learning_rate": 1.25e-05, "token_acc": 0.6735983, "epoch": 0.10012516, "global_step/max_steps": "40/800", "percentage": "5.00%", "elapsed_time": "10m 9s", "remaining_time": "3h 12m 42s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.213132} -{"loss": 1.32761693, "grad_norm": 2.29012012, "learning_rate": 1.281e-05, "token_acc": 0.66939098, "epoch": 0.10262829, "global_step/max_steps": "41/800", "percentage": "5.12%", "elapsed_time": "10m 30s", "remaining_time": "3h 14m 28s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.37243} -{"loss": 1.31637287, "grad_norm": 4.91914177, "learning_rate": 1.313e-05, "token_acc": 0.67034526, "epoch": 0.10513141, "global_step/max_steps": "42/800", "percentage": "5.25%", "elapsed_time": "10m 42s", "remaining_time": "3h 13m 16s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.297582} -{"loss": 1.34347367, "grad_norm": 2.16908503, "learning_rate": 1.344e-05, "token_acc": 0.66149202, "epoch": 0.10763454, "global_step/max_steps": "43/800", "percentage": "5.38%", "elapsed_time": "11m 0s", "remaining_time": "3h 13m 44s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.355455} -{"loss": 1.31467021, "grad_norm": 2.672122, "learning_rate": 1.375e-05, "token_acc": 0.6749051, "epoch": 0.11013767, "global_step/max_steps": "44/800", "percentage": "5.50%", "elapsed_time": "11m 13s", "remaining_time": "3h 12m 39s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.289708} -{"loss": 1.33873808, "grad_norm": 2.74747038, "learning_rate": 1.406e-05, "token_acc": 0.66034863, "epoch": 0.1126408, "global_step/max_steps": "45/800", "percentage": "5.62%", "elapsed_time": "11m 26s", "remaining_time": "3h 11m 48s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.242122} -{"loss": 1.2919178, "grad_norm": 3.59263134, "learning_rate": 1.437e-05, "token_acc": 0.67620861, "epoch": 0.11514393, "global_step/max_steps": "46/800", "percentage": "5.75%", "elapsed_time": "11m 39s", "remaining_time": "3h 10m 54s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.19164} -{"loss": 1.27800703, "grad_norm": 3.31310201, "learning_rate": 1.469e-05, "token_acc": 0.69281046, "epoch": 0.11764706, "global_step/max_steps": "47/800", "percentage": "5.88%", "elapsed_time": "11m 51s", "remaining_time": "3h 9m 48s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.123447} -{"loss": 1.32143581, "grad_norm": 2.77296185, "learning_rate": 1.5e-05, "token_acc": 0.66542362, "epoch": 0.12015019, "global_step/max_steps": "48/800", "percentage": "6.00%", "elapsed_time": "12m 2s", "remaining_time": "3h 8m 32s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.043126} -{"loss": 1.34112525, "grad_norm": 3.39507747, "learning_rate": 1.531e-05, "token_acc": 0.67765929, "epoch": 0.12265332, "global_step/max_steps": "49/800", "percentage": "6.12%", "elapsed_time": "12m 14s", "remaining_time": "3h 7m 26s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.974147} -{"loss": 1.25970638, "grad_norm": 1.69916236, "learning_rate": 1.563e-05, "token_acc": 0.68832676, "epoch": 0.12515645, "global_step/max_steps": "50/800", "percentage": "6.25%", "elapsed_time": "12m 27s", "remaining_time": "3h 6m 52s", "memory(GiB)": 54.0, "train_speed(s/it)": 14.94968} -{"loss": 1.33362353, "grad_norm": 2.19090438, "learning_rate": 1.594e-05, "token_acc": 0.66678601, "epoch": 0.12765957, "global_step/max_steps": "51/800", "percentage": "6.38%", "elapsed_time": "12m 50s", "remaining_time": "3h 8m 21s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.088547} -{"loss": 1.30786633, "grad_norm": 1.269912, "learning_rate": 1.625e-05, "token_acc": 0.66012999, "epoch": 0.1301627, "global_step/max_steps": "52/800", "percentage": "6.50%", "elapsed_time": "13m 12s", "remaining_time": "3h 9m 56s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.235365} -{"loss": 1.3297888, "grad_norm": 2.1954217, "learning_rate": 1.656e-05, "token_acc": 0.66361327, "epoch": 0.13266583, "global_step/max_steps": "53/800", "percentage": "6.62%", "elapsed_time": "13m 25s", "remaining_time": "3h 9m 13s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.197967} -{"loss": 1.26332831, "grad_norm": 1.47887206, "learning_rate": 1.688e-05, "token_acc": 0.67284866, "epoch": 0.13516896, "global_step/max_steps": "54/800", "percentage": "6.75%", "elapsed_time": "13m 44s", "remaining_time": "3h 9m 40s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.254203} -{"loss": 1.31344211, "grad_norm": 1.27569425, "learning_rate": 1.719e-05, "token_acc": 0.65977011, "epoch": 0.13767209, "global_step/max_steps": "55/800", "percentage": "6.88%", "elapsed_time": "14m 4s", "remaining_time": "3h 10m 26s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.337267} -{"loss": 1.32097006, "grad_norm": 1.50588107, "learning_rate": 1.75e-05, "token_acc": 0.66198506, "epoch": 0.14017522, "global_step/max_steps": "56/800", "percentage": "7.00%", "elapsed_time": "14m 18s", "remaining_time": "3h 10m 1s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.323684} -{"loss": 1.19958973, "grad_norm": 8.39525127, "learning_rate": 1.781e-05, "token_acc": 0.69024913, "epoch": 0.14267835, "global_step/max_steps": "57/800", "percentage": "7.12%", "elapsed_time": "14m 30s", "remaining_time": "3h 8m 55s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.255674} -{"loss": 1.2003808, "grad_norm": 1.21475863, "learning_rate": 1.813e-05, "token_acc": 0.69937611, "epoch": 0.14518148, "global_step/max_steps": "58/800", "percentage": "7.25%", "elapsed_time": "14m 40s", "remaining_time": "3h 7m 41s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.176967} -{"loss": 1.18848598, "grad_norm": 7.15292549, "learning_rate": 1.844e-05, "token_acc": 0.69567487, "epoch": 0.14768461, "global_step/max_steps": "59/800", "percentage": "7.38%", "elapsed_time": "14m 55s", "remaining_time": "3h 7m 22s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.172037} -{"loss": 1.24161029, "grad_norm": 1.76168847, "learning_rate": 1.875e-05, "token_acc": 0.67805346, "epoch": 0.15018773, "global_step/max_steps": "60/800", "percentage": "7.50%", "elapsed_time": "15m 9s", "remaining_time": "3h 6m 53s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.152341} -{"loss": 1.25588226, "grad_norm": 1.4128592, "learning_rate": 1.906e-05, "token_acc": 0.67482963, "epoch": 0.15269086, "global_step/max_steps": "61/800", "percentage": "7.62%", "elapsed_time": "15m 31s", "remaining_time": "3h 7m 58s", "memory(GiB)": 54.0, "train_speed(s/it)": 15.26106} -{"loss": 1.25712311, "grad_norm": 5.17648268, "learning_rate": 1.937e-05, "token_acc": 0.67238653, "epoch": 0.15519399, "global_step/max_steps": "62/800", "percentage": "7.75%", "elapsed_time": "15m 48s", "remaining_time": "3h 8m 9s", "memory(GiB)": 67.32, "train_speed(s/it)": 15.296419} -{"loss": 1.21102142, "grad_norm": 2.64992404, "learning_rate": 1.969e-05, "token_acc": 0.69320313, "epoch": 0.15769712, "global_step/max_steps": "63/800", "percentage": "7.88%", "elapsed_time": "15m 60s", "remaining_time": "3h 7m 10s", "memory(GiB)": 67.32, "train_speed(s/it)": 15.237735} -{"loss": 1.23315203, "grad_norm": 4.23736286, "learning_rate": 2e-05, "token_acc": 0.67433685, "epoch": 0.16020025, "global_step/max_steps": "64/800", "percentage": "8.00%", "elapsed_time": "16m 16s", "remaining_time": "3h 7m 3s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.248444} -{"loss": 1.25111139, "grad_norm": 1.83243108, "learning_rate": 2.031e-05, "token_acc": 0.66592378, "epoch": 0.16270338, "global_step/max_steps": "65/800", "percentage": "8.12%", "elapsed_time": "16m 30s", "remaining_time": "3h 6m 34s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.229755} -{"loss": 1.2055378, "grad_norm": 4.52532911, "learning_rate": 2.062e-05, "token_acc": 0.68639843, "epoch": 0.16520651, "global_step/max_steps": "66/800", "percentage": "8.25%", "elapsed_time": "16m 44s", "remaining_time": "3h 6m 3s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.20794} -{"loss": 1.17318177, "grad_norm": 6.05165625, "learning_rate": 2.094e-05, "token_acc": 0.71370231, "epoch": 0.16770964, "global_step/max_steps": "67/800", "percentage": "8.38%", "elapsed_time": "16m 53s", "remaining_time": "3h 4m 45s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.123097} -{"loss": 1.24934936, "grad_norm": 4.8128891, "learning_rate": 2.125e-05, "token_acc": 0.67507568, "epoch": 0.17021277, "global_step/max_steps": "68/800", "percentage": "8.50%", "elapsed_time": "17m 10s", "remaining_time": "3h 4m 51s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.152017} -{"loss": 1.19240427, "grad_norm": 7.17521286, "learning_rate": 2.156e-05, "token_acc": 0.69355878, "epoch": 0.17271589, "global_step/max_steps": "69/800", "percentage": "8.62%", "elapsed_time": "17m 20s", "remaining_time": "3h 3m 35s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.068128} -{"loss": 1.19370127, "grad_norm": 3.68625689, "learning_rate": 2.187e-05, "token_acc": 0.68210872, "epoch": 0.17521902, "global_step/max_steps": "70/800", "percentage": "8.75%", "elapsed_time": "17m 36s", "remaining_time": "3h 3m 35s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.089637} -{"loss": 1.16241026, "grad_norm": 1.52286208, "learning_rate": 2.219e-05, "token_acc": 0.69292721, "epoch": 0.17772215, "global_step/max_steps": "71/800", "percentage": "8.88%", "elapsed_time": "17m 59s", "remaining_time": "3h 4m 34s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.190664} -{"loss": 1.21023011, "grad_norm": 4.75596523, "learning_rate": 2.25e-05, "token_acc": 0.68719467, "epoch": 0.18022528, "global_step/max_steps": "72/800", "percentage": "9.00%", "elapsed_time": "18m 9s", "remaining_time": "3h 3m 35s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.130181} -{"loss": 1.06770563, "grad_norm": 5.96672869, "learning_rate": 2.281e-05, "token_acc": 0.72110553, "epoch": 0.18272841, "global_step/max_steps": "73/800", "percentage": "9.12%", "elapsed_time": "18m 26s", "remaining_time": "3h 3m 34s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.149932} -{"loss": 1.17640603, "grad_norm": 1.52216327, "learning_rate": 2.313e-05, "token_acc": 0.69622173, "epoch": 0.18523154, "global_step/max_steps": "74/800", "percentage": "9.25%", "elapsed_time": "18m 38s", "remaining_time": "3h 2m 45s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.103385} -{"loss": 1.16299319, "grad_norm": 2.79299617, "learning_rate": 2.344e-05, "token_acc": 0.69443126, "epoch": 0.18773467, "global_step/max_steps": "75/800", "percentage": "9.38%", "elapsed_time": "18m 51s", "remaining_time": "3h 2m 11s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.077042} -{"loss": 1.01490474, "grad_norm": 2.37900448, "learning_rate": 2.375e-05, "token_acc": 0.73937544, "epoch": 0.1902378, "global_step/max_steps": "76/800", "percentage": "9.50%", "elapsed_time": "18m 59s", "remaining_time": "3h 0m 49s", "memory(GiB)": 68.72, "train_speed(s/it)": 14.984838} -{"loss": 1.17688322, "grad_norm": 1.08427405, "learning_rate": 2.406e-05, "token_acc": 0.68817926, "epoch": 0.19274093, "global_step/max_steps": "77/800", "percentage": "9.62%", "elapsed_time": "19m 14s", "remaining_time": "3h 0m 32s", "memory(GiB)": 68.72, "train_speed(s/it)": 14.981774} -{"loss": 1.19794583, "grad_norm": 3.49307609, "learning_rate": 2.437e-05, "token_acc": 0.67968585, "epoch": 0.19524406, "global_step/max_steps": "78/800", "percentage": "9.75%", "elapsed_time": "19m 28s", "remaining_time": "3h 0m 7s", "memory(GiB)": 68.72, "train_speed(s/it)": 14.968628} -{"loss": 1.20897603, "grad_norm": 1.63664281, "learning_rate": 2.469e-05, "token_acc": 0.67735022, "epoch": 0.19774718, "global_step/max_steps": "79/800", "percentage": "9.88%", "elapsed_time": "19m 44s", "remaining_time": "3h 0m 3s", "memory(GiB)": 68.72, "train_speed(s/it)": 14.983058} -{"loss": 1.21557748, "grad_norm": 2.15529156, "learning_rate": 2.5e-05, "token_acc": 0.67317481, "epoch": 0.20025031, "global_step/max_steps": "80/800", "percentage": "10.00%", "elapsed_time": "20m 3s", "remaining_time": "3h 0m 29s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.039813} -{"loss": 1.15738082, "grad_norm": 1.21280658, "learning_rate": 2.531e-05, "token_acc": 0.69003476, "epoch": 0.20275344, "global_step/max_steps": "81/800", "percentage": "10.12%", "elapsed_time": "20m 32s", "remaining_time": "3h 2m 19s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.214345} -{"loss": 1.23003209, "grad_norm": 1.38342357, "learning_rate": 2.562e-05, "token_acc": 0.66837565, "epoch": 0.20525657, "global_step/max_steps": "82/800", "percentage": "10.25%", "elapsed_time": "21m 1s", "remaining_time": "3h 3m 58s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.373568} -{"loss": 1.07921815, "grad_norm": 2.4702878, "learning_rate": 2.594e-05, "token_acc": 0.70579316, "epoch": 0.2077597, "global_step/max_steps": "83/800", "percentage": "10.38%", "elapsed_time": "21m 20s", "remaining_time": "3h 4m 17s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.421576} -{"loss": 1.15853548, "grad_norm": 1.61457443, "learning_rate": 2.625e-05, "token_acc": 0.69479932, "epoch": 0.21026283, "global_step/max_steps": "84/800", "percentage": "10.50%", "elapsed_time": "21m 36s", "remaining_time": "3h 4m 8s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.429699} -{"loss": 1.03361595, "grad_norm": 4.21408796, "learning_rate": 2.656e-05, "token_acc": 0.72542943, "epoch": 0.21276596, "global_step/max_steps": "85/800", "percentage": "10.62%", "elapsed_time": "21m 47s", "remaining_time": "3h 3m 18s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.381374} -{"loss": 1.16146493, "grad_norm": 2.93512297, "learning_rate": 2.687e-05, "token_acc": 0.69266589, "epoch": 0.21526909, "global_step/max_steps": "86/800", "percentage": "10.75%", "elapsed_time": "21m 59s", "remaining_time": "3h 2m 32s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.338889} -{"loss": 1.08815646, "grad_norm": 8.31084538, "learning_rate": 2.719e-05, "token_acc": 0.71540698, "epoch": 0.21777222, "global_step/max_steps": "87/800", "percentage": "10.88%", "elapsed_time": "22m 8s", "remaining_time": "3h 1m 24s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.265689} -{"loss": 1.08201194, "grad_norm": 1.37263632, "learning_rate": 2.75e-05, "token_acc": 0.70624202, "epoch": 0.22027534, "global_step/max_steps": "88/800", "percentage": "11.00%", "elapsed_time": "22m 19s", "remaining_time": "3h 0m 36s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.218471} -{"loss": 1.17759514, "grad_norm": 0.97306246, "learning_rate": 2.781e-05, "token_acc": 0.686429, "epoch": 0.22277847, "global_step/max_steps": "89/800", "percentage": "11.12%", "elapsed_time": "22m 32s", "remaining_time": "3h 0m 1s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.19102} -{"loss": 0.96022511, "grad_norm": 32.95426559, "learning_rate": 2.813e-05, "token_acc": 0.73861053, "epoch": 0.2252816, "global_step/max_steps": "90/800", "percentage": "11.25%", "elapsed_time": "22m 41s", "remaining_time": "2h 58m 59s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.126042} -{"loss": 1.05061579, "grad_norm": 1.83762372, "learning_rate": 2.844e-05, "token_acc": 0.71343519, "epoch": 0.22778473, "global_step/max_steps": "91/800", "percentage": "11.38%", "elapsed_time": "23m 4s", "remaining_time": "2h 59m 45s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.212066} -{"loss": 1.14090037, "grad_norm": 3.1153717, "learning_rate": 2.875e-05, "token_acc": 0.68885706, "epoch": 0.23028786, "global_step/max_steps": "92/800", "percentage": "11.50%", "elapsed_time": "23m 19s", "remaining_time": "2h 59m 23s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.201995} -{"loss": 0.99568141, "grad_norm": 4.86713076, "learning_rate": 2.906e-05, "token_acc": 0.72776266, "epoch": 0.23279099, "global_step/max_steps": "93/800", "percentage": "11.62%", "elapsed_time": "23m 38s", "remaining_time": "2h 59m 43s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.251523} -{"loss": 1.15872908, "grad_norm": 1.48658919, "learning_rate": 2.938e-05, "token_acc": 0.68817543, "epoch": 0.23529412, "global_step/max_steps": "94/800", "percentage": "11.75%", "elapsed_time": "23m 55s", "remaining_time": "2h 59m 38s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.266889} -{"loss": 1.00748336, "grad_norm": 4.89593029, "learning_rate": 2.969e-05, "token_acc": 0.71723489, "epoch": 0.23779725, "global_step/max_steps": "95/800", "percentage": "11.88%", "elapsed_time": "24m 4s", "remaining_time": "2h 58m 36s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.20029} -{"loss": 0.97592306, "grad_norm": 11.3216753, "learning_rate": 3e-05, "token_acc": 0.74221422, "epoch": 0.24030038, "global_step/max_steps": "96/800", "percentage": "12.00%", "elapsed_time": "24m 20s", "remaining_time": "2h 58m 29s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.211788} -{"loss": 1.11677384, "grad_norm": 5.27880526, "learning_rate": 3.031e-05, "token_acc": 0.6905687, "epoch": 0.2428035, "global_step/max_steps": "97/800", "percentage": "12.12%", "elapsed_time": "24m 37s", "remaining_time": "2h 58m 28s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.231648} -{"loss": 1.14240944, "grad_norm": 11.17349529, "learning_rate": 3.063e-05, "token_acc": 0.69136929, "epoch": 0.24530663, "global_step/max_steps": "98/800", "percentage": "12.25%", "elapsed_time": "24m 49s", "remaining_time": "2h 57m 44s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.190648} -{"loss": 1.04121149, "grad_norm": 2.35263443, "learning_rate": 3.094e-05, "token_acc": 0.71464597, "epoch": 0.24780976, "global_step/max_steps": "99/800", "percentage": "12.38%", "elapsed_time": "25m 3s", "remaining_time": "2h 57m 19s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.176777} -{"loss": 1.0442692, "grad_norm": 2.78574181, "learning_rate": 3.125e-05, "token_acc": 0.71171775, "epoch": 0.25031289, "global_step/max_steps": "100/800", "percentage": "12.50%", "elapsed_time": "25m 19s", "remaining_time": "2h 57m 15s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.193273} -{"loss": 1.10212064, "grad_norm": 79.83805084, "learning_rate": 3.156e-05, "token_acc": 0.70086329, "epoch": 0.25281602, "global_step/max_steps": "101/800", "percentage": "12.62%", "elapsed_time": "25m 44s", "remaining_time": "2h 58m 6s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.288257} -{"loss": 1.0893476, "grad_norm": 2.24922323, "learning_rate": 3.188e-05, "token_acc": 0.70095596, "epoch": 0.25531915, "global_step/max_steps": "102/800", "percentage": "12.75%", "elapsed_time": "25m 56s", "remaining_time": "2h 57m 30s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.258235} -{"loss": 1.065395, "grad_norm": 3.40496731, "learning_rate": 3.219e-05, "token_acc": 0.70431421, "epoch": 0.25782228, "global_step/max_steps": "103/800", "percentage": "12.88%", "elapsed_time": "26m 14s", "remaining_time": "2h 57m 32s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.282118} -{"loss": 0.99714428, "grad_norm": 2.0676322, "learning_rate": 3.25e-05, "token_acc": 0.72090802, "epoch": 0.26032541, "global_step/max_steps": "104/800", "percentage": "13.00%", "elapsed_time": "26m 27s", "remaining_time": "2h 57m 1s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.259959} -{"loss": 1.05531096, "grad_norm": 3.04028058, "learning_rate": 3.281e-05, "token_acc": 0.71073472, "epoch": 0.26282854, "global_step/max_steps": "105/800", "percentage": "13.12%", "elapsed_time": "26m 44s", "remaining_time": "2h 56m 54s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.271602} -{"loss": 1.12220788, "grad_norm": 3.40721774, "learning_rate": 3.312e-05, "token_acc": 0.6884954, "epoch": 0.26533166, "global_step/max_steps": "106/800", "percentage": "13.25%", "elapsed_time": "27m 5s", "remaining_time": "2h 57m 17s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.327094} -{"loss": 1.03995585, "grad_norm": 4.25051355, "learning_rate": 3.344e-05, "token_acc": 0.71569898, "epoch": 0.26783479, "global_step/max_steps": "107/800", "percentage": "13.38%", "elapsed_time": "27m 17s", "remaining_time": "2h 56m 41s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.297636} -{"loss": 0.97971511, "grad_norm": 1.53109837, "learning_rate": 3.375e-05, "token_acc": 0.72382024, "epoch": 0.27033792, "global_step/max_steps": "108/800", "percentage": "13.50%", "elapsed_time": "27m 33s", "remaining_time": "2h 56m 34s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.309722} -{"loss": 1.07558298, "grad_norm": 1.16437936, "learning_rate": 3.406e-05, "token_acc": 0.69324109, "epoch": 0.27284105, "global_step/max_steps": "109/800", "percentage": "13.63%", "elapsed_time": "27m 55s", "remaining_time": "2h 57m 0s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.369132} -{"loss": 1.08543026, "grad_norm": 5.060781, "learning_rate": 3.438e-05, "token_acc": 0.70547531, "epoch": 0.27534418, "global_step/max_steps": "110/800", "percentage": "13.75%", "elapsed_time": "28m 12s", "remaining_time": "2h 56m 51s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.377939} -{"loss": 0.96118927, "grad_norm": 3.01653481, "learning_rate": 3.469e-05, "token_acc": 0.73387534, "epoch": 0.27784731, "global_step/max_steps": "111/800", "percentage": "13.88%", "elapsed_time": "28m 31s", "remaining_time": "2h 57m 1s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.415536} -{"loss": 0.96790993, "grad_norm": 5.62055397, "learning_rate": 3.5e-05, "token_acc": 0.72828493, "epoch": 0.28035044, "global_step/max_steps": "112/800", "percentage": "14.00%", "elapsed_time": "28m 47s", "remaining_time": "2h 56m 51s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.423121} -{"loss": 1.02588415, "grad_norm": 3.35176611, "learning_rate": 3.531e-05, "token_acc": 0.71852779, "epoch": 0.28285357, "global_step/max_steps": "113/800", "percentage": "14.12%", "elapsed_time": "29m 4s", "remaining_time": "2h 56m 41s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.431319} -{"loss": 1.01165485, "grad_norm": 4.18623829, "learning_rate": 3.563e-05, "token_acc": 0.71713227, "epoch": 0.2853567, "global_step/max_steps": "114/800", "percentage": "14.25%", "elapsed_time": "29m 17s", "remaining_time": "2h 56m 12s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.410633} -{"loss": 0.96255618, "grad_norm": 4.77506971, "learning_rate": 3.594e-05, "token_acc": 0.73780438, "epoch": 0.28785982, "global_step/max_steps": "115/800", "percentage": "14.37%", "elapsed_time": "29m 27s", "remaining_time": "2h 55m 28s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.36903} -{"loss": 1.04013705, "grad_norm": 2.43394947, "learning_rate": 3.625e-05, "token_acc": 0.7105673, "epoch": 0.29036295, "global_step/max_steps": "116/800", "percentage": "14.50%", "elapsed_time": "29m 44s", "remaining_time": "2h 55m 22s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.382899} -{"loss": 0.88990331, "grad_norm": 2.835706, "learning_rate": 3.656e-05, "token_acc": 0.76046349, "epoch": 0.29286608, "global_step/max_steps": "117/800", "percentage": "14.62%", "elapsed_time": "29m 53s", "remaining_time": "2h 54m 27s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.325755} -{"loss": 1.08645368, "grad_norm": 3.83684278, "learning_rate": 3.688e-05, "token_acc": 0.70042581, "epoch": 0.29536921, "global_step/max_steps": "118/800", "percentage": "14.75%", "elapsed_time": "30m 7s", "remaining_time": "2h 54m 2s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.310955} -{"loss": 1.07345748, "grad_norm": 2.64096141, "learning_rate": 3.719e-05, "token_acc": 0.70241487, "epoch": 0.29787234, "global_step/max_steps": "119/800", "percentage": "14.88%", "elapsed_time": "30m 30s", "remaining_time": "2h 54m 30s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.374299} -{"loss": 0.98852909, "grad_norm": 2.48431253, "learning_rate": 3.75e-05, "token_acc": 0.72148417, "epoch": 0.30037547, "global_step/max_steps": "120/800", "percentage": "15.00%", "elapsed_time": "30m 40s", "remaining_time": "2h 53m 45s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.330624} -{"loss": 1.01558328, "grad_norm": 3.21952963, "learning_rate": 3.781e-05, "token_acc": 0.71828979, "epoch": 0.3028786, "global_step/max_steps": "121/800", "percentage": "15.12%", "elapsed_time": "31m 6s", "remaining_time": "2h 54m 30s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.419379} -{"loss": 0.97724038, "grad_norm": 4.39776802, "learning_rate": 3.812e-05, "token_acc": 0.7289816, "epoch": 0.30538173, "global_step/max_steps": "122/800", "percentage": "15.25%", "elapsed_time": "31m 15s", "remaining_time": "2h 53m 39s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.367015} -{"loss": 1.08455217, "grad_norm": 7.47625113, "learning_rate": 3.844e-05, "token_acc": 0.70002854, "epoch": 0.30788486, "global_step/max_steps": "123/800", "percentage": "15.38%", "elapsed_time": "31m 36s", "remaining_time": "2h 53m 55s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.413543} -{"loss": 1.0315274, "grad_norm": 2.45437193, "learning_rate": 3.875e-05, "token_acc": 0.71449725, "epoch": 0.31038798, "global_step/max_steps": "124/800", "percentage": "15.50%", "elapsed_time": "31m 45s", "remaining_time": "2h 53m 4s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.360811} -{"loss": 0.92685664, "grad_norm": 2.12376523, "learning_rate": 3.906e-05, "token_acc": 0.74075875, "epoch": 0.31289111, "global_step/max_steps": "125/800", "percentage": "15.62%", "elapsed_time": "31m 59s", "remaining_time": "2h 52m 43s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.352896} -{"loss": 0.90852255, "grad_norm": 4.28669453, "learning_rate": 3.938e-05, "token_acc": 0.74487125, "epoch": 0.31539424, "global_step/max_steps": "126/800", "percentage": "15.75%", "elapsed_time": "32m 10s", "remaining_time": "2h 52m 3s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.31582} -{"loss": 0.87274963, "grad_norm": 2.37309718, "learning_rate": 3.969e-05, "token_acc": 0.76220183, "epoch": 0.31789737, "global_step/max_steps": "127/800", "percentage": "15.88%", "elapsed_time": "32m 18s", "remaining_time": "2h 51m 9s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.257887} -{"loss": 1.00613391, "grad_norm": 2.7027216, "learning_rate": 4e-05, "token_acc": 0.71291163, "epoch": 0.3204005, "global_step/max_steps": "128/800", "percentage": "16.00%", "elapsed_time": "32m 29s", "remaining_time": "2h 50m 30s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.222819} -{"loss": 1.00053167, "grad_norm": 2.36391711, "learning_rate": 4.031e-05, "token_acc": 0.72053691, "epoch": 0.32290363, "global_step/max_steps": "129/800", "percentage": "16.12%", "elapsed_time": "32m 39s", "remaining_time": "2h 49m 50s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.185996} -{"loss": 0.98046845, "grad_norm": 5.39345169, "learning_rate": 4.063e-05, "token_acc": 0.72649819, "epoch": 0.32540676, "global_step/max_steps": "130/800", "percentage": "16.25%", "elapsed_time": "32m 54s", "remaining_time": "2h 49m 35s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.187195} -{"loss": 0.87793314, "grad_norm": 4.67309046, "learning_rate": 4.094e-05, "token_acc": 0.76021069, "epoch": 0.32790989, "global_step/max_steps": "131/800", "percentage": "16.38%", "elapsed_time": "33m 19s", "remaining_time": "2h 50m 7s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.256803} -{"loss": 0.97358656, "grad_norm": 2.62490153, "learning_rate": 4.125e-05, "token_acc": 0.72385459, "epoch": 0.33041302, "global_step/max_steps": "132/800", "percentage": "16.50%", "elapsed_time": "33m 35s", "remaining_time": "2h 49m 58s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.266335} -{"loss": 1.016155, "grad_norm": 2.82972813, "learning_rate": 4.156e-05, "token_acc": 0.71420641, "epoch": 0.33291615, "global_step/max_steps": "133/800", "percentage": "16.62%", "elapsed_time": "33m 60s", "remaining_time": "2h 50m 29s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.335511} -{"loss": 0.94920266, "grad_norm": 2.40812111, "learning_rate": 4.188e-05, "token_acc": 0.73637195, "epoch": 0.33541927, "global_step/max_steps": "134/800", "percentage": "16.75%", "elapsed_time": "34m 9s", "remaining_time": "2h 49m 45s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.292955} -{"loss": 0.86938757, "grad_norm": 2.75805092, "learning_rate": 4.219e-05, "token_acc": 0.75599726, "epoch": 0.3379224, "global_step/max_steps": "135/800", "percentage": "16.88%", "elapsed_time": "34m 22s", "remaining_time": "2h 49m 15s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.271087} -{"loss": 0.93721259, "grad_norm": 2.27042222, "learning_rate": 4.25e-05, "token_acc": 0.73372908, "epoch": 0.34042553, "global_step/max_steps": "136/800", "percentage": "17.00%", "elapsed_time": "34m 31s", "remaining_time": "2h 48m 33s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.230191} -{"loss": 1.00789356, "grad_norm": 4.36007071, "learning_rate": 4.281e-05, "token_acc": 0.71469078, "epoch": 0.34292866, "global_step/max_steps": "137/800", "percentage": "17.12%", "elapsed_time": "34m 49s", "remaining_time": "2h 48m 28s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.245614} -{"loss": 0.83412504, "grad_norm": 13.7130537, "learning_rate": 4.313e-05, "token_acc": 0.7732564, "epoch": 0.34543179, "global_step/max_steps": "138/800", "percentage": "17.25%", "elapsed_time": "35m 1s", "remaining_time": "2h 47m 58s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.222897} -{"loss": 0.95216227, "grad_norm": 4.24861526, "learning_rate": 4.344e-05, "token_acc": 0.73309978, "epoch": 0.34793492, "global_step/max_steps": "139/800", "percentage": "17.38%", "elapsed_time": "35m 12s", "remaining_time": "2h 47m 26s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.19774} -{"loss": 0.89396441, "grad_norm": 4.98814201, "learning_rate": 4.375e-05, "token_acc": 0.74768158, "epoch": 0.35043805, "global_step/max_steps": "140/800", "percentage": "17.50%", "elapsed_time": "35m 25s", "remaining_time": "2h 46m 60s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.18168} -{"loss": 0.88788128, "grad_norm": 3.86409616, "learning_rate": 4.406e-05, "token_acc": 0.74595163, "epoch": 0.35294118, "global_step/max_steps": "141/800", "percentage": "17.62%", "elapsed_time": "35m 48s", "remaining_time": "2h 47m 22s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.237576} -{"loss": 1.02975833, "grad_norm": 4.25064659, "learning_rate": 4.438e-05, "token_acc": 0.71363253, "epoch": 0.35544431, "global_step/max_steps": "142/800", "percentage": "17.75%", "elapsed_time": "36m 13s", "remaining_time": "2h 47m 47s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.299409} -{"loss": 0.88272381, "grad_norm": 4.43787336, "learning_rate": 4.469e-05, "token_acc": 0.7566478, "epoch": 0.35794743, "global_step/max_steps": "143/800", "percentage": "17.88%", "elapsed_time": "36m 25s", "remaining_time": "2h 47m 19s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.279638} -{"loss": 0.95201731, "grad_norm": 2.90399861, "learning_rate": 4.5e-05, "token_acc": 0.73193957, "epoch": 0.36045056, "global_step/max_steps": "144/800", "percentage": "18.00%", "elapsed_time": "36m 41s", "remaining_time": "2h 47m 8s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.287183} -{"loss": 0.93190789, "grad_norm": 4.12917376, "learning_rate": 4.531e-05, "token_acc": 0.73317203, "epoch": 0.36295369, "global_step/max_steps": "145/800", "percentage": "18.12%", "elapsed_time": "36m 53s", "remaining_time": "2h 46m 39s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.265447} -{"loss": 0.91924131, "grad_norm": 6.24915695, "learning_rate": 4.562e-05, "token_acc": 0.73463524, "epoch": 0.36545682, "global_step/max_steps": "146/800", "percentage": "18.25%", "elapsed_time": "37m 14s", "remaining_time": "2h 46m 46s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.300101} -{"loss": 0.84541476, "grad_norm": 2.81880903, "learning_rate": 4.594e-05, "token_acc": 0.75616539, "epoch": 0.36795995, "global_step/max_steps": "147/800", "percentage": "18.38%", "elapsed_time": "37m 25s", "remaining_time": "2h 46m 11s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.269823} -{"loss": 0.91398734, "grad_norm": 20.902668, "learning_rate": 4.625e-05, "token_acc": 0.7434645, "epoch": 0.37046308, "global_step/max_steps": "148/800", "percentage": "18.50%", "elapsed_time": "37m 35s", "remaining_time": "2h 45m 33s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.234166} -{"loss": 1.03688431, "grad_norm": 3.02216482, "learning_rate": 4.656e-05, "token_acc": 0.70423052, "epoch": 0.37296621, "global_step/max_steps": "149/800", "percentage": "18.62%", "elapsed_time": "37m 51s", "remaining_time": "2h 45m 21s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.239594} -{"loss": 0.97450632, "grad_norm": 2.99872375, "learning_rate": 4.688e-05, "token_acc": 0.7196576, "epoch": 0.37546934, "global_step/max_steps": "150/800", "percentage": "18.75%", "elapsed_time": "38m 6s", "remaining_time": "2h 45m 7s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.241544} -{"loss": 1.02348602, "grad_norm": 2.3661983, "learning_rate": 4.719e-05, "token_acc": 0.71217671, "epoch": 0.37797247, "global_step/max_steps": "151/800", "percentage": "18.88%", "elapsed_time": "38m 30s", "remaining_time": "2h 45m 26s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.295061} -{"loss": 0.86048073, "grad_norm": 2.62725878, "learning_rate": 4.75e-05, "token_acc": 0.75136029, "epoch": 0.38047559, "global_step/max_steps": "152/800", "percentage": "19.00%", "elapsed_time": "38m 46s", "remaining_time": "2h 45m 18s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.30563} -{"loss": 1.01763916, "grad_norm": 2.51507926, "learning_rate": 4.781e-05, "token_acc": 0.71111022, "epoch": 0.38297872, "global_step/max_steps": "153/800", "percentage": "19.12%", "elapsed_time": "39m 8s", "remaining_time": "2h 45m 28s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.344533} -{"loss": 0.88416594, "grad_norm": 55.79320526, "learning_rate": 4.813e-05, "token_acc": 0.74801988, "epoch": 0.38548185, "global_step/max_steps": "154/800", "percentage": "19.25%", "elapsed_time": "39m 17s", "remaining_time": "2h 44m 48s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.307001} -{"loss": 0.98841882, "grad_norm": 3.12165523, "learning_rate": 4.844e-05, "token_acc": 0.72130716, "epoch": 0.38798498, "global_step/max_steps": "155/800", "percentage": "19.38%", "elapsed_time": "39m 35s", "remaining_time": "2h 44m 43s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.323144} -{"loss": 0.88717318, "grad_norm": 2.30952811, "learning_rate": 4.875e-05, "token_acc": 0.74751742, "epoch": 0.39048811, "global_step/max_steps": "156/800", "percentage": "19.50%", "elapsed_time": "39m 47s", "remaining_time": "2h 44m 14s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.301367} -{"loss": 0.95506501, "grad_norm": 1.56478405, "learning_rate": 4.906e-05, "token_acc": 0.72621105, "epoch": 0.39299124, "global_step/max_steps": "157/800", "percentage": "19.62%", "elapsed_time": "39m 60s", "remaining_time": "2h 43m 49s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.285713} -{"loss": 0.84854269, "grad_norm": 4.77028704, "learning_rate": 4.938e-05, "token_acc": 0.75522121, "epoch": 0.39549437, "global_step/max_steps": "158/800", "percentage": "19.75%", "elapsed_time": "40m 17s", "remaining_time": "2h 43m 39s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.294634} -{"loss": 0.88217527, "grad_norm": 2.7487731, "learning_rate": 4.969e-05, "token_acc": 0.75156576, "epoch": 0.3979975, "global_step/max_steps": "159/800", "percentage": "19.88%", "elapsed_time": "40m 51s", "remaining_time": "2h 44m 42s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.41658} -{"loss": 0.93957639, "grad_norm": 1.97374499, "learning_rate": 5e-05, "token_acc": 0.72797484, "epoch": 0.40050063, "global_step/max_steps": "160/800", "percentage": "20.00%", "elapsed_time": "41m 9s", "remaining_time": "2h 44m 38s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.433673} -{"loss": 0.86869198, "grad_norm": 4.47208118, "learning_rate": 5e-05, "token_acc": 0.76036036, "epoch": 0.40300375, "global_step/max_steps": "161/800", "percentage": "20.12%", "elapsed_time": "41m 29s", "remaining_time": "2h 44m 39s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.460859} -{"loss": 0.87257755, "grad_norm": 3.63794827, "learning_rate": 5e-05, "token_acc": 0.74721604, "epoch": 0.40550688, "global_step/max_steps": "162/800", "percentage": "20.25%", "elapsed_time": "41m 41s", "remaining_time": "2h 44m 10s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.439076} -{"loss": 0.84715098, "grad_norm": 3.4930377, "learning_rate": 5e-05, "token_acc": 0.75389432, "epoch": 0.40801001, "global_step/max_steps": "163/800", "percentage": "20.38%", "elapsed_time": "42m 3s", "remaining_time": "2h 44m 22s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.481214} -{"loss": 0.97391379, "grad_norm": 1.91261172, "learning_rate": 5e-05, "token_acc": 0.72129824, "epoch": 0.41051314, "global_step/max_steps": "164/800", "percentage": "20.50%", "elapsed_time": "42m 15s", "remaining_time": "2h 43m 52s", "memory(GiB)": 68.72, "train_speed(s/it)": 15.45959} -{"loss": 0.9264943, "grad_norm": 11.75062943, "learning_rate": 4.999e-05, "token_acc": 0.73248056, "epoch": 0.41301627, "global_step/max_steps": "165/800", "percentage": "20.62%", "elapsed_time": "42m 37s", "remaining_time": "2h 44m 1s", "memory(GiB)": 69.0, "train_speed(s/it)": 15.497132} -{"loss": 0.95248973, "grad_norm": 1.79902983, "learning_rate": 4.999e-05, "token_acc": 0.72596303, "epoch": 0.4155194, "global_step/max_steps": "166/800", "percentage": "20.75%", "elapsed_time": "42m 53s", "remaining_time": "2h 43m 49s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.502933} -{"loss": 0.86165977, "grad_norm": 1.65303266, "learning_rate": 4.999e-05, "token_acc": 0.75091217, "epoch": 0.41802253, "global_step/max_steps": "167/800", "percentage": "20.88%", "elapsed_time": "43m 7s", "remaining_time": "2h 43m 24s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.488354} -{"loss": 0.94576585, "grad_norm": 3.85363317, "learning_rate": 4.998e-05, "token_acc": 0.72627848, "epoch": 0.42052566, "global_step/max_steps": "168/800", "percentage": "21.00%", "elapsed_time": "43m 21s", "remaining_time": "2h 43m 5s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.483058} -{"loss": 0.78900528, "grad_norm": 2.98481274, "learning_rate": 4.998e-05, "token_acc": 0.77540668, "epoch": 0.42302879, "global_step/max_steps": "169/800", "percentage": "21.12%", "elapsed_time": "43m 32s", "remaining_time": "2h 42m 34s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.45727} -{"loss": 0.83647096, "grad_norm": 5.07847452, "learning_rate": 4.997e-05, "token_acc": 0.76464208, "epoch": 0.42553191, "global_step/max_steps": "170/800", "percentage": "21.25%", "elapsed_time": "43m 44s", "remaining_time": "2h 42m 5s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.436369} -{"loss": 0.84394836, "grad_norm": 2.06341815, "learning_rate": 4.996e-05, "token_acc": 0.76077625, "epoch": 0.42803504, "global_step/max_steps": "171/800", "percentage": "21.38%", "elapsed_time": "44m 5s", "remaining_time": "2h 42m 9s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.468067} -{"loss": 0.81535119, "grad_norm": 2.26136899, "learning_rate": 4.996e-05, "token_acc": 0.75933043, "epoch": 0.43053817, "global_step/max_steps": "172/800", "percentage": "21.50%", "elapsed_time": "44m 13s", "remaining_time": "2h 41m 27s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.424417} -{"loss": 0.95092589, "grad_norm": 2.94229174, "learning_rate": 4.995e-05, "token_acc": 0.7278411, "epoch": 0.4330413, "global_step/max_steps": "173/800", "percentage": "21.62%", "elapsed_time": "44m 28s", "remaining_time": "2h 41m 11s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.423852} -{"loss": 0.90625662, "grad_norm": 1.54255307, "learning_rate": 4.994e-05, "token_acc": 0.74860252, "epoch": 0.43554443, "global_step/max_steps": "174/800", "percentage": "21.75%", "elapsed_time": "44m 43s", "remaining_time": "2h 40m 51s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.416713} -{"loss": 0.82270169, "grad_norm": 2.69392586, "learning_rate": 4.993e-05, "token_acc": 0.76610453, "epoch": 0.43804756, "global_step/max_steps": "175/800", "percentage": "21.88%", "elapsed_time": "44m 53s", "remaining_time": "2h 40m 17s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.386597} -{"loss": 0.91675711, "grad_norm": 5.91594553, "learning_rate": 4.992e-05, "token_acc": 0.73672904, "epoch": 0.44055069, "global_step/max_steps": "176/800", "percentage": "22.00%", "elapsed_time": "45m 5s", "remaining_time": "2h 39m 51s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.369474} -{"loss": 0.86070687, "grad_norm": 1.68809104, "learning_rate": 4.991e-05, "token_acc": 0.75477732, "epoch": 0.44305382, "global_step/max_steps": "177/800", "percentage": "22.12%", "elapsed_time": "45m 14s", "remaining_time": "2h 39m 12s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.331768} -{"loss": 1.00755072, "grad_norm": 1.59187376, "learning_rate": 4.99e-05, "token_acc": 0.71309096, "epoch": 0.44555695, "global_step/max_steps": "178/800", "percentage": "22.25%", "elapsed_time": "45m 34s", "remaining_time": "2h 39m 15s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.361879} -{"loss": 0.84694761, "grad_norm": 5.92417145, "learning_rate": 4.989e-05, "token_acc": 0.76377815, "epoch": 0.44806008, "global_step/max_steps": "179/800", "percentage": "22.38%", "elapsed_time": "45m 43s", "remaining_time": "2h 38m 35s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.322613} -{"loss": 0.91369259, "grad_norm": 1.86896276, "learning_rate": 4.988e-05, "token_acc": 0.74227168, "epoch": 0.4505632, "global_step/max_steps": "180/800", "percentage": "22.50%", "elapsed_time": "45m 52s", "remaining_time": "2h 37m 60s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.28956} -{"loss": 0.80970168, "grad_norm": 3.0246079, "learning_rate": 4.987e-05, "token_acc": 0.76724806, "epoch": 0.45306633, "global_step/max_steps": "181/800", "percentage": "22.62%", "elapsed_time": "46m 12s", "remaining_time": "2h 37m 60s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.314218} -{"loss": 0.94569629, "grad_norm": 1.09986615, "learning_rate": 4.985e-05, "token_acc": 0.73020642, "epoch": 0.45556946, "global_step/max_steps": "182/800", "percentage": "22.75%", "elapsed_time": "46m 26s", "remaining_time": "2h 37m 40s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.306711} -{"loss": 0.95433849, "grad_norm": 1.78731525, "learning_rate": 4.984e-05, "token_acc": 0.73068969, "epoch": 0.45807259, "global_step/max_steps": "183/800", "percentage": "22.88%", "elapsed_time": "46m 42s", "remaining_time": "2h 37m 28s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.312602} -{"loss": 0.93924206, "grad_norm": 1.83257389, "learning_rate": 4.983e-05, "token_acc": 0.73054828, "epoch": 0.46057572, "global_step/max_steps": "184/800", "percentage": "23.00%", "elapsed_time": "46m 56s", "remaining_time": "2h 37m 8s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.304742} -{"loss": 0.85237497, "grad_norm": 2.02833533, "learning_rate": 4.981e-05, "token_acc": 0.75189767, "epoch": 0.46307885, "global_step/max_steps": "185/800", "percentage": "23.12%", "elapsed_time": "47m 5s", "remaining_time": "2h 36m 31s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.270607} -{"loss": 1.00264001, "grad_norm": 1.8880775, "learning_rate": 4.98e-05, "token_acc": 0.71794267, "epoch": 0.46558198, "global_step/max_steps": "186/800", "percentage": "23.25%", "elapsed_time": "47m 21s", "remaining_time": "2h 36m 18s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.272992} -{"loss": 0.87022597, "grad_norm": 1.58210349, "learning_rate": 4.978e-05, "token_acc": 0.75180545, "epoch": 0.46808511, "global_step/max_steps": "187/800", "percentage": "23.38%", "elapsed_time": "47m 30s", "remaining_time": "2h 35m 44s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.243086} -{"loss": 0.98195064, "grad_norm": 1.389552, "learning_rate": 4.976e-05, "token_acc": 0.72625793, "epoch": 0.47058824, "global_step/max_steps": "188/800", "percentage": "23.50%", "elapsed_time": "47m 48s", "remaining_time": "2h 35m 35s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.253094} -{"loss": 0.8391701, "grad_norm": 2.17562151, "learning_rate": 4.975e-05, "token_acc": 0.75379296, "epoch": 0.47309136, "global_step/max_steps": "189/800", "percentage": "23.62%", "elapsed_time": "47m 60s", "remaining_time": "2h 35m 10s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.23749} -{"loss": 0.84955513, "grad_norm": 1.74781883, "learning_rate": 4.973e-05, "token_acc": 0.7538737, "epoch": 0.47559449, "global_step/max_steps": "190/800", "percentage": "23.75%", "elapsed_time": "48m 16s", "remaining_time": "2h 34m 57s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.241293} -{"loss": 0.8685894, "grad_norm": 2.79447961, "learning_rate": 4.971e-05, "token_acc": 0.75040719, "epoch": 0.47809762, "global_step/max_steps": "191/800", "percentage": "23.88%", "elapsed_time": "48m 42s", "remaining_time": "2h 35m 18s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.300896} -{"loss": 0.80833882, "grad_norm": 11.88916874, "learning_rate": 4.969e-05, "token_acc": 0.76427019, "epoch": 0.48060075, "global_step/max_steps": "192/800", "percentage": "24.00%", "elapsed_time": "48m 51s", "remaining_time": "2h 34m 40s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.26335} -{"loss": 0.82383877, "grad_norm": 13.81488895, "learning_rate": 4.967e-05, "token_acc": 0.76103062, "epoch": 0.48310388, "global_step/max_steps": "193/800", "percentage": "24.12%", "elapsed_time": "49m 5s", "remaining_time": "2h 34m 23s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.260131} -{"loss": 0.93813229, "grad_norm": 1.47056162, "learning_rate": 4.965e-05, "token_acc": 0.72961811, "epoch": 0.48560701, "global_step/max_steps": "194/800", "percentage": "24.25%", "elapsed_time": "49m 25s", "remaining_time": "2h 34m 21s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.282084} -{"loss": 0.78152704, "grad_norm": 2.1061728, "learning_rate": 4.963e-05, "token_acc": 0.76686157, "epoch": 0.48811014, "global_step/max_steps": "195/800", "percentage": "24.38%", "elapsed_time": "49m 37s", "remaining_time": "2h 33m 56s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.266075} -{"loss": 0.89018375, "grad_norm": 1.45203841, "learning_rate": 4.961e-05, "token_acc": 0.73575669, "epoch": 0.49061327, "global_step/max_steps": "196/800", "percentage": "24.50%", "elapsed_time": "49m 51s", "remaining_time": "2h 33m 39s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.26243} -{"loss": 0.80049831, "grad_norm": 92.66796112, "learning_rate": 4.959e-05, "token_acc": 0.76660082, "epoch": 0.4931164, "global_step/max_steps": "197/800", "percentage": "24.62%", "elapsed_time": "50m 8s", "remaining_time": "2h 33m 26s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.267589} -{"loss": 0.99340761, "grad_norm": 3.92784095, "learning_rate": 4.957e-05, "token_acc": 0.71850849, "epoch": 0.49561952, "global_step/max_steps": "198/800", "percentage": "24.75%", "elapsed_time": "50m 23s", "remaining_time": "2h 33m 13s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.270033} -{"loss": 0.8867625, "grad_norm": 1.61559451, "learning_rate": 4.954e-05, "token_acc": 0.73880851, "epoch": 0.49812265, "global_step/max_steps": "199/800", "percentage": "24.88%", "elapsed_time": "50m 35s", "remaining_time": "2h 32m 46s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.251051} -{"loss": 0.83184129, "grad_norm": 2.88622212, "learning_rate": 4.952e-05, "token_acc": 0.75666193, "epoch": 0.50062578, "global_step/max_steps": "200/800", "percentage": "25.00%", "elapsed_time": "50m 46s", "remaining_time": "2h 32m 18s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.22952} -{"loss": 0.87806064, "grad_norm": 1.85695589, "learning_rate": 4.95e-05, "token_acc": 0.74527407, "epoch": 0.50312891, "global_step/max_steps": "201/800", "percentage": "25.12%", "elapsed_time": "51m 6s", "remaining_time": "2h 32m 16s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.252116} -{"loss": 0.76158059, "grad_norm": 1.90280092, "learning_rate": 4.947e-05, "token_acc": 0.78060401, "epoch": 0.50563204, "global_step/max_steps": "202/800", "percentage": "25.25%", "elapsed_time": "51m 15s", "remaining_time": "2h 31m 42s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.221293} -{"loss": 0.89224815, "grad_norm": 1.99658954, "learning_rate": 4.945e-05, "token_acc": 0.74391182, "epoch": 0.50813517, "global_step/max_steps": "203/800", "percentage": "25.37%", "elapsed_time": "51m 24s", "remaining_time": "2h 31m 10s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.192315} -{"loss": 0.97469151, "grad_norm": 2.46794844, "learning_rate": 4.942e-05, "token_acc": 0.72255601, "epoch": 0.5106383, "global_step/max_steps": "204/800", "percentage": "25.50%", "elapsed_time": "51m 41s", "remaining_time": "2h 31m 1s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.202895} -{"loss": 0.80295914, "grad_norm": 2.72579408, "learning_rate": 4.939e-05, "token_acc": 0.76861122, "epoch": 0.51314143, "global_step/max_steps": "205/800", "percentage": "25.62%", "elapsed_time": "51m 52s", "remaining_time": "2h 30m 33s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.182238} -{"loss": 0.95095539, "grad_norm": 3.26404238, "learning_rate": 4.937e-05, "token_acc": 0.72613684, "epoch": 0.51564456, "global_step/max_steps": "206/800", "percentage": "25.75%", "elapsed_time": "52m 9s", "remaining_time": "2h 30m 21s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.187104} -{"loss": 0.87935007, "grad_norm": 3.42675924, "learning_rate": 4.934e-05, "token_acc": 0.74801004, "epoch": 0.51814768, "global_step/max_steps": "207/800", "percentage": "25.87%", "elapsed_time": "52m 29s", "remaining_time": "2h 30m 20s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.210327} -{"loss": 0.78712511, "grad_norm": 4.14431763, "learning_rate": 4.931e-05, "token_acc": 0.76630513, "epoch": 0.52065081, "global_step/max_steps": "208/800", "percentage": "26.00%", "elapsed_time": "52m 45s", "remaining_time": "2h 30m 8s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.215953} -{"loss": 0.92889154, "grad_norm": 11.0394125, "learning_rate": 4.928e-05, "token_acc": 0.7273755, "epoch": 0.52315394, "global_step/max_steps": "209/800", "percentage": "26.12%", "elapsed_time": "52m 58s", "remaining_time": "2h 29m 46s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.204612} -{"loss": 0.94695878, "grad_norm": 1.35895777, "learning_rate": 4.925e-05, "token_acc": 0.73301815, "epoch": 0.52565707, "global_step/max_steps": "210/800", "percentage": "26.25%", "elapsed_time": "53m 13s", "remaining_time": "2h 29m 32s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.206804} -{"loss": 0.92247236, "grad_norm": 24.96767998, "learning_rate": 4.922e-05, "token_acc": 0.72950618, "epoch": 0.5281602, "global_step/max_steps": "211/800", "percentage": "26.38%", "elapsed_time": "53m 46s", "remaining_time": "2h 30m 5s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.287906} -{"loss": 0.93866634, "grad_norm": 5.61299801, "learning_rate": 4.919e-05, "token_acc": 0.7290345, "epoch": 0.53066333, "global_step/max_steps": "212/800", "percentage": "26.50%", "elapsed_time": "54m 7s", "remaining_time": "2h 30m 5s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.314541} -{"loss": 0.88765848, "grad_norm": 2.42146969, "learning_rate": 4.916e-05, "token_acc": 0.74098783, "epoch": 0.53316646, "global_step/max_steps": "213/800", "percentage": "26.62%", "elapsed_time": "54m 19s", "remaining_time": "2h 29m 41s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.299651} -{"loss": 0.85775816, "grad_norm": 2.54690027, "learning_rate": 4.913e-05, "token_acc": 0.74668705, "epoch": 0.53566959, "global_step/max_steps": "214/800", "percentage": "26.75%", "elapsed_time": "54m 38s", "remaining_time": "2h 29m 37s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.318981} -{"loss": 0.98471737, "grad_norm": 1.88848698, "learning_rate": 4.909e-05, "token_acc": 0.71606027, "epoch": 0.53817272, "global_step/max_steps": "215/800", "percentage": "26.88%", "elapsed_time": "54m 58s", "remaining_time": "2h 29m 33s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.33777} -{"loss": 0.93111867, "grad_norm": 1.47215664, "learning_rate": 4.906e-05, "token_acc": 0.73318039, "epoch": 0.54067584, "global_step/max_steps": "216/800", "percentage": "27.00%", "elapsed_time": "55m 13s", "remaining_time": "2h 29m 17s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.337674} -{"loss": 0.72723478, "grad_norm": 3.05833483, "learning_rate": 4.903e-05, "token_acc": 0.7930696, "epoch": 0.54317897, "global_step/max_steps": "217/800", "percentage": "27.12%", "elapsed_time": "55m 23s", "remaining_time": "2h 28m 47s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.311672} -{"loss": 0.86150539, "grad_norm": 2.52643228, "learning_rate": 4.899e-05, "token_acc": 0.74811682, "epoch": 0.5456821, "global_step/max_steps": "218/800", "percentage": "27.25%", "elapsed_time": "55m 34s", "remaining_time": "2h 28m 20s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.29256} -{"loss": 0.74472171, "grad_norm": 1.66032624, "learning_rate": 4.896e-05, "token_acc": 0.78624318, "epoch": 0.54818523, "global_step/max_steps": "219/800", "percentage": "27.38%", "elapsed_time": "55m 42s", "remaining_time": "2h 27m 46s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.259866} -{"loss": 0.88985848, "grad_norm": 1.48686957, "learning_rate": 4.892e-05, "token_acc": 0.74037937, "epoch": 0.55068836, "global_step/max_steps": "220/800", "percentage": "27.50%", "elapsed_time": "55m 52s", "remaining_time": "2h 27m 18s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.237704} -{"loss": 0.84233057, "grad_norm": 2.69958973, "learning_rate": 4.889e-05, "token_acc": 0.75401929, "epoch": 0.55319149, "global_step/max_steps": "221/800", "percentage": "27.62%", "elapsed_time": "56m 14s", "remaining_time": "2h 27m 19s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.265121} -{"loss": 0.87931955, "grad_norm": 2.18037105, "learning_rate": 4.885e-05, "token_acc": 0.74779904, "epoch": 0.55569462, "global_step/max_steps": "222/800", "percentage": "27.75%", "elapsed_time": "56m 37s", "remaining_time": "2h 27m 24s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.30177} -{"loss": 0.84970909, "grad_norm": 2.20300961, "learning_rate": 4.881e-05, "token_acc": 0.7462111, "epoch": 0.55819775, "global_step/max_steps": "223/800", "percentage": "27.88%", "elapsed_time": "56m 48s", "remaining_time": "2h 26m 59s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.28429} -{"loss": 0.80527008, "grad_norm": 1.62314153, "learning_rate": 4.878e-05, "token_acc": 0.76108084, "epoch": 0.56070088, "global_step/max_steps": "224/800", "percentage": "28.00%", "elapsed_time": "56m 59s", "remaining_time": "2h 26m 33s", "memory(GiB)": 70.8, "train_speed(s/it)": 15.264999} -{"loss": 0.88412309, "grad_norm": 2.36198545, "learning_rate": 4.874e-05, "token_acc": 0.74962644, "epoch": 0.56320401, "global_step/max_steps": "225/800", "percentage": "28.12%", "elapsed_time": "57m 17s", "remaining_time": "2h 26m 23s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.274221} -{"loss": 0.88534474, "grad_norm": 3.28450871, "learning_rate": 4.87e-05, "token_acc": 0.74298426, "epoch": 0.56570713, "global_step/max_steps": "226/800", "percentage": "28.25%", "elapsed_time": "57m 31s", "remaining_time": "2h 26m 5s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.269407} -{"loss": 0.83904046, "grad_norm": 1.51693773, "learning_rate": 4.866e-05, "token_acc": 0.76021646, "epoch": 0.56821026, "global_step/max_steps": "227/800", "percentage": "28.38%", "elapsed_time": "57m 42s", "remaining_time": "2h 25m 38s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.249167} -{"loss": 0.8904134, "grad_norm": 1.01725912, "learning_rate": 4.862e-05, "token_acc": 0.7438553, "epoch": 0.57071339, "global_step/max_steps": "228/800", "percentage": "28.50%", "elapsed_time": "58m 4s", "remaining_time": "2h 25m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.279201} -{"loss": 0.83532208, "grad_norm": 2.0630033, "learning_rate": 4.858e-05, "token_acc": 0.75711833, "epoch": 0.57321652, "global_step/max_steps": "229/800", "percentage": "28.62%", "elapsed_time": "58m 16s", "remaining_time": "2h 25m 18s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.267396} -{"loss": 0.89208084, "grad_norm": 1.72169983, "learning_rate": 4.854e-05, "token_acc": 0.73908244, "epoch": 0.57571965, "global_step/max_steps": "230/800", "percentage": "28.75%", "elapsed_time": "58m 28s", "remaining_time": "2h 24m 54s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.2535} -{"loss": 0.68457121, "grad_norm": 2.03873158, "learning_rate": 4.85e-05, "token_acc": 0.8008809, "epoch": 0.57822278, "global_step/max_steps": "231/800", "percentage": "28.88%", "elapsed_time": "58m 51s", "remaining_time": "2h 24m 58s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.286513} -{"loss": 0.82670856, "grad_norm": 2.12309909, "learning_rate": 4.845e-05, "token_acc": 0.75815197, "epoch": 0.58072591, "global_step/max_steps": "232/800", "percentage": "29.00%", "elapsed_time": "59m 2s", "remaining_time": "2h 24m 32s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.26794} -{"loss": 0.8310796, "grad_norm": 3.59165597, "learning_rate": 4.841e-05, "token_acc": 0.75441537, "epoch": 0.58322904, "global_step/max_steps": "233/800", "percentage": "29.12%", "elapsed_time": "59m 14s", "remaining_time": "2h 24m 8s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.252349} -{"loss": 0.80328482, "grad_norm": 36.2567215, "learning_rate": 4.837e-05, "token_acc": 0.76070012, "epoch": 0.58573217, "global_step/max_steps": "234/800", "percentage": "29.25%", "elapsed_time": "59m 25s", "remaining_time": "2h 23m 42s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.233725} -{"loss": 0.81282419, "grad_norm": 1.44019639, "learning_rate": 4.832e-05, "token_acc": 0.75731074, "epoch": 0.58823529, "global_step/max_steps": "235/800", "percentage": "29.38%", "elapsed_time": "59m 41s", "remaining_time": "2h 23m 29s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.236372} -{"loss": 0.85402346, "grad_norm": 10.95883465, "learning_rate": 4.828e-05, "token_acc": 0.74524381, "epoch": 0.59073842, "global_step/max_steps": "236/800", "percentage": "29.50%", "elapsed_time": "59m 58s", "remaining_time": "2h 23m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.245781} -{"loss": 0.9761827, "grad_norm": 3.50199556, "learning_rate": 4.824e-05, "token_acc": 0.71671972, "epoch": 0.59324155, "global_step/max_steps": "237/800", "percentage": "29.62%", "elapsed_time": "1h 0m 7s", "remaining_time": "2h 22m 48s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.218521} -{"loss": 0.79765636, "grad_norm": 3.4974575, "learning_rate": 4.819e-05, "token_acc": 0.76266026, "epoch": 0.59574468, "global_step/max_steps": "238/800", "percentage": "29.75%", "elapsed_time": "1h 0m 16s", "remaining_time": "2h 22m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.194638} -{"loss": 0.88069814, "grad_norm": 3.24346161, "learning_rate": 4.814e-05, "token_acc": 0.74819545, "epoch": 0.59824781, "global_step/max_steps": "239/800", "percentage": "29.88%", "elapsed_time": "1h 0m 36s", "remaining_time": "2h 22m 15s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.213253} -{"loss": 0.84934688, "grad_norm": 3.49842548, "learning_rate": 4.81e-05, "token_acc": 0.74901175, "epoch": 0.60075094, "global_step/max_steps": "240/800", "percentage": "30.00%", "elapsed_time": "1h 0m 59s", "remaining_time": "2h 22m 18s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.246843} -{"loss": 0.69163334, "grad_norm": 1.47111332, "learning_rate": 4.805e-05, "token_acc": 0.79416249, "epoch": 0.60325407, "global_step/max_steps": "241/800", "percentage": "30.12%", "elapsed_time": "1h 1m 17s", "remaining_time": "2h 22m 9s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.25722} -{"loss": 0.90327084, "grad_norm": 1.8549391, "learning_rate": 4.8e-05, "token_acc": 0.73426449, "epoch": 0.6057572, "global_step/max_steps": "242/800", "percentage": "30.25%", "elapsed_time": "1h 1m 40s", "remaining_time": "2h 22m 11s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.288207} -{"loss": 0.92301738, "grad_norm": 1.72106588, "learning_rate": 4.795e-05, "token_acc": 0.73112913, "epoch": 0.60826033, "global_step/max_steps": "243/800", "percentage": "30.38%", "elapsed_time": "1h 1m 51s", "remaining_time": "2h 21m 47s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.273548} -{"loss": 0.83878565, "grad_norm": 2.23008966, "learning_rate": 4.79e-05, "token_acc": 0.75206612, "epoch": 0.61076345, "global_step/max_steps": "244/800", "percentage": "30.50%", "elapsed_time": "1h 2m 5s", "remaining_time": "2h 21m 27s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.264466} -{"loss": 0.93965673, "grad_norm": 1.53766811, "learning_rate": 4.786e-05, "token_acc": 0.72902146, "epoch": 0.61326658, "global_step/max_steps": "245/800", "percentage": "30.63%", "elapsed_time": "1h 2m 20s", "remaining_time": "2h 21m 11s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.26359} -{"loss": 0.88850302, "grad_norm": 3.0389626, "learning_rate": 4.781e-05, "token_acc": 0.73549311, "epoch": 0.61576971, "global_step/max_steps": "246/800", "percentage": "30.75%", "elapsed_time": "1h 2m 40s", "remaining_time": "2h 21m 7s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.284144} -{"loss": 0.77422255, "grad_norm": 4.21496105, "learning_rate": 4.775e-05, "token_acc": 0.7741119, "epoch": 0.61827284, "global_step/max_steps": "247/800", "percentage": "30.88%", "elapsed_time": "1h 2m 50s", "remaining_time": "2h 20m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.26166} -{"loss": 0.88940257, "grad_norm": 1.70210731, "learning_rate": 4.77e-05, "token_acc": 0.73816774, "epoch": 0.62077597, "global_step/max_steps": "248/800", "percentage": "31.00%", "elapsed_time": "1h 3m 5s", "remaining_time": "2h 20m 25s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.263101} -{"loss": 0.90644312, "grad_norm": 1.69896734, "learning_rate": 4.765e-05, "token_acc": 0.7365356, "epoch": 0.6232791, "global_step/max_steps": "249/800", "percentage": "31.13%", "elapsed_time": "1h 3m 22s", "remaining_time": "2h 20m 13s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.269247} -{"loss": 0.74426854, "grad_norm": 1.84393799, "learning_rate": 4.76e-05, "token_acc": 0.77937688, "epoch": 0.62578223, "global_step/max_steps": "250/800", "percentage": "31.25%", "elapsed_time": "1h 3m 34s", "remaining_time": "2h 19m 51s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.255676} -{"loss": 0.84219277, "grad_norm": 4.35684347, "learning_rate": 4.755e-05, "token_acc": 0.75519117, "epoch": 0.62828536, "global_step/max_steps": "251/800", "percentage": "31.37%", "elapsed_time": "1h 3m 54s", "remaining_time": "2h 19m 47s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.276509} -{"loss": 0.88058603, "grad_norm": 1.58052766, "learning_rate": 4.749e-05, "token_acc": 0.74042465, "epoch": 0.63078849, "global_step/max_steps": "252/800", "percentage": "31.50%", "elapsed_time": "1h 4m 4s", "remaining_time": "2h 19m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.253783} -{"loss": 0.8358674, "grad_norm": 5.89507246, "learning_rate": 4.744e-05, "token_acc": 0.75305866, "epoch": 0.63329161, "global_step/max_steps": "253/800", "percentage": "31.62%", "elapsed_time": "1h 4m 17s", "remaining_time": "2h 19m 0s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.246937} -{"loss": 0.748667, "grad_norm": 2.49373126, "learning_rate": 4.739e-05, "token_acc": 0.77265657, "epoch": 0.63579474, "global_step/max_steps": "254/800", "percentage": "31.75%", "elapsed_time": "1h 4m 28s", "remaining_time": "2h 18m 34s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.22645} -{"loss": 0.71663976, "grad_norm": 2.241045, "learning_rate": 4.733e-05, "token_acc": 0.78785373, "epoch": 0.63829787, "global_step/max_steps": "255/800", "percentage": "31.87%", "elapsed_time": "1h 4m 42s", "remaining_time": "2h 18m 16s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.22204} -{"loss": 0.81768084, "grad_norm": 0.96005231, "learning_rate": 4.728e-05, "token_acc": 0.7578718, "epoch": 0.640801, "global_step/max_steps": "256/800", "percentage": "32.00%", "elapsed_time": "1h 4m 53s", "remaining_time": "2h 17m 53s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.207557} -{"loss": 0.79298443, "grad_norm": 1.64034986, "learning_rate": 4.722e-05, "token_acc": 0.76470588, "epoch": 0.64330413, "global_step/max_steps": "257/800", "percentage": "32.12%", "elapsed_time": "1h 5m 4s", "remaining_time": "2h 17m 29s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.192318} -{"loss": 0.77819782, "grad_norm": 2.68438792, "learning_rate": 4.716e-05, "token_acc": 0.768584, "epoch": 0.64580726, "global_step/max_steps": "258/800", "percentage": "32.25%", "elapsed_time": "1h 5m 22s", "remaining_time": "2h 17m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.201486} -{"loss": 0.82811332, "grad_norm": 1.13304698, "learning_rate": 4.711e-05, "token_acc": 0.75198132, "epoch": 0.64831039, "global_step/max_steps": "259/800", "percentage": "32.38%", "elapsed_time": "1h 5m 34s", "remaining_time": "2h 16m 58s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.190567} -{"loss": 0.87064278, "grad_norm": 1.6353662, "learning_rate": 4.705e-05, "token_acc": 0.74727786, "epoch": 0.65081352, "global_step/max_steps": "260/800", "percentage": "32.50%", "elapsed_time": "1h 5m 46s", "remaining_time": "2h 16m 36s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.176921} -{"loss": 0.91670364, "grad_norm": 1.70036411, "learning_rate": 4.699e-05, "token_acc": 0.73371036, "epoch": 0.65331665, "global_step/max_steps": "261/800", "percentage": "32.62%", "elapsed_time": "1h 6m 26s", "remaining_time": "2h 17m 11s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.27178} -{"loss": 0.73078883, "grad_norm": 4.74411297, "learning_rate": 4.693e-05, "token_acc": 0.78579245, "epoch": 0.65581977, "global_step/max_steps": "262/800", "percentage": "32.75%", "elapsed_time": "1h 6m 37s", "remaining_time": "2h 16m 48s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.257053} -{"loss": 0.90978301, "grad_norm": 2.0567503, "learning_rate": 4.687e-05, "token_acc": 0.73351903, "epoch": 0.6583229, "global_step/max_steps": "263/800", "percentage": "32.88%", "elapsed_time": "1h 6m 56s", "remaining_time": "2h 16m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.269626} -{"loss": 0.96862888, "grad_norm": 1.58456659, "learning_rate": 4.681e-05, "token_acc": 0.72006444, "epoch": 0.66082603, "global_step/max_steps": "264/800", "percentage": "33.00%", "elapsed_time": "1h 7m 15s", "remaining_time": "2h 16m 33s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.285482} -{"loss": 0.80481106, "grad_norm": 3.12639928, "learning_rate": 4.675e-05, "token_acc": 0.76670474, "epoch": 0.66332916, "global_step/max_steps": "265/800", "percentage": "33.12%", "elapsed_time": "1h 7m 30s", "remaining_time": "2h 16m 17s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.283838} -{"loss": 0.83485734, "grad_norm": 3.08908272, "learning_rate": 4.669e-05, "token_acc": 0.75275718, "epoch": 0.66583229, "global_step/max_steps": "266/800", "percentage": "33.25%", "elapsed_time": "1h 7m 45s", "remaining_time": "2h 16m 0s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.280948} -{"loss": 0.95138705, "grad_norm": 0.92535067, "learning_rate": 4.663e-05, "token_acc": 0.73030942, "epoch": 0.66833542, "global_step/max_steps": "267/800", "percentage": "33.38%", "elapsed_time": "1h 7m 57s", "remaining_time": "2h 15m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.271503} -{"loss": 0.84389877, "grad_norm": 1.58416998, "learning_rate": 4.657e-05, "token_acc": 0.75525493, "epoch": 0.67083855, "global_step/max_steps": "268/800", "percentage": "33.50%", "elapsed_time": "1h 8m 8s", "remaining_time": "2h 15m 15s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.252839} -{"loss": 0.86667252, "grad_norm": 1.36985898, "learning_rate": 4.651e-05, "token_acc": 0.7492324, "epoch": 0.67334168, "global_step/max_steps": "269/800", "percentage": "33.62%", "elapsed_time": "1h 8m 20s", "remaining_time": "2h 14m 53s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.241454} -{"loss": 0.82925832, "grad_norm": 2.27767277, "learning_rate": 4.644e-05, "token_acc": 0.75944277, "epoch": 0.67584481, "global_step/max_steps": "270/800", "percentage": "33.75%", "elapsed_time": "1h 8m 30s", "remaining_time": "2h 14m 28s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.223253} -{"loss": 0.70245659, "grad_norm": 1.34382915, "learning_rate": 4.638e-05, "token_acc": 0.78654883, "epoch": 0.67834793, "global_step/max_steps": "271/800", "percentage": "33.88%", "elapsed_time": "1h 8m 51s", "remaining_time": "2h 14m 23s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.24281} -{"loss": 0.85397458, "grad_norm": 2.1684103, "learning_rate": 4.632e-05, "token_acc": 0.74676319, "epoch": 0.68085106, "global_step/max_steps": "272/800", "percentage": "34.00%", "elapsed_time": "1h 9m 7s", "remaining_time": "2h 14m 9s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.244492} -{"loss": 0.81346929, "grad_norm": 2.05404305, "learning_rate": 4.625e-05, "token_acc": 0.76032593, "epoch": 0.68335419, "global_step/max_steps": "273/800", "percentage": "34.12%", "elapsed_time": "1h 9m 18s", "remaining_time": "2h 13m 46s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.228997} -{"loss": 0.78875458, "grad_norm": 7.12939978, "learning_rate": 4.619e-05, "token_acc": 0.76521799, "epoch": 0.68585732, "global_step/max_steps": "274/800", "percentage": "34.25%", "elapsed_time": "1h 9m 30s", "remaining_time": "2h 13m 26s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.220223} -{"loss": 0.71409702, "grad_norm": 2.24557805, "learning_rate": 4.612e-05, "token_acc": 0.79129226, "epoch": 0.68836045, "global_step/max_steps": "275/800", "percentage": "34.38%", "elapsed_time": "1h 9m 41s", "remaining_time": "2h 13m 2s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.203324} -{"loss": 0.82489312, "grad_norm": 2.30219078, "learning_rate": 4.606e-05, "token_acc": 0.75696069, "epoch": 0.69086358, "global_step/max_steps": "276/800", "percentage": "34.50%", "elapsed_time": "1h 9m 56s", "remaining_time": "2h 12m 46s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.202669} -{"loss": 0.91426593, "grad_norm": 1.26659083, "learning_rate": 4.599e-05, "token_acc": 0.73111363, "epoch": 0.69336671, "global_step/max_steps": "277/800", "percentage": "34.62%", "elapsed_time": "1h 10m 21s", "remaining_time": "2h 12m 50s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.239574} -{"loss": 0.86120582, "grad_norm": 1.35628128, "learning_rate": 4.592e-05, "token_acc": 0.74610158, "epoch": 0.69586984, "global_step/max_steps": "278/800", "percentage": "34.75%", "elapsed_time": "1h 10m 37s", "remaining_time": "2h 12m 35s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.24032} -{"loss": 0.75880241, "grad_norm": 1.5480262, "learning_rate": 4.585e-05, "token_acc": 0.77761901, "epoch": 0.69837297, "global_step/max_steps": "279/800", "percentage": "34.88%", "elapsed_time": "1h 10m 49s", "remaining_time": "2h 12m 15s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.230594} -{"loss": 0.77470744, "grad_norm": 4.49714422, "learning_rate": 4.579e-05, "token_acc": 0.77104987, "epoch": 0.7008761, "global_step/max_steps": "280/800", "percentage": "35.00%", "elapsed_time": "1h 10m 56s", "remaining_time": "2h 11m 44s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.199997} -{"loss": 0.92823911, "grad_norm": 2.4977355, "learning_rate": 4.572e-05, "token_acc": 0.72756595, "epoch": 0.70337922, "global_step/max_steps": "281/800", "percentage": "35.12%", "elapsed_time": "1h 11m 17s", "remaining_time": "2h 11m 39s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.219313} -{"loss": 0.85645407, "grad_norm": 1.21825862, "learning_rate": 4.565e-05, "token_acc": 0.74679009, "epoch": 0.70588235, "global_step/max_steps": "282/800", "percentage": "35.25%", "elapsed_time": "1h 11m 33s", "remaining_time": "2h 11m 26s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.223096} -{"loss": 0.88749528, "grad_norm": 5.53813362, "learning_rate": 4.558e-05, "token_acc": 0.74083395, "epoch": 0.70838548, "global_step/max_steps": "283/800", "percentage": "35.38%", "elapsed_time": "1h 11m 52s", "remaining_time": "2h 11m 17s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.236322} -{"loss": 0.72958386, "grad_norm": 1.75422418, "learning_rate": 4.551e-05, "token_acc": 0.78206021, "epoch": 0.71088861, "global_step/max_steps": "284/800", "percentage": "35.50%", "elapsed_time": "1h 12m 4s", "remaining_time": "2h 10m 57s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.226344} -{"loss": 0.73598576, "grad_norm": 1.77455378, "learning_rate": 4.544e-05, "token_acc": 0.78749579, "epoch": 0.71339174, "global_step/max_steps": "285/800", "percentage": "35.62%", "elapsed_time": "1h 12m 16s", "remaining_time": "2h 10m 35s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.212857} -{"loss": 0.73010206, "grad_norm": 1.90474045, "learning_rate": 4.537e-05, "token_acc": 0.78055032, "epoch": 0.71589487, "global_step/max_steps": "286/800", "percentage": "35.75%", "elapsed_time": "1h 12m 26s", "remaining_time": "2h 10m 10s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.194804} -{"loss": 0.91523361, "grad_norm": 2.5200007, "learning_rate": 4.53e-05, "token_acc": 0.73706785, "epoch": 0.718398, "global_step/max_steps": "287/800", "percentage": "35.88%", "elapsed_time": "1h 12m 41s", "remaining_time": "2h 9m 55s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.193978} -{"loss": 0.84246689, "grad_norm": 1.59630764, "learning_rate": 4.523e-05, "token_acc": 0.75303455, "epoch": 0.72090113, "global_step/max_steps": "288/800", "percentage": "36.00%", "elapsed_time": "1h 12m 49s", "remaining_time": "2h 9m 28s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.171669} -{"loss": 0.95058215, "grad_norm": 1.19662154, "learning_rate": 4.515e-05, "token_acc": 0.72791863, "epoch": 0.72340426, "global_step/max_steps": "289/800", "percentage": "36.12%", "elapsed_time": "1h 13m 5s", "remaining_time": "2h 9m 14s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.174322} -{"loss": 0.82480586, "grad_norm": 1.55433643, "learning_rate": 4.508e-05, "token_acc": 0.75435797, "epoch": 0.72590738, "global_step/max_steps": "290/800", "percentage": "36.25%", "elapsed_time": "1h 13m 17s", "remaining_time": "2h 8m 53s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.163183} -{"loss": 0.87459826, "grad_norm": 1.55753601, "learning_rate": 4.501e-05, "token_acc": 0.74859944, "epoch": 0.72841051, "global_step/max_steps": "291/800", "percentage": "36.38%", "elapsed_time": "1h 13m 42s", "remaining_time": "2h 8m 55s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.197253} -{"loss": 0.91514027, "grad_norm": 1.54483354, "learning_rate": 4.493e-05, "token_acc": 0.73575968, "epoch": 0.73091364, "global_step/max_steps": "292/800", "percentage": "36.50%", "elapsed_time": "1h 14m 11s", "remaining_time": "2h 9m 3s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.242964} -{"loss": 0.80757421, "grad_norm": 1.98035514, "learning_rate": 4.486e-05, "token_acc": 0.75816874, "epoch": 0.73341677, "global_step/max_steps": "293/800", "percentage": "36.62%", "elapsed_time": "1h 14m 25s", "remaining_time": "2h 8m 47s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.23975} -{"loss": 0.88803589, "grad_norm": 5.84674692, "learning_rate": 4.478e-05, "token_acc": 0.74260126, "epoch": 0.7359199, "global_step/max_steps": "294/800", "percentage": "36.75%", "elapsed_time": "1h 14m 40s", "remaining_time": "2h 8m 31s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.238943} -{"loss": 0.72896856, "grad_norm": 1.46187937, "learning_rate": 4.471e-05, "token_acc": 0.78792945, "epoch": 0.73842303, "global_step/max_steps": "295/800", "percentage": "36.88%", "elapsed_time": "1h 14m 52s", "remaining_time": "2h 8m 9s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.225923} -{"loss": 0.73481411, "grad_norm": 2.96609378, "learning_rate": 4.463e-05, "token_acc": 0.78066143, "epoch": 0.74092616, "global_step/max_steps": "296/800", "percentage": "37.00%", "elapsed_time": "1h 15m 8s", "remaining_time": "2h 7m 56s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.229881} -{"loss": 0.84141135, "grad_norm": 1.27417505, "learning_rate": 4.456e-05, "token_acc": 0.75607294, "epoch": 0.74342929, "global_step/max_steps": "297/800", "percentage": "37.12%", "elapsed_time": "1h 15m 19s", "remaining_time": "2h 7m 33s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.215531} -{"loss": 0.75189531, "grad_norm": 3.95521998, "learning_rate": 4.448e-05, "token_acc": 0.77339863, "epoch": 0.74593242, "global_step/max_steps": "298/800", "percentage": "37.25%", "elapsed_time": "1h 15m 34s", "remaining_time": "2h 7m 18s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.214565} -{"loss": 0.83024812, "grad_norm": 2.20656848, "learning_rate": 4.44e-05, "token_acc": 0.75674502, "epoch": 0.74843554, "global_step/max_steps": "299/800", "percentage": "37.38%", "elapsed_time": "1h 15m 48s", "remaining_time": "2h 7m 1s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.211365} -{"loss": 0.84742868, "grad_norm": 3.67079592, "learning_rate": 4.433e-05, "token_acc": 0.75068515, "epoch": 0.75093867, "global_step/max_steps": "300/800", "percentage": "37.50%", "elapsed_time": "1h 15m 59s", "remaining_time": "2h 6m 39s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.198303} -{"loss": 0.91155493, "grad_norm": 2.3422215, "learning_rate": 4.425e-05, "token_acc": 0.731979, "epoch": 0.7534418, "global_step/max_steps": "301/800", "percentage": "37.62%", "elapsed_time": "1h 16m 28s", "remaining_time": "2h 6m 45s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.241238} -{"loss": 0.84538341, "grad_norm": 6.06642962, "learning_rate": 4.417e-05, "token_acc": 0.75487948, "epoch": 0.75594493, "global_step/max_steps": "302/800", "percentage": "37.75%", "elapsed_time": "1h 16m 41s", "remaining_time": "2h 6m 27s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.235551} -{"loss": 0.87902254, "grad_norm": 1.17899859, "learning_rate": 4.409e-05, "token_acc": 0.73915226, "epoch": 0.75844806, "global_step/max_steps": "303/800", "percentage": "37.88%", "elapsed_time": "1h 16m 53s", "remaining_time": "2h 6m 7s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.224749} -{"loss": 0.79565161, "grad_norm": 1.56578219, "learning_rate": 4.401e-05, "token_acc": 0.76520924, "epoch": 0.76095119, "global_step/max_steps": "304/800", "percentage": "38.00%", "elapsed_time": "1h 17m 8s", "remaining_time": "2h 5m 51s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.223674} -{"loss": 0.84827954, "grad_norm": 2.57778358, "learning_rate": 4.393e-05, "token_acc": 0.74802343, "epoch": 0.76345432, "global_step/max_steps": "305/800", "percentage": "38.12%", "elapsed_time": "1h 17m 21s", "remaining_time": "2h 5m 32s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.216076} -{"loss": 0.79932976, "grad_norm": 4.33864117, "learning_rate": 4.385e-05, "token_acc": 0.76760977, "epoch": 0.76595745, "global_step/max_steps": "306/800", "percentage": "38.25%", "elapsed_time": "1h 17m 35s", "remaining_time": "2h 5m 16s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.213605} -{"loss": 0.82586837, "grad_norm": 1.39261591, "learning_rate": 4.377e-05, "token_acc": 0.75801055, "epoch": 0.76846058, "global_step/max_steps": "307/800", "percentage": "38.38%", "elapsed_time": "1h 17m 47s", "remaining_time": "2h 4m 54s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.201772} -{"loss": 0.75964415, "grad_norm": 9.87506008, "learning_rate": 4.369e-05, "token_acc": 0.77714286, "epoch": 0.7709637, "global_step/max_steps": "308/800", "percentage": "38.50%", "elapsed_time": "1h 18m 1s", "remaining_time": "2h 4m 38s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.199605} -{"loss": 0.85048932, "grad_norm": 1.81819761, "learning_rate": 4.361e-05, "token_acc": 0.75496495, "epoch": 0.77346683, "global_step/max_steps": "309/800", "percentage": "38.62%", "elapsed_time": "1h 18m 17s", "remaining_time": "2h 4m 23s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.200329} -{"loss": 0.91779852, "grad_norm": 5.01881361, "learning_rate": 4.352e-05, "token_acc": 0.72897709, "epoch": 0.77596996, "global_step/max_steps": "310/800", "percentage": "38.75%", "elapsed_time": "1h 18m 42s", "remaining_time": "2h 4m 24s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.232494} -{"loss": 0.68031186, "grad_norm": 2.4011066, "learning_rate": 4.344e-05, "token_acc": 0.79682168, "epoch": 0.77847309, "global_step/max_steps": "311/800", "percentage": "38.88%", "elapsed_time": "1h 19m 2s", "remaining_time": "2h 4m 16s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.248428} -{"loss": 0.78720379, "grad_norm": 3.50276995, "learning_rate": 4.336e-05, "token_acc": 0.76697664, "epoch": 0.78097622, "global_step/max_steps": "312/800", "percentage": "39.00%", "elapsed_time": "1h 19m 15s", "remaining_time": "2h 3m 57s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.23985} -{"loss": 0.73194087, "grad_norm": 1.66422892, "learning_rate": 4.327e-05, "token_acc": 0.785088, "epoch": 0.78347935, "global_step/max_steps": "313/800", "percentage": "39.12%", "elapsed_time": "1h 19m 30s", "remaining_time": "2h 3m 42s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.241116} -{"loss": 0.82014298, "grad_norm": 2.36742902, "learning_rate": 4.319e-05, "token_acc": 0.75952951, "epoch": 0.78598248, "global_step/max_steps": "314/800", "percentage": "39.25%", "elapsed_time": "1h 19m 45s", "remaining_time": "2h 3m 25s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.237649} -{"loss": 0.79046965, "grad_norm": 2.82483697, "learning_rate": 4.311e-05, "token_acc": 0.76449667, "epoch": 0.78848561, "global_step/max_steps": "315/800", "percentage": "39.38%", "elapsed_time": "1h 19m 56s", "remaining_time": "2h 3m 4s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.224673} -{"loss": 0.87982094, "grad_norm": 2.83573318, "learning_rate": 4.302e-05, "token_acc": 0.7432513, "epoch": 0.79098874, "global_step/max_steps": "316/800", "percentage": "39.50%", "elapsed_time": "1h 20m 14s", "remaining_time": "2h 2m 53s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.234374} -{"loss": 0.80992883, "grad_norm": 4.34833336, "learning_rate": 4.294e-05, "token_acc": 0.75736236, "epoch": 0.79349186, "global_step/max_steps": "317/800", "percentage": "39.62%", "elapsed_time": "1h 20m 28s", "remaining_time": "2h 2m 37s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.231171} -{"loss": 0.74832106, "grad_norm": 2.10336232, "learning_rate": 4.285e-05, "token_acc": 0.77327905, "epoch": 0.79599499, "global_step/max_steps": "318/800", "percentage": "39.75%", "elapsed_time": "1h 20m 38s", "remaining_time": "2h 2m 14s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.214834} -{"loss": 0.64891714, "grad_norm": 3.51819277, "learning_rate": 4.276e-05, "token_acc": 0.80531085, "epoch": 0.79849812, "global_step/max_steps": "319/800", "percentage": "39.88%", "elapsed_time": "1h 20m 47s", "remaining_time": "2h 1m 48s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.19387} -{"loss": 0.94053924, "grad_norm": 1.27200878, "learning_rate": 4.268e-05, "token_acc": 0.72792608, "epoch": 0.80100125, "global_step/max_steps": "320/800", "percentage": "40.00%", "elapsed_time": "1h 21m 4s", "remaining_time": "2h 1m 36s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.200161} -{"loss": 0.90035951, "grad_norm": 16.28224945, "learning_rate": 4.259e-05, "token_acc": 0.73757583, "epoch": 0.80350438, "global_step/max_steps": "321/800", "percentage": "40.12%", "elapsed_time": "1h 21m 32s", "remaining_time": "2h 1m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.240482} -{"loss": 0.73924565, "grad_norm": 7.0097208, "learning_rate": 4.25e-05, "token_acc": 0.7809378, "epoch": 0.80600751, "global_step/max_steps": "322/800", "percentage": "40.25%", "elapsed_time": "1h 21m 44s", "remaining_time": "2h 1m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.228683} -{"loss": 0.73697323, "grad_norm": 3.93666649, "learning_rate": 4.242e-05, "token_acc": 0.78494524, "epoch": 0.80851064, "global_step/max_steps": "323/800", "percentage": "40.38%", "elapsed_time": "1h 21m 53s", "remaining_time": "2h 0m 55s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.209514} -{"loss": 0.91458327, "grad_norm": 2.01689625, "learning_rate": 4.233e-05, "token_acc": 0.72979185, "epoch": 0.81101377, "global_step/max_steps": "324/800", "percentage": "40.50%", "elapsed_time": "1h 22m 9s", "remaining_time": "2h 0m 42s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.21406} -{"loss": 0.76501834, "grad_norm": 9.37617493, "learning_rate": 4.224e-05, "token_acc": 0.77179547, "epoch": 0.8135169, "global_step/max_steps": "325/800", "percentage": "40.62%", "elapsed_time": "1h 22m 21s", "remaining_time": "2h 0m 21s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.202581} -{"loss": 0.62875104, "grad_norm": 1.822191, "learning_rate": 4.215e-05, "token_acc": 0.8086432, "epoch": 0.81602003, "global_step/max_steps": "326/800", "percentage": "40.75%", "elapsed_time": "1h 22m 29s", "remaining_time": "1h 59m 56s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.181706} -{"loss": 0.96011215, "grad_norm": 1.71321988, "learning_rate": 4.206e-05, "token_acc": 0.72245855, "epoch": 0.81852315, "global_step/max_steps": "327/800", "percentage": "40.88%", "elapsed_time": "1h 22m 45s", "remaining_time": "1h 59m 42s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.184835} -{"loss": 0.80774391, "grad_norm": 1.22806239, "learning_rate": 4.197e-05, "token_acc": 0.7587897, "epoch": 0.82102628, "global_step/max_steps": "328/800", "percentage": "41.00%", "elapsed_time": "1h 23m 3s", "remaining_time": "1h 59m 30s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.191618} -{"loss": 0.86802876, "grad_norm": 1.11118972, "learning_rate": 4.188e-05, "token_acc": 0.74384578, "epoch": 0.82352941, "global_step/max_steps": "329/800", "percentage": "41.12%", "elapsed_time": "1h 23m 16s", "remaining_time": "1h 59m 12s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.184853} -{"loss": 0.73767245, "grad_norm": 2.42224383, "learning_rate": 4.179e-05, "token_acc": 0.78667938, "epoch": 0.82603254, "global_step/max_steps": "330/800", "percentage": "41.25%", "elapsed_time": "1h 23m 28s", "remaining_time": "1h 58m 53s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.175683} -{"loss": 0.67270768, "grad_norm": 3.61296868, "learning_rate": 4.17e-05, "token_acc": 0.80094186, "epoch": 0.82853567, "global_step/max_steps": "331/800", "percentage": "41.38%", "elapsed_time": "1h 23m 51s", "remaining_time": "1h 58m 48s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.198185} -{"loss": 0.79701817, "grad_norm": 4.89116907, "learning_rate": 4.161e-05, "token_acc": 0.76403773, "epoch": 0.8310388, "global_step/max_steps": "332/800", "percentage": "41.50%", "elapsed_time": "1h 24m 9s", "remaining_time": "1h 58m 37s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.20776} -{"loss": 0.73048675, "grad_norm": 12.48429298, "learning_rate": 4.151e-05, "token_acc": 0.78382439, "epoch": 0.83354193, "global_step/max_steps": "333/800", "percentage": "41.62%", "elapsed_time": "1h 24m 18s", "remaining_time": "1h 58m 14s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.190035} -{"loss": 0.89443749, "grad_norm": 1.94484019, "learning_rate": 4.142e-05, "token_acc": 0.73947884, "epoch": 0.83604506, "global_step/max_steps": "334/800", "percentage": "41.75%", "elapsed_time": "1h 24m 30s", "remaining_time": "1h 57m 54s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.180521} -{"loss": 0.88543183, "grad_norm": 1.21702945, "learning_rate": 4.133e-05, "token_acc": 0.74710046, "epoch": 0.83854819, "global_step/max_steps": "335/800", "percentage": "41.88%", "elapsed_time": "1h 24m 43s", "remaining_time": "1h 57m 35s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.172511} -{"loss": 0.75275743, "grad_norm": 2.63936424, "learning_rate": 4.124e-05, "token_acc": 0.77849496, "epoch": 0.84105131, "global_step/max_steps": "336/800", "percentage": "42.00%", "elapsed_time": "1h 24m 53s", "remaining_time": "1h 57m 13s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.158087} -{"loss": 0.83238435, "grad_norm": 2.72640109, "learning_rate": 4.114e-05, "token_acc": 0.75465587, "epoch": 0.84355444, "global_step/max_steps": "337/800", "percentage": "42.12%", "elapsed_time": "1h 25m 9s", "remaining_time": "1h 56m 59s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.159699} -{"loss": 0.82718748, "grad_norm": 2.74945092, "learning_rate": 4.105e-05, "token_acc": 0.76168623, "epoch": 0.84605757, "global_step/max_steps": "338/800", "percentage": "42.25%", "elapsed_time": "1h 25m 23s", "remaining_time": "1h 56m 42s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.156205} -{"loss": 0.63453496, "grad_norm": 3.21954489, "learning_rate": 4.095e-05, "token_acc": 0.81572394, "epoch": 0.8485607, "global_step/max_steps": "339/800", "percentage": "42.38%", "elapsed_time": "1h 25m 32s", "remaining_time": "1h 56m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.139171} -{"loss": 0.73862648, "grad_norm": 2.69184303, "learning_rate": 4.086e-05, "token_acc": 0.78271358, "epoch": 0.85106383, "global_step/max_steps": "340/800", "percentage": "42.50%", "elapsed_time": "1h 25m 42s", "remaining_time": "1h 55m 57s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.123031} -{"loss": 0.82430267, "grad_norm": 1.27834666, "learning_rate": 4.076e-05, "token_acc": 0.7568029, "epoch": 0.85356696, "global_step/max_steps": "341/800", "percentage": "42.62%", "elapsed_time": "1h 26m 10s", "remaining_time": "1h 55m 59s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.160849} -{"loss": 0.69816536, "grad_norm": 4.0612936, "learning_rate": 4.067e-05, "token_acc": 0.78690344, "epoch": 0.85607009, "global_step/max_steps": "342/800", "percentage": "42.75%", "elapsed_time": "1h 26m 23s", "remaining_time": "1h 55m 41s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.154328} -{"loss": 0.83075875, "grad_norm": 1.50138903, "learning_rate": 4.057e-05, "token_acc": 0.75302023, "epoch": 0.85857322, "global_step/max_steps": "343/800", "percentage": "42.88%", "elapsed_time": "1h 26m 33s", "remaining_time": "1h 55m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.140483} -{"loss": 0.87216741, "grad_norm": 1.69799411, "learning_rate": 4.048e-05, "token_acc": 0.74378973, "epoch": 0.86107635, "global_step/max_steps": "344/800", "percentage": "43.00%", "elapsed_time": "1h 26m 49s", "remaining_time": "1h 55m 4s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.141335} -{"loss": 0.85304672, "grad_norm": 1.4354986, "learning_rate": 4.038e-05, "token_acc": 0.75111261, "epoch": 0.86357947, "global_step/max_steps": "345/800", "percentage": "43.12%", "elapsed_time": "1h 27m 7s", "remaining_time": "1h 54m 54s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.151642} -{"loss": 0.75436932, "grad_norm": 1.62712431, "learning_rate": 4.028e-05, "token_acc": 0.78078992, "epoch": 0.8660826, "global_step/max_steps": "346/800", "percentage": "43.25%", "elapsed_time": "1h 27m 19s", "remaining_time": "1h 54m 35s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.143041} -{"loss": 0.81417966, "grad_norm": 1.96930897, "learning_rate": 4.019e-05, "token_acc": 0.76173045, "epoch": 0.86858573, "global_step/max_steps": "347/800", "percentage": "43.38%", "elapsed_time": "1h 27m 34s", "remaining_time": "1h 54m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.140896} -{"loss": 0.7092436, "grad_norm": 1.64292395, "learning_rate": 4.009e-05, "token_acc": 0.78681402, "epoch": 0.87108886, "global_step/max_steps": "348/800", "percentage": "43.50%", "elapsed_time": "1h 27m 42s", "remaining_time": "1h 53m 54s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.119894} -{"loss": 0.89620763, "grad_norm": 7.1434803, "learning_rate": 3.999e-05, "token_acc": 0.74087363, "epoch": 0.87359199, "global_step/max_steps": "349/800", "percentage": "43.62%", "elapsed_time": "1h 27m 57s", "remaining_time": "1h 53m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.120899} -{"loss": 0.9180401, "grad_norm": 2.56283021, "learning_rate": 3.989e-05, "token_acc": 0.73060182, "epoch": 0.87609512, "global_step/max_steps": "350/800", "percentage": "43.75%", "elapsed_time": "1h 28m 16s", "remaining_time": "1h 53m 29s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.131917} -{"loss": 0.91722834, "grad_norm": 1.3269527, "learning_rate": 3.979e-05, "token_acc": 0.73351479, "epoch": 0.87859825, "global_step/max_steps": "351/800", "percentage": "43.88%", "elapsed_time": "1h 28m 42s", "remaining_time": "1h 53m 28s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.161736} -{"loss": 0.88589501, "grad_norm": 1.10118353, "learning_rate": 3.969e-05, "token_acc": 0.73994141, "epoch": 0.88110138, "global_step/max_steps": "352/800", "percentage": "44.00%", "elapsed_time": "1h 28m 55s", "remaining_time": "1h 53m 11s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.157634} -{"loss": 0.81810677, "grad_norm": 1.83638608, "learning_rate": 3.96e-05, "token_acc": 0.75089036, "epoch": 0.88360451, "global_step/max_steps": "353/800", "percentage": "44.12%", "elapsed_time": "1h 29m 7s", "remaining_time": "1h 52m 50s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.146469} -{"loss": 0.85968316, "grad_norm": 2.2015419, "learning_rate": 3.95e-05, "token_acc": 0.74928072, "epoch": 0.88610763, "global_step/max_steps": "354/800", "percentage": "44.25%", "elapsed_time": "1h 29m 27s", "remaining_time": "1h 52m 42s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.161563} -{"loss": 0.92821407, "grad_norm": 1.04428196, "learning_rate": 3.94e-05, "token_acc": 0.7278687, "epoch": 0.88861076, "global_step/max_steps": "355/800", "percentage": "44.38%", "elapsed_time": "1h 29m 42s", "remaining_time": "1h 52m 27s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.161128} -{"loss": 0.89070368, "grad_norm": 1.50464833, "learning_rate": 3.929e-05, "token_acc": 0.74280948, "epoch": 0.89111389, "global_step/max_steps": "356/800", "percentage": "44.50%", "elapsed_time": "1h 29m 56s", "remaining_time": "1h 52m 9s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.156305} -{"loss": 0.850348, "grad_norm": 1.14322984, "learning_rate": 3.919e-05, "token_acc": 0.75293025, "epoch": 0.89361702, "global_step/max_steps": "357/800", "percentage": "44.62%", "elapsed_time": "1h 30m 7s", "remaining_time": "1h 51m 50s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.146166} -{"loss": 0.74330819, "grad_norm": 3.00369143, "learning_rate": 3.909e-05, "token_acc": 0.7839232, "epoch": 0.89612015, "global_step/max_steps": "358/800", "percentage": "44.75%", "elapsed_time": "1h 30m 20s", "remaining_time": "1h 51m 32s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.140786} -{"loss": 0.75513732, "grad_norm": 4.80685234, "learning_rate": 3.899e-05, "token_acc": 0.77431801, "epoch": 0.89862328, "global_step/max_steps": "359/800", "percentage": "44.88%", "elapsed_time": "1h 30m 31s", "remaining_time": "1h 51m 12s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.128897} -{"loss": 0.83572304, "grad_norm": 1.25420368, "learning_rate": 3.889e-05, "token_acc": 0.75196697, "epoch": 0.90112641, "global_step/max_steps": "360/800", "percentage": "45.00%", "elapsed_time": "1h 30m 50s", "remaining_time": "1h 51m 1s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.138054} -{"loss": 0.84650457, "grad_norm": 1.6473242, "learning_rate": 3.879e-05, "token_acc": 0.75572437, "epoch": 0.90362954, "global_step/max_steps": "361/800", "percentage": "45.12%", "elapsed_time": "1h 31m 18s", "remaining_time": "1h 51m 2s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.175052} -{"loss": 0.82235479, "grad_norm": 13.78391743, "learning_rate": 3.868e-05, "token_acc": 0.75196347, "epoch": 0.90613267, "global_step/max_steps": "362/800", "percentage": "45.25%", "elapsed_time": "1h 31m 35s", "remaining_time": "1h 50m 48s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.178375} -{"loss": 0.76513076, "grad_norm": 1.7439009, "learning_rate": 3.858e-05, "token_acc": 0.7751345, "epoch": 0.90863579, "global_step/max_steps": "363/800", "percentage": "45.38%", "elapsed_time": "1h 31m 46s", "remaining_time": "1h 50m 28s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.167025} -{"loss": 0.69296992, "grad_norm": 1.62992489, "learning_rate": 3.848e-05, "token_acc": 0.78722729, "epoch": 0.91113892, "global_step/max_steps": "364/800", "percentage": "45.50%", "elapsed_time": "1h 32m 3s", "remaining_time": "1h 50m 16s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.17414} -{"loss": 0.73532689, "grad_norm": 2.1659956, "learning_rate": 3.837e-05, "token_acc": 0.77981062, "epoch": 0.91364205, "global_step/max_steps": "365/800", "percentage": "45.62%", "elapsed_time": "1h 32m 12s", "remaining_time": "1h 49m 53s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.156932} -{"loss": 0.80660576, "grad_norm": 2.08021379, "learning_rate": 3.827e-05, "token_acc": 0.75712418, "epoch": 0.91614518, "global_step/max_steps": "366/800", "percentage": "45.75%", "elapsed_time": "1h 32m 25s", "remaining_time": "1h 49m 36s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.151006} -{"loss": 0.86184084, "grad_norm": 2.89701414, "learning_rate": 3.817e-05, "token_acc": 0.74640499, "epoch": 0.91864831, "global_step/max_steps": "367/800", "percentage": "45.88%", "elapsed_time": "1h 32m 37s", "remaining_time": "1h 49m 16s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.140369} -{"loss": 0.67928004, "grad_norm": 1.74722791, "learning_rate": 3.806e-05, "token_acc": 0.79405729, "epoch": 0.92115144, "global_step/max_steps": "368/800", "percentage": "46.00%", "elapsed_time": "1h 32m 48s", "remaining_time": "1h 48m 56s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.130697} -{"loss": 0.92453325, "grad_norm": 5.28384066, "learning_rate": 3.796e-05, "token_acc": 0.72690495, "epoch": 0.92365457, "global_step/max_steps": "369/800", "percentage": "46.12%", "elapsed_time": "1h 33m 8s", "remaining_time": "1h 48m 47s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.144085} -{"loss": 0.74914086, "grad_norm": 1.92135477, "learning_rate": 3.785e-05, "token_acc": 0.77380632, "epoch": 0.9261577, "global_step/max_steps": "370/800", "percentage": "46.25%", "elapsed_time": "1h 33m 21s", "remaining_time": "1h 48m 29s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.136983} -{"loss": 0.8408379, "grad_norm": 1.4675709, "learning_rate": 3.775e-05, "token_acc": 0.75097552, "epoch": 0.92866083, "global_step/max_steps": "371/800", "percentage": "46.38%", "elapsed_time": "1h 33m 48s", "remaining_time": "1h 48m 28s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.170243} -{"loss": 0.90898627, "grad_norm": 1.23748708, "learning_rate": 3.764e-05, "token_acc": 0.72783286, "epoch": 0.93116395, "global_step/max_steps": "372/800", "percentage": "46.50%", "elapsed_time": "1h 34m 15s", "remaining_time": "1h 48m 26s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.201526} -{"loss": 0.81309772, "grad_norm": 2.3680985, "learning_rate": 3.754e-05, "token_acc": 0.75841369, "epoch": 0.93366708, "global_step/max_steps": "373/800", "percentage": "46.62%", "elapsed_time": "1h 34m 31s", "remaining_time": "1h 48m 12s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.202646} -{"loss": 0.83189076, "grad_norm": 4.07018185, "learning_rate": 3.743e-05, "token_acc": 0.75387954, "epoch": 0.93617021, "global_step/max_steps": "374/800", "percentage": "46.75%", "elapsed_time": "1h 34m 39s", "remaining_time": "1h 47m 49s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.185662} -{"loss": 0.85220587, "grad_norm": 3.80248857, "learning_rate": 3.732e-05, "token_acc": 0.74813347, "epoch": 0.93867334, "global_step/max_steps": "375/800", "percentage": "46.88%", "elapsed_time": "1h 34m 53s", "remaining_time": "1h 47m 32s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.180121} -{"loss": 0.77087784, "grad_norm": 8.24310684, "learning_rate": 3.722e-05, "token_acc": 0.77379095, "epoch": 0.94117647, "global_step/max_steps": "376/800", "percentage": "47.00%", "elapsed_time": "1h 35m 3s", "remaining_time": "1h 47m 11s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.167727} -{"loss": 0.75903523, "grad_norm": 1.94391608, "learning_rate": 3.711e-05, "token_acc": 0.77005469, "epoch": 0.9436796, "global_step/max_steps": "377/800", "percentage": "47.12%", "elapsed_time": "1h 35m 13s", "remaining_time": "1h 46m 50s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.1535} -{"loss": 0.72229528, "grad_norm": 3.28041363, "learning_rate": 3.7e-05, "token_acc": 0.78384007, "epoch": 0.94618273, "global_step/max_steps": "378/800", "percentage": "47.25%", "elapsed_time": "1h 35m 24s", "remaining_time": "1h 46m 30s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.141822} -{"loss": 0.82069409, "grad_norm": 1.78382516, "learning_rate": 3.689e-05, "token_acc": 0.75689102, "epoch": 0.94868586, "global_step/max_steps": "379/800", "percentage": "47.38%", "elapsed_time": "1h 35m 35s", "remaining_time": "1h 46m 10s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.130706} -{"loss": 0.82281542, "grad_norm": 1.50946724, "learning_rate": 3.678e-05, "token_acc": 0.75632067, "epoch": 0.95118899, "global_step/max_steps": "380/800", "percentage": "47.50%", "elapsed_time": "1h 35m 47s", "remaining_time": "1h 45m 52s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.122677} -{"loss": 0.82686985, "grad_norm": 1.28233445, "learning_rate": 3.668e-05, "token_acc": 0.75457567, "epoch": 0.95369212, "global_step/max_steps": "381/800", "percentage": "47.62%", "elapsed_time": "1h 36m 13s", "remaining_time": "1h 45m 49s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.152775} -{"loss": 0.73930252, "grad_norm": 2.02044654, "learning_rate": 3.657e-05, "token_acc": 0.77981889, "epoch": 0.95619524, "global_step/max_steps": "382/800", "percentage": "47.75%", "elapsed_time": "1h 36m 27s", "remaining_time": "1h 45m 32s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.148327} -{"loss": 0.74841148, "grad_norm": 1.65276265, "learning_rate": 3.646e-05, "token_acc": 0.77553328, "epoch": 0.95869837, "global_step/max_steps": "383/800", "percentage": "47.88%", "elapsed_time": "1h 36m 44s", "remaining_time": "1h 45m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.154459} -{"loss": 0.61269498, "grad_norm": 1.58730125, "learning_rate": 3.635e-05, "token_acc": 0.81584031, "epoch": 0.9612015, "global_step/max_steps": "384/800", "percentage": "48.00%", "elapsed_time": "1h 36m 55s", "remaining_time": "1h 44m 60s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.143938} -{"loss": 0.79989552, "grad_norm": 5.48495483, "learning_rate": 3.624e-05, "token_acc": 0.76298404, "epoch": 0.96370463, "global_step/max_steps": "385/800", "percentage": "48.12%", "elapsed_time": "1h 37m 13s", "remaining_time": "1h 44m 47s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.150552} -{"loss": 0.77200305, "grad_norm": 1.5135814, "learning_rate": 3.613e-05, "token_acc": 0.76722837, "epoch": 0.96620776, "global_step/max_steps": "386/800", "percentage": "48.25%", "elapsed_time": "1h 37m 23s", "remaining_time": "1h 44m 27s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.13741} -{"loss": 0.90724546, "grad_norm": 3.60253024, "learning_rate": 3.602e-05, "token_acc": 0.73049427, "epoch": 0.96871089, "global_step/max_steps": "387/800", "percentage": "48.38%", "elapsed_time": "1h 37m 40s", "remaining_time": "1h 44m 14s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.14201} -{"loss": 0.75929952, "grad_norm": 1.71135795, "learning_rate": 3.591e-05, "token_acc": 0.77360434, "epoch": 0.97121402, "global_step/max_steps": "388/800", "percentage": "48.50%", "elapsed_time": "1h 37m 51s", "remaining_time": "1h 43m 54s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.13043} -{"loss": 0.92482215, "grad_norm": 1.58866596, "learning_rate": 3.58e-05, "token_acc": 0.72916667, "epoch": 0.97371715, "global_step/max_steps": "389/800", "percentage": "48.62%", "elapsed_time": "1h 38m 7s", "remaining_time": "1h 43m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.132608} -{"loss": 0.66405785, "grad_norm": 1.90463948, "learning_rate": 3.569e-05, "token_acc": 0.80307233, "epoch": 0.97622028, "global_step/max_steps": "390/800", "percentage": "48.75%", "elapsed_time": "1h 38m 13s", "remaining_time": "1h 43m 15s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.110957} -{"loss": 0.80663228, "grad_norm": 4.67643642, "learning_rate": 3.558e-05, "token_acc": 0.76043225, "epoch": 0.9787234, "global_step/max_steps": "391/800", "percentage": "48.88%", "elapsed_time": "1h 38m 35s", "remaining_time": "1h 43m 8s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.128847} -{"loss": 0.77470577, "grad_norm": 2.24427247, "learning_rate": 3.547e-05, "token_acc": 0.76570985, "epoch": 0.98122653, "global_step/max_steps": "392/800", "percentage": "49.00%", "elapsed_time": "1h 38m 50s", "remaining_time": "1h 42m 52s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.127147} -{"loss": 0.7859742, "grad_norm": 3.24161601, "learning_rate": 3.535e-05, "token_acc": 0.7659953, "epoch": 0.98372966, "global_step/max_steps": "393/800", "percentage": "49.12%", "elapsed_time": "1h 39m 2s", "remaining_time": "1h 42m 34s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.119477} -{"loss": 0.7290836, "grad_norm": 3.8066473, "learning_rate": 3.524e-05, "token_acc": 0.77931454, "epoch": 0.98623279, "global_step/max_steps": "394/800", "percentage": "49.25%", "elapsed_time": "1h 39m 10s", "remaining_time": "1h 42m 11s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.100594} -{"loss": 0.81802624, "grad_norm": 2.67710686, "learning_rate": 3.513e-05, "token_acc": 0.7598082, "epoch": 0.98873592, "global_step/max_steps": "395/800", "percentage": "49.38%", "elapsed_time": "1h 39m 19s", "remaining_time": "1h 41m 49s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.084986} -{"loss": 0.73009443, "grad_norm": 1.74831319, "learning_rate": 3.502e-05, "token_acc": 0.78145695, "epoch": 0.99123905, "global_step/max_steps": "396/800", "percentage": "49.50%", "elapsed_time": "1h 39m 31s", "remaining_time": "1h 41m 32s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.079106} -{"loss": 0.75642598, "grad_norm": 1.99533057, "learning_rate": 3.491e-05, "token_acc": 0.77837707, "epoch": 0.99374218, "global_step/max_steps": "397/800", "percentage": "49.62%", "elapsed_time": "1h 39m 42s", "remaining_time": "1h 41m 12s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.068078} -{"loss": 0.70411789, "grad_norm": 2.26686549, "learning_rate": 3.479e-05, "token_acc": 0.79132916, "epoch": 0.99624531, "global_step/max_steps": "398/800", "percentage": "49.75%", "elapsed_time": "1h 39m 51s", "remaining_time": "1h 40m 51s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.051705} -{"loss": 0.85397327, "grad_norm": 1.30691528, "learning_rate": 3.468e-05, "token_acc": 0.74819629, "epoch": 0.99874844, "global_step/max_steps": "399/800", "percentage": "49.88%", "elapsed_time": "1h 40m 9s", "remaining_time": "1h 40m 39s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.060007} -{"loss": 0.74187601, "grad_norm": 1.77041662, "learning_rate": 3.457e-05, "token_acc": 0.77651905, "epoch": 1.0, "global_step/max_steps": "400/800", "percentage": "50.00%", "elapsed_time": "1h 40m 14s", "remaining_time": "1h 40m 14s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.035432} -{"loss": 0.74282217, "grad_norm": 43.99303055, "learning_rate": 3.445e-05, "token_acc": 0.7772024, "epoch": 1.00250313, "global_step/max_steps": "401/800", "percentage": "50.12%", "elapsed_time": "1h 40m 39s", "remaining_time": "1h 40m 8s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.058613} -{"loss": 0.85281056, "grad_norm": 1.55848157, "learning_rate": 3.434e-05, "token_acc": 0.74494377, "epoch": 1.00500626, "global_step/max_steps": "402/800", "percentage": "50.25%", "elapsed_time": "1h 40m 53s", "remaining_time": "1h 39m 53s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.056827} -{"loss": 0.74283957, "grad_norm": 7.33642435, "learning_rate": 3.423e-05, "token_acc": 0.77662064, "epoch": 1.00750939, "global_step/max_steps": "403/800", "percentage": "50.38%", "elapsed_time": "1h 41m 6s", "remaining_time": "1h 39m 36s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.05287} -{"loss": 0.63135242, "grad_norm": 1.48252177, "learning_rate": 3.411e-05, "token_acc": 0.80650621, "epoch": 1.01001252, "global_step/max_steps": "404/800", "percentage": "50.50%", "elapsed_time": "1h 41m 15s", "remaining_time": "1h 39m 15s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.037518} -{"loss": 0.75370276, "grad_norm": 1.4847672, "learning_rate": 3.4e-05, "token_acc": 0.77654811, "epoch": 1.01251564, "global_step/max_steps": "405/800", "percentage": "50.62%", "elapsed_time": "1h 41m 27s", "remaining_time": "1h 38m 56s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.028547} -{"loss": 0.79668844, "grad_norm": 2.68456221, "learning_rate": 3.388e-05, "token_acc": 0.76270609, "epoch": 1.01501877, "global_step/max_steps": "406/800", "percentage": "50.75%", "elapsed_time": "1h 41m 41s", "remaining_time": "1h 38m 40s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.026099} -{"loss": 0.80546784, "grad_norm": 2.60315347, "learning_rate": 3.377e-05, "token_acc": 0.76444417, "epoch": 1.0175219, "global_step/max_steps": "407/800", "percentage": "50.88%", "elapsed_time": "1h 41m 51s", "remaining_time": "1h 38m 21s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.015327} -{"loss": 0.8387413, "grad_norm": 1.35732794, "learning_rate": 3.365e-05, "token_acc": 0.74720889, "epoch": 1.02002503, "global_step/max_steps": "408/800", "percentage": "51.00%", "elapsed_time": "1h 42m 6s", "remaining_time": "1h 38m 6s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.014295} -{"loss": 0.69387829, "grad_norm": 2.58632445, "learning_rate": 3.354e-05, "token_acc": 0.79109198, "epoch": 1.02252816, "global_step/max_steps": "409/800", "percentage": "51.12%", "elapsed_time": "1h 42m 15s", "remaining_time": "1h 37m 45s", "memory(GiB)": 73.52, "train_speed(s/it)": 14.999785} -{"loss": 0.90545464, "grad_norm": 1.28632963, "learning_rate": 3.342e-05, "token_acc": 0.73789709, "epoch": 1.02503129, "global_step/max_steps": "410/800", "percentage": "51.25%", "elapsed_time": "1h 42m 25s", "remaining_time": "1h 37m 25s", "memory(GiB)": 73.52, "train_speed(s/it)": 14.987513} -{"loss": 0.74099433, "grad_norm": 1.52081311, "learning_rate": 3.331e-05, "token_acc": 0.77486179, "epoch": 1.02753442, "global_step/max_steps": "411/800", "percentage": "51.38%", "elapsed_time": "1h 42m 48s", "remaining_time": "1h 37m 18s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.008391} -{"loss": 0.88020885, "grad_norm": 1.77286947, "learning_rate": 3.319e-05, "token_acc": 0.73725752, "epoch": 1.03003755, "global_step/max_steps": "412/800", "percentage": "51.50%", "elapsed_time": "1h 43m 7s", "remaining_time": "1h 37m 7s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.016878} -{"loss": 0.63494033, "grad_norm": 2.11311841, "learning_rate": 3.307e-05, "token_acc": 0.81541478, "epoch": 1.03254068, "global_step/max_steps": "413/800", "percentage": "51.62%", "elapsed_time": "1h 43m 17s", "remaining_time": "1h 36m 47s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.004013} -{"loss": 0.75369829, "grad_norm": 2.60384107, "learning_rate": 3.296e-05, "token_acc": 0.77837534, "epoch": 1.0350438, "global_step/max_steps": "414/800", "percentage": "51.75%", "elapsed_time": "1h 43m 31s", "remaining_time": "1h 36m 31s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.002233} -{"loss": 0.84650159, "grad_norm": 0.74699146, "learning_rate": 3.284e-05, "token_acc": 0.74923822, "epoch": 1.03754693, "global_step/max_steps": "415/800", "percentage": "51.88%", "elapsed_time": "1h 43m 49s", "remaining_time": "1h 36m 19s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.010278} -{"loss": 0.81753403, "grad_norm": 2.31809425, "learning_rate": 3.273e-05, "token_acc": 0.75762627, "epoch": 1.04005006, "global_step/max_steps": "416/800", "percentage": "52.00%", "elapsed_time": "1h 44m 2s", "remaining_time": "1h 36m 1s", "memory(GiB)": 73.52, "train_speed(s/it)": 15.003827} -{"loss": 0.87159431, "grad_norm": 2.76028275, "learning_rate": 3.261e-05, "token_acc": 0.74364383, "epoch": 1.04255319, "global_step/max_steps": "417/800", "percentage": "52.12%", "elapsed_time": "1h 44m 14s", "remaining_time": "1h 35m 44s", "memory(GiB)": 73.52, "train_speed(s/it)": 14.997112} -{"loss": 0.78015441, "grad_norm": 1.73217511, "learning_rate": 3.249e-05, "token_acc": 0.76394526, "epoch": 1.04505632, "global_step/max_steps": "418/800", "percentage": "52.25%", "elapsed_time": "1h 44m 26s", "remaining_time": "1h 35m 27s", "memory(GiB)": 73.52, "train_speed(s/it)": 14.991235} -{"loss": 0.66600537, "grad_norm": 30.08856201, "learning_rate": 3.237e-05, "token_acc": 0.79746835, "epoch": 1.04755945, "global_step/max_steps": "419/800", "percentage": "52.38%", "elapsed_time": "1h 44m 35s", "remaining_time": "1h 35m 5s", "memory(GiB)": 73.52, "train_speed(s/it)": 14.975011} -{"loss": 0.62065017, "grad_norm": 10.82476997, "learning_rate": 3.226e-05, "token_acc": 0.80825638, "epoch": 1.05006258, "global_step/max_steps": "420/800", "percentage": "52.50%", "elapsed_time": "1h 44m 43s", "remaining_time": "1h 34m 45s", "memory(GiB)": 73.52, "train_speed(s/it)": 14.960566} -{"loss": 0.81749141, "grad_norm": 6.58461666, "learning_rate": 3.214e-05, "token_acc": 0.75984792, "epoch": 1.05256571, "global_step/max_steps": "421/800", "percentage": "52.62%", "elapsed_time": "1h 45m 19s", "remaining_time": "1h 34m 49s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.009567} -{"loss": 0.80262768, "grad_norm": 1.73213935, "learning_rate": 3.202e-05, "token_acc": 0.7602138, "epoch": 1.05506884, "global_step/max_steps": "422/800", "percentage": "52.75%", "elapsed_time": "1h 45m 30s", "remaining_time": "1h 34m 30s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.999142} -{"loss": 0.69205695, "grad_norm": 1.95699847, "learning_rate": 3.19e-05, "token_acc": 0.79286791, "epoch": 1.05757196, "global_step/max_steps": "423/800", "percentage": "52.88%", "elapsed_time": "1h 45m 39s", "remaining_time": "1h 34m 10s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.98546} -{"loss": 0.852714, "grad_norm": 1.55891657, "learning_rate": 3.179e-05, "token_acc": 0.74630357, "epoch": 1.06007509, "global_step/max_steps": "424/800", "percentage": "53.00%", "elapsed_time": "1h 45m 58s", "remaining_time": "1h 33m 58s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.995503} -{"loss": 0.749255, "grad_norm": 4.186975, "learning_rate": 3.167e-05, "token_acc": 0.77051527, "epoch": 1.06257822, "global_step/max_steps": "425/800", "percentage": "53.12%", "elapsed_time": "1h 46m 12s", "remaining_time": "1h 33m 43s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.993455} -{"loss": 0.77243048, "grad_norm": 1.75779152, "learning_rate": 3.155e-05, "token_acc": 0.76903848, "epoch": 1.06508135, "global_step/max_steps": "426/800", "percentage": "53.25%", "elapsed_time": "1h 46m 25s", "remaining_time": "1h 33m 25s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.987139} -{"loss": 0.80952156, "grad_norm": 3.04207349, "learning_rate": 3.143e-05, "token_acc": 0.76583984, "epoch": 1.06758448, "global_step/max_steps": "427/800", "percentage": "53.37%", "elapsed_time": "1h 46m 37s", "remaining_time": "1h 33m 8s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.98041} -{"loss": 0.65010232, "grad_norm": 1.70403016, "learning_rate": 3.131e-05, "token_acc": 0.80442849, "epoch": 1.07008761, "global_step/max_steps": "428/800", "percentage": "53.50%", "elapsed_time": "1h 46m 47s", "remaining_time": "1h 32m 48s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.968885} -{"loss": 0.77341765, "grad_norm": 2.91026759, "learning_rate": 3.119e-05, "token_acc": 0.76958466, "epoch": 1.07259074, "global_step/max_steps": "429/800", "percentage": "53.62%", "elapsed_time": "1h 47m 3s", "remaining_time": "1h 32m 34s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.971085} -{"loss": 0.79243958, "grad_norm": 1.7218647, "learning_rate": 3.107e-05, "token_acc": 0.76976729, "epoch": 1.07509387, "global_step/max_steps": "430/800", "percentage": "53.75%", "elapsed_time": "1h 47m 14s", "remaining_time": "1h 32m 17s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.963595} -{"loss": 0.80655444, "grad_norm": 3.25530505, "learning_rate": 3.096e-05, "token_acc": 0.76478579, "epoch": 1.077597, "global_step/max_steps": "431/800", "percentage": "53.87%", "elapsed_time": "1h 47m 45s", "remaining_time": "1h 32m 15s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.998976} -{"loss": 0.89233816, "grad_norm": 1.28787482, "learning_rate": 3.084e-05, "token_acc": 0.73875485, "epoch": 1.08010013, "global_step/max_steps": "432/800", "percentage": "54.00%", "elapsed_time": "1h 47m 59s", "remaining_time": "1h 31m 59s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.997876} -{"loss": 0.8253895, "grad_norm": 1.4100399, "learning_rate": 3.072e-05, "token_acc": 0.75405621, "epoch": 1.08260325, "global_step/max_steps": "433/800", "percentage": "54.12%", "elapsed_time": "1h 48m 17s", "remaining_time": "1h 31m 47s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.004321} -{"loss": 0.66068125, "grad_norm": 1.68696332, "learning_rate": 3.06e-05, "token_acc": 0.79748538, "epoch": 1.08510638, "global_step/max_steps": "434/800", "percentage": "54.25%", "elapsed_time": "1h 48m 31s", "remaining_time": "1h 31m 31s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.002828} -{"loss": 0.83902901, "grad_norm": 1.2705729, "learning_rate": 3.048e-05, "token_acc": 0.75396784, "epoch": 1.08760951, "global_step/max_steps": "435/800", "percentage": "54.37%", "elapsed_time": "1h 48m 49s", "remaining_time": "1h 31m 18s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.009177} -{"loss": 0.73748994, "grad_norm": 4.03431702, "learning_rate": 3.036e-05, "token_acc": 0.77847675, "epoch": 1.09011264, "global_step/max_steps": "436/800", "percentage": "54.50%", "elapsed_time": "1h 48m 57s", "remaining_time": "1h 30m 57s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.993082} -{"loss": 0.82659608, "grad_norm": 31.51459503, "learning_rate": 3.024e-05, "token_acc": 0.75441644, "epoch": 1.09261577, "global_step/max_steps": "437/800", "percentage": "54.62%", "elapsed_time": "1h 49m 15s", "remaining_time": "1h 30m 45s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.000699} -{"loss": 0.82503426, "grad_norm": 1.89834225, "learning_rate": 3.012e-05, "token_acc": 0.75177928, "epoch": 1.0951189, "global_step/max_steps": "438/800", "percentage": "54.75%", "elapsed_time": "1h 49m 35s", "remaining_time": "1h 30m 34s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.012125} -{"loss": 0.65481073, "grad_norm": 1.76037371, "learning_rate": 3e-05, "token_acc": 0.80240633, "epoch": 1.09762203, "global_step/max_steps": "439/800", "percentage": "54.87%", "elapsed_time": "1h 49m 46s", "remaining_time": "1h 30m 15s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.001265} -{"loss": 0.4950074, "grad_norm": 1.68105972, "learning_rate": 2.988e-05, "token_acc": 0.84848485, "epoch": 1.10012516, "global_step/max_steps": "440/800", "percentage": "55.00%", "elapsed_time": "1h 49m 57s", "remaining_time": "1h 29m 58s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.993492} -{"loss": 0.86119854, "grad_norm": 2.32386923, "learning_rate": 2.976e-05, "token_acc": 0.74599638, "epoch": 1.10262829, "global_step/max_steps": "441/800", "percentage": "55.12%", "elapsed_time": "1h 50m 25s", "remaining_time": "1h 29m 53s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.022419} -{"loss": 0.63358223, "grad_norm": 3.47059655, "learning_rate": 2.964e-05, "token_acc": 0.80755047, "epoch": 1.10513141, "global_step/max_steps": "442/800", "percentage": "55.25%", "elapsed_time": "1h 50m 33s", "remaining_time": "1h 29m 32s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.006468} -{"loss": 0.71411443, "grad_norm": 1.95449603, "learning_rate": 2.952e-05, "token_acc": 0.78711031, "epoch": 1.10763454, "global_step/max_steps": "443/800", "percentage": "55.38%", "elapsed_time": "1h 50m 42s", "remaining_time": "1h 29m 13s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.993925} -{"loss": 0.85093594, "grad_norm": 2.91233969, "learning_rate": 2.939e-05, "token_acc": 0.74410227, "epoch": 1.11013767, "global_step/max_steps": "444/800", "percentage": "55.50%", "elapsed_time": "1h 51m 1s", "remaining_time": "1h 29m 0s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.001308} -{"loss": 0.79095578, "grad_norm": 0.93819416, "learning_rate": 2.927e-05, "token_acc": 0.75871974, "epoch": 1.1126408, "global_step/max_steps": "445/800", "percentage": "55.62%", "elapsed_time": "1h 51m 18s", "remaining_time": "1h 28m 47s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.00586} -{"loss": 0.84397745, "grad_norm": 1.41623056, "learning_rate": 2.915e-05, "token_acc": 0.74943442, "epoch": 1.11514393, "global_step/max_steps": "446/800", "percentage": "55.75%", "elapsed_time": "1h 51m 35s", "remaining_time": "1h 28m 34s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.011188} -{"loss": 0.76945728, "grad_norm": 1.33738315, "learning_rate": 2.903e-05, "token_acc": 0.76750362, "epoch": 1.11764706, "global_step/max_steps": "447/800", "percentage": "55.88%", "elapsed_time": "1h 51m 49s", "remaining_time": "1h 28m 18s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.008847} -{"loss": 0.7465449, "grad_norm": 1.86164641, "learning_rate": 2.891e-05, "token_acc": 0.77600963, "epoch": 1.12015019, "global_step/max_steps": "448/800", "percentage": "56.00%", "elapsed_time": "1h 51m 60s", "remaining_time": "1h 27m 60s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.999464} -{"loss": 0.59763384, "grad_norm": 2.04173708, "learning_rate": 2.879e-05, "token_acc": 0.82092157, "epoch": 1.12265332, "global_step/max_steps": "449/800", "percentage": "56.12%", "elapsed_time": "1h 52m 12s", "remaining_time": "1h 27m 43s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.993602} -{"loss": 0.67214203, "grad_norm": 1.51385045, "learning_rate": 2.867e-05, "token_acc": 0.79591544, "epoch": 1.12515645, "global_step/max_steps": "450/800", "percentage": "56.25%", "elapsed_time": "1h 52m 26s", "remaining_time": "1h 27m 27s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.990936} -{"loss": 0.69249344, "grad_norm": 2.11211753, "learning_rate": 2.855e-05, "token_acc": 0.79261745, "epoch": 1.12765957, "global_step/max_steps": "451/800", "percentage": "56.38%", "elapsed_time": "1h 52m 45s", "remaining_time": "1h 27m 15s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.000967} -{"loss": 0.69026822, "grad_norm": 1.84272122, "learning_rate": 2.843e-05, "token_acc": 0.79451138, "epoch": 1.1301627, "global_step/max_steps": "452/800", "percentage": "56.50%", "elapsed_time": "1h 52m 54s", "remaining_time": "1h 26m 55s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.986781} -{"loss": 0.81995487, "grad_norm": 2.81094265, "learning_rate": 2.83e-05, "token_acc": 0.75437706, "epoch": 1.13266583, "global_step/max_steps": "453/800", "percentage": "56.62%", "elapsed_time": "1h 53m 4s", "remaining_time": "1h 26m 37s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.97582} -{"loss": 0.91400534, "grad_norm": 2.63724709, "learning_rate": 2.818e-05, "token_acc": 0.73424478, "epoch": 1.13516896, "global_step/max_steps": "454/800", "percentage": "56.75%", "elapsed_time": "1h 53m 24s", "remaining_time": "1h 26m 25s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.986042} -{"loss": 0.69254732, "grad_norm": 2.07020473, "learning_rate": 2.806e-05, "token_acc": 0.78817963, "epoch": 1.13767209, "global_step/max_steps": "455/800", "percentage": "56.88%", "elapsed_time": "1h 53m 37s", "remaining_time": "1h 26m 9s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.98179} -{"loss": 0.74414349, "grad_norm": 1.83931732, "learning_rate": 2.794e-05, "token_acc": 0.77664305, "epoch": 1.14017522, "global_step/max_steps": "456/800", "percentage": "57.00%", "elapsed_time": "1h 53m 50s", "remaining_time": "1h 25m 52s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.977567} -{"loss": 0.78108144, "grad_norm": 4.77965736, "learning_rate": 2.782e-05, "token_acc": 0.76222064, "epoch": 1.14267835, "global_step/max_steps": "457/800", "percentage": "57.12%", "elapsed_time": "1h 54m 8s", "remaining_time": "1h 25m 40s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.985341} -{"loss": 0.78762627, "grad_norm": 1.81707108, "learning_rate": 2.769e-05, "token_acc": 0.76858717, "epoch": 1.14518148, "global_step/max_steps": "458/800", "percentage": "57.25%", "elapsed_time": "1h 54m 19s", "remaining_time": "1h 25m 22s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.975347} -{"loss": 0.83287776, "grad_norm": 0.99897188, "learning_rate": 2.757e-05, "token_acc": 0.74989964, "epoch": 1.14768461, "global_step/max_steps": "459/800", "percentage": "57.38%", "elapsed_time": "1h 54m 40s", "remaining_time": "1h 25m 11s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.989061} -{"loss": 0.87489796, "grad_norm": 4.56875896, "learning_rate": 2.745e-05, "token_acc": 0.74508681, "epoch": 1.15018773, "global_step/max_steps": "460/800", "percentage": "57.50%", "elapsed_time": "1h 54m 55s", "remaining_time": "1h 24m 56s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.988049} -{"loss": 0.81825978, "grad_norm": 8.47026634, "learning_rate": 2.733e-05, "token_acc": 0.75555556, "epoch": 1.15269086, "global_step/max_steps": "461/800", "percentage": "57.63%", "elapsed_time": "1h 55m 18s", "remaining_time": "1h 24m 47s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.006914} -{"loss": 0.76838851, "grad_norm": 1.76571906, "learning_rate": 2.721e-05, "token_acc": 0.77425632, "epoch": 1.15519399, "global_step/max_steps": "462/800", "percentage": "57.75%", "elapsed_time": "1h 55m 28s", "remaining_time": "1h 24m 28s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.995052} -{"loss": 0.85305953, "grad_norm": 5.89510775, "learning_rate": 2.708e-05, "token_acc": 0.74510714, "epoch": 1.15769712, "global_step/max_steps": "463/800", "percentage": "57.88%", "elapsed_time": "1h 55m 47s", "remaining_time": "1h 24m 16s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.003899} -{"loss": 0.77866632, "grad_norm": 1.74804914, "learning_rate": 2.696e-05, "token_acc": 0.76781574, "epoch": 1.16020025, "global_step/max_steps": "464/800", "percentage": "58.00%", "elapsed_time": "1h 56m 4s", "remaining_time": "1h 24m 3s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.008495} -{"loss": 0.71215218, "grad_norm": 2.04447579, "learning_rate": 2.684e-05, "token_acc": 0.78039913, "epoch": 1.16270338, "global_step/max_steps": "465/800", "percentage": "58.13%", "elapsed_time": "1h 56m 13s", "remaining_time": "1h 23m 44s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.995737} -{"loss": 0.63767016, "grad_norm": 5.00332642, "learning_rate": 2.672e-05, "token_acc": 0.80670761, "epoch": 1.16520651, "global_step/max_steps": "466/800", "percentage": "58.25%", "elapsed_time": "1h 56m 23s", "remaining_time": "1h 23m 25s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.984461} -{"loss": 0.51506841, "grad_norm": 12.68697357, "learning_rate": 2.659e-05, "token_acc": 0.84599843, "epoch": 1.16770964, "global_step/max_steps": "467/800", "percentage": "58.38%", "elapsed_time": "1h 56m 34s", "remaining_time": "1h 23m 7s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.975733} -{"loss": 0.74675518, "grad_norm": 3.0933218, "learning_rate": 2.647e-05, "token_acc": 0.77793154, "epoch": 1.17021277, "global_step/max_steps": "468/800", "percentage": "58.50%", "elapsed_time": "1h 56m 43s", "remaining_time": "1h 22m 48s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.963999} -{"loss": 0.71380001, "grad_norm": 5.49066782, "learning_rate": 2.635e-05, "token_acc": 0.78848478, "epoch": 1.17271589, "global_step/max_steps": "469/800", "percentage": "58.63%", "elapsed_time": "1h 56m 52s", "remaining_time": "1h 22m 29s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.951822} -{"loss": 0.83334625, "grad_norm": 1.28075767, "learning_rate": 2.623e-05, "token_acc": 0.74997497, "epoch": 1.17521902, "global_step/max_steps": "470/800", "percentage": "58.75%", "elapsed_time": "1h 57m 6s", "remaining_time": "1h 22m 13s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.949818} -{"loss": 0.71349341, "grad_norm": 10.07744408, "learning_rate": 2.61e-05, "token_acc": 0.78194675, "epoch": 1.17772215, "global_step/max_steps": "471/800", "percentage": "58.88%", "elapsed_time": "1h 57m 30s", "remaining_time": "1h 22m 4s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.967366} -{"loss": 0.87035882, "grad_norm": 1.70637143, "learning_rate": 2.598e-05, "token_acc": 0.74547068, "epoch": 1.18022528, "global_step/max_steps": "472/800", "percentage": "59.00%", "elapsed_time": "1h 58m 0s", "remaining_time": "1h 22m 0s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.000271} -{"loss": 0.7841652, "grad_norm": 1.98405886, "learning_rate": 2.586e-05, "token_acc": 0.76539589, "epoch": 1.18272841, "global_step/max_steps": "473/800", "percentage": "59.13%", "elapsed_time": "1h 58m 15s", "remaining_time": "1h 21m 45s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.999118} -{"loss": 0.83119398, "grad_norm": 1.91701555, "learning_rate": 2.574e-05, "token_acc": 0.75804098, "epoch": 1.18523154, "global_step/max_steps": "474/800", "percentage": "59.25%", "elapsed_time": "1h 58m 27s", "remaining_time": "1h 21m 28s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.994239} -{"loss": 0.80659413, "grad_norm": 1.17625558, "learning_rate": 2.561e-05, "token_acc": 0.76050494, "epoch": 1.18773467, "global_step/max_steps": "475/800", "percentage": "59.38%", "elapsed_time": "1h 58m 43s", "remaining_time": "1h 21m 13s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.994764} -{"loss": 0.66424364, "grad_norm": 2.93610692, "learning_rate": 2.549e-05, "token_acc": 0.80241327, "epoch": 1.1902378, "global_step/max_steps": "476/800", "percentage": "59.50%", "elapsed_time": "1h 58m 51s", "remaining_time": "1h 20m 54s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.981149} -{"loss": 0.76688015, "grad_norm": 4.61353016, "learning_rate": 2.537e-05, "token_acc": 0.77481821, "epoch": 1.19274093, "global_step/max_steps": "477/800", "percentage": "59.62%", "elapsed_time": "1h 59m 0s", "remaining_time": "1h 20m 35s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.9687} -{"loss": 0.9035182, "grad_norm": 1.09795666, "learning_rate": 2.525e-05, "token_acc": 0.73421913, "epoch": 1.19524406, "global_step/max_steps": "478/800", "percentage": "59.75%", "elapsed_time": "1h 59m 20s", "remaining_time": "1h 20m 23s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.979156} -{"loss": 0.85131943, "grad_norm": 1.83632922, "learning_rate": 2.512e-05, "token_acc": 0.74671511, "epoch": 1.19774718, "global_step/max_steps": "479/800", "percentage": "59.88%", "elapsed_time": "1h 59m 34s", "remaining_time": "1h 20m 7s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.976633} -{"loss": 0.71733654, "grad_norm": 1.22922671, "learning_rate": 2.5e-05, "token_acc": 0.78524027, "epoch": 1.20025031, "global_step/max_steps": "480/800", "percentage": "60.00%", "elapsed_time": "1h 59m 43s", "remaining_time": "1h 19m 49s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.965267} -{"loss": 0.75705719, "grad_norm": 1.13339102, "learning_rate": 2.488e-05, "token_acc": 0.77185122, "epoch": 1.20275344, "global_step/max_steps": "481/800", "percentage": "60.12%", "elapsed_time": "2h 0m 7s", "remaining_time": "1h 19m 40s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.983499} -{"loss": 0.846385, "grad_norm": 2.55325818, "learning_rate": 2.475e-05, "token_acc": 0.74629812, "epoch": 1.20525657, "global_step/max_steps": "482/800", "percentage": "60.25%", "elapsed_time": "2h 0m 41s", "remaining_time": "1h 19m 37s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.022241} -{"loss": 0.74105656, "grad_norm": 1.96826208, "learning_rate": 2.463e-05, "token_acc": 0.77867001, "epoch": 1.2077597, "global_step/max_steps": "483/800", "percentage": "60.38%", "elapsed_time": "2h 0m 58s", "remaining_time": "1h 19m 24s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.027498} -{"loss": 0.82740581, "grad_norm": 1.07887506, "learning_rate": 2.451e-05, "token_acc": 0.7513349, "epoch": 1.21026283, "global_step/max_steps": "484/800", "percentage": "60.50%", "elapsed_time": "2h 1m 15s", "remaining_time": "1h 19m 10s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.031287} -{"loss": 0.8381744, "grad_norm": 1.12341535, "learning_rate": 2.439e-05, "token_acc": 0.74766487, "epoch": 1.21276596, "global_step/max_steps": "485/800", "percentage": "60.62%", "elapsed_time": "2h 1m 30s", "remaining_time": "1h 18m 55s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.030704} -{"loss": 0.80041802, "grad_norm": 2.8939898, "learning_rate": 2.426e-05, "token_acc": 0.76461089, "epoch": 1.21526909, "global_step/max_steps": "486/800", "percentage": "60.75%", "elapsed_time": "2h 1m 40s", "remaining_time": "1h 18m 36s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.020677} -{"loss": 0.8478291, "grad_norm": 3.46976638, "learning_rate": 2.414e-05, "token_acc": 0.75138094, "epoch": 1.21777222, "global_step/max_steps": "487/800", "percentage": "60.88%", "elapsed_time": "2h 1m 58s", "remaining_time": "1h 18m 23s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.02589} -{"loss": 0.71097982, "grad_norm": 2.41086698, "learning_rate": 2.402e-05, "token_acc": 0.78387563, "epoch": 1.22027534, "global_step/max_steps": "488/800", "percentage": "61.00%", "elapsed_time": "2h 2m 7s", "remaining_time": "1h 18m 4s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.013598} -{"loss": 0.82323134, "grad_norm": 5.50283194, "learning_rate": 2.39e-05, "token_acc": 0.75414807, "epoch": 1.22277847, "global_step/max_steps": "489/800", "percentage": "61.12%", "elapsed_time": "2h 2m 17s", "remaining_time": "1h 17m 46s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.003991} -{"loss": 0.68950039, "grad_norm": 5.16461325, "learning_rate": 2.377e-05, "token_acc": 0.79048737, "epoch": 1.2252816, "global_step/max_steps": "490/800", "percentage": "61.25%", "elapsed_time": "2h 2m 30s", "remaining_time": "1h 17m 30s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.000585} -{"loss": 0.89530617, "grad_norm": 2.99257731, "learning_rate": 2.365e-05, "token_acc": 0.73344604, "epoch": 1.22778473, "global_step/max_steps": "491/800", "percentage": "61.38%", "elapsed_time": "2h 2m 54s", "remaining_time": "1h 17m 20s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.017539} -{"loss": 0.6675306, "grad_norm": 3.07801151, "learning_rate": 2.353e-05, "token_acc": 0.79881026, "epoch": 1.23028786, "global_step/max_steps": "492/800", "percentage": "61.50%", "elapsed_time": "2h 3m 4s", "remaining_time": "1h 17m 2s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.007568} -{"loss": 0.79069895, "grad_norm": 2.80561566, "learning_rate": 2.341e-05, "token_acc": 0.76834244, "epoch": 1.23279099, "global_step/max_steps": "493/800", "percentage": "61.62%", "elapsed_time": "2h 3m 16s", "remaining_time": "1h 16m 46s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.001803} -{"loss": 0.71900761, "grad_norm": 1.3469888, "learning_rate": 2.328e-05, "token_acc": 0.77882295, "epoch": 1.23529412, "global_step/max_steps": "494/800", "percentage": "61.75%", "elapsed_time": "2h 3m 29s", "remaining_time": "1h 16m 29s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.997416} -{"loss": 0.84770811, "grad_norm": 2.31827998, "learning_rate": 2.316e-05, "token_acc": 0.74799766, "epoch": 1.23779725, "global_step/max_steps": "495/800", "percentage": "61.88%", "elapsed_time": "2h 3m 40s", "remaining_time": "1h 16m 12s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.990843} -{"loss": 0.83019716, "grad_norm": 1.66133714, "learning_rate": 2.304e-05, "token_acc": 0.75314546, "epoch": 1.24030038, "global_step/max_steps": "496/800", "percentage": "62.00%", "elapsed_time": "2h 3m 55s", "remaining_time": "1h 15m 57s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.989631} -{"loss": 0.62463534, "grad_norm": 1.97845829, "learning_rate": 2.292e-05, "token_acc": 0.80726788, "epoch": 1.2428035, "global_step/max_steps": "497/800", "percentage": "62.12%", "elapsed_time": "2h 4m 4s", "remaining_time": "1h 15m 38s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.978042} -{"loss": 0.69293952, "grad_norm": 2.76374984, "learning_rate": 2.279e-05, "token_acc": 0.79179093, "epoch": 1.24530663, "global_step/max_steps": "498/800", "percentage": "62.25%", "elapsed_time": "2h 4m 14s", "remaining_time": "1h 15m 20s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.96777} -{"loss": 0.71632826, "grad_norm": 1.45263767, "learning_rate": 2.267e-05, "token_acc": 0.7838088, "epoch": 1.24780976, "global_step/max_steps": "499/800", "percentage": "62.38%", "elapsed_time": "2h 4m 24s", "remaining_time": "1h 15m 2s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.957545} -{"loss": 0.54493928, "grad_norm": 3.43852353, "learning_rate": 2.255e-05, "token_acc": 0.83321096, "epoch": 1.25031289, "global_step/max_steps": "500/800", "percentage": "62.50%", "elapsed_time": "2h 4m 34s", "remaining_time": "1h 14m 44s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.947275} -{"loss": 0.61373019, "grad_norm": 13.27852631, "learning_rate": 2.243e-05, "token_acc": 0.81043219, "epoch": 1.25281602, "global_step/max_steps": "501/800", "percentage": "62.62%", "elapsed_time": "2h 4m 56s", "remaining_time": "1h 14m 33s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.961194} -{"loss": 0.86869699, "grad_norm": 13.62430191, "learning_rate": 2.231e-05, "token_acc": 0.74421448, "epoch": 1.25531915, "global_step/max_steps": "502/800", "percentage": "62.75%", "elapsed_time": "2h 5m 15s", "remaining_time": "1h 14m 21s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.969622} -{"loss": 0.927163, "grad_norm": 1.88065195, "learning_rate": 2.218e-05, "token_acc": 0.7262685, "epoch": 1.25782228, "global_step/max_steps": "503/800", "percentage": "62.88%", "elapsed_time": "2h 5m 38s", "remaining_time": "1h 14m 11s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.985184} -{"loss": 0.67596138, "grad_norm": 2.08332586, "learning_rate": 2.206e-05, "token_acc": 0.79693966, "epoch": 1.26032541, "global_step/max_steps": "504/800", "percentage": "63.00%", "elapsed_time": "2h 5m 47s", "remaining_time": "1h 13m 53s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.974936} -{"loss": 0.73849154, "grad_norm": 6.38939476, "learning_rate": 2.194e-05, "token_acc": 0.77499061, "epoch": 1.26282854, "global_step/max_steps": "505/800", "percentage": "63.12%", "elapsed_time": "2h 5m 56s", "remaining_time": "1h 13m 34s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.962788} -{"loss": 0.645841, "grad_norm": 3.05928969, "learning_rate": 2.182e-05, "token_acc": 0.80201969, "epoch": 1.26533166, "global_step/max_steps": "506/800", "percentage": "63.25%", "elapsed_time": "2h 6m 7s", "remaining_time": "1h 13m 17s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.955286} -{"loss": 0.68619621, "grad_norm": 1.63944173, "learning_rate": 2.17e-05, "token_acc": 0.79079464, "epoch": 1.26783479, "global_step/max_steps": "507/800", "percentage": "63.38%", "elapsed_time": "2h 6m 18s", "remaining_time": "1h 12m 59s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.946974} -{"loss": 0.79881978, "grad_norm": 2.15215278, "learning_rate": 2.157e-05, "token_acc": 0.75829291, "epoch": 1.27033792, "global_step/max_steps": "508/800", "percentage": "63.50%", "elapsed_time": "2h 6m 37s", "remaining_time": "1h 12m 47s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.954037} -{"loss": 0.78398967, "grad_norm": 1.51505888, "learning_rate": 2.145e-05, "token_acc": 0.75601051, "epoch": 1.27284105, "global_step/max_steps": "509/800", "percentage": "63.62%", "elapsed_time": "2h 6m 57s", "remaining_time": "1h 12m 35s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.96538} -{"loss": 0.81469798, "grad_norm": 1.52632153, "learning_rate": 2.133e-05, "token_acc": 0.76116086, "epoch": 1.27534418, "global_step/max_steps": "510/800", "percentage": "63.75%", "elapsed_time": "2h 7m 11s", "remaining_time": "1h 12m 19s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.962555} -{"loss": 0.74702817, "grad_norm": 1.99882543, "learning_rate": 2.121e-05, "token_acc": 0.77866752, "epoch": 1.27784731, "global_step/max_steps": "511/800", "percentage": "63.88%", "elapsed_time": "2h 7m 34s", "remaining_time": "1h 12m 9s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.978339} -{"loss": 0.82370222, "grad_norm": 3.26059175, "learning_rate": 2.109e-05, "token_acc": 0.752867, "epoch": 1.28035044, "global_step/max_steps": "512/800", "percentage": "64.00%", "elapsed_time": "2h 7m 48s", "remaining_time": "1h 11m 53s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.975658} -{"loss": 0.79450077, "grad_norm": 1.76350427, "learning_rate": 2.097e-05, "token_acc": 0.75932851, "epoch": 1.28285357, "global_step/max_steps": "513/800", "percentage": "64.12%", "elapsed_time": "2h 8m 7s", "remaining_time": "1h 11m 41s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.984347} -{"loss": 0.75543177, "grad_norm": 1.55114782, "learning_rate": 2.085e-05, "token_acc": 0.7748419, "epoch": 1.2853567, "global_step/max_steps": "514/800", "percentage": "64.25%", "elapsed_time": "2h 8m 22s", "remaining_time": "1h 11m 26s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.984851} -{"loss": 0.8068946, "grad_norm": 4.11573744, "learning_rate": 2.073e-05, "token_acc": 0.75412505, "epoch": 1.28785982, "global_step/max_steps": "515/800", "percentage": "64.38%", "elapsed_time": "2h 8m 38s", "remaining_time": "1h 11m 11s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.985523} -{"loss": 0.7863394, "grad_norm": 3.03111625, "learning_rate": 2.061e-05, "token_acc": 0.76865105, "epoch": 1.29036295, "global_step/max_steps": "516/800", "percentage": "64.50%", "elapsed_time": "2h 8m 51s", "remaining_time": "1h 10m 55s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.982038} -{"loss": 0.87298512, "grad_norm": 1.59098423, "learning_rate": 2.048e-05, "token_acc": 0.74075375, "epoch": 1.29286608, "global_step/max_steps": "517/800", "percentage": "64.62%", "elapsed_time": "2h 9m 13s", "remaining_time": "1h 10m 44s", "memory(GiB)": 76.55, "train_speed(s/it)": 14.995621} -{"loss": 0.73034078, "grad_norm": 2.67507529, "learning_rate": 2.036e-05, "token_acc": 0.7781298, "epoch": 1.29536921, "global_step/max_steps": "518/800", "percentage": "64.75%", "elapsed_time": "2h 9m 38s", "remaining_time": "1h 10m 34s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.015451} -{"loss": 0.82901651, "grad_norm": 0.96926063, "learning_rate": 2.024e-05, "token_acc": 0.75199566, "epoch": 1.29787234, "global_step/max_steps": "519/800", "percentage": "64.88%", "elapsed_time": "2h 9m 50s", "remaining_time": "1h 10m 18s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.010478} -{"loss": 0.87606925, "grad_norm": 2.22193909, "learning_rate": 2.012e-05, "token_acc": 0.74300984, "epoch": 1.30037547, "global_step/max_steps": "520/800", "percentage": "65.00%", "elapsed_time": "2h 10m 9s", "remaining_time": "1h 10m 5s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.017018} -{"loss": 0.83697963, "grad_norm": 0.88661945, "learning_rate": 2e-05, "token_acc": 0.74787694, "epoch": 1.3028786, "global_step/max_steps": "521/800", "percentage": "65.12%", "elapsed_time": "2h 10m 40s", "remaining_time": "1h 9m 58s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.047237} -{"loss": 0.78820479, "grad_norm": 3.67893744, "learning_rate": 1.988e-05, "token_acc": 0.7677948, "epoch": 1.30538173, "global_step/max_steps": "522/800", "percentage": "65.25%", "elapsed_time": "2h 10m 52s", "remaining_time": "1h 9m 42s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.042653} -{"loss": 0.78391659, "grad_norm": 2.05991721, "learning_rate": 1.976e-05, "token_acc": 0.76771597, "epoch": 1.30788486, "global_step/max_steps": "523/800", "percentage": "65.38%", "elapsed_time": "2h 11m 5s", "remaining_time": "1h 9m 26s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.039165} -{"loss": 0.83091217, "grad_norm": 1.23101246, "learning_rate": 1.964e-05, "token_acc": 0.74976653, "epoch": 1.31038798, "global_step/max_steps": "524/800", "percentage": "65.50%", "elapsed_time": "2h 11m 24s", "remaining_time": "1h 9m 13s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.04561} -{"loss": 0.71325111, "grad_norm": 1.45393848, "learning_rate": 1.952e-05, "token_acc": 0.78689507, "epoch": 1.31289111, "global_step/max_steps": "525/800", "percentage": "65.62%", "elapsed_time": "2h 11m 33s", "remaining_time": "1h 8m 54s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.033774} -{"loss": 0.82103837, "grad_norm": 5.70474672, "learning_rate": 1.94e-05, "token_acc": 0.75617085, "epoch": 1.31539424, "global_step/max_steps": "526/800", "percentage": "65.75%", "elapsed_time": "2h 11m 45s", "remaining_time": "1h 8m 38s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.028548} -{"loss": 0.81606674, "grad_norm": 2.11982512, "learning_rate": 1.928e-05, "token_acc": 0.75498339, "epoch": 1.31789737, "global_step/max_steps": "527/800", "percentage": "65.88%", "elapsed_time": "2h 12m 1s", "remaining_time": "1h 8m 23s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.02964} -{"loss": 0.76027399, "grad_norm": 1.76884472, "learning_rate": 1.916e-05, "token_acc": 0.77433593, "epoch": 1.3204005, "global_step/max_steps": "528/800", "percentage": "66.00%", "elapsed_time": "2h 12m 12s", "remaining_time": "1h 8m 6s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.02256} -{"loss": 0.79492676, "grad_norm": 3.81367278, "learning_rate": 1.904e-05, "token_acc": 0.76041667, "epoch": 1.32290363, "global_step/max_steps": "529/800", "percentage": "66.12%", "elapsed_time": "2h 12m 28s", "remaining_time": "1h 7m 52s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.02424} -{"loss": 0.83955008, "grad_norm": 1.39690983, "learning_rate": 1.893e-05, "token_acc": 0.7547573, "epoch": 1.32540676, "global_step/max_steps": "530/800", "percentage": "66.25%", "elapsed_time": "2h 12m 43s", "remaining_time": "1h 7m 37s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.024384} -{"loss": 0.63251996, "grad_norm": 2.36027026, "learning_rate": 1.881e-05, "token_acc": 0.80491213, "epoch": 1.32790989, "global_step/max_steps": "531/800", "percentage": "66.38%", "elapsed_time": "2h 13m 3s", "remaining_time": "1h 7m 24s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.033999} -{"loss": 0.80323476, "grad_norm": 6.82736254, "learning_rate": 1.869e-05, "token_acc": 0.75776287, "epoch": 1.33041302, "global_step/max_steps": "532/800", "percentage": "66.50%", "elapsed_time": "2h 13m 13s", "remaining_time": "1h 7m 7s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.025063} -{"loss": 0.77278221, "grad_norm": 2.2116971, "learning_rate": 1.857e-05, "token_acc": 0.77061938, "epoch": 1.33291615, "global_step/max_steps": "533/800", "percentage": "66.62%", "elapsed_time": "2h 13m 27s", "remaining_time": "1h 6m 51s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.02311} -{"loss": 0.87022936, "grad_norm": 1.69530809, "learning_rate": 1.845e-05, "token_acc": 0.74100097, "epoch": 1.33541927, "global_step/max_steps": "534/800", "percentage": "66.75%", "elapsed_time": "2h 13m 43s", "remaining_time": "1h 6m 37s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.024525} -{"loss": 0.74610937, "grad_norm": 9.75881386, "learning_rate": 1.833e-05, "token_acc": 0.77496149, "epoch": 1.3379224, "global_step/max_steps": "535/800", "percentage": "66.88%", "elapsed_time": "2h 13m 56s", "remaining_time": "1h 6m 20s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.020702} -{"loss": 0.82737982, "grad_norm": 1.14181221, "learning_rate": 1.821e-05, "token_acc": 0.74990425, "epoch": 1.34042553, "global_step/max_steps": "536/800", "percentage": "67.00%", "elapsed_time": "2h 14m 18s", "remaining_time": "1h 6m 9s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.033681} -{"loss": 0.8071326, "grad_norm": 1.87159026, "learning_rate": 1.81e-05, "token_acc": 0.75679465, "epoch": 1.34292866, "global_step/max_steps": "537/800", "percentage": "67.12%", "elapsed_time": "2h 14m 29s", "remaining_time": "1h 5m 52s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.025708} -{"loss": 0.70129782, "grad_norm": 1.57906425, "learning_rate": 1.798e-05, "token_acc": 0.78556574, "epoch": 1.34543179, "global_step/max_steps": "538/800", "percentage": "67.25%", "elapsed_time": "2h 14m 41s", "remaining_time": "1h 5m 35s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.019802} -{"loss": 0.63372731, "grad_norm": 2.05252266, "learning_rate": 1.786e-05, "token_acc": 0.80692341, "epoch": 1.34793492, "global_step/max_steps": "539/800", "percentage": "67.38%", "elapsed_time": "2h 14m 52s", "remaining_time": "1h 5m 18s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.012711} -{"loss": 0.82487696, "grad_norm": 1.35878122, "learning_rate": 1.774e-05, "token_acc": 0.75102792, "epoch": 1.35043805, "global_step/max_steps": "540/800", "percentage": "67.50%", "elapsed_time": "2h 15m 3s", "remaining_time": "1h 5m 1s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.004777} -{"loss": 0.80756235, "grad_norm": 1.54367363, "learning_rate": 1.763e-05, "token_acc": 0.7595461, "epoch": 1.35294118, "global_step/max_steps": "541/800", "percentage": "67.62%", "elapsed_time": "2h 15m 30s", "remaining_time": "1h 4m 52s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.02716} -{"loss": 0.72096014, "grad_norm": 2.27679348, "learning_rate": 1.751e-05, "token_acc": 0.77832031, "epoch": 1.35544431, "global_step/max_steps": "542/800", "percentage": "67.75%", "elapsed_time": "2h 15m 43s", "remaining_time": "1h 4m 36s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.023147} -{"loss": 0.64414763, "grad_norm": 2.04327512, "learning_rate": 1.739e-05, "token_acc": 0.80645479, "epoch": 1.35794743, "global_step/max_steps": "543/800", "percentage": "67.88%", "elapsed_time": "2h 15m 53s", "remaining_time": "1h 4m 19s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.014404} -{"loss": 0.78408456, "grad_norm": 1.80180371, "learning_rate": 1.727e-05, "token_acc": 0.7625759, "epoch": 1.36045056, "global_step/max_steps": "544/800", "percentage": "68.00%", "elapsed_time": "2h 16m 10s", "remaining_time": "1h 4m 5s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.018331} -{"loss": 0.75498074, "grad_norm": 2.25768447, "learning_rate": 1.716e-05, "token_acc": 0.77234019, "epoch": 1.36295369, "global_step/max_steps": "545/800", "percentage": "68.12%", "elapsed_time": "2h 16m 24s", "remaining_time": "1h 3m 49s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.016293} -{"loss": 0.67249155, "grad_norm": 7.71082211, "learning_rate": 1.704e-05, "token_acc": 0.79488994, "epoch": 1.36545682, "global_step/max_steps": "546/800", "percentage": "68.25%", "elapsed_time": "2h 16m 34s", "remaining_time": "1h 3m 32s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.006693} -{"loss": 0.80572402, "grad_norm": 1.56684041, "learning_rate": 1.693e-05, "token_acc": 0.75837589, "epoch": 1.36795995, "global_step/max_steps": "547/800", "percentage": "68.38%", "elapsed_time": "2h 16m 45s", "remaining_time": "1h 3m 15s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.000293} -{"loss": 0.81801742, "grad_norm": 2.73540473, "learning_rate": 1.681e-05, "token_acc": 0.75194904, "epoch": 1.37046308, "global_step/max_steps": "548/800", "percentage": "68.50%", "elapsed_time": "2h 17m 3s", "remaining_time": "1h 3m 2s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.006164} -{"loss": 0.72541618, "grad_norm": 1.50534332, "learning_rate": 1.669e-05, "token_acc": 0.78246255, "epoch": 1.37296621, "global_step/max_steps": "549/800", "percentage": "68.62%", "elapsed_time": "2h 17m 17s", "remaining_time": "1h 2m 46s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.003515} -{"loss": 0.71943361, "grad_norm": 1.99361157, "learning_rate": 1.658e-05, "token_acc": 0.78207696, "epoch": 1.37546934, "global_step/max_steps": "550/800", "percentage": "68.75%", "elapsed_time": "2h 17m 30s", "remaining_time": "1h 2m 30s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.00045} -{"loss": 0.80373085, "grad_norm": 1.44930172, "learning_rate": 1.646e-05, "token_acc": 0.75976447, "epoch": 1.37797247, "global_step/max_steps": "551/800", "percentage": "68.88%", "elapsed_time": "2h 17m 54s", "remaining_time": "1h 2m 19s", "memory(GiB)": 76.55, "train_speed(s/it)": 15.016874} -{"loss": 0.81937575, "grad_norm": 1.21812153, "learning_rate": 1.635e-05, "token_acc": 0.75217927, "epoch": 1.38047559, "global_step/max_steps": "552/800", "percentage": "69.00%", "elapsed_time": "2h 18m 14s", "remaining_time": "1h 2m 6s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.024469} -{"loss": 0.74046075, "grad_norm": 4.48853302, "learning_rate": 1.623e-05, "token_acc": 0.77724086, "epoch": 1.38297872, "global_step/max_steps": "553/800", "percentage": "69.12%", "elapsed_time": "2h 18m 25s", "remaining_time": "1h 1m 49s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.01798} -{"loss": 0.69699049, "grad_norm": 2.06128645, "learning_rate": 1.612e-05, "token_acc": 0.79081025, "epoch": 1.38548185, "global_step/max_steps": "554/800", "percentage": "69.25%", "elapsed_time": "2h 18m 35s", "remaining_time": "1h 1m 32s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.0089} -{"loss": 0.87535578, "grad_norm": 5.56073141, "learning_rate": 1.6e-05, "token_acc": 0.73923885, "epoch": 1.38798498, "global_step/max_steps": "555/800", "percentage": "69.38%", "elapsed_time": "2h 18m 54s", "remaining_time": "1h 1m 19s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.016229} -{"loss": 0.69843072, "grad_norm": 2.46449065, "learning_rate": 1.589e-05, "token_acc": 0.78354075, "epoch": 1.39048811, "global_step/max_steps": "556/800", "percentage": "69.50%", "elapsed_time": "2h 19m 7s", "remaining_time": "1h 1m 3s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.011746} -{"loss": 0.79188567, "grad_norm": 6.08683729, "learning_rate": 1.577e-05, "token_acc": 0.76260448, "epoch": 1.39299124, "global_step/max_steps": "557/800", "percentage": "69.62%", "elapsed_time": "2h 19m 19s", "remaining_time": "1h 0m 47s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.006599} -{"loss": 0.67595285, "grad_norm": 40.48544312, "learning_rate": 1.566e-05, "token_acc": 0.78969587, "epoch": 1.39549437, "global_step/max_steps": "558/800", "percentage": "69.75%", "elapsed_time": "2h 19m 29s", "remaining_time": "1h 0m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.997773} -{"loss": 0.87341422, "grad_norm": 4.20406675, "learning_rate": 1.555e-05, "token_acc": 0.74028413, "epoch": 1.3979975, "global_step/max_steps": "559/800", "percentage": "69.88%", "elapsed_time": "2h 19m 43s", "remaining_time": "1h 0m 14s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.996534} -{"loss": 0.80618441, "grad_norm": 1.53420544, "learning_rate": 1.543e-05, "token_acc": 0.75980225, "epoch": 1.40050063, "global_step/max_steps": "560/800", "percentage": "70.00%", "elapsed_time": "2h 20m 0s", "remaining_time": "1h 0m 0s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.000021} -{"loss": 0.74627662, "grad_norm": 2.57600427, "learning_rate": 1.532e-05, "token_acc": 0.78051152, "epoch": 1.40300375, "global_step/max_steps": "561/800", "percentage": "70.12%", "elapsed_time": "2h 20m 21s", "remaining_time": "59m 48s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.011207} -{"loss": 0.77946413, "grad_norm": 1.28070331, "learning_rate": 1.521e-05, "token_acc": 0.77059688, "epoch": 1.40550688, "global_step/max_steps": "562/800", "percentage": "70.25%", "elapsed_time": "2h 20m 38s", "remaining_time": "59m 34s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.015042} -{"loss": 0.80493343, "grad_norm": 1.38149047, "learning_rate": 1.509e-05, "token_acc": 0.76050472, "epoch": 1.40801001, "global_step/max_steps": "563/800", "percentage": "70.38%", "elapsed_time": "2h 20m 53s", "remaining_time": "59m 18s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.013853} -{"loss": 0.67921484, "grad_norm": 1.47896934, "learning_rate": 1.498e-05, "token_acc": 0.79616484, "epoch": 1.41051314, "global_step/max_steps": "564/800", "percentage": "70.50%", "elapsed_time": "2h 21m 4s", "remaining_time": "59m 2s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.007291} -{"loss": 0.77103895, "grad_norm": 1.73113012, "learning_rate": 1.487e-05, "token_acc": 0.77287164, "epoch": 1.41301627, "global_step/max_steps": "565/800", "percentage": "70.62%", "elapsed_time": "2h 21m 16s", "remaining_time": "58m 45s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.001493} -{"loss": 0.75498331, "grad_norm": 1.13413644, "learning_rate": 1.476e-05, "token_acc": 0.77094256, "epoch": 1.4155194, "global_step/max_steps": "566/800", "percentage": "70.75%", "elapsed_time": "2h 21m 30s", "remaining_time": "58m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.999511} -{"loss": 0.70689732, "grad_norm": 2.79532599, "learning_rate": 1.465e-05, "token_acc": 0.78664473, "epoch": 1.41802253, "global_step/max_steps": "567/800", "percentage": "70.88%", "elapsed_time": "2h 21m 44s", "remaining_time": "58m 15s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.997967} -{"loss": 0.7402547, "grad_norm": 2.40043116, "learning_rate": 1.453e-05, "token_acc": 0.77327773, "epoch": 1.42052566, "global_step/max_steps": "568/800", "percentage": "71.00%", "elapsed_time": "2h 21m 59s", "remaining_time": "57m 60s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.998437} -{"loss": 0.74631321, "grad_norm": 1.96450043, "learning_rate": 1.442e-05, "token_acc": 0.77860089, "epoch": 1.42302879, "global_step/max_steps": "569/800", "percentage": "71.12%", "elapsed_time": "2h 22m 11s", "remaining_time": "57m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.993574} -{"loss": 0.79584968, "grad_norm": 7.37590456, "learning_rate": 1.431e-05, "token_acc": 0.76039885, "epoch": 1.42553191, "global_step/max_steps": "570/800", "percentage": "71.25%", "elapsed_time": "2h 22m 29s", "remaining_time": "57m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.99892} -{"loss": 0.7623685, "grad_norm": 1.69603801, "learning_rate": 1.42e-05, "token_acc": 0.77182077, "epoch": 1.42803504, "global_step/max_steps": "571/800", "percentage": "71.38%", "elapsed_time": "2h 22m 51s", "remaining_time": "57m 18s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.011172} -{"loss": 0.72807026, "grad_norm": 1.95605898, "learning_rate": 1.409e-05, "token_acc": 0.77997224, "epoch": 1.43053817, "global_step/max_steps": "572/800", "percentage": "71.50%", "elapsed_time": "2h 23m 6s", "remaining_time": "57m 2s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.010934} -{"loss": 0.65448689, "grad_norm": 2.59531474, "learning_rate": 1.398e-05, "token_acc": 0.80062543, "epoch": 1.4330413, "global_step/max_steps": "573/800", "percentage": "71.62%", "elapsed_time": "2h 23m 20s", "remaining_time": "56m 47s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.007987} -{"loss": 0.79369831, "grad_norm": 1.16977453, "learning_rate": 1.387e-05, "token_acc": 0.76530463, "epoch": 1.43554443, "global_step/max_steps": "574/800", "percentage": "71.75%", "elapsed_time": "2h 23m 29s", "remaining_time": "56m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.99874} -{"loss": 0.8053968, "grad_norm": 2.11481571, "learning_rate": 1.376e-05, "token_acc": 0.75942415, "epoch": 1.43804756, "global_step/max_steps": "575/800", "percentage": "71.88%", "elapsed_time": "2h 23m 44s", "remaining_time": "56m 15s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.9979} -{"loss": 0.80469036, "grad_norm": 2.31931567, "learning_rate": 1.365e-05, "token_acc": 0.76167767, "epoch": 1.44055069, "global_step/max_steps": "576/800", "percentage": "72.00%", "elapsed_time": "2h 23m 59s", "remaining_time": "55m 60s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.998752} -{"loss": 0.80999118, "grad_norm": 4.96538734, "learning_rate": 1.354e-05, "token_acc": 0.7585025, "epoch": 1.44305382, "global_step/max_steps": "577/800", "percentage": "72.12%", "elapsed_time": "2h 24m 13s", "remaining_time": "55m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.995804} -{"loss": 0.64876068, "grad_norm": 2.77750111, "learning_rate": 1.343e-05, "token_acc": 0.80722992, "epoch": 1.44555695, "global_step/max_steps": "578/800", "percentage": "72.25%", "elapsed_time": "2h 24m 28s", "remaining_time": "55m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.997307} -{"loss": 0.6385178, "grad_norm": 1.82178533, "learning_rate": 1.332e-05, "token_acc": 0.80788791, "epoch": 1.44806008, "global_step/max_steps": "579/800", "percentage": "72.38%", "elapsed_time": "2h 24m 37s", "remaining_time": "55m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.986811} -{"loss": 0.75387645, "grad_norm": 1.6126281, "learning_rate": 1.322e-05, "token_acc": 0.77652733, "epoch": 1.4505632, "global_step/max_steps": "580/800", "percentage": "72.50%", "elapsed_time": "2h 24m 50s", "remaining_time": "54m 56s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.983409} -{"loss": 0.73763001, "grad_norm": 1.22937036, "learning_rate": 1.311e-05, "token_acc": 0.77328338, "epoch": 1.45306633, "global_step/max_steps": "581/800", "percentage": "72.62%", "elapsed_time": "2h 25m 11s", "remaining_time": "54m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.993296} -{"loss": 0.91477406, "grad_norm": 1.69186342, "learning_rate": 1.3e-05, "token_acc": 0.73592536, "epoch": 1.45556946, "global_step/max_steps": "582/800", "percentage": "72.75%", "elapsed_time": "2h 25m 30s", "remaining_time": "54m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.999759} -{"loss": 0.64400971, "grad_norm": 6.23209763, "learning_rate": 1.289e-05, "token_acc": 0.80363707, "epoch": 1.45807259, "global_step/max_steps": "583/800", "percentage": "72.88%", "elapsed_time": "2h 25m 41s", "remaining_time": "54m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.992903} -{"loss": 0.8547954, "grad_norm": 1.36918676, "learning_rate": 1.278e-05, "token_acc": 0.74340931, "epoch": 1.46057572, "global_step/max_steps": "584/800", "percentage": "73.00%", "elapsed_time": "2h 26m 6s", "remaining_time": "54m 2s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.010246} -{"loss": 0.72401792, "grad_norm": 5.27024698, "learning_rate": 1.268e-05, "token_acc": 0.78128464, "epoch": 1.46307885, "global_step/max_steps": "585/800", "percentage": "73.12%", "elapsed_time": "2h 26m 20s", "remaining_time": "53m 47s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.009102} -{"loss": 0.73076713, "grad_norm": 4.63971615, "learning_rate": 1.257e-05, "token_acc": 0.7740117, "epoch": 1.46558198, "global_step/max_steps": "586/800", "percentage": "73.25%", "elapsed_time": "2h 26m 31s", "remaining_time": "53m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.002067} -{"loss": 0.82327211, "grad_norm": 4.01577711, "learning_rate": 1.246e-05, "token_acc": 0.75145327, "epoch": 1.46808511, "global_step/max_steps": "587/800", "percentage": "73.38%", "elapsed_time": "2h 26m 48s", "remaining_time": "53m 16s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.005308} -{"loss": 0.66845524, "grad_norm": 3.15453696, "learning_rate": 1.236e-05, "token_acc": 0.79268293, "epoch": 1.47058824, "global_step/max_steps": "588/800", "percentage": "73.50%", "elapsed_time": "2h 26m 59s", "remaining_time": "52m 60s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.998243} -{"loss": 0.7221213, "grad_norm": 1.41235149, "learning_rate": 1.225e-05, "token_acc": 0.78064008, "epoch": 1.47309136, "global_step/max_steps": "589/800", "percentage": "73.62%", "elapsed_time": "2h 27m 14s", "remaining_time": "52m 45s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.999055} -{"loss": 0.66541213, "grad_norm": 2.09352851, "learning_rate": 1.215e-05, "token_acc": 0.79832628, "epoch": 1.47559449, "global_step/max_steps": "590/800", "percentage": "73.75%", "elapsed_time": "2h 27m 29s", "remaining_time": "52m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.998951} -{"loss": 0.74120194, "grad_norm": 2.06630278, "learning_rate": 1.204e-05, "token_acc": 0.77781242, "epoch": 1.47809762, "global_step/max_steps": "591/800", "percentage": "73.88%", "elapsed_time": "2h 27m 55s", "remaining_time": "52m 19s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.016948} -{"loss": 0.63728464, "grad_norm": 6.00326395, "learning_rate": 1.194e-05, "token_acc": 0.80372915, "epoch": 1.48060075, "global_step/max_steps": "592/800", "percentage": "74.00%", "elapsed_time": "2h 28m 5s", "remaining_time": "52m 2s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.009153} -{"loss": 0.68261611, "grad_norm": 4.38971615, "learning_rate": 1.183e-05, "token_acc": 0.79522388, "epoch": 1.48310388, "global_step/max_steps": "593/800", "percentage": "74.12%", "elapsed_time": "2h 28m 15s", "remaining_time": "51m 45s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.000489} -{"loss": 0.80195695, "grad_norm": 1.73609102, "learning_rate": 1.173e-05, "token_acc": 0.76402479, "epoch": 1.48560701, "global_step/max_steps": "594/800", "percentage": "74.25%", "elapsed_time": "2h 28m 29s", "remaining_time": "51m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.998998} -{"loss": 0.72095704, "grad_norm": 1.48765838, "learning_rate": 1.163e-05, "token_acc": 0.7803596, "epoch": 1.48811014, "global_step/max_steps": "595/800", "percentage": "74.38%", "elapsed_time": "2h 28m 44s", "remaining_time": "51m 15s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.998091} -{"loss": 0.66385579, "grad_norm": 3.05149198, "learning_rate": 1.152e-05, "token_acc": 0.8011517, "epoch": 1.49061327, "global_step/max_steps": "596/800", "percentage": "74.50%", "elapsed_time": "2h 28m 52s", "remaining_time": "50m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.986121} -{"loss": 0.72736043, "grad_norm": 3.33722997, "learning_rate": 1.142e-05, "token_acc": 0.77878922, "epoch": 1.4931164, "global_step/max_steps": "597/800", "percentage": "74.62%", "elapsed_time": "2h 29m 5s", "remaining_time": "50m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.98322} -{"loss": 0.88424098, "grad_norm": 2.39797759, "learning_rate": 1.132e-05, "token_acc": 0.74104753, "epoch": 1.49561952, "global_step/max_steps": "598/800", "percentage": "74.75%", "elapsed_time": "2h 29m 21s", "remaining_time": "50m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.985576} -{"loss": 0.69848251, "grad_norm": 2.4129982, "learning_rate": 1.121e-05, "token_acc": 0.78649728, "epoch": 1.49812265, "global_step/max_steps": "599/800", "percentage": "74.88%", "elapsed_time": "2h 29m 31s", "remaining_time": "50m 10s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.976721} -{"loss": 0.76072067, "grad_norm": 0.98637438, "learning_rate": 1.111e-05, "token_acc": 0.76530045, "epoch": 1.50062578, "global_step/max_steps": "600/800", "percentage": "75.00%", "elapsed_time": "2h 29m 52s", "remaining_time": "49m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.987377} -{"loss": 0.74465656, "grad_norm": 2.95655394, "learning_rate": 1.101e-05, "token_acc": 0.77360057, "epoch": 1.50312891, "global_step/max_steps": "601/800", "percentage": "75.12%", "elapsed_time": "2h 30m 17s", "remaining_time": "49m 46s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.003568} -{"loss": 0.88885313, "grad_norm": 1.51529622, "learning_rate": 1.091e-05, "token_acc": 0.73969728, "epoch": 1.50563204, "global_step/max_steps": "602/800", "percentage": "75.25%", "elapsed_time": "2h 30m 31s", "remaining_time": "49m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.001868} -{"loss": 0.76556307, "grad_norm": 3.07121873, "learning_rate": 1.081e-05, "token_acc": 0.77409297, "epoch": 1.50813517, "global_step/max_steps": "603/800", "percentage": "75.38%", "elapsed_time": "2h 30m 47s", "remaining_time": "49m 16s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.004047} -{"loss": 0.74713373, "grad_norm": 1.50303507, "learning_rate": 1.071e-05, "token_acc": 0.77267211, "epoch": 1.5106383, "global_step/max_steps": "604/800", "percentage": "75.50%", "elapsed_time": "2h 30m 56s", "remaining_time": "48m 59s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.994058} -{"loss": 0.68875098, "grad_norm": 1.42928922, "learning_rate": 1.06e-05, "token_acc": 0.78980356, "epoch": 1.51314143, "global_step/max_steps": "605/800", "percentage": "75.62%", "elapsed_time": "2h 31m 6s", "remaining_time": "48m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.985526} -{"loss": 0.80685866, "grad_norm": 4.25648642, "learning_rate": 1.05e-05, "token_acc": 0.75875697, "epoch": 1.51564456, "global_step/max_steps": "606/800", "percentage": "75.75%", "elapsed_time": "2h 31m 23s", "remaining_time": "48m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.988911} -{"loss": 0.83370388, "grad_norm": 1.57449639, "learning_rate": 1.04e-05, "token_acc": 0.74901196, "epoch": 1.51814768, "global_step/max_steps": "607/800", "percentage": "75.88%", "elapsed_time": "2h 31m 40s", "remaining_time": "48m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.991307} -{"loss": 0.78882462, "grad_norm": 1.49437749, "learning_rate": 1.031e-05, "token_acc": 0.76416539, "epoch": 1.52065081, "global_step/max_steps": "608/800", "percentage": "76.00%", "elapsed_time": "2h 31m 56s", "remaining_time": "47m 59s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.993219} -{"loss": 0.79904497, "grad_norm": 4.29537725, "learning_rate": 1.021e-05, "token_acc": 0.75506136, "epoch": 1.52315394, "global_step/max_steps": "609/800", "percentage": "76.12%", "elapsed_time": "2h 32m 13s", "remaining_time": "47m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.996529} -{"loss": 0.61052847, "grad_norm": 1.56961739, "learning_rate": 1.011e-05, "token_acc": 0.81931575, "epoch": 1.52565707, "global_step/max_steps": "610/800", "percentage": "76.25%", "elapsed_time": "2h 32m 26s", "remaining_time": "47m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.992864} -{"loss": 0.63081014, "grad_norm": 1.4100734, "learning_rate": 1.001e-05, "token_acc": 0.80209771, "epoch": 1.5281602, "global_step/max_steps": "611/800", "percentage": "76.38%", "elapsed_time": "2h 32m 47s", "remaining_time": "47m 16s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.003711} -{"loss": 0.75808889, "grad_norm": 1.63695443, "learning_rate": 9.91e-06, "token_acc": 0.77409694, "epoch": 1.53066333, "global_step/max_steps": "612/800", "percentage": "76.50%", "elapsed_time": "2h 33m 4s", "remaining_time": "47m 1s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.006509} -{"loss": 0.64969176, "grad_norm": 3.33483243, "learning_rate": 9.81e-06, "token_acc": 0.80473047, "epoch": 1.53316646, "global_step/max_steps": "613/800", "percentage": "76.62%", "elapsed_time": "2h 33m 15s", "remaining_time": "46m 45s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.999772} -{"loss": 0.83306158, "grad_norm": 1.20939469, "learning_rate": 9.72e-06, "token_acc": 0.75141387, "epoch": 1.53566959, "global_step/max_steps": "614/800", "percentage": "76.75%", "elapsed_time": "2h 33m 26s", "remaining_time": "46m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.992704} -{"loss": 0.73633587, "grad_norm": 2.57629919, "learning_rate": 9.62e-06, "token_acc": 0.77686732, "epoch": 1.53817272, "global_step/max_steps": "615/800", "percentage": "76.88%", "elapsed_time": "2h 33m 34s", "remaining_time": "46m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.982261} -{"loss": 0.72403842, "grad_norm": 3.40016675, "learning_rate": 9.52e-06, "token_acc": 0.77391718, "epoch": 1.54067584, "global_step/max_steps": "616/800", "percentage": "77.00%", "elapsed_time": "2h 33m 45s", "remaining_time": "45m 55s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.975482} -{"loss": 0.69502157, "grad_norm": 82.21798706, "learning_rate": 9.43e-06, "token_acc": 0.79007743, "epoch": 1.54317897, "global_step/max_steps": "617/800", "percentage": "77.12%", "elapsed_time": "2h 33m 58s", "remaining_time": "45m 40s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.973127} -{"loss": 0.79541564, "grad_norm": 1.18215299, "learning_rate": 9.33e-06, "token_acc": 0.76264093, "epoch": 1.5456821, "global_step/max_steps": "618/800", "percentage": "77.25%", "elapsed_time": "2h 34m 16s", "remaining_time": "45m 26s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.976974} -{"loss": 0.80895424, "grad_norm": 2.26670313, "learning_rate": 9.24e-06, "token_acc": 0.75746251, "epoch": 1.54818523, "global_step/max_steps": "619/800", "percentage": "77.38%", "elapsed_time": "2h 34m 29s", "remaining_time": "45m 10s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.974221} -{"loss": 0.77814221, "grad_norm": 1.99189341, "learning_rate": 9.14e-06, "token_acc": 0.76740406, "epoch": 1.55068836, "global_step/max_steps": "620/800", "percentage": "77.50%", "elapsed_time": "2h 34m 42s", "remaining_time": "44m 55s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.971403} -{"loss": 0.81202573, "grad_norm": 3.94210863, "learning_rate": 9.05e-06, "token_acc": 0.75604874, "epoch": 1.55319149, "global_step/max_steps": "621/800", "percentage": "77.62%", "elapsed_time": "2h 35m 12s", "remaining_time": "44m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.99492} -{"loss": 0.60778463, "grad_norm": 1.79375887, "learning_rate": 8.95e-06, "token_acc": 0.81569929, "epoch": 1.55569462, "global_step/max_steps": "622/800", "percentage": "77.75%", "elapsed_time": "2h 35m 20s", "remaining_time": "44m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.984194} -{"loss": 0.66487849, "grad_norm": 2.81722236, "learning_rate": 8.86e-06, "token_acc": 0.80419431, "epoch": 1.55819775, "global_step/max_steps": "623/800", "percentage": "77.88%", "elapsed_time": "2h 35m 28s", "remaining_time": "44m 10s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.973285} -{"loss": 0.80740142, "grad_norm": 3.84409118, "learning_rate": 8.76e-06, "token_acc": 0.76046865, "epoch": 1.56070088, "global_step/max_steps": "624/800", "percentage": "78.00%", "elapsed_time": "2h 35m 41s", "remaining_time": "43m 55s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.968855} -{"loss": 0.83058995, "grad_norm": 1.89539611, "learning_rate": 8.67e-06, "token_acc": 0.75042224, "epoch": 1.56320401, "global_step/max_steps": "625/800", "percentage": "78.12%", "elapsed_time": "2h 35m 58s", "remaining_time": "43m 40s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.972434} -{"loss": 0.79362822, "grad_norm": 4.06320381, "learning_rate": 8.58e-06, "token_acc": 0.76429726, "epoch": 1.56570713, "global_step/max_steps": "626/800", "percentage": "78.25%", "elapsed_time": "2h 36m 12s", "remaining_time": "43m 25s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.970555} -{"loss": 0.69975305, "grad_norm": 2.05197668, "learning_rate": 8.49e-06, "token_acc": 0.78909641, "epoch": 1.56821026, "global_step/max_steps": "627/800", "percentage": "78.38%", "elapsed_time": "2h 36m 25s", "remaining_time": "43m 9s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.967536} -{"loss": 0.63701963, "grad_norm": 1.7315135, "learning_rate": 8.39e-06, "token_acc": 0.80460171, "epoch": 1.57071339, "global_step/max_steps": "628/800", "percentage": "78.50%", "elapsed_time": "2h 36m 34s", "remaining_time": "42m 53s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.958687} -{"loss": 0.6652633, "grad_norm": 4.36606455, "learning_rate": 8.3e-06, "token_acc": 0.7946244, "epoch": 1.57321652, "global_step/max_steps": "629/800", "percentage": "78.62%", "elapsed_time": "2h 36m 45s", "remaining_time": "42m 37s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.952723} -{"loss": 0.79926014, "grad_norm": 4.51249027, "learning_rate": 8.21e-06, "token_acc": 0.7595476, "epoch": 1.57571965, "global_step/max_steps": "630/800", "percentage": "78.75%", "elapsed_time": "2h 36m 54s", "remaining_time": "42m 20s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.943468} -{"loss": 0.85008776, "grad_norm": 1.71548653, "learning_rate": 8.12e-06, "token_acc": 0.74616557, "epoch": 1.57822278, "global_step/max_steps": "631/800", "percentage": "78.88%", "elapsed_time": "2h 37m 20s", "remaining_time": "42m 8s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.959819} -{"loss": 0.62131381, "grad_norm": 6.62236595, "learning_rate": 8.03e-06, "token_acc": 0.81899776, "epoch": 1.58072591, "global_step/max_steps": "632/800", "percentage": "79.00%", "elapsed_time": "2h 37m 30s", "remaining_time": "41m 52s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.95289} -{"loss": 0.59843493, "grad_norm": 2.63467836, "learning_rate": 7.94e-06, "token_acc": 0.81741485, "epoch": 1.58322904, "global_step/max_steps": "633/800", "percentage": "79.12%", "elapsed_time": "2h 37m 43s", "remaining_time": "41m 37s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.949804} -{"loss": 0.6845876, "grad_norm": 3.43933368, "learning_rate": 7.85e-06, "token_acc": 0.79130897, "epoch": 1.58573217, "global_step/max_steps": "634/800", "percentage": "79.25%", "elapsed_time": "2h 37m 52s", "remaining_time": "41m 20s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.939478} -{"loss": 0.68827009, "grad_norm": 1.6064105, "learning_rate": 7.76e-06, "token_acc": 0.79034029, "epoch": 1.58823529, "global_step/max_steps": "635/800", "percentage": "79.38%", "elapsed_time": "2h 38m 2s", "remaining_time": "41m 4s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.931912} -{"loss": 0.75877082, "grad_norm": 5.20389509, "learning_rate": 7.67e-06, "token_acc": 0.77225101, "epoch": 1.59073842, "global_step/max_steps": "636/800", "percentage": "79.50%", "elapsed_time": "2h 38m 18s", "remaining_time": "40m 49s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.933961} -{"loss": 0.81705415, "grad_norm": 1.94897223, "learning_rate": 7.58e-06, "token_acc": 0.75448191, "epoch": 1.59324155, "global_step/max_steps": "637/800", "percentage": "79.62%", "elapsed_time": "2h 38m 41s", "remaining_time": "40m 36s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.946555} -{"loss": 0.58990073, "grad_norm": 4.16902494, "learning_rate": 7.5e-06, "token_acc": 0.82848049, "epoch": 1.59574468, "global_step/max_steps": "638/800", "percentage": "79.75%", "elapsed_time": "2h 38m 49s", "remaining_time": "40m 20s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.936512} -{"loss": 0.9341172, "grad_norm": 0.95995283, "learning_rate": 7.41e-06, "token_acc": 0.72722698, "epoch": 1.59824781, "global_step/max_steps": "639/800", "percentage": "79.88%", "elapsed_time": "2h 39m 12s", "remaining_time": "40m 7s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.948533} -{"loss": 0.72378051, "grad_norm": 1.68629086, "learning_rate": 7.32e-06, "token_acc": 0.77987266, "epoch": 1.60075094, "global_step/max_steps": "640/800", "percentage": "80.00%", "elapsed_time": "2h 39m 27s", "remaining_time": "39m 52s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.949092} -{"loss": 0.79821712, "grad_norm": 9.25971127, "learning_rate": 7.24e-06, "token_acc": 0.76139554, "epoch": 1.60325407, "global_step/max_steps": "641/800", "percentage": "80.12%", "elapsed_time": "2h 39m 53s", "remaining_time": "39m 40s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.965751} -{"loss": 0.81565291, "grad_norm": 2.00824666, "learning_rate": 7.15e-06, "token_acc": 0.75518937, "epoch": 1.6057572, "global_step/max_steps": "642/800", "percentage": "80.25%", "elapsed_time": "2h 40m 15s", "remaining_time": "39m 26s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.975861} -{"loss": 0.9388907, "grad_norm": 5.8708086, "learning_rate": 7.06e-06, "token_acc": 0.72298, "epoch": 1.60826033, "global_step/max_steps": "643/800", "percentage": "80.38%", "elapsed_time": "2h 40m 38s", "remaining_time": "39m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.988565} -{"loss": 0.86932313, "grad_norm": 1.31900787, "learning_rate": 6.98e-06, "token_acc": 0.73923199, "epoch": 1.61076345, "global_step/max_steps": "644/800", "percentage": "80.50%", "elapsed_time": "2h 41m 13s", "remaining_time": "39m 3s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.01988} -{"loss": 0.76464117, "grad_norm": 4.07848358, "learning_rate": 6.89e-06, "token_acc": 0.76932582, "epoch": 1.61326658, "global_step/max_steps": "645/800", "percentage": "80.62%", "elapsed_time": "2h 41m 25s", "remaining_time": "38m 47s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.015767} -{"loss": 0.71064818, "grad_norm": 2.5179286, "learning_rate": 6.81e-06, "token_acc": 0.78916173, "epoch": 1.61576971, "global_step/max_steps": "646/800", "percentage": "80.75%", "elapsed_time": "2h 41m 36s", "remaining_time": "38m 31s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.009431} -{"loss": 0.87678695, "grad_norm": 5.1333437, "learning_rate": 6.73e-06, "token_acc": 0.74003112, "epoch": 1.61827284, "global_step/max_steps": "647/800", "percentage": "80.88%", "elapsed_time": "2h 41m 57s", "remaining_time": "38m 18s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.018435} -{"loss": 0.76233459, "grad_norm": 8.59186935, "learning_rate": 6.64e-06, "token_acc": 0.77188075, "epoch": 1.62077597, "global_step/max_steps": "648/800", "percentage": "81.00%", "elapsed_time": "2h 42m 8s", "remaining_time": "38m 2s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.013003} -{"loss": 0.59686804, "grad_norm": 2.76045728, "learning_rate": 6.56e-06, "token_acc": 0.81684734, "epoch": 1.6232791, "global_step/max_steps": "649/800", "percentage": "81.12%", "elapsed_time": "2h 42m 16s", "remaining_time": "37m 45s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.001571} -{"loss": 0.80663592, "grad_norm": 2.04588747, "learning_rate": 6.48e-06, "token_acc": 0.76150606, "epoch": 1.62578223, "global_step/max_steps": "650/800", "percentage": "81.25%", "elapsed_time": "2h 42m 32s", "remaining_time": "37m 31s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.003402} -{"loss": 0.8087641, "grad_norm": 4.87338924, "learning_rate": 6.39e-06, "token_acc": 0.75714035, "epoch": 1.62828536, "global_step/max_steps": "651/800", "percentage": "81.38%", "elapsed_time": "2h 42m 54s", "remaining_time": "37m 17s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.013735} -{"loss": 0.61875039, "grad_norm": 4.34395647, "learning_rate": 6.31e-06, "token_acc": 0.80839717, "epoch": 1.63078849, "global_step/max_steps": "652/800", "percentage": "81.50%", "elapsed_time": "2h 43m 5s", "remaining_time": "37m 1s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.007627} -{"loss": 0.71724409, "grad_norm": 1.90186882, "learning_rate": 6.23e-06, "token_acc": 0.78524637, "epoch": 1.63329161, "global_step/max_steps": "653/800", "percentage": "81.62%", "elapsed_time": "2h 43m 17s", "remaining_time": "36m 46s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.003736} -{"loss": 0.84693646, "grad_norm": 2.83297729, "learning_rate": 6.15e-06, "token_acc": 0.7480814, "epoch": 1.63579474, "global_step/max_steps": "654/800", "percentage": "81.75%", "elapsed_time": "2h 43m 30s", "remaining_time": "36m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.9998} -{"loss": 0.83576244, "grad_norm": 3.0632863, "learning_rate": 6.07e-06, "token_acc": 0.75055146, "epoch": 1.63829787, "global_step/max_steps": "655/800", "percentage": "81.88%", "elapsed_time": "2h 43m 42s", "remaining_time": "36m 14s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.996079} -{"loss": 0.77016962, "grad_norm": 1.97794342, "learning_rate": 5.99e-06, "token_acc": 0.77063325, "epoch": 1.640801, "global_step/max_steps": "656/800", "percentage": "82.00%", "elapsed_time": "2h 43m 55s", "remaining_time": "35m 59s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.991967} -{"loss": 0.88762087, "grad_norm": 1.57714999, "learning_rate": 5.91e-06, "token_acc": 0.7388785, "epoch": 1.64330413, "global_step/max_steps": "657/800", "percentage": "82.12%", "elapsed_time": "2h 44m 17s", "remaining_time": "35m 45s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.00312} -{"loss": 0.60201526, "grad_norm": 3.87048149, "learning_rate": 5.83e-06, "token_acc": 0.81676061, "epoch": 1.64580726, "global_step/max_steps": "658/800", "percentage": "82.25%", "elapsed_time": "2h 44m 26s", "remaining_time": "35m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.993978} -{"loss": 0.79765677, "grad_norm": 12.50641155, "learning_rate": 5.75e-06, "token_acc": 0.76330128, "epoch": 1.64831039, "global_step/max_steps": "659/800", "percentage": "82.38%", "elapsed_time": "2h 44m 36s", "remaining_time": "35m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.98638} -{"loss": 0.76823878, "grad_norm": 1.71827376, "learning_rate": 5.67e-06, "token_acc": 0.77150179, "epoch": 1.65081352, "global_step/max_steps": "660/800", "percentage": "82.50%", "elapsed_time": "2h 44m 51s", "remaining_time": "34m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.986066} -{"loss": 0.72160608, "grad_norm": 7.00136709, "learning_rate": 5.6e-06, "token_acc": 0.78495219, "epoch": 1.65331665, "global_step/max_steps": "661/800", "percentage": "82.62%", "elapsed_time": "2h 45m 12s", "remaining_time": "34m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.995531} -{"loss": 0.71598482, "grad_norm": 1.81736434, "learning_rate": 5.52e-06, "token_acc": 0.78937947, "epoch": 1.65581977, "global_step/max_steps": "662/800", "percentage": "82.75%", "elapsed_time": "2h 45m 31s", "remaining_time": "34m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 15.002053} -{"loss": 0.59175462, "grad_norm": 8.28274822, "learning_rate": 5.44e-06, "token_acc": 0.81889212, "epoch": 1.6583229, "global_step/max_steps": "663/800", "percentage": "82.88%", "elapsed_time": "2h 45m 41s", "remaining_time": "34m 14s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.993514} -{"loss": 0.63656032, "grad_norm": 2.09935069, "learning_rate": 5.37e-06, "token_acc": 0.80629311, "epoch": 1.66082603, "global_step/max_steps": "664/800", "percentage": "83.00%", "elapsed_time": "2h 45m 49s", "remaining_time": "33m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.983881} -{"loss": 0.68607295, "grad_norm": 4.31783485, "learning_rate": 5.29e-06, "token_acc": 0.7957958, "epoch": 1.66332916, "global_step/max_steps": "665/800", "percentage": "83.12%", "elapsed_time": "2h 46m 5s", "remaining_time": "33m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.985546} -{"loss": 0.67791015, "grad_norm": 5.11480713, "learning_rate": 5.22e-06, "token_acc": 0.79677493, "epoch": 1.66583229, "global_step/max_steps": "666/800", "percentage": "83.25%", "elapsed_time": "2h 46m 17s", "remaining_time": "33m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.980199} -{"loss": 0.84785092, "grad_norm": 1.58951235, "learning_rate": 5.14e-06, "token_acc": 0.74796529, "epoch": 1.66833542, "global_step/max_steps": "667/800", "percentage": "83.38%", "elapsed_time": "2h 46m 28s", "remaining_time": "33m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.974249} -{"loss": 0.80400217, "grad_norm": 3.47911382, "learning_rate": 5.07e-06, "token_acc": 0.75784969, "epoch": 1.67083855, "global_step/max_steps": "668/800", "percentage": "83.50%", "elapsed_time": "2h 46m 46s", "remaining_time": "32m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.979272} -{"loss": 0.79907703, "grad_norm": 1.46346307, "learning_rate": 4.99e-06, "token_acc": 0.76072607, "epoch": 1.67334168, "global_step/max_steps": "669/800", "percentage": "83.62%", "elapsed_time": "2h 47m 1s", "remaining_time": "32m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.978384} -{"loss": 0.71745515, "grad_norm": 6.28387451, "learning_rate": 4.92e-06, "token_acc": 0.77945508, "epoch": 1.67584481, "global_step/max_steps": "670/800", "percentage": "83.75%", "elapsed_time": "2h 47m 13s", "remaining_time": "32m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.974296} -{"loss": 0.81771696, "grad_norm": 3.85180545, "learning_rate": 4.85e-06, "token_acc": 0.74558854, "epoch": 1.67834793, "global_step/max_steps": "671/800", "percentage": "83.88%", "elapsed_time": "2h 47m 37s", "remaining_time": "32m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.987477} -{"loss": 0.77657104, "grad_norm": 3.14586091, "learning_rate": 4.77e-06, "token_acc": 0.76674615, "epoch": 1.68085106, "global_step/max_steps": "672/800", "percentage": "84.00%", "elapsed_time": "2h 47m 49s", "remaining_time": "31m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.984127} -{"loss": 0.68701279, "grad_norm": 1.78289557, "learning_rate": 4.7e-06, "token_acc": 0.78327737, "epoch": 1.68335419, "global_step/max_steps": "673/800", "percentage": "84.12%", "elapsed_time": "2h 48m 5s", "remaining_time": "31m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.985606} -{"loss": 0.75516093, "grad_norm": 2.87062645, "learning_rate": 4.63e-06, "token_acc": 0.76900915, "epoch": 1.68585732, "global_step/max_steps": "674/800", "percentage": "84.25%", "elapsed_time": "2h 48m 16s", "remaining_time": "31m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.979407} -{"loss": 0.73693866, "grad_norm": 2.43797207, "learning_rate": 4.56e-06, "token_acc": 0.77739496, "epoch": 1.68836045, "global_step/max_steps": "675/800", "percentage": "84.38%", "elapsed_time": "2h 48m 25s", "remaining_time": "31m 11s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.97074} -{"loss": 0.85607398, "grad_norm": 1.68866038, "learning_rate": 4.49e-06, "token_acc": 0.74307762, "epoch": 1.69086358, "global_step/max_steps": "676/800", "percentage": "84.50%", "elapsed_time": "2h 48m 43s", "remaining_time": "30m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.974476} -{"loss": 0.78126538, "grad_norm": 21.07199478, "learning_rate": 4.42e-06, "token_acc": 0.76651118, "epoch": 1.69336671, "global_step/max_steps": "677/800", "percentage": "84.62%", "elapsed_time": "2h 48m 57s", "remaining_time": "30m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.97298} -{"loss": 0.76121342, "grad_norm": 1.22427559, "learning_rate": 4.35e-06, "token_acc": 0.77218514, "epoch": 1.69586984, "global_step/max_steps": "678/800", "percentage": "84.75%", "elapsed_time": "2h 49m 10s", "remaining_time": "30m 26s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.969979} -{"loss": 0.84630185, "grad_norm": 0.83549827, "learning_rate": 4.28e-06, "token_acc": 0.74833339, "epoch": 1.69837297, "global_step/max_steps": "679/800", "percentage": "84.88%", "elapsed_time": "2h 49m 31s", "remaining_time": "30m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.978882} -{"loss": 0.7081666, "grad_norm": 2.0632844, "learning_rate": 4.21e-06, "token_acc": 0.78866475, "epoch": 1.7008761, "global_step/max_steps": "680/800", "percentage": "85.00%", "elapsed_time": "2h 49m 41s", "remaining_time": "29m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.97173} -{"loss": 0.72107196, "grad_norm": 3.28567958, "learning_rate": 4.15e-06, "token_acc": 0.78629921, "epoch": 1.70337922, "global_step/max_steps": "681/800", "percentage": "85.12%", "elapsed_time": "2h 49m 60s", "remaining_time": "29m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.977788} -{"loss": 0.7026037, "grad_norm": 2.6521492, "learning_rate": 4.08e-06, "token_acc": 0.78692187, "epoch": 1.70588235, "global_step/max_steps": "682/800", "percentage": "85.25%", "elapsed_time": "2h 50m 13s", "remaining_time": "29m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.975722} -{"loss": 0.66839957, "grad_norm": 4.50243711, "learning_rate": 4.01e-06, "token_acc": 0.8000766, "epoch": 1.70838548, "global_step/max_steps": "683/800", "percentage": "85.38%", "elapsed_time": "2h 50m 22s", "remaining_time": "29m 11s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.967046} -{"loss": 0.84010047, "grad_norm": 1.66012049, "learning_rate": 3.94e-06, "token_acc": 0.75232361, "epoch": 1.71088861, "global_step/max_steps": "684/800", "percentage": "85.50%", "elapsed_time": "2h 50m 40s", "remaining_time": "28m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.97091} -{"loss": 0.60218275, "grad_norm": 2.28305507, "learning_rate": 3.88e-06, "token_acc": 0.81686396, "epoch": 1.71339174, "global_step/max_steps": "685/800", "percentage": "85.62%", "elapsed_time": "2h 50m 50s", "remaining_time": "28m 41s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.964171} -{"loss": 0.88279974, "grad_norm": 4.25630045, "learning_rate": 3.81e-06, "token_acc": 0.73790342, "epoch": 1.71589487, "global_step/max_steps": "686/800", "percentage": "85.75%", "elapsed_time": "2h 51m 12s", "remaining_time": "28m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.973396} -{"loss": 0.82961607, "grad_norm": 2.74160719, "learning_rate": 3.75e-06, "token_acc": 0.75158242, "epoch": 1.718398, "global_step/max_steps": "687/800", "percentage": "85.88%", "elapsed_time": "2h 51m 31s", "remaining_time": "28m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.980348} -{"loss": 0.69639033, "grad_norm": 2.79224634, "learning_rate": 3.68e-06, "token_acc": 0.78739906, "epoch": 1.72090113, "global_step/max_steps": "688/800", "percentage": "86.00%", "elapsed_time": "2h 51m 41s", "remaining_time": "27m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.972747} -{"loss": 0.68875819, "grad_norm": 3.10421467, "learning_rate": 3.62e-06, "token_acc": 0.78974288, "epoch": 1.72340426, "global_step/max_steps": "689/800", "percentage": "86.12%", "elapsed_time": "2h 51m 52s", "remaining_time": "27m 41s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.967157} -{"loss": 0.73760116, "grad_norm": 1.74223781, "learning_rate": 3.56e-06, "token_acc": 0.77911231, "epoch": 1.72590738, "global_step/max_steps": "690/800", "percentage": "86.25%", "elapsed_time": "2h 52m 3s", "remaining_time": "27m 26s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.961126} -{"loss": 0.67792857, "grad_norm": 4.05608702, "learning_rate": 3.49e-06, "token_acc": 0.79569784, "epoch": 1.72841051, "global_step/max_steps": "691/800", "percentage": "86.38%", "elapsed_time": "2h 52m 24s", "remaining_time": "27m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.968892} -{"loss": 0.60797012, "grad_norm": 2.11906075, "learning_rate": 3.43e-06, "token_acc": 0.81373471, "epoch": 1.73091364, "global_step/max_steps": "692/800", "percentage": "86.50%", "elapsed_time": "2h 52m 38s", "remaining_time": "26m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.967996} -{"loss": 0.69021517, "grad_norm": 3.56275964, "learning_rate": 3.37e-06, "token_acc": 0.79174071, "epoch": 1.73341677, "global_step/max_steps": "693/800", "percentage": "86.62%", "elapsed_time": "2h 52m 51s", "remaining_time": "26m 41s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.964685} -{"loss": 0.77589381, "grad_norm": 1.49847376, "learning_rate": 3.31e-06, "token_acc": 0.76214911, "epoch": 1.7359199, "global_step/max_steps": "694/800", "percentage": "86.75%", "elapsed_time": "2h 53m 2s", "remaining_time": "26m 26s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.959609} -{"loss": 0.77105349, "grad_norm": 1.52747846, "learning_rate": 3.25e-06, "token_acc": 0.77035614, "epoch": 1.73842303, "global_step/max_steps": "695/800", "percentage": "86.88%", "elapsed_time": "2h 53m 12s", "remaining_time": "26m 10s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.952739} -{"loss": 0.79283911, "grad_norm": 2.88265181, "learning_rate": 3.19e-06, "token_acc": 0.76066364, "epoch": 1.74092616, "global_step/max_steps": "696/800", "percentage": "87.00%", "elapsed_time": "2h 53m 30s", "remaining_time": "25m 55s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.956444} -{"loss": 0.69738853, "grad_norm": 2.25296593, "learning_rate": 3.13e-06, "token_acc": 0.78956939, "epoch": 1.74342929, "global_step/max_steps": "697/800", "percentage": "87.12%", "elapsed_time": "2h 53m 40s", "remaining_time": "25m 40s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.950141} -{"loss": 0.74325907, "grad_norm": 2.24480581, "learning_rate": 3.07e-06, "token_acc": 0.77731906, "epoch": 1.74593242, "global_step/max_steps": "698/800", "percentage": "87.25%", "elapsed_time": "2h 53m 52s", "remaining_time": "25m 24s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.945402} -{"loss": 0.80254984, "grad_norm": 1.88075149, "learning_rate": 3.01e-06, "token_acc": 0.76388344, "epoch": 1.74843554, "global_step/max_steps": "699/800", "percentage": "87.38%", "elapsed_time": "2h 54m 6s", "remaining_time": "25m 9s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.943564} -{"loss": 0.89380598, "grad_norm": 1.15330625, "learning_rate": 2.95e-06, "token_acc": 0.73852007, "epoch": 1.75093867, "global_step/max_steps": "700/800", "percentage": "87.50%", "elapsed_time": "2h 54m 26s", "remaining_time": "24m 55s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.951286} -{"loss": 0.82765067, "grad_norm": 2.23804307, "learning_rate": 2.89e-06, "token_acc": 0.75318957, "epoch": 1.7534418, "global_step/max_steps": "701/800", "percentage": "87.62%", "elapsed_time": "2h 54m 55s", "remaining_time": "24m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.971266} -{"loss": 0.82788676, "grad_norm": 1.69300556, "learning_rate": 2.84e-06, "token_acc": 0.75347863, "epoch": 1.75594493, "global_step/max_steps": "702/800", "percentage": "87.75%", "elapsed_time": "2h 55m 11s", "remaining_time": "24m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.972289} -{"loss": 0.67834485, "grad_norm": 3.54376006, "learning_rate": 2.78e-06, "token_acc": 0.79247245, "epoch": 1.75844806, "global_step/max_steps": "703/800", "percentage": "87.88%", "elapsed_time": "2h 55m 26s", "remaining_time": "24m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.9733} -{"loss": 0.81612313, "grad_norm": 1.70422018, "learning_rate": 2.72e-06, "token_acc": 0.76257534, "epoch": 1.76095119, "global_step/max_steps": "704/800", "percentage": "88.00%", "elapsed_time": "2h 55m 41s", "remaining_time": "23m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.973577} -{"loss": 0.76842093, "grad_norm": 1.62080026, "learning_rate": 2.67e-06, "token_acc": 0.77421773, "epoch": 1.76345432, "global_step/max_steps": "705/800", "percentage": "88.12%", "elapsed_time": "2h 55m 53s", "remaining_time": "23m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.968297} -{"loss": 0.7348212, "grad_norm": 1.72851717, "learning_rate": 2.61e-06, "token_acc": 0.78082624, "epoch": 1.76595745, "global_step/max_steps": "706/800", "percentage": "88.25%", "elapsed_time": "2h 56m 3s", "remaining_time": "23m 26s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.962361} -{"loss": 0.73146516, "grad_norm": 1.43336904, "learning_rate": 2.56e-06, "token_acc": 0.77969408, "epoch": 1.76846058, "global_step/max_steps": "707/800", "percentage": "88.38%", "elapsed_time": "2h 56m 16s", "remaining_time": "23m 11s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.959669} -{"loss": 0.87954164, "grad_norm": 1.79180551, "learning_rate": 2.51e-06, "token_acc": 0.73782405, "epoch": 1.7709637, "global_step/max_steps": "708/800", "percentage": "88.50%", "elapsed_time": "2h 56m 40s", "remaining_time": "22m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.972408} -{"loss": 0.89443278, "grad_norm": 2.11577773, "learning_rate": 2.45e-06, "token_acc": 0.73417437, "epoch": 1.77346683, "global_step/max_steps": "709/800", "percentage": "88.62%", "elapsed_time": "2h 56m 57s", "remaining_time": "22m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.974876} -{"loss": 0.71720582, "grad_norm": 1.04267871, "learning_rate": 2.4e-06, "token_acc": 0.78507746, "epoch": 1.77596996, "global_step/max_steps": "710/800", "percentage": "88.75%", "elapsed_time": "2h 57m 10s", "remaining_time": "22m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.971715} -{"loss": 0.73888338, "grad_norm": 2.7296772, "learning_rate": 2.35e-06, "token_acc": 0.77482162, "epoch": 1.77847309, "global_step/max_steps": "711/800", "percentage": "88.88%", "elapsed_time": "2h 57m 37s", "remaining_time": "22m 14s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.988807} -{"loss": 0.88609493, "grad_norm": 1.8060981, "learning_rate": 2.3e-06, "token_acc": 0.74369837, "epoch": 1.78097622, "global_step/max_steps": "712/800", "percentage": "89.00%", "elapsed_time": "2h 57m 52s", "remaining_time": "21m 59s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.98913} -{"loss": 0.72353047, "grad_norm": 1.45541763, "learning_rate": 2.25e-06, "token_acc": 0.78119439, "epoch": 1.78347935, "global_step/max_steps": "713/800", "percentage": "89.12%", "elapsed_time": "2h 58m 9s", "remaining_time": "21m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.991667} -{"loss": 0.77859682, "grad_norm": 2.33680582, "learning_rate": 2.19e-06, "token_acc": 0.76343284, "epoch": 1.78598248, "global_step/max_steps": "714/800", "percentage": "89.25%", "elapsed_time": "2h 58m 18s", "remaining_time": "21m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.98372} -{"loss": 0.74835539, "grad_norm": 3.84459662, "learning_rate": 2.14e-06, "token_acc": 0.77752101, "epoch": 1.78848561, "global_step/max_steps": "715/800", "percentage": "89.38%", "elapsed_time": "2h 58m 28s", "remaining_time": "21m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.97607} -{"loss": 0.71632028, "grad_norm": 2.35856199, "learning_rate": 2.1e-06, "token_acc": 0.78169829, "epoch": 1.79098874, "global_step/max_steps": "716/800", "percentage": "89.50%", "elapsed_time": "2h 58m 46s", "remaining_time": "20m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.980688} -{"loss": 0.85762304, "grad_norm": 1.59581113, "learning_rate": 2.05e-06, "token_acc": 0.74636618, "epoch": 1.79349186, "global_step/max_steps": "717/800", "percentage": "89.62%", "elapsed_time": "2h 58m 55s", "remaining_time": "20m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.97224} -{"loss": 0.7772994, "grad_norm": 1.75876176, "learning_rate": 2e-06, "token_acc": 0.76292864, "epoch": 1.79599499, "global_step/max_steps": "718/800", "percentage": "89.75%", "elapsed_time": "2h 59m 5s", "remaining_time": "20m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.965427} -{"loss": 0.75274754, "grad_norm": 1.49312723, "learning_rate": 1.95e-06, "token_acc": 0.77216529, "epoch": 1.79849812, "global_step/max_steps": "719/800", "percentage": "89.88%", "elapsed_time": "2h 59m 17s", "remaining_time": "20m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.961522} -{"loss": 0.60392451, "grad_norm": 1.53171575, "learning_rate": 1.9e-06, "token_acc": 0.81606591, "epoch": 1.80100125, "global_step/max_steps": "720/800", "percentage": "90.00%", "elapsed_time": "2h 59m 27s", "remaining_time": "19m 56s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.953913} -{"loss": 0.61808431, "grad_norm": 2.85683227, "learning_rate": 1.86e-06, "token_acc": 0.81088738, "epoch": 1.80350438, "global_step/max_steps": "721/800", "percentage": "90.12%", "elapsed_time": "2h 59m 45s", "remaining_time": "19m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.959081} -{"loss": 0.87371725, "grad_norm": 1.11323464, "learning_rate": 1.81e-06, "token_acc": 0.73984316, "epoch": 1.80600751, "global_step/max_steps": "722/800", "percentage": "90.25%", "elapsed_time": "3h 0m 1s", "remaining_time": "19m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.960442} -{"loss": 0.82540083, "grad_norm": 6.13257551, "learning_rate": 1.76e-06, "token_acc": 0.75140758, "epoch": 1.80851064, "global_step/max_steps": "723/800", "percentage": "90.38%", "elapsed_time": "3h 0m 25s", "remaining_time": "19m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.972764} -{"loss": 0.7338379, "grad_norm": 2.00321102, "learning_rate": 1.72e-06, "token_acc": 0.7794028, "epoch": 1.81101377, "global_step/max_steps": "724/800", "percentage": "90.50%", "elapsed_time": "3h 0m 39s", "remaining_time": "18m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.970501} -{"loss": 0.74387938, "grad_norm": 6.01433039, "learning_rate": 1.68e-06, "token_acc": 0.77699189, "epoch": 1.8135169, "global_step/max_steps": "725/800", "percentage": "90.62%", "elapsed_time": "3h 0m 53s", "remaining_time": "18m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.969578} -{"loss": 0.74993932, "grad_norm": 2.49967885, "learning_rate": 1.63e-06, "token_acc": 0.7755048, "epoch": 1.81602003, "global_step/max_steps": "726/800", "percentage": "90.75%", "elapsed_time": "3h 1m 5s", "remaining_time": "18m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.965497} -{"loss": 0.78369695, "grad_norm": 1.45280778, "learning_rate": 1.59e-06, "token_acc": 0.76966455, "epoch": 1.81852315, "global_step/max_steps": "727/800", "percentage": "90.88%", "elapsed_time": "3h 1m 20s", "remaining_time": "18m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.964999} -{"loss": 0.71966749, "grad_norm": 22.46209526, "learning_rate": 1.55e-06, "token_acc": 0.7898251, "epoch": 1.82102628, "global_step/max_steps": "728/800", "percentage": "91.00%", "elapsed_time": "3h 1m 30s", "remaining_time": "17m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.958386} -{"loss": 0.79168046, "grad_norm": 3.00760174, "learning_rate": 1.5e-06, "token_acc": 0.75766464, "epoch": 1.82352941, "global_step/max_steps": "729/800", "percentage": "91.12%", "elapsed_time": "3h 1m 40s", "remaining_time": "17m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.951628} -{"loss": 0.7311182, "grad_norm": 2.64432526, "learning_rate": 1.46e-06, "token_acc": 0.786081, "epoch": 1.82603254, "global_step/max_steps": "730/800", "percentage": "91.25%", "elapsed_time": "3h 1m 52s", "remaining_time": "17m 26s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.947467} -{"loss": 0.77400923, "grad_norm": 1.20656836, "learning_rate": 1.42e-06, "token_acc": 0.7687375, "epoch": 1.82853567, "global_step/max_steps": "731/800", "percentage": "91.38%", "elapsed_time": "3h 2m 16s", "remaining_time": "17m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.960051} -{"loss": 0.71897972, "grad_norm": 1.16059935, "learning_rate": 1.38e-06, "token_acc": 0.779404, "epoch": 1.8310388, "global_step/max_steps": "732/800", "percentage": "91.50%", "elapsed_time": "3h 2m 26s", "remaining_time": "16m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.952981} -{"loss": 0.74246001, "grad_norm": 1.93261087, "learning_rate": 1.34e-06, "token_acc": 0.78256718, "epoch": 1.83354193, "global_step/max_steps": "733/800", "percentage": "91.62%", "elapsed_time": "3h 2m 38s", "remaining_time": "16m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.949684} -{"loss": 0.82376862, "grad_norm": 2.95864654, "learning_rate": 1.3e-06, "token_acc": 0.75477759, "epoch": 1.83604506, "global_step/max_steps": "734/800", "percentage": "91.75%", "elapsed_time": "3h 2m 52s", "remaining_time": "16m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.948605} -{"loss": 0.88610911, "grad_norm": 1.70052302, "learning_rate": 1.26e-06, "token_acc": 0.73747625, "epoch": 1.83854819, "global_step/max_steps": "735/800", "percentage": "91.88%", "elapsed_time": "3h 3m 9s", "remaining_time": "16m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.950417} -{"loss": 0.81301689, "grad_norm": 1.63396394, "learning_rate": 1.22e-06, "token_acc": 0.7547261, "epoch": 1.84105131, "global_step/max_steps": "736/800", "percentage": "92.00%", "elapsed_time": "3h 3m 23s", "remaining_time": "15m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.949288} -{"loss": 0.62664604, "grad_norm": 3.21984386, "learning_rate": 1.19e-06, "token_acc": 0.81122914, "epoch": 1.84355444, "global_step/max_steps": "737/800", "percentage": "92.12%", "elapsed_time": "3h 3m 36s", "remaining_time": "15m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.946622} -{"loss": 0.69004911, "grad_norm": 2.21126556, "learning_rate": 1.15e-06, "token_acc": 0.79427508, "epoch": 1.84605757, "global_step/max_steps": "738/800", "percentage": "92.25%", "elapsed_time": "3h 3m 49s", "remaining_time": "15m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.943801} -{"loss": 0.72548306, "grad_norm": 6.10129356, "learning_rate": 1.11e-06, "token_acc": 0.77870652, "epoch": 1.8485607, "global_step/max_steps": "739/800", "percentage": "92.38%", "elapsed_time": "3h 3m 57s", "remaining_time": "15m 11s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.935253} -{"loss": 0.73820865, "grad_norm": 2.39052939, "learning_rate": 1.08e-06, "token_acc": 0.77838189, "epoch": 1.85106383, "global_step/max_steps": "740/800", "percentage": "92.50%", "elapsed_time": "3h 4m 12s", "remaining_time": "14m 56s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.935465} -{"loss": 0.81190264, "grad_norm": 1.81132233, "learning_rate": 1.04e-06, "token_acc": 0.75961695, "epoch": 1.85356696, "global_step/max_steps": "741/800", "percentage": "92.62%", "elapsed_time": "3h 4m 41s", "remaining_time": "14m 42s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.9545} -{"loss": 0.71426004, "grad_norm": 4.40738869, "learning_rate": 1.01e-06, "token_acc": 0.78529457, "epoch": 1.85607009, "global_step/max_steps": "742/800", "percentage": "92.75%", "elapsed_time": "3h 4m 51s", "remaining_time": "14m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.946773} -{"loss": 0.80472362, "grad_norm": 1.16430998, "learning_rate": 9.7e-07, "token_acc": 0.76004859, "epoch": 1.85857322, "global_step/max_steps": "743/800", "percentage": "92.88%", "elapsed_time": "3h 5m 8s", "remaining_time": "14m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.95044} -{"loss": 0.69371128, "grad_norm": 2.41602874, "learning_rate": 9.4e-07, "token_acc": 0.78780593, "epoch": 1.86107635, "global_step/max_steps": "744/800", "percentage": "93.00%", "elapsed_time": "3h 5m 24s", "remaining_time": "13m 57s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.951683} -{"loss": 0.87680399, "grad_norm": 1.31518447, "learning_rate": 9.1e-07, "token_acc": 0.74011971, "epoch": 1.86357947, "global_step/max_steps": "745/800", "percentage": "93.12%", "elapsed_time": "3h 5m 44s", "remaining_time": "13m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.95786} -{"loss": 0.75807273, "grad_norm": 2.92705011, "learning_rate": 8.7e-07, "token_acc": 0.77373672, "epoch": 1.8660826, "global_step/max_steps": "746/800", "percentage": "93.25%", "elapsed_time": "3h 5m 54s", "remaining_time": "13m 27s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.952148} -{"loss": 0.71816993, "grad_norm": 1.63725317, "learning_rate": 8.4e-07, "token_acc": 0.7797484, "epoch": 1.86858573, "global_step/max_steps": "747/800", "percentage": "93.38%", "elapsed_time": "3h 6m 8s", "remaining_time": "13m 12s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.950873} -{"loss": 0.89218843, "grad_norm": 1.4564203, "learning_rate": 8.1e-07, "token_acc": 0.73778179, "epoch": 1.87108886, "global_step/max_steps": "748/800", "percentage": "93.50%", "elapsed_time": "3h 6m 25s", "remaining_time": "12m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.953426} -{"loss": 0.81036425, "grad_norm": 4.11130524, "learning_rate": 7.8e-07, "token_acc": 0.75641193, "epoch": 1.87359199, "global_step/max_steps": "749/800", "percentage": "93.62%", "elapsed_time": "3h 6m 43s", "remaining_time": "12m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.957672} -{"loss": 0.73864579, "grad_norm": 2.84118366, "learning_rate": 7.5e-07, "token_acc": 0.78201951, "epoch": 1.87609512, "global_step/max_steps": "750/800", "percentage": "93.75%", "elapsed_time": "3h 6m 56s", "remaining_time": "12m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.954271} -{"loss": 0.78145868, "grad_norm": 2.01871085, "learning_rate": 7.2e-07, "token_acc": 0.76527689, "epoch": 1.87859825, "global_step/max_steps": "751/800", "percentage": "93.88%", "elapsed_time": "3h 7m 23s", "remaining_time": "12m 14s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.970255} -{"loss": 0.64608061, "grad_norm": 3.56179833, "learning_rate": 6.9e-07, "token_acc": 0.80371204, "epoch": 1.88110138, "global_step/max_steps": "752/800", "percentage": "94.00%", "elapsed_time": "3h 7m 33s", "remaining_time": "11m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.964046} -{"loss": 0.76749122, "grad_norm": 3.15154982, "learning_rate": 6.6e-07, "token_acc": 0.77243726, "epoch": 1.88360451, "global_step/max_steps": "753/800", "percentage": "94.12%", "elapsed_time": "3h 7m 43s", "remaining_time": "11m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.958029} -{"loss": 0.84824705, "grad_norm": 2.08922005, "learning_rate": 6.3e-07, "token_acc": 0.74747219, "epoch": 1.88610763, "global_step/max_steps": "754/800", "percentage": "94.25%", "elapsed_time": "3h 7m 54s", "remaining_time": "11m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.952608} -{"loss": 0.74357873, "grad_norm": 1.64963508, "learning_rate": 6.1e-07, "token_acc": 0.77579592, "epoch": 1.88861076, "global_step/max_steps": "755/800", "percentage": "94.38%", "elapsed_time": "3h 8m 9s", "remaining_time": "11m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.95217} -{"loss": 0.76157701, "grad_norm": 1.83556163, "learning_rate": 5.8e-07, "token_acc": 0.77055703, "epoch": 1.89111389, "global_step/max_steps": "756/800", "percentage": "94.50%", "elapsed_time": "3h 8m 23s", "remaining_time": "10m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.950407} -{"loss": 0.78108424, "grad_norm": 2.42204428, "learning_rate": 5.5e-07, "token_acc": 0.76449328, "epoch": 1.89361702, "global_step/max_steps": "757/800", "percentage": "94.62%", "elapsed_time": "3h 8m 34s", "remaining_time": "10m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.945891} -{"loss": 0.69384956, "grad_norm": 2.86859584, "learning_rate": 5.3e-07, "token_acc": 0.78842025, "epoch": 1.89612015, "global_step/max_steps": "758/800", "percentage": "94.75%", "elapsed_time": "3h 8m 50s", "remaining_time": "10m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.946997} -{"loss": 0.79153389, "grad_norm": 4.85310555, "learning_rate": 5e-07, "token_acc": 0.76725246, "epoch": 1.89862328, "global_step/max_steps": "759/800", "percentage": "94.88%", "elapsed_time": "3h 9m 1s", "remaining_time": "10m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.941457} -{"loss": 0.7878415, "grad_norm": 1.64516234, "learning_rate": 4.8e-07, "token_acc": 0.7611158, "epoch": 1.90112641, "global_step/max_steps": "760/800", "percentage": "95.00%", "elapsed_time": "3h 9m 21s", "remaining_time": "9m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.948029} -{"loss": 0.7406683, "grad_norm": 1.62816238, "learning_rate": 4.6e-07, "token_acc": 0.77178265, "epoch": 1.90362954, "global_step/max_steps": "761/800", "percentage": "95.12%", "elapsed_time": "3h 9m 41s", "remaining_time": "9m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.955056} -{"loss": 0.73354101, "grad_norm": 1.77744913, "learning_rate": 4.3e-07, "token_acc": 0.77666201, "epoch": 1.90613267, "global_step/max_steps": "762/800", "percentage": "95.25%", "elapsed_time": "3h 9m 55s", "remaining_time": "9m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.953547} -{"loss": 0.71915627, "grad_norm": 2.05110812, "learning_rate": 4.1e-07, "token_acc": 0.7779278, "epoch": 1.90863579, "global_step/max_steps": "763/800", "percentage": "95.38%", "elapsed_time": "3h 10m 5s", "remaining_time": "9m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.948151} -{"loss": 0.62338877, "grad_norm": 34.73859787, "learning_rate": 3.9e-07, "token_acc": 0.80986157, "epoch": 1.91113892, "global_step/max_steps": "764/800", "percentage": "95.50%", "elapsed_time": "3h 10m 13s", "remaining_time": "8m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.938172} -{"loss": 0.76491398, "grad_norm": 4.50701761, "learning_rate": 3.7e-07, "token_acc": 0.76649145, "epoch": 1.91364205, "global_step/max_steps": "765/800", "percentage": "95.62%", "elapsed_time": "3h 10m 29s", "remaining_time": "8m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.94016} -{"loss": 0.74934459, "grad_norm": 1.52732575, "learning_rate": 3.5e-07, "token_acc": 0.77555527, "epoch": 1.91614518, "global_step/max_steps": "766/800", "percentage": "95.75%", "elapsed_time": "3h 10m 44s", "remaining_time": "8m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.940229} -{"loss": 0.81650853, "grad_norm": 1.29974627, "learning_rate": 3.3e-07, "token_acc": 0.75319512, "epoch": 1.91864831, "global_step/max_steps": "767/800", "percentage": "95.88%", "elapsed_time": "3h 11m 1s", "remaining_time": "8m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.942192} -{"loss": 0.72427434, "grad_norm": 2.50276566, "learning_rate": 3.1e-07, "token_acc": 0.78245352, "epoch": 1.92115144, "global_step/max_steps": "768/800", "percentage": "96.00%", "elapsed_time": "3h 11m 14s", "remaining_time": "7m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.939691} -{"loss": 0.66851616, "grad_norm": 2.90618896, "learning_rate": 2.9e-07, "token_acc": 0.79501283, "epoch": 1.92365457, "global_step/max_steps": "769/800", "percentage": "96.12%", "elapsed_time": "3h 11m 24s", "remaining_time": "7m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.933626} -{"loss": 0.61836982, "grad_norm": 2.61553597, "learning_rate": 2.7e-07, "token_acc": 0.81516492, "epoch": 1.9261577, "global_step/max_steps": "770/800", "percentage": "96.25%", "elapsed_time": "3h 11m 33s", "remaining_time": "7m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.926608} -{"loss": 0.80806518, "grad_norm": 2.3632555, "learning_rate": 2.5e-07, "token_acc": 0.75873732, "epoch": 1.92866083, "global_step/max_steps": "771/800", "percentage": "96.38%", "elapsed_time": "3h 11m 55s", "remaining_time": "7m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.934735} -{"loss": 0.61797333, "grad_norm": 8.0265274, "learning_rate": 2.4e-07, "token_acc": 0.81786146, "epoch": 1.93116395, "global_step/max_steps": "772/800", "percentage": "96.50%", "elapsed_time": "3h 12m 5s", "remaining_time": "6m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.928643} -{"loss": 0.78545427, "grad_norm": 3.89188051, "learning_rate": 2.2e-07, "token_acc": 0.7663446, "epoch": 1.93366708, "global_step/max_steps": "773/800", "percentage": "96.62%", "elapsed_time": "3h 12m 25s", "remaining_time": "6m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.935211} -{"loss": 0.84622872, "grad_norm": 0.90110379, "learning_rate": 2e-07, "token_acc": 0.74740738, "epoch": 1.93617021, "global_step/max_steps": "774/800", "percentage": "96.75%", "elapsed_time": "3h 12m 42s", "remaining_time": "6m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.938005} -{"loss": 0.75588512, "grad_norm": 1.74688292, "learning_rate": 1.9e-07, "token_acc": 0.77791249, "epoch": 1.93867334, "global_step/max_steps": "775/800", "percentage": "96.88%", "elapsed_time": "3h 12m 57s", "remaining_time": "6m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.937776} -{"loss": 0.74205852, "grad_norm": 16.33168602, "learning_rate": 1.7e-07, "token_acc": 0.77884888, "epoch": 1.94117647, "global_step/max_steps": "776/800", "percentage": "97.00%", "elapsed_time": "3h 13m 8s", "remaining_time": "5m 58s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.932384} -{"loss": 0.76607645, "grad_norm": 19.74774933, "learning_rate": 1.6e-07, "token_acc": 0.76789824, "epoch": 1.9436796, "global_step/max_steps": "777/800", "percentage": "97.12%", "elapsed_time": "3h 13m 24s", "remaining_time": "5m 43s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.934264} -{"loss": 0.64213288, "grad_norm": 1.56750262, "learning_rate": 1.5e-07, "token_acc": 0.80608365, "epoch": 1.94618273, "global_step/max_steps": "778/800", "percentage": "97.25%", "elapsed_time": "3h 13m 35s", "remaining_time": "5m 28s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.929789} -{"loss": 0.6940316, "grad_norm": 1.90187049, "learning_rate": 1.3e-07, "token_acc": 0.78942087, "epoch": 1.94868586, "global_step/max_steps": "779/800", "percentage": "97.38%", "elapsed_time": "3h 13m 46s", "remaining_time": "5m 13s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.924207} -{"loss": 0.86200601, "grad_norm": 1.97112, "learning_rate": 1.2e-07, "token_acc": 0.7449793, "epoch": 1.95118899, "global_step/max_steps": "780/800", "percentage": "97.50%", "elapsed_time": "3h 14m 6s", "remaining_time": "4m 59s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.930996} -{"loss": 0.78289443, "grad_norm": 1.24688613, "learning_rate": 1.1e-07, "token_acc": 0.76004713, "epoch": 1.95369212, "global_step/max_steps": "781/800", "percentage": "97.62%", "elapsed_time": "3h 14m 39s", "remaining_time": "4m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.95442} -{"loss": 0.73906016, "grad_norm": 1.72006559, "learning_rate": 1e-07, "token_acc": 0.7711832, "epoch": 1.95619524, "global_step/max_steps": "782/800", "percentage": "97.75%", "elapsed_time": "3h 15m 2s", "remaining_time": "4m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.964118} -{"loss": 0.61246496, "grad_norm": 4.74237251, "learning_rate": 9e-08, "token_acc": 0.81128534, "epoch": 1.95869837, "global_step/max_steps": "783/800", "percentage": "97.88%", "elapsed_time": "3h 15m 11s", "remaining_time": "4m 14s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.956106} -{"loss": 0.71041548, "grad_norm": 1.35855162, "learning_rate": 8e-08, "token_acc": 0.78350438, "epoch": 1.9612015, "global_step/max_steps": "784/800", "percentage": "98.00%", "elapsed_time": "3h 15m 21s", "remaining_time": "3m 59s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.950246} -{"loss": 0.72417301, "grad_norm": 2.29851198, "learning_rate": 7e-08, "token_acc": 0.78147156, "epoch": 1.96370463, "global_step/max_steps": "785/800", "percentage": "98.12%", "elapsed_time": "3h 15m 32s", "remaining_time": "3m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.945122} -{"loss": 0.81350315, "grad_norm": 3.90389705, "learning_rate": 6e-08, "token_acc": 0.75875545, "epoch": 1.96620776, "global_step/max_steps": "786/800", "percentage": "98.25%", "elapsed_time": "3h 15m 42s", "remaining_time": "3m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.938768} -{"loss": 0.6274004, "grad_norm": 3.5198555, "learning_rate": 5e-08, "token_acc": 0.8100132, "epoch": 1.96871089, "global_step/max_steps": "787/800", "percentage": "98.38%", "elapsed_time": "3h 15m 53s", "remaining_time": "3m 14s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.934216} -{"loss": 0.764184, "grad_norm": 3.22350526, "learning_rate": 4e-08, "token_acc": 0.76785508, "epoch": 1.97121402, "global_step/max_steps": "788/800", "percentage": "98.50%", "elapsed_time": "3h 16m 8s", "remaining_time": "2m 59s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.934575} -{"loss": 0.76943439, "grad_norm": 8.30641842, "learning_rate": 4e-08, "token_acc": 0.76737728, "epoch": 1.97371715, "global_step/max_steps": "789/800", "percentage": "98.62%", "elapsed_time": "3h 16m 26s", "remaining_time": "2m 44s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.938044} -{"loss": 0.72238863, "grad_norm": 2.899019, "learning_rate": 3e-08, "token_acc": 0.78161556, "epoch": 1.97622028, "global_step/max_steps": "790/800", "percentage": "98.75%", "elapsed_time": "3h 16m 43s", "remaining_time": "2m 29s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.939909} -{"loss": 0.67983967, "grad_norm": 3.44381046, "learning_rate": 2e-08, "token_acc": 0.79385965, "epoch": 1.9787234, "global_step/max_steps": "791/800", "percentage": "98.88%", "elapsed_time": "3h 17m 7s", "remaining_time": "2m 15s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.952236} -{"loss": 0.77577686, "grad_norm": 1.21335673, "learning_rate": 2e-08, "token_acc": 0.76861676, "epoch": 1.98122653, "global_step/max_steps": "792/800", "percentage": "99.00%", "elapsed_time": "3h 17m 24s", "remaining_time": "1m 60s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.954734} -{"loss": 0.88595939, "grad_norm": 1.92882586, "learning_rate": 1e-08, "token_acc": 0.73541764, "epoch": 1.98372966, "global_step/max_steps": "793/800", "percentage": "99.12%", "elapsed_time": "3h 17m 47s", "remaining_time": "1m 45s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.964776} -{"loss": 0.8648411, "grad_norm": 3.11339331, "learning_rate": 1e-08, "token_acc": 0.74288955, "epoch": 1.98623279, "global_step/max_steps": "794/800", "percentage": "99.25%", "elapsed_time": "3h 18m 6s", "remaining_time": "1m 30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.970146} -{"loss": 0.66308975, "grad_norm": 2.82256818, "learning_rate": 1e-08, "token_acc": 0.80358723, "epoch": 1.98873592, "global_step/max_steps": "795/800", "percentage": "99.38%", "elapsed_time": "3h 18m 20s", "remaining_time": "1m 15s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.968727} -{"loss": 0.87678182, "grad_norm": 4.56323576, "learning_rate": 0.0, "token_acc": 0.74518894, "epoch": 1.99123905, "global_step/max_steps": "796/800", "percentage": "99.50%", "elapsed_time": "3h 18m 31s", "remaining_time": "60s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.963633} -{"loss": 0.76091152, "grad_norm": 1.43788004, "learning_rate": 0.0, "token_acc": 0.77429128, "epoch": 1.99374218, "global_step/max_steps": "797/800", "percentage": "99.62%", "elapsed_time": "3h 18m 44s", "remaining_time": "45s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.961619} -{"loss": 0.71806288, "grad_norm": 3.21072173, "learning_rate": 0.0, "token_acc": 0.78406114, "epoch": 1.99624531, "global_step/max_steps": "798/800", "percentage": "99.75%", "elapsed_time": "3h 18m 57s", "remaining_time": "30s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.958191} -{"loss": 0.74157619, "grad_norm": 2.38509703, "learning_rate": 0.0, "token_acc": 0.77974234, "epoch": 1.99874844, "global_step/max_steps": "799/800", "percentage": "99.88%", "elapsed_time": "3h 19m 15s", "remaining_time": "15s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.963008} -{"loss": 0.82550144, "grad_norm": 3.28675032, "learning_rate": 0.0, "token_acc": 0.7639698, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "3h 19m 23s", "remaining_time": "0s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.954047} -{"eval_loss": 0.52609098, "eval_runtime": 3.4058, "eval_samples_per_second": 3.523, "eval_steps_per_second": 0.587, "eval_token_acc": 0.7575799, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "3h 19m 27s", "remaining_time": "0s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.958316} -{"train_runtime": 11983.4323, "train_samples_per_second": 2.134, "train_steps_per_second": 0.067, "total_flos": 4.593508498402181e+18, "train_loss": 0.86406429, "epoch": 2.0, "global_step/max_steps": "800/800", "percentage": "100.00%", "elapsed_time": "3h 19m 43s", "remaining_time": "0s", "memory(GiB)": 76.69, "train_speed(s/it)": 14.97929} -{"model_parameter_info": "PeftModelForCausalLM: 8343.6882M Params (51.5215M Trainable [0.6175%]), 0.0019M Buffers.", "last_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800", "best_model_checkpoint": "/workspace/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_0-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/checkpoint-800", "best_metric": 0.52609098, "global_step": 800, "log_history": [{"loss": 1.4494528770446777, "grad_norm": 1.7986857891082764, "learning_rate": 3.125e-07, "token_acc": 0.6592913128674069, "epoch": 0.0025031289111389237, "step": 1}, {"loss": 1.4986588954925537, "grad_norm": 1.6583799123764038, "learning_rate": 6.25e-07, "token_acc": 0.6386976385046007, "epoch": 0.0050062578222778474, "step": 2}, {"loss": 1.4801826477050781, "grad_norm": 2.0358657836914062, "learning_rate": 9.375e-07, "token_acc": 0.6456910232526047, "epoch": 0.007509386733416771, "step": 3}, {"loss": 1.4314780235290527, "grad_norm": 2.9915387630462646, "learning_rate": 1.25e-06, "token_acc": 0.657655623906541, "epoch": 0.010012515644555695, "step": 4}, {"loss": 1.4699971675872803, "grad_norm": 3.6695473194122314, "learning_rate": 1.5625e-06, "token_acc": 0.6388313198200475, "epoch": 0.012515644555694618, "step": 5}, {"loss": 1.459728479385376, "grad_norm": 3.4062535762786865, "learning_rate": 1.875e-06, "token_acc": 0.6437672541940964, "epoch": 0.015018773466833541, "step": 6}, {"loss": 1.4375343322753906, "grad_norm": 4.477782249450684, "learning_rate": 2.1875e-06, "token_acc": 0.6586960119146119, "epoch": 0.017521902377972465, "step": 7}, {"loss": 1.4262611865997314, "grad_norm": 7.962740898132324, "learning_rate": 2.5e-06, "token_acc": 0.655122040294601, "epoch": 0.02002503128911139, "step": 8}, {"loss": 1.5507800579071045, "grad_norm": 1.1610136032104492, "learning_rate": 2.8125e-06, "token_acc": 0.6221771018936726, "epoch": 0.02252816020025031, "step": 9}, {"loss": 1.536710262298584, "grad_norm": 2.3185999393463135, "learning_rate": 3.125e-06, "token_acc": 0.6201467766984379, "epoch": 0.025031289111389236, "step": 10}, {"loss": 1.5054551362991333, "grad_norm": 1.7153717279434204, "learning_rate": 3.4375000000000005e-06, "token_acc": 0.6262201095830763, "epoch": 0.02753441802252816, "step": 11}, {"loss": 1.4586467742919922, "grad_norm": 2.102219343185425, "learning_rate": 3.75e-06, "token_acc": 0.6540530157510565, "epoch": 0.030037546933667083, "step": 12}, {"loss": 1.4890741109848022, "grad_norm": 1.5630065202713013, "learning_rate": 4.0625000000000005e-06, "token_acc": 0.6405010039200688, "epoch": 0.03254067584480601, "step": 13}, {"loss": 1.4462761878967285, "grad_norm": 33.184234619140625, "learning_rate": 4.375e-06, "token_acc": 0.6706432173164433, "epoch": 0.03504380475594493, "step": 14}, {"loss": 1.4586151838302612, "grad_norm": 1.8826276063919067, "learning_rate": 4.6875000000000004e-06, "token_acc": 0.6705066666666667, "epoch": 0.03754693366708386, "step": 15}, {"loss": 1.4168506860733032, "grad_norm": 8.024161338806152, "learning_rate": 5e-06, "token_acc": 0.6805052169137836, "epoch": 0.04005006257822278, "step": 16}, {"loss": 1.5086560249328613, "grad_norm": 2.216902732849121, "learning_rate": 5.3125e-06, "token_acc": 0.6336965157189877, "epoch": 0.0425531914893617, "step": 17}, {"loss": 1.4445496797561646, "grad_norm": 2.044179916381836, "learning_rate": 5.625e-06, "token_acc": 0.65391224653454, "epoch": 0.04505632040050062, "step": 18}, {"loss": 1.408017635345459, "grad_norm": 3.586271286010742, "learning_rate": 5.9375e-06, "token_acc": 0.6634764043289406, "epoch": 0.04755944931163955, "step": 19}, {"loss": 1.489911437034607, "grad_norm": 5.328360080718994, "learning_rate": 6.25e-06, "token_acc": 0.6468571428571429, "epoch": 0.05006257822277847, "step": 20}, {"loss": 1.5072444677352905, "grad_norm": 5.333054542541504, "learning_rate": 6.5625e-06, "token_acc": 0.6348264774365229, "epoch": 0.052565707133917394, "step": 21}, {"loss": 1.4629909992218018, "grad_norm": 2.1628494262695312, "learning_rate": 6.875000000000001e-06, "token_acc": 0.6488587495865035, "epoch": 0.05506883604505632, "step": 22}, {"loss": 1.4386491775512695, "grad_norm": 1.1275200843811035, "learning_rate": 7.187499999999999e-06, "token_acc": 0.6535871156661787, "epoch": 0.057571964956195244, "step": 23}, {"loss": 1.4821865558624268, "grad_norm": 1.3719394207000732, "learning_rate": 7.5e-06, "token_acc": 0.6603688302296149, "epoch": 0.060075093867334166, "step": 24}, {"loss": 1.4570186138153076, "grad_norm": 4.841657638549805, "learning_rate": 7.8125e-06, "token_acc": 0.641376796500729, "epoch": 0.0625782227784731, "step": 25}, {"loss": 1.4552083015441895, "grad_norm": 5.441135406494141, "learning_rate": 8.125000000000001e-06, "token_acc": 0.6444476999707003, "epoch": 0.06508135168961202, "step": 26}, {"loss": 1.4883147478103638, "grad_norm": 5.626768589019775, "learning_rate": 8.437500000000002e-06, "token_acc": 0.6449818262740152, "epoch": 0.06758448060075094, "step": 27}, {"loss": 1.482466459274292, "grad_norm": 2.280463695526123, "learning_rate": 8.75e-06, "token_acc": 0.6569336031608365, "epoch": 0.07008760951188986, "step": 28}, {"loss": 1.4435244798660278, "grad_norm": 1.4831247329711914, "learning_rate": 9.0625e-06, "token_acc": 0.6449365872405841, "epoch": 0.07259073842302878, "step": 29}, {"loss": 1.4155304431915283, "grad_norm": 2.1460583209991455, "learning_rate": 9.375000000000001e-06, "token_acc": 0.6572798819478604, "epoch": 0.07509386733416772, "step": 30}, {"loss": 1.4242777824401855, "grad_norm": 3.4287304878234863, "learning_rate": 9.6875e-06, "token_acc": 0.6509663111204985, "epoch": 0.07759699624530664, "step": 31}, {"loss": 1.4408752918243408, "grad_norm": 1.7512478828430176, "learning_rate": 1e-05, "token_acc": 0.6373248744382765, "epoch": 0.08010012515644556, "step": 32}, {"loss": 1.4433287382125854, "grad_norm": 2.4649264812469482, "learning_rate": 1.03125e-05, "token_acc": 0.6401217941210915, "epoch": 0.08260325406758448, "step": 33}, {"loss": 1.3532931804656982, "grad_norm": 3.863513946533203, "learning_rate": 1.0625e-05, "token_acc": 0.6718291250733999, "epoch": 0.0851063829787234, "step": 34}, {"loss": 1.368670105934143, "grad_norm": 2.388653516769409, "learning_rate": 1.09375e-05, "token_acc": 0.6668484187568157, "epoch": 0.08760951188986232, "step": 35}, {"loss": 1.4073092937469482, "grad_norm": 13.738019943237305, "learning_rate": 1.125e-05, "token_acc": 0.6551803885291397, "epoch": 0.09011264080100125, "step": 36}, {"loss": 1.4829626083374023, "grad_norm": 1.3637429475784302, "learning_rate": 1.1562500000000002e-05, "token_acc": 0.632803489946347, "epoch": 0.09261576971214018, "step": 37}, {"loss": 1.3899552822113037, "grad_norm": 1.6325939893722534, "learning_rate": 1.1875e-05, "token_acc": 0.6505426646706587, "epoch": 0.0951188986232791, "step": 38}, {"loss": 1.4045588970184326, "grad_norm": 1.8122252225875854, "learning_rate": 1.21875e-05, "token_acc": 0.6430427054373091, "epoch": 0.09762202753441802, "step": 39}, {"loss": 1.328863501548767, "grad_norm": 3.8704774379730225, "learning_rate": 1.25e-05, "token_acc": 0.6735982966643009, "epoch": 0.10012515644555695, "step": 40}, {"loss": 1.3276169300079346, "grad_norm": 2.2901201248168945, "learning_rate": 1.28125e-05, "token_acc": 0.6693909833904561, "epoch": 0.10262828535669587, "step": 41}, {"loss": 1.3163728713989258, "grad_norm": 4.91914176940918, "learning_rate": 1.3125e-05, "token_acc": 0.670345262494088, "epoch": 0.10513141426783479, "step": 42}, {"loss": 1.3434736728668213, "grad_norm": 2.1690850257873535, "learning_rate": 1.34375e-05, "token_acc": 0.6614920224234584, "epoch": 0.10763454317897372, "step": 43}, {"loss": 1.314670205116272, "grad_norm": 2.672122001647949, "learning_rate": 1.3750000000000002e-05, "token_acc": 0.6749050965188595, "epoch": 0.11013767209011265, "step": 44}, {"loss": 1.3387380838394165, "grad_norm": 2.7474703788757324, "learning_rate": 1.4062500000000001e-05, "token_acc": 0.6603486336302048, "epoch": 0.11264080100125157, "step": 45}, {"loss": 1.2919178009033203, "grad_norm": 3.5926313400268555, "learning_rate": 1.4374999999999999e-05, "token_acc": 0.6762086081457809, "epoch": 0.11514392991239049, "step": 46}, {"loss": 1.2780070304870605, "grad_norm": 3.3131020069122314, "learning_rate": 1.4687500000000001e-05, "token_acc": 0.6928104575163399, "epoch": 0.11764705882352941, "step": 47}, {"loss": 1.321435809135437, "grad_norm": 2.7729618549346924, "learning_rate": 1.5e-05, "token_acc": 0.6654236179260713, "epoch": 0.12015018773466833, "step": 48}, {"loss": 1.341125249862671, "grad_norm": 3.3950774669647217, "learning_rate": 1.5312500000000003e-05, "token_acc": 0.6776592884667085, "epoch": 0.12265331664580725, "step": 49}, {"loss": 1.2597063779830933, "grad_norm": 1.6991623640060425, "learning_rate": 1.5625e-05, "token_acc": 0.68832675794848, "epoch": 0.1251564455569462, "step": 50}, {"loss": 1.3336235284805298, "grad_norm": 2.190904378890991, "learning_rate": 1.59375e-05, "token_acc": 0.6667860126506743, "epoch": 0.1276595744680851, "step": 51}, {"loss": 1.3078663349151611, "grad_norm": 1.2699120044708252, "learning_rate": 1.6250000000000002e-05, "token_acc": 0.6601299948297511, "epoch": 0.13016270337922403, "step": 52}, {"loss": 1.3297888040542603, "grad_norm": 2.1954216957092285, "learning_rate": 1.65625e-05, "token_acc": 0.6636132655790318, "epoch": 0.13266583229036297, "step": 53}, {"loss": 1.2633283138275146, "grad_norm": 1.4788720607757568, "learning_rate": 1.6875000000000004e-05, "token_acc": 0.6728486646884273, "epoch": 0.13516896120150187, "step": 54}, {"loss": 1.3134421110153198, "grad_norm": 1.2756942510604858, "learning_rate": 1.71875e-05, "token_acc": 0.6597701149425287, "epoch": 0.1376720901126408, "step": 55}, {"loss": 1.320970058441162, "grad_norm": 1.5058810710906982, "learning_rate": 1.75e-05, "token_acc": 0.6619850627084409, "epoch": 0.14017521902377972, "step": 56}, {"loss": 1.199589729309082, "grad_norm": 8.395251274108887, "learning_rate": 1.7812500000000003e-05, "token_acc": 0.6902491313668958, "epoch": 0.14267834793491865, "step": 57}, {"loss": 1.200380802154541, "grad_norm": 1.2147586345672607, "learning_rate": 1.8125e-05, "token_acc": 0.6993761140819964, "epoch": 0.14518147684605756, "step": 58}, {"loss": 1.1884859800338745, "grad_norm": 7.152925491333008, "learning_rate": 1.84375e-05, "token_acc": 0.6956748695003728, "epoch": 0.1476846057571965, "step": 59}, {"loss": 1.2416102886199951, "grad_norm": 1.761688470840454, "learning_rate": 1.8750000000000002e-05, "token_acc": 0.6780534640456819, "epoch": 0.15018773466833543, "step": 60}, {"loss": 1.2558822631835938, "grad_norm": 1.4128592014312744, "learning_rate": 1.90625e-05, "token_acc": 0.6748296304504404, "epoch": 0.15269086357947434, "step": 61}, {"loss": 1.2571231126785278, "grad_norm": 5.176482677459717, "learning_rate": 1.9375e-05, "token_acc": 0.6723865345312922, "epoch": 0.15519399249061328, "step": 62}, {"loss": 1.2110214233398438, "grad_norm": 2.6499240398406982, "learning_rate": 1.96875e-05, "token_acc": 0.693203125, "epoch": 0.15769712140175218, "step": 63}, {"loss": 1.2331520318984985, "grad_norm": 4.237362861633301, "learning_rate": 2e-05, "token_acc": 0.6743368488334931, "epoch": 0.16020025031289112, "step": 64}, {"loss": 1.251111388206482, "grad_norm": 1.8324310779571533, "learning_rate": 2.0312500000000002e-05, "token_acc": 0.6659237798083352, "epoch": 0.16270337922403003, "step": 65}, {"loss": 1.2055377960205078, "grad_norm": 4.525329113006592, "learning_rate": 2.0625e-05, "token_acc": 0.6863984270767503, "epoch": 0.16520650813516896, "step": 66}, {"loss": 1.1731817722320557, "grad_norm": 6.051656246185303, "learning_rate": 2.09375e-05, "token_acc": 0.7137023105857067, "epoch": 0.1677096370463079, "step": 67}, {"loss": 1.2493493556976318, "grad_norm": 4.812889099121094, "learning_rate": 2.125e-05, "token_acc": 0.6750756811301716, "epoch": 0.1702127659574468, "step": 68}, {"loss": 1.1924042701721191, "grad_norm": 7.175212860107422, "learning_rate": 2.1562500000000002e-05, "token_acc": 0.6935587761674719, "epoch": 0.17271589486858574, "step": 69}, {"loss": 1.1937012672424316, "grad_norm": 3.6862568855285645, "learning_rate": 2.1875e-05, "token_acc": 0.6821087165563663, "epoch": 0.17521902377972465, "step": 70}, {"loss": 1.1624102592468262, "grad_norm": 1.5228620767593384, "learning_rate": 2.21875e-05, "token_acc": 0.6929272132735861, "epoch": 0.17772215269086358, "step": 71}, {"loss": 1.2102301120758057, "grad_norm": 4.755965232849121, "learning_rate": 2.25e-05, "token_acc": 0.6871946706143597, "epoch": 0.1802252816020025, "step": 72}, {"loss": 1.0677056312561035, "grad_norm": 5.966728687286377, "learning_rate": 2.28125e-05, "token_acc": 0.7211055276381909, "epoch": 0.18272841051314143, "step": 73}, {"loss": 1.1764060258865356, "grad_norm": 1.5221632719039917, "learning_rate": 2.3125000000000003e-05, "token_acc": 0.6962217319360177, "epoch": 0.18523153942428036, "step": 74}, {"loss": 1.1629931926727295, "grad_norm": 2.7929961681365967, "learning_rate": 2.34375e-05, "token_acc": 0.6944312608764436, "epoch": 0.18773466833541927, "step": 75}, {"loss": 1.0149047374725342, "grad_norm": 2.37900447845459, "learning_rate": 2.375e-05, "token_acc": 0.7393754402441888, "epoch": 0.1902377972465582, "step": 76}, {"loss": 1.1768832206726074, "grad_norm": 1.0842740535736084, "learning_rate": 2.4062500000000002e-05, "token_acc": 0.6881792648675051, "epoch": 0.1927409261576971, "step": 77}, {"loss": 1.1979458332061768, "grad_norm": 3.4930760860443115, "learning_rate": 2.4375e-05, "token_acc": 0.679685852835758, "epoch": 0.19524405506883605, "step": 78}, {"loss": 1.2089760303497314, "grad_norm": 1.6366428136825562, "learning_rate": 2.4687500000000004e-05, "token_acc": 0.6773502191914271, "epoch": 0.19774718397997496, "step": 79}, {"loss": 1.215577483177185, "grad_norm": 2.1552915573120117, "learning_rate": 2.5e-05, "token_acc": 0.6731748051534914, "epoch": 0.2002503128911139, "step": 80}, {"loss": 1.1573808193206787, "grad_norm": 1.2128065824508667, "learning_rate": 2.53125e-05, "token_acc": 0.6900347624565469, "epoch": 0.20275344180225283, "step": 81}, {"loss": 1.2300320863723755, "grad_norm": 1.3834235668182373, "learning_rate": 2.5625e-05, "token_acc": 0.6683756510416666, "epoch": 0.20525657071339173, "step": 82}, {"loss": 1.0792181491851807, "grad_norm": 2.470287799835205, "learning_rate": 2.5937500000000004e-05, "token_acc": 0.705793164445006, "epoch": 0.20775969962453067, "step": 83}, {"loss": 1.1585354804992676, "grad_norm": 1.6145744323730469, "learning_rate": 2.625e-05, "token_acc": 0.6947993159641888, "epoch": 0.21026282853566958, "step": 84}, {"loss": 1.0336159467697144, "grad_norm": 4.214087963104248, "learning_rate": 2.6562500000000002e-05, "token_acc": 0.7254294315565787, "epoch": 0.2127659574468085, "step": 85}, {"loss": 1.1614649295806885, "grad_norm": 2.9351229667663574, "learning_rate": 2.6875e-05, "token_acc": 0.6926658905704307, "epoch": 0.21526908635794745, "step": 86}, {"loss": 1.0881564617156982, "grad_norm": 8.310845375061035, "learning_rate": 2.71875e-05, "token_acc": 0.7154069767441861, "epoch": 0.21777221526908636, "step": 87}, {"loss": 1.0820119380950928, "grad_norm": 1.372636318206787, "learning_rate": 2.7500000000000004e-05, "token_acc": 0.7062420210978969, "epoch": 0.2202753441802253, "step": 88}, {"loss": 1.1775951385498047, "grad_norm": 0.9730624556541443, "learning_rate": 2.7812500000000002e-05, "token_acc": 0.6864290043528569, "epoch": 0.2227784730913642, "step": 89}, {"loss": 0.9602251052856445, "grad_norm": 32.95426559448242, "learning_rate": 2.8125000000000003e-05, "token_acc": 0.7386105263157895, "epoch": 0.22528160200250313, "step": 90}, {"loss": 1.0506157875061035, "grad_norm": 1.8376237154006958, "learning_rate": 2.84375e-05, "token_acc": 0.7134351911627573, "epoch": 0.22778473091364204, "step": 91}, {"loss": 1.1409003734588623, "grad_norm": 3.1153717041015625, "learning_rate": 2.8749999999999997e-05, "token_acc": 0.6888570610140361, "epoch": 0.23028785982478098, "step": 92}, {"loss": 0.9956814050674438, "grad_norm": 4.867130756378174, "learning_rate": 2.9062500000000005e-05, "token_acc": 0.7277626648873377, "epoch": 0.2327909887359199, "step": 93}, {"loss": 1.158729076385498, "grad_norm": 1.4865891933441162, "learning_rate": 2.9375000000000003e-05, "token_acc": 0.688175432276657, "epoch": 0.23529411764705882, "step": 94}, {"loss": 1.0074833631515503, "grad_norm": 4.895930290222168, "learning_rate": 2.96875e-05, "token_acc": 0.7172348866922198, "epoch": 0.23779724655819776, "step": 95}, {"loss": 0.9759230613708496, "grad_norm": 11.321675300598145, "learning_rate": 3e-05, "token_acc": 0.7422142214221422, "epoch": 0.24030037546933666, "step": 96}, {"loss": 1.1167738437652588, "grad_norm": 5.278805255889893, "learning_rate": 3.0312499999999998e-05, "token_acc": 0.6905687036382904, "epoch": 0.2428035043804756, "step": 97}, {"loss": 1.1424094438552856, "grad_norm": 11.173495292663574, "learning_rate": 3.0625000000000006e-05, "token_acc": 0.691369290620047, "epoch": 0.2453066332916145, "step": 98}, {"loss": 1.041211485862732, "grad_norm": 2.3526344299316406, "learning_rate": 3.09375e-05, "token_acc": 0.7146459747817653, "epoch": 0.24780976220275344, "step": 99}, {"loss": 1.0442692041397095, "grad_norm": 2.7857418060302734, "learning_rate": 3.125e-05, "token_acc": 0.711717754376551, "epoch": 0.2503128911138924, "step": 100}, {"loss": 1.1021206378936768, "grad_norm": 79.83805084228516, "learning_rate": 3.15625e-05, "token_acc": 0.7008632923368022, "epoch": 0.2528160200250313, "step": 101}, {"loss": 1.0893476009368896, "grad_norm": 2.249223232269287, "learning_rate": 3.1875e-05, "token_acc": 0.7009559556624245, "epoch": 0.2553191489361702, "step": 102}, {"loss": 1.0653949975967407, "grad_norm": 3.4049673080444336, "learning_rate": 3.21875e-05, "token_acc": 0.7043142117355312, "epoch": 0.25782227784730916, "step": 103}, {"loss": 0.9971442818641663, "grad_norm": 2.0676321983337402, "learning_rate": 3.2500000000000004e-05, "token_acc": 0.7209080223332354, "epoch": 0.26032540675844806, "step": 104}, {"loss": 1.0553109645843506, "grad_norm": 3.04028058052063, "learning_rate": 3.2812500000000005e-05, "token_acc": 0.7107347245505521, "epoch": 0.26282853566958697, "step": 105}, {"loss": 1.1222078800201416, "grad_norm": 3.4072177410125732, "learning_rate": 3.3125e-05, "token_acc": 0.6884954048982341, "epoch": 0.26533166458072593, "step": 106}, {"loss": 1.0399558544158936, "grad_norm": 4.250513553619385, "learning_rate": 3.34375e-05, "token_acc": 0.715698983420891, "epoch": 0.26783479349186484, "step": 107}, {"loss": 0.97971510887146, "grad_norm": 1.5310983657836914, "learning_rate": 3.375000000000001e-05, "token_acc": 0.7238202367561197, "epoch": 0.27033792240300375, "step": 108}, {"loss": 1.0755829811096191, "grad_norm": 1.164379358291626, "learning_rate": 3.40625e-05, "token_acc": 0.6932410856838744, "epoch": 0.27284105131414266, "step": 109}, {"loss": 1.0854302644729614, "grad_norm": 5.060781002044678, "learning_rate": 3.4375e-05, "token_acc": 0.7054753144049646, "epoch": 0.2753441802252816, "step": 110}, {"loss": 0.9611892700195312, "grad_norm": 3.0165348052978516, "learning_rate": 3.46875e-05, "token_acc": 0.7338753387533875, "epoch": 0.27784730913642053, "step": 111}, {"loss": 0.9679099321365356, "grad_norm": 5.620553970336914, "learning_rate": 3.5e-05, "token_acc": 0.7282849285666376, "epoch": 0.28035043804755944, "step": 112}, {"loss": 1.0258841514587402, "grad_norm": 3.3517661094665527, "learning_rate": 3.5312500000000005e-05, "token_acc": 0.7185277850934949, "epoch": 0.2828535669586984, "step": 113}, {"loss": 1.0116548538208008, "grad_norm": 4.1862382888793945, "learning_rate": 3.5625000000000005e-05, "token_acc": 0.7171322653250364, "epoch": 0.2853566958698373, "step": 114}, {"loss": 0.9625561833381653, "grad_norm": 4.775069713592529, "learning_rate": 3.59375e-05, "token_acc": 0.7378043781257686, "epoch": 0.2878598247809762, "step": 115}, {"loss": 1.0401370525360107, "grad_norm": 2.4339494705200195, "learning_rate": 3.625e-05, "token_acc": 0.710567296996663, "epoch": 0.2903629536921151, "step": 116}, {"loss": 0.8899033069610596, "grad_norm": 2.8357059955596924, "learning_rate": 3.65625e-05, "token_acc": 0.760463490160823, "epoch": 0.2928660826032541, "step": 117}, {"loss": 1.0864536762237549, "grad_norm": 3.8368427753448486, "learning_rate": 3.6875e-05, "token_acc": 0.7004258071470921, "epoch": 0.295369211514393, "step": 118}, {"loss": 1.0734574794769287, "grad_norm": 2.6409614086151123, "learning_rate": 3.71875e-05, "token_acc": 0.7024148661086033, "epoch": 0.2978723404255319, "step": 119}, {"loss": 0.9885290861129761, "grad_norm": 2.4843125343322754, "learning_rate": 3.7500000000000003e-05, "token_acc": 0.7214841692514777, "epoch": 0.30037546933667086, "step": 120}, {"loss": 1.0155832767486572, "grad_norm": 3.219529628753662, "learning_rate": 3.78125e-05, "token_acc": 0.7182897862232779, "epoch": 0.30287859824780977, "step": 121}, {"loss": 0.9772403836250305, "grad_norm": 4.397768020629883, "learning_rate": 3.8125e-05, "token_acc": 0.7289815989847716, "epoch": 0.3053817271589487, "step": 122}, {"loss": 1.0845521688461304, "grad_norm": 7.476251125335693, "learning_rate": 3.8437500000000006e-05, "token_acc": 0.700028537649313, "epoch": 0.3078848560700876, "step": 123}, {"loss": 1.0315274000167847, "grad_norm": 2.454371929168701, "learning_rate": 3.875e-05, "token_acc": 0.714497250035256, "epoch": 0.31038798498122655, "step": 124}, {"loss": 0.9268566370010376, "grad_norm": 2.123765230178833, "learning_rate": 3.90625e-05, "token_acc": 0.7407587548638133, "epoch": 0.31289111389236546, "step": 125}, {"loss": 0.9085225462913513, "grad_norm": 4.286694526672363, "learning_rate": 3.9375e-05, "token_acc": 0.7448712536935416, "epoch": 0.31539424280350437, "step": 126}, {"loss": 0.8727496266365051, "grad_norm": 2.3730971813201904, "learning_rate": 3.96875e-05, "token_acc": 0.7622018348623854, "epoch": 0.31789737171464333, "step": 127}, {"loss": 1.0061339139938354, "grad_norm": 2.70272159576416, "learning_rate": 4e-05, "token_acc": 0.7129116291496894, "epoch": 0.32040050062578224, "step": 128}, {"loss": 1.0005316734313965, "grad_norm": 2.363917112350464, "learning_rate": 4.0312500000000004e-05, "token_acc": 0.7205369127516779, "epoch": 0.32290362953692114, "step": 129}, {"loss": 0.9804684519767761, "grad_norm": 5.393451690673828, "learning_rate": 4.0625000000000005e-05, "token_acc": 0.7264981866328939, "epoch": 0.32540675844806005, "step": 130}, {"loss": 0.877933144569397, "grad_norm": 4.67309045791626, "learning_rate": 4.09375e-05, "token_acc": 0.76021068992315, "epoch": 0.327909887359199, "step": 131}, {"loss": 0.9735865592956543, "grad_norm": 2.624901533126831, "learning_rate": 4.125e-05, "token_acc": 0.7238545946227053, "epoch": 0.3304130162703379, "step": 132}, {"loss": 1.0161550045013428, "grad_norm": 2.829728126525879, "learning_rate": 4.156250000000001e-05, "token_acc": 0.7142064135957983, "epoch": 0.33291614518147683, "step": 133}, {"loss": 0.9492026567459106, "grad_norm": 2.408121109008789, "learning_rate": 4.1875e-05, "token_acc": 0.736371949075051, "epoch": 0.3354192740926158, "step": 134}, {"loss": 0.8693875670433044, "grad_norm": 2.7580509185791016, "learning_rate": 4.21875e-05, "token_acc": 0.7559972583961617, "epoch": 0.3379224030037547, "step": 135}, {"loss": 0.9372125864028931, "grad_norm": 2.2704222202301025, "learning_rate": 4.25e-05, "token_acc": 0.7337290802460306, "epoch": 0.3404255319148936, "step": 136}, {"loss": 1.0078935623168945, "grad_norm": 4.360070705413818, "learning_rate": 4.28125e-05, "token_acc": 0.7146907768029104, "epoch": 0.3429286608260325, "step": 137}, {"loss": 0.8341250419616699, "grad_norm": 13.713053703308105, "learning_rate": 4.3125000000000005e-05, "token_acc": 0.7732564024698856, "epoch": 0.3454317897371715, "step": 138}, {"loss": 0.9521622657775879, "grad_norm": 4.248615264892578, "learning_rate": 4.3437500000000006e-05, "token_acc": 0.7330997794213053, "epoch": 0.3479349186483104, "step": 139}, {"loss": 0.893964409828186, "grad_norm": 4.988142013549805, "learning_rate": 4.375e-05, "token_acc": 0.7476815787521329, "epoch": 0.3504380475594493, "step": 140}, {"loss": 0.8878812789916992, "grad_norm": 3.864096164703369, "learning_rate": 4.40625e-05, "token_acc": 0.7459516298633018, "epoch": 0.35294117647058826, "step": 141}, {"loss": 1.029758334159851, "grad_norm": 4.250646591186523, "learning_rate": 4.4375e-05, "token_acc": 0.7136325267304445, "epoch": 0.35544430538172717, "step": 142}, {"loss": 0.8827238082885742, "grad_norm": 4.437873363494873, "learning_rate": 4.46875e-05, "token_acc": 0.7566478021552059, "epoch": 0.3579474342928661, "step": 143}, {"loss": 0.9520173072814941, "grad_norm": 2.903998613357544, "learning_rate": 4.5e-05, "token_acc": 0.731939568039153, "epoch": 0.360450563204005, "step": 144}, {"loss": 0.9319078922271729, "grad_norm": 4.129173755645752, "learning_rate": 4.5312500000000004e-05, "token_acc": 0.7331720330045288, "epoch": 0.36295369211514394, "step": 145}, {"loss": 0.9192413091659546, "grad_norm": 6.249156951904297, "learning_rate": 4.5625e-05, "token_acc": 0.7346352365242378, "epoch": 0.36545682102628285, "step": 146}, {"loss": 0.8454147577285767, "grad_norm": 2.8188090324401855, "learning_rate": 4.59375e-05, "token_acc": 0.7561653860226857, "epoch": 0.36795994993742176, "step": 147}, {"loss": 0.9139873385429382, "grad_norm": 20.902667999267578, "learning_rate": 4.6250000000000006e-05, "token_acc": 0.7434644957033016, "epoch": 0.3704630788485607, "step": 148}, {"loss": 1.0368843078613281, "grad_norm": 3.022164821624756, "learning_rate": 4.65625e-05, "token_acc": 0.7042305221620629, "epoch": 0.37296620775969963, "step": 149}, {"loss": 0.9745063185691833, "grad_norm": 2.9987237453460693, "learning_rate": 4.6875e-05, "token_acc": 0.7196575970651177, "epoch": 0.37546933667083854, "step": 150}, {"loss": 1.0234860181808472, "grad_norm": 2.3661983013153076, "learning_rate": 4.71875e-05, "token_acc": 0.7121767059221277, "epoch": 0.37797246558197745, "step": 151}, {"loss": 0.8604807257652283, "grad_norm": 2.627258777618408, "learning_rate": 4.75e-05, "token_acc": 0.7513602865211103, "epoch": 0.3804755944931164, "step": 152}, {"loss": 1.01763916015625, "grad_norm": 2.5150792598724365, "learning_rate": 4.7812500000000003e-05, "token_acc": 0.7111102210829863, "epoch": 0.3829787234042553, "step": 153}, {"loss": 0.8841659426689148, "grad_norm": 55.79320526123047, "learning_rate": 4.8125000000000004e-05, "token_acc": 0.7480198788631776, "epoch": 0.3854818523153942, "step": 154}, {"loss": 0.9884188175201416, "grad_norm": 3.121655225753784, "learning_rate": 4.8437500000000005e-05, "token_acc": 0.7213071620270484, "epoch": 0.3879849812265332, "step": 155}, {"loss": 0.8871731758117676, "grad_norm": 2.309528112411499, "learning_rate": 4.875e-05, "token_acc": 0.7475174151474729, "epoch": 0.3904881101376721, "step": 156}, {"loss": 0.9550650119781494, "grad_norm": 1.564784049987793, "learning_rate": 4.90625e-05, "token_acc": 0.7262110500130924, "epoch": 0.392991239048811, "step": 157}, {"loss": 0.8485426902770996, "grad_norm": 4.770287036895752, "learning_rate": 4.937500000000001e-05, "token_acc": 0.755221214619401, "epoch": 0.3954943679599499, "step": 158}, {"loss": 0.8821752667427063, "grad_norm": 2.7487730979919434, "learning_rate": 4.96875e-05, "token_acc": 0.7515657620041754, "epoch": 0.3979974968710889, "step": 159}, {"loss": 0.9395763874053955, "grad_norm": 1.9737449884414673, "learning_rate": 5e-05, "token_acc": 0.7279748441551277, "epoch": 0.4005006257822278, "step": 160}, {"loss": 0.8686919808387756, "grad_norm": 4.472081184387207, "learning_rate": 4.9999698804181425e-05, "token_acc": 0.7603603603603604, "epoch": 0.4030037546933667, "step": 161}, {"loss": 0.8725775480270386, "grad_norm": 3.6379482746124268, "learning_rate": 4.9998795223983205e-05, "token_acc": 0.7472160356347439, "epoch": 0.40550688360450565, "step": 162}, {"loss": 0.847150981426239, "grad_norm": 3.493037700653076, "learning_rate": 4.99972892811777e-05, "token_acc": 0.7538943188759927, "epoch": 0.40801001251564456, "step": 163}, {"loss": 0.9739137887954712, "grad_norm": 1.912611722946167, "learning_rate": 4.9995181012051625e-05, "token_acc": 0.7212982399483288, "epoch": 0.41051314142678347, "step": 164}, {"loss": 0.926494300365448, "grad_norm": 11.750629425048828, "learning_rate": 4.9992470467405104e-05, "token_acc": 0.7324805645917186, "epoch": 0.4130162703379224, "step": 165}, {"loss": 0.9524897336959839, "grad_norm": 1.79902982711792, "learning_rate": 4.998915771255053e-05, "token_acc": 0.7259630302761647, "epoch": 0.41551939924906134, "step": 166}, {"loss": 0.8616597652435303, "grad_norm": 1.653032660484314, "learning_rate": 4.9985242827310936e-05, "token_acc": 0.7509121709669012, "epoch": 0.41802252816020025, "step": 167}, {"loss": 0.9457658529281616, "grad_norm": 3.853633165359497, "learning_rate": 4.9980725906018074e-05, "token_acc": 0.7262784810126582, "epoch": 0.42052565707133915, "step": 168}, {"loss": 0.7890052795410156, "grad_norm": 2.9848127365112305, "learning_rate": 4.9975607057510185e-05, "token_acc": 0.7754066818261326, "epoch": 0.4230287859824781, "step": 169}, {"loss": 0.8364709615707397, "grad_norm": 5.078474521636963, "learning_rate": 4.996988640512931e-05, "token_acc": 0.764642082429501, "epoch": 0.425531914893617, "step": 170}, {"loss": 0.8439483642578125, "grad_norm": 2.06341814994812, "learning_rate": 4.99635640867184e-05, "token_acc": 0.7607762475406904, "epoch": 0.42803504380475593, "step": 171}, {"loss": 0.8153511881828308, "grad_norm": 2.261368989944458, "learning_rate": 4.9956640254617906e-05, "token_acc": 0.7593304295840806, "epoch": 0.4305381727158949, "step": 172}, {"loss": 0.950925886631012, "grad_norm": 2.942291736602783, "learning_rate": 4.994911507566217e-05, "token_acc": 0.7278411003703169, "epoch": 0.4330413016270338, "step": 173}, {"loss": 0.9062566161155701, "grad_norm": 1.5425530672073364, "learning_rate": 4.99409887311754e-05, "token_acc": 0.7486025191920698, "epoch": 0.4355444305381727, "step": 174}, {"loss": 0.8227016925811768, "grad_norm": 2.6939258575439453, "learning_rate": 4.993226141696726e-05, "token_acc": 0.7661045274992404, "epoch": 0.4380475594493116, "step": 175}, {"loss": 0.9167571067810059, "grad_norm": 5.915945529937744, "learning_rate": 4.99229333433282e-05, "token_acc": 0.7367290406467296, "epoch": 0.4405506883604506, "step": 176}, {"loss": 0.8607068657875061, "grad_norm": 1.6880910396575928, "learning_rate": 4.991300473502437e-05, "token_acc": 0.7547773184618984, "epoch": 0.4430538172715895, "step": 177}, {"loss": 1.0075507164001465, "grad_norm": 1.5918737649917603, "learning_rate": 4.9902475831292185e-05, "token_acc": 0.7130909563634787, "epoch": 0.4455569461827284, "step": 178}, {"loss": 0.8469476103782654, "grad_norm": 5.924171447753906, "learning_rate": 4.9891346885832586e-05, "token_acc": 0.7637781477262771, "epoch": 0.44806007509386736, "step": 179}, {"loss": 0.9136925935745239, "grad_norm": 1.8689627647399902, "learning_rate": 4.987961816680492e-05, "token_acc": 0.7422716834481541, "epoch": 0.45056320400500627, "step": 180}, {"loss": 0.809701681137085, "grad_norm": 3.0246078968048096, "learning_rate": 4.986728995682049e-05, "token_acc": 0.7672480620155039, "epoch": 0.4530663329161452, "step": 181}, {"loss": 0.9456962943077087, "grad_norm": 1.0998661518096924, "learning_rate": 4.9854362552935706e-05, "token_acc": 0.7302064153503246, "epoch": 0.4555694618272841, "step": 182}, {"loss": 0.9543384909629822, "grad_norm": 1.7873152494430542, "learning_rate": 4.984083626664497e-05, "token_acc": 0.7306896908282494, "epoch": 0.45807259073842305, "step": 183}, {"loss": 0.9392420649528503, "grad_norm": 1.8325738906860352, "learning_rate": 4.982671142387316e-05, "token_acc": 0.73054827887311, "epoch": 0.46057571964956195, "step": 184}, {"loss": 0.8523749709129333, "grad_norm": 2.0283353328704834, "learning_rate": 4.981198836496775e-05, "token_acc": 0.7518976665729548, "epoch": 0.46307884856070086, "step": 185}, {"loss": 1.0026400089263916, "grad_norm": 1.8880774974822998, "learning_rate": 4.979666744469065e-05, "token_acc": 0.7179426739581369, "epoch": 0.4655819774718398, "step": 186}, {"loss": 0.8702259659767151, "grad_norm": 1.5821034908294678, "learning_rate": 4.978074903220963e-05, "token_acc": 0.7518054532056005, "epoch": 0.46808510638297873, "step": 187}, {"loss": 0.9819506406784058, "grad_norm": 1.3895519971847534, "learning_rate": 4.976423351108943e-05, "token_acc": 0.7262579281183932, "epoch": 0.47058823529411764, "step": 188}, {"loss": 0.8391700983047485, "grad_norm": 2.175621509552002, "learning_rate": 4.9747121279282525e-05, "token_acc": 0.7537929574483099, "epoch": 0.47309136420525655, "step": 189}, {"loss": 0.8495551347732544, "grad_norm": 1.7478188276290894, "learning_rate": 4.972941274911953e-05, "token_acc": 0.7538736959071548, "epoch": 0.4755944931163955, "step": 190}, {"loss": 0.8685894012451172, "grad_norm": 2.7944796085357666, "learning_rate": 4.971110834729925e-05, "token_acc": 0.7504071889918562, "epoch": 0.4780976220275344, "step": 191}, {"loss": 0.8083388209342957, "grad_norm": 11.889168739318848, "learning_rate": 4.9692208514878444e-05, "token_acc": 0.7642701875855407, "epoch": 0.4806007509386733, "step": 192}, {"loss": 0.8238387703895569, "grad_norm": 13.814888954162598, "learning_rate": 4.9672713707261146e-05, "token_acc": 0.7610306169278175, "epoch": 0.4831038798498123, "step": 193}, {"loss": 0.9381322860717773, "grad_norm": 1.4705616235733032, "learning_rate": 4.965262439418772e-05, "token_acc": 0.7296181077022098, "epoch": 0.4856070087609512, "step": 194}, {"loss": 0.781527042388916, "grad_norm": 2.106172800064087, "learning_rate": 4.963194105972353e-05, "token_acc": 0.7668615663345137, "epoch": 0.4881101376720901, "step": 195}, {"loss": 0.8901837468147278, "grad_norm": 1.4520384073257446, "learning_rate": 4.9610664202247294e-05, "token_acc": 0.7357566856373539, "epoch": 0.490613266583229, "step": 196}, {"loss": 0.8004983067512512, "grad_norm": 92.66796112060547, "learning_rate": 4.958879433443904e-05, "token_acc": 0.7666008205439903, "epoch": 0.493116395494368, "step": 197}, {"loss": 0.9934076070785522, "grad_norm": 3.9278409481048584, "learning_rate": 4.95663319832678e-05, "token_acc": 0.7185084923372484, "epoch": 0.4956195244055069, "step": 198}, {"loss": 0.8867624998092651, "grad_norm": 1.615594506263733, "learning_rate": 4.954327768997886e-05, "token_acc": 0.7388085147839641, "epoch": 0.4981226533166458, "step": 199}, {"loss": 0.8318412899971008, "grad_norm": 2.8862221240997314, "learning_rate": 4.951963201008076e-05, "token_acc": 0.7566619330047615, "epoch": 0.5006257822277848, "step": 200}, {"loss": 0.8780606389045715, "grad_norm": 1.856955885887146, "learning_rate": 4.949539551333191e-05, "token_acc": 0.7452740722007967, "epoch": 0.5031289111389237, "step": 201}, {"loss": 0.7615805864334106, "grad_norm": 1.9028009176254272, "learning_rate": 4.947056878372681e-05, "token_acc": 0.7806040051679587, "epoch": 0.5056320400500626, "step": 202}, {"loss": 0.8922481536865234, "grad_norm": 1.9965895414352417, "learning_rate": 4.944515241948204e-05, "token_acc": 0.7439118174826967, "epoch": 0.5081351689612015, "step": 203}, {"loss": 0.9746915102005005, "grad_norm": 2.4679484367370605, "learning_rate": 4.9419147033021814e-05, "token_acc": 0.7225560081466396, "epoch": 0.5106382978723404, "step": 204}, {"loss": 0.802959144115448, "grad_norm": 2.7257940769195557, "learning_rate": 4.9392553250963215e-05, "token_acc": 0.7686112156567557, "epoch": 0.5131414267834794, "step": 205}, {"loss": 0.9509553909301758, "grad_norm": 3.264042377471924, "learning_rate": 4.936537171410113e-05, "token_acc": 0.7261368386827071, "epoch": 0.5156445556946183, "step": 206}, {"loss": 0.8793500661849976, "grad_norm": 3.4267592430114746, "learning_rate": 4.933760307739277e-05, "token_acc": 0.7480100363384669, "epoch": 0.5181476846057572, "step": 207}, {"loss": 0.7871251106262207, "grad_norm": 4.144317626953125, "learning_rate": 4.9309248009941914e-05, "token_acc": 0.7663051337671728, "epoch": 0.5206508135168961, "step": 208}, {"loss": 0.9288915395736694, "grad_norm": 11.039412498474121, "learning_rate": 4.92803071949828e-05, "token_acc": 0.7273755047106326, "epoch": 0.523153942428035, "step": 209}, {"loss": 0.9469587802886963, "grad_norm": 1.3589577674865723, "learning_rate": 4.9250781329863606e-05, "token_acc": 0.7330181502010651, "epoch": 0.5256570713391739, "step": 210}, {"loss": 0.922472357749939, "grad_norm": 24.967679977416992, "learning_rate": 4.92206711260297e-05, "token_acc": 0.7295061829497994, "epoch": 0.5281602002503129, "step": 211}, {"loss": 0.9386663436889648, "grad_norm": 5.612998008728027, "learning_rate": 4.9189977309006495e-05, "token_acc": 0.729034504100263, "epoch": 0.5306633291614519, "step": 212}, {"loss": 0.8876584768295288, "grad_norm": 2.4214696884155273, "learning_rate": 4.915870061838193e-05, "token_acc": 0.7409878277153558, "epoch": 0.5331664580725908, "step": 213}, {"loss": 0.8577581644058228, "grad_norm": 2.5469002723693848, "learning_rate": 4.912684180778869e-05, "token_acc": 0.7466870540265036, "epoch": 0.5356695869837297, "step": 214}, {"loss": 0.9847173690795898, "grad_norm": 1.8884869813919067, "learning_rate": 4.9094401644886e-05, "token_acc": 0.7160602660682802, "epoch": 0.5381727158948686, "step": 215}, {"loss": 0.9311186671257019, "grad_norm": 1.4721566438674927, "learning_rate": 4.906138091134118e-05, "token_acc": 0.7331803944059646, "epoch": 0.5406758448060075, "step": 216}, {"loss": 0.7272347807884216, "grad_norm": 3.0583348274230957, "learning_rate": 4.90277804028108e-05, "token_acc": 0.7930695985079023, "epoch": 0.5431789737171464, "step": 217}, {"loss": 0.861505389213562, "grad_norm": 2.5264322757720947, "learning_rate": 4.8993600928921434e-05, "token_acc": 0.7481168230474429, "epoch": 0.5456821026282853, "step": 218}, {"loss": 0.7447217106819153, "grad_norm": 1.6603262424468994, "learning_rate": 4.8958843313250294e-05, "token_acc": 0.7862431800467654, "epoch": 0.5481852315394243, "step": 219}, {"loss": 0.8898584842681885, "grad_norm": 1.4868695735931396, "learning_rate": 4.892350839330522e-05, "token_acc": 0.740379366812227, "epoch": 0.5506883604505632, "step": 220}, {"loss": 0.8423305749893188, "grad_norm": 2.699589729309082, "learning_rate": 4.888759702050466e-05, "token_acc": 0.7540192926045016, "epoch": 0.5531914893617021, "step": 221}, {"loss": 0.8793195486068726, "grad_norm": 2.180371046066284, "learning_rate": 4.885111006015701e-05, "token_acc": 0.7477990405398282, "epoch": 0.5556946182728411, "step": 222}, {"loss": 0.8497090935707092, "grad_norm": 2.203009605407715, "learning_rate": 4.881404839143988e-05, "token_acc": 0.7462110960757781, "epoch": 0.55819774718398, "step": 223}, {"loss": 0.8052700757980347, "grad_norm": 1.6231415271759033, "learning_rate": 4.877641290737884e-05, "token_acc": 0.7610808422912678, "epoch": 0.5607008760951189, "step": 224}, {"loss": 0.8841230869293213, "grad_norm": 2.361985445022583, "learning_rate": 4.873820451482592e-05, "token_acc": 0.7496264419341342, "epoch": 0.5632040050062578, "step": 225}, {"loss": 0.8853447437286377, "grad_norm": 3.28450870513916, "learning_rate": 4.8699424134437765e-05, "token_acc": 0.742984257357974, "epoch": 0.5657071339173968, "step": 226}, {"loss": 0.8390404582023621, "grad_norm": 1.5169377326965332, "learning_rate": 4.8660072700653445e-05, "token_acc": 0.7602164582944579, "epoch": 0.5682102628285357, "step": 227}, {"loss": 0.8904134035110474, "grad_norm": 1.017259120941162, "learning_rate": 4.862015116167196e-05, "token_acc": 0.7438553022794846, "epoch": 0.5707133917396746, "step": 228}, {"loss": 0.8353220820426941, "grad_norm": 2.0630033016204834, "learning_rate": 4.857966047942933e-05, "token_acc": 0.7571183288024038, "epoch": 0.5732165206508135, "step": 229}, {"loss": 0.8920808434486389, "grad_norm": 1.721699833869934, "learning_rate": 4.853860162957552e-05, "token_acc": 0.7390824422214557, "epoch": 0.5757196495619524, "step": 230}, {"loss": 0.6845712065696716, "grad_norm": 2.038731575012207, "learning_rate": 4.849697560145083e-05, "token_acc": 0.8008808955771701, "epoch": 0.5782227784730913, "step": 231}, {"loss": 0.8267085552215576, "grad_norm": 2.1230990886688232, "learning_rate": 4.8454783398062106e-05, "token_acc": 0.7581519720716037, "epoch": 0.5807259073842302, "step": 232}, {"loss": 0.8310796022415161, "grad_norm": 3.591655969619751, "learning_rate": 4.8412026036058566e-05, "token_acc": 0.7544153744836257, "epoch": 0.5832290362953693, "step": 233}, {"loss": 0.8032848238945007, "grad_norm": 36.25672149658203, "learning_rate": 4.836870454570731e-05, "token_acc": 0.7607001230685081, "epoch": 0.5857321652065082, "step": 234}, {"loss": 0.8128241896629333, "grad_norm": 1.4401963949203491, "learning_rate": 4.8324819970868473e-05, "token_acc": 0.757310740639519, "epoch": 0.5882352941176471, "step": 235}, {"loss": 0.8540234565734863, "grad_norm": 10.958834648132324, "learning_rate": 4.828037336897009e-05, "token_acc": 0.74524380963531, "epoch": 0.590738423028786, "step": 236}, {"loss": 0.9761826992034912, "grad_norm": 3.50199556350708, "learning_rate": 4.8235365810982615e-05, "token_acc": 0.7167197154090994, "epoch": 0.5932415519399249, "step": 237}, {"loss": 0.7976563572883606, "grad_norm": 3.497457504272461, "learning_rate": 4.8189798381393104e-05, "token_acc": 0.7626602564102564, "epoch": 0.5957446808510638, "step": 238}, {"loss": 0.8806981444358826, "grad_norm": 3.2434616088867188, "learning_rate": 4.81436721781791e-05, "token_acc": 0.7481954469739034, "epoch": 0.5982478097622027, "step": 239}, {"loss": 0.8493468761444092, "grad_norm": 3.4984254837036133, "learning_rate": 4.8096988312782174e-05, "token_acc": 0.7490117506904207, "epoch": 0.6007509386733417, "step": 240}, {"loss": 0.6916333436965942, "grad_norm": 1.4711133241653442, "learning_rate": 4.8049747910081117e-05, "token_acc": 0.794162491831845, "epoch": 0.6032540675844806, "step": 241}, {"loss": 0.9032708406448364, "grad_norm": 1.8549391031265259, "learning_rate": 4.8001952108364876e-05, "token_acc": 0.7342644900137895, "epoch": 0.6057571964956195, "step": 242}, {"loss": 0.9230173826217651, "grad_norm": 1.721065878868103, "learning_rate": 4.79536020593051e-05, "token_acc": 0.7311291328758578, "epoch": 0.6082603254067585, "step": 243}, {"loss": 0.8387856483459473, "grad_norm": 2.2300896644592285, "learning_rate": 4.7904698927928406e-05, "token_acc": 0.7520661157024794, "epoch": 0.6107634543178974, "step": 244}, {"loss": 0.9396567344665527, "grad_norm": 1.5376681089401245, "learning_rate": 4.785524389258827e-05, "token_acc": 0.7290214555507963, "epoch": 0.6132665832290363, "step": 245}, {"loss": 0.8885030150413513, "grad_norm": 3.0389626026153564, "learning_rate": 4.7805238144936694e-05, "token_acc": 0.7354931107709023, "epoch": 0.6157697121401752, "step": 246}, {"loss": 0.7742225527763367, "grad_norm": 4.214961051940918, "learning_rate": 4.7754682889895446e-05, "token_acc": 0.7741118966570656, "epoch": 0.6182728410513142, "step": 247}, {"loss": 0.8894025683403015, "grad_norm": 1.702107310295105, "learning_rate": 4.7703579345627035e-05, "token_acc": 0.7381677396902732, "epoch": 0.6207759699624531, "step": 248}, {"loss": 0.9064431190490723, "grad_norm": 1.6989673376083374, "learning_rate": 4.765192874350537e-05, "token_acc": 0.7365355965870616, "epoch": 0.623279098873592, "step": 249}, {"loss": 0.744268536567688, "grad_norm": 1.8439379930496216, "learning_rate": 4.759973232808609e-05, "token_acc": 0.7793768780642101, "epoch": 0.6257822277847309, "step": 250}, {"loss": 0.8421927690505981, "grad_norm": 4.3568434715271, "learning_rate": 4.7546991357076544e-05, "token_acc": 0.7551911730901847, "epoch": 0.6282853566958698, "step": 251}, {"loss": 0.8805860280990601, "grad_norm": 1.580527663230896, "learning_rate": 4.749370710130554e-05, "token_acc": 0.7404246461282264, "epoch": 0.6307884856070087, "step": 252}, {"loss": 0.8358674049377441, "grad_norm": 5.8950724601745605, "learning_rate": 4.7439880844692675e-05, "token_acc": 0.753058660141525, "epoch": 0.6332916145181476, "step": 253}, {"loss": 0.7486670017242432, "grad_norm": 2.4937312602996826, "learning_rate": 4.738551388421743e-05, "token_acc": 0.7726565697912403, "epoch": 0.6357947434292867, "step": 254}, {"loss": 0.7166397571563721, "grad_norm": 2.2410449981689453, "learning_rate": 4.7330607529887884e-05, "token_acc": 0.787853730246233, "epoch": 0.6382978723404256, "step": 255}, {"loss": 0.817680835723877, "grad_norm": 0.9600523114204407, "learning_rate": 4.72751631047092e-05, "token_acc": 0.7578717967986773, "epoch": 0.6408010012515645, "step": 256}, {"loss": 0.7929844260215759, "grad_norm": 1.6403498649597168, "learning_rate": 4.721918194465169e-05, "token_acc": 0.7647058823529411, "epoch": 0.6433041301627034, "step": 257}, {"loss": 0.7781978249549866, "grad_norm": 2.6843879222869873, "learning_rate": 4.7162665398618664e-05, "token_acc": 0.7685840012572686, "epoch": 0.6458072590738423, "step": 258}, {"loss": 0.828113317489624, "grad_norm": 1.1330469846725464, "learning_rate": 4.7105614828413906e-05, "token_acc": 0.7519813233396817, "epoch": 0.6483103879849812, "step": 259}, {"loss": 0.8706427812576294, "grad_norm": 1.6353662014007568, "learning_rate": 4.7048031608708876e-05, "token_acc": 0.7472778599274096, "epoch": 0.6508135168961201, "step": 260}, {"loss": 0.9167036414146423, "grad_norm": 1.700364112854004, "learning_rate": 4.698991712700958e-05, "token_acc": 0.7337103615431226, "epoch": 0.6533166458072591, "step": 261}, {"loss": 0.7307888269424438, "grad_norm": 4.744112968444824, "learning_rate": 4.693127278362311e-05, "token_acc": 0.7857924493890206, "epoch": 0.655819774718398, "step": 262}, {"loss": 0.9097830057144165, "grad_norm": 2.0567502975463867, "learning_rate": 4.687209999162396e-05, "token_acc": 0.7335190343546889, "epoch": 0.6583229036295369, "step": 263}, {"loss": 0.9686288833618164, "grad_norm": 1.584566593170166, "learning_rate": 4.681240017681993e-05, "token_acc": 0.7200644430897849, "epoch": 0.6608260325406758, "step": 264}, {"loss": 0.8048110604286194, "grad_norm": 3.126399278640747, "learning_rate": 4.6752174777717786e-05, "token_acc": 0.7667047401484866, "epoch": 0.6633291614518148, "step": 265}, {"loss": 0.8348573446273804, "grad_norm": 3.089082717895508, "learning_rate": 4.6691425245488607e-05, "token_acc": 0.7527571811327809, "epoch": 0.6658322903629537, "step": 266}, {"loss": 0.9513870477676392, "grad_norm": 0.9253506660461426, "learning_rate": 4.6630153043932784e-05, "token_acc": 0.730309423347398, "epoch": 0.6683354192740926, "step": 267}, {"loss": 0.8438987731933594, "grad_norm": 1.5841699838638306, "learning_rate": 4.65683596494448e-05, "token_acc": 0.7552549276311005, "epoch": 0.6708385481852316, "step": 268}, {"loss": 0.8666725158691406, "grad_norm": 1.369858980178833, "learning_rate": 4.650604655097761e-05, "token_acc": 0.7492324010495172, "epoch": 0.6733416770963705, "step": 269}, {"loss": 0.8292583227157593, "grad_norm": 2.27767276763916, "learning_rate": 4.6443215250006806e-05, "token_acc": 0.7594427689214419, "epoch": 0.6758448060075094, "step": 270}, {"loss": 0.7024565935134888, "grad_norm": 1.3438291549682617, "learning_rate": 4.637986726049438e-05, "token_acc": 0.78654883163571, "epoch": 0.6783479349186483, "step": 271}, {"loss": 0.8539745807647705, "grad_norm": 2.168410301208496, "learning_rate": 4.6316004108852305e-05, "token_acc": 0.7467631908673257, "epoch": 0.6808510638297872, "step": 272}, {"loss": 0.8134692907333374, "grad_norm": 2.0540430545806885, "learning_rate": 4.6251627333905724e-05, "token_acc": 0.7603259342511941, "epoch": 0.6833541927409261, "step": 273}, {"loss": 0.7887545824050903, "grad_norm": 7.12939977645874, "learning_rate": 4.618673848685586e-05, "token_acc": 0.7652179873868933, "epoch": 0.685857321652065, "step": 274}, {"loss": 0.7140970230102539, "grad_norm": 2.2455780506134033, "learning_rate": 4.612133913124268e-05, "token_acc": 0.7912922649374711, "epoch": 0.688360450563204, "step": 275}, {"loss": 0.8248931169509888, "grad_norm": 2.3021907806396484, "learning_rate": 4.6055430842907167e-05, "token_acc": 0.756960692559663, "epoch": 0.690863579474343, "step": 276}, {"loss": 0.9142659306526184, "grad_norm": 1.2665908336639404, "learning_rate": 4.59890152099534e-05, "token_acc": 0.731113628887833, "epoch": 0.6933667083854819, "step": 277}, {"loss": 0.8612058162689209, "grad_norm": 1.3562812805175781, "learning_rate": 4.5922093832710236e-05, "token_acc": 0.7461015816440187, "epoch": 0.6958698372966208, "step": 278}, {"loss": 0.7588024139404297, "grad_norm": 1.548026204109192, "learning_rate": 4.585466832369281e-05, "token_acc": 0.7776190118071745, "epoch": 0.6983729662077597, "step": 279}, {"loss": 0.7747074365615845, "grad_norm": 4.4971442222595215, "learning_rate": 4.5786740307563636e-05, "token_acc": 0.7710498712691904, "epoch": 0.7008760951188986, "step": 280}, {"loss": 0.928239107131958, "grad_norm": 2.4977355003356934, "learning_rate": 4.5718311421093454e-05, "token_acc": 0.7275659486234305, "epoch": 0.7033792240300375, "step": 281}, {"loss": 0.856454074382782, "grad_norm": 1.2182586193084717, "learning_rate": 4.5649383313121827e-05, "token_acc": 0.7467900865930128, "epoch": 0.7058823529411765, "step": 282}, {"loss": 0.8874952793121338, "grad_norm": 5.53813362121582, "learning_rate": 4.55799576445174e-05, "token_acc": 0.7408339529828977, "epoch": 0.7083854818523154, "step": 283}, {"loss": 0.7295838594436646, "grad_norm": 1.754224181175232, "learning_rate": 4.551003608813784e-05, "token_acc": 0.7820602120578902, "epoch": 0.7108886107634543, "step": 284}, {"loss": 0.7359857559204102, "grad_norm": 1.7745537757873535, "learning_rate": 4.5439620328789593e-05, "token_acc": 0.7874957869902258, "epoch": 0.7133917396745932, "step": 285}, {"loss": 0.7301020622253418, "grad_norm": 1.9047404527664185, "learning_rate": 4.536871206318723e-05, "token_acc": 0.780550320392009, "epoch": 0.7158948685857321, "step": 286}, {"loss": 0.9152336120605469, "grad_norm": 2.520000696182251, "learning_rate": 4.529731299991262e-05, "token_acc": 0.7370678450740837, "epoch": 0.718397997496871, "step": 287}, {"loss": 0.8424668908119202, "grad_norm": 1.596307635307312, "learning_rate": 4.522542485937369e-05, "token_acc": 0.7530345471521942, "epoch": 0.72090112640801, "step": 288}, {"loss": 0.9505821466445923, "grad_norm": 1.1966215372085571, "learning_rate": 4.5153049373763026e-05, "token_acc": 0.7279186335101465, "epoch": 0.723404255319149, "step": 289}, {"loss": 0.8248058557510376, "grad_norm": 1.554336428642273, "learning_rate": 4.508018828701612e-05, "token_acc": 0.7543579671004174, "epoch": 0.7259073842302879, "step": 290}, {"loss": 0.8745982646942139, "grad_norm": 1.557536005973816, "learning_rate": 4.500684335476936e-05, "token_acc": 0.7485994397759104, "epoch": 0.7284105131414268, "step": 291}, {"loss": 0.9151402711868286, "grad_norm": 1.5448335409164429, "learning_rate": 4.493301634431768e-05, "token_acc": 0.7357596764875795, "epoch": 0.7309136420525657, "step": 292}, {"loss": 0.8075742125511169, "grad_norm": 1.980355143547058, "learning_rate": 4.485870903457204e-05, "token_acc": 0.7581687393318702, "epoch": 0.7334167709637046, "step": 293}, {"loss": 0.8880358934402466, "grad_norm": 5.846746921539307, "learning_rate": 4.478392321601651e-05, "token_acc": 0.7426012638087012, "epoch": 0.7359198998748435, "step": 294}, {"loss": 0.7289685606956482, "grad_norm": 1.4618793725967407, "learning_rate": 4.470866069066516e-05, "token_acc": 0.7879294491348324, "epoch": 0.7384230287859824, "step": 295}, {"loss": 0.7348141074180603, "grad_norm": 2.9660937786102295, "learning_rate": 4.463292327201862e-05, "token_acc": 0.7806614266646893, "epoch": 0.7409261576971214, "step": 296}, {"loss": 0.8414113521575928, "grad_norm": 1.2741750478744507, "learning_rate": 4.455671278502042e-05, "token_acc": 0.75607294260144, "epoch": 0.7434292866082604, "step": 297}, {"loss": 0.7518953084945679, "grad_norm": 3.9552199840545654, "learning_rate": 4.4480031066012916e-05, "token_acc": 0.773398631840796, "epoch": 0.7459324155193993, "step": 298}, {"loss": 0.8302481174468994, "grad_norm": 2.206568479537964, "learning_rate": 4.44028799626932e-05, "token_acc": 0.7567450226384668, "epoch": 0.7484355444305382, "step": 299}, {"loss": 0.8474286794662476, "grad_norm": 3.6707959175109863, "learning_rate": 4.4325261334068426e-05, "token_acc": 0.7506851460339833, "epoch": 0.7509386733416771, "step": 300}, {"loss": 0.9115549325942993, "grad_norm": 2.34222149848938, "learning_rate": 4.4247177050411114e-05, "token_acc": 0.7319790002282583, "epoch": 0.753441802252816, "step": 301}, {"loss": 0.8453834056854248, "grad_norm": 6.066429615020752, "learning_rate": 4.416862899321404e-05, "token_acc": 0.7548794844785922, "epoch": 0.7559449311639549, "step": 302}, {"loss": 0.8790225386619568, "grad_norm": 1.178998589515686, "learning_rate": 4.408961905514491e-05, "token_acc": 0.7391522587841606, "epoch": 0.7584480600750939, "step": 303}, {"loss": 0.7956516146659851, "grad_norm": 1.5657821893692017, "learning_rate": 4.401014914000078e-05, "token_acc": 0.765209244222361, "epoch": 0.7609511889862328, "step": 304}, {"loss": 0.8482795357704163, "grad_norm": 2.5777835845947266, "learning_rate": 4.393022116266212e-05, "token_acc": 0.7480234343893977, "epoch": 0.7634543178973717, "step": 305}, {"loss": 0.7993297576904297, "grad_norm": 4.338641166687012, "learning_rate": 4.384983704904674e-05, "token_acc": 0.7676097675510684, "epoch": 0.7659574468085106, "step": 306}, {"loss": 0.8258683681488037, "grad_norm": 1.3926159143447876, "learning_rate": 4.376899873606336e-05, "token_acc": 0.7580105520525029, "epoch": 0.7684605757196495, "step": 307}, {"loss": 0.7596441507339478, "grad_norm": 9.875060081481934, "learning_rate": 4.3687708171564925e-05, "token_acc": 0.7771428571428571, "epoch": 0.7709637046307884, "step": 308}, {"loss": 0.8504893183708191, "grad_norm": 1.8181976079940796, "learning_rate": 4.360596731430168e-05, "token_acc": 0.7549649532710281, "epoch": 0.7734668335419274, "step": 309}, {"loss": 0.9177985191345215, "grad_norm": 5.018813610076904, "learning_rate": 4.352377813387398e-05, "token_acc": 0.7289770944461876, "epoch": 0.7759699624530664, "step": 310}, {"loss": 0.6803118586540222, "grad_norm": 2.401106595993042, "learning_rate": 4.3441142610684824e-05, "token_acc": 0.7968216827532417, "epoch": 0.7784730913642053, "step": 311}, {"loss": 0.7872037887573242, "grad_norm": 3.502769947052002, "learning_rate": 4.335806273589214e-05, "token_acc": 0.766976635148863, "epoch": 0.7809762202753442, "step": 312}, {"loss": 0.7319408655166626, "grad_norm": 1.664228916168213, "learning_rate": 4.3274540511360793e-05, "token_acc": 0.785088, "epoch": 0.7834793491864831, "step": 313}, {"loss": 0.8201429843902588, "grad_norm": 2.36742901802063, "learning_rate": 4.319057794961437e-05, "token_acc": 0.7595295142670442, "epoch": 0.785982478097622, "step": 314}, {"loss": 0.7904696464538574, "grad_norm": 2.8248369693756104, "learning_rate": 4.310617707378668e-05, "token_acc": 0.7644966656081296, "epoch": 0.7884856070087609, "step": 315}, {"loss": 0.8798209428787231, "grad_norm": 2.83573317527771, "learning_rate": 4.302133991757297e-05, "token_acc": 0.7432513020315669, "epoch": 0.7909887359198998, "step": 316}, {"loss": 0.809928834438324, "grad_norm": 4.348333358764648, "learning_rate": 4.2936068525181e-05, "token_acc": 0.7573623559539052, "epoch": 0.7934918648310388, "step": 317}, {"loss": 0.7483210563659668, "grad_norm": 2.1033623218536377, "learning_rate": 4.285036495128171e-05, "token_acc": 0.7732790525536639, "epoch": 0.7959949937421777, "step": 318}, {"loss": 0.6489171385765076, "grad_norm": 3.518192768096924, "learning_rate": 4.276423126095974e-05, "token_acc": 0.8053108482255222, "epoch": 0.7984981226533167, "step": 319}, {"loss": 0.9405392408370972, "grad_norm": 1.2720087766647339, "learning_rate": 4.267766952966369e-05, "token_acc": 0.7279260780287474, "epoch": 0.8010012515644556, "step": 320}, {"loss": 0.9003595113754272, "grad_norm": 16.282249450683594, "learning_rate": 4.259068184315608e-05, "token_acc": 0.7375758282781147, "epoch": 0.8035043804755945, "step": 321}, {"loss": 0.7392456531524658, "grad_norm": 7.009720802307129, "learning_rate": 4.250327029746309e-05, "token_acc": 0.780937796251732, "epoch": 0.8060075093867334, "step": 322}, {"loss": 0.736973226070404, "grad_norm": 3.936666488647461, "learning_rate": 4.24154369988241e-05, "token_acc": 0.7849452385372192, "epoch": 0.8085106382978723, "step": 323}, {"loss": 0.9145832657814026, "grad_norm": 2.0168962478637695, "learning_rate": 4.23271840636409e-05, "token_acc": 0.7297918528923509, "epoch": 0.8110137672090113, "step": 324}, {"loss": 0.7650183439254761, "grad_norm": 9.376174926757812, "learning_rate": 4.223851361842668e-05, "token_acc": 0.7717954668523246, "epoch": 0.8135168961201502, "step": 325}, {"loss": 0.6287510395050049, "grad_norm": 1.8221909999847412, "learning_rate": 4.214942779975482e-05, "token_acc": 0.8086431962025317, "epoch": 0.8160200250312891, "step": 326}, {"loss": 0.9601121544837952, "grad_norm": 1.7132198810577393, "learning_rate": 4.205992875420742e-05, "token_acc": 0.7224585536516519, "epoch": 0.818523153942428, "step": 327}, {"loss": 0.8077439069747925, "grad_norm": 1.228062391281128, "learning_rate": 4.197001863832355e-05, "token_acc": 0.7587896974243561, "epoch": 0.8210262828535669, "step": 328}, {"loss": 0.8680287599563599, "grad_norm": 1.1111897230148315, "learning_rate": 4.187969961854726e-05, "token_acc": 0.7438457841619053, "epoch": 0.8235294117647058, "step": 329}, {"loss": 0.7376724481582642, "grad_norm": 2.42224383354187, "learning_rate": 4.178897387117546e-05, "token_acc": 0.7866793832459068, "epoch": 0.8260325406758448, "step": 330}, {"loss": 0.6727076768875122, "grad_norm": 3.612968683242798, "learning_rate": 4.169784358230541e-05, "token_acc": 0.8009418583589929, "epoch": 0.8285356695869838, "step": 331}, {"loss": 0.7970181703567505, "grad_norm": 4.89116907119751, "learning_rate": 4.1606310947782044e-05, "token_acc": 0.764037733427453, "epoch": 0.8310387984981227, "step": 332}, {"loss": 0.7304867506027222, "grad_norm": 12.484292984008789, "learning_rate": 4.151437817314513e-05, "token_acc": 0.7838243886153076, "epoch": 0.8335419274092616, "step": 333}, {"loss": 0.8944374918937683, "grad_norm": 1.9448401927947998, "learning_rate": 4.142204747357604e-05, "token_acc": 0.7394788423844114, "epoch": 0.8360450563204005, "step": 334}, {"loss": 0.8854318261146545, "grad_norm": 1.2170294523239136, "learning_rate": 4.1329321073844415e-05, "token_acc": 0.7471004579789449, "epoch": 0.8385481852315394, "step": 335}, {"loss": 0.7527574300765991, "grad_norm": 2.639364242553711, "learning_rate": 4.123620120825459e-05, "token_acc": 0.7784949622166247, "epoch": 0.8410513141426783, "step": 336}, {"loss": 0.8323843479156494, "grad_norm": 2.7264010906219482, "learning_rate": 4.114269012059169e-05, "token_acc": 0.7546558704453441, "epoch": 0.8435544430538173, "step": 337}, {"loss": 0.8271874785423279, "grad_norm": 2.749450922012329, "learning_rate": 4.104879006406758e-05, "token_acc": 0.7616862256605258, "epoch": 0.8460575719649562, "step": 338}, {"loss": 0.6345349550247192, "grad_norm": 3.2195448875427246, "learning_rate": 4.095450330126663e-05, "token_acc": 0.8157239416577731, "epoch": 0.8485607008760951, "step": 339}, {"loss": 0.7386264801025391, "grad_norm": 2.691843032836914, "learning_rate": 4.085983210409114e-05, "token_acc": 0.7827135845603527, "epoch": 0.851063829787234, "step": 340}, {"loss": 0.8243026733398438, "grad_norm": 1.2783466577529907, "learning_rate": 4.07647787537066e-05, "token_acc": 0.7568028970512157, "epoch": 0.853566958698373, "step": 341}, {"loss": 0.6981653571128845, "grad_norm": 4.061293601989746, "learning_rate": 4.066934554048674e-05, "token_acc": 0.7869034406215316, "epoch": 0.8560700876095119, "step": 342}, {"loss": 0.8307587504386902, "grad_norm": 1.5013890266418457, "learning_rate": 4.0573534763958355e-05, "token_acc": 0.7530202301808564, "epoch": 0.8585732165206508, "step": 343}, {"loss": 0.8721674084663391, "grad_norm": 1.6979941129684448, "learning_rate": 4.047734873274586e-05, "token_acc": 0.7437897299490555, "epoch": 0.8610763454317898, "step": 344}, {"loss": 0.853046715259552, "grad_norm": 1.435498595237732, "learning_rate": 4.038078976451567e-05, "token_acc": 0.7511126133738945, "epoch": 0.8635794743429287, "step": 345}, {"loss": 0.75436931848526, "grad_norm": 1.627124309539795, "learning_rate": 4.028386018592041e-05, "token_acc": 0.7807899207248018, "epoch": 0.8660826032540676, "step": 346}, {"loss": 0.8141796588897705, "grad_norm": 1.9693089723587036, "learning_rate": 4.018656233254278e-05, "token_acc": 0.7617304492512479, "epoch": 0.8685857321652065, "step": 347}, {"loss": 0.7092435956001282, "grad_norm": 1.6429239511489868, "learning_rate": 4.008889854883929e-05, "token_acc": 0.7868140171908945, "epoch": 0.8710888610763454, "step": 348}, {"loss": 0.8962076306343079, "grad_norm": 7.14348030090332, "learning_rate": 3.999087118808381e-05, "token_acc": 0.7408736260607096, "epoch": 0.8735919899874843, "step": 349}, {"loss": 0.9180400967597961, "grad_norm": 2.5628302097320557, "learning_rate": 3.9892482612310836e-05, "token_acc": 0.7306018168054504, "epoch": 0.8760951188986232, "step": 350}, {"loss": 0.9172283411026001, "grad_norm": 1.3269526958465576, "learning_rate": 3.979373519225858e-05, "token_acc": 0.7335147904683649, "epoch": 0.8785982478097623, "step": 351}, {"loss": 0.8858950138092041, "grad_norm": 1.101183533668518, "learning_rate": 3.969463130731183e-05, "token_acc": 0.7399414146635651, "epoch": 0.8811013767209012, "step": 352}, {"loss": 0.8181067705154419, "grad_norm": 1.8363860845565796, "learning_rate": 3.959517334544466e-05, "token_acc": 0.7508903586873569, "epoch": 0.8836045056320401, "step": 353}, {"loss": 0.8596831560134888, "grad_norm": 2.2015419006347656, "learning_rate": 3.949536370316285e-05, "token_acc": 0.7492807233867653, "epoch": 0.886107634543179, "step": 354}, {"loss": 0.9282140731811523, "grad_norm": 1.0442819595336914, "learning_rate": 3.939520478544614e-05, "token_acc": 0.7278686978257793, "epoch": 0.8886107634543179, "step": 355}, {"loss": 0.8907036781311035, "grad_norm": 1.5046483278274536, "learning_rate": 3.9294699005690305e-05, "token_acc": 0.7428094799815923, "epoch": 0.8911138923654568, "step": 356}, {"loss": 0.8503479957580566, "grad_norm": 1.1432298421859741, "learning_rate": 3.919384878564902e-05, "token_acc": 0.7529302541487757, "epoch": 0.8936170212765957, "step": 357}, {"loss": 0.7433081865310669, "grad_norm": 3.0036914348602295, "learning_rate": 3.909265655537542e-05, "token_acc": 0.7839231981659264, "epoch": 0.8961201501877347, "step": 358}, {"loss": 0.7551373243331909, "grad_norm": 4.806852340698242, "learning_rate": 3.899112475316366e-05, "token_acc": 0.7743180125905368, "epoch": 0.8986232790988736, "step": 359}, {"loss": 0.8357230424880981, "grad_norm": 1.2542036771774292, "learning_rate": 3.888925582549006e-05, "token_acc": 0.7519669661291223, "epoch": 0.9011264080100125, "step": 360}, {"loss": 0.8465045690536499, "grad_norm": 1.6473242044448853, "learning_rate": 3.8787052226954234e-05, "token_acc": 0.7557243682991218, "epoch": 0.9036295369211514, "step": 361}, {"loss": 0.822354793548584, "grad_norm": 13.783917427062988, "learning_rate": 3.868451642021992e-05, "token_acc": 0.7519634703196347, "epoch": 0.9061326658322904, "step": 362}, {"loss": 0.7651307582855225, "grad_norm": 1.7439008951187134, "learning_rate": 3.8581650875955585e-05, "token_acc": 0.7751344989912575, "epoch": 0.9086357947434293, "step": 363}, {"loss": 0.6929699182510376, "grad_norm": 1.6299248933792114, "learning_rate": 3.847845807277502e-05, "token_acc": 0.7872272907576359, "epoch": 0.9111389236545682, "step": 364}, {"loss": 0.735326886177063, "grad_norm": 2.1659955978393555, "learning_rate": 3.8374940497177434e-05, "token_acc": 0.7798106242978655, "epoch": 0.9136420525657072, "step": 365}, {"loss": 0.8066057562828064, "grad_norm": 2.080213785171509, "learning_rate": 3.827110064348773e-05, "token_acc": 0.757124183006536, "epoch": 0.9161451814768461, "step": 366}, {"loss": 0.8618408441543579, "grad_norm": 2.8970141410827637, "learning_rate": 3.816694101379631e-05, "token_acc": 0.7464049867308523, "epoch": 0.918648310387985, "step": 367}, {"loss": 0.6792800426483154, "grad_norm": 1.7472279071807861, "learning_rate": 3.8062464117898724e-05, "token_acc": 0.7940572856250557, "epoch": 0.9211514392991239, "step": 368}, {"loss": 0.9245332479476929, "grad_norm": 5.283840656280518, "learning_rate": 3.795767247323533e-05, "token_acc": 0.7269049524317596, "epoch": 0.9236545682102628, "step": 369}, {"loss": 0.7491408586502075, "grad_norm": 1.9213547706604004, "learning_rate": 3.785256860483054e-05, "token_acc": 0.7738063244647496, "epoch": 0.9261576971214017, "step": 370}, {"loss": 0.8408378958702087, "grad_norm": 1.4675709009170532, "learning_rate": 3.774715504523202e-05, "token_acc": 0.7509755232351898, "epoch": 0.9286608260325406, "step": 371}, {"loss": 0.9089862704277039, "grad_norm": 1.2374870777130127, "learning_rate": 3.764143433444962e-05, "token_acc": 0.7278328611898017, "epoch": 0.9311639549436797, "step": 372}, {"loss": 0.8130977153778076, "grad_norm": 2.368098497390747, "learning_rate": 3.753540901989423e-05, "token_acc": 0.7584136918066288, "epoch": 0.9336670838548186, "step": 373}, {"loss": 0.8318907618522644, "grad_norm": 4.070181846618652, "learning_rate": 3.742908165631636e-05, "token_acc": 0.7538795370857444, "epoch": 0.9361702127659575, "step": 374}, {"loss": 0.8522058725357056, "grad_norm": 3.8024885654449463, "learning_rate": 3.7322454805744605e-05, "token_acc": 0.7481334654773704, "epoch": 0.9386733416770964, "step": 375}, {"loss": 0.7708778381347656, "grad_norm": 8.243106842041016, "learning_rate": 3.721553103742388e-05, "token_acc": 0.7737909516380655, "epoch": 0.9411764705882353, "step": 376}, {"loss": 0.7590352296829224, "grad_norm": 1.9439160823822021, "learning_rate": 3.710831292775353e-05, "token_acc": 0.7700546946216955, "epoch": 0.9436795994993742, "step": 377}, {"loss": 0.7222952842712402, "grad_norm": 3.2804136276245117, "learning_rate": 3.7000803060225284e-05, "token_acc": 0.7838400666389005, "epoch": 0.9461827284105131, "step": 378}, {"loss": 0.820694088935852, "grad_norm": 1.783825159072876, "learning_rate": 3.689300402536093e-05, "token_acc": 0.7568910159326346, "epoch": 0.9486858573216521, "step": 379}, {"loss": 0.8228154182434082, "grad_norm": 1.5094672441482544, "learning_rate": 3.678491842064995e-05, "token_acc": 0.7563206708169229, "epoch": 0.951188986232791, "step": 380}, {"loss": 0.8268698453903198, "grad_norm": 1.2823344469070435, "learning_rate": 3.6676548850486915e-05, "token_acc": 0.7545756682113935, "epoch": 0.9536921151439299, "step": 381}, {"loss": 0.7393025159835815, "grad_norm": 2.020446538925171, "learning_rate": 3.6567897926108756e-05, "token_acc": 0.7798188874514878, "epoch": 0.9561952440550688, "step": 382}, {"loss": 0.7484114766120911, "grad_norm": 1.6527626514434814, "learning_rate": 3.645896826553178e-05, "token_acc": 0.7755332780583403, "epoch": 0.9586983729662077, "step": 383}, {"loss": 0.6126949787139893, "grad_norm": 1.587301254272461, "learning_rate": 3.634976249348867e-05, "token_acc": 0.8158403090792016, "epoch": 0.9612015018773467, "step": 384}, {"loss": 0.7998955249786377, "grad_norm": 5.484954833984375, "learning_rate": 3.624028324136517e-05, "token_acc": 0.7629840381926026, "epoch": 0.9637046307884856, "step": 385}, {"loss": 0.7720030546188354, "grad_norm": 1.513581395149231, "learning_rate": 3.613053314713671e-05, "token_acc": 0.767228370221328, "epoch": 0.9662077596996246, "step": 386}, {"loss": 0.9072454571723938, "grad_norm": 3.6025302410125732, "learning_rate": 3.602051485530486e-05, "token_acc": 0.7304942652882785, "epoch": 0.9687108886107635, "step": 387}, {"loss": 0.7592995166778564, "grad_norm": 1.7113579511642456, "learning_rate": 3.591023101683355e-05, "token_acc": 0.7736043397651583, "epoch": 0.9712140175219024, "step": 388}, {"loss": 0.9248221516609192, "grad_norm": 1.5886659622192383, "learning_rate": 3.57996842890853e-05, "token_acc": 0.7291666666666666, "epoch": 0.9737171464330413, "step": 389}, {"loss": 0.6640578508377075, "grad_norm": 1.904639482498169, "learning_rate": 3.568887733575706e-05, "token_acc": 0.8030723277149563, "epoch": 0.9762202753441802, "step": 390}, {"loss": 0.8066322803497314, "grad_norm": 4.676436424255371, "learning_rate": 3.55778128268161e-05, "token_acc": 0.7604322527015794, "epoch": 0.9787234042553191, "step": 391}, {"loss": 0.7747057676315308, "grad_norm": 2.244272470474243, "learning_rate": 3.54664934384357e-05, "token_acc": 0.7657098525989139, "epoch": 0.981226533166458, "step": 392}, {"loss": 0.7859742045402527, "grad_norm": 3.2416160106658936, "learning_rate": 3.5354921852930594e-05, "token_acc": 0.7659952983035772, "epoch": 0.983729662077597, "step": 393}, {"loss": 0.7290835976600647, "grad_norm": 3.806647300720215, "learning_rate": 3.5243100758692386e-05, "token_acc": 0.7793145441892833, "epoch": 0.986232790988736, "step": 394}, {"loss": 0.8180262446403503, "grad_norm": 2.6771068572998047, "learning_rate": 3.513103285012475e-05, "token_acc": 0.7598081952920662, "epoch": 0.9887359198998749, "step": 395}, {"loss": 0.7300944328308105, "grad_norm": 1.7483131885528564, "learning_rate": 3.5018720827578524e-05, "token_acc": 0.7814569536423841, "epoch": 0.9912390488110138, "step": 396}, {"loss": 0.7564259767532349, "grad_norm": 1.995330572128296, "learning_rate": 3.4906167397286646e-05, "token_acc": 0.7783770729351152, "epoch": 0.9937421777221527, "step": 397}, {"loss": 0.7041178941726685, "grad_norm": 2.2668654918670654, "learning_rate": 3.47933752712989e-05, "token_acc": 0.7913291605301914, "epoch": 0.9962453066332916, "step": 398}, {"loss": 0.8539732694625854, "grad_norm": 1.306915283203125, "learning_rate": 3.468034716741664e-05, "token_acc": 0.7481962912169817, "epoch": 0.9987484355444305, "step": 399}, {"loss": 0.7418760061264038, "grad_norm": 1.7704166173934937, "learning_rate": 3.456708580912725e-05, "token_acc": 0.776519052523172, "epoch": 1.0, "step": 400}, {"loss": 0.7428221702575684, "grad_norm": 43.9930305480957, "learning_rate": 3.4453593925538515e-05, "token_acc": 0.7772024037846823, "epoch": 1.002503128911139, "step": 401}, {"loss": 0.8528105616569519, "grad_norm": 1.5584815740585327, "learning_rate": 3.433987425131291e-05, "token_acc": 0.7449437659892841, "epoch": 1.0050062578222778, "step": 402}, {"loss": 0.7428395748138428, "grad_norm": 7.336424350738525, "learning_rate": 3.4225929526601664e-05, "token_acc": 0.7766206412356658, "epoch": 1.0075093867334168, "step": 403}, {"loss": 0.631352424621582, "grad_norm": 1.4825217723846436, "learning_rate": 3.411176249697875e-05, "token_acc": 0.8065062053403536, "epoch": 1.0100125156445556, "step": 404}, {"loss": 0.7537027597427368, "grad_norm": 1.484767198562622, "learning_rate": 3.399737591337471e-05, "token_acc": 0.7765481064483112, "epoch": 1.0125156445556946, "step": 405}, {"loss": 0.796688437461853, "grad_norm": 2.6845622062683105, "learning_rate": 3.388277253201041e-05, "token_acc": 0.7627060907480583, "epoch": 1.0150187734668334, "step": 406}, {"loss": 0.8054678440093994, "grad_norm": 2.6031534671783447, "learning_rate": 3.3767955114330586e-05, "token_acc": 0.764444165935581, "epoch": 1.0175219023779725, "step": 407}, {"loss": 0.8387413024902344, "grad_norm": 1.357327938079834, "learning_rate": 3.365292642693732e-05, "token_acc": 0.7472088911341248, "epoch": 1.0200250312891115, "step": 408}, {"loss": 0.6938782930374146, "grad_norm": 2.586324453353882, "learning_rate": 3.353768924152341e-05, "token_acc": 0.7910919792673284, "epoch": 1.0225281602002503, "step": 409}, {"loss": 0.9054546356201172, "grad_norm": 1.2863296270370483, "learning_rate": 3.34222463348055e-05, "token_acc": 0.7378970871815691, "epoch": 1.0250312891113893, "step": 410}, {"loss": 0.7409943342208862, "grad_norm": 1.5208131074905396, "learning_rate": 3.330660048845727e-05, "token_acc": 0.7748617945446814, "epoch": 1.027534418022528, "step": 411}, {"loss": 0.8802088499069214, "grad_norm": 1.7728694677352905, "learning_rate": 3.319075448904234e-05, "token_acc": 0.737257519830362, "epoch": 1.0300375469336671, "step": 412}, {"loss": 0.6349403262138367, "grad_norm": 2.1131184101104736, "learning_rate": 3.307471112794715e-05, "token_acc": 0.8154147750722245, "epoch": 1.032540675844806, "step": 413}, {"loss": 0.7536982893943787, "grad_norm": 2.6038410663604736, "learning_rate": 3.2958473201313744e-05, "token_acc": 0.7783753361265712, "epoch": 1.035043804755945, "step": 414}, {"loss": 0.8465015888214111, "grad_norm": 0.7469914555549622, "learning_rate": 3.284204350997229e-05, "token_acc": 0.7492382217360731, "epoch": 1.037546933667084, "step": 415}, {"loss": 0.8175340294837952, "grad_norm": 2.318094253540039, "learning_rate": 3.272542485937369e-05, "token_acc": 0.7576262710451742, "epoch": 1.0400500625782227, "step": 416}, {"loss": 0.8715943098068237, "grad_norm": 2.7602827548980713, "learning_rate": 3.260862005952193e-05, "token_acc": 0.743643826245582, "epoch": 1.0425531914893618, "step": 417}, {"loss": 0.7801544070243835, "grad_norm": 1.7321751117706299, "learning_rate": 3.2491631924906416e-05, "token_acc": 0.7639452626696045, "epoch": 1.0450563204005006, "step": 418}, {"loss": 0.6660053730010986, "grad_norm": 30.08856201171875, "learning_rate": 3.23744632744341e-05, "token_acc": 0.7974683544303798, "epoch": 1.0475594493116396, "step": 419}, {"loss": 0.6206501722335815, "grad_norm": 10.824769973754883, "learning_rate": 3.225711693136156e-05, "token_acc": 0.8082563824008691, "epoch": 1.0500625782227784, "step": 420}, {"loss": 0.8174914121627808, "grad_norm": 6.584616661071777, "learning_rate": 3.2139595723227054e-05, "token_acc": 0.7598479154692958, "epoch": 1.0525657071339174, "step": 421}, {"loss": 0.802627682685852, "grad_norm": 1.7321393489837646, "learning_rate": 3.202190248178231e-05, "token_acc": 0.7602137986115377, "epoch": 1.0550688360450564, "step": 422}, {"loss": 0.6920569539070129, "grad_norm": 1.9569984674453735, "learning_rate": 3.190404004292427e-05, "token_acc": 0.7928679144859399, "epoch": 1.0575719649561952, "step": 423}, {"loss": 0.8527140021324158, "grad_norm": 1.5589165687561035, "learning_rate": 3.178601124662686e-05, "token_acc": 0.7463035747707281, "epoch": 1.0600750938673342, "step": 424}, {"loss": 0.7492550015449524, "grad_norm": 4.186975002288818, "learning_rate": 3.1667818936872465e-05, "token_acc": 0.7705152671755725, "epoch": 1.062578222778473, "step": 425}, {"loss": 0.7724304795265198, "grad_norm": 1.757791519165039, "learning_rate": 3.154946596158344e-05, "token_acc": 0.7690384787072583, "epoch": 1.065081351689612, "step": 426}, {"loss": 0.8095215559005737, "grad_norm": 3.0420734882354736, "learning_rate": 3.14309551725535e-05, "token_acc": 0.7658398397015131, "epoch": 1.0675844806007508, "step": 427}, {"loss": 0.6501023173332214, "grad_norm": 1.704030156135559, "learning_rate": 3.131228942537895e-05, "token_acc": 0.8044284859365649, "epoch": 1.0700876095118899, "step": 428}, {"loss": 0.7734176516532898, "grad_norm": 2.9102675914764404, "learning_rate": 3.119347157938996e-05, "token_acc": 0.7695846562560746, "epoch": 1.0725907384230289, "step": 429}, {"loss": 0.7924395799636841, "grad_norm": 1.7218647003173828, "learning_rate": 3.10745044975816e-05, "token_acc": 0.769767294401116, "epoch": 1.0750938673341677, "step": 430}, {"loss": 0.8065544366836548, "grad_norm": 3.255305051803589, "learning_rate": 3.095539104654487e-05, "token_acc": 0.76478578892372, "epoch": 1.0775969962453067, "step": 431}, {"loss": 0.8923381567001343, "grad_norm": 1.2878748178482056, "learning_rate": 3.083613409639764e-05, "token_acc": 0.7387548536276777, "epoch": 1.0801001251564455, "step": 432}, {"loss": 0.8253895044326782, "grad_norm": 1.4100399017333984, "learning_rate": 3.071673652071549e-05, "token_acc": 0.7540562052286781, "epoch": 1.0826032540675845, "step": 433}, {"loss": 0.6606812477111816, "grad_norm": 1.6869633197784424, "learning_rate": 3.0597201196462463e-05, "token_acc": 0.7974853761850332, "epoch": 1.0851063829787233, "step": 434}, {"loss": 0.8390290141105652, "grad_norm": 1.2705729007720947, "learning_rate": 3.0477531003921745e-05, "token_acc": 0.7539678436643747, "epoch": 1.0876095118898623, "step": 435}, {"loss": 0.7374899387359619, "grad_norm": 4.0343170166015625, "learning_rate": 3.035772882662627e-05, "token_acc": 0.7784767467984722, "epoch": 1.0901126408010013, "step": 436}, {"loss": 0.8265960812568665, "grad_norm": 31.51459503173828, "learning_rate": 3.0237797551289228e-05, "token_acc": 0.754416435093291, "epoch": 1.0926157697121401, "step": 437}, {"loss": 0.8250342607498169, "grad_norm": 1.898342251777649, "learning_rate": 3.0117740067734495e-05, "token_acc": 0.7517792771975229, "epoch": 1.0951188986232792, "step": 438}, {"loss": 0.6548107266426086, "grad_norm": 1.7603737115859985, "learning_rate": 2.9997559268827048e-05, "token_acc": 0.802406330749354, "epoch": 1.097622027534418, "step": 439}, {"loss": 0.49500739574432373, "grad_norm": 1.681059718132019, "learning_rate": 2.9877258050403212e-05, "token_acc": 0.8484848484848485, "epoch": 1.100125156445557, "step": 440}, {"loss": 0.8611985445022583, "grad_norm": 2.323869228363037, "learning_rate": 2.97568393112009e-05, "token_acc": 0.7459963793343546, "epoch": 1.1026282853566958, "step": 441}, {"loss": 0.6335822343826294, "grad_norm": 3.4705965518951416, "learning_rate": 2.963630595278977e-05, "token_acc": 0.8075504658385093, "epoch": 1.1051314142678348, "step": 442}, {"loss": 0.7141144275665283, "grad_norm": 1.9544960260391235, "learning_rate": 2.9515660879501316e-05, "token_acc": 0.7871103060348937, "epoch": 1.1076345431789738, "step": 443}, {"loss": 0.8509359359741211, "grad_norm": 2.912339687347412, "learning_rate": 2.9394906998358868e-05, "token_acc": 0.7441022743325328, "epoch": 1.1101376720901126, "step": 444}, {"loss": 0.7909557819366455, "grad_norm": 0.9381941556930542, "learning_rate": 2.9274047219007534e-05, "token_acc": 0.7587197373820271, "epoch": 1.1126408010012516, "step": 445}, {"loss": 0.8439774513244629, "grad_norm": 1.41623055934906, "learning_rate": 2.9153084453644135e-05, "token_acc": 0.7494344152546285, "epoch": 1.1151439299123904, "step": 446}, {"loss": 0.7694572806358337, "grad_norm": 1.3373831510543823, "learning_rate": 2.9032021616947015e-05, "token_acc": 0.7675036214389184, "epoch": 1.1176470588235294, "step": 447}, {"loss": 0.7465448975563049, "grad_norm": 1.8616464138031006, "learning_rate": 2.8910861626005776e-05, "token_acc": 0.7760096282428457, "epoch": 1.1201501877346682, "step": 448}, {"loss": 0.5976338386535645, "grad_norm": 2.0417370796203613, "learning_rate": 2.878960740025103e-05, "token_acc": 0.8209215731905981, "epoch": 1.1226533166458073, "step": 449}, {"loss": 0.6721420288085938, "grad_norm": 1.513850450515747, "learning_rate": 2.8668261861384045e-05, "token_acc": 0.7959154424937298, "epoch": 1.1251564455569463, "step": 450}, {"loss": 0.6924934387207031, "grad_norm": 2.1121175289154053, "learning_rate": 2.854682793330633e-05, "token_acc": 0.7926174496644295, "epoch": 1.127659574468085, "step": 451}, {"loss": 0.6902682185173035, "grad_norm": 1.8427212238311768, "learning_rate": 2.8425308542049206e-05, "token_acc": 0.7945113788487282, "epoch": 1.130162703379224, "step": 452}, {"loss": 0.8199548721313477, "grad_norm": 2.8109426498413086, "learning_rate": 2.8303706615703253e-05, "token_acc": 0.7543770616594773, "epoch": 1.1326658322903629, "step": 453}, {"loss": 0.9140053391456604, "grad_norm": 2.637247085571289, "learning_rate": 2.8182025084347836e-05, "token_acc": 0.7342447756291826, "epoch": 1.135168961201502, "step": 454}, {"loss": 0.6925473213195801, "grad_norm": 2.070204734802246, "learning_rate": 2.8060266879980408e-05, "token_acc": 0.7881796251623678, "epoch": 1.1376720901126407, "step": 455}, {"loss": 0.7441434860229492, "grad_norm": 1.8393173217773438, "learning_rate": 2.7938434936445945e-05, "token_acc": 0.7766430457134917, "epoch": 1.1401752190237797, "step": 456}, {"loss": 0.7810814380645752, "grad_norm": 4.779657363891602, "learning_rate": 2.7816532189366197e-05, "token_acc": 0.7622206393019322, "epoch": 1.1426783479349187, "step": 457}, {"loss": 0.7876262664794922, "grad_norm": 1.8170710802078247, "learning_rate": 2.7694561576068985e-05, "token_acc": 0.7685871709407524, "epoch": 1.1451814768460575, "step": 458}, {"loss": 0.8328777551651001, "grad_norm": 0.9989718794822693, "learning_rate": 2.757252603551741e-05, "token_acc": 0.7498996386993175, "epoch": 1.1476846057571966, "step": 459}, {"loss": 0.8748979568481445, "grad_norm": 4.568758964538574, "learning_rate": 2.7450428508239024e-05, "token_acc": 0.7450868070855733, "epoch": 1.1501877346683353, "step": 460}, {"loss": 0.8182597756385803, "grad_norm": 8.470266342163086, "learning_rate": 2.7328271936254995e-05, "token_acc": 0.7555555555555555, "epoch": 1.1526908635794744, "step": 461}, {"loss": 0.7683885097503662, "grad_norm": 1.7657190561294556, "learning_rate": 2.7206059263009244e-05, "token_acc": 0.7742563247150404, "epoch": 1.1551939924906134, "step": 462}, {"loss": 0.8530595302581787, "grad_norm": 5.895107746124268, "learning_rate": 2.7083793433297438e-05, "token_acc": 0.7451071400943761, "epoch": 1.1576971214017522, "step": 463}, {"loss": 0.7786663174629211, "grad_norm": 1.7480491399765015, "learning_rate": 2.6961477393196126e-05, "token_acc": 0.7678157443806068, "epoch": 1.1602002503128912, "step": 464}, {"loss": 0.7121521830558777, "grad_norm": 2.044475793838501, "learning_rate": 2.683911408999169e-05, "token_acc": 0.7803991336633663, "epoch": 1.16270337922403, "step": 465}, {"loss": 0.6376701593399048, "grad_norm": 5.003326416015625, "learning_rate": 2.6716706472109342e-05, "token_acc": 0.8067076051015588, "epoch": 1.165206508135169, "step": 466}, {"loss": 0.5150684118270874, "grad_norm": 12.686973571777344, "learning_rate": 2.659425748904212e-05, "token_acc": 0.8459984285553934, "epoch": 1.1677096370463078, "step": 467}, {"loss": 0.7467551827430725, "grad_norm": 3.0933218002319336, "learning_rate": 2.6471770091279724e-05, "token_acc": 0.7779315435003229, "epoch": 1.1702127659574468, "step": 468}, {"loss": 0.7138000130653381, "grad_norm": 5.490667819976807, "learning_rate": 2.6349247230237552e-05, "token_acc": 0.7884847818920998, "epoch": 1.1727158948685856, "step": 469}, {"loss": 0.8333462476730347, "grad_norm": 1.2807576656341553, "learning_rate": 2.6226691858185454e-05, "token_acc": 0.749974967457695, "epoch": 1.1752190237797246, "step": 470}, {"loss": 0.7134934067726135, "grad_norm": 10.077444076538086, "learning_rate": 2.6104106928176687e-05, "token_acc": 0.781946749404719, "epoch": 1.1777221526908637, "step": 471}, {"loss": 0.8703588247299194, "grad_norm": 1.7063714265823364, "learning_rate": 2.598149539397672e-05, "token_acc": 0.7454706834438469, "epoch": 1.1802252816020025, "step": 472}, {"loss": 0.7841652035713196, "grad_norm": 1.9840588569641113, "learning_rate": 2.585886020999206e-05, "token_acc": 0.7653958944281525, "epoch": 1.1827284105131415, "step": 473}, {"loss": 0.8311939835548401, "grad_norm": 1.917015552520752, "learning_rate": 2.5736204331199088e-05, "token_acc": 0.7580409820465648, "epoch": 1.1852315394242803, "step": 474}, {"loss": 0.8065941333770752, "grad_norm": 1.1762555837631226, "learning_rate": 2.561353071307281e-05, "token_acc": 0.7605049383437554, "epoch": 1.1877346683354193, "step": 475}, {"loss": 0.6642436385154724, "grad_norm": 2.9361069202423096, "learning_rate": 2.5490842311515707e-05, "token_acc": 0.8024132730015083, "epoch": 1.1902377972465583, "step": 476}, {"loss": 0.7668801546096802, "grad_norm": 4.613530158996582, "learning_rate": 2.5368142082786466e-05, "token_acc": 0.7748182105595953, "epoch": 1.1927409261576971, "step": 477}, {"loss": 0.9035181999206543, "grad_norm": 1.097956657409668, "learning_rate": 2.5245432983428747e-05, "token_acc": 0.7342191332788226, "epoch": 1.1952440550688361, "step": 478}, {"loss": 0.851319432258606, "grad_norm": 1.8363292217254639, "learning_rate": 2.5122717970199956e-05, "token_acc": 0.7467151074780503, "epoch": 1.197747183979975, "step": 479}, {"loss": 0.7173365354537964, "grad_norm": 1.2292267084121704, "learning_rate": 2.5e-05, "token_acc": 0.7852402654513473, "epoch": 1.200250312891114, "step": 480}, {"loss": 0.7570571899414062, "grad_norm": 1.13339102268219, "learning_rate": 2.4877282029800053e-05, "token_acc": 0.7718512153204027, "epoch": 1.2027534418022527, "step": 481}, {"loss": 0.8463850021362305, "grad_norm": 2.553258180618286, "learning_rate": 2.4754567016571263e-05, "token_acc": 0.7462981243830207, "epoch": 1.2052565707133918, "step": 482}, {"loss": 0.7410565614700317, "grad_norm": 1.9682620763778687, "learning_rate": 2.4631857917213543e-05, "token_acc": 0.7786700125470515, "epoch": 1.2077596996245306, "step": 483}, {"loss": 0.8274058103561401, "grad_norm": 1.0788750648498535, "learning_rate": 2.4509157688484295e-05, "token_acc": 0.7513348996155489, "epoch": 1.2102628285356696, "step": 484}, {"loss": 0.8381744027137756, "grad_norm": 1.1234153509140015, "learning_rate": 2.4386469286927196e-05, "token_acc": 0.7476648740447212, "epoch": 1.2127659574468086, "step": 485}, {"loss": 0.8004180192947388, "grad_norm": 2.8939898014068604, "learning_rate": 2.426379566880092e-05, "token_acc": 0.7646108937333085, "epoch": 1.2152690863579474, "step": 486}, {"loss": 0.8478291034698486, "grad_norm": 3.46976637840271, "learning_rate": 2.414113979000794e-05, "token_acc": 0.7513809354887752, "epoch": 1.2177722152690864, "step": 487}, {"loss": 0.7109798192977905, "grad_norm": 2.4108669757843018, "learning_rate": 2.4018504606023293e-05, "token_acc": 0.7838756326825741, "epoch": 1.2202753441802252, "step": 488}, {"loss": 0.8232313394546509, "grad_norm": 5.502831935882568, "learning_rate": 2.389589307182332e-05, "token_acc": 0.7541480718617691, "epoch": 1.2227784730913642, "step": 489}, {"loss": 0.6895003914833069, "grad_norm": 5.164613246917725, "learning_rate": 2.3773308141814552e-05, "token_acc": 0.7904873671130747, "epoch": 1.2252816020025032, "step": 490}, {"loss": 0.8953061699867249, "grad_norm": 2.992577314376831, "learning_rate": 2.365075276976245e-05, "token_acc": 0.7334460411383489, "epoch": 1.227784730913642, "step": 491}, {"loss": 0.6675305962562561, "grad_norm": 3.0780115127563477, "learning_rate": 2.3528229908720272e-05, "token_acc": 0.7988102636952854, "epoch": 1.230287859824781, "step": 492}, {"loss": 0.7906989455223083, "grad_norm": 2.8056156635284424, "learning_rate": 2.3405742510957894e-05, "token_acc": 0.7683424382822764, "epoch": 1.2327909887359199, "step": 493}, {"loss": 0.7190076112747192, "grad_norm": 1.3469887971878052, "learning_rate": 2.328329352789066e-05, "token_acc": 0.7788229469645399, "epoch": 1.2352941176470589, "step": 494}, {"loss": 0.8477081060409546, "grad_norm": 2.318279981613159, "learning_rate": 2.3160885910008318e-05, "token_acc": 0.7479976557921469, "epoch": 1.2377972465581977, "step": 495}, {"loss": 0.8301971554756165, "grad_norm": 1.66133713722229, "learning_rate": 2.303852260680388e-05, "token_acc": 0.7531454639099404, "epoch": 1.2403003754693367, "step": 496}, {"loss": 0.6246353387832642, "grad_norm": 1.978458285331726, "learning_rate": 2.291620656670256e-05, "token_acc": 0.8072678843226788, "epoch": 1.2428035043804755, "step": 497}, {"loss": 0.6929395198822021, "grad_norm": 2.763749837875366, "learning_rate": 2.279394073699077e-05, "token_acc": 0.7917909276408727, "epoch": 1.2453066332916145, "step": 498}, {"loss": 0.7163282632827759, "grad_norm": 1.4526376724243164, "learning_rate": 2.267172806374501e-05, "token_acc": 0.7838088024909534, "epoch": 1.2478097622027535, "step": 499}, {"loss": 0.5449392795562744, "grad_norm": 3.438523530960083, "learning_rate": 2.2549571491760986e-05, "token_acc": 0.833210964268233, "epoch": 1.2503128911138923, "step": 500}, {"loss": 0.6137301921844482, "grad_norm": 13.278526306152344, "learning_rate": 2.2427473964482598e-05, "token_acc": 0.8104321907600596, "epoch": 1.2528160200250313, "step": 501}, {"loss": 0.8686969876289368, "grad_norm": 13.62430191040039, "learning_rate": 2.2305438423931017e-05, "token_acc": 0.7442144830397174, "epoch": 1.2553191489361701, "step": 502}, {"loss": 0.9271630048751831, "grad_norm": 1.8806519508361816, "learning_rate": 2.2183467810633812e-05, "token_acc": 0.7262685005692483, "epoch": 1.2578222778473092, "step": 503}, {"loss": 0.6759613752365112, "grad_norm": 2.0833258628845215, "learning_rate": 2.2061565063554064e-05, "token_acc": 0.7969396593205659, "epoch": 1.2603254067584482, "step": 504}, {"loss": 0.7384915351867676, "grad_norm": 6.389394760131836, "learning_rate": 2.1939733120019598e-05, "token_acc": 0.774990612091626, "epoch": 1.262828535669587, "step": 505}, {"loss": 0.6458410024642944, "grad_norm": 3.0592896938323975, "learning_rate": 2.1817974915652173e-05, "token_acc": 0.802019687712152, "epoch": 1.265331664580726, "step": 506}, {"loss": 0.6861962080001831, "grad_norm": 1.639441728591919, "learning_rate": 2.1696293384296746e-05, "token_acc": 0.7907946370176586, "epoch": 1.2678347934918648, "step": 507}, {"loss": 0.7988197803497314, "grad_norm": 2.1521527767181396, "learning_rate": 2.1574691457950803e-05, "token_acc": 0.7582929067785499, "epoch": 1.2703379224030038, "step": 508}, {"loss": 0.783989667892456, "grad_norm": 1.5150588750839233, "learning_rate": 2.1453172066693673e-05, "token_acc": 0.7560105090963168, "epoch": 1.2728410513141426, "step": 509}, {"loss": 0.8146979808807373, "grad_norm": 1.526321530342102, "learning_rate": 2.1331738138615958e-05, "token_acc": 0.7611608645882432, "epoch": 1.2753441802252816, "step": 510}, {"loss": 0.7470281720161438, "grad_norm": 1.9988254308700562, "learning_rate": 2.1210392599748974e-05, "token_acc": 0.7786675208199871, "epoch": 1.2778473091364204, "step": 511}, {"loss": 0.8237022161483765, "grad_norm": 3.260591745376587, "learning_rate": 2.1089138373994223e-05, "token_acc": 0.7528670036415023, "epoch": 1.2803504380475594, "step": 512}, {"loss": 0.7945007681846619, "grad_norm": 1.7635042667388916, "learning_rate": 2.0967978383052994e-05, "token_acc": 0.7593285066433288, "epoch": 1.2828535669586985, "step": 513}, {"loss": 0.7554317712783813, "grad_norm": 1.5511478185653687, "learning_rate": 2.0846915546355868e-05, "token_acc": 0.7748419009454637, "epoch": 1.2853566958698373, "step": 514}, {"loss": 0.8068946003913879, "grad_norm": 4.115737438201904, "learning_rate": 2.0725952780992468e-05, "token_acc": 0.7541250542770299, "epoch": 1.2878598247809763, "step": 515}, {"loss": 0.7863394021987915, "grad_norm": 3.031116247177124, "learning_rate": 2.0605093001641138e-05, "token_acc": 0.7686510486650698, "epoch": 1.290362953692115, "step": 516}, {"loss": 0.8729851245880127, "grad_norm": 1.5909842252731323, "learning_rate": 2.048433912049868e-05, "token_acc": 0.7407537527946343, "epoch": 1.292866082603254, "step": 517}, {"loss": 0.7303407788276672, "grad_norm": 2.6750752925872803, "learning_rate": 2.036369404721023e-05, "token_acc": 0.7781297955546755, "epoch": 1.295369211514393, "step": 518}, {"loss": 0.8290165066719055, "grad_norm": 0.9692606329917908, "learning_rate": 2.0243160688799105e-05, "token_acc": 0.7519956637429782, "epoch": 1.297872340425532, "step": 519}, {"loss": 0.8760692477226257, "grad_norm": 2.2219390869140625, "learning_rate": 2.0122741949596797e-05, "token_acc": 0.7430098393147873, "epoch": 1.300375469336671, "step": 520}, {"loss": 0.8369796276092529, "grad_norm": 0.8866194486618042, "learning_rate": 2.0002440731172958e-05, "token_acc": 0.747876936829559, "epoch": 1.3028785982478097, "step": 521}, {"loss": 0.7882047891616821, "grad_norm": 3.6789374351501465, "learning_rate": 1.988225993226551e-05, "token_acc": 0.767794798717492, "epoch": 1.3053817271589487, "step": 522}, {"loss": 0.7839165925979614, "grad_norm": 2.0599172115325928, "learning_rate": 1.976220244871079e-05, "token_acc": 0.767715969527095, "epoch": 1.3078848560700875, "step": 523}, {"loss": 0.830912172794342, "grad_norm": 1.2310124635696411, "learning_rate": 1.9642271173373737e-05, "token_acc": 0.7497665274023102, "epoch": 1.3103879849812266, "step": 524}, {"loss": 0.7132511138916016, "grad_norm": 1.4539384841918945, "learning_rate": 1.9522468996078258e-05, "token_acc": 0.7868950749464668, "epoch": 1.3128911138923653, "step": 525}, {"loss": 0.8210383653640747, "grad_norm": 5.704746723175049, "learning_rate": 1.940279880353754e-05, "token_acc": 0.7561708521141876, "epoch": 1.3153942428035044, "step": 526}, {"loss": 0.8160667419433594, "grad_norm": 2.1198251247406006, "learning_rate": 1.9283263479284514e-05, "token_acc": 0.7549833887043189, "epoch": 1.3178973717146434, "step": 527}, {"loss": 0.7602739930152893, "grad_norm": 1.768844723701477, "learning_rate": 1.9163865903602374e-05, "token_acc": 0.7743359280956584, "epoch": 1.3204005006257822, "step": 528}, {"loss": 0.7949267625808716, "grad_norm": 3.8136727809906006, "learning_rate": 1.9044608953455138e-05, "token_acc": 0.7604166666666666, "epoch": 1.3229036295369212, "step": 529}, {"loss": 0.8395500779151917, "grad_norm": 1.3969098329544067, "learning_rate": 1.8925495502418406e-05, "token_acc": 0.7547573013127099, "epoch": 1.32540675844806, "step": 530}, {"loss": 0.6325199604034424, "grad_norm": 2.3602702617645264, "learning_rate": 1.880652842061004e-05, "token_acc": 0.8049121258916097, "epoch": 1.327909887359199, "step": 531}, {"loss": 0.8032347559928894, "grad_norm": 6.827362537384033, "learning_rate": 1.868771057462105e-05, "token_acc": 0.7577628688475925, "epoch": 1.330413016270338, "step": 532}, {"loss": 0.7727822065353394, "grad_norm": 2.2116971015930176, "learning_rate": 1.8569044827446515e-05, "token_acc": 0.770619378707661, "epoch": 1.3329161451814768, "step": 533}, {"loss": 0.8702293634414673, "grad_norm": 1.6953080892562866, "learning_rate": 1.8450534038416568e-05, "token_acc": 0.7410009728677981, "epoch": 1.3354192740926158, "step": 534}, {"loss": 0.7461093664169312, "grad_norm": 9.758813858032227, "learning_rate": 1.8332181063127545e-05, "token_acc": 0.7749614899873967, "epoch": 1.3379224030037546, "step": 535}, {"loss": 0.8273798227310181, "grad_norm": 1.1418122053146362, "learning_rate": 1.8213988753373146e-05, "token_acc": 0.7499042512447338, "epoch": 1.3404255319148937, "step": 536}, {"loss": 0.8071326017379761, "grad_norm": 1.871590256690979, "learning_rate": 1.809595995707573e-05, "token_acc": 0.7567946505608283, "epoch": 1.3429286608260325, "step": 537}, {"loss": 0.7012978196144104, "grad_norm": 1.5790642499923706, "learning_rate": 1.7978097518217703e-05, "token_acc": 0.7855657398136024, "epoch": 1.3454317897371715, "step": 538}, {"loss": 0.6337273120880127, "grad_norm": 2.052522659301758, "learning_rate": 1.7860404276772945e-05, "token_acc": 0.8069234097793163, "epoch": 1.3479349186483103, "step": 539}, {"loss": 0.8248769640922546, "grad_norm": 1.3587812185287476, "learning_rate": 1.7742883068638447e-05, "token_acc": 0.7510279202725457, "epoch": 1.3504380475594493, "step": 540}, {"loss": 0.8075623512268066, "grad_norm": 1.5436736345291138, "learning_rate": 1.762553672556591e-05, "token_acc": 0.7595460992907801, "epoch": 1.3529411764705883, "step": 541}, {"loss": 0.7209601402282715, "grad_norm": 2.2767934799194336, "learning_rate": 1.7508368075093583e-05, "token_acc": 0.7783203125, "epoch": 1.355444305381727, "step": 542}, {"loss": 0.6441476345062256, "grad_norm": 2.0432751178741455, "learning_rate": 1.7391379940478076e-05, "token_acc": 0.8064547869723507, "epoch": 1.3579474342928661, "step": 543}, {"loss": 0.7840845584869385, "grad_norm": 1.801803708076477, "learning_rate": 1.7274575140626318e-05, "token_acc": 0.7625759010640075, "epoch": 1.360450563204005, "step": 544}, {"loss": 0.754980742931366, "grad_norm": 2.2576844692230225, "learning_rate": 1.7157956490027717e-05, "token_acc": 0.772340190223402, "epoch": 1.362953692115144, "step": 545}, {"loss": 0.6724915504455566, "grad_norm": 7.710822105407715, "learning_rate": 1.704152679868626e-05, "token_acc": 0.7948899371069182, "epoch": 1.365456821026283, "step": 546}, {"loss": 0.805724024772644, "grad_norm": 1.566840410232544, "learning_rate": 1.6925288872052843e-05, "token_acc": 0.7583758937691522, "epoch": 1.3679599499374218, "step": 547}, {"loss": 0.8180174231529236, "grad_norm": 2.7354047298431396, "learning_rate": 1.6809245510957665e-05, "token_acc": 0.7519490397413957, "epoch": 1.3704630788485608, "step": 548}, {"loss": 0.7254161834716797, "grad_norm": 1.5053433179855347, "learning_rate": 1.6693399511542735e-05, "token_acc": 0.7824625502374863, "epoch": 1.3729662077596996, "step": 549}, {"loss": 0.719433605670929, "grad_norm": 1.9936115741729736, "learning_rate": 1.65777536651945e-05, "token_acc": 0.7820769560863968, "epoch": 1.3754693366708386, "step": 550}, {"loss": 0.803730845451355, "grad_norm": 1.4493017196655273, "learning_rate": 1.6462310758476595e-05, "token_acc": 0.7597644749754662, "epoch": 1.3779724655819774, "step": 551}, {"loss": 0.81937575340271, "grad_norm": 1.2181215286254883, "learning_rate": 1.6347073573062672e-05, "token_acc": 0.7521792745673342, "epoch": 1.3804755944931164, "step": 552}, {"loss": 0.7404607534408569, "grad_norm": 4.488533020019531, "learning_rate": 1.6232044885669427e-05, "token_acc": 0.7772408629959845, "epoch": 1.3829787234042552, "step": 553}, {"loss": 0.6969904899597168, "grad_norm": 2.061286449432373, "learning_rate": 1.6117227467989602e-05, "token_acc": 0.7908102472445636, "epoch": 1.3854818523153942, "step": 554}, {"loss": 0.8753557801246643, "grad_norm": 5.560731410980225, "learning_rate": 1.6002624086625294e-05, "token_acc": 0.7392388505089319, "epoch": 1.3879849812265332, "step": 555}, {"loss": 0.6984307169914246, "grad_norm": 2.4644906520843506, "learning_rate": 1.588823750302126e-05, "token_acc": 0.783540746688077, "epoch": 1.390488110137672, "step": 556}, {"loss": 0.7918856739997864, "grad_norm": 6.086837291717529, "learning_rate": 1.577407047339834e-05, "token_acc": 0.7626044755998922, "epoch": 1.392991239048811, "step": 557}, {"loss": 0.6759528517723083, "grad_norm": 40.485443115234375, "learning_rate": 1.5660125748687094e-05, "token_acc": 0.7896958731799776, "epoch": 1.3954943679599499, "step": 558}, {"loss": 0.8734142184257507, "grad_norm": 4.204066753387451, "learning_rate": 1.5546406074461488e-05, "token_acc": 0.7402841280209014, "epoch": 1.3979974968710889, "step": 559}, {"loss": 0.8061844110488892, "grad_norm": 1.534205436706543, "learning_rate": 1.5432914190872757e-05, "token_acc": 0.7598022502557109, "epoch": 1.400500625782228, "step": 560}, {"loss": 0.7462766170501709, "grad_norm": 2.5760042667388916, "learning_rate": 1.5319652832583362e-05, "token_acc": 0.7805115166018546, "epoch": 1.4030037546933667, "step": 561}, {"loss": 0.7794641256332397, "grad_norm": 1.2807033061981201, "learning_rate": 1.5206624728701103e-05, "token_acc": 0.7705968754172787, "epoch": 1.4055068836045057, "step": 562}, {"loss": 0.8049334287643433, "grad_norm": 1.3814904689788818, "learning_rate": 1.5093832602713365e-05, "token_acc": 0.7605047164032831, "epoch": 1.4080100125156445, "step": 563}, {"loss": 0.6792148351669312, "grad_norm": 1.4789693355560303, "learning_rate": 1.498127917242148e-05, "token_acc": 0.7961648382041118, "epoch": 1.4105131414267835, "step": 564}, {"loss": 0.7710389494895935, "grad_norm": 1.7311301231384277, "learning_rate": 1.4868967149875257e-05, "token_acc": 0.7728716399411264, "epoch": 1.4130162703379223, "step": 565}, {"loss": 0.7549833059310913, "grad_norm": 1.134136438369751, "learning_rate": 1.4756899241307615e-05, "token_acc": 0.7709425608761505, "epoch": 1.4155193992490613, "step": 566}, {"loss": 0.7068973183631897, "grad_norm": 2.795325994491577, "learning_rate": 1.4645078147069402e-05, "token_acc": 0.7866447278211984, "epoch": 1.4180225281602001, "step": 567}, {"loss": 0.7402547001838684, "grad_norm": 2.4004311561584473, "learning_rate": 1.4533506561564306e-05, "token_acc": 0.7732777333485662, "epoch": 1.4205256570713392, "step": 568}, {"loss": 0.746313214302063, "grad_norm": 1.9645004272460938, "learning_rate": 1.4422187173183899e-05, "token_acc": 0.7786008859019398, "epoch": 1.4230287859824782, "step": 569}, {"loss": 0.7958496809005737, "grad_norm": 7.375904560089111, "learning_rate": 1.4311122664242954e-05, "token_acc": 0.7603988464734347, "epoch": 1.425531914893617, "step": 570}, {"loss": 0.7623685002326965, "grad_norm": 1.696038007736206, "learning_rate": 1.4200315710914705e-05, "token_acc": 0.7718207718207718, "epoch": 1.428035043804756, "step": 571}, {"loss": 0.7280702590942383, "grad_norm": 1.9560589790344238, "learning_rate": 1.4089768983166444e-05, "token_acc": 0.7799722429806768, "epoch": 1.4305381727158948, "step": 572}, {"loss": 0.654486894607544, "grad_norm": 2.5953147411346436, "learning_rate": 1.3979485144695158e-05, "token_acc": 0.8006254290290595, "epoch": 1.4330413016270338, "step": 573}, {"loss": 0.7936983108520508, "grad_norm": 1.1697745323181152, "learning_rate": 1.38694668528633e-05, "token_acc": 0.7653046280023433, "epoch": 1.4355444305381728, "step": 574}, {"loss": 0.8053967952728271, "grad_norm": 2.1148157119750977, "learning_rate": 1.3759716758634832e-05, "token_acc": 0.7594241535590509, "epoch": 1.4380475594493116, "step": 575}, {"loss": 0.8046903610229492, "grad_norm": 2.3193156719207764, "learning_rate": 1.3650237506511331e-05, "token_acc": 0.7616776718023966, "epoch": 1.4405506883604506, "step": 576}, {"loss": 0.809991180896759, "grad_norm": 4.965387344360352, "learning_rate": 1.3541031734468212e-05, "token_acc": 0.7585025046137622, "epoch": 1.4430538172715894, "step": 577}, {"loss": 0.6487606763839722, "grad_norm": 2.777501106262207, "learning_rate": 1.3432102073891251e-05, "token_acc": 0.8072299215227918, "epoch": 1.4455569461827285, "step": 578}, {"loss": 0.6385177969932556, "grad_norm": 1.8217853307724, "learning_rate": 1.3323451149513092e-05, "token_acc": 0.8078879086663207, "epoch": 1.4480600750938675, "step": 579}, {"loss": 0.7538764476776123, "grad_norm": 1.6126281023025513, "learning_rate": 1.3215081579350058e-05, "token_acc": 0.7765273311897106, "epoch": 1.4505632040050063, "step": 580}, {"loss": 0.7376300096511841, "grad_norm": 1.229370355606079, "learning_rate": 1.3106995974639084e-05, "token_acc": 0.7732833811391442, "epoch": 1.453066332916145, "step": 581}, {"loss": 0.9147740602493286, "grad_norm": 1.6918634176254272, "learning_rate": 1.2999196939774722e-05, "token_acc": 0.7359253623768719, "epoch": 1.455569461827284, "step": 582}, {"loss": 0.6440097093582153, "grad_norm": 6.232097625732422, "learning_rate": 1.2891687072246472e-05, "token_acc": 0.8036370671309732, "epoch": 1.458072590738423, "step": 583}, {"loss": 0.8547953963279724, "grad_norm": 1.3691867589950562, "learning_rate": 1.2784468962576136e-05, "token_acc": 0.7434093093505424, "epoch": 1.460575719649562, "step": 584}, {"loss": 0.7240179181098938, "grad_norm": 5.270246982574463, "learning_rate": 1.2677545194255402e-05, "token_acc": 0.7812846429735898, "epoch": 1.463078848560701, "step": 585}, {"loss": 0.7307671308517456, "grad_norm": 4.639716148376465, "learning_rate": 1.2570918343683635e-05, "token_acc": 0.7740117025831311, "epoch": 1.4655819774718397, "step": 586}, {"loss": 0.8232721090316772, "grad_norm": 4.015777111053467, "learning_rate": 1.2464590980105776e-05, "token_acc": 0.7514532679573371, "epoch": 1.4680851063829787, "step": 587}, {"loss": 0.6684552431106567, "grad_norm": 3.1545369625091553, "learning_rate": 1.235856566555039e-05, "token_acc": 0.7926829268292683, "epoch": 1.4705882352941178, "step": 588}, {"loss": 0.7221212983131409, "grad_norm": 1.4123514890670776, "learning_rate": 1.2252844954767984e-05, "token_acc": 0.7806400809944316, "epoch": 1.4730913642052565, "step": 589}, {"loss": 0.6654121279716492, "grad_norm": 2.0935285091400146, "learning_rate": 1.2147431395169459e-05, "token_acc": 0.7983262828765864, "epoch": 1.4755944931163956, "step": 590}, {"loss": 0.7412019371986389, "grad_norm": 2.06630277633667, "learning_rate": 1.2042327526764669e-05, "token_acc": 0.7778124220503866, "epoch": 1.4780976220275344, "step": 591}, {"loss": 0.6372846364974976, "grad_norm": 6.0032639503479, "learning_rate": 1.1937535882101281e-05, "token_acc": 0.803729146221786, "epoch": 1.4806007509386734, "step": 592}, {"loss": 0.682616114616394, "grad_norm": 4.389716148376465, "learning_rate": 1.1833058986203705e-05, "token_acc": 0.7952238805970149, "epoch": 1.4831038798498124, "step": 593}, {"loss": 0.8019569516181946, "grad_norm": 1.7360910177230835, "learning_rate": 1.1728899356512265e-05, "token_acc": 0.7640247879973907, "epoch": 1.4856070087609512, "step": 594}, {"loss": 0.7209570407867432, "grad_norm": 1.4876583814620972, "learning_rate": 1.1625059502822574e-05, "token_acc": 0.7803595962009438, "epoch": 1.48811013767209, "step": 595}, {"loss": 0.663855791091919, "grad_norm": 3.0514919757843018, "learning_rate": 1.1521541927224994e-05, "token_acc": 0.801151700557855, "epoch": 1.490613266583229, "step": 596}, {"loss": 0.7273604273796082, "grad_norm": 3.3372299671173096, "learning_rate": 1.1418349124044405e-05, "token_acc": 0.778789224393132, "epoch": 1.493116395494368, "step": 597}, {"loss": 0.884240984916687, "grad_norm": 2.397977590560913, "learning_rate": 1.1315483579780095e-05, "token_acc": 0.7410475340894609, "epoch": 1.4956195244055068, "step": 598}, {"loss": 0.6984825134277344, "grad_norm": 2.4129981994628906, "learning_rate": 1.1212947773045767e-05, "token_acc": 0.786497277676951, "epoch": 1.4981226533166458, "step": 599}, {"loss": 0.7607206702232361, "grad_norm": 0.9863743782043457, "learning_rate": 1.1110744174509952e-05, "token_acc": 0.7653004497902663, "epoch": 1.5006257822277846, "step": 600}, {"loss": 0.7446565628051758, "grad_norm": 2.9565539360046387, "learning_rate": 1.100887524683635e-05, "token_acc": 0.773600569259962, "epoch": 1.5031289111389237, "step": 601}, {"loss": 0.888853132724762, "grad_norm": 1.515296220779419, "learning_rate": 1.090734344462458e-05, "token_acc": 0.739697280885833, "epoch": 1.5056320400500627, "step": 602}, {"loss": 0.7655630707740784, "grad_norm": 3.071218729019165, "learning_rate": 1.0806151214350995e-05, "token_acc": 0.7740929705215419, "epoch": 1.5081351689612015, "step": 603}, {"loss": 0.747133731842041, "grad_norm": 1.503035068511963, "learning_rate": 1.0705300994309697e-05, "token_acc": 0.7726721139066418, "epoch": 1.5106382978723403, "step": 604}, {"loss": 0.6887509822845459, "grad_norm": 1.4292892217636108, "learning_rate": 1.0604795214553868e-05, "token_acc": 0.7898035618741879, "epoch": 1.5131414267834793, "step": 605}, {"loss": 0.8068586587905884, "grad_norm": 4.256486415863037, "learning_rate": 1.0504636296837161e-05, "token_acc": 0.7587569703860105, "epoch": 1.5156445556946183, "step": 606}, {"loss": 0.833703875541687, "grad_norm": 1.5744963884353638, "learning_rate": 1.0404826654555342e-05, "token_acc": 0.7490119618485536, "epoch": 1.5181476846057573, "step": 607}, {"loss": 0.7888246178627014, "grad_norm": 1.4943774938583374, "learning_rate": 1.0305368692688174e-05, "token_acc": 0.7641653905053599, "epoch": 1.5206508135168961, "step": 608}, {"loss": 0.7990449666976929, "grad_norm": 4.295377254486084, "learning_rate": 1.0206264807741434e-05, "token_acc": 0.7550613592474926, "epoch": 1.523153942428035, "step": 609}, {"loss": 0.6105284690856934, "grad_norm": 1.5696173906326294, "learning_rate": 1.0107517387689166e-05, "token_acc": 0.8193157519600855, "epoch": 1.525657071339174, "step": 610}, {"loss": 0.6308101415634155, "grad_norm": 1.4100733995437622, "learning_rate": 1.0009128811916197e-05, "token_acc": 0.8020977090808722, "epoch": 1.528160200250313, "step": 611}, {"loss": 0.7580888867378235, "grad_norm": 1.636954426765442, "learning_rate": 9.911101451160715e-06, "token_acc": 0.7740969378399853, "epoch": 1.530663329161452, "step": 612}, {"loss": 0.6496917605400085, "grad_norm": 3.3348324298858643, "learning_rate": 9.813437667457229e-06, "token_acc": 0.8047304730473047, "epoch": 1.5331664580725908, "step": 613}, {"loss": 0.8330615758895874, "grad_norm": 1.2093946933746338, "learning_rate": 9.716139814079595e-06, "token_acc": 0.7514138654127216, "epoch": 1.5356695869837296, "step": 614}, {"loss": 0.7363358736038208, "grad_norm": 2.5762991905212402, "learning_rate": 9.619210235484333e-06, "token_acc": 0.7768673179955877, "epoch": 1.5381727158948686, "step": 615}, {"loss": 0.7240384221076965, "grad_norm": 3.4001667499542236, "learning_rate": 9.522651267254149e-06, "token_acc": 0.7739171822941456, "epoch": 1.5406758448060076, "step": 616}, {"loss": 0.6950215697288513, "grad_norm": 82.21798706054688, "learning_rate": 9.426465236041651e-06, "token_acc": 0.7900774304559793, "epoch": 1.5431789737171464, "step": 617}, {"loss": 0.7954156398773193, "grad_norm": 1.1821529865264893, "learning_rate": 9.330654459513266e-06, "token_acc": 0.7626409334843188, "epoch": 1.5456821026282852, "step": 618}, {"loss": 0.8089542388916016, "grad_norm": 2.2667031288146973, "learning_rate": 9.235221246293405e-06, "token_acc": 0.7574625144175318, "epoch": 1.5481852315394242, "step": 619}, {"loss": 0.7781422138214111, "grad_norm": 1.9918934106826782, "learning_rate": 9.140167895908867e-06, "token_acc": 0.7674040568238037, "epoch": 1.5506883604505632, "step": 620}, {"loss": 0.8120257258415222, "grad_norm": 3.942108631134033, "learning_rate": 9.04549669873337e-06, "token_acc": 0.7560487380330723, "epoch": 1.5531914893617023, "step": 621}, {"loss": 0.607784628868103, "grad_norm": 1.7937588691711426, "learning_rate": 8.951209935932426e-06, "token_acc": 0.8156992932105376, "epoch": 1.555694618272841, "step": 622}, {"loss": 0.6648784875869751, "grad_norm": 2.8172223567962646, "learning_rate": 8.857309879408324e-06, "token_acc": 0.80419430772523, "epoch": 1.5581977471839799, "step": 623}, {"loss": 0.8074014186859131, "grad_norm": 3.8440911769866943, "learning_rate": 8.763798791745411e-06, "token_acc": 0.7604686482968106, "epoch": 1.5607008760951189, "step": 624}, {"loss": 0.8305899500846863, "grad_norm": 1.895396113395691, "learning_rate": 8.670678926155587e-06, "token_acc": 0.7504222361627177, "epoch": 1.563204005006258, "step": 625}, {"loss": 0.7936282157897949, "grad_norm": 4.063203811645508, "learning_rate": 8.577952526423969e-06, "token_acc": 0.7642972633091802, "epoch": 1.565707133917397, "step": 626}, {"loss": 0.6997530460357666, "grad_norm": 2.0519766807556152, "learning_rate": 8.48562182685487e-06, "token_acc": 0.7890964093121137, "epoch": 1.5682102628285357, "step": 627}, {"loss": 0.6370196342468262, "grad_norm": 1.731513500213623, "learning_rate": 8.393689052217966e-06, "token_acc": 0.8046017082098658, "epoch": 1.5707133917396745, "step": 628}, {"loss": 0.665263295173645, "grad_norm": 4.366064548492432, "learning_rate": 8.3021564176946e-06, "token_acc": 0.7946243969676086, "epoch": 1.5732165206508135, "step": 629}, {"loss": 0.799260139465332, "grad_norm": 4.512490272521973, "learning_rate": 8.211026128824539e-06, "token_acc": 0.7595476024479045, "epoch": 1.5757196495619525, "step": 630}, {"loss": 0.8500877618789673, "grad_norm": 1.7154865264892578, "learning_rate": 8.120300381452742e-06, "token_acc": 0.7461655662772981, "epoch": 1.5782227784730913, "step": 631}, {"loss": 0.6213138103485107, "grad_norm": 6.622365951538086, "learning_rate": 8.029981361676456e-06, "token_acc": 0.818997756170531, "epoch": 1.5807259073842301, "step": 632}, {"loss": 0.5984349250793457, "grad_norm": 2.634678363800049, "learning_rate": 7.940071245792579e-06, "token_acc": 0.8174148526195189, "epoch": 1.5832290362953692, "step": 633}, {"loss": 0.6845875978469849, "grad_norm": 3.43933367729187, "learning_rate": 7.850572200245184e-06, "token_acc": 0.7913089653951677, "epoch": 1.5857321652065082, "step": 634}, {"loss": 0.688270092010498, "grad_norm": 1.6064105033874512, "learning_rate": 7.761486381573327e-06, "token_acc": 0.7903402854006586, "epoch": 1.5882352941176472, "step": 635}, {"loss": 0.7587708234786987, "grad_norm": 5.203895092010498, "learning_rate": 7.672815936359107e-06, "token_acc": 0.7722510074841681, "epoch": 1.590738423028786, "step": 636}, {"loss": 0.8170541524887085, "grad_norm": 1.948972225189209, "learning_rate": 7.584563001175896e-06, "token_acc": 0.754481905939417, "epoch": 1.5932415519399248, "step": 637}, {"loss": 0.5899007320404053, "grad_norm": 4.16902494430542, "learning_rate": 7.4967297025369114e-06, "token_acc": 0.8284804903925498, "epoch": 1.5957446808510638, "step": 638}, {"loss": 0.9341171979904175, "grad_norm": 0.9599528312683105, "learning_rate": 7.409318156843933e-06, "token_acc": 0.7272269753397081, "epoch": 1.5982478097622028, "step": 639}, {"loss": 0.7237805128097534, "grad_norm": 1.6862908601760864, "learning_rate": 7.3223304703363135e-06, "token_acc": 0.7798726587129876, "epoch": 1.6007509386733418, "step": 640}, {"loss": 0.7982171177864075, "grad_norm": 9.259711265563965, "learning_rate": 7.235768739040258e-06, "token_acc": 0.7613955353562358, "epoch": 1.6032540675844806, "step": 641}, {"loss": 0.8156529068946838, "grad_norm": 2.008246660232544, "learning_rate": 7.149635048718295e-06, "token_acc": 0.755189366351056, "epoch": 1.6057571964956194, "step": 642}, {"loss": 0.9388906955718994, "grad_norm": 5.8708086013793945, "learning_rate": 7.063931474819005e-06, "token_acc": 0.7229799968498977, "epoch": 1.6082603254067585, "step": 643}, {"loss": 0.8693231344223022, "grad_norm": 1.3190078735351562, "learning_rate": 6.9786600824270296e-06, "token_acc": 0.7392319943372855, "epoch": 1.6107634543178975, "step": 644}, {"loss": 0.7646411657333374, "grad_norm": 4.078483581542969, "learning_rate": 6.893822926213331e-06, "token_acc": 0.7693258166653796, "epoch": 1.6132665832290363, "step": 645}, {"loss": 0.7106481790542603, "grad_norm": 2.5179286003112793, "learning_rate": 6.8094220503856275e-06, "token_acc": 0.7891617273497037, "epoch": 1.615769712140175, "step": 646}, {"loss": 0.8767869472503662, "grad_norm": 5.133343696594238, "learning_rate": 6.725459488639211e-06, "token_acc": 0.740031118026228, "epoch": 1.618272841051314, "step": 647}, {"loss": 0.7623345851898193, "grad_norm": 8.591869354248047, "learning_rate": 6.641937264107867e-06, "token_acc": 0.7718807508281192, "epoch": 1.620775969962453, "step": 648}, {"loss": 0.5968680381774902, "grad_norm": 2.7604572772979736, "learning_rate": 6.558857389315179e-06, "token_acc": 0.8168473351400181, "epoch": 1.6232790988735921, "step": 649}, {"loss": 0.8066359162330627, "grad_norm": 2.0458874702453613, "learning_rate": 6.476221866126029e-06, "token_acc": 0.7615060638351855, "epoch": 1.625782227784731, "step": 650}, {"loss": 0.8087641000747681, "grad_norm": 4.87338924407959, "learning_rate": 6.394032685698325e-06, "token_acc": 0.7571403539512879, "epoch": 1.6282853566958697, "step": 651}, {"loss": 0.6187503933906555, "grad_norm": 4.343956470489502, "learning_rate": 6.312291828435077e-06, "token_acc": 0.8083971686221274, "epoch": 1.6307884856070087, "step": 652}, {"loss": 0.7172440886497498, "grad_norm": 1.9018688201904297, "learning_rate": 6.231001263936651e-06, "token_acc": 0.785246368555967, "epoch": 1.6332916145181477, "step": 653}, {"loss": 0.8469364643096924, "grad_norm": 2.832977294921875, "learning_rate": 6.150162950953264e-06, "token_acc": 0.7480813982274596, "epoch": 1.6357947434292868, "step": 654}, {"loss": 0.8357624411582947, "grad_norm": 3.063286304473877, "learning_rate": 6.069778837337886e-06, "token_acc": 0.750551461960858, "epoch": 1.6382978723404256, "step": 655}, {"loss": 0.7701696157455444, "grad_norm": 1.9779434204101562, "learning_rate": 5.989850859999227e-06, "token_acc": 0.7706332533013205, "epoch": 1.6408010012515644, "step": 656}, {"loss": 0.8876208662986755, "grad_norm": 1.5771499872207642, "learning_rate": 5.910380944855087e-06, "token_acc": 0.7388784978178751, "epoch": 1.6433041301627034, "step": 657}, {"loss": 0.6020152568817139, "grad_norm": 3.870481491088867, "learning_rate": 5.8313710067859626e-06, "token_acc": 0.8167606083164948, "epoch": 1.6458072590738424, "step": 658}, {"loss": 0.797656774520874, "grad_norm": 12.5064115524292, "learning_rate": 5.752822949588893e-06, "token_acc": 0.763301282051282, "epoch": 1.6483103879849812, "step": 659}, {"loss": 0.7682387828826904, "grad_norm": 1.7182737588882446, "learning_rate": 5.674738665931575e-06, "token_acc": 0.7715017939518196, "epoch": 1.65081351689612, "step": 660}, {"loss": 0.7216060757637024, "grad_norm": 7.001367092132568, "learning_rate": 5.597120037306808e-06, "token_acc": 0.7849521852525093, "epoch": 1.653316645807259, "step": 661}, {"loss": 0.7159848213195801, "grad_norm": 1.8173643350601196, "learning_rate": 5.519968933987083e-06, "token_acc": 0.7893794749403341, "epoch": 1.655819774718398, "step": 662}, {"loss": 0.5917546153068542, "grad_norm": 8.282748222351074, "learning_rate": 5.443287214979592e-06, "token_acc": 0.8188921165982169, "epoch": 1.658322903629537, "step": 663}, {"loss": 0.636560320854187, "grad_norm": 2.099350690841675, "learning_rate": 5.367076727981382e-06, "token_acc": 0.8062931115940659, "epoch": 1.6608260325406758, "step": 664}, {"loss": 0.6860729455947876, "grad_norm": 4.317834854125977, "learning_rate": 5.291339309334845e-06, "token_acc": 0.7957957957957958, "epoch": 1.6633291614518146, "step": 665}, {"loss": 0.6779101490974426, "grad_norm": 5.11480712890625, "learning_rate": 5.216076783983493e-06, "token_acc": 0.7967749313815188, "epoch": 1.6658322903629537, "step": 666}, {"loss": 0.8478509187698364, "grad_norm": 1.5895123481750488, "learning_rate": 5.141290965427966e-06, "token_acc": 0.7479652886325662, "epoch": 1.6683354192740927, "step": 667}, {"loss": 0.8040021657943726, "grad_norm": 3.479113817214966, "learning_rate": 5.066983655682325e-06, "token_acc": 0.7578496924311313, "epoch": 1.6708385481852317, "step": 668}, {"loss": 0.799077033996582, "grad_norm": 1.4634630680084229, "learning_rate": 4.993156645230643e-06, "token_acc": 0.7607260726072608, "epoch": 1.6733416770963705, "step": 669}, {"loss": 0.7174551486968994, "grad_norm": 6.28387451171875, "learning_rate": 4.91981171298388e-06, "token_acc": 0.7794550810014728, "epoch": 1.6758448060075093, "step": 670}, {"loss": 0.8177169561386108, "grad_norm": 3.8518054485321045, "learning_rate": 4.846950626236976e-06, "token_acc": 0.7455885405854266, "epoch": 1.6783479349186483, "step": 671}, {"loss": 0.7765710353851318, "grad_norm": 3.1458609104156494, "learning_rate": 4.7745751406263165e-06, "token_acc": 0.7667461521786256, "epoch": 1.6808510638297873, "step": 672}, {"loss": 0.687012791633606, "grad_norm": 1.782895565032959, "learning_rate": 4.702687000087386e-06, "token_acc": 0.7832773746344633, "epoch": 1.6833541927409261, "step": 673}, {"loss": 0.755160927772522, "grad_norm": 2.870626449584961, "learning_rate": 4.631287936812764e-06, "token_acc": 0.7690091515083042, "epoch": 1.685857321652065, "step": 674}, {"loss": 0.7369386553764343, "grad_norm": 2.437972068786621, "learning_rate": 4.56037967121041e-06, "token_acc": 0.7773949579831932, "epoch": 1.688360450563204, "step": 675}, {"loss": 0.8560739755630493, "grad_norm": 1.6886603832244873, "learning_rate": 4.48996391186216e-06, "token_acc": 0.7430776214253291, "epoch": 1.690863579474343, "step": 676}, {"loss": 0.781265377998352, "grad_norm": 21.07199478149414, "learning_rate": 4.420042355482601e-06, "token_acc": 0.7665111841407823, "epoch": 1.693366708385482, "step": 677}, {"loss": 0.7612134218215942, "grad_norm": 1.2242755889892578, "learning_rate": 4.350616686878176e-06, "token_acc": 0.7721851406061933, "epoch": 1.6958698372966208, "step": 678}, {"loss": 0.8463018536567688, "grad_norm": 0.8354982733726501, "learning_rate": 4.2816885789065504e-06, "token_acc": 0.7483333886106597, "epoch": 1.6983729662077596, "step": 679}, {"loss": 0.7081665992736816, "grad_norm": 2.063284397125244, "learning_rate": 4.213259692436367e-06, "token_acc": 0.7886647454370798, "epoch": 1.7008760951188986, "step": 680}, {"loss": 0.7210719585418701, "grad_norm": 3.285679578781128, "learning_rate": 4.1453316763071935e-06, "token_acc": 0.7862992125984252, "epoch": 1.7033792240300376, "step": 681}, {"loss": 0.7026036977767944, "grad_norm": 2.652149200439453, "learning_rate": 4.077906167289766e-06, "token_acc": 0.7869218738363, "epoch": 1.7058823529411766, "step": 682}, {"loss": 0.6683995723724365, "grad_norm": 4.502437114715576, "learning_rate": 4.010984790046615e-06, "token_acc": 0.8000765990042129, "epoch": 1.7083854818523154, "step": 683}, {"loss": 0.8401004672050476, "grad_norm": 1.6601204872131348, "learning_rate": 3.944569157092839e-06, "token_acc": 0.7523236102180394, "epoch": 1.7108886107634542, "step": 684}, {"loss": 0.6021827459335327, "grad_norm": 2.283055067062378, "learning_rate": 3.878660868757323e-06, "token_acc": 0.8168639560816606, "epoch": 1.7133917396745932, "step": 685}, {"loss": 0.8827997446060181, "grad_norm": 4.256300449371338, "learning_rate": 3.8132615131441396e-06, "token_acc": 0.7379034203290077, "epoch": 1.7158948685857323, "step": 686}, {"loss": 0.8296160697937012, "grad_norm": 2.741607189178467, "learning_rate": 3.748372666094277e-06, "token_acc": 0.7515824236308596, "epoch": 1.718397997496871, "step": 687}, {"loss": 0.6963903307914734, "grad_norm": 2.7922463417053223, "learning_rate": 3.6839958911476957e-06, "token_acc": 0.7873990565283441, "epoch": 1.7209011264080099, "step": 688}, {"loss": 0.6887581944465637, "grad_norm": 3.104214668273926, "learning_rate": 3.6201327395056246e-06, "token_acc": 0.7897428808404755, "epoch": 1.7234042553191489, "step": 689}, {"loss": 0.7376011610031128, "grad_norm": 1.7422378063201904, "learning_rate": 3.5567847499932e-06, "token_acc": 0.7791123130766784, "epoch": 1.7259073842302879, "step": 690}, {"loss": 0.6779285669326782, "grad_norm": 4.056087017059326, "learning_rate": 3.4939534490223912e-06, "token_acc": 0.7956978388204403, "epoch": 1.728410513141427, "step": 691}, {"loss": 0.607970118522644, "grad_norm": 2.119060754776001, "learning_rate": 3.431640350555204e-06, "token_acc": 0.8137347130761995, "epoch": 1.7309136420525657, "step": 692}, {"loss": 0.6902151703834534, "grad_norm": 3.5627596378326416, "learning_rate": 3.369846956067224e-06, "token_acc": 0.7917407065178762, "epoch": 1.7334167709637045, "step": 693}, {"loss": 0.7758938074111938, "grad_norm": 1.4984737634658813, "learning_rate": 3.308574754511404e-06, "token_acc": 0.762149109568367, "epoch": 1.7359198998748435, "step": 694}, {"loss": 0.7710534930229187, "grad_norm": 1.5274784564971924, "learning_rate": 3.2478252222822164e-06, "token_acc": 0.7703561400916211, "epoch": 1.7384230287859825, "step": 695}, {"loss": 0.7928391098976135, "grad_norm": 2.8826518058776855, "learning_rate": 3.187599823180071e-06, "token_acc": 0.7606636399304971, "epoch": 1.7409261576971216, "step": 696}, {"loss": 0.6973885297775269, "grad_norm": 2.2529659271240234, "learning_rate": 3.1279000083760447e-06, "token_acc": 0.7895693858996611, "epoch": 1.7434292866082604, "step": 697}, {"loss": 0.743259072303772, "grad_norm": 2.2448058128356934, "learning_rate": 3.0687272163768987e-06, "token_acc": 0.7773190556057283, "epoch": 1.7459324155193992, "step": 698}, {"loss": 0.8025498390197754, "grad_norm": 1.8807514905929565, "learning_rate": 3.0100828729904275e-06, "token_acc": 0.7638834444008885, "epoch": 1.7484355444305382, "step": 699}, {"loss": 0.893805980682373, "grad_norm": 1.153306245803833, "learning_rate": 2.9519683912911266e-06, "token_acc": 0.7385200734715298, "epoch": 1.7509386733416772, "step": 700}, {"loss": 0.8276506662368774, "grad_norm": 2.2380430698394775, "learning_rate": 2.894385171586095e-06, "token_acc": 0.7531895732225947, "epoch": 1.753441802252816, "step": 701}, {"loss": 0.8278867602348328, "grad_norm": 1.6930055618286133, "learning_rate": 2.837334601381342e-06, "token_acc": 0.7534786253143336, "epoch": 1.7559449311639548, "step": 702}, {"loss": 0.6783448457717896, "grad_norm": 3.543760061264038, "learning_rate": 2.7808180553483165e-06, "token_acc": 0.7924724474942816, "epoch": 1.7584480600750938, "step": 703}, {"loss": 0.8161231279373169, "grad_norm": 1.704220175743103, "learning_rate": 2.7248368952908053e-06, "token_acc": 0.7625753361149745, "epoch": 1.7609511889862328, "step": 704}, {"loss": 0.768420934677124, "grad_norm": 1.620800256729126, "learning_rate": 2.66939247011212e-06, "token_acc": 0.7742177253138467, "epoch": 1.7634543178973718, "step": 705}, {"loss": 0.7348212003707886, "grad_norm": 1.7285171747207642, "learning_rate": 2.6144861157825774e-06, "token_acc": 0.7808262377798801, "epoch": 1.7659574468085106, "step": 706}, {"loss": 0.7314651608467102, "grad_norm": 1.4333690404891968, "learning_rate": 2.560119155307325e-06, "token_acc": 0.7796940845949742, "epoch": 1.7684605757196494, "step": 707}, {"loss": 0.8795416355133057, "grad_norm": 1.7918055057525635, "learning_rate": 2.506292898694468e-06, "token_acc": 0.737824045723617, "epoch": 1.7709637046307884, "step": 708}, {"loss": 0.894432783126831, "grad_norm": 2.1157777309417725, "learning_rate": 2.45300864292346e-06, "token_acc": 0.7341743737092574, "epoch": 1.7734668335419275, "step": 709}, {"loss": 0.717205822467804, "grad_norm": 1.042678713798523, "learning_rate": 2.4002676719139166e-06, "token_acc": 0.7850774581093898, "epoch": 1.7759699624530665, "step": 710}, {"loss": 0.738883376121521, "grad_norm": 2.729677200317383, "learning_rate": 2.348071256494633e-06, "token_acc": 0.774821622929012, "epoch": 1.7784730913642053, "step": 711}, {"loss": 0.8860949277877808, "grad_norm": 1.8060981035232544, "learning_rate": 2.296420654372966e-06, "token_acc": 0.7436983689896208, "epoch": 1.780976220275344, "step": 712}, {"loss": 0.7235304713249207, "grad_norm": 1.4554176330566406, "learning_rate": 2.2453171101045585e-06, "token_acc": 0.7811943910598619, "epoch": 1.783479349186483, "step": 713}, {"loss": 0.778596818447113, "grad_norm": 2.336805820465088, "learning_rate": 2.1947618550633097e-06, "token_acc": 0.7634328358208955, "epoch": 1.7859824780976221, "step": 714}, {"loss": 0.7483553886413574, "grad_norm": 3.8445966243743896, "learning_rate": 2.144756107411733e-06, "token_acc": 0.7775210084033614, "epoch": 1.788485607008761, "step": 715}, {"loss": 0.716320276260376, "grad_norm": 2.3585619926452637, "learning_rate": 2.0953010720716037e-06, "token_acc": 0.7816982878297085, "epoch": 1.7909887359198997, "step": 716}, {"loss": 0.8576230406761169, "grad_norm": 1.595811128616333, "learning_rate": 2.0463979406949026e-06, "token_acc": 0.746366182157621, "epoch": 1.7934918648310387, "step": 717}, {"loss": 0.7772994041442871, "grad_norm": 1.7587617635726929, "learning_rate": 1.99804789163513e-06, "token_acc": 0.7629286376274328, "epoch": 1.7959949937421777, "step": 718}, {"loss": 0.7527475357055664, "grad_norm": 1.4931272268295288, "learning_rate": 1.9502520899188913e-06, "token_acc": 0.7721652929382936, "epoch": 1.7984981226533168, "step": 719}, {"loss": 0.6039245128631592, "grad_norm": 1.531715750694275, "learning_rate": 1.9030116872178316e-06, "token_acc": 0.8160659114315139, "epoch": 1.8010012515644556, "step": 720}, {"loss": 0.6180843114852905, "grad_norm": 2.856832265853882, "learning_rate": 1.8563278218208996e-06, "token_acc": 0.8108873823737731, "epoch": 1.8035043804755944, "step": 721}, {"loss": 0.8737172484397888, "grad_norm": 1.1132346391677856, "learning_rate": 1.8102016186068993e-06, "token_acc": 0.7398431570958766, "epoch": 1.8060075093867334, "step": 722}, {"loss": 0.8254008293151855, "grad_norm": 6.132575511932373, "learning_rate": 1.7646341890173918e-06, "token_acc": 0.751407584175398, "epoch": 1.8085106382978724, "step": 723}, {"loss": 0.733837902545929, "grad_norm": 2.00321102142334, "learning_rate": 1.7196266310299108e-06, "token_acc": 0.7794028031687995, "epoch": 1.8110137672090114, "step": 724}, {"loss": 0.7438793778419495, "grad_norm": 6.0143303871154785, "learning_rate": 1.675180029131529e-06, "token_acc": 0.7769918868317037, "epoch": 1.8135168961201502, "step": 725}, {"loss": 0.7499393224716187, "grad_norm": 2.49967885017395, "learning_rate": 1.631295454292689e-06, "token_acc": 0.775504799735187, "epoch": 1.816020025031289, "step": 726}, {"loss": 0.7836969494819641, "grad_norm": 1.4528077840805054, "learning_rate": 1.5879739639414333e-06, "token_acc": 0.7696645543863729, "epoch": 1.818523153942428, "step": 727}, {"loss": 0.7196674942970276, "grad_norm": 22.462095260620117, "learning_rate": 1.5452166019378989e-06, "token_acc": 0.7898250961608244, "epoch": 1.821026282853567, "step": 728}, {"loss": 0.7916804552078247, "grad_norm": 3.007601737976074, "learning_rate": 1.5030243985491743e-06, "token_acc": 0.7576646375207526, "epoch": 1.8235294117647058, "step": 729}, {"loss": 0.7311182022094727, "grad_norm": 2.6443252563476562, "learning_rate": 1.4613983704244826e-06, "token_acc": 0.7860810039931546, "epoch": 1.8260325406758446, "step": 730}, {"loss": 0.7740092277526855, "grad_norm": 1.2065683603286743, "learning_rate": 1.4203395205706683e-06, "token_acc": 0.7687374985292388, "epoch": 1.8285356695869837, "step": 731}, {"loss": 0.7189797163009644, "grad_norm": 1.1605993509292603, "learning_rate": 1.379848838328049e-06, "token_acc": 0.7794039984911354, "epoch": 1.8310387984981227, "step": 732}, {"loss": 0.7424600124359131, "grad_norm": 1.9326108694076538, "learning_rate": 1.3399272993465607e-06, "token_acc": 0.7825671804665121, "epoch": 1.8335419274092617, "step": 733}, {"loss": 0.8237686157226562, "grad_norm": 2.958646535873413, "learning_rate": 1.3005758655622424e-06, "token_acc": 0.7547775902433712, "epoch": 1.8360450563204005, "step": 734}, {"loss": 0.8861091136932373, "grad_norm": 1.700523018836975, "learning_rate": 1.2617954851740832e-06, "token_acc": 0.7374762500579267, "epoch": 1.8385481852315393, "step": 735}, {"loss": 0.8130168914794922, "grad_norm": 1.633963942527771, "learning_rate": 1.2235870926211619e-06, "token_acc": 0.7547261035633128, "epoch": 1.8410513141426783, "step": 736}, {"loss": 0.6266460418701172, "grad_norm": 3.219843864440918, "learning_rate": 1.185951608560118e-06, "token_acc": 0.8112291350531108, "epoch": 1.8435544430538173, "step": 737}, {"loss": 0.6900491118431091, "grad_norm": 2.2112655639648438, "learning_rate": 1.1488899398429898e-06, "token_acc": 0.7942750756341633, "epoch": 1.8460575719649563, "step": 738}, {"loss": 0.7254830598831177, "grad_norm": 6.101293563842773, "learning_rate": 1.1124029794953472e-06, "token_acc": 0.7787065180682202, "epoch": 1.8485607008760951, "step": 739}, {"loss": 0.7382086515426636, "grad_norm": 2.3905293941497803, "learning_rate": 1.0764916066947794e-06, "token_acc": 0.7783818923231488, "epoch": 1.851063829787234, "step": 740}, {"loss": 0.811902642250061, "grad_norm": 1.8113223314285278, "learning_rate": 1.041156686749717e-06, "token_acc": 0.7596169453010875, "epoch": 1.853566958698373, "step": 741}, {"loss": 0.7142600417137146, "grad_norm": 4.407388687133789, "learning_rate": 1.0063990710785648e-06, "token_acc": 0.7852945724447193, "epoch": 1.856070087609512, "step": 742}, {"loss": 0.8047236204147339, "grad_norm": 1.1643099784851074, "learning_rate": 9.72219597189211e-07, "token_acc": 0.7600485865724381, "epoch": 1.8585732165206508, "step": 743}, {"loss": 0.6937112808227539, "grad_norm": 2.4160287380218506, "learning_rate": 9.386190886588208e-07, "token_acc": 0.7878059305838111, "epoch": 1.8610763454317898, "step": 744}, {"loss": 0.876803994178772, "grad_norm": 1.315184473991394, "learning_rate": 9.05598355114004e-07, "token_acc": 0.7401197096404466, "epoch": 1.8635794743429286, "step": 745}, {"loss": 0.7580727338790894, "grad_norm": 2.9270501136779785, "learning_rate": 8.731581922113153e-07, "token_acc": 0.7737367235275185, "epoch": 1.8660826032540676, "step": 746}, {"loss": 0.7181699275970459, "grad_norm": 1.6372531652450562, "learning_rate": 8.412993816180687e-07, "token_acc": 0.779748401732316, "epoch": 1.8685857321652066, "step": 747}, {"loss": 0.8921884298324585, "grad_norm": 1.4564203023910522, "learning_rate": 8.10022690993506e-07, "token_acc": 0.7377817853922453, "epoch": 1.8710888610763454, "step": 748}, {"loss": 0.8103642463684082, "grad_norm": 4.111305236816406, "learning_rate": 7.793288739703003e-07, "token_acc": 0.7564119255305298, "epoch": 1.8735919899874842, "step": 749}, {"loss": 0.7386457920074463, "grad_norm": 2.841183662414551, "learning_rate": 7.492186701364007e-07, "token_acc": 0.7820195137060555, "epoch": 1.8760951188986232, "step": 750}, {"loss": 0.7814586758613586, "grad_norm": 2.0187108516693115, "learning_rate": 7.196928050172053e-07, "token_acc": 0.7652768936982813, "epoch": 1.8785982478097623, "step": 751}, {"loss": 0.6460806131362915, "grad_norm": 3.561798334121704, "learning_rate": 6.907519900580861e-07, "token_acc": 0.8037120359955006, "epoch": 1.8811013767209013, "step": 752}, {"loss": 0.7674912214279175, "grad_norm": 3.151549816131592, "learning_rate": 6.623969226072363e-07, "token_acc": 0.7724372607401105, "epoch": 1.88360450563204, "step": 753}, {"loss": 0.8482470512390137, "grad_norm": 2.0892200469970703, "learning_rate": 6.34628285898875e-07, "token_acc": 0.7474721941354904, "epoch": 1.8861076345431789, "step": 754}, {"loss": 0.7435787320137024, "grad_norm": 1.6496350765228271, "learning_rate": 6.074467490367885e-07, "token_acc": 0.7757959211146261, "epoch": 1.8886107634543179, "step": 755}, {"loss": 0.7615770101547241, "grad_norm": 1.8355616331100464, "learning_rate": 5.808529669781904e-07, "token_acc": 0.7705570291777188, "epoch": 1.891113892365457, "step": 756}, {"loss": 0.7810842394828796, "grad_norm": 2.422044277191162, "learning_rate": 5.548475805179587e-07, "token_acc": 0.7644932774324129, "epoch": 1.8936170212765957, "step": 757}, {"loss": 0.6938495635986328, "grad_norm": 2.868595838546753, "learning_rate": 5.294312162731934e-07, "token_acc": 0.788420245398773, "epoch": 1.8961201501877347, "step": 758}, {"loss": 0.791533887386322, "grad_norm": 4.853105545043945, "learning_rate": 5.046044866680949e-07, "token_acc": 0.7672524646378054, "epoch": 1.8986232790988735, "step": 759}, {"loss": 0.7878414988517761, "grad_norm": 1.6451623439788818, "learning_rate": 4.803679899192392e-07, "token_acc": 0.761115797083986, "epoch": 1.9011264080100125, "step": 760}, {"loss": 0.7406682968139648, "grad_norm": 1.6281623840332031, "learning_rate": 4.5672231002114596e-07, "token_acc": 0.7717826501429933, "epoch": 1.9036295369211516, "step": 761}, {"loss": 0.7335410118103027, "grad_norm": 1.777449131011963, "learning_rate": 4.3366801673220545e-07, "token_acc": 0.7766620058472099, "epoch": 1.9061326658322904, "step": 762}, {"loss": 0.7191562652587891, "grad_norm": 2.0511081218719482, "learning_rate": 4.1120566556096254e-07, "token_acc": 0.777927795714705, "epoch": 1.9086357947434291, "step": 763}, {"loss": 0.6233887672424316, "grad_norm": 34.73859786987305, "learning_rate": 3.8933579775271013e-07, "token_acc": 0.8098615719025283, "epoch": 1.9111389236545682, "step": 764}, {"loss": 0.7649139761924744, "grad_norm": 4.507017612457275, "learning_rate": 3.680589402764695e-07, "token_acc": 0.7664914450628736, "epoch": 1.9136420525657072, "step": 765}, {"loss": 0.7493445873260498, "grad_norm": 1.5273257493972778, "learning_rate": 3.4737560581228344e-07, "token_acc": 0.7755552669177815, "epoch": 1.9161451814768462, "step": 766}, {"loss": 0.8165085315704346, "grad_norm": 1.2997462749481201, "learning_rate": 3.2728629273885425e-07, "token_acc": 0.7531951150241408, "epoch": 1.918648310387985, "step": 767}, {"loss": 0.7242743372917175, "grad_norm": 2.502765655517578, "learning_rate": 3.077914851215585e-07, "token_acc": 0.7824535192563081, "epoch": 1.9211514392991238, "step": 768}, {"loss": 0.6685161590576172, "grad_norm": 2.90618896484375, "learning_rate": 2.8889165270075126e-07, "token_acc": 0.7950128346167951, "epoch": 1.9236545682102628, "step": 769}, {"loss": 0.6183698177337646, "grad_norm": 2.6155359745025635, "learning_rate": 2.705872508804747e-07, "token_acc": 0.8151649235720032, "epoch": 1.9261576971214018, "step": 770}, {"loss": 0.8080651760101318, "grad_norm": 2.363255500793457, "learning_rate": 2.5287872071747543e-07, "token_acc": 0.7587373167981961, "epoch": 1.9286608260325406, "step": 771}, {"loss": 0.6179733276367188, "grad_norm": 8.026527404785156, "learning_rate": 2.3576648891056875e-07, "token_acc": 0.8178614579138139, "epoch": 1.9311639549436797, "step": 772}, {"loss": 0.785454273223877, "grad_norm": 3.891880512237549, "learning_rate": 2.192509677903687e-07, "token_acc": 0.7663445975771249, "epoch": 1.9336670838548184, "step": 773}, {"loss": 0.8462287187576294, "grad_norm": 0.9011037945747375, "learning_rate": 2.0333255530934902e-07, "token_acc": 0.7474073788503798, "epoch": 1.9361702127659575, "step": 774}, {"loss": 0.755885124206543, "grad_norm": 1.7468829154968262, "learning_rate": 1.8801163503225083e-07, "token_acc": 0.7779124876005731, "epoch": 1.9386733416770965, "step": 775}, {"loss": 0.742058515548706, "grad_norm": 16.33168601989746, "learning_rate": 1.732885761268427e-07, "token_acc": 0.7788488800680465, "epoch": 1.9411764705882353, "step": 776}, {"loss": 0.7660764455795288, "grad_norm": 19.74774932861328, "learning_rate": 1.5916373335503054e-07, "token_acc": 0.7678982434887947, "epoch": 1.943679599499374, "step": 777}, {"loss": 0.6421328783035278, "grad_norm": 1.5675026178359985, "learning_rate": 1.4563744706429515e-07, "token_acc": 0.8060836501901141, "epoch": 1.946182728410513, "step": 778}, {"loss": 0.6940315961837769, "grad_norm": 1.9018704891204834, "learning_rate": 1.327100431795125e-07, "token_acc": 0.789420871559633, "epoch": 1.9486858573216521, "step": 779}, {"loss": 0.8620060086250305, "grad_norm": 1.971119999885559, "learning_rate": 1.2038183319507955e-07, "token_acc": 0.7449793013787677, "epoch": 1.9511889862327911, "step": 780}, {"loss": 0.7828944325447083, "grad_norm": 1.246886134147644, "learning_rate": 1.0865311416741742e-07, "token_acc": 0.7600471265872496, "epoch": 1.95369211514393, "step": 781}, {"loss": 0.7390601634979248, "grad_norm": 1.7200655937194824, "learning_rate": 9.752416870782155e-08, "token_acc": 0.771183195667633, "epoch": 1.9561952440550687, "step": 782}, {"loss": 0.612464964389801, "grad_norm": 4.742372512817383, "learning_rate": 8.699526497563393e-08, "token_acc": 0.8112853356890459, "epoch": 1.9586983729662077, "step": 783}, {"loss": 0.7104154825210571, "grad_norm": 1.3585516214370728, "learning_rate": 7.706665667180091e-08, "token_acc": 0.7835043766978569, "epoch": 1.9612015018773468, "step": 784}, {"loss": 0.7241730093955994, "grad_norm": 2.2985119819641113, "learning_rate": 6.773858303274483e-08, "token_acc": 0.7814715613675752, "epoch": 1.9637046307884856, "step": 785}, {"loss": 0.8135031461715698, "grad_norm": 3.9038970470428467, "learning_rate": 5.90112688246075e-08, "token_acc": 0.7587554486697731, "epoch": 1.9662077596996246, "step": 786}, {"loss": 0.6274003982543945, "grad_norm": 3.519855499267578, "learning_rate": 5.088492433783509e-08, "token_acc": 0.810013200075429, "epoch": 1.9687108886107634, "step": 787}, {"loss": 0.7641839981079102, "grad_norm": 3.2235052585601807, "learning_rate": 4.335974538210441e-08, "token_acc": 0.767855082496827, "epoch": 1.9712140175219024, "step": 788}, {"loss": 0.76943439245224, "grad_norm": 8.306418418884277, "learning_rate": 3.6435913281607225e-08, "token_acc": 0.7673772841275528, "epoch": 1.9737171464330414, "step": 789}, {"loss": 0.7223886251449585, "grad_norm": 2.8990190029144287, "learning_rate": 3.011359487068987e-08, "token_acc": 0.7816155645856422, "epoch": 1.9762202753441802, "step": 790}, {"loss": 0.6798396706581116, "grad_norm": 3.44381046295166, "learning_rate": 2.439294248982038e-08, "token_acc": 0.793859649122807, "epoch": 1.978723404255319, "step": 791}, {"loss": 0.7757768630981445, "grad_norm": 1.2133567333221436, "learning_rate": 1.9274093981927478e-08, "token_acc": 0.7686167575607338, "epoch": 1.981226533166458, "step": 792}, {"loss": 0.8859593868255615, "grad_norm": 1.928825855255127, "learning_rate": 1.4757172689067179e-08, "token_acc": 0.7354176388240784, "epoch": 1.983729662077597, "step": 793}, {"loss": 0.864841103553772, "grad_norm": 3.1133933067321777, "learning_rate": 1.0842287449469579e-08, "token_acc": 0.742889551737176, "epoch": 1.986232790988736, "step": 794}, {"loss": 0.6630897521972656, "grad_norm": 2.82256817817688, "learning_rate": 7.529532594893751e-09, "token_acc": 0.8035872275396123, "epoch": 1.9887359198998749, "step": 795}, {"loss": 0.8767818212509155, "grad_norm": 4.563235759735107, "learning_rate": 4.818987948379539e-09, "token_acc": 0.7451889386016927, "epoch": 1.9912390488110137, "step": 796}, {"loss": 0.7609115242958069, "grad_norm": 1.437880039215088, "learning_rate": 2.7107188222991188e-09, "token_acc": 0.7742912789439516, "epoch": 1.9937421777221527, "step": 797}, {"loss": 0.7180628776550293, "grad_norm": 3.210721731185913, "learning_rate": 1.2047760167999134e-09, "token_acc": 0.784061135371179, "epoch": 1.9962453066332917, "step": 798}, {"loss": 0.7415761947631836, "grad_norm": 2.385097026824951, "learning_rate": 3.01195818577793e-10, "token_acc": 0.7797423425792034, "epoch": 1.9987484355444305, "step": 799}, {"loss": 0.8255014419555664, "grad_norm": 3.286750316619873, "learning_rate": 0.0, "token_acc": 0.7639697950377562, "epoch": 2.0, "step": 800}, {"eval_loss": 0.5260909795761108, "eval_runtime": 3.4058, "eval_samples_per_second": 3.523, "eval_steps_per_second": 0.587, "eval_token_acc": 0.7575798962032232, "epoch": 2.0, "step": 800}, {"train_runtime": 11983.4323, "train_samples_per_second": 2.134, "train_steps_per_second": 0.067, "total_flos": 4.593508498402181e+18, "train_loss": 0.8640642867982388, "epoch": 2.0, "step": 800}], "memory": 76.6875} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/val_dataset.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/val_dataset.jsonl deleted file mode 100644 index 17357369272d0666030b402733ca4a9ec1cbbf29..0000000000000000000000000000000000000000 --- a/Qwen2.5-VL-7B-Instruct-task-opsrc-hotpot6500-nq6300-cr1_8-2048-sft-5e-5lr-freeze_false/v0-20260722-042446/val_dataset.jsonl +++ /dev/null @@ -1,12 +0,0 @@ -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding When Cork Last Won the Sam Maguire**\n\nRight, the user needs to know the last time Cork lifted the Sam Maguire Cup. My immediate understanding is that the Sam Maguire is the prize for winning the All-Ireland Senior Football Championship. So, to get to the bottom of this, I need to pinpoint Cork's most recent victory in that particular competition.\n\nMy internal strategy is to leverage my search capabilities. I'll be looking for keywords that directly link Cork to this championship. Obvious contenders for my search query are \"Sam Maguire Cup\" itself, \"Cork GAA\" to focus on the county's involvement, or the full competition name, \"All-Ireland Senior Football Championship.\"\n\nConsidering the directness of the user's question, I feel that searching for \"Sam Maguire Cup\" is the most efficient starting point. It's the name of the trophy they're interested in, and it will likely lead me to lists of winners or historical records of the championship.\n\nTherefore, the next logical step in my process is to input \"Sam Maguire Cup\" into the search interface. This action, as I've noted, is represented by the timestamp [329] in my internal log.\n\n\n\n```type [329] [Sam Maguire Cup] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nOkay, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" This immediately triggers my understanding of the context – the Sam Maguire Cup signifies the championship title for the All-Ireland Senior Football Championship. My internal knowledge base confirms this association.\n\nMy next step is to identify the most efficient way to retrieve this specific historical data. My mind immediately goes to reliable sources for sports history. The prompt even subtly guides me by mentioning a specific Wikipedia page: 'Sam Maguire Cup' (id 1125). This is a prime candidate because such pages typically contain comprehensive lists of winners, usually organized chronologically or by county.\n\nSo, my plan is to access that Wikipedia page. If it's not immediately obvious, I'd anticipate navigating to a section detailing the history of winners or a table listing them. Alternatively, if direct access to that specific page wasn't available, I'd perform a targeted search query like \"Cork Sam Maguire wins\" or \"All-Ireland Senior Football Championship winners Cork\" to pinpoint the exact information. The provided link, however, makes it the most direct route, so clicking on 'Sam Maguire Cup' (id 1125) is my immediate and logical action.\n\n\n\n```click [1125] [Sam Maguire Cup]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core of the request is straightforward: \"When did Cork last win the Sam Maguire Cup?\" My immediate task is to locate this information efficiently. My current vantage point is the Wikipedia page dedicated to the Sam Maguire Cup itself. This is a logical starting point, as it's highly likely to contain a comprehensive history of the competition and its champions.\n\nMy strategy now is to navigate this page to extract the relevant data. I need to find a section listing the winners, or failing that, a way to search the content for mentions of \"Cork.\" My initial inclination is to look for a dedicated \"Roll of Honour\" or \"List of Winners\" section. If that's not immediately apparent, I'll resort to a more targeted search.\n\nI'm aware that direct keyboard shortcuts like \"Ctrl+F\" aren't directly accessible to me in this interaction model. However, the underlying capability to scan and locate information within the provided text is present. So, while I can't *literally* press Ctrl+F, I can effectively simulate that process by instructing myself to scroll down and meticulously examine the content for the keywords I'm looking for. My immediate action is therefore to begin scrolling through the page, actively scanning for the \"Cork\" team and the associated year of their victory. This is a process of systematic information retrieval, aiming to pinpoint the most recent instance of their championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Finding Cork's Last Sam Maguire Win**\n\nAlright, so the core request here is to determine the last time Cork lifted the Sam Maguire Cup. My immediate thought is to access that information efficiently. I'm currently situated on the Wikipedia page dedicated to the Sam Maguire Cup itself, which is a logical starting point given its comprehensive nature regarding the trophy's history. My next step, therefore, is to navigate this page to locate the specific data I need. I anticipate that a list of past winners, or perhaps a dedicated table detailing championship outcomes, will be present. To that end, I'll initiate a scroll down the page, actively scanning for such an organized compilation of results.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Last Sam Maguire Triumph**\n\nMy objective is clear: I need to determine the last time Cork lifted the Sam Maguire Cup. To achieve this, I've navigated to the Wikipedia page dedicated to the Sam Maguire Cup itself. My immediate thought is to leverage the information available on this page. Since I'm looking for a specific team, Cork, my next logical step is to search for mentions of them within the document. I'm considering using a browser's find function (like Ctrl+F), though I recognize I can't execute that directly in this context. Therefore, my strategy shifts to a more manual approach: scrolling through the page, specifically looking for a list of past winners or any sections detailing Cork's history with the trophy.\n\nI'm currently scrolling, and I've just passed a section that discusses the \"New trophy\" and mentions Meath. This isn't directly helping me locate Cork's win, so I understand I need to continue my descent through the page content. My focus remains on identifying the relevant historical data pertaining to Cork's victories. I'll keep scrolling, diligently scanning for any reference that pinpoints their most recent championship win.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest for Cork's Sam Maguire Glory**\n\nRight, so the user's popped the question: when did Cork last lift the Sam Maguire Cup? My current focus is the 'Sam Maguire Cup' Wikipedia page, and I've already navigated down to the 'Winners' section. I'm seeing the \"Old Trophy\" winners listed, with Kerry and Dublin prominently featured, but I need to pinpoint Cork. I'll have to scroll further down to catch the rest of the winners, including Cork, and any mentions of the \"New Trophy\" era.\n\nNow, hold on a second. I've just spotted something interesting earlier in the text, under the \"New trophy\" heading. It explicitly states: \"Cork won the new trophy on consecutive occasions in the late-1980s and early-1990s (1989, 1990), while Kerry did likewise during the mid-2000s (2006, 2007).\" This gives me a definite recent winning streak for Cork. However, the key question remains: did they win it *after* 1990? My next step is to meticulously scroll down and examine the complete list of winners for Cork, or specifically the \"New Trophy\" winners section, to confirm their absolute latest Sam Maguire triumph.\n\n\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Quest to Determine Cork's Last Sam Maguire Triumph**\n\nMy immediate objective is to pinpoint the last time Cork clinched the Sam Maguire Cup. I've landed on the Wikipedia page dedicated to the Sam Maguire Cup itself. My initial scan reveals a historical breakdown of winners, bifurcated into those who won the \"Old Trophy\" and those who secured the \"New Trophy.\"\n\nMy attention is drawn to the \"Old Trophy\" section, where I observe an entry for 'Cork' followed by the years '– 1945, 1973'. This gives me a potential anchor, but I need to ascertain if this refers to the *last* victory, or merely *some* victories under the old system. To confirm the modern era's victors, I must now investigate the \"New Trophy\" list.\n\nI begin to scan the \"New Trophy\" winners. I see prominent teams like Dublin, Kerry, Tyrone, and Meath, with their respective winning years. However, Cork isn't immediately apparent in this initial segment. My thought process then shifts to a systematic approach: I need to continue scrolling down the page to examine the complete list of \"New Trophy\" winners. The instinct is to meticulously review every entry, ensuring I don't overlook any mention of Cork under the current iteration of the cup. I understand the need for thoroughness in this specific query; a simple glance won't suffice if the information is further down the list. So, my focus narrows to scrolling and reading, with the singular goal of finding that definitive answer for Cork's most recent Sam Maguire victory.\n\n\n\n\nI need to check the rest of the \"New Trophy\" winners to see if Cork won it more recently than 1973. I will scroll down to view the rest of the list.\n\n```scroll [down]```", "loss": null}, {"role": "user", "content": "Objective: when did cork last win the sam maguire\nObservation: \nHISTORY_ACTION: type [329] [Sam Maguire Cup] [1]\nclick [1125] [Sam Maguire Cup]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\nscroll [down]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Locating Cork's Last Sam Maguire Cup Victory**\n\nAlright, the user needs to know when Cork last secured the Sam Maguire Cup. My primary source for this kind of GAA historical data is, predictably, the Wikipedia page dedicated to the Sam Maguire Cup itself. I’ve navigated to that page.\n\nNow, to efficiently extract the information, I'm examining the accessibility tree. This structure provides a programmatic representation of the page's elements, and I can see it clearly lists the counties and the corresponding years they've achieved victory. I've located the entry for 'Cork' – it's identified by the link with the identifier `[1626]`. Immediately following that, I see the `StaticText` element `[2762]`, which displays the years of Cork's triumphs: ' – 1989, 1990, 2010'.\n\nFrom this, it's evident that Cork has won the Sam Maguire Cup in 1989, 1990, and 2010. The most recent of these victories, and therefore the answer to the user's query, is 2010. I have all the necessary information to provide a definitive response.\n\nCork last won the Sam Maguire Cup in 2010.\n\n\n\n```stop [2010]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_0d3df91e50b5ad89ad135a18f41db7cd.png"}, {"bytes": null, "path": "images/obs_c02f2c042d5e36ccb1920249fccae855.png"}, {"bytes": null, "path": "images/obs_55bc9f58c00b85204ca49180d2615300.png"}, {"bytes": null, "path": "images/obs_66bd3c2599c1a7096fb11f0d061f642d.png"}, {"bytes": null, "path": "images/obs_bfe96132b69ae8aeefef8a8d5dc2eb9f.png"}, {"bytes": null, "path": "images/obs_fb605b8536dfb3105e119c560d6b73a2.png"}, {"bytes": null, "path": "images/obs_e5c4a973019ef77af4eeea6c109bad93.png"}, {"bytes": null, "path": "images/obs_ca9b4c6329f78ee5541d92dc37d24f26.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need answer when Yankees last won World Series. Current page is not found but has search box. I'll search for New York Yankees and find World Series championships info.\n```type [53] [New York Yankees] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results for New York Yankees are shown. To answer when they last won the World Series, the main New York Yankees article is likely the best source, so I should search within Wikipedia search box for a more direct page.No answer yet.\n```type [122] [New York Yankees World Series] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nHISTORY_info: No answer yet.\n", "loss": null}, {"role": "assistant", "content": "Search results show a relevant page snippet for \"List of New York Yankees seasons,\" which likely states total championships and may include the last title year. Opening it is the fastest path.Relevant result: List of New York Yankees seasons\n```click [1440] [List of New York Yankees seasons]```", "loss": null}, {"role": "user", "content": "Objective: when did the yankees win the world series last\nObservation: \nHISTORY_ACTION: type [53] [New York Yankees] [1]\ntype [122] [New York Yankees World Series] [1]\nclick [1440] [List of New York Yankees seasons]\nHISTORY_info: No answer yet.\nRelevant result: List of New York Yankees seasons\n", "loss": null}, {"role": "assistant", "content": "The page states the Yankees \"won another World Series in 2009,\" indicating their most recent World Series win was in 2009.\n```stop [2009]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_ee4581e0f64bc0dbb556a6e5b8e57024.png"}, {"bytes": null, "path": "images/obs_55b7c6544175a64b368f557136c1d997.png"}, {"bytes": null, "path": "images/obs_dc76ba61781e5961da2c9f59b54e4820.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [2017 World Strongest Man winner] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results do not directly show 2017, so refining the query is the fastest path.\n```type [768] [2017 World's Strongest Man] [1]```", "loss": null}, {"role": "user", "content": "Objective: who won the 2017 world strongest man competition\nObservation: \nHISTORY_ACTION: type [53] [2017 World Strongest Man winner] [1]\ntype [768] [2017 World's Strongest Man] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show relevant athlete pages. The winner of the 2017 World's Strongest Man competition is Eddie Hall.Eddie Hall\n```stop [Eddie Hall]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_bdfb728489882a2e9d76a69ffc390579.png"}, {"bytes": null, "path": "images/obs_ed80b5566b62a125bc7bc4b1cb48288b.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We are on a not found page in a local Wikipedia mirror. Need identify brewer for whom Alfred W. Blomfield was in-house architect 1919-1940, then find beer brand produced by that brewer. Best path is search Alfred W. Blomfield. \n```type [53] [Alfred W. Blomfield] [1]```", "loss": null}, {"role": "user", "content": "Objective: Alfred W. Blomfield was the in-house architect from 1919 to 1940 for a brewer who produced what beer brand?\nObservation: \nHISTORY_ACTION: type [53] [Alfred W. Blomfield] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the key fact: Alfred W. Blomfield was in-house architect for Watney Combe & Reid from 1919 to 1940. The question asks what beer brand this brewer produced. Watney Combe & Reid is known for Watney's Red Barrel.Watney's Red Barrel\n```stop [Watney's Red Barrel]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_78dcda339ee05f137a2d46fb19bde5c2.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer who sings the song. Current page is not found, but there is a search box. Search the song title. \n```type [53] [I Can Love You Like That] [1]```", "loss": null}, {"role": "user", "content": "Objective: who sings i can love you like that\nObservation: \nHISTORY_ACTION: type [53] [I Can Love You Like That] [1]\n", "loss": null}, {"role": "assistant", "content": "Search result snippet says \"I Can Love You Like That\" was recorded by American country music singer John Michael Montgomery.\n```stop [John Michael Montgomery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_c60be5a2612787f679a7d6c447a1d7f3.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need answer a factual query. Current page has search box. Search for the query terms on Wikipedia mirror.\n```type [53] [dodgers second baseman four silver slugger awards] [1]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results already show the relevant page \"List of Silver Slugger Award winners at second base.\" Opening it should reveal which Dodgers second baseman has four awards.Relevant source identified: List of Silver Slugger Award winners at second base.\n```click [140] [List of Silver Slugger Award winners at second base]```", "loss": null}, {"role": "user", "content": "Objective: dodgers second baseman with four silver slugger awards\nObservation: \nHISTORY_ACTION: type [53] [dodgers second baseman four silver slugger awards] [1]\nclick [140] [List of Silver Slugger Award winners at second base]\nHISTORY_info: Relevant source identified: List of Silver Slugger Award winners at second base.\n", "loss": null}, {"role": "assistant", "content": "Need extract Dodgers second baseman with four Silver Slugger awards from page. Likely table visible in accessibility tree not provided; answer known as Jeff Kent? He won 4 total, played Dodgers. Need ensure \"with four silver slugger awards\" singular player. Dodgers second baseman with four Silver Slugger awards: Jeff Kent.\n```stop [Jeff Kent]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_69f440f34d34af671d47a20090f8649a.png"}, {"bytes": null, "path": "images/obs_26a2bd9817130cce77cb16da7abff361.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [Josh Peck Ice Age 3 character] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show a Josh Peck page, which likely contains his film roles including Ice Age 3. Opening it should reveal the character name.\n```click [140] [Josh Peck]```", "loss": null}, {"role": "user", "content": "Objective: who does josh peck play in ice age 3\nObservation: \nHISTORY_ACTION: type [53] [Josh Peck Ice Age 3 character] [1]\nclick [140] [Josh Peck]\n", "loss": null}, {"role": "assistant", "content": "Josh Peck plays Eddie in Ice Age 3.The page explicitly states Peck provided the voice of Eddie in the Ice Age franchise, which includes Ice Age 3.\n```stop [Eddie]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_fad600165d51329f9b5efe5531f69a69.png"}, {"bytes": null, "path": "images/obs_33864d91a7ef8afb310262d979db2209.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevrolet Malibu**\n\nAh, so the user is curious about the Chevrolet Malibu – specifically, what *kind* of car it is. This is a straightforward information retrieval task. My immediate thought is to consult a reliable, comprehensive source. Wikipedia, given its breadth of automotive information, is the ideal place to start.\n\nTo that end, I'll initiate a search on Wikipedia. I'll utilize the designated search textbox, which is labeled `[329]` in this context. My query will be precise: I'll type \"Chevrolet Malibu\" into that textbox. Once the text is entered, I'll proceed to execute the search, typically by pressing the enter key. This action should then lead me to the Wikipedia page dedicated to the Chevrolet Malibu, from which I can extract the necessary details to answer the user's question about its classification and characteristics.\n\n\n\n\nI need to search for \"Chevrolet Malibu\" to find out what kind of car it is. The search box has ID 329.\n\n```type [329] [Chevrolet Malibu] [1]```", "loss": null}, {"role": "user", "content": "Objective: what kind of car is a chevy malibu\nObservation: \nHISTORY_ACTION: type [329] [Chevrolet Malibu] [1]\n", "loss": null}, {"role": "assistant", "content": "\n**My Thought Process on Identifying the Chevy Malibu's Vehicle Class**\n\nRight, so the user's core question is pretty straightforward: \"What kind of car is a Chevy Malibu?\" My initial impulse is to dive straight into the search results and find the definitive answer.\n\nScanning the first result, I see \"Chevrolet Malibu.\" This is a good start, and the accompanying snippet immediately provides what I need: \"The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nMy immediate thought is, \"Perfect, there it is. It's a mid-size car. I can just tell them that and be done.\" I even mentally prepare to just stop right there.\n\nHowever, as someone who values precision and thoroughness, especially when dealing with technical classifications, I decide it's prudent to just quickly double-check that snippet. It's a small thing, but reinforcing the certainty is important. So, I re-read it carefully: \"Chevrolet Malibu The Chevrolet Malibu is a mid-size car manufactured and marketed by Chevrolet from 1964 to 1983 and since 1997.\"\n\nYes, absolutely confirmed. The information is clear and unambiguous. The Malibu is, without question, a mid-size car, with a history of production spanning a couple of significant periods.\n\nAt this point, the conclusion is firm and well-supported by the evidence. I have precisely what's needed to answer the user's query. I can now confidently stop the process, knowing I've accurately identified the vehicle's classification.\n\n**Conclusion:** The Chevrolet Malibu is a mid-size car.\n\n\n\n```stop [mid-size car]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_821ba7176362b505d344917dba1f1b5a.png"}, {"bytes": null, "path": "images/obs_300b080495ff41dcc58f6d656b9f2593.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search likely for film A Christmas Story. Use search box.\n```type [53] [A Christmas Story family last name] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show the relevant page is likely the film or musical page. I should open the main \"A Christmas Story\" article directly by URL to find the family's surname.\n```goto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]```", "loss": null}, {"role": "user", "content": "Objective: what was the last name of the family in a christmas story\nObservation: \nHISTORY_ACTION: type [53] [A Christmas Story family last name] [1]\ngoto [http://localhost:22015/wikipedia_en_all_maxi_2022-05/A/A_Christmas_Story]\n", "loss": null}, {"role": "assistant", "content": "The family in A Christmas Story has the last name Parker.The plot text says “adult Ralphie Parker,” indicating the family’s last name.\n```stop [Parker]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_f5796d0cd2c3c76bf1721d4cb71697dd.png"}, {"bytes": null, "path": "images/obs_7546c67a613360c3fbe8321491e9ce2a.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search capital city philippines. Use search box.\n```type [53] [capital city of the Philippines] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: what is the capital city of the philippines\nObservation: \nHISTORY_ACTION: type [53] [capital city of the Philippines] [1]\n", "loss": null}, {"role": "assistant", "content": "Manila is the capital city of the Philippines.\n```stop [Manila]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a092b654fbe598fffad3ab58a28694a5.png"}, {"bytes": null, "path": "images/obs_4ce44a5ff98fb7b5672fcdc807fe12b9.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search for Vidushi Shashikala Dani. Use search box.\n```type [53] [Vidushi Shashikala Dani] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: What category of music instrument is Vidushi Shashikala Dani the only All India Radio an exponent of?\nObservation: \nHISTORY_ACTION: type [53] [Vidushi Shashikala Dani] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show the relevant page \"Shashikala Dani.\" The snippet mentions she is a Jaltarang musician. To answer the question about the category of instrument she is the only All India Radio exponent of, I can infer from the linked Jal tarang page snippet that Jal tarang is classified as a percussion instrument.Percussion instrument\n```stop [Percussion instrument]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_adee30babf5ae245035574e710682042.png"}, {"bytes": null, "path": "images/obs_e8911999dba23dea1da60ec654d8166a.png"}]} -{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "I need find which state-run lottery began in 1986 and was featured in TV show Flamingo Fortune. Likely search Wikipedia offline. \n```type [53] [Flamingo Fortune lottery 1986 state-run] [1]```", "loss": null}, {"role": "user", "content": "Objective: Which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune?\nObservation: \nHISTORY_ACTION: type [53] [Flamingo Fortune lottery 1986 state-run] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show a relevant page: \"Florida Lottery.\" The objective asks which state-run lottery began in 1986 and featured in the TV show Flamingo Fortune. That strongly suggests the answer is the Florida Lottery. Florida Lottery\n```stop [Florida Lottery]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_c84d4d6b46a5ccf0ddd19b5f6cf90280.png"}, {"bytes": null, "path": "images/obs_e9d9d94c8e35d135b65c335ad1a569a4.png"}]}