diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/args.json new file mode 100644 index 0000000000000000000000000000000000000000..5091f9392117c45807769eb71740ba331c08b424 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/args.json @@ -0,0 +1,403 @@ +{ + "output_dir": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "epoch", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 8, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "epoch", + "save_steps": 500, + "save_total_limit": null, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 48, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 3, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "offload_param": { + "device": "none", + "pin_memory": true + }, + "overlap_comm": false, + "contiguous_gradients": true, + "sub_group_size": 1000000000.0, + "reduce_bucket_size": "auto", + "zero_quantized_weights": false, + "zero_quantized_gradients": false, + "stage3_prefetch_bucket_size": "auto", + "stage3_param_persistence_threshold": "auto", + "stage3_max_live_parameters": 1000000000.0, + "stage3_max_reuse_distance": 1000000000.0, + "stage3_gather_16bit_weights_on_model_save": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "tensorboard" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": true, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "safe_serialization": true, + "max_shard_size": "5GB", + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "eval_metric": null, + "callbacks": [], + "early_stop_interval": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "tuner_type": "lora", + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "experts_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 16240, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 100, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "adapters": [], + "external_plugins": [], + "custom_register_path": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "swift_version": "4.1.3", + "ckpt_dir": null, + "rank": 0, + "global_world_size": 4, + "local_world_size": 4, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], template='qwen2_5_vl', ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], template='qwen2_5_vl', ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='XiaomiMiMo/MiMo-VL-7B-SFT', hf_model_id='XiaomiMiMo/MiMo-VL-7B-SFT', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='XiaomiMiMo/MiMo-VL-7B-RL', hf_model_id='XiaomiMiMo/MiMo-VL-7B-RL', model_path=None, ms_revision=None, hf_revision=None)], template='mimo_vl', ignore_patterns=None, requires=None, tags=[])], loader=, template='qwen2_5_vl', model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), mcore_model_type=None, architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=[])", + "model_dir": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "template_meta": "QwenTemplateMeta(template_type='qwen2_5_vl', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system='You are a helpful assistant.', auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='hermes', is_thinking=False, thinking_prefix='', non_thinking_prefix='', history_thinking_prefix='')", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "epoch", + "training_args": "Seq2SeqTrainingArguments(output_dir='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=8, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=500, save_total_limit=None, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000.0, dataloader_num_workers=48, dataloader_prefetch_factor=2, past_index=-1, run_name='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 3, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'offload_param': {'device': 'none', 'pin_memory': True}, 'overlap_comm': False, 'contiguous_gradients': True, 'sub_group_size': 1000000000.0, 'reduce_bucket_size': 'auto', 'zero_quantized_weights': False, 'zero_quantized_gradients': False, 'stage3_prefetch_bucket_size': 'auto', 'stage3_param_persistence_threshold': 'auto', 'stage3_max_live_parameters': 1000000000.0, 'stage3_max_reuse_distance': 1000000000.0, 'stage3_gather_16bit_weights_on_model_save': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, safe_serialization=True, max_shard_size='5GB', check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, eval_metric=None, callbacks=[], early_stop_interval=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, tuner_type='lora', use_galore=False, galore_target_modules=None, galore_rank=128, galore_update_proj_gap=50, galore_scale=1.0, galore_proj_type='std', galore_optim_per_parameter=False, galore_with_embedding=False, galore_quantization=False, galore_proj_quant=False, galore_proj_bits=4, galore_proj_group_size=256, galore_cos_threshold=0.4, galore_gamma_proj=2, galore_queue_size=5, lisa_activated_layers=0, lisa_step_interval=20, use_flash_ckpt=False)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/README.md new file mode 100644 index 0000000000000000000000000000000000000000..dffda63a4f167a4b37ef34b9b53e0dfb5e0333c9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/README.md @@ -0,0 +1,207 @@ +--- +base_model: /data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..8e2d26e1d4ba608d99e7617209e451476d87c4cf --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/adapter_config.json @@ -0,0 +1,40 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(up_proj|o_proj|down_proj|q_proj|v_proj|gate_proj|k_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(qkv|up_proj|mlp.2|down_proj|mlp.0|attn.proj|gate_proj))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..df25843cc302e40c149198cd4f3b3ceef799ab88 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4d95481f2456b40bbce0c8ed48286384ee4f90642b04060131c9b20f7447c4d1 +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/args.json new file mode 100644 index 0000000000000000000000000000000000000000..5091f9392117c45807769eb71740ba331c08b424 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/args.json @@ -0,0 +1,403 @@ +{ + "output_dir": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "epoch", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 8, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "epoch", + "save_steps": 500, + "save_total_limit": null, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 48, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 3, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "offload_param": { + "device": "none", + "pin_memory": true + }, + "overlap_comm": false, + "contiguous_gradients": true, + "sub_group_size": 1000000000.0, + "reduce_bucket_size": "auto", + "zero_quantized_weights": false, + "zero_quantized_gradients": false, + "stage3_prefetch_bucket_size": "auto", + "stage3_param_persistence_threshold": "auto", + "stage3_max_live_parameters": 1000000000.0, + "stage3_max_reuse_distance": 1000000000.0, + "stage3_gather_16bit_weights_on_model_save": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "tensorboard" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": true, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "safe_serialization": true, + "max_shard_size": "5GB", + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "eval_metric": null, + "callbacks": [], + "early_stop_interval": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "tuner_type": "lora", + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "experts_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 16240, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 100, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "adapters": [], + "external_plugins": [], + "custom_register_path": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "swift_version": "4.1.3", + "ckpt_dir": null, + "rank": 0, + "global_world_size": 4, + "local_world_size": 4, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], template='qwen2_5_vl', ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], template='qwen2_5_vl', ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='XiaomiMiMo/MiMo-VL-7B-SFT', hf_model_id='XiaomiMiMo/MiMo-VL-7B-SFT', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='XiaomiMiMo/MiMo-VL-7B-RL', hf_model_id='XiaomiMiMo/MiMo-VL-7B-RL', model_path=None, ms_revision=None, hf_revision=None)], template='mimo_vl', ignore_patterns=None, requires=None, tags=[])], loader=, template='qwen2_5_vl', model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), mcore_model_type=None, architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=[])", + "model_dir": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "template_meta": "QwenTemplateMeta(template_type='qwen2_5_vl', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system='You are a helpful assistant.', auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='hermes', is_thinking=False, thinking_prefix='', non_thinking_prefix='', history_thinking_prefix='')", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "epoch", + "training_args": "Seq2SeqTrainingArguments(output_dir='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=8, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=500, save_total_limit=None, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000.0, dataloader_num_workers=48, dataloader_prefetch_factor=2, past_index=-1, run_name='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 3, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'offload_param': {'device': 'none', 'pin_memory': True}, 'overlap_comm': False, 'contiguous_gradients': True, 'sub_group_size': 1000000000.0, 'reduce_bucket_size': 'auto', 'zero_quantized_weights': False, 'zero_quantized_gradients': False, 'stage3_prefetch_bucket_size': 'auto', 'stage3_param_persistence_threshold': 'auto', 'stage3_max_live_parameters': 1000000000.0, 'stage3_max_reuse_distance': 1000000000.0, 'stage3_gather_16bit_weights_on_model_save': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, safe_serialization=True, max_shard_size='5GB', check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, eval_metric=None, callbacks=[], early_stop_interval=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, tuner_type='lora', use_galore=False, galore_target_modules=None, galore_rank=128, galore_update_proj_gap=50, galore_scale=1.0, galore_proj_type='std', galore_optim_per_parameter=False, galore_with_embedding=False, galore_quantization=False, galore_proj_quant=False, galore_proj_bits=4, galore_proj_group_size=256, galore_cos_threshold=0.4, galore_gamma_proj=2, galore_queue_size=5, lisa_activated_layers=0, lisa_step_interval=20, use_flash_ckpt=False)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..f87c083bafe2cac80ac013bcd64f0a4e01e97c35 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:287e2bcefb6253ed8b45b79ad807f2697967afce025b2ba2d1c51a097ce5024c +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..26045b33130adc89745c1c23952399a8b669b89f --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:799db15bb7cde0de8f4342bcbcf1a9e4b9d6973423d668b1923f680acff74800 +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..465b19b2fcba2d3c9c7de829e4e5847469a0b543 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6443033bb25191b7d9a576f71fbcbdb94d2b50ae603d093fd14175d673b1ef59 +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..dea786a9a8367e0ae6e01483ac74217e84bf1f09 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ba54cb957fbe12c2b986bf9b17ebe6da85375d808cc06cf5c56365f1c55e431d +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_0_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_0_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..a639b0ea624c2d3c47ce24cde46fc83ee4b09d0d --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_0_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dee1d0bfff9a1227418e4a67d588529eb69aabf6ecc018d57b368c26eda4ef20 +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_1_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_1_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..7656030f5e6a854daf7e3283fda8084e49c34902 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_1_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ccdc6f17819e84c4ce50109643efce192a115d4ed049838f9e626385a1094859 +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_2_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_2_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..410b8d9d812b55037d40371375fbcb78c3d5778b --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_2_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c2e8fa754c15642022fa305fc6ea93d522d6b74481587c164939d512b11b842a +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_3_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_3_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..adad17cfb0fd6a23b1abaf4d762f840e07f7d97a --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/global_step394/zero_pp_rank_3_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7d6ebbfc364320d2d153672e6bd3deda1a7aa72c2854f22bd64c16403d008d5a +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/latest new file mode 100644 index 0000000000000000000000000000000000000000..e16948ee986225ee29fa9ac9d900ea99b9621dbd --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/latest @@ -0,0 +1 @@ +global_step394 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..46da1bb2263d655b0e2072834b158ae927547207 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:896573e771d74e064376d38881cd4b078122797c17126dc4dfc997b621cc5ac6 +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..c021a701eeaab46ffcd4280f2baccd0049a4cc50 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:54c981c54ebaac3235bea9791ea4db035522184b0ae26ff26eeb7f3a4e5835f9 +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..785da633fdb6dc95936d37404e1b5bc6449b7a9a --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a1623a15e509683723159ea15c0ebe929e6c6579925f349f18eb0d280ef0ceea +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..289b783b929a7d2b01927eb676b8bc58e43a8d1d --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:85851983cd092edf0ed4f6e2d0b855da520b1f9d044c8d96897eecf8ab218ae9 +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..4e7dbbf7887c42741e4c047b33a43c26a1c570fe --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e5231310b50f521b1700af4c096de931cb9a32e5a4590c23558cb566596c5699 +size 1465 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fea0446bd55c05bcaa1da2d11860a2ee086013ee --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/trainer_state.json @@ -0,0 +1,3195 @@ +{ + "best_global_step": 394, + "best_metric": 0.38288021, + "best_model_checkpoint": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394", + "epoch": 1.0, + "eval_steps": 2000.0, + "global_step": 394, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025388765471278957, + "grad_norm": 3.644420246106802, + "learning_rate": 3.1645569620253163e-07, + "loss": 1.318245530128479, + "step": 1, + "token_acc": 0.7163964997848228 + }, + { + "epoch": 0.0050777530942557915, + "grad_norm": 7.066332979169105, + "learning_rate": 6.329113924050633e-07, + "loss": 1.3213859796524048, + "step": 2, + "token_acc": 0.7273305758829144 + }, + { + "epoch": 0.007616629641383688, + "grad_norm": 10.199557510236037, + "learning_rate": 9.493670886075951e-07, + "loss": 1.3628352880477905, + "step": 3, + "token_acc": 0.7068235294117647 + }, + { + "epoch": 0.010155506188511583, + "grad_norm": 2.8758103179283525, + "learning_rate": 1.2658227848101265e-06, + "loss": 1.365400791168213, + "step": 4, + "token_acc": 0.7117047560222359 + }, + { + "epoch": 0.012694382735639479, + "grad_norm": 3.297140385498391, + "learning_rate": 1.5822784810126583e-06, + "loss": 1.400863528251648, + "step": 5, + "token_acc": 0.698011137629276 + }, + { + "epoch": 0.015233259282767376, + "grad_norm": 5.493150648764733, + "learning_rate": 1.8987341772151901e-06, + "loss": 1.35938560962677, + "step": 6, + "token_acc": 0.7149187592319055 + }, + { + "epoch": 0.017772135829895272, + "grad_norm": 8.171500030817667, + "learning_rate": 2.2151898734177215e-06, + "loss": 1.3011455535888672, + "step": 7, + "token_acc": 0.7231049321416749 + }, + { + "epoch": 0.020311012377023166, + "grad_norm": 5.827210745414414, + "learning_rate": 2.531645569620253e-06, + "loss": 1.417736291885376, + "step": 8, + "token_acc": 0.714411093558013 + }, + { + "epoch": 0.022849888924151063, + "grad_norm": 6.1293874585644526, + "learning_rate": 2.848101265822785e-06, + "loss": 1.378328800201416, + "step": 9, + "token_acc": 0.7031924072476272 + }, + { + "epoch": 0.025388765471278957, + "grad_norm": 3.520366609215098, + "learning_rate": 3.1645569620253167e-06, + "loss": 1.343224287033081, + "step": 10, + "token_acc": 0.7227991691963572 + }, + { + "epoch": 0.027927642018406855, + "grad_norm": 3.6585128819526824, + "learning_rate": 3.4810126582278482e-06, + "loss": 1.390702724456787, + "step": 11, + "token_acc": 0.7076406649616368 + }, + { + "epoch": 0.030466518565534752, + "grad_norm": 6.217581279052289, + "learning_rate": 3.7974683544303802e-06, + "loss": 1.3524142503738403, + "step": 12, + "token_acc": 0.7028127313101407 + }, + { + "epoch": 0.03300539511266265, + "grad_norm": 3.388086422416274, + "learning_rate": 4.113924050632911e-06, + "loss": 1.3935208320617676, + "step": 13, + "token_acc": 0.7046906654199782 + }, + { + "epoch": 0.035544271659790544, + "grad_norm": 8.332931037303998, + "learning_rate": 4.430379746835443e-06, + "loss": 1.3878122568130493, + "step": 14, + "token_acc": 0.7046968687541639 + }, + { + "epoch": 0.03808314820691844, + "grad_norm": 17.896380479546966, + "learning_rate": 4.746835443037975e-06, + "loss": 1.2754666805267334, + "step": 15, + "token_acc": 0.7242310577644411 + }, + { + "epoch": 0.04062202475404633, + "grad_norm": 11.46365102116194, + "learning_rate": 5.063291139240506e-06, + "loss": 1.3468568325042725, + "step": 16, + "token_acc": 0.7084963229541543 + }, + { + "epoch": 0.04316090130117423, + "grad_norm": 4.2821219745746655, + "learning_rate": 5.379746835443038e-06, + "loss": 1.40608549118042, + "step": 17, + "token_acc": 0.6968503937007874 + }, + { + "epoch": 0.04569977784830213, + "grad_norm": 13.278823682877052, + "learning_rate": 5.69620253164557e-06, + "loss": 1.300422191619873, + "step": 18, + "token_acc": 0.7242131505141789 + }, + { + "epoch": 0.04823865439543002, + "grad_norm": 2.778568201618841, + "learning_rate": 6.012658227848101e-06, + "loss": 1.3542265892028809, + "step": 19, + "token_acc": 0.7110212691158376 + }, + { + "epoch": 0.050777530942557915, + "grad_norm": 10.575315873473542, + "learning_rate": 6.329113924050633e-06, + "loss": 1.3549412488937378, + "step": 20, + "token_acc": 0.7120073608342279 + }, + { + "epoch": 0.053316407489685816, + "grad_norm": 4.651761760848563, + "learning_rate": 6.6455696202531645e-06, + "loss": 1.3315010070800781, + "step": 21, + "token_acc": 0.7172937521574042 + }, + { + "epoch": 0.05585528403681371, + "grad_norm": 11.039499603303584, + "learning_rate": 6.9620253164556965e-06, + "loss": 1.3607463836669922, + "step": 22, + "token_acc": 0.7119058535839828 + }, + { + "epoch": 0.058394160583941604, + "grad_norm": 21.786442056735186, + "learning_rate": 7.2784810126582285e-06, + "loss": 1.3679276704788208, + "step": 23, + "token_acc": 0.7060693204177387 + }, + { + "epoch": 0.060933037131069505, + "grad_norm": 3.8926457068624027, + "learning_rate": 7.5949367088607605e-06, + "loss": 1.230813980102539, + "step": 24, + "token_acc": 0.7303050847457627 + }, + { + "epoch": 0.06347191367819739, + "grad_norm": 27.273056033594486, + "learning_rate": 7.911392405063292e-06, + "loss": 1.2661793231964111, + "step": 25, + "token_acc": 0.7191495088144261 + }, + { + "epoch": 0.0660107902253253, + "grad_norm": 17.170751148909975, + "learning_rate": 8.227848101265822e-06, + "loss": 1.3003311157226562, + "step": 26, + "token_acc": 0.7185164292765477 + }, + { + "epoch": 0.0685496667724532, + "grad_norm": 4.4377062155304925, + "learning_rate": 8.544303797468354e-06, + "loss": 1.3472293615341187, + "step": 27, + "token_acc": 0.7084078711985689 + }, + { + "epoch": 0.07108854331958109, + "grad_norm": 28.824459578387078, + "learning_rate": 8.860759493670886e-06, + "loss": 1.2210255861282349, + "step": 28, + "token_acc": 0.7316366961292289 + }, + { + "epoch": 0.07362741986670898, + "grad_norm": 6.453710147572056, + "learning_rate": 9.177215189873418e-06, + "loss": 1.3194985389709473, + "step": 29, + "token_acc": 0.7122530736289543 + }, + { + "epoch": 0.07616629641383688, + "grad_norm": 5.834087298103824, + "learning_rate": 9.49367088607595e-06, + "loss": 1.2912172079086304, + "step": 30, + "token_acc": 0.7186076772934288 + }, + { + "epoch": 0.07870517296096477, + "grad_norm": 2.871547428905148, + "learning_rate": 9.81012658227848e-06, + "loss": 1.315631628036499, + "step": 31, + "token_acc": 0.7080590902442592 + }, + { + "epoch": 0.08124404950809266, + "grad_norm": 3.6221352179116657, + "learning_rate": 1.0126582278481012e-05, + "loss": 1.2459921836853027, + "step": 32, + "token_acc": 0.7226173541963016 + }, + { + "epoch": 0.08378292605522057, + "grad_norm": 8.000389558921656, + "learning_rate": 1.0443037974683544e-05, + "loss": 1.271647334098816, + "step": 33, + "token_acc": 0.7218111867416396 + }, + { + "epoch": 0.08632180260234847, + "grad_norm": 4.361540191205865, + "learning_rate": 1.0759493670886076e-05, + "loss": 1.274230718612671, + "step": 34, + "token_acc": 0.7135694646611677 + }, + { + "epoch": 0.08886067914947636, + "grad_norm": 4.9147142745551164, + "learning_rate": 1.1075949367088608e-05, + "loss": 1.2685215473175049, + "step": 35, + "token_acc": 0.7207676044885347 + }, + { + "epoch": 0.09139955569660425, + "grad_norm": 3.195151105054266, + "learning_rate": 1.139240506329114e-05, + "loss": 1.299472451210022, + "step": 36, + "token_acc": 0.7125310717941219 + }, + { + "epoch": 0.09393843224373215, + "grad_norm": 2.6222925030737736, + "learning_rate": 1.170886075949367e-05, + "loss": 1.184287428855896, + "step": 37, + "token_acc": 0.7353410097431355 + }, + { + "epoch": 0.09647730879086004, + "grad_norm": 2.8207306382492585, + "learning_rate": 1.2025316455696203e-05, + "loss": 1.2705498933792114, + "step": 38, + "token_acc": 0.7183790421612771 + }, + { + "epoch": 0.09901618533798794, + "grad_norm": 4.451363242439522, + "learning_rate": 1.2341772151898735e-05, + "loss": 1.1410255432128906, + "step": 39, + "token_acc": 0.7343029443064917 + }, + { + "epoch": 0.10155506188511583, + "grad_norm": 5.113673628483296, + "learning_rate": 1.2658227848101267e-05, + "loss": 1.1782591342926025, + "step": 40, + "token_acc": 0.7327224724336077 + }, + { + "epoch": 0.10409393843224374, + "grad_norm": 3.5593986457435083, + "learning_rate": 1.2974683544303799e-05, + "loss": 1.1586289405822754, + "step": 41, + "token_acc": 0.7429899957728617 + }, + { + "epoch": 0.10663281497937163, + "grad_norm": 2.9195256626560684, + "learning_rate": 1.3291139240506329e-05, + "loss": 1.139272689819336, + "step": 42, + "token_acc": 0.7421777221526908 + }, + { + "epoch": 0.10917169152649953, + "grad_norm": 20.803104301053065, + "learning_rate": 1.3607594936708861e-05, + "loss": 1.1704292297363281, + "step": 43, + "token_acc": 0.7285796434732605 + }, + { + "epoch": 0.11171056807362742, + "grad_norm": 3.471589836187823, + "learning_rate": 1.3924050632911393e-05, + "loss": 1.1391760110855103, + "step": 44, + "token_acc": 0.7379228837346727 + }, + { + "epoch": 0.11424944462075531, + "grad_norm": 5.205417449479473, + "learning_rate": 1.4240506329113925e-05, + "loss": 1.1042394638061523, + "step": 45, + "token_acc": 0.7448979591836735 + }, + { + "epoch": 0.11678832116788321, + "grad_norm": 4.3574672102801015, + "learning_rate": 1.4556962025316457e-05, + "loss": 1.0657453536987305, + "step": 46, + "token_acc": 0.7489454347530277 + }, + { + "epoch": 0.1193271977150111, + "grad_norm": 23.053778423920146, + "learning_rate": 1.4873417721518987e-05, + "loss": 1.1951930522918701, + "step": 47, + "token_acc": 0.7246397287369314 + }, + { + "epoch": 0.12186607426213901, + "grad_norm": 3.803629904444073, + "learning_rate": 1.5189873417721521e-05, + "loss": 1.0914082527160645, + "step": 48, + "token_acc": 0.745520801700577 + }, + { + "epoch": 0.1244049508092669, + "grad_norm": 6.689336514482712, + "learning_rate": 1.550632911392405e-05, + "loss": 1.1104226112365723, + "step": 49, + "token_acc": 0.7371739753511035 + }, + { + "epoch": 0.12694382735639478, + "grad_norm": 13.295611456338577, + "learning_rate": 1.5822784810126583e-05, + "loss": 1.114711880683899, + "step": 50, + "token_acc": 0.734084314729476 + }, + { + "epoch": 0.12948270390352268, + "grad_norm": 3.6818930607365474, + "learning_rate": 1.6139240506329115e-05, + "loss": 1.0886123180389404, + "step": 51, + "token_acc": 0.7460102378801566 + }, + { + "epoch": 0.1320215804506506, + "grad_norm": 2.068572818027539, + "learning_rate": 1.6455696202531644e-05, + "loss": 0.9962466359138489, + "step": 52, + "token_acc": 0.7619711761971176 + }, + { + "epoch": 0.1345604569977785, + "grad_norm": 2.3029328438465955, + "learning_rate": 1.677215189873418e-05, + "loss": 1.048902153968811, + "step": 53, + "token_acc": 0.7497123130034522 + }, + { + "epoch": 0.1370993335449064, + "grad_norm": 5.7047860384924505, + "learning_rate": 1.7088607594936708e-05, + "loss": 1.0195245742797852, + "step": 54, + "token_acc": 0.7620052770448549 + }, + { + "epoch": 0.13963821009203428, + "grad_norm": 6.477061508345248, + "learning_rate": 1.7405063291139243e-05, + "loss": 1.081801176071167, + "step": 55, + "token_acc": 0.7465539422900203 + }, + { + "epoch": 0.14217708663916218, + "grad_norm": 6.2376824743665855, + "learning_rate": 1.7721518987341772e-05, + "loss": 1.0337473154067993, + "step": 56, + "token_acc": 0.7620926243567753 + }, + { + "epoch": 0.14471596318629007, + "grad_norm": 2.5584859222177037, + "learning_rate": 1.8037974683544304e-05, + "loss": 1.0235919952392578, + "step": 57, + "token_acc": 0.7479560191711305 + }, + { + "epoch": 0.14725483973341796, + "grad_norm": 1.6007308463984253, + "learning_rate": 1.8354430379746836e-05, + "loss": 1.026627540588379, + "step": 58, + "token_acc": 0.7545010680500458 + }, + { + "epoch": 0.14979371628054586, + "grad_norm": 3.5256130287772764, + "learning_rate": 1.8670886075949368e-05, + "loss": 1.0003381967544556, + "step": 59, + "token_acc": 0.7527782006393667 + }, + { + "epoch": 0.15233259282767375, + "grad_norm": 3.7023204963636838, + "learning_rate": 1.89873417721519e-05, + "loss": 0.9081876873970032, + "step": 60, + "token_acc": 0.7770368222673238 + }, + { + "epoch": 0.15487146937480165, + "grad_norm": 13.207752417441773, + "learning_rate": 1.9303797468354432e-05, + "loss": 1.0521725416183472, + "step": 61, + "token_acc": 0.7498269417139692 + }, + { + "epoch": 0.15741034592192954, + "grad_norm": 5.75860602043051, + "learning_rate": 1.962025316455696e-05, + "loss": 0.9959630966186523, + "step": 62, + "token_acc": 0.7539973595423207 + }, + { + "epoch": 0.15994922246905743, + "grad_norm": 2.1358911014473065, + "learning_rate": 1.9936708860759496e-05, + "loss": 0.9936040639877319, + "step": 63, + "token_acc": 0.7573317125056982 + }, + { + "epoch": 0.16248809901618533, + "grad_norm": 3.6065860167804553, + "learning_rate": 2.0253164556962025e-05, + "loss": 0.9302588701248169, + "step": 64, + "token_acc": 0.7660311958405546 + }, + { + "epoch": 0.16502697556331322, + "grad_norm": 3.4010076126873536, + "learning_rate": 2.056962025316456e-05, + "loss": 0.9686568975448608, + "step": 65, + "token_acc": 0.7588071919310042 + }, + { + "epoch": 0.16756585211044114, + "grad_norm": 8.25772123801425, + "learning_rate": 2.088607594936709e-05, + "loss": 0.9752371907234192, + "step": 66, + "token_acc": 0.7534704800133801 + }, + { + "epoch": 0.17010472865756904, + "grad_norm": 2.759694488314889, + "learning_rate": 2.120253164556962e-05, + "loss": 0.8781665563583374, + "step": 67, + "token_acc": 0.7766960284345542 + }, + { + "epoch": 0.17264360520469693, + "grad_norm": 6.065387925549159, + "learning_rate": 2.1518987341772153e-05, + "loss": 0.8539150953292847, + "step": 68, + "token_acc": 0.7778531456672885 + }, + { + "epoch": 0.17518248175182483, + "grad_norm": 6.273759879651115, + "learning_rate": 2.1835443037974685e-05, + "loss": 0.8206325173377991, + "step": 69, + "token_acc": 0.7851107226107226 + }, + { + "epoch": 0.17772135829895272, + "grad_norm": 6.797725562475832, + "learning_rate": 2.2151898734177217e-05, + "loss": 0.899059534072876, + "step": 70, + "token_acc": 0.7692409240924093 + }, + { + "epoch": 0.1802602348460806, + "grad_norm": 14.741247422293133, + "learning_rate": 2.246835443037975e-05, + "loss": 0.9375818371772766, + "step": 71, + "token_acc": 0.7635605006954103 + }, + { + "epoch": 0.1827991113932085, + "grad_norm": 2.91554003314857, + "learning_rate": 2.278481012658228e-05, + "loss": 0.8030121326446533, + "step": 72, + "token_acc": 0.7937145989402521 + }, + { + "epoch": 0.1853379879403364, + "grad_norm": 3.256147486736755, + "learning_rate": 2.3101265822784813e-05, + "loss": 0.9064524173736572, + "step": 73, + "token_acc": 0.7655107017068545 + }, + { + "epoch": 0.1878768644874643, + "grad_norm": 2.189919100543407, + "learning_rate": 2.341772151898734e-05, + "loss": 0.7569831609725952, + "step": 74, + "token_acc": 0.7891252955082743 + }, + { + "epoch": 0.1904157410345922, + "grad_norm": 3.0168260923297563, + "learning_rate": 2.3734177215189873e-05, + "loss": 0.8783301115036011, + "step": 75, + "token_acc": 0.7689860284963342 + }, + { + "epoch": 0.19295461758172008, + "grad_norm": 14.13725393363498, + "learning_rate": 2.4050632911392405e-05, + "loss": 0.8693279027938843, + "step": 76, + "token_acc": 0.7832378223495702 + }, + { + "epoch": 0.19549349412884798, + "grad_norm": 4.663170307038689, + "learning_rate": 2.4367088607594937e-05, + "loss": 0.9367852807044983, + "step": 77, + "token_acc": 0.7587620685094564 + }, + { + "epoch": 0.19803237067597587, + "grad_norm": 2.0251332116596314, + "learning_rate": 2.468354430379747e-05, + "loss": 0.9105110764503479, + "step": 78, + "token_acc": 0.7696913251729643 + }, + { + "epoch": 0.20057124722310377, + "grad_norm": 2.9353487138799976, + "learning_rate": 2.5e-05, + "loss": 0.812760055065155, + "step": 79, + "token_acc": 0.7861037544788908 + }, + { + "epoch": 0.20311012377023166, + "grad_norm": 6.81850589494243, + "learning_rate": 2.5316455696202533e-05, + "loss": 0.8404111266136169, + "step": 80, + "token_acc": 0.7826737386100912 + }, + { + "epoch": 0.20564900031735958, + "grad_norm": 5.8636033139277925, + "learning_rate": 2.5632911392405062e-05, + "loss": 0.7662273049354553, + "step": 81, + "token_acc": 0.7912533814247069 + }, + { + "epoch": 0.20818787686448748, + "grad_norm": 3.1667411014534554, + "learning_rate": 2.5949367088607597e-05, + "loss": 0.8550683259963989, + "step": 82, + "token_acc": 0.7763946519133241 + }, + { + "epoch": 0.21072675341161537, + "grad_norm": 2.9382867326927786, + "learning_rate": 2.626582278481013e-05, + "loss": 0.728255033493042, + "step": 83, + "token_acc": 0.7997798049701164 + }, + { + "epoch": 0.21326562995874326, + "grad_norm": 4.413930575957828, + "learning_rate": 2.6582278481012658e-05, + "loss": 0.7953159213066101, + "step": 84, + "token_acc": 0.7851035843472542 + }, + { + "epoch": 0.21580450650587116, + "grad_norm": 2.2548226528829085, + "learning_rate": 2.689873417721519e-05, + "loss": 0.8843717575073242, + "step": 85, + "token_acc": 0.7768637532133676 + }, + { + "epoch": 0.21834338305299905, + "grad_norm": 13.172644883413941, + "learning_rate": 2.7215189873417722e-05, + "loss": 0.8480836749076843, + "step": 86, + "token_acc": 0.7769437756691687 + }, + { + "epoch": 0.22088225960012695, + "grad_norm": 13.962359276231266, + "learning_rate": 2.7531645569620257e-05, + "loss": 0.7050020098686218, + "step": 87, + "token_acc": 0.8056864831990269 + }, + { + "epoch": 0.22342113614725484, + "grad_norm": 4.2019275549330555, + "learning_rate": 2.7848101265822786e-05, + "loss": 0.7555727958679199, + "step": 88, + "token_acc": 0.7975503308461214 + }, + { + "epoch": 0.22596001269438273, + "grad_norm": 5.0153336369322, + "learning_rate": 2.8164556962025318e-05, + "loss": 0.7249046564102173, + "step": 89, + "token_acc": 0.8017741935483871 + }, + { + "epoch": 0.22849888924151063, + "grad_norm": 11.63320257189594, + "learning_rate": 2.848101265822785e-05, + "loss": 0.688890814781189, + "step": 90, + "token_acc": 0.8080682699767261 + }, + { + "epoch": 0.23103776578863852, + "grad_norm": 5.457398735429565, + "learning_rate": 2.879746835443038e-05, + "loss": 0.7510577440261841, + "step": 91, + "token_acc": 0.7953611274221961 + }, + { + "epoch": 0.23357664233576642, + "grad_norm": 4.530006374919538, + "learning_rate": 2.9113924050632914e-05, + "loss": 0.7740436792373657, + "step": 92, + "token_acc": 0.7910108958837773 + }, + { + "epoch": 0.2361155188828943, + "grad_norm": 3.283408990769055, + "learning_rate": 2.9430379746835446e-05, + "loss": 0.6994897127151489, + "step": 93, + "token_acc": 0.8084580953850903 + }, + { + "epoch": 0.2386543954300222, + "grad_norm": 3.74567677581687, + "learning_rate": 2.9746835443037974e-05, + "loss": 0.6745874285697937, + "step": 94, + "token_acc": 0.8121098626716604 + }, + { + "epoch": 0.2411932719771501, + "grad_norm": 2.481160635241608, + "learning_rate": 3.0063291139240506e-05, + "loss": 0.7404159307479858, + "step": 95, + "token_acc": 0.8046498830650709 + }, + { + "epoch": 0.24373214852427802, + "grad_norm": 3.011989315773918, + "learning_rate": 3.0379746835443042e-05, + "loss": 0.6883790493011475, + "step": 96, + "token_acc": 0.8137285986049461 + }, + { + "epoch": 0.2462710250714059, + "grad_norm": 3.977588680498373, + "learning_rate": 3.0696202531645574e-05, + "loss": 0.7354066371917725, + "step": 97, + "token_acc": 0.8012324221835994 + }, + { + "epoch": 0.2488099016185338, + "grad_norm": 2.4417231744019787, + "learning_rate": 3.10126582278481e-05, + "loss": 0.7102183103561401, + "step": 98, + "token_acc": 0.801501463290495 + }, + { + "epoch": 0.2513487781656617, + "grad_norm": 5.211297364565694, + "learning_rate": 3.132911392405064e-05, + "loss": 0.7254366278648376, + "step": 99, + "token_acc": 0.8042974184572577 + }, + { + "epoch": 0.25388765471278957, + "grad_norm": 4.740070832115608, + "learning_rate": 3.1645569620253167e-05, + "loss": 0.71342533826828, + "step": 100, + "token_acc": 0.8091580057237536 + }, + { + "epoch": 0.2564265312599175, + "grad_norm": 5.296776098340419, + "learning_rate": 3.1962025316455695e-05, + "loss": 0.7370377779006958, + "step": 101, + "token_acc": 0.8084075636818253 + }, + { + "epoch": 0.25896540780704536, + "grad_norm": 4.396582033002235, + "learning_rate": 3.227848101265823e-05, + "loss": 0.671318531036377, + "step": 102, + "token_acc": 0.8183896782622897 + }, + { + "epoch": 0.2615042843541733, + "grad_norm": 2.6335454183216696, + "learning_rate": 3.2594936708860766e-05, + "loss": 0.6583906412124634, + "step": 103, + "token_acc": 0.8211532014750251 + }, + { + "epoch": 0.2640431609013012, + "grad_norm": 6.236411278449773, + "learning_rate": 3.291139240506329e-05, + "loss": 0.7536572217941284, + "step": 104, + "token_acc": 0.7975090397750101 + }, + { + "epoch": 0.26658203744842907, + "grad_norm": 2.5341922649732602, + "learning_rate": 3.322784810126582e-05, + "loss": 0.6701930165290833, + "step": 105, + "token_acc": 0.8116928446771379 + }, + { + "epoch": 0.269120913995557, + "grad_norm": 11.881079085435806, + "learning_rate": 3.354430379746836e-05, + "loss": 0.5909067392349243, + "step": 106, + "token_acc": 0.8345961631468645 + }, + { + "epoch": 0.27165979054268485, + "grad_norm": 2.384697440414924, + "learning_rate": 3.386075949367089e-05, + "loss": 0.6282612085342407, + "step": 107, + "token_acc": 0.823628821631587 + }, + { + "epoch": 0.2741986670898128, + "grad_norm": 2.1995079597886673, + "learning_rate": 3.4177215189873416e-05, + "loss": 0.6936606764793396, + "step": 108, + "token_acc": 0.8020663404023926 + }, + { + "epoch": 0.27673754363694064, + "grad_norm": 4.861432353099602, + "learning_rate": 3.449367088607595e-05, + "loss": 0.778184175491333, + "step": 109, + "token_acc": 0.78875 + }, + { + "epoch": 0.27927642018406856, + "grad_norm": 9.57103993272581, + "learning_rate": 3.4810126582278487e-05, + "loss": 0.6751368641853333, + "step": 110, + "token_acc": 0.8148423557406306 + }, + { + "epoch": 0.28181529673119643, + "grad_norm": 13.549564951896668, + "learning_rate": 3.5126582278481015e-05, + "loss": 0.7030066251754761, + "step": 111, + "token_acc": 0.805439330543933 + }, + { + "epoch": 0.28435417327832435, + "grad_norm": 5.1073725117939475, + "learning_rate": 3.5443037974683544e-05, + "loss": 0.6886919736862183, + "step": 112, + "token_acc": 0.8083333333333333 + }, + { + "epoch": 0.2868930498254522, + "grad_norm": 22.063583297317187, + "learning_rate": 3.575949367088608e-05, + "loss": 0.6610169410705566, + "step": 113, + "token_acc": 0.8150403409955853 + }, + { + "epoch": 0.28943192637258014, + "grad_norm": 18.72026765015026, + "learning_rate": 3.607594936708861e-05, + "loss": 0.6841698884963989, + "step": 114, + "token_acc": 0.8123032904148784 + }, + { + "epoch": 0.291970802919708, + "grad_norm": 2.864881799429328, + "learning_rate": 3.639240506329114e-05, + "loss": 0.6466969847679138, + "step": 115, + "token_acc": 0.8172187406744256 + }, + { + "epoch": 0.2945096794668359, + "grad_norm": 6.716337706090099, + "learning_rate": 3.670886075949367e-05, + "loss": 0.6078028678894043, + "step": 116, + "token_acc": 0.8346497252747253 + }, + { + "epoch": 0.2970485560139638, + "grad_norm": 5.564745491758841, + "learning_rate": 3.70253164556962e-05, + "loss": 0.664849042892456, + "step": 117, + "token_acc": 0.8190188679245283 + }, + { + "epoch": 0.2995874325610917, + "grad_norm": 28.630717891823956, + "learning_rate": 3.7341772151898736e-05, + "loss": 0.6384534239768982, + "step": 118, + "token_acc": 0.8220830070477682 + }, + { + "epoch": 0.30212630910821964, + "grad_norm": 12.273392356907912, + "learning_rate": 3.765822784810127e-05, + "loss": 0.6201878190040588, + "step": 119, + "token_acc": 0.8250733897427042 + }, + { + "epoch": 0.3046651856553475, + "grad_norm": 4.192852448588315, + "learning_rate": 3.79746835443038e-05, + "loss": 0.6979496479034424, + "step": 120, + "token_acc": 0.8104520945665699 + }, + { + "epoch": 0.3072040622024754, + "grad_norm": 3.4657196050906567, + "learning_rate": 3.829113924050633e-05, + "loss": 0.6550031304359436, + "step": 121, + "token_acc": 0.8187575798409917 + }, + { + "epoch": 0.3097429387496033, + "grad_norm": 27.787374024365484, + "learning_rate": 3.8607594936708864e-05, + "loss": 0.6515278220176697, + "step": 122, + "token_acc": 0.8171852329517976 + }, + { + "epoch": 0.3122818152967312, + "grad_norm": 4.0417548472450715, + "learning_rate": 3.89240506329114e-05, + "loss": 0.605487585067749, + "step": 123, + "token_acc": 0.8265876933201711 + }, + { + "epoch": 0.3148206918438591, + "grad_norm": 3.8292748886400765, + "learning_rate": 3.924050632911392e-05, + "loss": 0.6631138324737549, + "step": 124, + "token_acc": 0.8129932356257046 + }, + { + "epoch": 0.317359568390987, + "grad_norm": 8.960479693493973, + "learning_rate": 3.9556962025316456e-05, + "loss": 0.6087026596069336, + "step": 125, + "token_acc": 0.8281978055012776 + }, + { + "epoch": 0.31989844493811487, + "grad_norm": 4.011722457924042, + "learning_rate": 3.987341772151899e-05, + "loss": 0.7122887372970581, + "step": 126, + "token_acc": 0.8093482748451785 + }, + { + "epoch": 0.3224373214852428, + "grad_norm": 31.39830164995725, + "learning_rate": 4.018987341772152e-05, + "loss": 0.6663644313812256, + "step": 127, + "token_acc": 0.8180548501777553 + }, + { + "epoch": 0.32497619803237066, + "grad_norm": 4.425596331791689, + "learning_rate": 4.050632911392405e-05, + "loss": 0.6300691366195679, + "step": 128, + "token_acc": 0.8203907404367099 + }, + { + "epoch": 0.3275150745794986, + "grad_norm": 16.1083849209539, + "learning_rate": 4.0822784810126584e-05, + "loss": 0.6704287528991699, + "step": 129, + "token_acc": 0.8078627591136526 + }, + { + "epoch": 0.33005395112662644, + "grad_norm": 2.2389483956009752, + "learning_rate": 4.113924050632912e-05, + "loss": 0.7170148491859436, + "step": 130, + "token_acc": 0.8084219603334292 + }, + { + "epoch": 0.33259282767375437, + "grad_norm": 3.613513118589346, + "learning_rate": 4.145569620253165e-05, + "loss": 0.6717650890350342, + "step": 131, + "token_acc": 0.8138652912621359 + }, + { + "epoch": 0.3351317042208823, + "grad_norm": 5.5827028571809105, + "learning_rate": 4.177215189873418e-05, + "loss": 0.6085385084152222, + "step": 132, + "token_acc": 0.8274016203703703 + }, + { + "epoch": 0.33767058076801015, + "grad_norm": 5.37295628319291, + "learning_rate": 4.208860759493671e-05, + "loss": 0.6445047855377197, + "step": 133, + "token_acc": 0.8134654130288784 + }, + { + "epoch": 0.3402094573151381, + "grad_norm": 2.1788757767041003, + "learning_rate": 4.240506329113924e-05, + "loss": 0.5425457954406738, + "step": 134, + "token_acc": 0.837465564738292 + }, + { + "epoch": 0.34274833386226594, + "grad_norm": 4.649401574423171, + "learning_rate": 4.2721518987341776e-05, + "loss": 0.5962692499160767, + "step": 135, + "token_acc": 0.8225226767071709 + }, + { + "epoch": 0.34528721040939386, + "grad_norm": 3.1742303151683506, + "learning_rate": 4.3037974683544305e-05, + "loss": 0.6038417816162109, + "step": 136, + "token_acc": 0.8316648698598491 + }, + { + "epoch": 0.34782608695652173, + "grad_norm": 5.696983011175984, + "learning_rate": 4.3354430379746834e-05, + "loss": 0.6016777753829956, + "step": 137, + "token_acc": 0.8321018707750354 + }, + { + "epoch": 0.35036496350364965, + "grad_norm": 5.797388182589766, + "learning_rate": 4.367088607594937e-05, + "loss": 0.6565921306610107, + "step": 138, + "token_acc": 0.8184429761562769 + }, + { + "epoch": 0.3529038400507775, + "grad_norm": 6.854274250412749, + "learning_rate": 4.3987341772151904e-05, + "loss": 0.691247820854187, + "step": 139, + "token_acc": 0.8143437786810017 + }, + { + "epoch": 0.35544271659790544, + "grad_norm": 2.6184869642829267, + "learning_rate": 4.430379746835443e-05, + "loss": 0.6285054683685303, + "step": 140, + "token_acc": 0.8222631355332106 + }, + { + "epoch": 0.3579815931450333, + "grad_norm": 4.653346904540878, + "learning_rate": 4.462025316455696e-05, + "loss": 0.5671603679656982, + "step": 141, + "token_acc": 0.8380648412565094 + }, + { + "epoch": 0.3605204696921612, + "grad_norm": 4.522681266549905, + "learning_rate": 4.49367088607595e-05, + "loss": 0.6068707704544067, + "step": 142, + "token_acc": 0.8331301432490095 + }, + { + "epoch": 0.3630593462392891, + "grad_norm": 3.181075099904124, + "learning_rate": 4.525316455696203e-05, + "loss": 0.5732223987579346, + "step": 143, + "token_acc": 0.836748182419035 + }, + { + "epoch": 0.365598222786417, + "grad_norm": 5.248411142229925, + "learning_rate": 4.556962025316456e-05, + "loss": 0.7090050578117371, + "step": 144, + "token_acc": 0.8088770652478298 + }, + { + "epoch": 0.3681370993335449, + "grad_norm": 2.2841820115958877, + "learning_rate": 4.588607594936709e-05, + "loss": 0.6395794153213501, + "step": 145, + "token_acc": 0.8251766217084137 + }, + { + "epoch": 0.3706759758806728, + "grad_norm": 3.192951403479268, + "learning_rate": 4.6202531645569625e-05, + "loss": 0.5619275569915771, + "step": 146, + "token_acc": 0.8353532367720957 + }, + { + "epoch": 0.3732148524278007, + "grad_norm": 6.184982774052421, + "learning_rate": 4.6518987341772154e-05, + "loss": 0.6076276302337646, + "step": 147, + "token_acc": 0.8321759259259259 + }, + { + "epoch": 0.3757537289749286, + "grad_norm": 3.9260670039543686, + "learning_rate": 4.683544303797468e-05, + "loss": 0.5210973024368286, + "step": 148, + "token_acc": 0.8457633053221288 + }, + { + "epoch": 0.3782926055220565, + "grad_norm": 3.6953261186445467, + "learning_rate": 4.715189873417722e-05, + "loss": 0.4648306369781494, + "step": 149, + "token_acc": 0.8572195383789587 + }, + { + "epoch": 0.3808314820691844, + "grad_norm": 4.9921203101786045, + "learning_rate": 4.7468354430379746e-05, + "loss": 0.676045835018158, + "step": 150, + "token_acc": 0.8171926006528836 + }, + { + "epoch": 0.3833703586163123, + "grad_norm": 20.42938551967448, + "learning_rate": 4.778481012658228e-05, + "loss": 0.619693398475647, + "step": 151, + "token_acc": 0.8338338338338338 + }, + { + "epoch": 0.38590923516344017, + "grad_norm": 8.755403481608779, + "learning_rate": 4.810126582278481e-05, + "loss": 0.5743368864059448, + "step": 152, + "token_acc": 0.8412815319462346 + }, + { + "epoch": 0.3884481117105681, + "grad_norm": 3.2072760680708425, + "learning_rate": 4.8417721518987346e-05, + "loss": 0.6492601633071899, + "step": 153, + "token_acc": 0.8137201735357917 + }, + { + "epoch": 0.39098698825769596, + "grad_norm": 3.8316550813580914, + "learning_rate": 4.8734177215189874e-05, + "loss": 0.6361663341522217, + "step": 154, + "token_acc": 0.8231698225734307 + }, + { + "epoch": 0.3935258648048239, + "grad_norm": 3.972772394188529, + "learning_rate": 4.905063291139241e-05, + "loss": 0.6939312815666199, + "step": 155, + "token_acc": 0.8113469274517964 + }, + { + "epoch": 0.39606474135195174, + "grad_norm": 16.657647846984553, + "learning_rate": 4.936708860759494e-05, + "loss": 0.6008589863777161, + "step": 156, + "token_acc": 0.8316379183252248 + }, + { + "epoch": 0.39860361789907967, + "grad_norm": 2.814742590512491, + "learning_rate": 4.968354430379747e-05, + "loss": 0.5716952085494995, + "step": 157, + "token_acc": 0.8305734227453128 + }, + { + "epoch": 0.40114249444620753, + "grad_norm": 3.3183075108254605, + "learning_rate": 5e-05, + "loss": 0.5892596244812012, + "step": 158, + "token_acc": 0.823594674556213 + }, + { + "epoch": 0.40368137099333545, + "grad_norm": 3.805622229512587, + "learning_rate": 4.9999689166542295e-05, + "loss": 0.5727576017379761, + "step": 159, + "token_acc": 0.832796486090776 + }, + { + "epoch": 0.4062202475404633, + "grad_norm": 2.9959092236114975, + "learning_rate": 4.999875667389858e-05, + "loss": 0.5001785159111023, + "step": 160, + "token_acc": 0.8474907244678773 + }, + { + "epoch": 0.40875912408759124, + "grad_norm": 2.926865350121703, + "learning_rate": 4.999720254525684e-05, + "loss": 0.6166025400161743, + "step": 161, + "token_acc": 0.820961340585036 + }, + { + "epoch": 0.41129800063471916, + "grad_norm": 2.2665405249006403, + "learning_rate": 4.999502681926309e-05, + "loss": 0.5835655927658081, + "step": 162, + "token_acc": 0.8314150304671631 + }, + { + "epoch": 0.41383687718184703, + "grad_norm": 6.077225672698818, + "learning_rate": 4.999222955002041e-05, + "loss": 0.6306543350219727, + "step": 163, + "token_acc": 0.8202965582913889 + }, + { + "epoch": 0.41637575372897495, + "grad_norm": 9.205523914845546, + "learning_rate": 4.9988810807087584e-05, + "loss": 0.6070675253868103, + "step": 164, + "token_acc": 0.8314500941619586 + }, + { + "epoch": 0.4189146302761028, + "grad_norm": 2.520164837218412, + "learning_rate": 4.99847706754774e-05, + "loss": 0.5549716949462891, + "step": 165, + "token_acc": 0.8379689521345407 + }, + { + "epoch": 0.42145350682323074, + "grad_norm": 2.3723529006989215, + "learning_rate": 4.998010925565448e-05, + "loss": 0.5140861868858337, + "step": 166, + "token_acc": 0.8497000856898029 + }, + { + "epoch": 0.4239923833703586, + "grad_norm": 3.168399232927889, + "learning_rate": 4.997482666353287e-05, + "loss": 0.5713208913803101, + "step": 167, + "token_acc": 0.8342638379326847 + }, + { + "epoch": 0.4265312599174865, + "grad_norm": 3.1544527876057353, + "learning_rate": 4.996892303047306e-05, + "loss": 0.5652569532394409, + "step": 168, + "token_acc": 0.8433680398370303 + }, + { + "epoch": 0.4290701364646144, + "grad_norm": 4.050502290302643, + "learning_rate": 4.99623985032788e-05, + "loss": 0.6010338068008423, + "step": 169, + "token_acc": 0.8299908842297175 + }, + { + "epoch": 0.4316090130117423, + "grad_norm": 2.3208744483079924, + "learning_rate": 4.9955253244193375e-05, + "loss": 0.625551700592041, + "step": 170, + "token_acc": 0.8214095744680852 + }, + { + "epoch": 0.4341478895588702, + "grad_norm": 3.5752910543983734, + "learning_rate": 4.994748743089566e-05, + "loss": 0.5763528347015381, + "step": 171, + "token_acc": 0.8370288248337029 + }, + { + "epoch": 0.4366867661059981, + "grad_norm": 5.186367702439989, + "learning_rate": 4.993910125649561e-05, + "loss": 0.583060085773468, + "step": 172, + "token_acc": 0.8326601269474899 + }, + { + "epoch": 0.43922564265312597, + "grad_norm": 2.314721989016231, + "learning_rate": 4.9930094929529506e-05, + "loss": 0.6205261945724487, + "step": 173, + "token_acc": 0.8203899721448468 + }, + { + "epoch": 0.4417645192002539, + "grad_norm": 3.3583225237625016, + "learning_rate": 4.992046867395478e-05, + "loss": 0.5230633020401001, + "step": 174, + "token_acc": 0.8419920582395765 + }, + { + "epoch": 0.44430339574738176, + "grad_norm": 4.042306283685085, + "learning_rate": 4.99102227291444e-05, + "loss": 0.5143859386444092, + "step": 175, + "token_acc": 0.8474544778892605 + }, + { + "epoch": 0.4468422722945097, + "grad_norm": 2.6321524863816603, + "learning_rate": 4.989935734988098e-05, + "loss": 0.6144051551818848, + "step": 176, + "token_acc": 0.8175049636002647 + }, + { + "epoch": 0.4493811488416376, + "grad_norm": 2.361660215036252, + "learning_rate": 4.988787280635038e-05, + "loss": 0.49258965253829956, + "step": 177, + "token_acc": 0.8459661430532256 + }, + { + "epoch": 0.45192002538876547, + "grad_norm": 2.0369998726790266, + "learning_rate": 4.987576938413504e-05, + "loss": 0.5039229393005371, + "step": 178, + "token_acc": 0.8487822609960014 + }, + { + "epoch": 0.4544589019358934, + "grad_norm": 6.93229029448243, + "learning_rate": 4.9863047384206835e-05, + "loss": 0.5814566612243652, + "step": 179, + "token_acc": 0.8274802458296752 + }, + { + "epoch": 0.45699777848302126, + "grad_norm": 1.9442137330470775, + "learning_rate": 4.984970712291963e-05, + "loss": 0.5427694916725159, + "step": 180, + "token_acc": 0.8449736295349208 + }, + { + "epoch": 0.4595366550301492, + "grad_norm": 3.8278365677194706, + "learning_rate": 4.983574893200139e-05, + "loss": 0.5021108388900757, + "step": 181, + "token_acc": 0.8494821249582358 + }, + { + "epoch": 0.46207553157727704, + "grad_norm": 3.898165087457517, + "learning_rate": 4.9821173158545936e-05, + "loss": 0.529310941696167, + "step": 182, + "token_acc": 0.8456512269493248 + }, + { + "epoch": 0.46461440812440497, + "grad_norm": 5.784138022488126, + "learning_rate": 4.9805980165004304e-05, + "loss": 0.5193842053413391, + "step": 183, + "token_acc": 0.8486529318541997 + }, + { + "epoch": 0.46715328467153283, + "grad_norm": 2.7860896602561755, + "learning_rate": 4.9790170329175754e-05, + "loss": 0.5510420799255371, + "step": 184, + "token_acc": 0.8427399903521466 + }, + { + "epoch": 0.46969216121866075, + "grad_norm": 2.391478502605225, + "learning_rate": 4.977374404419837e-05, + "loss": 0.565636396408081, + "step": 185, + "token_acc": 0.8384972889233152 + }, + { + "epoch": 0.4722310377657886, + "grad_norm": 2.7381469955000233, + "learning_rate": 4.975670171853926e-05, + "loss": 0.5837178230285645, + "step": 186, + "token_acc": 0.8304386223138063 + }, + { + "epoch": 0.47476991431291654, + "grad_norm": 4.436221537482703, + "learning_rate": 4.973904377598443e-05, + "loss": 0.5879358649253845, + "step": 187, + "token_acc": 0.8254743303571429 + }, + { + "epoch": 0.4773087908600444, + "grad_norm": 3.161812435220317, + "learning_rate": 4.972077065562821e-05, + "loss": 0.5809712409973145, + "step": 188, + "token_acc": 0.8361007729745205 + }, + { + "epoch": 0.47984766740717233, + "grad_norm": 1.5520306180347663, + "learning_rate": 4.970188281186241e-05, + "loss": 0.5579955577850342, + "step": 189, + "token_acc": 0.837281009110021 + }, + { + "epoch": 0.4823865439543002, + "grad_norm": 3.727248476475511, + "learning_rate": 4.9682380714364897e-05, + "loss": 0.58579421043396, + "step": 190, + "token_acc": 0.8350501304765829 + }, + { + "epoch": 0.4849254205014281, + "grad_norm": 3.0795046455062614, + "learning_rate": 4.9662264848088034e-05, + "loss": 0.4905577301979065, + "step": 191, + "token_acc": 0.8543485289363077 + }, + { + "epoch": 0.48746429704855604, + "grad_norm": 2.222320433523395, + "learning_rate": 4.964153571324658e-05, + "loss": 0.6000843048095703, + "step": 192, + "token_acc": 0.8202116862403944 + }, + { + "epoch": 0.4900031735956839, + "grad_norm": 3.054493416036562, + "learning_rate": 4.962019382530521e-05, + "loss": 0.553142786026001, + "step": 193, + "token_acc": 0.8378803028138837 + }, + { + "epoch": 0.4925420501428118, + "grad_norm": 1.48942863662551, + "learning_rate": 4.959823971496574e-05, + "loss": 0.49760788679122925, + "step": 194, + "token_acc": 0.848271341962969 + }, + { + "epoch": 0.4950809266899397, + "grad_norm": 1.4337417758608024, + "learning_rate": 4.9575673928153957e-05, + "loss": 0.5126315355300903, + "step": 195, + "token_acc": 0.846869578930768 + }, + { + "epoch": 0.4976198032370676, + "grad_norm": 1.8216377101814463, + "learning_rate": 4.9552497026005974e-05, + "loss": 0.5140909552574158, + "step": 196, + "token_acc": 0.8483076923076923 + }, + { + "epoch": 0.5001586797841955, + "grad_norm": 3.6989217579732125, + "learning_rate": 4.952870958485432e-05, + "loss": 0.5483355522155762, + "step": 197, + "token_acc": 0.8436149991359945 + }, + { + "epoch": 0.5026975563313234, + "grad_norm": 1.4793601703477388, + "learning_rate": 4.9504312196213596e-05, + "loss": 0.5258674621582031, + "step": 198, + "token_acc": 0.844776119402985 + }, + { + "epoch": 0.5052364328784513, + "grad_norm": 3.320358649604752, + "learning_rate": 4.947930546676579e-05, + "loss": 0.5483481287956238, + "step": 199, + "token_acc": 0.8407105847520355 + }, + { + "epoch": 0.5077753094255791, + "grad_norm": 1.4836965410501335, + "learning_rate": 4.9453690018345144e-05, + "loss": 0.5698910355567932, + "step": 200, + "token_acc": 0.8355416991426344 + }, + { + "epoch": 0.5103141859727071, + "grad_norm": 1.9840806554207313, + "learning_rate": 4.942746648792274e-05, + "loss": 0.6226257681846619, + "step": 201, + "token_acc": 0.821941594317285 + }, + { + "epoch": 0.512853062519835, + "grad_norm": 3.4200124483670358, + "learning_rate": 4.940063552759061e-05, + "loss": 0.5485865473747253, + "step": 202, + "token_acc": 0.8423786494716102 + }, + { + "epoch": 0.5153919390669629, + "grad_norm": 1.4137645693467988, + "learning_rate": 4.937319780454559e-05, + "loss": 0.4833056330680847, + "step": 203, + "token_acc": 0.8569816188326347 + }, + { + "epoch": 0.5179308156140907, + "grad_norm": 2.216132222614037, + "learning_rate": 4.934515400107266e-05, + "loss": 0.4503518342971802, + "step": 204, + "token_acc": 0.8646072954321393 + }, + { + "epoch": 0.5204696921612186, + "grad_norm": 4.426951079644797, + "learning_rate": 4.931650481452801e-05, + "loss": 0.5067535638809204, + "step": 205, + "token_acc": 0.8500777604976671 + }, + { + "epoch": 0.5230085687083466, + "grad_norm": 7.154300916510774, + "learning_rate": 4.928725095732169e-05, + "loss": 0.5493313670158386, + "step": 206, + "token_acc": 0.8378132118451025 + }, + { + "epoch": 0.5255474452554745, + "grad_norm": 1.965712161044352, + "learning_rate": 4.925739315689991e-05, + "loss": 0.4918142557144165, + "step": 207, + "token_acc": 0.8530601240226476 + }, + { + "epoch": 0.5280863218026024, + "grad_norm": 1.5124863710410141, + "learning_rate": 4.922693215572695e-05, + "loss": 0.5023689270019531, + "step": 208, + "token_acc": 0.8512195121951219 + }, + { + "epoch": 0.5306251983497302, + "grad_norm": 2.3375825804294723, + "learning_rate": 4.919586871126667e-05, + "loss": 0.5670746564865112, + "step": 209, + "token_acc": 0.8375552282768778 + }, + { + "epoch": 0.5331640748968581, + "grad_norm": 1.8418248968647637, + "learning_rate": 4.916420359596368e-05, + "loss": 0.5001412630081177, + "step": 210, + "token_acc": 0.8473023413640991 + }, + { + "epoch": 0.535702951443986, + "grad_norm": 2.4235777237942924, + "learning_rate": 4.9131937597224185e-05, + "loss": 0.5839577913284302, + "step": 211, + "token_acc": 0.8330151270377442 + }, + { + "epoch": 0.538241827991114, + "grad_norm": 15.841289330503669, + "learning_rate": 4.909907151739633e-05, + "loss": 0.5890910625457764, + "step": 212, + "token_acc": 0.8299887822510283 + }, + { + "epoch": 0.5407807045382418, + "grad_norm": 2.1298845605680197, + "learning_rate": 4.90656061737503e-05, + "loss": 0.5155512094497681, + "step": 213, + "token_acc": 0.8465608465608465 + }, + { + "epoch": 0.5433195810853697, + "grad_norm": 2.1579493985693454, + "learning_rate": 4.9031542398457974e-05, + "loss": 0.5869525671005249, + "step": 214, + "token_acc": 0.8264487369985141 + }, + { + "epoch": 0.5458584576324976, + "grad_norm": 3.015091026973871, + "learning_rate": 4.899688103857223e-05, + "loss": 0.5348740816116333, + "step": 215, + "token_acc": 0.8366959820658735 + }, + { + "epoch": 0.5483973341796256, + "grad_norm": 1.4983193386255376, + "learning_rate": 4.896162295600589e-05, + "loss": 0.5215170383453369, + "step": 216, + "token_acc": 0.8455044322498945 + }, + { + "epoch": 0.5509362107267534, + "grad_norm": 7.6369461867236215, + "learning_rate": 4.892576902751031e-05, + "loss": 0.6286407709121704, + "step": 217, + "token_acc": 0.8244441744623983 + }, + { + "epoch": 0.5534750872738813, + "grad_norm": 1.909191100547535, + "learning_rate": 4.888932014465352e-05, + "loss": 0.5405088663101196, + "step": 218, + "token_acc": 0.8398148148148148 + }, + { + "epoch": 0.5560139638210092, + "grad_norm": 2.1249944661063713, + "learning_rate": 4.8852277213798106e-05, + "loss": 0.5207107067108154, + "step": 219, + "token_acc": 0.8505783057205377 + }, + { + "epoch": 0.5585528403681371, + "grad_norm": 4.590133511444357, + "learning_rate": 4.881464115607865e-05, + "loss": 0.5813536643981934, + "step": 220, + "token_acc": 0.831871745683749 + }, + { + "epoch": 0.561091716915265, + "grad_norm": 1.641052016603602, + "learning_rate": 4.877641290737884e-05, + "loss": 0.5410237312316895, + "step": 221, + "token_acc": 0.8366046831955923 + }, + { + "epoch": 0.5636305934623929, + "grad_norm": 2.277495246079136, + "learning_rate": 4.8737593418308156e-05, + "loss": 0.5533527135848999, + "step": 222, + "token_acc": 0.8363823756763721 + }, + { + "epoch": 0.5661694700095208, + "grad_norm": 4.159566523283519, + "learning_rate": 4.86981836541783e-05, + "loss": 0.559136152267456, + "step": 223, + "token_acc": 0.8388266834884087 + }, + { + "epoch": 0.5687083465566487, + "grad_norm": 225.83355044511626, + "learning_rate": 4.865818459497911e-05, + "loss": 0.4840168356895447, + "step": 224, + "token_acc": 0.8560429982568274 + }, + { + "epoch": 0.5712472231037766, + "grad_norm": 1.7941761886315637, + "learning_rate": 4.861759723535426e-05, + "loss": 0.5671250224113464, + "step": 225, + "token_acc": 0.8405020448455789 + }, + { + "epoch": 0.5737860996509044, + "grad_norm": 1.6927695579956952, + "learning_rate": 4.8576422584576514e-05, + "loss": 0.5532321929931641, + "step": 226, + "token_acc": 0.8365077158348394 + }, + { + "epoch": 0.5763249761980324, + "grad_norm": 1.3677369838188163, + "learning_rate": 4.8534661666522584e-05, + "loss": 0.5039372444152832, + "step": 227, + "token_acc": 0.8533067362283259 + }, + { + "epoch": 0.5788638527451603, + "grad_norm": 3.1985990377060944, + "learning_rate": 4.849231551964771e-05, + "loss": 0.4986110031604767, + "step": 228, + "token_acc": 0.8453477868112015 + }, + { + "epoch": 0.5814027292922882, + "grad_norm": 2.5449576622123646, + "learning_rate": 4.844938519695984e-05, + "loss": 0.5104832649230957, + "step": 229, + "token_acc": 0.8486502433987314 + }, + { + "epoch": 0.583941605839416, + "grad_norm": 1.3118749339834277, + "learning_rate": 4.8405871765993433e-05, + "loss": 0.505854606628418, + "step": 230, + "token_acc": 0.8532082324455206 + }, + { + "epoch": 0.5864804823865439, + "grad_norm": 2.18900446561014, + "learning_rate": 4.836177630878289e-05, + "loss": 0.5590152144432068, + "step": 231, + "token_acc": 0.8363560267857143 + }, + { + "epoch": 0.5890193589336719, + "grad_norm": 15.30797015176157, + "learning_rate": 4.8317099921835697e-05, + "loss": 0.4845745265483856, + "step": 232, + "token_acc": 0.8525514089870525 + }, + { + "epoch": 0.5915582354807998, + "grad_norm": 1.7181163596035074, + "learning_rate": 4.827184371610511e-05, + "loss": 0.5797554850578308, + "step": 233, + "token_acc": 0.8373081140350878 + }, + { + "epoch": 0.5940971120279276, + "grad_norm": 1.1288420718760477, + "learning_rate": 4.822600881696256e-05, + "loss": 0.5012973546981812, + "step": 234, + "token_acc": 0.8529411764705882 + }, + { + "epoch": 0.5966359885750555, + "grad_norm": 1.437368423568747, + "learning_rate": 4.817959636416969e-05, + "loss": 0.5510119199752808, + "step": 235, + "token_acc": 0.8344022575679836 + }, + { + "epoch": 0.5991748651221834, + "grad_norm": 1.2890032605357924, + "learning_rate": 4.813260751184992e-05, + "loss": 0.5216597318649292, + "step": 236, + "token_acc": 0.8493268404468634 + }, + { + "epoch": 0.6017137416693114, + "grad_norm": 1.405196489873568, + "learning_rate": 4.808504342845986e-05, + "loss": 0.6565842032432556, + "step": 237, + "token_acc": 0.8143687707641196 + }, + { + "epoch": 0.6042526182164393, + "grad_norm": 1.6519014060456265, + "learning_rate": 4.803690529676019e-05, + "loss": 0.4384632706642151, + "step": 238, + "token_acc": 0.8647027694478744 + }, + { + "epoch": 0.6067914947635671, + "grad_norm": 1.8927813931053827, + "learning_rate": 4.7988194313786275e-05, + "loss": 0.504548192024231, + "step": 239, + "token_acc": 0.8548215641609719 + }, + { + "epoch": 0.609330371310695, + "grad_norm": 1.3750618958063838, + "learning_rate": 4.7938911690818347e-05, + "loss": 0.5044655799865723, + "step": 240, + "token_acc": 0.8456818530449456 + }, + { + "epoch": 0.6118692478578229, + "grad_norm": 1.7791425452801302, + "learning_rate": 4.7889058653351485e-05, + "loss": 0.4389927089214325, + "step": 241, + "token_acc": 0.8615710435117443 + }, + { + "epoch": 0.6144081244049509, + "grad_norm": 3.174913815120615, + "learning_rate": 4.783863644106502e-05, + "loss": 0.5367846488952637, + "step": 242, + "token_acc": 0.841294538665007 + }, + { + "epoch": 0.6169470009520787, + "grad_norm": 2.447734108467047, + "learning_rate": 4.778764630779183e-05, + "loss": 0.5005022287368774, + "step": 243, + "token_acc": 0.8491663435440093 + }, + { + "epoch": 0.6194858774992066, + "grad_norm": 2.807814103600755, + "learning_rate": 4.773608952148706e-05, + "loss": 0.5408118367195129, + "step": 244, + "token_acc": 0.8354211087420043 + }, + { + "epoch": 0.6220247540463345, + "grad_norm": 2.227992234463683, + "learning_rate": 4.7683967364196624e-05, + "loss": 0.5159645080566406, + "step": 245, + "token_acc": 0.8429188135357193 + }, + { + "epoch": 0.6245636305934624, + "grad_norm": 3.9276559319284314, + "learning_rate": 4.763128113202537e-05, + "loss": 0.5435395240783691, + "step": 246, + "token_acc": 0.8381928868952259 + }, + { + "epoch": 0.6271025071405902, + "grad_norm": 21.07592625562304, + "learning_rate": 4.7578032135104796e-05, + "loss": 0.528008222579956, + "step": 247, + "token_acc": 0.8437879893022125 + }, + { + "epoch": 0.6296413836877182, + "grad_norm": 2.4305528198591606, + "learning_rate": 4.752422169756048e-05, + "loss": 0.5454938411712646, + "step": 248, + "token_acc": 0.8377711162052548 + }, + { + "epoch": 0.6321802602348461, + "grad_norm": 4.774445766197441, + "learning_rate": 4.7469851157479177e-05, + "loss": 0.5896109342575073, + "step": 249, + "token_acc": 0.8303083960454478 + }, + { + "epoch": 0.634719136781974, + "grad_norm": 2.9285874898965036, + "learning_rate": 4.7414921866875524e-05, + "loss": 0.5258548259735107, + "step": 250, + "token_acc": 0.8459306342407075 + }, + { + "epoch": 0.6372580133291019, + "grad_norm": 1.1551732083505906, + "learning_rate": 4.7359435191658425e-05, + "loss": 0.4973874092102051, + "step": 251, + "token_acc": 0.8523009950248757 + }, + { + "epoch": 0.6397968898762297, + "grad_norm": 1.404758000704147, + "learning_rate": 4.730339251159709e-05, + "loss": 0.48979347944259644, + "step": 252, + "token_acc": 0.8519233625427002 + }, + { + "epoch": 0.6423357664233577, + "grad_norm": 1.1599030830108534, + "learning_rate": 4.724679522028672e-05, + "loss": 0.4671449661254883, + "step": 253, + "token_acc": 0.8547652417659425 + }, + { + "epoch": 0.6448746429704856, + "grad_norm": 9.767857767777004, + "learning_rate": 4.718964472511386e-05, + "loss": 0.5248907208442688, + "step": 254, + "token_acc": 0.8436238600687697 + }, + { + "epoch": 0.6474135195176135, + "grad_norm": 1.5836269105977552, + "learning_rate": 4.713194244722138e-05, + "loss": 0.492233008146286, + "step": 255, + "token_acc": 0.8537440902851914 + }, + { + "epoch": 0.6499523960647413, + "grad_norm": 1.676133573613313, + "learning_rate": 4.707368982147318e-05, + "loss": 0.49239009618759155, + "step": 256, + "token_acc": 0.8473175021987687 + }, + { + "epoch": 0.6524912726118692, + "grad_norm": 12.420578245961337, + "learning_rate": 4.701488829641845e-05, + "loss": 0.55488121509552, + "step": 257, + "token_acc": 0.835998984513836 + }, + { + "epoch": 0.6550301491589972, + "grad_norm": 2.7460132417830643, + "learning_rate": 4.6955539334255716e-05, + "loss": 0.5333112478256226, + "step": 258, + "token_acc": 0.8431862832648688 + }, + { + "epoch": 0.6575690257061251, + "grad_norm": 2.143768931475659, + "learning_rate": 4.6895644410796416e-05, + "loss": 0.5408412218093872, + "step": 259, + "token_acc": 0.8437373601186463 + }, + { + "epoch": 0.6601079022532529, + "grad_norm": 1.552814047782724, + "learning_rate": 4.6835205015428246e-05, + "loss": 0.5155550241470337, + "step": 260, + "token_acc": 0.8499210110584519 + }, + { + "epoch": 0.6626467788003808, + "grad_norm": 1.2034458590422716, + "learning_rate": 4.6774222651078106e-05, + "loss": 0.5099776983261108, + "step": 261, + "token_acc": 0.8472036789793799 + }, + { + "epoch": 0.6651856553475087, + "grad_norm": 2.924220695079595, + "learning_rate": 4.671269883417473e-05, + "loss": 0.5947083234786987, + "step": 262, + "token_acc": 0.8290450928381963 + }, + { + "epoch": 0.6677245318946367, + "grad_norm": 1.455955314620601, + "learning_rate": 4.665063509461097e-05, + "loss": 0.5068027973175049, + "step": 263, + "token_acc": 0.8482072342441952 + }, + { + "epoch": 0.6702634084417646, + "grad_norm": 3.344945263340371, + "learning_rate": 4.658803297570577e-05, + "loss": 0.5365261435508728, + "step": 264, + "token_acc": 0.8415192190359976 + }, + { + "epoch": 0.6728022849888924, + "grad_norm": 1.9005203964312098, + "learning_rate": 4.652489403416579e-05, + "loss": 0.4796498417854309, + "step": 265, + "token_acc": 0.8555090206185567 + }, + { + "epoch": 0.6753411615360203, + "grad_norm": 2.8726899682034412, + "learning_rate": 4.6461219840046654e-05, + "loss": 0.49148356914520264, + "step": 266, + "token_acc": 0.8587875255027688 + }, + { + "epoch": 0.6778800380831482, + "grad_norm": 3.620289535245779, + "learning_rate": 4.639701197671397e-05, + "loss": 0.5379594564437866, + "step": 267, + "token_acc": 0.844286636539703 + }, + { + "epoch": 0.6804189146302762, + "grad_norm": 1.880048630363598, + "learning_rate": 4.6332272040803895e-05, + "loss": 0.40906715393066406, + "step": 268, + "token_acc": 0.8677865920049774 + }, + { + "epoch": 0.682957791177404, + "grad_norm": 3.2529749263524854, + "learning_rate": 4.6267001642183496e-05, + "loss": 0.5698261857032776, + "step": 269, + "token_acc": 0.8295176385889129 + }, + { + "epoch": 0.6854966677245319, + "grad_norm": 1.4115756433255298, + "learning_rate": 4.620120240391065e-05, + "loss": 0.5403001308441162, + "step": 270, + "token_acc": 0.8392932267564156 + }, + { + "epoch": 0.6880355442716598, + "grad_norm": 1.5731929659655102, + "learning_rate": 4.613487596219376e-05, + "loss": 0.4380991756916046, + "step": 271, + "token_acc": 0.8581743166580712 + }, + { + "epoch": 0.6905744208187877, + "grad_norm": 2.429353942954586, + "learning_rate": 4.606802396635098e-05, + "loss": 0.4497607946395874, + "step": 272, + "token_acc": 0.8668831168831169 + }, + { + "epoch": 0.6931132973659155, + "grad_norm": 1.4740422171009888, + "learning_rate": 4.600064807876929e-05, + "loss": 0.4794745445251465, + "step": 273, + "token_acc": 0.8582345601996257 + }, + { + "epoch": 0.6956521739130435, + "grad_norm": 1.4962672531000716, + "learning_rate": 4.593274997486309e-05, + "loss": 0.5734583735466003, + "step": 274, + "token_acc": 0.8358989687640114 + }, + { + "epoch": 0.6981910504601714, + "grad_norm": 2.582140206521716, + "learning_rate": 4.586433134303257e-05, + "loss": 0.47569674253463745, + "step": 275, + "token_acc": 0.851392632524708 + }, + { + "epoch": 0.7007299270072993, + "grad_norm": 2.0299052997394145, + "learning_rate": 4.579539388462173e-05, + "loss": 0.4513978362083435, + "step": 276, + "token_acc": 0.8595333128645993 + }, + { + "epoch": 0.7032688035544271, + "grad_norm": 1.4683236839939144, + "learning_rate": 4.572593931387604e-05, + "loss": 0.4924212694168091, + "step": 277, + "token_acc": 0.8509630565203663 + }, + { + "epoch": 0.705807680101555, + "grad_norm": 1.6692647992426015, + "learning_rate": 4.5655969357899874e-05, + "loss": 0.50971919298172, + "step": 278, + "token_acc": 0.8504672897196262 + }, + { + "epoch": 0.708346556648683, + "grad_norm": 2.772573768796691, + "learning_rate": 4.5585485756613486e-05, + "loss": 0.4721433222293854, + "step": 279, + "token_acc": 0.8584571832979476 + }, + { + "epoch": 0.7108854331958109, + "grad_norm": 2.0060707686440407, + "learning_rate": 4.551449026270979e-05, + "loss": 0.5175821781158447, + "step": 280, + "token_acc": 0.8468809073724007 + }, + { + "epoch": 0.7134243097429388, + "grad_norm": 1.8487986104225613, + "learning_rate": 4.544298464161079e-05, + "loss": 0.5257778763771057, + "step": 281, + "token_acc": 0.8475199020208206 + }, + { + "epoch": 0.7159631862900666, + "grad_norm": 2.127782753744905, + "learning_rate": 4.537097067142363e-05, + "loss": 0.562999427318573, + "step": 282, + "token_acc": 0.8408823529411765 + }, + { + "epoch": 0.7185020628371945, + "grad_norm": 2.5685178275153957, + "learning_rate": 4.529845014289642e-05, + "loss": 0.5207107067108154, + "step": 283, + "token_acc": 0.8469147432878003 + }, + { + "epoch": 0.7210409393843225, + "grad_norm": 6.2775274916114014, + "learning_rate": 4.522542485937369e-05, + "loss": 0.5115345120429993, + "step": 284, + "token_acc": 0.8454268292682927 + }, + { + "epoch": 0.7235798159314504, + "grad_norm": 1.2979163949839545, + "learning_rate": 4.5151896636751556e-05, + "loss": 0.4864828586578369, + "step": 285, + "token_acc": 0.855954855954856 + }, + { + "epoch": 0.7261186924785782, + "grad_norm": 1.9952838067379783, + "learning_rate": 4.5077867303432546e-05, + "loss": 0.49415430426597595, + "step": 286, + "token_acc": 0.8480227882037533 + }, + { + "epoch": 0.7286575690257061, + "grad_norm": 1.7314556438703808, + "learning_rate": 4.500333870028016e-05, + "loss": 0.5226168036460876, + "step": 287, + "token_acc": 0.8493612242032851 + }, + { + "epoch": 0.731196445572834, + "grad_norm": 4.40006164102703, + "learning_rate": 4.4928312680573064e-05, + "loss": 0.4729849100112915, + "step": 288, + "token_acc": 0.8531379420197515 + }, + { + "epoch": 0.733735322119962, + "grad_norm": 6.394724509170586, + "learning_rate": 4.485279110995903e-05, + "loss": 0.5564934611320496, + "step": 289, + "token_acc": 0.8377503852080124 + }, + { + "epoch": 0.7362741986670898, + "grad_norm": 1.4562222001050333, + "learning_rate": 4.477677586640854e-05, + "loss": 0.5449815988540649, + "step": 290, + "token_acc": 0.8387928419775553 + }, + { + "epoch": 0.7388130752142177, + "grad_norm": 2.12916421678339, + "learning_rate": 4.4700268840168045e-05, + "loss": 0.5377695560455322, + "step": 291, + "token_acc": 0.840630472854641 + }, + { + "epoch": 0.7413519517613456, + "grad_norm": 2.4123707155531, + "learning_rate": 4.4623271933713065e-05, + "loss": 0.4623599648475647, + "step": 292, + "token_acc": 0.8558679912443172 + }, + { + "epoch": 0.7438908283084735, + "grad_norm": 2.3146814777436333, + "learning_rate": 4.454578706170075e-05, + "loss": 0.5539848804473877, + "step": 293, + "token_acc": 0.8411723411723412 + }, + { + "epoch": 0.7464297048556015, + "grad_norm": 1.9969775879325171, + "learning_rate": 4.446781615092235e-05, + "loss": 0.48377200961112976, + "step": 294, + "token_acc": 0.8496886046120182 + }, + { + "epoch": 0.7489685814027293, + "grad_norm": 2.8675177730517296, + "learning_rate": 4.4389361140255306e-05, + "loss": 0.5668104887008667, + "step": 295, + "token_acc": 0.8326268464996789 + }, + { + "epoch": 0.7515074579498572, + "grad_norm": 2.7875164416704923, + "learning_rate": 4.431042398061499e-05, + "loss": 0.4774082601070404, + "step": 296, + "token_acc": 0.8559006211180125 + }, + { + "epoch": 0.7540463344969851, + "grad_norm": 3.728199688522229, + "learning_rate": 4.4231006634906224e-05, + "loss": 0.5095118284225464, + "step": 297, + "token_acc": 0.8488716956802064 + }, + { + "epoch": 0.756585211044113, + "grad_norm": 2.5412776821938974, + "learning_rate": 4.415111107797445e-05, + "loss": 0.5145753622055054, + "step": 298, + "token_acc": 0.8456885637923759 + }, + { + "epoch": 0.7591240875912408, + "grad_norm": 3.109090657017562, + "learning_rate": 4.407073929655666e-05, + "loss": 0.4358251094818115, + "step": 299, + "token_acc": 0.8618875369944098 + }, + { + "epoch": 0.7616629641383688, + "grad_norm": 1.6297548376808046, + "learning_rate": 4.3989893289231954e-05, + "loss": 0.4839688539505005, + "step": 300, + "token_acc": 0.8528946535906359 + }, + { + "epoch": 0.7642018406854967, + "grad_norm": 1.6139429460706416, + "learning_rate": 4.3908575066371835e-05, + "loss": 0.5315079092979431, + "step": 301, + "token_acc": 0.8464961067853171 + }, + { + "epoch": 0.7667407172326246, + "grad_norm": 1.958784000024998, + "learning_rate": 4.382678665009028e-05, + "loss": 0.43339255452156067, + "step": 302, + "token_acc": 0.8655923195611178 + }, + { + "epoch": 0.7692795937797524, + "grad_norm": 2.9343918370531257, + "learning_rate": 4.374453007419336e-05, + "loss": 0.4361863434314728, + "step": 303, + "token_acc": 0.859846630771741 + }, + { + "epoch": 0.7718184703268803, + "grad_norm": 3.237940469376079, + "learning_rate": 4.366180738412876e-05, + "loss": 0.511203408241272, + "step": 304, + "token_acc": 0.8461118690313779 + }, + { + "epoch": 0.7743573468740083, + "grad_norm": 2.274147737832287, + "learning_rate": 4.357862063693486e-05, + "loss": 0.4454347491264343, + "step": 305, + "token_acc": 0.8601151774103659 + }, + { + "epoch": 0.7768962234211362, + "grad_norm": 4.944015444600801, + "learning_rate": 4.34949719011896e-05, + "loss": 0.5148607492446899, + "step": 306, + "token_acc": 0.8461761718183137 + }, + { + "epoch": 0.779435099968264, + "grad_norm": 1.192919570288064, + "learning_rate": 4.341086325695905e-05, + "loss": 0.4589368402957916, + "step": 307, + "token_acc": 0.8554825669530066 + }, + { + "epoch": 0.7819739765153919, + "grad_norm": 2.321389755226125, + "learning_rate": 4.332629679574566e-05, + "loss": 0.4466659128665924, + "step": 308, + "token_acc": 0.8586858685868587 + }, + { + "epoch": 0.7845128530625198, + "grad_norm": 1.7507551558813503, + "learning_rate": 4.324127462043627e-05, + "loss": 0.5438239574432373, + "step": 309, + "token_acc": 0.8434806403064715 + }, + { + "epoch": 0.7870517296096478, + "grad_norm": 1.779981899957501, + "learning_rate": 4.3155798845249827e-05, + "loss": 0.45011502504348755, + "step": 310, + "token_acc": 0.8603988603988604 + }, + { + "epoch": 0.7895906061567757, + "grad_norm": 1.1173424722276424, + "learning_rate": 4.306987159568479e-05, + "loss": 0.474408894777298, + "step": 311, + "token_acc": 0.8555719678319383 + }, + { + "epoch": 0.7921294827039035, + "grad_norm": 1.6608650795823556, + "learning_rate": 4.2983495008466276e-05, + "loss": 0.4456779360771179, + "step": 312, + "token_acc": 0.8610570687418937 + }, + { + "epoch": 0.7946683592510314, + "grad_norm": 1.5083288797918926, + "learning_rate": 4.2896671231492966e-05, + "loss": 0.4788318872451782, + "step": 313, + "token_acc": 0.8551842330762639 + }, + { + "epoch": 0.7972072357981593, + "grad_norm": 1.2937780524566131, + "learning_rate": 4.2809402423783624e-05, + "loss": 0.4659798741340637, + "step": 314, + "token_acc": 0.8593476531424026 + }, + { + "epoch": 0.7997461123452873, + "grad_norm": 1.0233055916579001, + "learning_rate": 4.272169075542348e-05, + "loss": 0.5088976621627808, + "step": 315, + "token_acc": 0.8429627141417534 + }, + { + "epoch": 0.8022849888924151, + "grad_norm": 1.0571728981681126, + "learning_rate": 4.263353840751022e-05, + "loss": 0.4456738829612732, + "step": 316, + "token_acc": 0.8666382616105667 + }, + { + "epoch": 0.804823865439543, + "grad_norm": 1.8198326747222258, + "learning_rate": 4.254494757209979e-05, + "loss": 0.4678633213043213, + "step": 317, + "token_acc": 0.8546817674270218 + }, + { + "epoch": 0.8073627419866709, + "grad_norm": 1.5377357010824237, + "learning_rate": 4.245592045215182e-05, + "loss": 0.5010336637496948, + "step": 318, + "token_acc": 0.8465278833004103 + }, + { + "epoch": 0.8099016185337988, + "grad_norm": 1.4181630525718223, + "learning_rate": 4.2366459261474933e-05, + "loss": 0.5233482718467712, + "step": 319, + "token_acc": 0.843609022556391 + }, + { + "epoch": 0.8124404950809266, + "grad_norm": 2.7968517592507247, + "learning_rate": 4.227656622467162e-05, + "loss": 0.45297539234161377, + "step": 320, + "token_acc": 0.8587121852290012 + }, + { + "epoch": 0.8149793716280546, + "grad_norm": 3.9632559263367324, + "learning_rate": 4.2186243577082954e-05, + "loss": 0.49113717675209045, + "step": 321, + "token_acc": 0.8499593165174939 + }, + { + "epoch": 0.8175182481751825, + "grad_norm": 1.5212678599870548, + "learning_rate": 4.2095493564733005e-05, + "loss": 0.4760684370994568, + "step": 322, + "token_acc": 0.8581730769230769 + }, + { + "epoch": 0.8200571247223104, + "grad_norm": 1.1979894810329197, + "learning_rate": 4.2004318444272985e-05, + "loss": 0.5287943482398987, + "step": 323, + "token_acc": 0.8400316247199895 + }, + { + "epoch": 0.8225960012694383, + "grad_norm": 13.231283362213604, + "learning_rate": 4.191272048292513e-05, + "loss": 0.45438772439956665, + "step": 324, + "token_acc": 0.8593374939990398 + }, + { + "epoch": 0.8251348778165661, + "grad_norm": 1.9566355667367066, + "learning_rate": 4.1820701958426325e-05, + "loss": 0.4688713550567627, + "step": 325, + "token_acc": 0.8610249593856151 + }, + { + "epoch": 0.8276737543636941, + "grad_norm": 4.323839382951773, + "learning_rate": 4.172826515897146e-05, + "loss": 0.5428496599197388, + "step": 326, + "token_acc": 0.841347459929367 + }, + { + "epoch": 0.830212630910822, + "grad_norm": 2.713639671675627, + "learning_rate": 4.163541238315653e-05, + "loss": 0.5651642680168152, + "step": 327, + "token_acc": 0.8335643015521065 + }, + { + "epoch": 0.8327515074579499, + "grad_norm": 2.2005640892547205, + "learning_rate": 4.154214593992149e-05, + "loss": 0.42816388607025146, + "step": 328, + "token_acc": 0.8655292606861127 + }, + { + "epoch": 0.8352903840050777, + "grad_norm": 1.7693852546194808, + "learning_rate": 4.144846814849282e-05, + "loss": 0.5406675934791565, + "step": 329, + "token_acc": 0.8363126015659624 + }, + { + "epoch": 0.8378292605522056, + "grad_norm": 1.2824936447977062, + "learning_rate": 4.1354381338325864e-05, + "loss": 0.47528088092803955, + "step": 330, + "token_acc": 0.8529364953047907 + }, + { + "epoch": 0.8403681370993336, + "grad_norm": 2.1290755841224964, + "learning_rate": 4.1259887849046906e-05, + "loss": 0.47919371724128723, + "step": 331, + "token_acc": 0.8517776664997496 + }, + { + "epoch": 0.8429070136464615, + "grad_norm": 1.7923254144391947, + "learning_rate": 4.116499003039499e-05, + "loss": 0.4583389163017273, + "step": 332, + "token_acc": 0.8578696865255211 + }, + { + "epoch": 0.8454458901935893, + "grad_norm": 3.831696945491014, + "learning_rate": 4.1069690242163484e-05, + "loss": 0.4751017093658447, + "step": 333, + "token_acc": 0.8565161762017912 + }, + { + "epoch": 0.8479847667407172, + "grad_norm": 1.3534101044854359, + "learning_rate": 4.09739908541414e-05, + "loss": 0.5170926451683044, + "step": 334, + "token_acc": 0.844575246579701 + }, + { + "epoch": 0.8505236432878451, + "grad_norm": 1.7263471686071763, + "learning_rate": 4.087789424605447e-05, + "loss": 0.560020923614502, + "step": 335, + "token_acc": 0.8369974874371859 + }, + { + "epoch": 0.853062519834973, + "grad_norm": 1.976895260311541, + "learning_rate": 4.078140280750597e-05, + "loss": 0.48105573654174805, + "step": 336, + "token_acc": 0.8486519607843137 + }, + { + "epoch": 0.8556013963821009, + "grad_norm": 1.3618234100955324, + "learning_rate": 4.0684518937917315e-05, + "loss": 0.535722553730011, + "step": 337, + "token_acc": 0.8411811652035116 + }, + { + "epoch": 0.8581402729292288, + "grad_norm": 1.7410934714261248, + "learning_rate": 4.058724504646834e-05, + "loss": 0.5101606845855713, + "step": 338, + "token_acc": 0.8413575374901342 + }, + { + "epoch": 0.8606791494763567, + "grad_norm": 1.6462446903462482, + "learning_rate": 4.048958355203746e-05, + "loss": 0.4928050637245178, + "step": 339, + "token_acc": 0.8460967646185812 + }, + { + "epoch": 0.8632180260234846, + "grad_norm": 1.228936011236623, + "learning_rate": 4.039153688314145e-05, + "loss": 0.5174915194511414, + "step": 340, + "token_acc": 0.8437601824698598 + }, + { + "epoch": 0.8657569025706126, + "grad_norm": 1.4612143586664255, + "learning_rate": 4.029310747787516e-05, + "loss": 0.41705322265625, + "step": 341, + "token_acc": 0.8653099269846202 + }, + { + "epoch": 0.8682957791177404, + "grad_norm": 1.797059242292307, + "learning_rate": 4.0194297783850755e-05, + "loss": 0.5154389142990112, + "step": 342, + "token_acc": 0.8439297831538575 + }, + { + "epoch": 0.8708346556648683, + "grad_norm": 2.068548395822149, + "learning_rate": 4.009511025813694e-05, + "loss": 0.45814093947410583, + "step": 343, + "token_acc": 0.8591615638247763 + }, + { + "epoch": 0.8733735322119962, + "grad_norm": 2.106347854495477, + "learning_rate": 3.9995547367197845e-05, + "loss": 0.5106515884399414, + "step": 344, + "token_acc": 0.8444444444444444 + }, + { + "epoch": 0.8759124087591241, + "grad_norm": 2.277599588151966, + "learning_rate": 3.9895611586831685e-05, + "loss": 0.5230048894882202, + "step": 345, + "token_acc": 0.8413416536661467 + }, + { + "epoch": 0.8784512853062519, + "grad_norm": 2.12251688559056, + "learning_rate": 3.9795305402109195e-05, + "loss": 0.4795979857444763, + "step": 346, + "token_acc": 0.8566383257030739 + }, + { + "epoch": 0.8809901618533799, + "grad_norm": 6.771491520442473, + "learning_rate": 3.969463130731183e-05, + "loss": 0.41639000177383423, + "step": 347, + "token_acc": 0.869641912153819 + }, + { + "epoch": 0.8835290384005078, + "grad_norm": 8.929919537256396, + "learning_rate": 3.959359180586975e-05, + "loss": 0.4425828158855438, + "step": 348, + "token_acc": 0.8597887647328946 + }, + { + "epoch": 0.8860679149476357, + "grad_norm": 7.530785543727866, + "learning_rate": 3.9492189410299566e-05, + "loss": 0.44385579228401184, + "step": 349, + "token_acc": 0.865767878077374 + }, + { + "epoch": 0.8886067914947635, + "grad_norm": 2.6343520915908716, + "learning_rate": 3.939042664214184e-05, + "loss": 0.48342394828796387, + "step": 350, + "token_acc": 0.8567626018965231 + }, + { + "epoch": 0.8911456680418914, + "grad_norm": 1.5801412806386852, + "learning_rate": 3.928830603189844e-05, + "loss": 0.4776611030101776, + "step": 351, + "token_acc": 0.8521291530182499 + }, + { + "epoch": 0.8936845445890194, + "grad_norm": 3.7389218036878478, + "learning_rate": 3.918583011896955e-05, + "loss": 0.45217645168304443, + "step": 352, + "token_acc": 0.8585561910650796 + }, + { + "epoch": 0.8962234211361473, + "grad_norm": 1.6890575760456612, + "learning_rate": 3.908300145159055e-05, + "loss": 0.5242031216621399, + "step": 353, + "token_acc": 0.8453546152687849 + }, + { + "epoch": 0.8987622976832752, + "grad_norm": 1.992965354554827, + "learning_rate": 3.897982258676867e-05, + "loss": 0.4830443859100342, + "step": 354, + "token_acc": 0.8554014932195643 + }, + { + "epoch": 0.901301174230403, + "grad_norm": 1.2964405728485144, + "learning_rate": 3.887629609021938e-05, + "loss": 0.4663028419017792, + "step": 355, + "token_acc": 0.8561201572150478 + }, + { + "epoch": 0.9038400507775309, + "grad_norm": 8.39081588467176, + "learning_rate": 3.8772424536302564e-05, + "loss": 0.5014960169792175, + "step": 356, + "token_acc": 0.8504262120404902 + }, + { + "epoch": 0.9063789273246589, + "grad_norm": 1.8861771407475878, + "learning_rate": 3.866821050795859e-05, + "loss": 0.5827922821044922, + "step": 357, + "token_acc": 0.8322280231409623 + }, + { + "epoch": 0.9089178038717868, + "grad_norm": 1.631982885362827, + "learning_rate": 3.856365659664399e-05, + "loss": 0.5254430770874023, + "step": 358, + "token_acc": 0.8455894342083808 + }, + { + "epoch": 0.9114566804189146, + "grad_norm": 1.6184938593440648, + "learning_rate": 3.845876540226706e-05, + "loss": 0.5034159421920776, + "step": 359, + "token_acc": 0.8477827221114009 + }, + { + "epoch": 0.9139955569660425, + "grad_norm": 2.616866018868145, + "learning_rate": 3.835353953312322e-05, + "loss": 0.4409644603729248, + "step": 360, + "token_acc": 0.8624558168126633 + }, + { + "epoch": 0.9165344335131704, + "grad_norm": 1.1082161386999507, + "learning_rate": 3.824798160583012e-05, + "loss": 0.4826850891113281, + "step": 361, + "token_acc": 0.8542769573697409 + }, + { + "epoch": 0.9190733100602984, + "grad_norm": 1.4706520431007584, + "learning_rate": 3.814209424526262e-05, + "loss": 0.5543685555458069, + "step": 362, + "token_acc": 0.8411547002220577 + }, + { + "epoch": 0.9216121866074262, + "grad_norm": 1.4937567660832907, + "learning_rate": 3.803588008448745e-05, + "loss": 0.46426546573638916, + "step": 363, + "token_acc": 0.8584509156409487 + }, + { + "epoch": 0.9241510631545541, + "grad_norm": 1.164319366810129, + "learning_rate": 3.7929341764697816e-05, + "loss": 0.43454286456108093, + "step": 364, + "token_acc": 0.869382677655108 + }, + { + "epoch": 0.926689939701682, + "grad_norm": 1.4647461875367664, + "learning_rate": 3.782248193514766e-05, + "loss": 0.40108054876327515, + "step": 365, + "token_acc": 0.8742168674698795 + }, + { + "epoch": 0.9292288162488099, + "grad_norm": 1.6339280778635523, + "learning_rate": 3.771530325308579e-05, + "loss": 0.48394569754600525, + "step": 366, + "token_acc": 0.8536367122587243 + }, + { + "epoch": 0.9317676927959379, + "grad_norm": 1.4990029947108798, + "learning_rate": 3.7607808383689856e-05, + "loss": 0.5164212584495544, + "step": 367, + "token_acc": 0.8487874465049928 + }, + { + "epoch": 0.9343065693430657, + "grad_norm": 1.246505387725808, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.5112602710723877, + "step": 368, + "token_acc": 0.8492902446390819 + }, + { + "epoch": 0.9368454458901936, + "grad_norm": 3.107413430389552, + "learning_rate": 3.739188078285244e-05, + "loss": 0.4383936822414398, + "step": 369, + "token_acc": 0.8606896551724138 + }, + { + "epoch": 0.9393843224373215, + "grad_norm": 37.635995940969075, + "learning_rate": 3.7283453420812786e-05, + "loss": 0.46092715859413147, + "step": 370, + "token_acc": 0.8597212294496068 + }, + { + "epoch": 0.9419231989844494, + "grad_norm": 3.577937521692329, + "learning_rate": 3.717472061010918e-05, + "loss": 0.5413942337036133, + "step": 371, + "token_acc": 0.8350426115845732 + }, + { + "epoch": 0.9444620755315772, + "grad_norm": 5.47409206936157, + "learning_rate": 3.706568505456527e-05, + "loss": 0.48648974299430847, + "step": 372, + "token_acc": 0.8585890540968049 + }, + { + "epoch": 0.9470009520787052, + "grad_norm": 1.4741286710796073, + "learning_rate": 3.695634946553296e-05, + "loss": 0.47160500288009644, + "step": 373, + "token_acc": 0.8502487562189055 + }, + { + "epoch": 0.9495398286258331, + "grad_norm": 2.090944147666011, + "learning_rate": 3.6846716561824965e-05, + "loss": 0.5264440774917603, + "step": 374, + "token_acc": 0.84245960502693 + }, + { + "epoch": 0.952078705172961, + "grad_norm": 5.396217963829348, + "learning_rate": 3.673678906964727e-05, + "loss": 0.46441876888275146, + "step": 375, + "token_acc": 0.8582541054451167 + }, + { + "epoch": 0.9546175817200888, + "grad_norm": 2.5487410815491325, + "learning_rate": 3.662656972253127e-05, + "loss": 0.4945961534976959, + "step": 376, + "token_acc": 0.849025974025974 + }, + { + "epoch": 0.9571564582672167, + "grad_norm": 1.4487108456202973, + "learning_rate": 3.651606126126581e-05, + "loss": 0.44490116834640503, + "step": 377, + "token_acc": 0.8634252090430474 + }, + { + "epoch": 0.9596953348143447, + "grad_norm": 2.4501839034153567, + "learning_rate": 3.6405266433829075e-05, + "loss": 0.45414626598358154, + "step": 378, + "token_acc": 0.8611764705882353 + }, + { + "epoch": 0.9622342113614726, + "grad_norm": 2.498672242292354, + "learning_rate": 3.6294187995320214e-05, + "loss": 0.4957122206687927, + "step": 379, + "token_acc": 0.8477234401349073 + }, + { + "epoch": 0.9647730879086004, + "grad_norm": 1.5923271833585566, + "learning_rate": 3.6182828707890816e-05, + "loss": 0.5208961963653564, + "step": 380, + "token_acc": 0.8432196541134637 + }, + { + "epoch": 0.9673119644557283, + "grad_norm": 4.277533304496898, + "learning_rate": 3.607119134067629e-05, + "loss": 0.5402977466583252, + "step": 381, + "token_acc": 0.8438965563446336 + }, + { + "epoch": 0.9698508410028562, + "grad_norm": 1.391785836034451, + "learning_rate": 3.5959278669726935e-05, + "loss": 0.5133845210075378, + "step": 382, + "token_acc": 0.8467186095295175 + }, + { + "epoch": 0.9723897175499842, + "grad_norm": 1.6652300791673929, + "learning_rate": 3.5847093477938956e-05, + "loss": 0.4607965350151062, + "step": 383, + "token_acc": 0.8581548321808062 + }, + { + "epoch": 0.9749285940971121, + "grad_norm": 3.047516730060917, + "learning_rate": 3.5734638554985236e-05, + "loss": 0.558885931968689, + "step": 384, + "token_acc": 0.8354353441726181 + }, + { + "epoch": 0.9774674706442399, + "grad_norm": 1.7394548434827772, + "learning_rate": 3.562191669724597e-05, + "loss": 0.45114433765411377, + "step": 385, + "token_acc": 0.8557377049180328 + }, + { + "epoch": 0.9800063471913678, + "grad_norm": 2.3715567586043527, + "learning_rate": 3.550893070773914e-05, + "loss": 0.4739205837249756, + "step": 386, + "token_acc": 0.8504549457000293 + }, + { + "epoch": 0.9825452237384957, + "grad_norm": 2.7051039254253944, + "learning_rate": 3.5395683396050825e-05, + "loss": 0.47992223501205444, + "step": 387, + "token_acc": 0.8514475557664927 + }, + { + "epoch": 0.9850841002856237, + "grad_norm": 2.9508108026603526, + "learning_rate": 3.5282177578265296e-05, + "loss": 0.41233572363853455, + "step": 388, + "token_acc": 0.8679525222551929 + }, + { + "epoch": 0.9876229768327515, + "grad_norm": 1.4813660303012237, + "learning_rate": 3.516841607689501e-05, + "loss": 0.5352930426597595, + "step": 389, + "token_acc": 0.8431159981415518 + }, + { + "epoch": 0.9901618533798794, + "grad_norm": 3.1303557072936457, + "learning_rate": 3.505440172081044e-05, + "loss": 0.4628872275352478, + "step": 390, + "token_acc": 0.86190833959429 + }, + { + "epoch": 0.9927007299270073, + "grad_norm": 1.4674915872936216, + "learning_rate": 3.494013734516971e-05, + "loss": 0.4559894800186157, + "step": 391, + "token_acc": 0.8610082138830729 + }, + { + "epoch": 0.9952396064741352, + "grad_norm": 1.953348901842891, + "learning_rate": 3.4825625791348096e-05, + "loss": 0.4409753978252411, + "step": 392, + "token_acc": 0.862080370431619 + }, + { + "epoch": 0.997778483021263, + "grad_norm": 4.310074710886207, + "learning_rate": 3.471086990686737e-05, + "loss": 0.4559399485588074, + "step": 393, + "token_acc": 0.8591592988987126 + }, + { + "epoch": 1.0, + "grad_norm": 1.7219046332106547, + "learning_rate": 3.459587254532502e-05, + "loss": 0.48068922758102417, + "step": 394, + "token_acc": 0.8567295770767324 + }, + { + "epoch": 1.0, + "eval_loss": 0.38288021087646484, + "eval_runtime": 8.607, + "eval_samples_per_second": 1.394, + "eval_steps_per_second": 0.349, + "eval_token_acc": 0.8742701440249124, + "step": 394 + } + ], + "logging_steps": 1, + "max_steps": 788, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2082783438045184.0, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..16727af62765d5e4ce0975877aed57baf55e201e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:127702dae975ef36e1701c2735de30b8da42177c8aab9767eeec06a55c650d06 +size 9873 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-394/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/README.md b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/README.md new file mode 100644 index 0000000000000000000000000000000000000000..dffda63a4f167a4b37ef34b9b53e0dfb5e0333c9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/README.md @@ -0,0 +1,207 @@ +--- +base_model: /data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.19.1 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/adapter_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..8e2d26e1d4ba608d99e7617209e451476d87c4cf --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/adapter_config.json @@ -0,0 +1,40 @@ +{ + "alora_invocation_tokens": null, + "alpha_pattern": {}, + "arrow_config": null, + "auto_mapping": null, + "base_model_name_or_path": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "bias": "none", + "corda_config": null, + "ensure_weight_tying": false, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "lora_ga_config": null, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "peft_version": "0.19.1", + "qalora_group_size": 16, + "r": 16, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(model\\.language_model(?=\\.).*\\.(up_proj|o_proj|down_proj|q_proj|v_proj|gate_proj|k_proj)|(?!(model.visual.merger))model\\.visual(?=\\.).*\\.(qkv|up_proj|mlp.2|down_proj|mlp.0|attn.proj|gate_proj))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_bdlora": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/adapter_model.safetensors b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..0224293f55e9f1b2ca2b22c031f23f93e1a9e77b --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:dfcd28130097822de7163f52b0875e80ba705fe726b822e4ff77d63c502826cd +size 103145560 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/additional_config.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/args.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/args.json new file mode 100644 index 0000000000000000000000000000000000000000..5091f9392117c45807769eb71740ba331c08b424 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/args.json @@ -0,0 +1,403 @@ +{ + "output_dir": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "epoch", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 8, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 5e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 2.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.2, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 1, + "logging_nan_inf_filter": true, + "save_strategy": "epoch", + "save_steps": 500, + "save_total_limit": null, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": 0, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 2000.0, + "dataloader_num_workers": 48, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": [], + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": { + "fp16": { + "enabled": "auto", + "loss_scale": 0, + "loss_scale_window": 1000, + "initial_scale_power": 16, + "hysteresis": 2, + "min_loss_scale": 1 + }, + "bf16": { + "enabled": "auto" + }, + "zero_optimization": { + "stage": 3, + "offload_optimizer": { + "device": "none", + "pin_memory": true + }, + "offload_param": { + "device": "none", + "pin_memory": true + }, + "overlap_comm": false, + "contiguous_gradients": true, + "sub_group_size": 1000000000.0, + "reduce_bucket_size": "auto", + "zero_quantized_weights": false, + "zero_quantized_gradients": false, + "stage3_prefetch_bucket_size": "auto", + "stage3_param_persistence_threshold": "auto", + "stage3_max_live_parameters": 1000000000.0, + "stage3_max_reuse_distance": 1000000000.0, + "stage3_gather_16bit_weights_on_model_save": true + }, + "gradient_accumulation_steps": "auto", + "gradient_clipping": "auto", + "steps_per_print": 2000, + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "wall_clock_breakdown": false + }, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "tensorboard" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": true, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "safe_serialization": true, + "max_shard_size": "5GB", + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "eval_metric": null, + "callbacks": [], + "early_stop_interval": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "tuner_type": "lora", + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "model_type": "qwen2_5_vl", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "experts_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_vl", + "system": null, + "max_length": 16240, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "data.jsonl" + ], + "val_dataset": [], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.001, + "dataset_num_proc": 100, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "adapters": [], + "external_plugins": [], + "custom_register_path": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": false, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 16, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "swift_version": "4.1.3", + "ckpt_dir": null, + "rank": 0, + "global_world_size": 4, + "local_world_size": 4, + "model_suffix": "Qwen2.5-VL-7B-Instruct", + "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], template='qwen2_5_vl', ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], template='qwen2_5_vl', ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='XiaomiMiMo/MiMo-VL-7B-SFT', hf_model_id='XiaomiMiMo/MiMo-VL-7B-SFT', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='XiaomiMiMo/MiMo-VL-7B-RL', hf_model_id='XiaomiMiMo/MiMo-VL-7B-RL', model_path=None, ms_revision=None, hf_revision=None)], template='mimo_vl', ignore_patterns=None, requires=None, tags=[])], loader=, template='qwen2_5_vl', model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), mcore_model_type=None, architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=[])", + "model_dir": "/data/yutao/lzt/BrowserAgent_v2/models/Qwen2.5-VL-7B-Instruct", + "template_meta": "QwenTemplateMeta(template_type='qwen2_5_vl', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system='You are a helpful assistant.', auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='hermes', is_thinking=False, thinking_prefix='', non_thinking_prefix='', history_thinking_prefix='')", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "epoch", + "training_args": "Seq2SeqTrainingArguments(output_dir='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=8, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=5e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.2, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs', logging_strategy=, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=, save_steps=500, save_total_limit=None, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=2000.0, dataloader_num_workers=48, dataloader_prefetch_factor=2, past_index=-1, run_name='/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 3, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'offload_param': {'device': 'none', 'pin_memory': True}, 'overlap_comm': False, 'contiguous_gradients': True, 'sub_group_size': 1000000000.0, 'reduce_bucket_size': 'auto', 'zero_quantized_weights': False, 'zero_quantized_gradients': False, 'stage3_prefetch_bucket_size': 'auto', 'stage3_param_persistence_threshold': 'auto', 'stage3_max_live_parameters': 1000000000.0, 'stage3_max_reuse_distance': 1000000000.0, 'stage3_gather_16bit_weights_on_model_save': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, safe_serialization=True, max_shard_size='5GB', check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, eval_metric=None, callbacks=[], early_stop_interval=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, tuner_type='lora', use_galore=False, galore_target_modules=None, galore_rank=128, galore_update_proj_gap=50, galore_scale=1.0, galore_proj_type='std', galore_optim_per_parameter=False, galore_with_embedding=False, galore_quantization=False, galore_proj_quant=False, galore_proj_bits=4, galore_proj_group_size=256, galore_cos_threshold=0.4, galore_gamma_proj=2, galore_queue_size=5, lisa_activated_layers=0, lisa_step_interval=20, use_flash_ckpt=False)" +} \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..657eb024aae1a3df5f9c316c5bc29f88a9db4228 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c8acec1076365a7b99766f89c3a33df0119f303fcce39c2376ae687248780991 +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..fa270de8d6ffc0391f21bf48ac3cb737d8a73ed9 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2ec9e7d570948c6b5a1bd2d13f88b5d9e3786bead128ee45ae5ec7183255edd1 +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..136ad2c9c4f98b675dfcbf542f1380f925aa3451 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3b8d8d40a736e470d23022261733a5aa65ed256d7f19d67f4c6896895d7104ba +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..b5f49872ed7a5335c18c4a556db2c19e2625b436 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:31d79581ff29eec6a19fb84706938056987171ebcd37f626a2a2c757735fe5aa +size 154569157 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_0_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_0_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..89db765126dc05dcd287a8f5e0871336bd31f1c6 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_0_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7b781e914afe6c9319e94bff5acb2aebe2cfd0e6c6800f0c848594737f10bf11 +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_1_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_1_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..12cb574c1fd517fd941acd709ce238ebe0308422 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_1_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0946b7cb82f6053e42e0a427494eb666966bd43eab9d245f11dd90b732ba7acb +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_2_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_2_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..6e6b15d11231cd389289738a91d4076fe1bd5332 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_2_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:16b826c199505a59dddcc29e910e7d9b0c8cd86223c3bee451f5d4e90264e98a +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_3_mp_rank_00_model_states.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_3_mp_rank_00_model_states.pt new file mode 100644 index 0000000000000000000000000000000000000000..e6c92f543b1166f5c791ff01cfa32112459984ea --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/global_step788/zero_pp_rank_3_mp_rank_00_model_states.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce2e90621ddf30a1cb61bc8edeea4c823e74076e691f1f2dd0f4d995ad8c6fca +size 766241 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/latest b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/latest new file mode 100644 index 0000000000000000000000000000000000000000..55d68b7abbb5e3e5cf9b8aab610a5e929b47f9eb --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/latest @@ -0,0 +1 @@ +global_step788 \ No newline at end of file diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_0.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_0.pth new file mode 100644 index 0000000000000000000000000000000000000000..035a1c8fc1691a8d62e95fa313786950c4dbeedd --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_0.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:22d6790b00b5718921d1c1f3fd3cf361895b4d3db078805589fbef73a26d446a +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_1.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_1.pth new file mode 100644 index 0000000000000000000000000000000000000000..5091035d3da712f2a5beda9a51c17afaa3b90b06 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_1.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:98b9ab57254e7912ec73442baaca5373adde75dda800dd0388800a5ce6645908 +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_2.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_2.pth new file mode 100644 index 0000000000000000000000000000000000000000..323022e48e580ab22bef32ea50de79027a9b5a14 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_2.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:05777f4a94779fcb4f7d833dd95f50147032e0dd69503ada716e8999b69e3e21 +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_3.pth b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_3.pth new file mode 100644 index 0000000000000000000000000000000000000000..ebbade99c833d3447f61aac106b0030138190af2 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/rng_state_3.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d049d405eb58f9feec0c323caaf3809ab89c1cc9d844b91a5839c835a2af754d +size 15429 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/scheduler.pt b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..ab85b5981f664c029d88e93ff1bea90cd9cd89f0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:acc9808b873dd2b1009a6d63db076a42434e830983edcd704445fb5b060787f4 +size 1465 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/trainer_state.json b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..fb814d4d4806d83e477de2deb9c10ef1b84cfaf0 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/trainer_state.json @@ -0,0 +1,6365 @@ +{ + "best_global_step": 788, + "best_metric": 0.35869709, + "best_model_checkpoint": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788", + "epoch": 2.0, + "eval_steps": 2000.0, + "global_step": 788, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0025388765471278957, + "grad_norm": 3.644420246106802, + "learning_rate": 3.1645569620253163e-07, + "loss": 1.318245530128479, + "step": 1, + "token_acc": 0.7163964997848228 + }, + { + "epoch": 0.0050777530942557915, + "grad_norm": 7.066332979169105, + "learning_rate": 6.329113924050633e-07, + "loss": 1.3213859796524048, + "step": 2, + "token_acc": 0.7273305758829144 + }, + { + "epoch": 0.007616629641383688, + "grad_norm": 10.199557510236037, + "learning_rate": 9.493670886075951e-07, + "loss": 1.3628352880477905, + "step": 3, + "token_acc": 0.7068235294117647 + }, + { + "epoch": 0.010155506188511583, + "grad_norm": 2.8758103179283525, + "learning_rate": 1.2658227848101265e-06, + "loss": 1.365400791168213, + "step": 4, + "token_acc": 0.7117047560222359 + }, + { + "epoch": 0.012694382735639479, + "grad_norm": 3.297140385498391, + "learning_rate": 1.5822784810126583e-06, + "loss": 1.400863528251648, + "step": 5, + "token_acc": 0.698011137629276 + }, + { + "epoch": 0.015233259282767376, + "grad_norm": 5.493150648764733, + "learning_rate": 1.8987341772151901e-06, + "loss": 1.35938560962677, + "step": 6, + "token_acc": 0.7149187592319055 + }, + { + "epoch": 0.017772135829895272, + "grad_norm": 8.171500030817667, + "learning_rate": 2.2151898734177215e-06, + "loss": 1.3011455535888672, + "step": 7, + "token_acc": 0.7231049321416749 + }, + { + "epoch": 0.020311012377023166, + "grad_norm": 5.827210745414414, + "learning_rate": 2.531645569620253e-06, + "loss": 1.417736291885376, + "step": 8, + "token_acc": 0.714411093558013 + }, + { + "epoch": 0.022849888924151063, + "grad_norm": 6.1293874585644526, + "learning_rate": 2.848101265822785e-06, + "loss": 1.378328800201416, + "step": 9, + "token_acc": 0.7031924072476272 + }, + { + "epoch": 0.025388765471278957, + "grad_norm": 3.520366609215098, + "learning_rate": 3.1645569620253167e-06, + "loss": 1.343224287033081, + "step": 10, + "token_acc": 0.7227991691963572 + }, + { + "epoch": 0.027927642018406855, + "grad_norm": 3.6585128819526824, + "learning_rate": 3.4810126582278482e-06, + "loss": 1.390702724456787, + "step": 11, + "token_acc": 0.7076406649616368 + }, + { + "epoch": 0.030466518565534752, + "grad_norm": 6.217581279052289, + "learning_rate": 3.7974683544303802e-06, + "loss": 1.3524142503738403, + "step": 12, + "token_acc": 0.7028127313101407 + }, + { + "epoch": 0.03300539511266265, + "grad_norm": 3.388086422416274, + "learning_rate": 4.113924050632911e-06, + "loss": 1.3935208320617676, + "step": 13, + "token_acc": 0.7046906654199782 + }, + { + "epoch": 0.035544271659790544, + "grad_norm": 8.332931037303998, + "learning_rate": 4.430379746835443e-06, + "loss": 1.3878122568130493, + "step": 14, + "token_acc": 0.7046968687541639 + }, + { + "epoch": 0.03808314820691844, + "grad_norm": 17.896380479546966, + "learning_rate": 4.746835443037975e-06, + "loss": 1.2754666805267334, + "step": 15, + "token_acc": 0.7242310577644411 + }, + { + "epoch": 0.04062202475404633, + "grad_norm": 11.46365102116194, + "learning_rate": 5.063291139240506e-06, + "loss": 1.3468568325042725, + "step": 16, + "token_acc": 0.7084963229541543 + }, + { + "epoch": 0.04316090130117423, + "grad_norm": 4.2821219745746655, + "learning_rate": 5.379746835443038e-06, + "loss": 1.40608549118042, + "step": 17, + "token_acc": 0.6968503937007874 + }, + { + "epoch": 0.04569977784830213, + "grad_norm": 13.278823682877052, + "learning_rate": 5.69620253164557e-06, + "loss": 1.300422191619873, + "step": 18, + "token_acc": 0.7242131505141789 + }, + { + "epoch": 0.04823865439543002, + "grad_norm": 2.778568201618841, + "learning_rate": 6.012658227848101e-06, + "loss": 1.3542265892028809, + "step": 19, + "token_acc": 0.7110212691158376 + }, + { + "epoch": 0.050777530942557915, + "grad_norm": 10.575315873473542, + "learning_rate": 6.329113924050633e-06, + "loss": 1.3549412488937378, + "step": 20, + "token_acc": 0.7120073608342279 + }, + { + "epoch": 0.053316407489685816, + "grad_norm": 4.651761760848563, + "learning_rate": 6.6455696202531645e-06, + "loss": 1.3315010070800781, + "step": 21, + "token_acc": 0.7172937521574042 + }, + { + "epoch": 0.05585528403681371, + "grad_norm": 11.039499603303584, + "learning_rate": 6.9620253164556965e-06, + "loss": 1.3607463836669922, + "step": 22, + "token_acc": 0.7119058535839828 + }, + { + "epoch": 0.058394160583941604, + "grad_norm": 21.786442056735186, + "learning_rate": 7.2784810126582285e-06, + "loss": 1.3679276704788208, + "step": 23, + "token_acc": 0.7060693204177387 + }, + { + "epoch": 0.060933037131069505, + "grad_norm": 3.8926457068624027, + "learning_rate": 7.5949367088607605e-06, + "loss": 1.230813980102539, + "step": 24, + "token_acc": 0.7303050847457627 + }, + { + "epoch": 0.06347191367819739, + "grad_norm": 27.273056033594486, + "learning_rate": 7.911392405063292e-06, + "loss": 1.2661793231964111, + "step": 25, + "token_acc": 0.7191495088144261 + }, + { + "epoch": 0.0660107902253253, + "grad_norm": 17.170751148909975, + "learning_rate": 8.227848101265822e-06, + "loss": 1.3003311157226562, + "step": 26, + "token_acc": 0.7185164292765477 + }, + { + "epoch": 0.0685496667724532, + "grad_norm": 4.4377062155304925, + "learning_rate": 8.544303797468354e-06, + "loss": 1.3472293615341187, + "step": 27, + "token_acc": 0.7084078711985689 + }, + { + "epoch": 0.07108854331958109, + "grad_norm": 28.824459578387078, + "learning_rate": 8.860759493670886e-06, + "loss": 1.2210255861282349, + "step": 28, + "token_acc": 0.7316366961292289 + }, + { + "epoch": 0.07362741986670898, + "grad_norm": 6.453710147572056, + "learning_rate": 9.177215189873418e-06, + "loss": 1.3194985389709473, + "step": 29, + "token_acc": 0.7122530736289543 + }, + { + "epoch": 0.07616629641383688, + "grad_norm": 5.834087298103824, + "learning_rate": 9.49367088607595e-06, + "loss": 1.2912172079086304, + "step": 30, + "token_acc": 0.7186076772934288 + }, + { + "epoch": 0.07870517296096477, + "grad_norm": 2.871547428905148, + "learning_rate": 9.81012658227848e-06, + "loss": 1.315631628036499, + "step": 31, + "token_acc": 0.7080590902442592 + }, + { + "epoch": 0.08124404950809266, + "grad_norm": 3.6221352179116657, + "learning_rate": 1.0126582278481012e-05, + "loss": 1.2459921836853027, + "step": 32, + "token_acc": 0.7226173541963016 + }, + { + "epoch": 0.08378292605522057, + "grad_norm": 8.000389558921656, + "learning_rate": 1.0443037974683544e-05, + "loss": 1.271647334098816, + "step": 33, + "token_acc": 0.7218111867416396 + }, + { + "epoch": 0.08632180260234847, + "grad_norm": 4.361540191205865, + "learning_rate": 1.0759493670886076e-05, + "loss": 1.274230718612671, + "step": 34, + "token_acc": 0.7135694646611677 + }, + { + "epoch": 0.08886067914947636, + "grad_norm": 4.9147142745551164, + "learning_rate": 1.1075949367088608e-05, + "loss": 1.2685215473175049, + "step": 35, + "token_acc": 0.7207676044885347 + }, + { + "epoch": 0.09139955569660425, + "grad_norm": 3.195151105054266, + "learning_rate": 1.139240506329114e-05, + "loss": 1.299472451210022, + "step": 36, + "token_acc": 0.7125310717941219 + }, + { + "epoch": 0.09393843224373215, + "grad_norm": 2.6222925030737736, + "learning_rate": 1.170886075949367e-05, + "loss": 1.184287428855896, + "step": 37, + "token_acc": 0.7353410097431355 + }, + { + "epoch": 0.09647730879086004, + "grad_norm": 2.8207306382492585, + "learning_rate": 1.2025316455696203e-05, + "loss": 1.2705498933792114, + "step": 38, + "token_acc": 0.7183790421612771 + }, + { + "epoch": 0.09901618533798794, + "grad_norm": 4.451363242439522, + "learning_rate": 1.2341772151898735e-05, + "loss": 1.1410255432128906, + "step": 39, + "token_acc": 0.7343029443064917 + }, + { + "epoch": 0.10155506188511583, + "grad_norm": 5.113673628483296, + "learning_rate": 1.2658227848101267e-05, + "loss": 1.1782591342926025, + "step": 40, + "token_acc": 0.7327224724336077 + }, + { + "epoch": 0.10409393843224374, + "grad_norm": 3.5593986457435083, + "learning_rate": 1.2974683544303799e-05, + "loss": 1.1586289405822754, + "step": 41, + "token_acc": 0.7429899957728617 + }, + { + "epoch": 0.10663281497937163, + "grad_norm": 2.9195256626560684, + "learning_rate": 1.3291139240506329e-05, + "loss": 1.139272689819336, + "step": 42, + "token_acc": 0.7421777221526908 + }, + { + "epoch": 0.10917169152649953, + "grad_norm": 20.803104301053065, + "learning_rate": 1.3607594936708861e-05, + "loss": 1.1704292297363281, + "step": 43, + "token_acc": 0.7285796434732605 + }, + { + "epoch": 0.11171056807362742, + "grad_norm": 3.471589836187823, + "learning_rate": 1.3924050632911393e-05, + "loss": 1.1391760110855103, + "step": 44, + "token_acc": 0.7379228837346727 + }, + { + "epoch": 0.11424944462075531, + "grad_norm": 5.205417449479473, + "learning_rate": 1.4240506329113925e-05, + "loss": 1.1042394638061523, + "step": 45, + "token_acc": 0.7448979591836735 + }, + { + "epoch": 0.11678832116788321, + "grad_norm": 4.3574672102801015, + "learning_rate": 1.4556962025316457e-05, + "loss": 1.0657453536987305, + "step": 46, + "token_acc": 0.7489454347530277 + }, + { + "epoch": 0.1193271977150111, + "grad_norm": 23.053778423920146, + "learning_rate": 1.4873417721518987e-05, + "loss": 1.1951930522918701, + "step": 47, + "token_acc": 0.7246397287369314 + }, + { + "epoch": 0.12186607426213901, + "grad_norm": 3.803629904444073, + "learning_rate": 1.5189873417721521e-05, + "loss": 1.0914082527160645, + "step": 48, + "token_acc": 0.745520801700577 + }, + { + "epoch": 0.1244049508092669, + "grad_norm": 6.689336514482712, + "learning_rate": 1.550632911392405e-05, + "loss": 1.1104226112365723, + "step": 49, + "token_acc": 0.7371739753511035 + }, + { + "epoch": 0.12694382735639478, + "grad_norm": 13.295611456338577, + "learning_rate": 1.5822784810126583e-05, + "loss": 1.114711880683899, + "step": 50, + "token_acc": 0.734084314729476 + }, + { + "epoch": 0.12948270390352268, + "grad_norm": 3.6818930607365474, + "learning_rate": 1.6139240506329115e-05, + "loss": 1.0886123180389404, + "step": 51, + "token_acc": 0.7460102378801566 + }, + { + "epoch": 0.1320215804506506, + "grad_norm": 2.068572818027539, + "learning_rate": 1.6455696202531644e-05, + "loss": 0.9962466359138489, + "step": 52, + "token_acc": 0.7619711761971176 + }, + { + "epoch": 0.1345604569977785, + "grad_norm": 2.3029328438465955, + "learning_rate": 1.677215189873418e-05, + "loss": 1.048902153968811, + "step": 53, + "token_acc": 0.7497123130034522 + }, + { + "epoch": 0.1370993335449064, + "grad_norm": 5.7047860384924505, + "learning_rate": 1.7088607594936708e-05, + "loss": 1.0195245742797852, + "step": 54, + "token_acc": 0.7620052770448549 + }, + { + "epoch": 0.13963821009203428, + "grad_norm": 6.477061508345248, + "learning_rate": 1.7405063291139243e-05, + "loss": 1.081801176071167, + "step": 55, + "token_acc": 0.7465539422900203 + }, + { + "epoch": 0.14217708663916218, + "grad_norm": 6.2376824743665855, + "learning_rate": 1.7721518987341772e-05, + "loss": 1.0337473154067993, + "step": 56, + "token_acc": 0.7620926243567753 + }, + { + "epoch": 0.14471596318629007, + "grad_norm": 2.5584859222177037, + "learning_rate": 1.8037974683544304e-05, + "loss": 1.0235919952392578, + "step": 57, + "token_acc": 0.7479560191711305 + }, + { + "epoch": 0.14725483973341796, + "grad_norm": 1.6007308463984253, + "learning_rate": 1.8354430379746836e-05, + "loss": 1.026627540588379, + "step": 58, + "token_acc": 0.7545010680500458 + }, + { + "epoch": 0.14979371628054586, + "grad_norm": 3.5256130287772764, + "learning_rate": 1.8670886075949368e-05, + "loss": 1.0003381967544556, + "step": 59, + "token_acc": 0.7527782006393667 + }, + { + "epoch": 0.15233259282767375, + "grad_norm": 3.7023204963636838, + "learning_rate": 1.89873417721519e-05, + "loss": 0.9081876873970032, + "step": 60, + "token_acc": 0.7770368222673238 + }, + { + "epoch": 0.15487146937480165, + "grad_norm": 13.207752417441773, + "learning_rate": 1.9303797468354432e-05, + "loss": 1.0521725416183472, + "step": 61, + "token_acc": 0.7498269417139692 + }, + { + "epoch": 0.15741034592192954, + "grad_norm": 5.75860602043051, + "learning_rate": 1.962025316455696e-05, + "loss": 0.9959630966186523, + "step": 62, + "token_acc": 0.7539973595423207 + }, + { + "epoch": 0.15994922246905743, + "grad_norm": 2.1358911014473065, + "learning_rate": 1.9936708860759496e-05, + "loss": 0.9936040639877319, + "step": 63, + "token_acc": 0.7573317125056982 + }, + { + "epoch": 0.16248809901618533, + "grad_norm": 3.6065860167804553, + "learning_rate": 2.0253164556962025e-05, + "loss": 0.9302588701248169, + "step": 64, + "token_acc": 0.7660311958405546 + }, + { + "epoch": 0.16502697556331322, + "grad_norm": 3.4010076126873536, + "learning_rate": 2.056962025316456e-05, + "loss": 0.9686568975448608, + "step": 65, + "token_acc": 0.7588071919310042 + }, + { + "epoch": 0.16756585211044114, + "grad_norm": 8.25772123801425, + "learning_rate": 2.088607594936709e-05, + "loss": 0.9752371907234192, + "step": 66, + "token_acc": 0.7534704800133801 + }, + { + "epoch": 0.17010472865756904, + "grad_norm": 2.759694488314889, + "learning_rate": 2.120253164556962e-05, + "loss": 0.8781665563583374, + "step": 67, + "token_acc": 0.7766960284345542 + }, + { + "epoch": 0.17264360520469693, + "grad_norm": 6.065387925549159, + "learning_rate": 2.1518987341772153e-05, + "loss": 0.8539150953292847, + "step": 68, + "token_acc": 0.7778531456672885 + }, + { + "epoch": 0.17518248175182483, + "grad_norm": 6.273759879651115, + "learning_rate": 2.1835443037974685e-05, + "loss": 0.8206325173377991, + "step": 69, + "token_acc": 0.7851107226107226 + }, + { + "epoch": 0.17772135829895272, + "grad_norm": 6.797725562475832, + "learning_rate": 2.2151898734177217e-05, + "loss": 0.899059534072876, + "step": 70, + "token_acc": 0.7692409240924093 + }, + { + "epoch": 0.1802602348460806, + "grad_norm": 14.741247422293133, + "learning_rate": 2.246835443037975e-05, + "loss": 0.9375818371772766, + "step": 71, + "token_acc": 0.7635605006954103 + }, + { + "epoch": 0.1827991113932085, + "grad_norm": 2.91554003314857, + "learning_rate": 2.278481012658228e-05, + "loss": 0.8030121326446533, + "step": 72, + "token_acc": 0.7937145989402521 + }, + { + "epoch": 0.1853379879403364, + "grad_norm": 3.256147486736755, + "learning_rate": 2.3101265822784813e-05, + "loss": 0.9064524173736572, + "step": 73, + "token_acc": 0.7655107017068545 + }, + { + "epoch": 0.1878768644874643, + "grad_norm": 2.189919100543407, + "learning_rate": 2.341772151898734e-05, + "loss": 0.7569831609725952, + "step": 74, + "token_acc": 0.7891252955082743 + }, + { + "epoch": 0.1904157410345922, + "grad_norm": 3.0168260923297563, + "learning_rate": 2.3734177215189873e-05, + "loss": 0.8783301115036011, + "step": 75, + "token_acc": 0.7689860284963342 + }, + { + "epoch": 0.19295461758172008, + "grad_norm": 14.13725393363498, + "learning_rate": 2.4050632911392405e-05, + "loss": 0.8693279027938843, + "step": 76, + "token_acc": 0.7832378223495702 + }, + { + "epoch": 0.19549349412884798, + "grad_norm": 4.663170307038689, + "learning_rate": 2.4367088607594937e-05, + "loss": 0.9367852807044983, + "step": 77, + "token_acc": 0.7587620685094564 + }, + { + "epoch": 0.19803237067597587, + "grad_norm": 2.0251332116596314, + "learning_rate": 2.468354430379747e-05, + "loss": 0.9105110764503479, + "step": 78, + "token_acc": 0.7696913251729643 + }, + { + "epoch": 0.20057124722310377, + "grad_norm": 2.9353487138799976, + "learning_rate": 2.5e-05, + "loss": 0.812760055065155, + "step": 79, + "token_acc": 0.7861037544788908 + }, + { + "epoch": 0.20311012377023166, + "grad_norm": 6.81850589494243, + "learning_rate": 2.5316455696202533e-05, + "loss": 0.8404111266136169, + "step": 80, + "token_acc": 0.7826737386100912 + }, + { + "epoch": 0.20564900031735958, + "grad_norm": 5.8636033139277925, + "learning_rate": 2.5632911392405062e-05, + "loss": 0.7662273049354553, + "step": 81, + "token_acc": 0.7912533814247069 + }, + { + "epoch": 0.20818787686448748, + "grad_norm": 3.1667411014534554, + "learning_rate": 2.5949367088607597e-05, + "loss": 0.8550683259963989, + "step": 82, + "token_acc": 0.7763946519133241 + }, + { + "epoch": 0.21072675341161537, + "grad_norm": 2.9382867326927786, + "learning_rate": 2.626582278481013e-05, + "loss": 0.728255033493042, + "step": 83, + "token_acc": 0.7997798049701164 + }, + { + "epoch": 0.21326562995874326, + "grad_norm": 4.413930575957828, + "learning_rate": 2.6582278481012658e-05, + "loss": 0.7953159213066101, + "step": 84, + "token_acc": 0.7851035843472542 + }, + { + "epoch": 0.21580450650587116, + "grad_norm": 2.2548226528829085, + "learning_rate": 2.689873417721519e-05, + "loss": 0.8843717575073242, + "step": 85, + "token_acc": 0.7768637532133676 + }, + { + "epoch": 0.21834338305299905, + "grad_norm": 13.172644883413941, + "learning_rate": 2.7215189873417722e-05, + "loss": 0.8480836749076843, + "step": 86, + "token_acc": 0.7769437756691687 + }, + { + "epoch": 0.22088225960012695, + "grad_norm": 13.962359276231266, + "learning_rate": 2.7531645569620257e-05, + "loss": 0.7050020098686218, + "step": 87, + "token_acc": 0.8056864831990269 + }, + { + "epoch": 0.22342113614725484, + "grad_norm": 4.2019275549330555, + "learning_rate": 2.7848101265822786e-05, + "loss": 0.7555727958679199, + "step": 88, + "token_acc": 0.7975503308461214 + }, + { + "epoch": 0.22596001269438273, + "grad_norm": 5.0153336369322, + "learning_rate": 2.8164556962025318e-05, + "loss": 0.7249046564102173, + "step": 89, + "token_acc": 0.8017741935483871 + }, + { + "epoch": 0.22849888924151063, + "grad_norm": 11.63320257189594, + "learning_rate": 2.848101265822785e-05, + "loss": 0.688890814781189, + "step": 90, + "token_acc": 0.8080682699767261 + }, + { + "epoch": 0.23103776578863852, + "grad_norm": 5.457398735429565, + "learning_rate": 2.879746835443038e-05, + "loss": 0.7510577440261841, + "step": 91, + "token_acc": 0.7953611274221961 + }, + { + "epoch": 0.23357664233576642, + "grad_norm": 4.530006374919538, + "learning_rate": 2.9113924050632914e-05, + "loss": 0.7740436792373657, + "step": 92, + "token_acc": 0.7910108958837773 + }, + { + "epoch": 0.2361155188828943, + "grad_norm": 3.283408990769055, + "learning_rate": 2.9430379746835446e-05, + "loss": 0.6994897127151489, + "step": 93, + "token_acc": 0.8084580953850903 + }, + { + "epoch": 0.2386543954300222, + "grad_norm": 3.74567677581687, + "learning_rate": 2.9746835443037974e-05, + "loss": 0.6745874285697937, + "step": 94, + "token_acc": 0.8121098626716604 + }, + { + "epoch": 0.2411932719771501, + "grad_norm": 2.481160635241608, + "learning_rate": 3.0063291139240506e-05, + "loss": 0.7404159307479858, + "step": 95, + "token_acc": 0.8046498830650709 + }, + { + "epoch": 0.24373214852427802, + "grad_norm": 3.011989315773918, + "learning_rate": 3.0379746835443042e-05, + "loss": 0.6883790493011475, + "step": 96, + "token_acc": 0.8137285986049461 + }, + { + "epoch": 0.2462710250714059, + "grad_norm": 3.977588680498373, + "learning_rate": 3.0696202531645574e-05, + "loss": 0.7354066371917725, + "step": 97, + "token_acc": 0.8012324221835994 + }, + { + "epoch": 0.2488099016185338, + "grad_norm": 2.4417231744019787, + "learning_rate": 3.10126582278481e-05, + "loss": 0.7102183103561401, + "step": 98, + "token_acc": 0.801501463290495 + }, + { + "epoch": 0.2513487781656617, + "grad_norm": 5.211297364565694, + "learning_rate": 3.132911392405064e-05, + "loss": 0.7254366278648376, + "step": 99, + "token_acc": 0.8042974184572577 + }, + { + "epoch": 0.25388765471278957, + "grad_norm": 4.740070832115608, + "learning_rate": 3.1645569620253167e-05, + "loss": 0.71342533826828, + "step": 100, + "token_acc": 0.8091580057237536 + }, + { + "epoch": 0.2564265312599175, + "grad_norm": 5.296776098340419, + "learning_rate": 3.1962025316455695e-05, + "loss": 0.7370377779006958, + "step": 101, + "token_acc": 0.8084075636818253 + }, + { + "epoch": 0.25896540780704536, + "grad_norm": 4.396582033002235, + "learning_rate": 3.227848101265823e-05, + "loss": 0.671318531036377, + "step": 102, + "token_acc": 0.8183896782622897 + }, + { + "epoch": 0.2615042843541733, + "grad_norm": 2.6335454183216696, + "learning_rate": 3.2594936708860766e-05, + "loss": 0.6583906412124634, + "step": 103, + "token_acc": 0.8211532014750251 + }, + { + "epoch": 0.2640431609013012, + "grad_norm": 6.236411278449773, + "learning_rate": 3.291139240506329e-05, + "loss": 0.7536572217941284, + "step": 104, + "token_acc": 0.7975090397750101 + }, + { + "epoch": 0.26658203744842907, + "grad_norm": 2.5341922649732602, + "learning_rate": 3.322784810126582e-05, + "loss": 0.6701930165290833, + "step": 105, + "token_acc": 0.8116928446771379 + }, + { + "epoch": 0.269120913995557, + "grad_norm": 11.881079085435806, + "learning_rate": 3.354430379746836e-05, + "loss": 0.5909067392349243, + "step": 106, + "token_acc": 0.8345961631468645 + }, + { + "epoch": 0.27165979054268485, + "grad_norm": 2.384697440414924, + "learning_rate": 3.386075949367089e-05, + "loss": 0.6282612085342407, + "step": 107, + "token_acc": 0.823628821631587 + }, + { + "epoch": 0.2741986670898128, + "grad_norm": 2.1995079597886673, + "learning_rate": 3.4177215189873416e-05, + "loss": 0.6936606764793396, + "step": 108, + "token_acc": 0.8020663404023926 + }, + { + "epoch": 0.27673754363694064, + "grad_norm": 4.861432353099602, + "learning_rate": 3.449367088607595e-05, + "loss": 0.778184175491333, + "step": 109, + "token_acc": 0.78875 + }, + { + "epoch": 0.27927642018406856, + "grad_norm": 9.57103993272581, + "learning_rate": 3.4810126582278487e-05, + "loss": 0.6751368641853333, + "step": 110, + "token_acc": 0.8148423557406306 + }, + { + "epoch": 0.28181529673119643, + "grad_norm": 13.549564951896668, + "learning_rate": 3.5126582278481015e-05, + "loss": 0.7030066251754761, + "step": 111, + "token_acc": 0.805439330543933 + }, + { + "epoch": 0.28435417327832435, + "grad_norm": 5.1073725117939475, + "learning_rate": 3.5443037974683544e-05, + "loss": 0.6886919736862183, + "step": 112, + "token_acc": 0.8083333333333333 + }, + { + "epoch": 0.2868930498254522, + "grad_norm": 22.063583297317187, + "learning_rate": 3.575949367088608e-05, + "loss": 0.6610169410705566, + "step": 113, + "token_acc": 0.8150403409955853 + }, + { + "epoch": 0.28943192637258014, + "grad_norm": 18.72026765015026, + "learning_rate": 3.607594936708861e-05, + "loss": 0.6841698884963989, + "step": 114, + "token_acc": 0.8123032904148784 + }, + { + "epoch": 0.291970802919708, + "grad_norm": 2.864881799429328, + "learning_rate": 3.639240506329114e-05, + "loss": 0.6466969847679138, + "step": 115, + "token_acc": 0.8172187406744256 + }, + { + "epoch": 0.2945096794668359, + "grad_norm": 6.716337706090099, + "learning_rate": 3.670886075949367e-05, + "loss": 0.6078028678894043, + "step": 116, + "token_acc": 0.8346497252747253 + }, + { + "epoch": 0.2970485560139638, + "grad_norm": 5.564745491758841, + "learning_rate": 3.70253164556962e-05, + "loss": 0.664849042892456, + "step": 117, + "token_acc": 0.8190188679245283 + }, + { + "epoch": 0.2995874325610917, + "grad_norm": 28.630717891823956, + "learning_rate": 3.7341772151898736e-05, + "loss": 0.6384534239768982, + "step": 118, + "token_acc": 0.8220830070477682 + }, + { + "epoch": 0.30212630910821964, + "grad_norm": 12.273392356907912, + "learning_rate": 3.765822784810127e-05, + "loss": 0.6201878190040588, + "step": 119, + "token_acc": 0.8250733897427042 + }, + { + "epoch": 0.3046651856553475, + "grad_norm": 4.192852448588315, + "learning_rate": 3.79746835443038e-05, + "loss": 0.6979496479034424, + "step": 120, + "token_acc": 0.8104520945665699 + }, + { + "epoch": 0.3072040622024754, + "grad_norm": 3.4657196050906567, + "learning_rate": 3.829113924050633e-05, + "loss": 0.6550031304359436, + "step": 121, + "token_acc": 0.8187575798409917 + }, + { + "epoch": 0.3097429387496033, + "grad_norm": 27.787374024365484, + "learning_rate": 3.8607594936708864e-05, + "loss": 0.6515278220176697, + "step": 122, + "token_acc": 0.8171852329517976 + }, + { + "epoch": 0.3122818152967312, + "grad_norm": 4.0417548472450715, + "learning_rate": 3.89240506329114e-05, + "loss": 0.605487585067749, + "step": 123, + "token_acc": 0.8265876933201711 + }, + { + "epoch": 0.3148206918438591, + "grad_norm": 3.8292748886400765, + "learning_rate": 3.924050632911392e-05, + "loss": 0.6631138324737549, + "step": 124, + "token_acc": 0.8129932356257046 + }, + { + "epoch": 0.317359568390987, + "grad_norm": 8.960479693493973, + "learning_rate": 3.9556962025316456e-05, + "loss": 0.6087026596069336, + "step": 125, + "token_acc": 0.8281978055012776 + }, + { + "epoch": 0.31989844493811487, + "grad_norm": 4.011722457924042, + "learning_rate": 3.987341772151899e-05, + "loss": 0.7122887372970581, + "step": 126, + "token_acc": 0.8093482748451785 + }, + { + "epoch": 0.3224373214852428, + "grad_norm": 31.39830164995725, + "learning_rate": 4.018987341772152e-05, + "loss": 0.6663644313812256, + "step": 127, + "token_acc": 0.8180548501777553 + }, + { + "epoch": 0.32497619803237066, + "grad_norm": 4.425596331791689, + "learning_rate": 4.050632911392405e-05, + "loss": 0.6300691366195679, + "step": 128, + "token_acc": 0.8203907404367099 + }, + { + "epoch": 0.3275150745794986, + "grad_norm": 16.1083849209539, + "learning_rate": 4.0822784810126584e-05, + "loss": 0.6704287528991699, + "step": 129, + "token_acc": 0.8078627591136526 + }, + { + "epoch": 0.33005395112662644, + "grad_norm": 2.2389483956009752, + "learning_rate": 4.113924050632912e-05, + "loss": 0.7170148491859436, + "step": 130, + "token_acc": 0.8084219603334292 + }, + { + "epoch": 0.33259282767375437, + "grad_norm": 3.613513118589346, + "learning_rate": 4.145569620253165e-05, + "loss": 0.6717650890350342, + "step": 131, + "token_acc": 0.8138652912621359 + }, + { + "epoch": 0.3351317042208823, + "grad_norm": 5.5827028571809105, + "learning_rate": 4.177215189873418e-05, + "loss": 0.6085385084152222, + "step": 132, + "token_acc": 0.8274016203703703 + }, + { + "epoch": 0.33767058076801015, + "grad_norm": 5.37295628319291, + "learning_rate": 4.208860759493671e-05, + "loss": 0.6445047855377197, + "step": 133, + "token_acc": 0.8134654130288784 + }, + { + "epoch": 0.3402094573151381, + "grad_norm": 2.1788757767041003, + "learning_rate": 4.240506329113924e-05, + "loss": 0.5425457954406738, + "step": 134, + "token_acc": 0.837465564738292 + }, + { + "epoch": 0.34274833386226594, + "grad_norm": 4.649401574423171, + "learning_rate": 4.2721518987341776e-05, + "loss": 0.5962692499160767, + "step": 135, + "token_acc": 0.8225226767071709 + }, + { + "epoch": 0.34528721040939386, + "grad_norm": 3.1742303151683506, + "learning_rate": 4.3037974683544305e-05, + "loss": 0.6038417816162109, + "step": 136, + "token_acc": 0.8316648698598491 + }, + { + "epoch": 0.34782608695652173, + "grad_norm": 5.696983011175984, + "learning_rate": 4.3354430379746834e-05, + "loss": 0.6016777753829956, + "step": 137, + "token_acc": 0.8321018707750354 + }, + { + "epoch": 0.35036496350364965, + "grad_norm": 5.797388182589766, + "learning_rate": 4.367088607594937e-05, + "loss": 0.6565921306610107, + "step": 138, + "token_acc": 0.8184429761562769 + }, + { + "epoch": 0.3529038400507775, + "grad_norm": 6.854274250412749, + "learning_rate": 4.3987341772151904e-05, + "loss": 0.691247820854187, + "step": 139, + "token_acc": 0.8143437786810017 + }, + { + "epoch": 0.35544271659790544, + "grad_norm": 2.6184869642829267, + "learning_rate": 4.430379746835443e-05, + "loss": 0.6285054683685303, + "step": 140, + "token_acc": 0.8222631355332106 + }, + { + "epoch": 0.3579815931450333, + "grad_norm": 4.653346904540878, + "learning_rate": 4.462025316455696e-05, + "loss": 0.5671603679656982, + "step": 141, + "token_acc": 0.8380648412565094 + }, + { + "epoch": 0.3605204696921612, + "grad_norm": 4.522681266549905, + "learning_rate": 4.49367088607595e-05, + "loss": 0.6068707704544067, + "step": 142, + "token_acc": 0.8331301432490095 + }, + { + "epoch": 0.3630593462392891, + "grad_norm": 3.181075099904124, + "learning_rate": 4.525316455696203e-05, + "loss": 0.5732223987579346, + "step": 143, + "token_acc": 0.836748182419035 + }, + { + "epoch": 0.365598222786417, + "grad_norm": 5.248411142229925, + "learning_rate": 4.556962025316456e-05, + "loss": 0.7090050578117371, + "step": 144, + "token_acc": 0.8088770652478298 + }, + { + "epoch": 0.3681370993335449, + "grad_norm": 2.2841820115958877, + "learning_rate": 4.588607594936709e-05, + "loss": 0.6395794153213501, + "step": 145, + "token_acc": 0.8251766217084137 + }, + { + "epoch": 0.3706759758806728, + "grad_norm": 3.192951403479268, + "learning_rate": 4.6202531645569625e-05, + "loss": 0.5619275569915771, + "step": 146, + "token_acc": 0.8353532367720957 + }, + { + "epoch": 0.3732148524278007, + "grad_norm": 6.184982774052421, + "learning_rate": 4.6518987341772154e-05, + "loss": 0.6076276302337646, + "step": 147, + "token_acc": 0.8321759259259259 + }, + { + "epoch": 0.3757537289749286, + "grad_norm": 3.9260670039543686, + "learning_rate": 4.683544303797468e-05, + "loss": 0.5210973024368286, + "step": 148, + "token_acc": 0.8457633053221288 + }, + { + "epoch": 0.3782926055220565, + "grad_norm": 3.6953261186445467, + "learning_rate": 4.715189873417722e-05, + "loss": 0.4648306369781494, + "step": 149, + "token_acc": 0.8572195383789587 + }, + { + "epoch": 0.3808314820691844, + "grad_norm": 4.9921203101786045, + "learning_rate": 4.7468354430379746e-05, + "loss": 0.676045835018158, + "step": 150, + "token_acc": 0.8171926006528836 + }, + { + "epoch": 0.3833703586163123, + "grad_norm": 20.42938551967448, + "learning_rate": 4.778481012658228e-05, + "loss": 0.619693398475647, + "step": 151, + "token_acc": 0.8338338338338338 + }, + { + "epoch": 0.38590923516344017, + "grad_norm": 8.755403481608779, + "learning_rate": 4.810126582278481e-05, + "loss": 0.5743368864059448, + "step": 152, + "token_acc": 0.8412815319462346 + }, + { + "epoch": 0.3884481117105681, + "grad_norm": 3.2072760680708425, + "learning_rate": 4.8417721518987346e-05, + "loss": 0.6492601633071899, + "step": 153, + "token_acc": 0.8137201735357917 + }, + { + "epoch": 0.39098698825769596, + "grad_norm": 3.8316550813580914, + "learning_rate": 4.8734177215189874e-05, + "loss": 0.6361663341522217, + "step": 154, + "token_acc": 0.8231698225734307 + }, + { + "epoch": 0.3935258648048239, + "grad_norm": 3.972772394188529, + "learning_rate": 4.905063291139241e-05, + "loss": 0.6939312815666199, + "step": 155, + "token_acc": 0.8113469274517964 + }, + { + "epoch": 0.39606474135195174, + "grad_norm": 16.657647846984553, + "learning_rate": 4.936708860759494e-05, + "loss": 0.6008589863777161, + "step": 156, + "token_acc": 0.8316379183252248 + }, + { + "epoch": 0.39860361789907967, + "grad_norm": 2.814742590512491, + "learning_rate": 4.968354430379747e-05, + "loss": 0.5716952085494995, + "step": 157, + "token_acc": 0.8305734227453128 + }, + { + "epoch": 0.40114249444620753, + "grad_norm": 3.3183075108254605, + "learning_rate": 5e-05, + "loss": 0.5892596244812012, + "step": 158, + "token_acc": 0.823594674556213 + }, + { + "epoch": 0.40368137099333545, + "grad_norm": 3.805622229512587, + "learning_rate": 4.9999689166542295e-05, + "loss": 0.5727576017379761, + "step": 159, + "token_acc": 0.832796486090776 + }, + { + "epoch": 0.4062202475404633, + "grad_norm": 2.9959092236114975, + "learning_rate": 4.999875667389858e-05, + "loss": 0.5001785159111023, + "step": 160, + "token_acc": 0.8474907244678773 + }, + { + "epoch": 0.40875912408759124, + "grad_norm": 2.926865350121703, + "learning_rate": 4.999720254525684e-05, + "loss": 0.6166025400161743, + "step": 161, + "token_acc": 0.820961340585036 + }, + { + "epoch": 0.41129800063471916, + "grad_norm": 2.2665405249006403, + "learning_rate": 4.999502681926309e-05, + "loss": 0.5835655927658081, + "step": 162, + "token_acc": 0.8314150304671631 + }, + { + "epoch": 0.41383687718184703, + "grad_norm": 6.077225672698818, + "learning_rate": 4.999222955002041e-05, + "loss": 0.6306543350219727, + "step": 163, + "token_acc": 0.8202965582913889 + }, + { + "epoch": 0.41637575372897495, + "grad_norm": 9.205523914845546, + "learning_rate": 4.9988810807087584e-05, + "loss": 0.6070675253868103, + "step": 164, + "token_acc": 0.8314500941619586 + }, + { + "epoch": 0.4189146302761028, + "grad_norm": 2.520164837218412, + "learning_rate": 4.99847706754774e-05, + "loss": 0.5549716949462891, + "step": 165, + "token_acc": 0.8379689521345407 + }, + { + "epoch": 0.42145350682323074, + "grad_norm": 2.3723529006989215, + "learning_rate": 4.998010925565448e-05, + "loss": 0.5140861868858337, + "step": 166, + "token_acc": 0.8497000856898029 + }, + { + "epoch": 0.4239923833703586, + "grad_norm": 3.168399232927889, + "learning_rate": 4.997482666353287e-05, + "loss": 0.5713208913803101, + "step": 167, + "token_acc": 0.8342638379326847 + }, + { + "epoch": 0.4265312599174865, + "grad_norm": 3.1544527876057353, + "learning_rate": 4.996892303047306e-05, + "loss": 0.5652569532394409, + "step": 168, + "token_acc": 0.8433680398370303 + }, + { + "epoch": 0.4290701364646144, + "grad_norm": 4.050502290302643, + "learning_rate": 4.99623985032788e-05, + "loss": 0.6010338068008423, + "step": 169, + "token_acc": 0.8299908842297175 + }, + { + "epoch": 0.4316090130117423, + "grad_norm": 2.3208744483079924, + "learning_rate": 4.9955253244193375e-05, + "loss": 0.625551700592041, + "step": 170, + "token_acc": 0.8214095744680852 + }, + { + "epoch": 0.4341478895588702, + "grad_norm": 3.5752910543983734, + "learning_rate": 4.994748743089566e-05, + "loss": 0.5763528347015381, + "step": 171, + "token_acc": 0.8370288248337029 + }, + { + "epoch": 0.4366867661059981, + "grad_norm": 5.186367702439989, + "learning_rate": 4.993910125649561e-05, + "loss": 0.583060085773468, + "step": 172, + "token_acc": 0.8326601269474899 + }, + { + "epoch": 0.43922564265312597, + "grad_norm": 2.314721989016231, + "learning_rate": 4.9930094929529506e-05, + "loss": 0.6205261945724487, + "step": 173, + "token_acc": 0.8203899721448468 + }, + { + "epoch": 0.4417645192002539, + "grad_norm": 3.3583225237625016, + "learning_rate": 4.992046867395478e-05, + "loss": 0.5230633020401001, + "step": 174, + "token_acc": 0.8419920582395765 + }, + { + "epoch": 0.44430339574738176, + "grad_norm": 4.042306283685085, + "learning_rate": 4.99102227291444e-05, + "loss": 0.5143859386444092, + "step": 175, + "token_acc": 0.8474544778892605 + }, + { + "epoch": 0.4468422722945097, + "grad_norm": 2.6321524863816603, + "learning_rate": 4.989935734988098e-05, + "loss": 0.6144051551818848, + "step": 176, + "token_acc": 0.8175049636002647 + }, + { + "epoch": 0.4493811488416376, + "grad_norm": 2.361660215036252, + "learning_rate": 4.988787280635038e-05, + "loss": 0.49258965253829956, + "step": 177, + "token_acc": 0.8459661430532256 + }, + { + "epoch": 0.45192002538876547, + "grad_norm": 2.0369998726790266, + "learning_rate": 4.987576938413504e-05, + "loss": 0.5039229393005371, + "step": 178, + "token_acc": 0.8487822609960014 + }, + { + "epoch": 0.4544589019358934, + "grad_norm": 6.93229029448243, + "learning_rate": 4.9863047384206835e-05, + "loss": 0.5814566612243652, + "step": 179, + "token_acc": 0.8274802458296752 + }, + { + "epoch": 0.45699777848302126, + "grad_norm": 1.9442137330470775, + "learning_rate": 4.984970712291963e-05, + "loss": 0.5427694916725159, + "step": 180, + "token_acc": 0.8449736295349208 + }, + { + "epoch": 0.4595366550301492, + "grad_norm": 3.8278365677194706, + "learning_rate": 4.983574893200139e-05, + "loss": 0.5021108388900757, + "step": 181, + "token_acc": 0.8494821249582358 + }, + { + "epoch": 0.46207553157727704, + "grad_norm": 3.898165087457517, + "learning_rate": 4.9821173158545936e-05, + "loss": 0.529310941696167, + "step": 182, + "token_acc": 0.8456512269493248 + }, + { + "epoch": 0.46461440812440497, + "grad_norm": 5.784138022488126, + "learning_rate": 4.9805980165004304e-05, + "loss": 0.5193842053413391, + "step": 183, + "token_acc": 0.8486529318541997 + }, + { + "epoch": 0.46715328467153283, + "grad_norm": 2.7860896602561755, + "learning_rate": 4.9790170329175754e-05, + "loss": 0.5510420799255371, + "step": 184, + "token_acc": 0.8427399903521466 + }, + { + "epoch": 0.46969216121866075, + "grad_norm": 2.391478502605225, + "learning_rate": 4.977374404419837e-05, + "loss": 0.565636396408081, + "step": 185, + "token_acc": 0.8384972889233152 + }, + { + "epoch": 0.4722310377657886, + "grad_norm": 2.7381469955000233, + "learning_rate": 4.975670171853926e-05, + "loss": 0.5837178230285645, + "step": 186, + "token_acc": 0.8304386223138063 + }, + { + "epoch": 0.47476991431291654, + "grad_norm": 4.436221537482703, + "learning_rate": 4.973904377598443e-05, + "loss": 0.5879358649253845, + "step": 187, + "token_acc": 0.8254743303571429 + }, + { + "epoch": 0.4773087908600444, + "grad_norm": 3.161812435220317, + "learning_rate": 4.972077065562821e-05, + "loss": 0.5809712409973145, + "step": 188, + "token_acc": 0.8361007729745205 + }, + { + "epoch": 0.47984766740717233, + "grad_norm": 1.5520306180347663, + "learning_rate": 4.970188281186241e-05, + "loss": 0.5579955577850342, + "step": 189, + "token_acc": 0.837281009110021 + }, + { + "epoch": 0.4823865439543002, + "grad_norm": 3.727248476475511, + "learning_rate": 4.9682380714364897e-05, + "loss": 0.58579421043396, + "step": 190, + "token_acc": 0.8350501304765829 + }, + { + "epoch": 0.4849254205014281, + "grad_norm": 3.0795046455062614, + "learning_rate": 4.9662264848088034e-05, + "loss": 0.4905577301979065, + "step": 191, + "token_acc": 0.8543485289363077 + }, + { + "epoch": 0.48746429704855604, + "grad_norm": 2.222320433523395, + "learning_rate": 4.964153571324658e-05, + "loss": 0.6000843048095703, + "step": 192, + "token_acc": 0.8202116862403944 + }, + { + "epoch": 0.4900031735956839, + "grad_norm": 3.054493416036562, + "learning_rate": 4.962019382530521e-05, + "loss": 0.553142786026001, + "step": 193, + "token_acc": 0.8378803028138837 + }, + { + "epoch": 0.4925420501428118, + "grad_norm": 1.48942863662551, + "learning_rate": 4.959823971496574e-05, + "loss": 0.49760788679122925, + "step": 194, + "token_acc": 0.848271341962969 + }, + { + "epoch": 0.4950809266899397, + "grad_norm": 1.4337417758608024, + "learning_rate": 4.9575673928153957e-05, + "loss": 0.5126315355300903, + "step": 195, + "token_acc": 0.846869578930768 + }, + { + "epoch": 0.4976198032370676, + "grad_norm": 1.8216377101814463, + "learning_rate": 4.9552497026005974e-05, + "loss": 0.5140909552574158, + "step": 196, + "token_acc": 0.8483076923076923 + }, + { + "epoch": 0.5001586797841955, + "grad_norm": 3.6989217579732125, + "learning_rate": 4.952870958485432e-05, + "loss": 0.5483355522155762, + "step": 197, + "token_acc": 0.8436149991359945 + }, + { + "epoch": 0.5026975563313234, + "grad_norm": 1.4793601703477388, + "learning_rate": 4.9504312196213596e-05, + "loss": 0.5258674621582031, + "step": 198, + "token_acc": 0.844776119402985 + }, + { + "epoch": 0.5052364328784513, + "grad_norm": 3.320358649604752, + "learning_rate": 4.947930546676579e-05, + "loss": 0.5483481287956238, + "step": 199, + "token_acc": 0.8407105847520355 + }, + { + "epoch": 0.5077753094255791, + "grad_norm": 1.4836965410501335, + "learning_rate": 4.9453690018345144e-05, + "loss": 0.5698910355567932, + "step": 200, + "token_acc": 0.8355416991426344 + }, + { + "epoch": 0.5103141859727071, + "grad_norm": 1.9840806554207313, + "learning_rate": 4.942746648792274e-05, + "loss": 0.6226257681846619, + "step": 201, + "token_acc": 0.821941594317285 + }, + { + "epoch": 0.512853062519835, + "grad_norm": 3.4200124483670358, + "learning_rate": 4.940063552759061e-05, + "loss": 0.5485865473747253, + "step": 202, + "token_acc": 0.8423786494716102 + }, + { + "epoch": 0.5153919390669629, + "grad_norm": 1.4137645693467988, + "learning_rate": 4.937319780454559e-05, + "loss": 0.4833056330680847, + "step": 203, + "token_acc": 0.8569816188326347 + }, + { + "epoch": 0.5179308156140907, + "grad_norm": 2.216132222614037, + "learning_rate": 4.934515400107266e-05, + "loss": 0.4503518342971802, + "step": 204, + "token_acc": 0.8646072954321393 + }, + { + "epoch": 0.5204696921612186, + "grad_norm": 4.426951079644797, + "learning_rate": 4.931650481452801e-05, + "loss": 0.5067535638809204, + "step": 205, + "token_acc": 0.8500777604976671 + }, + { + "epoch": 0.5230085687083466, + "grad_norm": 7.154300916510774, + "learning_rate": 4.928725095732169e-05, + "loss": 0.5493313670158386, + "step": 206, + "token_acc": 0.8378132118451025 + }, + { + "epoch": 0.5255474452554745, + "grad_norm": 1.965712161044352, + "learning_rate": 4.925739315689991e-05, + "loss": 0.4918142557144165, + "step": 207, + "token_acc": 0.8530601240226476 + }, + { + "epoch": 0.5280863218026024, + "grad_norm": 1.5124863710410141, + "learning_rate": 4.922693215572695e-05, + "loss": 0.5023689270019531, + "step": 208, + "token_acc": 0.8512195121951219 + }, + { + "epoch": 0.5306251983497302, + "grad_norm": 2.3375825804294723, + "learning_rate": 4.919586871126667e-05, + "loss": 0.5670746564865112, + "step": 209, + "token_acc": 0.8375552282768778 + }, + { + "epoch": 0.5331640748968581, + "grad_norm": 1.8418248968647637, + "learning_rate": 4.916420359596368e-05, + "loss": 0.5001412630081177, + "step": 210, + "token_acc": 0.8473023413640991 + }, + { + "epoch": 0.535702951443986, + "grad_norm": 2.4235777237942924, + "learning_rate": 4.9131937597224185e-05, + "loss": 0.5839577913284302, + "step": 211, + "token_acc": 0.8330151270377442 + }, + { + "epoch": 0.538241827991114, + "grad_norm": 15.841289330503669, + "learning_rate": 4.909907151739633e-05, + "loss": 0.5890910625457764, + "step": 212, + "token_acc": 0.8299887822510283 + }, + { + "epoch": 0.5407807045382418, + "grad_norm": 2.1298845605680197, + "learning_rate": 4.90656061737503e-05, + "loss": 0.5155512094497681, + "step": 213, + "token_acc": 0.8465608465608465 + }, + { + "epoch": 0.5433195810853697, + "grad_norm": 2.1579493985693454, + "learning_rate": 4.9031542398457974e-05, + "loss": 0.5869525671005249, + "step": 214, + "token_acc": 0.8264487369985141 + }, + { + "epoch": 0.5458584576324976, + "grad_norm": 3.015091026973871, + "learning_rate": 4.899688103857223e-05, + "loss": 0.5348740816116333, + "step": 215, + "token_acc": 0.8366959820658735 + }, + { + "epoch": 0.5483973341796256, + "grad_norm": 1.4983193386255376, + "learning_rate": 4.896162295600589e-05, + "loss": 0.5215170383453369, + "step": 216, + "token_acc": 0.8455044322498945 + }, + { + "epoch": 0.5509362107267534, + "grad_norm": 7.6369461867236215, + "learning_rate": 4.892576902751031e-05, + "loss": 0.6286407709121704, + "step": 217, + "token_acc": 0.8244441744623983 + }, + { + "epoch": 0.5534750872738813, + "grad_norm": 1.909191100547535, + "learning_rate": 4.888932014465352e-05, + "loss": 0.5405088663101196, + "step": 218, + "token_acc": 0.8398148148148148 + }, + { + "epoch": 0.5560139638210092, + "grad_norm": 2.1249944661063713, + "learning_rate": 4.8852277213798106e-05, + "loss": 0.5207107067108154, + "step": 219, + "token_acc": 0.8505783057205377 + }, + { + "epoch": 0.5585528403681371, + "grad_norm": 4.590133511444357, + "learning_rate": 4.881464115607865e-05, + "loss": 0.5813536643981934, + "step": 220, + "token_acc": 0.831871745683749 + }, + { + "epoch": 0.561091716915265, + "grad_norm": 1.641052016603602, + "learning_rate": 4.877641290737884e-05, + "loss": 0.5410237312316895, + "step": 221, + "token_acc": 0.8366046831955923 + }, + { + "epoch": 0.5636305934623929, + "grad_norm": 2.277495246079136, + "learning_rate": 4.8737593418308156e-05, + "loss": 0.5533527135848999, + "step": 222, + "token_acc": 0.8363823756763721 + }, + { + "epoch": 0.5661694700095208, + "grad_norm": 4.159566523283519, + "learning_rate": 4.86981836541783e-05, + "loss": 0.559136152267456, + "step": 223, + "token_acc": 0.8388266834884087 + }, + { + "epoch": 0.5687083465566487, + "grad_norm": 225.83355044511626, + "learning_rate": 4.865818459497911e-05, + "loss": 0.4840168356895447, + "step": 224, + "token_acc": 0.8560429982568274 + }, + { + "epoch": 0.5712472231037766, + "grad_norm": 1.7941761886315637, + "learning_rate": 4.861759723535426e-05, + "loss": 0.5671250224113464, + "step": 225, + "token_acc": 0.8405020448455789 + }, + { + "epoch": 0.5737860996509044, + "grad_norm": 1.6927695579956952, + "learning_rate": 4.8576422584576514e-05, + "loss": 0.5532321929931641, + "step": 226, + "token_acc": 0.8365077158348394 + }, + { + "epoch": 0.5763249761980324, + "grad_norm": 1.3677369838188163, + "learning_rate": 4.8534661666522584e-05, + "loss": 0.5039372444152832, + "step": 227, + "token_acc": 0.8533067362283259 + }, + { + "epoch": 0.5788638527451603, + "grad_norm": 3.1985990377060944, + "learning_rate": 4.849231551964771e-05, + "loss": 0.4986110031604767, + "step": 228, + "token_acc": 0.8453477868112015 + }, + { + "epoch": 0.5814027292922882, + "grad_norm": 2.5449576622123646, + "learning_rate": 4.844938519695984e-05, + "loss": 0.5104832649230957, + "step": 229, + "token_acc": 0.8486502433987314 + }, + { + "epoch": 0.583941605839416, + "grad_norm": 1.3118749339834277, + "learning_rate": 4.8405871765993433e-05, + "loss": 0.505854606628418, + "step": 230, + "token_acc": 0.8532082324455206 + }, + { + "epoch": 0.5864804823865439, + "grad_norm": 2.18900446561014, + "learning_rate": 4.836177630878289e-05, + "loss": 0.5590152144432068, + "step": 231, + "token_acc": 0.8363560267857143 + }, + { + "epoch": 0.5890193589336719, + "grad_norm": 15.30797015176157, + "learning_rate": 4.8317099921835697e-05, + "loss": 0.4845745265483856, + "step": 232, + "token_acc": 0.8525514089870525 + }, + { + "epoch": 0.5915582354807998, + "grad_norm": 1.7181163596035074, + "learning_rate": 4.827184371610511e-05, + "loss": 0.5797554850578308, + "step": 233, + "token_acc": 0.8373081140350878 + }, + { + "epoch": 0.5940971120279276, + "grad_norm": 1.1288420718760477, + "learning_rate": 4.822600881696256e-05, + "loss": 0.5012973546981812, + "step": 234, + "token_acc": 0.8529411764705882 + }, + { + "epoch": 0.5966359885750555, + "grad_norm": 1.437368423568747, + "learning_rate": 4.817959636416969e-05, + "loss": 0.5510119199752808, + "step": 235, + "token_acc": 0.8344022575679836 + }, + { + "epoch": 0.5991748651221834, + "grad_norm": 1.2890032605357924, + "learning_rate": 4.813260751184992e-05, + "loss": 0.5216597318649292, + "step": 236, + "token_acc": 0.8493268404468634 + }, + { + "epoch": 0.6017137416693114, + "grad_norm": 1.405196489873568, + "learning_rate": 4.808504342845986e-05, + "loss": 0.6565842032432556, + "step": 237, + "token_acc": 0.8143687707641196 + }, + { + "epoch": 0.6042526182164393, + "grad_norm": 1.6519014060456265, + "learning_rate": 4.803690529676019e-05, + "loss": 0.4384632706642151, + "step": 238, + "token_acc": 0.8647027694478744 + }, + { + "epoch": 0.6067914947635671, + "grad_norm": 1.8927813931053827, + "learning_rate": 4.7988194313786275e-05, + "loss": 0.504548192024231, + "step": 239, + "token_acc": 0.8548215641609719 + }, + { + "epoch": 0.609330371310695, + "grad_norm": 1.3750618958063838, + "learning_rate": 4.7938911690818347e-05, + "loss": 0.5044655799865723, + "step": 240, + "token_acc": 0.8456818530449456 + }, + { + "epoch": 0.6118692478578229, + "grad_norm": 1.7791425452801302, + "learning_rate": 4.7889058653351485e-05, + "loss": 0.4389927089214325, + "step": 241, + "token_acc": 0.8615710435117443 + }, + { + "epoch": 0.6144081244049509, + "grad_norm": 3.174913815120615, + "learning_rate": 4.783863644106502e-05, + "loss": 0.5367846488952637, + "step": 242, + "token_acc": 0.841294538665007 + }, + { + "epoch": 0.6169470009520787, + "grad_norm": 2.447734108467047, + "learning_rate": 4.778764630779183e-05, + "loss": 0.5005022287368774, + "step": 243, + "token_acc": 0.8491663435440093 + }, + { + "epoch": 0.6194858774992066, + "grad_norm": 2.807814103600755, + "learning_rate": 4.773608952148706e-05, + "loss": 0.5408118367195129, + "step": 244, + "token_acc": 0.8354211087420043 + }, + { + "epoch": 0.6220247540463345, + "grad_norm": 2.227992234463683, + "learning_rate": 4.7683967364196624e-05, + "loss": 0.5159645080566406, + "step": 245, + "token_acc": 0.8429188135357193 + }, + { + "epoch": 0.6245636305934624, + "grad_norm": 3.9276559319284314, + "learning_rate": 4.763128113202537e-05, + "loss": 0.5435395240783691, + "step": 246, + "token_acc": 0.8381928868952259 + }, + { + "epoch": 0.6271025071405902, + "grad_norm": 21.07592625562304, + "learning_rate": 4.7578032135104796e-05, + "loss": 0.528008222579956, + "step": 247, + "token_acc": 0.8437879893022125 + }, + { + "epoch": 0.6296413836877182, + "grad_norm": 2.4305528198591606, + "learning_rate": 4.752422169756048e-05, + "loss": 0.5454938411712646, + "step": 248, + "token_acc": 0.8377711162052548 + }, + { + "epoch": 0.6321802602348461, + "grad_norm": 4.774445766197441, + "learning_rate": 4.7469851157479177e-05, + "loss": 0.5896109342575073, + "step": 249, + "token_acc": 0.8303083960454478 + }, + { + "epoch": 0.634719136781974, + "grad_norm": 2.9285874898965036, + "learning_rate": 4.7414921866875524e-05, + "loss": 0.5258548259735107, + "step": 250, + "token_acc": 0.8459306342407075 + }, + { + "epoch": 0.6372580133291019, + "grad_norm": 1.1551732083505906, + "learning_rate": 4.7359435191658425e-05, + "loss": 0.4973874092102051, + "step": 251, + "token_acc": 0.8523009950248757 + }, + { + "epoch": 0.6397968898762297, + "grad_norm": 1.404758000704147, + "learning_rate": 4.730339251159709e-05, + "loss": 0.48979347944259644, + "step": 252, + "token_acc": 0.8519233625427002 + }, + { + "epoch": 0.6423357664233577, + "grad_norm": 1.1599030830108534, + "learning_rate": 4.724679522028672e-05, + "loss": 0.4671449661254883, + "step": 253, + "token_acc": 0.8547652417659425 + }, + { + "epoch": 0.6448746429704856, + "grad_norm": 9.767857767777004, + "learning_rate": 4.718964472511386e-05, + "loss": 0.5248907208442688, + "step": 254, + "token_acc": 0.8436238600687697 + }, + { + "epoch": 0.6474135195176135, + "grad_norm": 1.5836269105977552, + "learning_rate": 4.713194244722138e-05, + "loss": 0.492233008146286, + "step": 255, + "token_acc": 0.8537440902851914 + }, + { + "epoch": 0.6499523960647413, + "grad_norm": 1.676133573613313, + "learning_rate": 4.707368982147318e-05, + "loss": 0.49239009618759155, + "step": 256, + "token_acc": 0.8473175021987687 + }, + { + "epoch": 0.6524912726118692, + "grad_norm": 12.420578245961337, + "learning_rate": 4.701488829641845e-05, + "loss": 0.55488121509552, + "step": 257, + "token_acc": 0.835998984513836 + }, + { + "epoch": 0.6550301491589972, + "grad_norm": 2.7460132417830643, + "learning_rate": 4.6955539334255716e-05, + "loss": 0.5333112478256226, + "step": 258, + "token_acc": 0.8431862832648688 + }, + { + "epoch": 0.6575690257061251, + "grad_norm": 2.143768931475659, + "learning_rate": 4.6895644410796416e-05, + "loss": 0.5408412218093872, + "step": 259, + "token_acc": 0.8437373601186463 + }, + { + "epoch": 0.6601079022532529, + "grad_norm": 1.552814047782724, + "learning_rate": 4.6835205015428246e-05, + "loss": 0.5155550241470337, + "step": 260, + "token_acc": 0.8499210110584519 + }, + { + "epoch": 0.6626467788003808, + "grad_norm": 1.2034458590422716, + "learning_rate": 4.6774222651078106e-05, + "loss": 0.5099776983261108, + "step": 261, + "token_acc": 0.8472036789793799 + }, + { + "epoch": 0.6651856553475087, + "grad_norm": 2.924220695079595, + "learning_rate": 4.671269883417473e-05, + "loss": 0.5947083234786987, + "step": 262, + "token_acc": 0.8290450928381963 + }, + { + "epoch": 0.6677245318946367, + "grad_norm": 1.455955314620601, + "learning_rate": 4.665063509461097e-05, + "loss": 0.5068027973175049, + "step": 263, + "token_acc": 0.8482072342441952 + }, + { + "epoch": 0.6702634084417646, + "grad_norm": 3.344945263340371, + "learning_rate": 4.658803297570577e-05, + "loss": 0.5365261435508728, + "step": 264, + "token_acc": 0.8415192190359976 + }, + { + "epoch": 0.6728022849888924, + "grad_norm": 1.9005203964312098, + "learning_rate": 4.652489403416579e-05, + "loss": 0.4796498417854309, + "step": 265, + "token_acc": 0.8555090206185567 + }, + { + "epoch": 0.6753411615360203, + "grad_norm": 2.8726899682034412, + "learning_rate": 4.6461219840046654e-05, + "loss": 0.49148356914520264, + "step": 266, + "token_acc": 0.8587875255027688 + }, + { + "epoch": 0.6778800380831482, + "grad_norm": 3.620289535245779, + "learning_rate": 4.639701197671397e-05, + "loss": 0.5379594564437866, + "step": 267, + "token_acc": 0.844286636539703 + }, + { + "epoch": 0.6804189146302762, + "grad_norm": 1.880048630363598, + "learning_rate": 4.6332272040803895e-05, + "loss": 0.40906715393066406, + "step": 268, + "token_acc": 0.8677865920049774 + }, + { + "epoch": 0.682957791177404, + "grad_norm": 3.2529749263524854, + "learning_rate": 4.6267001642183496e-05, + "loss": 0.5698261857032776, + "step": 269, + "token_acc": 0.8295176385889129 + }, + { + "epoch": 0.6854966677245319, + "grad_norm": 1.4115756433255298, + "learning_rate": 4.620120240391065e-05, + "loss": 0.5403001308441162, + "step": 270, + "token_acc": 0.8392932267564156 + }, + { + "epoch": 0.6880355442716598, + "grad_norm": 1.5731929659655102, + "learning_rate": 4.613487596219376e-05, + "loss": 0.4380991756916046, + "step": 271, + "token_acc": 0.8581743166580712 + }, + { + "epoch": 0.6905744208187877, + "grad_norm": 2.429353942954586, + "learning_rate": 4.606802396635098e-05, + "loss": 0.4497607946395874, + "step": 272, + "token_acc": 0.8668831168831169 + }, + { + "epoch": 0.6931132973659155, + "grad_norm": 1.4740422171009888, + "learning_rate": 4.600064807876929e-05, + "loss": 0.4794745445251465, + "step": 273, + "token_acc": 0.8582345601996257 + }, + { + "epoch": 0.6956521739130435, + "grad_norm": 1.4962672531000716, + "learning_rate": 4.593274997486309e-05, + "loss": 0.5734583735466003, + "step": 274, + "token_acc": 0.8358989687640114 + }, + { + "epoch": 0.6981910504601714, + "grad_norm": 2.582140206521716, + "learning_rate": 4.586433134303257e-05, + "loss": 0.47569674253463745, + "step": 275, + "token_acc": 0.851392632524708 + }, + { + "epoch": 0.7007299270072993, + "grad_norm": 2.0299052997394145, + "learning_rate": 4.579539388462173e-05, + "loss": 0.4513978362083435, + "step": 276, + "token_acc": 0.8595333128645993 + }, + { + "epoch": 0.7032688035544271, + "grad_norm": 1.4683236839939144, + "learning_rate": 4.572593931387604e-05, + "loss": 0.4924212694168091, + "step": 277, + "token_acc": 0.8509630565203663 + }, + { + "epoch": 0.705807680101555, + "grad_norm": 1.6692647992426015, + "learning_rate": 4.5655969357899874e-05, + "loss": 0.50971919298172, + "step": 278, + "token_acc": 0.8504672897196262 + }, + { + "epoch": 0.708346556648683, + "grad_norm": 2.772573768796691, + "learning_rate": 4.5585485756613486e-05, + "loss": 0.4721433222293854, + "step": 279, + "token_acc": 0.8584571832979476 + }, + { + "epoch": 0.7108854331958109, + "grad_norm": 2.0060707686440407, + "learning_rate": 4.551449026270979e-05, + "loss": 0.5175821781158447, + "step": 280, + "token_acc": 0.8468809073724007 + }, + { + "epoch": 0.7134243097429388, + "grad_norm": 1.8487986104225613, + "learning_rate": 4.544298464161079e-05, + "loss": 0.5257778763771057, + "step": 281, + "token_acc": 0.8475199020208206 + }, + { + "epoch": 0.7159631862900666, + "grad_norm": 2.127782753744905, + "learning_rate": 4.537097067142363e-05, + "loss": 0.562999427318573, + "step": 282, + "token_acc": 0.8408823529411765 + }, + { + "epoch": 0.7185020628371945, + "grad_norm": 2.5685178275153957, + "learning_rate": 4.529845014289642e-05, + "loss": 0.5207107067108154, + "step": 283, + "token_acc": 0.8469147432878003 + }, + { + "epoch": 0.7210409393843225, + "grad_norm": 6.2775274916114014, + "learning_rate": 4.522542485937369e-05, + "loss": 0.5115345120429993, + "step": 284, + "token_acc": 0.8454268292682927 + }, + { + "epoch": 0.7235798159314504, + "grad_norm": 1.2979163949839545, + "learning_rate": 4.5151896636751556e-05, + "loss": 0.4864828586578369, + "step": 285, + "token_acc": 0.855954855954856 + }, + { + "epoch": 0.7261186924785782, + "grad_norm": 1.9952838067379783, + "learning_rate": 4.5077867303432546e-05, + "loss": 0.49415430426597595, + "step": 286, + "token_acc": 0.8480227882037533 + }, + { + "epoch": 0.7286575690257061, + "grad_norm": 1.7314556438703808, + "learning_rate": 4.500333870028016e-05, + "loss": 0.5226168036460876, + "step": 287, + "token_acc": 0.8493612242032851 + }, + { + "epoch": 0.731196445572834, + "grad_norm": 4.40006164102703, + "learning_rate": 4.4928312680573064e-05, + "loss": 0.4729849100112915, + "step": 288, + "token_acc": 0.8531379420197515 + }, + { + "epoch": 0.733735322119962, + "grad_norm": 6.394724509170586, + "learning_rate": 4.485279110995903e-05, + "loss": 0.5564934611320496, + "step": 289, + "token_acc": 0.8377503852080124 + }, + { + "epoch": 0.7362741986670898, + "grad_norm": 1.4562222001050333, + "learning_rate": 4.477677586640854e-05, + "loss": 0.5449815988540649, + "step": 290, + "token_acc": 0.8387928419775553 + }, + { + "epoch": 0.7388130752142177, + "grad_norm": 2.12916421678339, + "learning_rate": 4.4700268840168045e-05, + "loss": 0.5377695560455322, + "step": 291, + "token_acc": 0.840630472854641 + }, + { + "epoch": 0.7413519517613456, + "grad_norm": 2.4123707155531, + "learning_rate": 4.4623271933713065e-05, + "loss": 0.4623599648475647, + "step": 292, + "token_acc": 0.8558679912443172 + }, + { + "epoch": 0.7438908283084735, + "grad_norm": 2.3146814777436333, + "learning_rate": 4.454578706170075e-05, + "loss": 0.5539848804473877, + "step": 293, + "token_acc": 0.8411723411723412 + }, + { + "epoch": 0.7464297048556015, + "grad_norm": 1.9969775879325171, + "learning_rate": 4.446781615092235e-05, + "loss": 0.48377200961112976, + "step": 294, + "token_acc": 0.8496886046120182 + }, + { + "epoch": 0.7489685814027293, + "grad_norm": 2.8675177730517296, + "learning_rate": 4.4389361140255306e-05, + "loss": 0.5668104887008667, + "step": 295, + "token_acc": 0.8326268464996789 + }, + { + "epoch": 0.7515074579498572, + "grad_norm": 2.7875164416704923, + "learning_rate": 4.431042398061499e-05, + "loss": 0.4774082601070404, + "step": 296, + "token_acc": 0.8559006211180125 + }, + { + "epoch": 0.7540463344969851, + "grad_norm": 3.728199688522229, + "learning_rate": 4.4231006634906224e-05, + "loss": 0.5095118284225464, + "step": 297, + "token_acc": 0.8488716956802064 + }, + { + "epoch": 0.756585211044113, + "grad_norm": 2.5412776821938974, + "learning_rate": 4.415111107797445e-05, + "loss": 0.5145753622055054, + "step": 298, + "token_acc": 0.8456885637923759 + }, + { + "epoch": 0.7591240875912408, + "grad_norm": 3.109090657017562, + "learning_rate": 4.407073929655666e-05, + "loss": 0.4358251094818115, + "step": 299, + "token_acc": 0.8618875369944098 + }, + { + "epoch": 0.7616629641383688, + "grad_norm": 1.6297548376808046, + "learning_rate": 4.3989893289231954e-05, + "loss": 0.4839688539505005, + "step": 300, + "token_acc": 0.8528946535906359 + }, + { + "epoch": 0.7642018406854967, + "grad_norm": 1.6139429460706416, + "learning_rate": 4.3908575066371835e-05, + "loss": 0.5315079092979431, + "step": 301, + "token_acc": 0.8464961067853171 + }, + { + "epoch": 0.7667407172326246, + "grad_norm": 1.958784000024998, + "learning_rate": 4.382678665009028e-05, + "loss": 0.43339255452156067, + "step": 302, + "token_acc": 0.8655923195611178 + }, + { + "epoch": 0.7692795937797524, + "grad_norm": 2.9343918370531257, + "learning_rate": 4.374453007419336e-05, + "loss": 0.4361863434314728, + "step": 303, + "token_acc": 0.859846630771741 + }, + { + "epoch": 0.7718184703268803, + "grad_norm": 3.237940469376079, + "learning_rate": 4.366180738412876e-05, + "loss": 0.511203408241272, + "step": 304, + "token_acc": 0.8461118690313779 + }, + { + "epoch": 0.7743573468740083, + "grad_norm": 2.274147737832287, + "learning_rate": 4.357862063693486e-05, + "loss": 0.4454347491264343, + "step": 305, + "token_acc": 0.8601151774103659 + }, + { + "epoch": 0.7768962234211362, + "grad_norm": 4.944015444600801, + "learning_rate": 4.34949719011896e-05, + "loss": 0.5148607492446899, + "step": 306, + "token_acc": 0.8461761718183137 + }, + { + "epoch": 0.779435099968264, + "grad_norm": 1.192919570288064, + "learning_rate": 4.341086325695905e-05, + "loss": 0.4589368402957916, + "step": 307, + "token_acc": 0.8554825669530066 + }, + { + "epoch": 0.7819739765153919, + "grad_norm": 2.321389755226125, + "learning_rate": 4.332629679574566e-05, + "loss": 0.4466659128665924, + "step": 308, + "token_acc": 0.8586858685868587 + }, + { + "epoch": 0.7845128530625198, + "grad_norm": 1.7507551558813503, + "learning_rate": 4.324127462043627e-05, + "loss": 0.5438239574432373, + "step": 309, + "token_acc": 0.8434806403064715 + }, + { + "epoch": 0.7870517296096478, + "grad_norm": 1.779981899957501, + "learning_rate": 4.3155798845249827e-05, + "loss": 0.45011502504348755, + "step": 310, + "token_acc": 0.8603988603988604 + }, + { + "epoch": 0.7895906061567757, + "grad_norm": 1.1173424722276424, + "learning_rate": 4.306987159568479e-05, + "loss": 0.474408894777298, + "step": 311, + "token_acc": 0.8555719678319383 + }, + { + "epoch": 0.7921294827039035, + "grad_norm": 1.6608650795823556, + "learning_rate": 4.2983495008466276e-05, + "loss": 0.4456779360771179, + "step": 312, + "token_acc": 0.8610570687418937 + }, + { + "epoch": 0.7946683592510314, + "grad_norm": 1.5083288797918926, + "learning_rate": 4.2896671231492966e-05, + "loss": 0.4788318872451782, + "step": 313, + "token_acc": 0.8551842330762639 + }, + { + "epoch": 0.7972072357981593, + "grad_norm": 1.2937780524566131, + "learning_rate": 4.2809402423783624e-05, + "loss": 0.4659798741340637, + "step": 314, + "token_acc": 0.8593476531424026 + }, + { + "epoch": 0.7997461123452873, + "grad_norm": 1.0233055916579001, + "learning_rate": 4.272169075542348e-05, + "loss": 0.5088976621627808, + "step": 315, + "token_acc": 0.8429627141417534 + }, + { + "epoch": 0.8022849888924151, + "grad_norm": 1.0571728981681126, + "learning_rate": 4.263353840751022e-05, + "loss": 0.4456738829612732, + "step": 316, + "token_acc": 0.8666382616105667 + }, + { + "epoch": 0.804823865439543, + "grad_norm": 1.8198326747222258, + "learning_rate": 4.254494757209979e-05, + "loss": 0.4678633213043213, + "step": 317, + "token_acc": 0.8546817674270218 + }, + { + "epoch": 0.8073627419866709, + "grad_norm": 1.5377357010824237, + "learning_rate": 4.245592045215182e-05, + "loss": 0.5010336637496948, + "step": 318, + "token_acc": 0.8465278833004103 + }, + { + "epoch": 0.8099016185337988, + "grad_norm": 1.4181630525718223, + "learning_rate": 4.2366459261474933e-05, + "loss": 0.5233482718467712, + "step": 319, + "token_acc": 0.843609022556391 + }, + { + "epoch": 0.8124404950809266, + "grad_norm": 2.7968517592507247, + "learning_rate": 4.227656622467162e-05, + "loss": 0.45297539234161377, + "step": 320, + "token_acc": 0.8587121852290012 + }, + { + "epoch": 0.8149793716280546, + "grad_norm": 3.9632559263367324, + "learning_rate": 4.2186243577082954e-05, + "loss": 0.49113717675209045, + "step": 321, + "token_acc": 0.8499593165174939 + }, + { + "epoch": 0.8175182481751825, + "grad_norm": 1.5212678599870548, + "learning_rate": 4.2095493564733005e-05, + "loss": 0.4760684370994568, + "step": 322, + "token_acc": 0.8581730769230769 + }, + { + "epoch": 0.8200571247223104, + "grad_norm": 1.1979894810329197, + "learning_rate": 4.2004318444272985e-05, + "loss": 0.5287943482398987, + "step": 323, + "token_acc": 0.8400316247199895 + }, + { + "epoch": 0.8225960012694383, + "grad_norm": 13.231283362213604, + "learning_rate": 4.191272048292513e-05, + "loss": 0.45438772439956665, + "step": 324, + "token_acc": 0.8593374939990398 + }, + { + "epoch": 0.8251348778165661, + "grad_norm": 1.9566355667367066, + "learning_rate": 4.1820701958426325e-05, + "loss": 0.4688713550567627, + "step": 325, + "token_acc": 0.8610249593856151 + }, + { + "epoch": 0.8276737543636941, + "grad_norm": 4.323839382951773, + "learning_rate": 4.172826515897146e-05, + "loss": 0.5428496599197388, + "step": 326, + "token_acc": 0.841347459929367 + }, + { + "epoch": 0.830212630910822, + "grad_norm": 2.713639671675627, + "learning_rate": 4.163541238315653e-05, + "loss": 0.5651642680168152, + "step": 327, + "token_acc": 0.8335643015521065 + }, + { + "epoch": 0.8327515074579499, + "grad_norm": 2.2005640892547205, + "learning_rate": 4.154214593992149e-05, + "loss": 0.42816388607025146, + "step": 328, + "token_acc": 0.8655292606861127 + }, + { + "epoch": 0.8352903840050777, + "grad_norm": 1.7693852546194808, + "learning_rate": 4.144846814849282e-05, + "loss": 0.5406675934791565, + "step": 329, + "token_acc": 0.8363126015659624 + }, + { + "epoch": 0.8378292605522056, + "grad_norm": 1.2824936447977062, + "learning_rate": 4.1354381338325864e-05, + "loss": 0.47528088092803955, + "step": 330, + "token_acc": 0.8529364953047907 + }, + { + "epoch": 0.8403681370993336, + "grad_norm": 2.1290755841224964, + "learning_rate": 4.1259887849046906e-05, + "loss": 0.47919371724128723, + "step": 331, + "token_acc": 0.8517776664997496 + }, + { + "epoch": 0.8429070136464615, + "grad_norm": 1.7923254144391947, + "learning_rate": 4.116499003039499e-05, + "loss": 0.4583389163017273, + "step": 332, + "token_acc": 0.8578696865255211 + }, + { + "epoch": 0.8454458901935893, + "grad_norm": 3.831696945491014, + "learning_rate": 4.1069690242163484e-05, + "loss": 0.4751017093658447, + "step": 333, + "token_acc": 0.8565161762017912 + }, + { + "epoch": 0.8479847667407172, + "grad_norm": 1.3534101044854359, + "learning_rate": 4.09739908541414e-05, + "loss": 0.5170926451683044, + "step": 334, + "token_acc": 0.844575246579701 + }, + { + "epoch": 0.8505236432878451, + "grad_norm": 1.7263471686071763, + "learning_rate": 4.087789424605447e-05, + "loss": 0.560020923614502, + "step": 335, + "token_acc": 0.8369974874371859 + }, + { + "epoch": 0.853062519834973, + "grad_norm": 1.976895260311541, + "learning_rate": 4.078140280750597e-05, + "loss": 0.48105573654174805, + "step": 336, + "token_acc": 0.8486519607843137 + }, + { + "epoch": 0.8556013963821009, + "grad_norm": 1.3618234100955324, + "learning_rate": 4.0684518937917315e-05, + "loss": 0.535722553730011, + "step": 337, + "token_acc": 0.8411811652035116 + }, + { + "epoch": 0.8581402729292288, + "grad_norm": 1.7410934714261248, + "learning_rate": 4.058724504646834e-05, + "loss": 0.5101606845855713, + "step": 338, + "token_acc": 0.8413575374901342 + }, + { + "epoch": 0.8606791494763567, + "grad_norm": 1.6462446903462482, + "learning_rate": 4.048958355203746e-05, + "loss": 0.4928050637245178, + "step": 339, + "token_acc": 0.8460967646185812 + }, + { + "epoch": 0.8632180260234846, + "grad_norm": 1.228936011236623, + "learning_rate": 4.039153688314145e-05, + "loss": 0.5174915194511414, + "step": 340, + "token_acc": 0.8437601824698598 + }, + { + "epoch": 0.8657569025706126, + "grad_norm": 1.4612143586664255, + "learning_rate": 4.029310747787516e-05, + "loss": 0.41705322265625, + "step": 341, + "token_acc": 0.8653099269846202 + }, + { + "epoch": 0.8682957791177404, + "grad_norm": 1.797059242292307, + "learning_rate": 4.0194297783850755e-05, + "loss": 0.5154389142990112, + "step": 342, + "token_acc": 0.8439297831538575 + }, + { + "epoch": 0.8708346556648683, + "grad_norm": 2.068548395822149, + "learning_rate": 4.009511025813694e-05, + "loss": 0.45814093947410583, + "step": 343, + "token_acc": 0.8591615638247763 + }, + { + "epoch": 0.8733735322119962, + "grad_norm": 2.106347854495477, + "learning_rate": 3.9995547367197845e-05, + "loss": 0.5106515884399414, + "step": 344, + "token_acc": 0.8444444444444444 + }, + { + "epoch": 0.8759124087591241, + "grad_norm": 2.277599588151966, + "learning_rate": 3.9895611586831685e-05, + "loss": 0.5230048894882202, + "step": 345, + "token_acc": 0.8413416536661467 + }, + { + "epoch": 0.8784512853062519, + "grad_norm": 2.12251688559056, + "learning_rate": 3.9795305402109195e-05, + "loss": 0.4795979857444763, + "step": 346, + "token_acc": 0.8566383257030739 + }, + { + "epoch": 0.8809901618533799, + "grad_norm": 6.771491520442473, + "learning_rate": 3.969463130731183e-05, + "loss": 0.41639000177383423, + "step": 347, + "token_acc": 0.869641912153819 + }, + { + "epoch": 0.8835290384005078, + "grad_norm": 8.929919537256396, + "learning_rate": 3.959359180586975e-05, + "loss": 0.4425828158855438, + "step": 348, + "token_acc": 0.8597887647328946 + }, + { + "epoch": 0.8860679149476357, + "grad_norm": 7.530785543727866, + "learning_rate": 3.9492189410299566e-05, + "loss": 0.44385579228401184, + "step": 349, + "token_acc": 0.865767878077374 + }, + { + "epoch": 0.8886067914947635, + "grad_norm": 2.6343520915908716, + "learning_rate": 3.939042664214184e-05, + "loss": 0.48342394828796387, + "step": 350, + "token_acc": 0.8567626018965231 + }, + { + "epoch": 0.8911456680418914, + "grad_norm": 1.5801412806386852, + "learning_rate": 3.928830603189844e-05, + "loss": 0.4776611030101776, + "step": 351, + "token_acc": 0.8521291530182499 + }, + { + "epoch": 0.8936845445890194, + "grad_norm": 3.7389218036878478, + "learning_rate": 3.918583011896955e-05, + "loss": 0.45217645168304443, + "step": 352, + "token_acc": 0.8585561910650796 + }, + { + "epoch": 0.8962234211361473, + "grad_norm": 1.6890575760456612, + "learning_rate": 3.908300145159055e-05, + "loss": 0.5242031216621399, + "step": 353, + "token_acc": 0.8453546152687849 + }, + { + "epoch": 0.8987622976832752, + "grad_norm": 1.992965354554827, + "learning_rate": 3.897982258676867e-05, + "loss": 0.4830443859100342, + "step": 354, + "token_acc": 0.8554014932195643 + }, + { + "epoch": 0.901301174230403, + "grad_norm": 1.2964405728485144, + "learning_rate": 3.887629609021938e-05, + "loss": 0.4663028419017792, + "step": 355, + "token_acc": 0.8561201572150478 + }, + { + "epoch": 0.9038400507775309, + "grad_norm": 8.39081588467176, + "learning_rate": 3.8772424536302564e-05, + "loss": 0.5014960169792175, + "step": 356, + "token_acc": 0.8504262120404902 + }, + { + "epoch": 0.9063789273246589, + "grad_norm": 1.8861771407475878, + "learning_rate": 3.866821050795859e-05, + "loss": 0.5827922821044922, + "step": 357, + "token_acc": 0.8322280231409623 + }, + { + "epoch": 0.9089178038717868, + "grad_norm": 1.631982885362827, + "learning_rate": 3.856365659664399e-05, + "loss": 0.5254430770874023, + "step": 358, + "token_acc": 0.8455894342083808 + }, + { + "epoch": 0.9114566804189146, + "grad_norm": 1.6184938593440648, + "learning_rate": 3.845876540226706e-05, + "loss": 0.5034159421920776, + "step": 359, + "token_acc": 0.8477827221114009 + }, + { + "epoch": 0.9139955569660425, + "grad_norm": 2.616866018868145, + "learning_rate": 3.835353953312322e-05, + "loss": 0.4409644603729248, + "step": 360, + "token_acc": 0.8624558168126633 + }, + { + "epoch": 0.9165344335131704, + "grad_norm": 1.1082161386999507, + "learning_rate": 3.824798160583012e-05, + "loss": 0.4826850891113281, + "step": 361, + "token_acc": 0.8542769573697409 + }, + { + "epoch": 0.9190733100602984, + "grad_norm": 1.4706520431007584, + "learning_rate": 3.814209424526262e-05, + "loss": 0.5543685555458069, + "step": 362, + "token_acc": 0.8411547002220577 + }, + { + "epoch": 0.9216121866074262, + "grad_norm": 1.4937567660832907, + "learning_rate": 3.803588008448745e-05, + "loss": 0.46426546573638916, + "step": 363, + "token_acc": 0.8584509156409487 + }, + { + "epoch": 0.9241510631545541, + "grad_norm": 1.164319366810129, + "learning_rate": 3.7929341764697816e-05, + "loss": 0.43454286456108093, + "step": 364, + "token_acc": 0.869382677655108 + }, + { + "epoch": 0.926689939701682, + "grad_norm": 1.4647461875367664, + "learning_rate": 3.782248193514766e-05, + "loss": 0.40108054876327515, + "step": 365, + "token_acc": 0.8742168674698795 + }, + { + "epoch": 0.9292288162488099, + "grad_norm": 1.6339280778635523, + "learning_rate": 3.771530325308579e-05, + "loss": 0.48394569754600525, + "step": 366, + "token_acc": 0.8536367122587243 + }, + { + "epoch": 0.9317676927959379, + "grad_norm": 1.4990029947108798, + "learning_rate": 3.7607808383689856e-05, + "loss": 0.5164212584495544, + "step": 367, + "token_acc": 0.8487874465049928 + }, + { + "epoch": 0.9343065693430657, + "grad_norm": 1.246505387725808, + "learning_rate": 3.7500000000000003e-05, + "loss": 0.5112602710723877, + "step": 368, + "token_acc": 0.8492902446390819 + }, + { + "epoch": 0.9368454458901936, + "grad_norm": 3.107413430389552, + "learning_rate": 3.739188078285244e-05, + "loss": 0.4383936822414398, + "step": 369, + "token_acc": 0.8606896551724138 + }, + { + "epoch": 0.9393843224373215, + "grad_norm": 37.635995940969075, + "learning_rate": 3.7283453420812786e-05, + "loss": 0.46092715859413147, + "step": 370, + "token_acc": 0.8597212294496068 + }, + { + "epoch": 0.9419231989844494, + "grad_norm": 3.577937521692329, + "learning_rate": 3.717472061010918e-05, + "loss": 0.5413942337036133, + "step": 371, + "token_acc": 0.8350426115845732 + }, + { + "epoch": 0.9444620755315772, + "grad_norm": 5.47409206936157, + "learning_rate": 3.706568505456527e-05, + "loss": 0.48648974299430847, + "step": 372, + "token_acc": 0.8585890540968049 + }, + { + "epoch": 0.9470009520787052, + "grad_norm": 1.4741286710796073, + "learning_rate": 3.695634946553296e-05, + "loss": 0.47160500288009644, + "step": 373, + "token_acc": 0.8502487562189055 + }, + { + "epoch": 0.9495398286258331, + "grad_norm": 2.090944147666011, + "learning_rate": 3.6846716561824965e-05, + "loss": 0.5264440774917603, + "step": 374, + "token_acc": 0.84245960502693 + }, + { + "epoch": 0.952078705172961, + "grad_norm": 5.396217963829348, + "learning_rate": 3.673678906964727e-05, + "loss": 0.46441876888275146, + "step": 375, + "token_acc": 0.8582541054451167 + }, + { + "epoch": 0.9546175817200888, + "grad_norm": 2.5487410815491325, + "learning_rate": 3.662656972253127e-05, + "loss": 0.4945961534976959, + "step": 376, + "token_acc": 0.849025974025974 + }, + { + "epoch": 0.9571564582672167, + "grad_norm": 1.4487108456202973, + "learning_rate": 3.651606126126581e-05, + "loss": 0.44490116834640503, + "step": 377, + "token_acc": 0.8634252090430474 + }, + { + "epoch": 0.9596953348143447, + "grad_norm": 2.4501839034153567, + "learning_rate": 3.6405266433829075e-05, + "loss": 0.45414626598358154, + "step": 378, + "token_acc": 0.8611764705882353 + }, + { + "epoch": 0.9622342113614726, + "grad_norm": 2.498672242292354, + "learning_rate": 3.6294187995320214e-05, + "loss": 0.4957122206687927, + "step": 379, + "token_acc": 0.8477234401349073 + }, + { + "epoch": 0.9647730879086004, + "grad_norm": 1.5923271833585566, + "learning_rate": 3.6182828707890816e-05, + "loss": 0.5208961963653564, + "step": 380, + "token_acc": 0.8432196541134637 + }, + { + "epoch": 0.9673119644557283, + "grad_norm": 4.277533304496898, + "learning_rate": 3.607119134067629e-05, + "loss": 0.5402977466583252, + "step": 381, + "token_acc": 0.8438965563446336 + }, + { + "epoch": 0.9698508410028562, + "grad_norm": 1.391785836034451, + "learning_rate": 3.5959278669726935e-05, + "loss": 0.5133845210075378, + "step": 382, + "token_acc": 0.8467186095295175 + }, + { + "epoch": 0.9723897175499842, + "grad_norm": 1.6652300791673929, + "learning_rate": 3.5847093477938956e-05, + "loss": 0.4607965350151062, + "step": 383, + "token_acc": 0.8581548321808062 + }, + { + "epoch": 0.9749285940971121, + "grad_norm": 3.047516730060917, + "learning_rate": 3.5734638554985236e-05, + "loss": 0.558885931968689, + "step": 384, + "token_acc": 0.8354353441726181 + }, + { + "epoch": 0.9774674706442399, + "grad_norm": 1.7394548434827772, + "learning_rate": 3.562191669724597e-05, + "loss": 0.45114433765411377, + "step": 385, + "token_acc": 0.8557377049180328 + }, + { + "epoch": 0.9800063471913678, + "grad_norm": 2.3715567586043527, + "learning_rate": 3.550893070773914e-05, + "loss": 0.4739205837249756, + "step": 386, + "token_acc": 0.8504549457000293 + }, + { + "epoch": 0.9825452237384957, + "grad_norm": 2.7051039254253944, + "learning_rate": 3.5395683396050825e-05, + "loss": 0.47992223501205444, + "step": 387, + "token_acc": 0.8514475557664927 + }, + { + "epoch": 0.9850841002856237, + "grad_norm": 2.9508108026603526, + "learning_rate": 3.5282177578265296e-05, + "loss": 0.41233572363853455, + "step": 388, + "token_acc": 0.8679525222551929 + }, + { + "epoch": 0.9876229768327515, + "grad_norm": 1.4813660303012237, + "learning_rate": 3.516841607689501e-05, + "loss": 0.5352930426597595, + "step": 389, + "token_acc": 0.8431159981415518 + }, + { + "epoch": 0.9901618533798794, + "grad_norm": 3.1303557072936457, + "learning_rate": 3.505440172081044e-05, + "loss": 0.4628872275352478, + "step": 390, + "token_acc": 0.86190833959429 + }, + { + "epoch": 0.9927007299270073, + "grad_norm": 1.4674915872936216, + "learning_rate": 3.494013734516971e-05, + "loss": 0.4559894800186157, + "step": 391, + "token_acc": 0.8610082138830729 + }, + { + "epoch": 0.9952396064741352, + "grad_norm": 1.953348901842891, + "learning_rate": 3.4825625791348096e-05, + "loss": 0.4409753978252411, + "step": 392, + "token_acc": 0.862080370431619 + }, + { + "epoch": 0.997778483021263, + "grad_norm": 4.310074710886207, + "learning_rate": 3.471086990686737e-05, + "loss": 0.4559399485588074, + "step": 393, + "token_acc": 0.8591592988987126 + }, + { + "epoch": 1.0, + "grad_norm": 1.7219046332106547, + "learning_rate": 3.459587254532502e-05, + "loss": 0.48068922758102417, + "step": 394, + "token_acc": 0.8567295770767324 + }, + { + "epoch": 1.0, + "eval_loss": 0.38288021087646484, + "eval_runtime": 8.607, + "eval_samples_per_second": 1.394, + "eval_steps_per_second": 0.349, + "eval_token_acc": 0.8742701440249124, + "step": 394 + }, + { + "epoch": 1.002538876547128, + "grad_norm": 1.2229641769370543, + "learning_rate": 3.4480636566323215e-05, + "loss": 0.5143592357635498, + "step": 395, + "token_acc": 0.8472704323130325 + }, + { + "epoch": 1.0050777530942558, + "grad_norm": 1.782813512616928, + "learning_rate": 3.436516483539781e-05, + "loss": 0.45231950283050537, + "step": 396, + "token_acc": 0.8617021276595744 + }, + { + "epoch": 1.0076166296413838, + "grad_norm": 2.5856575991238056, + "learning_rate": 3.4249460223946975e-05, + "loss": 0.4508786201477051, + "step": 397, + "token_acc": 0.8614345263763117 + }, + { + "epoch": 1.0101555061885117, + "grad_norm": 2.745875080779602, + "learning_rate": 3.413352560915988e-05, + "loss": 0.4804307520389557, + "step": 398, + "token_acc": 0.8540305010893247 + }, + { + "epoch": 1.0126943827356394, + "grad_norm": 1.3535080212876127, + "learning_rate": 3.40173638739451e-05, + "loss": 0.4729859530925751, + "step": 399, + "token_acc": 0.8471134319698288 + }, + { + "epoch": 1.0152332592827673, + "grad_norm": 6.2502653542713045, + "learning_rate": 3.390097790685892e-05, + "loss": 0.4843446910381317, + "step": 400, + "token_acc": 0.8495706737120211 + }, + { + "epoch": 1.0177721358298952, + "grad_norm": 1.5132850287078201, + "learning_rate": 3.378437060203357e-05, + "loss": 0.49588215351104736, + "step": 401, + "token_acc": 0.8444312620495329 + }, + { + "epoch": 1.0203110123770232, + "grad_norm": 1.741043699741523, + "learning_rate": 3.366754485910518e-05, + "loss": 0.4410606026649475, + "step": 402, + "token_acc": 0.8592157540162377 + }, + { + "epoch": 1.022849888924151, + "grad_norm": 2.0466665441953373, + "learning_rate": 3.355050358314172e-05, + "loss": 0.4497084617614746, + "step": 403, + "token_acc": 0.8592548787699587 + }, + { + "epoch": 1.025388765471279, + "grad_norm": 1.4823523958796039, + "learning_rate": 3.343324968457076e-05, + "loss": 0.38255980610847473, + "step": 404, + "token_acc": 0.8794028849379403 + }, + { + "epoch": 1.027927642018407, + "grad_norm": 2.3966751712341288, + "learning_rate": 3.3315786079107055e-05, + "loss": 0.4536193609237671, + "step": 405, + "token_acc": 0.8633706363788208 + }, + { + "epoch": 1.0304665185655348, + "grad_norm": 1.9063349365942874, + "learning_rate": 3.3198115687680115e-05, + "loss": 0.4739498794078827, + "step": 406, + "token_acc": 0.8466187520418164 + }, + { + "epoch": 1.0330053951126628, + "grad_norm": 1.4474508319260888, + "learning_rate": 3.3080241436361506e-05, + "loss": 0.4536374807357788, + "step": 407, + "token_acc": 0.856529635132904 + }, + { + "epoch": 1.0355442716597905, + "grad_norm": 2.0083018432623465, + "learning_rate": 3.2962166256292113e-05, + "loss": 0.4842260479927063, + "step": 408, + "token_acc": 0.8531575720416922 + }, + { + "epoch": 1.0380831482069184, + "grad_norm": 2.8898012681351974, + "learning_rate": 3.284389308360927e-05, + "loss": 0.4716520607471466, + "step": 409, + "token_acc": 0.8573252473667411 + }, + { + "epoch": 1.0406220247540463, + "grad_norm": 2.3139198848727585, + "learning_rate": 3.272542485937369e-05, + "loss": 0.46738767623901367, + "step": 410, + "token_acc": 0.8576483396842678 + }, + { + "epoch": 1.0431609013011742, + "grad_norm": 2.6044461796538103, + "learning_rate": 3.260676452949641e-05, + "loss": 0.3785024881362915, + "step": 411, + "token_acc": 0.8754966887417218 + }, + { + "epoch": 1.0456997778483021, + "grad_norm": 3.1131273390710468, + "learning_rate": 3.248791504466548e-05, + "loss": 0.4541627764701843, + "step": 412, + "token_acc": 0.8586320148507782 + }, + { + "epoch": 1.04823865439543, + "grad_norm": 4.266600593708534, + "learning_rate": 3.2368879360272606e-05, + "loss": 0.48604655265808105, + "step": 413, + "token_acc": 0.8502902014339365 + }, + { + "epoch": 1.050777530942558, + "grad_norm": 2.5732127120225754, + "learning_rate": 3.224966043633966e-05, + "loss": 0.4228139817714691, + "step": 414, + "token_acc": 0.8685553404891783 + }, + { + "epoch": 1.053316407489686, + "grad_norm": 3.290325675872062, + "learning_rate": 3.213026123744506e-05, + "loss": 0.4242054224014282, + "step": 415, + "token_acc": 0.8702075930428278 + }, + { + "epoch": 1.0558552840368136, + "grad_norm": 1.8726969443881516, + "learning_rate": 3.201068473265007e-05, + "loss": 0.5049506425857544, + "step": 416, + "token_acc": 0.8449933244325768 + }, + { + "epoch": 1.0583941605839415, + "grad_norm": 1.4990350894397084, + "learning_rate": 3.1890933895424976e-05, + "loss": 0.4801601767539978, + "step": 417, + "token_acc": 0.8546188793538617 + }, + { + "epoch": 1.0609330371310695, + "grad_norm": 4.725304561377453, + "learning_rate": 3.177101170357513e-05, + "loss": 0.4432232081890106, + "step": 418, + "token_acc": 0.8598114824335904 + }, + { + "epoch": 1.0634719136781974, + "grad_norm": 1.8364682243485244, + "learning_rate": 3.165092113916688e-05, + "loss": 0.4704890549182892, + "step": 419, + "token_acc": 0.853051391862955 + }, + { + "epoch": 1.0660107902253253, + "grad_norm": 1.8584736101795611, + "learning_rate": 3.1530665188453464e-05, + "loss": 0.4157974123954773, + "step": 420, + "token_acc": 0.8669499402469791 + }, + { + "epoch": 1.0685496667724532, + "grad_norm": 2.4486092965062944, + "learning_rate": 3.141024684180071e-05, + "loss": 0.47378596663475037, + "step": 421, + "token_acc": 0.8559068743117823 + }, + { + "epoch": 1.0710885433195811, + "grad_norm": 2.122171195805963, + "learning_rate": 3.1289669093612714e-05, + "loss": 0.44109225273132324, + "step": 422, + "token_acc": 0.8653446345754038 + }, + { + "epoch": 1.073627419866709, + "grad_norm": 1.663932313816282, + "learning_rate": 3.116893494225734e-05, + "loss": 0.4290213882923126, + "step": 423, + "token_acc": 0.8728871787824654 + }, + { + "epoch": 1.0761662964138368, + "grad_norm": 3.2894488241422595, + "learning_rate": 3.104804738999169e-05, + "loss": 0.48185476660728455, + "step": 424, + "token_acc": 0.8533186145991445 + }, + { + "epoch": 1.0787051729609647, + "grad_norm": 1.8835262069474619, + "learning_rate": 3.092700944288744e-05, + "loss": 0.4967986047267914, + "step": 425, + "token_acc": 0.8481705560357246 + }, + { + "epoch": 1.0812440495080926, + "grad_norm": 7.1900683103196394, + "learning_rate": 3.0805824110756064e-05, + "loss": 0.47215160727500916, + "step": 426, + "token_acc": 0.8555606829718505 + }, + { + "epoch": 1.0837829260552205, + "grad_norm": 2.0678528290425673, + "learning_rate": 3.068449440707404e-05, + "loss": 0.49559837579727173, + "step": 427, + "token_acc": 0.8468780971258671 + }, + { + "epoch": 1.0863218026023485, + "grad_norm": 1.1605274764312772, + "learning_rate": 3.056302334890786e-05, + "loss": 0.4293171465396881, + "step": 428, + "token_acc": 0.8696649029982363 + }, + { + "epoch": 1.0888606791494764, + "grad_norm": 1.829932435079925, + "learning_rate": 3.044141395683906e-05, + "loss": 0.4138556718826294, + "step": 429, + "token_acc": 0.8735001714089818 + }, + { + "epoch": 1.0913995556966043, + "grad_norm": 1.9917983924455804, + "learning_rate": 3.0319669254889055e-05, + "loss": 0.49801939725875854, + "step": 430, + "token_acc": 0.8478201634877384 + }, + { + "epoch": 1.0939384322437322, + "grad_norm": 1.8340886864271402, + "learning_rate": 3.0197792270443982e-05, + "loss": 0.4354502558708191, + "step": 431, + "token_acc": 0.8643157010915198 + }, + { + "epoch": 1.0964773087908601, + "grad_norm": 3.7272006794934955, + "learning_rate": 3.0075786034179405e-05, + "loss": 0.4251129925251007, + "step": 432, + "token_acc": 0.8639125151883353 + }, + { + "epoch": 1.0990161853379878, + "grad_norm": 3.189824496796892, + "learning_rate": 2.9953653579984942e-05, + "loss": 0.5122531652450562, + "step": 433, + "token_acc": 0.84490833667871 + }, + { + "epoch": 1.1015550618851158, + "grad_norm": 9.547665998376548, + "learning_rate": 2.9831397944888833e-05, + "loss": 0.4983152151107788, + "step": 434, + "token_acc": 0.8490809879379667 + }, + { + "epoch": 1.1040939384322437, + "grad_norm": 1.368844738455595, + "learning_rate": 2.9709022168982426e-05, + "loss": 0.4401092529296875, + "step": 435, + "token_acc": 0.8648365098793496 + }, + { + "epoch": 1.1066328149793716, + "grad_norm": 1.5166459641814631, + "learning_rate": 2.958652929534456e-05, + "loss": 0.47184881567955017, + "step": 436, + "token_acc": 0.8622801507537688 + }, + { + "epoch": 1.1091716915264995, + "grad_norm": 8.52384238349447, + "learning_rate": 2.9463922369965917e-05, + "loss": 0.442952036857605, + "step": 437, + "token_acc": 0.8647058823529412 + }, + { + "epoch": 1.1117105680736274, + "grad_norm": 1.7355688744377027, + "learning_rate": 2.9341204441673266e-05, + "loss": 0.4556211829185486, + "step": 438, + "token_acc": 0.8579634464751958 + }, + { + "epoch": 1.1142494446207554, + "grad_norm": 2.842812023165703, + "learning_rate": 2.9218378562053623e-05, + "loss": 0.4310702979564667, + "step": 439, + "token_acc": 0.8618874773139746 + }, + { + "epoch": 1.1167883211678833, + "grad_norm": 1.981590398544929, + "learning_rate": 2.9095447785378443e-05, + "loss": 0.41620612144470215, + "step": 440, + "token_acc": 0.8692713484998351 + }, + { + "epoch": 1.1193271977150112, + "grad_norm": 1.6561586631847878, + "learning_rate": 2.8972415168527584e-05, + "loss": 0.46872544288635254, + "step": 441, + "token_acc": 0.8524402461714613 + }, + { + "epoch": 1.121866074262139, + "grad_norm": 1.0697309113408602, + "learning_rate": 2.8849283770913337e-05, + "loss": 0.4736919403076172, + "step": 442, + "token_acc": 0.858664890960546 + }, + { + "epoch": 1.1244049508092668, + "grad_norm": 2.271613730200828, + "learning_rate": 2.872605665440436e-05, + "loss": 0.5187445282936096, + "step": 443, + "token_acc": 0.8385538413588904 + }, + { + "epoch": 1.1269438273563948, + "grad_norm": 2.0302271966788226, + "learning_rate": 2.8602736883249503e-05, + "loss": 0.48289763927459717, + "step": 444, + "token_acc": 0.8504065040650407 + }, + { + "epoch": 1.1294827039035227, + "grad_norm": 2.5156014361955505, + "learning_rate": 2.8479327524001636e-05, + "loss": 0.439789742231369, + "step": 445, + "token_acc": 0.8627858627858628 + }, + { + "epoch": 1.1320215804506506, + "grad_norm": 1.630120505800982, + "learning_rate": 2.8355831645441388e-05, + "loss": 0.4468497633934021, + "step": 446, + "token_acc": 0.8583463338533541 + }, + { + "epoch": 1.1345604569977785, + "grad_norm": 3.439515982340311, + "learning_rate": 2.8232252318500834e-05, + "loss": 0.44376781582832336, + "step": 447, + "token_acc": 0.8602133418245502 + }, + { + "epoch": 1.1370993335449064, + "grad_norm": 1.9688918033614031, + "learning_rate": 2.8108592616187133e-05, + "loss": 0.5256617069244385, + "step": 448, + "token_acc": 0.8416276346604216 + }, + { + "epoch": 1.1396382100920344, + "grad_norm": 1.458501108793647, + "learning_rate": 2.7984855613506107e-05, + "loss": 0.5007484555244446, + "step": 449, + "token_acc": 0.8427366200896388 + }, + { + "epoch": 1.1421770866391623, + "grad_norm": 2.419603108383009, + "learning_rate": 2.78610443873858e-05, + "loss": 0.4337853491306305, + "step": 450, + "token_acc": 0.8653566229985444 + }, + { + "epoch": 1.14471596318629, + "grad_norm": 2.0546175364709973, + "learning_rate": 2.7737162016599927e-05, + "loss": 0.4739110469818115, + "step": 451, + "token_acc": 0.8580179048217371 + }, + { + "epoch": 1.147254839733418, + "grad_norm": 1.7344233726597045, + "learning_rate": 2.761321158169134e-05, + "loss": 0.4021814465522766, + "step": 452, + "token_acc": 0.8751091703056768 + }, + { + "epoch": 1.1497937162805458, + "grad_norm": 2.4932317823051235, + "learning_rate": 2.748919616489542e-05, + "loss": 0.4569374620914459, + "step": 453, + "token_acc": 0.8565812234628086 + }, + { + "epoch": 1.1523325928276738, + "grad_norm": 2.039426578941072, + "learning_rate": 2.736511885006343e-05, + "loss": 0.4615058898925781, + "step": 454, + "token_acc": 0.857873634729711 + }, + { + "epoch": 1.1548714693748017, + "grad_norm": 1.301902650044201, + "learning_rate": 2.724098272258584e-05, + "loss": 0.4801989793777466, + "step": 455, + "token_acc": 0.8526692514166418 + }, + { + "epoch": 1.1574103459219296, + "grad_norm": 1.2365689612139248, + "learning_rate": 2.7116790869315582e-05, + "loss": 0.4869546890258789, + "step": 456, + "token_acc": 0.8527866752081998 + }, + { + "epoch": 1.1599492224690575, + "grad_norm": 2.2554775681141472, + "learning_rate": 2.6992546378491318e-05, + "loss": 0.4671558439731598, + "step": 457, + "token_acc": 0.8632738871973322 + }, + { + "epoch": 1.1624880990161852, + "grad_norm": 2.8330547866128533, + "learning_rate": 2.686825233966061e-05, + "loss": 0.45758605003356934, + "step": 458, + "token_acc": 0.8600294393148669 + }, + { + "epoch": 1.1650269755633131, + "grad_norm": 2.5382341534463375, + "learning_rate": 2.674391184360313e-05, + "loss": 0.4325929284095764, + "step": 459, + "token_acc": 0.8682536798110122 + }, + { + "epoch": 1.167565852110441, + "grad_norm": 1.2696808367267984, + "learning_rate": 2.6619527982253794e-05, + "loss": 0.3959786295890808, + "step": 460, + "token_acc": 0.8766492789199141 + }, + { + "epoch": 1.170104728657569, + "grad_norm": 1.7506142140382555, + "learning_rate": 2.649510384862586e-05, + "loss": 0.3940657377243042, + "step": 461, + "token_acc": 0.8712036889807601 + }, + { + "epoch": 1.172643605204697, + "grad_norm": 1.7107196519705088, + "learning_rate": 2.6370642536734004e-05, + "loss": 0.5099540948867798, + "step": 462, + "token_acc": 0.8436054506813352 + }, + { + "epoch": 1.1751824817518248, + "grad_norm": 1.7833742981941938, + "learning_rate": 2.624614714151743e-05, + "loss": 0.4193633794784546, + "step": 463, + "token_acc": 0.8683380375228291 + }, + { + "epoch": 1.1777213582989527, + "grad_norm": 2.3198990995406725, + "learning_rate": 2.6121620758762877e-05, + "loss": 0.4693203270435333, + "step": 464, + "token_acc": 0.8514638732205211 + }, + { + "epoch": 1.1802602348460807, + "grad_norm": 1.2897817969202603, + "learning_rate": 2.5997066485027626e-05, + "loss": 0.4063398540019989, + "step": 465, + "token_acc": 0.8695512304970243 + }, + { + "epoch": 1.1827991113932086, + "grad_norm": 1.4405232549772193, + "learning_rate": 2.587248741756253e-05, + "loss": 0.44572171568870544, + "step": 466, + "token_acc": 0.8620852335272842 + }, + { + "epoch": 1.1853379879403363, + "grad_norm": 1.8217636722356765, + "learning_rate": 2.5747886654234967e-05, + "loss": 0.3987278342247009, + "step": 467, + "token_acc": 0.8706475756589652 + }, + { + "epoch": 1.1878768644874642, + "grad_norm": 3.1824454514895275, + "learning_rate": 2.5623267293451826e-05, + "loss": 0.37269577383995056, + "step": 468, + "token_acc": 0.8813060971835345 + }, + { + "epoch": 1.1904157410345921, + "grad_norm": 2.138374626937944, + "learning_rate": 2.5498632434082452e-05, + "loss": 0.4612298905849457, + "step": 469, + "token_acc": 0.8567168225565949 + }, + { + "epoch": 1.19295461758172, + "grad_norm": 2.3450905694863304, + "learning_rate": 2.5373985175381594e-05, + "loss": 0.44054481387138367, + "step": 470, + "token_acc": 0.8611957044398141 + }, + { + "epoch": 1.195493494128848, + "grad_norm": 2.839758777918868, + "learning_rate": 2.5249328616912316e-05, + "loss": 0.46581026911735535, + "step": 471, + "token_acc": 0.854138500826198 + }, + { + "epoch": 1.198032370675976, + "grad_norm": 3.5936641880132116, + "learning_rate": 2.5124665858468954e-05, + "loss": 0.43622541427612305, + "step": 472, + "token_acc": 0.8644588045234248 + }, + { + "epoch": 1.2005712472231038, + "grad_norm": 4.911380154668555, + "learning_rate": 2.5e-05, + "loss": 0.4469029903411865, + "step": 473, + "token_acc": 0.8588452262732302 + }, + { + "epoch": 1.2031101237702317, + "grad_norm": 1.8675819623640426, + "learning_rate": 2.4875334141531052e-05, + "loss": 0.49759551882743835, + "step": 474, + "token_acc": 0.8490790255496138 + }, + { + "epoch": 1.2056490003173597, + "grad_norm": 1.6580101212399494, + "learning_rate": 2.475067138308769e-05, + "loss": 0.4025341272354126, + "step": 475, + "token_acc": 0.8734239397412805 + }, + { + "epoch": 1.2081878768644874, + "grad_norm": 5.728085354938939, + "learning_rate": 2.4626014824618415e-05, + "loss": 0.3990614712238312, + "step": 476, + "token_acc": 0.8767967145790554 + }, + { + "epoch": 1.2107267534116153, + "grad_norm": 1.5367082341872766, + "learning_rate": 2.4501367565917554e-05, + "loss": 0.5157250761985779, + "step": 477, + "token_acc": 0.8448275862068966 + }, + { + "epoch": 1.2132656299587432, + "grad_norm": 3.597690424641379, + "learning_rate": 2.4376732706548183e-05, + "loss": 0.4492168426513672, + "step": 478, + "token_acc": 0.8615661861074705 + }, + { + "epoch": 1.2158045065058711, + "grad_norm": 1.4902041072493963, + "learning_rate": 2.4252113345765046e-05, + "loss": 0.37822383642196655, + "step": 479, + "token_acc": 0.8781550480769231 + }, + { + "epoch": 1.218343383052999, + "grad_norm": 1.426246751443822, + "learning_rate": 2.4127512582437485e-05, + "loss": 0.5190750360488892, + "step": 480, + "token_acc": 0.8486579856497476 + }, + { + "epoch": 1.220882259600127, + "grad_norm": 2.774813842177893, + "learning_rate": 2.4002933514972383e-05, + "loss": 0.518539547920227, + "step": 481, + "token_acc": 0.84472834479854 + }, + { + "epoch": 1.223421136147255, + "grad_norm": 1.4098380882633827, + "learning_rate": 2.3878379241237136e-05, + "loss": 0.47627416253089905, + "step": 482, + "token_acc": 0.8569976771196284 + }, + { + "epoch": 1.2259600126943828, + "grad_norm": 1.7826564526094135, + "learning_rate": 2.375385285848257e-05, + "loss": 0.42589280009269714, + "step": 483, + "token_acc": 0.8641709458340235 + }, + { + "epoch": 1.2284988892415107, + "grad_norm": 6.914261522969829, + "learning_rate": 2.3629357463265995e-05, + "loss": 0.4288692772388458, + "step": 484, + "token_acc": 0.8673562519014298 + }, + { + "epoch": 1.2310377657886384, + "grad_norm": 2.2936806230614, + "learning_rate": 2.3504896151374144e-05, + "loss": 0.4289345145225525, + "step": 485, + "token_acc": 0.861934856587263 + }, + { + "epoch": 1.2335766423357664, + "grad_norm": 4.477879405699933, + "learning_rate": 2.3380472017746202e-05, + "loss": 0.4350780248641968, + "step": 486, + "token_acc": 0.8626133691635876 + }, + { + "epoch": 1.2361155188828943, + "grad_norm": 1.8058168095565652, + "learning_rate": 2.3256088156396868e-05, + "loss": 0.39745572209358215, + "step": 487, + "token_acc": 0.8732865262454029 + }, + { + "epoch": 1.2386543954300222, + "grad_norm": 2.2664330502994345, + "learning_rate": 2.3131747660339394e-05, + "loss": 0.4024912118911743, + "step": 488, + "token_acc": 0.8703306797305572 + }, + { + "epoch": 1.2411932719771501, + "grad_norm": 5.084590822735379, + "learning_rate": 2.300745362150869e-05, + "loss": 0.4632995128631592, + "step": 489, + "token_acc": 0.855690440060698 + }, + { + "epoch": 1.243732148524278, + "grad_norm": 2.0874369543957347, + "learning_rate": 2.288320913068442e-05, + "loss": 0.4639138877391815, + "step": 490, + "token_acc": 0.8562836340614118 + }, + { + "epoch": 1.246271025071406, + "grad_norm": 1.2707114462172824, + "learning_rate": 2.2759017277414166e-05, + "loss": 0.46406933665275574, + "step": 491, + "token_acc": 0.8545316070068545 + }, + { + "epoch": 1.248809901618534, + "grad_norm": 5.750489479727684, + "learning_rate": 2.2634881149936575e-05, + "loss": 0.44021913409233093, + "step": 492, + "token_acc": 0.8632707774798928 + }, + { + "epoch": 1.2513487781656618, + "grad_norm": 2.6842431999286265, + "learning_rate": 2.251080383510459e-05, + "loss": 0.3908591568470001, + "step": 493, + "token_acc": 0.8772083515841729 + }, + { + "epoch": 1.2538876547127895, + "grad_norm": 1.1560545363753385, + "learning_rate": 2.238678841830867e-05, + "loss": 0.4324193000793457, + "step": 494, + "token_acc": 0.8664389132910363 + }, + { + "epoch": 1.2564265312599174, + "grad_norm": 1.6882361440401292, + "learning_rate": 2.2262837983400082e-05, + "loss": 0.4089895486831665, + "step": 495, + "token_acc": 0.8690438624171662 + }, + { + "epoch": 1.2589654078070454, + "grad_norm": 0.9792218604145349, + "learning_rate": 2.2138955612614207e-05, + "loss": 0.4600200653076172, + "step": 496, + "token_acc": 0.8582183186951067 + }, + { + "epoch": 1.2615042843541733, + "grad_norm": 2.080232718858842, + "learning_rate": 2.2015144386493896e-05, + "loss": 0.3934141993522644, + "step": 497, + "token_acc": 0.8696333437793795 + }, + { + "epoch": 1.2640431609013012, + "grad_norm": 1.8586192597126465, + "learning_rate": 2.189140738381288e-05, + "loss": 0.44040676951408386, + "step": 498, + "token_acc": 0.8644963828603227 + }, + { + "epoch": 1.2665820374484291, + "grad_norm": 4.06956415958539, + "learning_rate": 2.1767747681499176e-05, + "loss": 0.3815660774707794, + "step": 499, + "token_acc": 0.870893371757925 + }, + { + "epoch": 1.269120913995557, + "grad_norm": 1.3449883177756365, + "learning_rate": 2.164416835455862e-05, + "loss": 0.5274641513824463, + "step": 500, + "token_acc": 0.8424899193548387 + }, + { + "epoch": 1.2716597905426847, + "grad_norm": 1.9086096747495165, + "learning_rate": 2.1520672475998373e-05, + "loss": 0.47970038652420044, + "step": 501, + "token_acc": 0.8552230534774176 + }, + { + "epoch": 1.2741986670898129, + "grad_norm": 1.4597144720924924, + "learning_rate": 2.1397263116750503e-05, + "loss": 0.4599403738975525, + "step": 502, + "token_acc": 0.8601061263868789 + }, + { + "epoch": 1.2767375436369406, + "grad_norm": 1.9206210272302051, + "learning_rate": 2.1273943345595637e-05, + "loss": 0.4462440013885498, + "step": 503, + "token_acc": 0.860810615894995 + }, + { + "epoch": 1.2792764201840685, + "grad_norm": 2.0589969018981424, + "learning_rate": 2.115071622908666e-05, + "loss": 0.398454487323761, + "step": 504, + "token_acc": 0.8701257361133217 + }, + { + "epoch": 1.2818152967311964, + "grad_norm": 1.338387248924533, + "learning_rate": 2.1027584831472418e-05, + "loss": 0.43291550874710083, + "step": 505, + "token_acc": 0.8682223747426219 + }, + { + "epoch": 1.2843541732783244, + "grad_norm": 3.9967212680040456, + "learning_rate": 2.090455221462156e-05, + "loss": 0.4928514361381531, + "step": 506, + "token_acc": 0.8556149732620321 + }, + { + "epoch": 1.2868930498254523, + "grad_norm": 1.3777480828704425, + "learning_rate": 2.0781621437946376e-05, + "loss": 0.39140599966049194, + "step": 507, + "token_acc": 0.8749344061570754 + }, + { + "epoch": 1.2894319263725802, + "grad_norm": 2.163412854039733, + "learning_rate": 2.0658795558326743e-05, + "loss": 0.4300925135612488, + "step": 508, + "token_acc": 0.8705182174481056 + }, + { + "epoch": 1.2919708029197081, + "grad_norm": 3.6013585326036526, + "learning_rate": 2.0536077630034086e-05, + "loss": 0.46016770601272583, + "step": 509, + "token_acc": 0.8594602789569437 + }, + { + "epoch": 1.2945096794668358, + "grad_norm": 8.4409855883816, + "learning_rate": 2.0413470704655445e-05, + "loss": 0.4381971061229706, + "step": 510, + "token_acc": 0.8621141525917297 + }, + { + "epoch": 1.2970485560139637, + "grad_norm": 1.856318757657611, + "learning_rate": 2.0290977831017583e-05, + "loss": 0.4124452471733093, + "step": 511, + "token_acc": 0.8683113273106324 + }, + { + "epoch": 1.2995874325610917, + "grad_norm": 17.66087022350861, + "learning_rate": 2.0168602055111173e-05, + "loss": 0.41474050283432007, + "step": 512, + "token_acc": 0.866996699669967 + }, + { + "epoch": 1.3021263091082196, + "grad_norm": 1.2286019548778255, + "learning_rate": 2.0046346420015067e-05, + "loss": 0.46553826332092285, + "step": 513, + "token_acc": 0.8545911616829849 + }, + { + "epoch": 1.3046651856553475, + "grad_norm": 1.4026697049092485, + "learning_rate": 1.99242139658206e-05, + "loss": 0.46943899989128113, + "step": 514, + "token_acc": 0.8579387186629527 + }, + { + "epoch": 1.3072040622024754, + "grad_norm": 1.8539995874816066, + "learning_rate": 1.980220772955602e-05, + "loss": 0.5168992877006531, + "step": 515, + "token_acc": 0.8489708634055065 + }, + { + "epoch": 1.3097429387496033, + "grad_norm": 3.677926572991036, + "learning_rate": 1.9680330745110954e-05, + "loss": 0.42453351616859436, + "step": 516, + "token_acc": 0.8682324233643435 + }, + { + "epoch": 1.3122818152967313, + "grad_norm": 3.7047767816786488, + "learning_rate": 1.9558586043160944e-05, + "loss": 0.4531457722187042, + "step": 517, + "token_acc": 0.8594585832387746 + }, + { + "epoch": 1.3148206918438592, + "grad_norm": 1.5017453573561992, + "learning_rate": 1.9436976651092144e-05, + "loss": 0.48053622245788574, + "step": 518, + "token_acc": 0.8554669169404036 + }, + { + "epoch": 1.317359568390987, + "grad_norm": 1.2658361060226122, + "learning_rate": 1.931550559292597e-05, + "loss": 0.4013400375843048, + "step": 519, + "token_acc": 0.8704970360237118 + }, + { + "epoch": 1.3198984449381148, + "grad_norm": 1.8447385702822394, + "learning_rate": 1.919417588924394e-05, + "loss": 0.43935462832450867, + "step": 520, + "token_acc": 0.8640745501285347 + }, + { + "epoch": 1.3224373214852427, + "grad_norm": 1.6140562094589839, + "learning_rate": 1.9072990557112564e-05, + "loss": 0.44726884365081787, + "step": 521, + "token_acc": 0.8607212916855289 + }, + { + "epoch": 1.3249761980323707, + "grad_norm": 2.727348058003196, + "learning_rate": 1.895195261000831e-05, + "loss": 0.47654542326927185, + "step": 522, + "token_acc": 0.8562250142775557 + }, + { + "epoch": 1.3275150745794986, + "grad_norm": 1.7111060247682721, + "learning_rate": 1.8831065057742657e-05, + "loss": 0.4838721752166748, + "step": 523, + "token_acc": 0.8474853482349735 + }, + { + "epoch": 1.3300539511266265, + "grad_norm": 1.1904717534818117, + "learning_rate": 1.871033090638729e-05, + "loss": 0.4641708731651306, + "step": 524, + "token_acc": 0.8535112359550562 + }, + { + "epoch": 1.3325928276737544, + "grad_norm": 1.1848974404987074, + "learning_rate": 1.858975315819929e-05, + "loss": 0.42533761262893677, + "step": 525, + "token_acc": 0.8690002651816494 + }, + { + "epoch": 1.3351317042208823, + "grad_norm": 3.787955396097398, + "learning_rate": 1.8469334811546542e-05, + "loss": 0.4110487699508667, + "step": 526, + "token_acc": 0.8647342995169082 + }, + { + "epoch": 1.3376705807680103, + "grad_norm": 1.5655236026657533, + "learning_rate": 1.8349078860833123e-05, + "loss": 0.42806491255760193, + "step": 527, + "token_acc": 0.8654826029989809 + }, + { + "epoch": 1.340209457315138, + "grad_norm": 2.8998679857731413, + "learning_rate": 1.8228988296424877e-05, + "loss": 0.43801093101501465, + "step": 528, + "token_acc": 0.8696023941855494 + }, + { + "epoch": 1.3427483338622659, + "grad_norm": 1.636297205622352, + "learning_rate": 1.8109066104575023e-05, + "loss": 0.422304630279541, + "step": 529, + "token_acc": 0.8669064748201439 + }, + { + "epoch": 1.3452872104093938, + "grad_norm": 1.3420918097116232, + "learning_rate": 1.7989315267349936e-05, + "loss": 0.44057074189186096, + "step": 530, + "token_acc": 0.8630622960124876 + }, + { + "epoch": 1.3478260869565217, + "grad_norm": 2.1241693763789637, + "learning_rate": 1.786973876255495e-05, + "loss": 0.45155152678489685, + "step": 531, + "token_acc": 0.8607133207241286 + }, + { + "epoch": 1.3503649635036497, + "grad_norm": 1.5304045614948183, + "learning_rate": 1.7750339563660347e-05, + "loss": 0.43257462978363037, + "step": 532, + "token_acc": 0.8637951105937136 + }, + { + "epoch": 1.3529038400507776, + "grad_norm": 1.5985611897798757, + "learning_rate": 1.7631120639727393e-05, + "loss": 0.4317207932472229, + "step": 533, + "token_acc": 0.8642266824085005 + }, + { + "epoch": 1.3554427165979055, + "grad_norm": 18.310832077778397, + "learning_rate": 1.751208495533452e-05, + "loss": 0.4994572103023529, + "step": 534, + "token_acc": 0.8442584844258484 + }, + { + "epoch": 1.3579815931450332, + "grad_norm": 7.992790487896188, + "learning_rate": 1.7393235470503594e-05, + "loss": 0.43917202949523926, + "step": 535, + "token_acc": 0.8584739803094233 + }, + { + "epoch": 1.3605204696921613, + "grad_norm": 2.4309869470711605, + "learning_rate": 1.7274575140626318e-05, + "loss": 0.46626704931259155, + "step": 536, + "token_acc": 0.8609659742576781 + }, + { + "epoch": 1.363059346239289, + "grad_norm": 1.4286614492442966, + "learning_rate": 1.7156106916390742e-05, + "loss": 0.4859922230243683, + "step": 537, + "token_acc": 0.8509760355499127 + }, + { + "epoch": 1.365598222786417, + "grad_norm": 12.19485526753234, + "learning_rate": 1.7037833743707892e-05, + "loss": 0.5352718234062195, + "step": 538, + "token_acc": 0.8372653475393201 + }, + { + "epoch": 1.3681370993335449, + "grad_norm": 1.359902459346923, + "learning_rate": 1.6919758563638504e-05, + "loss": 0.4395660161972046, + "step": 539, + "token_acc": 0.8599110090426295 + }, + { + "epoch": 1.3706759758806728, + "grad_norm": 2.3653688053773174, + "learning_rate": 1.6801884312319895e-05, + "loss": 0.4254641532897949, + "step": 540, + "token_acc": 0.8650124069478908 + }, + { + "epoch": 1.3732148524278007, + "grad_norm": 1.6701485031120074, + "learning_rate": 1.6684213920892954e-05, + "loss": 0.41960853338241577, + "step": 541, + "token_acc": 0.8680320569902048 + }, + { + "epoch": 1.3757537289749286, + "grad_norm": 1.1051014859233328, + "learning_rate": 1.6566750315429254e-05, + "loss": 0.4190429449081421, + "step": 542, + "token_acc": 0.8667908709827666 + }, + { + "epoch": 1.3782926055220566, + "grad_norm": 1.4380751334871487, + "learning_rate": 1.6449496416858284e-05, + "loss": 0.45707201957702637, + "step": 543, + "token_acc": 0.8615271659324523 + }, + { + "epoch": 1.3808314820691843, + "grad_norm": 3.9885703693887793, + "learning_rate": 1.633245514089482e-05, + "loss": 0.4892377257347107, + "step": 544, + "token_acc": 0.8495562130177515 + }, + { + "epoch": 1.3833703586163124, + "grad_norm": 17.032385872575972, + "learning_rate": 1.621562939796643e-05, + "loss": 0.406480073928833, + "step": 545, + "token_acc": 0.8727165586328816 + }, + { + "epoch": 1.3859092351634401, + "grad_norm": 4.979648086866017, + "learning_rate": 1.609902209314108e-05, + "loss": 0.38652193546295166, + "step": 546, + "token_acc": 0.878414234431091 + }, + { + "epoch": 1.388448111710568, + "grad_norm": 1.2121080853043547, + "learning_rate": 1.5982636126054908e-05, + "loss": 0.4779953956604004, + "step": 547, + "token_acc": 0.8547113289760349 + }, + { + "epoch": 1.390986988257696, + "grad_norm": 1.5065420828046852, + "learning_rate": 1.5866474390840125e-05, + "loss": 0.44981124997138977, + "step": 548, + "token_acc": 0.8576479631053037 + }, + { + "epoch": 1.3935258648048239, + "grad_norm": 3.4688752703683976, + "learning_rate": 1.575053977605303e-05, + "loss": 0.44178125262260437, + "step": 549, + "token_acc": 0.8575572027070577 + }, + { + "epoch": 1.3960647413519518, + "grad_norm": 1.6171169118006599, + "learning_rate": 1.56348351646022e-05, + "loss": 0.44523173570632935, + "step": 550, + "token_acc": 0.8633571309978416 + }, + { + "epoch": 1.3986036178990797, + "grad_norm": 1.586112451088612, + "learning_rate": 1.551936343367679e-05, + "loss": 0.4479164481163025, + "step": 551, + "token_acc": 0.8625266262493856 + }, + { + "epoch": 1.4011424944462076, + "grad_norm": 1.767169114419103, + "learning_rate": 1.5404127454674995e-05, + "loss": 0.4843277335166931, + "step": 552, + "token_acc": 0.8488859764089122 + }, + { + "epoch": 1.4036813709933353, + "grad_norm": 1.4568503886378839, + "learning_rate": 1.5289130093132632e-05, + "loss": 0.4229825437068939, + "step": 553, + "token_acc": 0.8641706573791903 + }, + { + "epoch": 1.4062202475404633, + "grad_norm": 1.5583360742463694, + "learning_rate": 1.5174374208651912e-05, + "loss": 0.38800352811813354, + "step": 554, + "token_acc": 0.8774544179523142 + }, + { + "epoch": 1.4087591240875912, + "grad_norm": 1.3167806496310293, + "learning_rate": 1.5059862654830298e-05, + "loss": 0.4089431166648865, + "step": 555, + "token_acc": 0.8715203426124197 + }, + { + "epoch": 1.411298000634719, + "grad_norm": 1.4514359662418896, + "learning_rate": 1.4945598279189565e-05, + "loss": 0.4339912533760071, + "step": 556, + "token_acc": 0.8620784583620096 + }, + { + "epoch": 1.413836877181847, + "grad_norm": 1.6651515172850537, + "learning_rate": 1.4831583923104999e-05, + "loss": 0.4562704563140869, + "step": 557, + "token_acc": 0.858122001370802 + }, + { + "epoch": 1.416375753728975, + "grad_norm": 14.207475985132781, + "learning_rate": 1.4717822421734718e-05, + "loss": 0.40736958384513855, + "step": 558, + "token_acc": 0.8740584513407653 + }, + { + "epoch": 1.4189146302761029, + "grad_norm": 1.692438013357271, + "learning_rate": 1.4604316603949186e-05, + "loss": 0.3650285005569458, + "step": 559, + "token_acc": 0.8788610871440897 + }, + { + "epoch": 1.4214535068232308, + "grad_norm": 2.6535952737736994, + "learning_rate": 1.4491069292260868e-05, + "loss": 0.47478920221328735, + "step": 560, + "token_acc": 0.8526717557251908 + }, + { + "epoch": 1.4239923833703587, + "grad_norm": 19.04443327976999, + "learning_rate": 1.4378083302754042e-05, + "loss": 0.40597039461135864, + "step": 561, + "token_acc": 0.8681386077890217 + }, + { + "epoch": 1.4265312599174864, + "grad_norm": 2.0378333351281386, + "learning_rate": 1.4265361445014768e-05, + "loss": 0.4422416090965271, + "step": 562, + "token_acc": 0.8635491960466145 + }, + { + "epoch": 1.4290701364646143, + "grad_norm": 2.044871674991076, + "learning_rate": 1.4152906522061048e-05, + "loss": 0.436612606048584, + "step": 563, + "token_acc": 0.8649324662331166 + }, + { + "epoch": 1.4316090130117423, + "grad_norm": 2.2315866852201003, + "learning_rate": 1.4040721330273062e-05, + "loss": 0.45890551805496216, + "step": 564, + "token_acc": 0.8538338658146964 + }, + { + "epoch": 1.4341478895588702, + "grad_norm": 1.4472748890794247, + "learning_rate": 1.3928808659323717e-05, + "loss": 0.46236127614974976, + "step": 565, + "token_acc": 0.8577593360995851 + }, + { + "epoch": 1.436686766105998, + "grad_norm": 5.334866510249806, + "learning_rate": 1.3817171292109183e-05, + "loss": 0.42898571491241455, + "step": 566, + "token_acc": 0.8695944131077088 + }, + { + "epoch": 1.439225642653126, + "grad_norm": 1.398192162767741, + "learning_rate": 1.3705812004679797e-05, + "loss": 0.4595816135406494, + "step": 567, + "token_acc": 0.8598717034925161 + }, + { + "epoch": 1.441764519200254, + "grad_norm": 1.7375329727298936, + "learning_rate": 1.3594733566170926e-05, + "loss": 0.3788098096847534, + "step": 568, + "token_acc": 0.8798551678736011 + }, + { + "epoch": 1.4443033957473816, + "grad_norm": 1.2774126876702627, + "learning_rate": 1.3483938738734198e-05, + "loss": 0.39907386898994446, + "step": 569, + "token_acc": 0.8782964534707487 + }, + { + "epoch": 1.4468422722945098, + "grad_norm": 2.2690969610790526, + "learning_rate": 1.337343027746874e-05, + "loss": 0.4483853578567505, + "step": 570, + "token_acc": 0.8679751719510149 + }, + { + "epoch": 1.4493811488416375, + "grad_norm": 1.767412679641127, + "learning_rate": 1.3263210930352737e-05, + "loss": 0.4337015748023987, + "step": 571, + "token_acc": 0.866182405165456 + }, + { + "epoch": 1.4519200253887654, + "grad_norm": 2.020777202559013, + "learning_rate": 1.3153283438175034e-05, + "loss": 0.44972699880599976, + "step": 572, + "token_acc": 0.8617665816326531 + }, + { + "epoch": 1.4544589019358933, + "grad_norm": 1.3171148885726507, + "learning_rate": 1.3043650534467053e-05, + "loss": 0.4027412533760071, + "step": 573, + "token_acc": 0.8740135287485907 + }, + { + "epoch": 1.4569977784830213, + "grad_norm": 1.413278248705783, + "learning_rate": 1.2934314945434734e-05, + "loss": 0.44188162684440613, + "step": 574, + "token_acc": 0.8614916286149162 + }, + { + "epoch": 1.4595366550301492, + "grad_norm": 5.833884922458294, + "learning_rate": 1.2825279389890817e-05, + "loss": 0.4478895664215088, + "step": 575, + "token_acc": 0.8566862013851891 + }, + { + "epoch": 1.462075531577277, + "grad_norm": 1.9849253184994973, + "learning_rate": 1.271654657918722e-05, + "loss": 0.44952666759490967, + "step": 576, + "token_acc": 0.8655305964368707 + }, + { + "epoch": 1.464614408124405, + "grad_norm": 1.5315197381415413, + "learning_rate": 1.260811921714756e-05, + "loss": 0.4790754020214081, + "step": 577, + "token_acc": 0.8557457212713936 + }, + { + "epoch": 1.4671532846715327, + "grad_norm": 2.1666096227689517, + "learning_rate": 1.2500000000000006e-05, + "loss": 0.4595195949077606, + "step": 578, + "token_acc": 0.8576657177714518 + }, + { + "epoch": 1.4696921612186609, + "grad_norm": 1.7299272521309481, + "learning_rate": 1.2392191616310148e-05, + "loss": 0.46253153681755066, + "step": 579, + "token_acc": 0.8554183432773692 + }, + { + "epoch": 1.4722310377657886, + "grad_norm": 3.1935857212226444, + "learning_rate": 1.2284696746914216e-05, + "loss": 0.38790345191955566, + "step": 580, + "token_acc": 0.8763918024850734 + }, + { + "epoch": 1.4747699143129165, + "grad_norm": 2.4891023520531306, + "learning_rate": 1.217751806485235e-05, + "loss": 0.48343977332115173, + "step": 581, + "token_acc": 0.8529189923065319 + }, + { + "epoch": 1.4773087908600444, + "grad_norm": 3.177945315387868, + "learning_rate": 1.2070658235302181e-05, + "loss": 0.48892277479171753, + "step": 582, + "token_acc": 0.8539147040101845 + }, + { + "epoch": 1.4798476674071723, + "grad_norm": 1.5857930798647957, + "learning_rate": 1.196411991551255e-05, + "loss": 0.42535966634750366, + "step": 583, + "token_acc": 0.8711089494163424 + }, + { + "epoch": 1.4823865439543003, + "grad_norm": 3.7111437583115316, + "learning_rate": 1.185790575473738e-05, + "loss": 0.48156630992889404, + "step": 584, + "token_acc": 0.8545431568305321 + }, + { + "epoch": 1.4849254205014282, + "grad_norm": 1.7366290492440477, + "learning_rate": 1.175201839416988e-05, + "loss": 0.42791950702667236, + "step": 585, + "token_acc": 0.865335463258786 + }, + { + "epoch": 1.487464297048556, + "grad_norm": 1.7963881029673523, + "learning_rate": 1.1646460466876783e-05, + "loss": 0.5193693041801453, + "step": 586, + "token_acc": 0.8437993964650093 + }, + { + "epoch": 1.4900031735956838, + "grad_norm": 1.988412951732855, + "learning_rate": 1.1541234597732947e-05, + "loss": 0.49178972840309143, + "step": 587, + "token_acc": 0.8525784753363229 + }, + { + "epoch": 1.492542050142812, + "grad_norm": 9.176836375495418, + "learning_rate": 1.1436343403356017e-05, + "loss": 0.4512653350830078, + "step": 588, + "token_acc": 0.8604761904761905 + }, + { + "epoch": 1.4950809266899396, + "grad_norm": 2.971031706591444, + "learning_rate": 1.133178949204141e-05, + "loss": 0.4031686782836914, + "step": 589, + "token_acc": 0.8732302045097011 + }, + { + "epoch": 1.4976198032370676, + "grad_norm": 1.651857378948217, + "learning_rate": 1.122757546369744e-05, + "loss": 0.4282115697860718, + "step": 590, + "token_acc": 0.8629955216453806 + }, + { + "epoch": 1.5001586797841955, + "grad_norm": 2.4954449061301864, + "learning_rate": 1.1123703909780628e-05, + "loss": 0.434163361787796, + "step": 591, + "token_acc": 0.8638222464558343 + }, + { + "epoch": 1.5026975563313234, + "grad_norm": 1.2601544635386799, + "learning_rate": 1.1020177413231334e-05, + "loss": 0.45839256048202515, + "step": 592, + "token_acc": 0.8634242200933432 + }, + { + "epoch": 1.5052364328784513, + "grad_norm": 2.2375854968960875, + "learning_rate": 1.0916998548409449e-05, + "loss": 0.5025709867477417, + "step": 593, + "token_acc": 0.850828729281768 + }, + { + "epoch": 1.507775309425579, + "grad_norm": 1.319442700362402, + "learning_rate": 1.0814169881030459e-05, + "loss": 0.4569821357727051, + "step": 594, + "token_acc": 0.8591549295774648 + }, + { + "epoch": 1.5103141859727072, + "grad_norm": 1.9929190447195282, + "learning_rate": 1.0711693968101564e-05, + "loss": 0.44513434171676636, + "step": 595, + "token_acc": 0.8614449109598957 + }, + { + "epoch": 1.5128530625198349, + "grad_norm": 1.881642036542598, + "learning_rate": 1.0609573357858166e-05, + "loss": 0.44361644983291626, + "step": 596, + "token_acc": 0.8606782768102658 + }, + { + "epoch": 1.515391939066963, + "grad_norm": 1.9838343655923574, + "learning_rate": 1.0507810589700445e-05, + "loss": 0.4259661138057709, + "step": 597, + "token_acc": 0.8694739997002847 + }, + { + "epoch": 1.5179308156140907, + "grad_norm": 4.829259494993677, + "learning_rate": 1.0406408194130259e-05, + "loss": 0.4639781713485718, + "step": 598, + "token_acc": 0.8590412909349786 + }, + { + "epoch": 1.5204696921612186, + "grad_norm": 1.177744266394994, + "learning_rate": 1.0305368692688174e-05, + "loss": 0.40976643562316895, + "step": 599, + "token_acc": 0.8727062563213408 + }, + { + "epoch": 1.5230085687083466, + "grad_norm": 1.824261035759033, + "learning_rate": 1.0204694597890812e-05, + "loss": 0.3980882167816162, + "step": 600, + "token_acc": 0.8739591836734694 + }, + { + "epoch": 1.5255474452554745, + "grad_norm": 2.4861898678492875, + "learning_rate": 1.010438841316831e-05, + "loss": 0.4560452699661255, + "step": 601, + "token_acc": 0.8610804851157663 + }, + { + "epoch": 1.5280863218026024, + "grad_norm": 1.6031601811839713, + "learning_rate": 1.0004452632802158e-05, + "loss": 0.41717058420181274, + "step": 602, + "token_acc": 0.8684555928248505 + }, + { + "epoch": 1.53062519834973, + "grad_norm": 1.2064594649724982, + "learning_rate": 9.90488974186306e-06, + "loss": 0.4804377555847168, + "step": 603, + "token_acc": 0.8492275698158052 + }, + { + "epoch": 1.5331640748968582, + "grad_norm": 1.2672495489324482, + "learning_rate": 9.805702216149251e-06, + "loss": 0.5097688436508179, + "step": 604, + "token_acc": 0.8502415458937198 + }, + { + "epoch": 1.535702951443986, + "grad_norm": 4.053034491495449, + "learning_rate": 9.706892522124839e-06, + "loss": 0.47695496678352356, + "step": 605, + "token_acc": 0.8586020720852181 + }, + { + "epoch": 1.538241827991114, + "grad_norm": 4.465741013251589, + "learning_rate": 9.608463116858542e-06, + "loss": 0.4402783513069153, + "step": 606, + "token_acc": 0.8638701382192221 + }, + { + "epoch": 1.5407807045382418, + "grad_norm": 2.100444839862141, + "learning_rate": 9.510416447962544e-06, + "loss": 0.44809940457344055, + "step": 607, + "token_acc": 0.8649390767118585 + }, + { + "epoch": 1.5433195810853697, + "grad_norm": 1.5950345297195268, + "learning_rate": 9.412754953531663e-06, + "loss": 0.402049720287323, + "step": 608, + "token_acc": 0.8729817007534983 + }, + { + "epoch": 1.5458584576324976, + "grad_norm": 1.9379983192487504, + "learning_rate": 9.315481062082687e-06, + "loss": 0.45930030941963196, + "step": 609, + "token_acc": 0.8534591194968554 + }, + { + "epoch": 1.5483973341796256, + "grad_norm": 1.6436723545662089, + "learning_rate": 9.21859719249403e-06, + "loss": 0.4582301676273346, + "step": 610, + "token_acc": 0.8593083846518238 + }, + { + "epoch": 1.5509362107267535, + "grad_norm": 1.5694932995169957, + "learning_rate": 9.122105753945531e-06, + "loss": 0.42741185426712036, + "step": 611, + "token_acc": 0.8661592134475103 + }, + { + "epoch": 1.5534750872738812, + "grad_norm": 1.2677907142399418, + "learning_rate": 9.026009145858607e-06, + "loss": 0.3978237509727478, + "step": 612, + "token_acc": 0.8717145343777197 + }, + { + "epoch": 1.5560139638210093, + "grad_norm": 1.7909513896650815, + "learning_rate": 8.930309757836517e-06, + "loss": 0.3929862380027771, + "step": 613, + "token_acc": 0.8780487804878049 + }, + { + "epoch": 1.558552840368137, + "grad_norm": 2.1671678126879192, + "learning_rate": 8.835009969605012e-06, + "loss": 0.4144135117530823, + "step": 614, + "token_acc": 0.8640829694323144 + }, + { + "epoch": 1.5610917169152652, + "grad_norm": 4.708681225228973, + "learning_rate": 8.740112150953095e-06, + "loss": 0.44686853885650635, + "step": 615, + "token_acc": 0.8602134375469713 + }, + { + "epoch": 1.5636305934623929, + "grad_norm": 2.694424425912483, + "learning_rate": 8.645618661674142e-06, + "loss": 0.4374513030052185, + "step": 616, + "token_acc": 0.8667699457784663 + }, + { + "epoch": 1.5661694700095208, + "grad_norm": 8.526048424431572, + "learning_rate": 8.551531851507186e-06, + "loss": 0.4310656189918518, + "step": 617, + "token_acc": 0.8675113405287033 + }, + { + "epoch": 1.5687083465566487, + "grad_norm": 1.3330352300976973, + "learning_rate": 8.45785406007852e-06, + "loss": 0.5003854036331177, + "step": 618, + "token_acc": 0.847457627118644 + }, + { + "epoch": 1.5712472231037766, + "grad_norm": 4.976416729285302, + "learning_rate": 8.364587616843477e-06, + "loss": 0.4497206211090088, + "step": 619, + "token_acc": 0.8669887278582931 + }, + { + "epoch": 1.5737860996509045, + "grad_norm": 1.328053676437707, + "learning_rate": 8.271734841028553e-06, + "loss": 0.4438425302505493, + "step": 620, + "token_acc": 0.8648385526529287 + }, + { + "epoch": 1.5763249761980322, + "grad_norm": 18.013475899545398, + "learning_rate": 8.17929804157367e-06, + "loss": 0.42214319109916687, + "step": 621, + "token_acc": 0.8670833333333333 + }, + { + "epoch": 1.5788638527451604, + "grad_norm": 1.3143009672659078, + "learning_rate": 8.08727951707487e-06, + "loss": 0.41414207220077515, + "step": 622, + "token_acc": 0.868986529826812 + }, + { + "epoch": 1.581402729292288, + "grad_norm": 2.7221474239289822, + "learning_rate": 7.99568155572701e-06, + "loss": 0.42111027240753174, + "step": 623, + "token_acc": 0.8662572500852951 + }, + { + "epoch": 1.583941605839416, + "grad_norm": 1.5392077956981898, + "learning_rate": 7.904506435266998e-06, + "loss": 0.43198782205581665, + "step": 624, + "token_acc": 0.8656245065529765 + }, + { + "epoch": 1.586480482386544, + "grad_norm": 1.449572952125542, + "learning_rate": 7.813756422917046e-06, + "loss": 0.3983515501022339, + "step": 625, + "token_acc": 0.8759147828915271 + }, + { + "epoch": 1.5890193589336719, + "grad_norm": 2.557129100686671, + "learning_rate": 7.723433775328384e-06, + "loss": 0.4601841866970062, + "step": 626, + "token_acc": 0.8575240919199407 + }, + { + "epoch": 1.5915582354807998, + "grad_norm": 1.410335769896056, + "learning_rate": 7.633540738525066e-06, + "loss": 0.46355000138282776, + "step": 627, + "token_acc": 0.8606245239908606 + }, + { + "epoch": 1.5940971120279275, + "grad_norm": 2.3461604442237443, + "learning_rate": 7.5440795478481815e-06, + "loss": 0.35412007570266724, + "step": 628, + "token_acc": 0.8864518306057028 + }, + { + "epoch": 1.5966359885750556, + "grad_norm": 1.7143044424108447, + "learning_rate": 7.455052427900213e-06, + "loss": 0.4599078595638275, + "step": 629, + "token_acc": 0.858727378867484 + }, + { + "epoch": 1.5991748651221833, + "grad_norm": 2.6729291996865556, + "learning_rate": 7.366461592489782e-06, + "loss": 0.4420662522315979, + "step": 630, + "token_acc": 0.8678435114503816 + }, + { + "epoch": 1.6017137416693115, + "grad_norm": 1.7421105240693378, + "learning_rate": 7.278309244576526e-06, + "loss": 0.4172115623950958, + "step": 631, + "token_acc": 0.8718300205620287 + }, + { + "epoch": 1.6042526182164392, + "grad_norm": 5.808548468818688, + "learning_rate": 7.190597576216385e-06, + "loss": 0.4470146894454956, + "step": 632, + "token_acc": 0.8587673038892552 + }, + { + "epoch": 1.606791494763567, + "grad_norm": 1.501385308932159, + "learning_rate": 7.103328768507039e-06, + "loss": 0.39006733894348145, + "step": 633, + "token_acc": 0.8735427461139896 + }, + { + "epoch": 1.609330371310695, + "grad_norm": 2.5341252686226583, + "learning_rate": 7.016504991533726e-06, + "loss": 0.42773884534835815, + "step": 634, + "token_acc": 0.8643475366178429 + }, + { + "epoch": 1.611869247857823, + "grad_norm": 9.109577297686016, + "learning_rate": 6.930128404315214e-06, + "loss": 0.4322446882724762, + "step": 635, + "token_acc": 0.866756167142138 + }, + { + "epoch": 1.6144081244049509, + "grad_norm": 2.8982200371462725, + "learning_rate": 6.844201154750177e-06, + "loss": 0.4075253903865814, + "step": 636, + "token_acc": 0.8719616039634618 + }, + { + "epoch": 1.6169470009520786, + "grad_norm": 2.4476071961529473, + "learning_rate": 6.758725379563729e-06, + "loss": 0.42523565888404846, + "step": 637, + "token_acc": 0.8710596914822267 + }, + { + "epoch": 1.6194858774992067, + "grad_norm": 3.952901868685563, + "learning_rate": 6.673703204254347e-06, + "loss": 0.4927784204483032, + "step": 638, + "token_acc": 0.8524006268699245 + }, + { + "epoch": 1.6220247540463344, + "grad_norm": 1.9925103239226836, + "learning_rate": 6.589136743040955e-06, + "loss": 0.45517563819885254, + "step": 639, + "token_acc": 0.8612017400761284 + }, + { + "epoch": 1.6245636305934625, + "grad_norm": 5.231140628017069, + "learning_rate": 6.505028098810406e-06, + "loss": 0.43744373321533203, + "step": 640, + "token_acc": 0.8593057042361217 + }, + { + "epoch": 1.6271025071405902, + "grad_norm": 1.3524404530982062, + "learning_rate": 6.421379363065142e-06, + "loss": 0.48253944516181946, + "step": 641, + "token_acc": 0.8524788391777509 + }, + { + "epoch": 1.6296413836877182, + "grad_norm": 2.0130605650206963, + "learning_rate": 6.338192615871247e-06, + "loss": 0.4024979770183563, + "step": 642, + "token_acc": 0.8751388227828019 + }, + { + "epoch": 1.632180260234846, + "grad_norm": 3.8621192074051556, + "learning_rate": 6.255469925806643e-06, + "loss": 0.3890977203845978, + "step": 643, + "token_acc": 0.8722797003210846 + }, + { + "epoch": 1.634719136781974, + "grad_norm": 1.6599106938742667, + "learning_rate": 6.173213349909729e-06, + "loss": 0.40084201097488403, + "step": 644, + "token_acc": 0.8785992217898833 + }, + { + "epoch": 1.637258013329102, + "grad_norm": 1.2846213190178855, + "learning_rate": 6.091424933628159e-06, + "loss": 0.4719259738922119, + "step": 645, + "token_acc": 0.8553555080866646 + }, + { + "epoch": 1.6397968898762296, + "grad_norm": 1.7252300824422093, + "learning_rate": 6.010106710768052e-06, + "loss": 0.43028050661087036, + "step": 646, + "token_acc": 0.8588945481984531 + }, + { + "epoch": 1.6423357664233578, + "grad_norm": 1.7252627976692818, + "learning_rate": 5.9292607034433375e-06, + "loss": 0.4257124662399292, + "step": 647, + "token_acc": 0.8627259404005863 + }, + { + "epoch": 1.6448746429704855, + "grad_norm": 2.6645530077871546, + "learning_rate": 5.848888922025553e-06, + "loss": 0.4690347909927368, + "step": 648, + "token_acc": 0.8566015738851647 + }, + { + "epoch": 1.6474135195176136, + "grad_norm": 3.2780898962364864, + "learning_rate": 5.768993365093783e-06, + "loss": 0.4059619903564453, + "step": 649, + "token_acc": 0.8718351942129265 + }, + { + "epoch": 1.6499523960647413, + "grad_norm": 2.8838630249451653, + "learning_rate": 5.689576019385015e-06, + "loss": 0.44327762722969055, + "step": 650, + "token_acc": 0.8564371719666564 + }, + { + "epoch": 1.6524912726118692, + "grad_norm": 25.182915532896892, + "learning_rate": 5.610638859744693e-06, + "loss": 0.4271925687789917, + "step": 651, + "token_acc": 0.8661558526247147 + }, + { + "epoch": 1.6550301491589972, + "grad_norm": 1.5779086626122172, + "learning_rate": 5.532183849077652e-06, + "loss": 0.46068426966667175, + "step": 652, + "token_acc": 0.8604612018178758 + }, + { + "epoch": 1.657569025706125, + "grad_norm": 1.693357004070117, + "learning_rate": 5.454212938299255e-06, + "loss": 0.451456218957901, + "step": 653, + "token_acc": 0.8634725142685491 + }, + { + "epoch": 1.660107902253253, + "grad_norm": 8.514820092384175, + "learning_rate": 5.376728066286943e-06, + "loss": 0.43730106949806213, + "step": 654, + "token_acc": 0.8636299335125195 + }, + { + "epoch": 1.6626467788003807, + "grad_norm": 1.111931988912096, + "learning_rate": 5.299731159831953e-06, + "loss": 0.41232720017433167, + "step": 655, + "token_acc": 0.8704655812624964 + }, + { + "epoch": 1.6651856553475088, + "grad_norm": 2.634292237533276, + "learning_rate": 5.223224133591476e-06, + "loss": 0.46359729766845703, + "step": 656, + "token_acc": 0.8527910932426164 + }, + { + "epoch": 1.6677245318946365, + "grad_norm": 5.059923947440153, + "learning_rate": 5.147208890040975e-06, + "loss": 0.4276030361652374, + "step": 657, + "token_acc": 0.8669181034482759 + }, + { + "epoch": 1.6702634084417647, + "grad_norm": 1.6527985205614077, + "learning_rate": 5.071687319426946e-06, + "loss": 0.4615190625190735, + "step": 658, + "token_acc": 0.8562792806407737 + }, + { + "epoch": 1.6728022849888924, + "grad_norm": 4.504539765572017, + "learning_rate": 4.996661299719846e-06, + "loss": 0.43903154134750366, + "step": 659, + "token_acc": 0.8628378378378379 + }, + { + "epoch": 1.6753411615360203, + "grad_norm": 1.7117325712294194, + "learning_rate": 4.922132696567464e-06, + "loss": 0.48397350311279297, + "step": 660, + "token_acc": 0.8517076845806127 + }, + { + "epoch": 1.6778800380831482, + "grad_norm": 2.4283538134736293, + "learning_rate": 4.8481033632484464e-06, + "loss": 0.4164693355560303, + "step": 661, + "token_acc": 0.8711068519405846 + }, + { + "epoch": 1.6804189146302762, + "grad_norm": 1.2528673067956313, + "learning_rate": 4.7745751406263165e-06, + "loss": 0.4900897741317749, + "step": 662, + "token_acc": 0.8495370370370371 + }, + { + "epoch": 1.682957791177404, + "grad_norm": 1.5210322880049643, + "learning_rate": 4.701549857103588e-06, + "loss": 0.4142399728298187, + "step": 663, + "token_acc": 0.8718934911242604 + }, + { + "epoch": 1.6854966677245318, + "grad_norm": 1.3712029731634767, + "learning_rate": 4.629029328576381e-06, + "loss": 0.4212270677089691, + "step": 664, + "token_acc": 0.8674501636417733 + }, + { + "epoch": 1.68803554427166, + "grad_norm": 1.590593266989074, + "learning_rate": 4.5570153583892165e-06, + "loss": 0.39592063426971436, + "step": 665, + "token_acc": 0.8769955906948457 + }, + { + "epoch": 1.6905744208187876, + "grad_norm": 1.8309798554500323, + "learning_rate": 4.4855097372902135e-06, + "loss": 0.4617067575454712, + "step": 666, + "token_acc": 0.8591635916359164 + }, + { + "epoch": 1.6931132973659155, + "grad_norm": 1.0905142063588467, + "learning_rate": 4.41451424338652e-06, + "loss": 0.44668224453926086, + "step": 667, + "token_acc": 0.8633254015466983 + }, + { + "epoch": 1.6956521739130435, + "grad_norm": 2.896217519377637, + "learning_rate": 4.344030642100133e-06, + "loss": 0.4766824245452881, + "step": 668, + "token_acc": 0.8560614882962618 + }, + { + "epoch": 1.6981910504601714, + "grad_norm": 1.5035325936138646, + "learning_rate": 4.274060686123959e-06, + "loss": 0.44002464413642883, + "step": 669, + "token_acc": 0.8666061705989111 + }, + { + "epoch": 1.7007299270072993, + "grad_norm": 1.1311132458603954, + "learning_rate": 4.204606115378282e-06, + "loss": 0.4330123960971832, + "step": 670, + "token_acc": 0.8573323685479981 + }, + { + "epoch": 1.703268803554427, + "grad_norm": 2.001085120015709, + "learning_rate": 4.135668656967434e-06, + "loss": 0.4757775366306305, + "step": 671, + "token_acc": 0.8538387847269742 + }, + { + "epoch": 1.7058076801015551, + "grad_norm": 3.131879855652598, + "learning_rate": 4.067250025136921e-06, + "loss": 0.4560514986515045, + "step": 672, + "token_acc": 0.8587115666178624 + }, + { + "epoch": 1.7083465566486828, + "grad_norm": 3.243793366725845, + "learning_rate": 3.9993519212307154e-06, + "loss": 0.48498058319091797, + "step": 673, + "token_acc": 0.8464744703021883 + }, + { + "epoch": 1.710885433195811, + "grad_norm": 1.8349332605705886, + "learning_rate": 3.931976033649021e-06, + "loss": 0.4820587933063507, + "step": 674, + "token_acc": 0.8574167922202438 + }, + { + "epoch": 1.7134243097429387, + "grad_norm": 1.351981900157725, + "learning_rate": 3.86512403780625e-06, + "loss": 0.40726059675216675, + "step": 675, + "token_acc": 0.8761935588282894 + }, + { + "epoch": 1.7159631862900666, + "grad_norm": 2.3240652003253173, + "learning_rate": 3.798797596089351e-06, + "loss": 0.4622320532798767, + "step": 676, + "token_acc": 0.8597043095312992 + }, + { + "epoch": 1.7185020628371945, + "grad_norm": 3.134466385053714, + "learning_rate": 3.732998357816514e-06, + "loss": 0.433416485786438, + "step": 677, + "token_acc": 0.8626889419252187 + }, + { + "epoch": 1.7210409393843225, + "grad_norm": 3.126205495024486, + "learning_rate": 3.66772795919611e-06, + "loss": 0.40910568833351135, + "step": 678, + "token_acc": 0.8706845238095238 + }, + { + "epoch": 1.7235798159314504, + "grad_norm": 2.662738301930067, + "learning_rate": 3.6029880232860413e-06, + "loss": 0.48174020648002625, + "step": 679, + "token_acc": 0.851764705882353 + }, + { + "epoch": 1.726118692478578, + "grad_norm": 1.6393237243792689, + "learning_rate": 3.5387801599533475e-06, + "loss": 0.39522039890289307, + "step": 680, + "token_acc": 0.8741348784806052 + }, + { + "epoch": 1.7286575690257062, + "grad_norm": 2.70788924806579, + "learning_rate": 3.4751059658342105e-06, + "loss": 0.47784876823425293, + "step": 681, + "token_acc": 0.8528927885933644 + }, + { + "epoch": 1.731196445572834, + "grad_norm": 2.820200992606637, + "learning_rate": 3.41196702429423e-06, + "loss": 0.3826233744621277, + "step": 682, + "token_acc": 0.8822283759569962 + }, + { + "epoch": 1.733735322119962, + "grad_norm": 1.307789139772657, + "learning_rate": 3.3493649053890326e-06, + "loss": 0.44565722346305847, + "step": 683, + "token_acc": 0.8606760098928277 + }, + { + "epoch": 1.7362741986670898, + "grad_norm": 1.982089557516867, + "learning_rate": 3.2873011658252796e-06, + "loss": 0.45349833369255066, + "step": 684, + "token_acc": 0.8590145257761321 + }, + { + "epoch": 1.7388130752142177, + "grad_norm": 1.2355749205318602, + "learning_rate": 3.225777348921899e-06, + "loss": 0.4516002833843231, + "step": 685, + "token_acc": 0.8644168146832445 + }, + { + "epoch": 1.7413519517613456, + "grad_norm": 1.794396532306371, + "learning_rate": 3.164794984571759e-06, + "loss": 0.4385417103767395, + "step": 686, + "token_acc": 0.863161039737078 + }, + { + "epoch": 1.7438908283084735, + "grad_norm": 1.3932099565380185, + "learning_rate": 3.1043555892035865e-06, + "loss": 0.47738581895828247, + "step": 687, + "token_acc": 0.8537170263788969 + }, + { + "epoch": 1.7464297048556015, + "grad_norm": 2.276337589217584, + "learning_rate": 3.044460665744284e-06, + "loss": 0.4527597725391388, + "step": 688, + "token_acc": 0.859869325997249 + }, + { + "epoch": 1.7489685814027291, + "grad_norm": 1.5410789525322917, + "learning_rate": 2.98511170358155e-06, + "loss": 0.362637996673584, + "step": 689, + "token_acc": 0.8799796575690795 + }, + { + "epoch": 1.7515074579498573, + "grad_norm": 1.5215647982798974, + "learning_rate": 2.9263101785268254e-06, + "loss": 0.4314054846763611, + "step": 690, + "token_acc": 0.8690420378184092 + }, + { + "epoch": 1.754046334496985, + "grad_norm": 1.774390329095064, + "learning_rate": 2.8680575527786247e-06, + "loss": 0.4486577808856964, + "step": 691, + "token_acc": 0.8656532456861133 + }, + { + "epoch": 1.7565852110441131, + "grad_norm": 1.3388386880862562, + "learning_rate": 2.8103552748861476e-06, + "loss": 0.41996461153030396, + "step": 692, + "token_acc": 0.8718206638884898 + }, + { + "epoch": 1.7591240875912408, + "grad_norm": 1.3389406554357517, + "learning_rate": 2.7532047797132867e-06, + "loss": 0.4188646376132965, + "step": 693, + "token_acc": 0.8667355371900827 + }, + { + "epoch": 1.7616629641383688, + "grad_norm": 1.156002235003077, + "learning_rate": 2.6966074884029164e-06, + "loss": 0.4410921335220337, + "step": 694, + "token_acc": 0.865283540802213 + }, + { + "epoch": 1.7642018406854967, + "grad_norm": 2.061855392222814, + "learning_rate": 2.6405648083415834e-06, + "loss": 0.4875490963459015, + "step": 695, + "token_acc": 0.8523312456506611 + }, + { + "epoch": 1.7667407172326246, + "grad_norm": 1.2947706686947225, + "learning_rate": 2.58507813312448e-06, + "loss": 0.4236608147621155, + "step": 696, + "token_acc": 0.8694029850746269 + }, + { + "epoch": 1.7692795937797525, + "grad_norm": 2.4268079188473766, + "learning_rate": 2.5301488425208296e-06, + "loss": 0.4632965922355652, + "step": 697, + "token_acc": 0.8577529082609335 + }, + { + "epoch": 1.7718184703268802, + "grad_norm": 15.351053657190288, + "learning_rate": 2.475778302439524e-06, + "loss": 0.4632093608379364, + "step": 698, + "token_acc": 0.857186127517795 + }, + { + "epoch": 1.7743573468740084, + "grad_norm": 1.233450519862793, + "learning_rate": 2.421967864895211e-06, + "loss": 0.4644908905029297, + "step": 699, + "token_acc": 0.8622404211757824 + }, + { + "epoch": 1.776896223421136, + "grad_norm": 1.1609373101377098, + "learning_rate": 2.3687188679746315e-06, + "loss": 0.5130558609962463, + "step": 700, + "token_acc": 0.8425488443366109 + }, + { + "epoch": 1.779435099968264, + "grad_norm": 1.5822630142900636, + "learning_rate": 2.316032635803378e-06, + "loss": 0.4497196078300476, + "step": 701, + "token_acc": 0.8579769878069724 + }, + { + "epoch": 1.781973976515392, + "grad_norm": 1.570413179886022, + "learning_rate": 2.2639104785129455e-06, + "loss": 0.4693135619163513, + "step": 702, + "token_acc": 0.8559370529327611 + }, + { + "epoch": 1.7845128530625198, + "grad_norm": 3.061251657790942, + "learning_rate": 2.212353692208172e-06, + "loss": 0.4473997950553894, + "step": 703, + "token_acc": 0.8591812468150162 + }, + { + "epoch": 1.7870517296096478, + "grad_norm": 2.948308520618527, + "learning_rate": 2.1613635589349756e-06, + "loss": 0.4503086805343628, + "step": 704, + "token_acc": 0.8623773802654356 + }, + { + "epoch": 1.7895906061567757, + "grad_norm": 1.913650702279099, + "learning_rate": 2.1109413466485234e-06, + "loss": 0.4229254126548767, + "step": 705, + "token_acc": 0.8654380576276145 + }, + { + "epoch": 1.7921294827039036, + "grad_norm": 1.577758527103726, + "learning_rate": 2.0610883091816525e-06, + "loss": 0.41494959592819214, + "step": 706, + "token_acc": 0.8632981484685932 + }, + { + "epoch": 1.7946683592510313, + "grad_norm": 28.453997574496324, + "learning_rate": 2.0118056862137357e-06, + "loss": 0.39806830883026123, + "step": 707, + "token_acc": 0.8761904761904762 + }, + { + "epoch": 1.7972072357981594, + "grad_norm": 1.442011622440876, + "learning_rate": 1.9630947032398067e-06, + "loss": 0.47827813029289246, + "step": 708, + "token_acc": 0.8559821570814083 + }, + { + "epoch": 1.7997461123452871, + "grad_norm": 1.3684845981941494, + "learning_rate": 1.9149565715401415e-06, + "loss": 0.41705846786499023, + "step": 709, + "token_acc": 0.8656061437191442 + }, + { + "epoch": 1.802284988892415, + "grad_norm": 1.40488381846196, + "learning_rate": 1.8673924881500826e-06, + "loss": 0.4175983667373657, + "step": 710, + "token_acc": 0.8665089557282866 + }, + { + "epoch": 1.804823865439543, + "grad_norm": 1.6524874244872123, + "learning_rate": 1.8204036358303173e-06, + "loss": 0.37564218044281006, + "step": 711, + "token_acc": 0.8825536062378168 + }, + { + "epoch": 1.807362741986671, + "grad_norm": 1.4366556315978845, + "learning_rate": 1.773991183037435e-06, + "loss": 0.41721421480178833, + "step": 712, + "token_acc": 0.8702656868287167 + }, + { + "epoch": 1.8099016185337988, + "grad_norm": 1.658222363219091, + "learning_rate": 1.7281562838948966e-06, + "loss": 0.39479967951774597, + "step": 713, + "token_acc": 0.8711364717070851 + }, + { + "epoch": 1.8124404950809265, + "grad_norm": 2.089415658710758, + "learning_rate": 1.6829000781643094e-06, + "loss": 0.4703880250453949, + "step": 714, + "token_acc": 0.8586910626319494 + }, + { + "epoch": 1.8149793716280547, + "grad_norm": 2.2836604994483953, + "learning_rate": 1.638223691217114e-06, + "loss": 0.502145528793335, + "step": 715, + "token_acc": 0.8485543827443781 + }, + { + "epoch": 1.8175182481751824, + "grad_norm": 1.8788922029695805, + "learning_rate": 1.59412823400657e-06, + "loss": 0.43437492847442627, + "step": 716, + "token_acc": 0.8597447073474471 + }, + { + "epoch": 1.8200571247223105, + "grad_norm": 1.9928854925573405, + "learning_rate": 1.5506148030401596e-06, + "loss": 0.503593385219574, + "step": 717, + "token_acc": 0.8448118932038835 + }, + { + "epoch": 1.8225960012694382, + "grad_norm": 1.8750971097385831, + "learning_rate": 1.5076844803522922e-06, + "loss": 0.43502116203308105, + "step": 718, + "token_acc": 0.8666423756604117 + }, + { + "epoch": 1.8251348778165661, + "grad_norm": 1.4504406407026815, + "learning_rate": 1.465338333477423e-06, + "loss": 0.4320788085460663, + "step": 719, + "token_acc": 0.8646112600536193 + }, + { + "epoch": 1.827673754363694, + "grad_norm": 1.90977553356785, + "learning_rate": 1.4235774154234855e-06, + "loss": 0.40384840965270996, + "step": 720, + "token_acc": 0.8733692569483834 + }, + { + "epoch": 1.830212630910822, + "grad_norm": 6.19991714045044, + "learning_rate": 1.3824027646457376e-06, + "loss": 0.3967495858669281, + "step": 721, + "token_acc": 0.8748278500382556 + }, + { + "epoch": 1.83275150745795, + "grad_norm": 2.002447851723243, + "learning_rate": 1.3418154050208936e-06, + "loss": 0.4520436227321625, + "step": 722, + "token_acc": 0.8591839740757107 + }, + { + "epoch": 1.8352903840050776, + "grad_norm": 6.098683471560786, + "learning_rate": 1.3018163458217076e-06, + "loss": 0.45737043023109436, + "step": 723, + "token_acc": 0.8586900464156781 + }, + { + "epoch": 1.8378292605522057, + "grad_norm": 1.2867812390877849, + "learning_rate": 1.2624065816918413e-06, + "loss": 0.4802631735801697, + "step": 724, + "token_acc": 0.8534614848864744 + }, + { + "epoch": 1.8403681370993334, + "grad_norm": 3.1957168567594025, + "learning_rate": 1.2235870926211619e-06, + "loss": 0.47273802757263184, + "step": 725, + "token_acc": 0.8561225814829243 + }, + { + "epoch": 1.8429070136464616, + "grad_norm": 3.280293947027647, + "learning_rate": 1.1853588439213442e-06, + "loss": 0.48560330271720886, + "step": 726, + "token_acc": 0.8526057456330302 + }, + { + "epoch": 1.8454458901935893, + "grad_norm": 2.2792470189790377, + "learning_rate": 1.1477227862018936e-06, + "loss": 0.45862627029418945, + "step": 727, + "token_acc": 0.8571593533487298 + }, + { + "epoch": 1.8479847667407172, + "grad_norm": 1.5587404762398274, + "learning_rate": 1.1106798553464804e-06, + "loss": 0.42885905504226685, + "step": 728, + "token_acc": 0.8708909004287756 + }, + { + "epoch": 1.8505236432878451, + "grad_norm": 3.06823799070072, + "learning_rate": 1.0742309724896925e-06, + "loss": 0.4785131812095642, + "step": 729, + "token_acc": 0.8561222794484133 + }, + { + "epoch": 1.853062519834973, + "grad_norm": 1.8989534799725791, + "learning_rate": 1.038377043994107e-06, + "loss": 0.3938445448875427, + "step": 730, + "token_acc": 0.879425346331452 + }, + { + "epoch": 1.855601396382101, + "grad_norm": 1.2724853752055847, + "learning_rate": 1.0031189614277765e-06, + "loss": 0.40233713388442993, + "step": 731, + "token_acc": 0.8721188321666382 + }, + { + "epoch": 1.8581402729292287, + "grad_norm": 1.2336935005972807, + "learning_rate": 9.684576015420278e-07, + "loss": 0.40896981954574585, + "step": 732, + "token_acc": 0.8702893674293405 + }, + { + "epoch": 1.8606791494763568, + "grad_norm": 2.4052171825994617, + "learning_rate": 9.343938262496993e-07, + "loss": 0.4635767340660095, + "step": 733, + "token_acc": 0.8580862723057469 + }, + { + "epoch": 1.8632180260234845, + "grad_norm": 1.4002855058918304, + "learning_rate": 9.009284826036691e-07, + "loss": 0.45178261399269104, + "step": 734, + "token_acc": 0.8653539887071088 + }, + { + "epoch": 1.8657569025706127, + "grad_norm": 1.9242594727542799, + "learning_rate": 8.680624027758183e-07, + "loss": 0.3883354067802429, + "step": 735, + "token_acc": 0.8772727272727273 + }, + { + "epoch": 1.8682957791177404, + "grad_norm": 1.3147653580408487, + "learning_rate": 8.357964040363209e-07, + "loss": 0.49033722281455994, + "step": 736, + "token_acc": 0.8530385277373229 + }, + { + "epoch": 1.8708346556648683, + "grad_norm": 2.0201488165176626, + "learning_rate": 8.041312887333397e-07, + "loss": 0.39452701807022095, + "step": 737, + "token_acc": 0.8727473917167247 + }, + { + "epoch": 1.8733735322119962, + "grad_norm": 1.3190322958534526, + "learning_rate": 7.730678442730538e-07, + "loss": 0.4112352132797241, + "step": 738, + "token_acc": 0.872272330520803 + }, + { + "epoch": 1.8759124087591241, + "grad_norm": 1.479059054445775, + "learning_rate": 7.426068431000882e-07, + "loss": 0.47771161794662476, + "step": 739, + "token_acc": 0.8543046357615894 + }, + { + "epoch": 1.878451285306252, + "grad_norm": 3.4561592643709336, + "learning_rate": 7.127490426783123e-07, + "loss": 0.4562588930130005, + "step": 740, + "token_acc": 0.858059232973932 + }, + { + "epoch": 1.8809901618533797, + "grad_norm": 8.34125855841703, + "learning_rate": 6.834951854719967e-07, + "loss": 0.36923718452453613, + "step": 741, + "token_acc": 0.8817420435510888 + }, + { + "epoch": 1.883529038400508, + "grad_norm": 1.9715995397748214, + "learning_rate": 6.54845998927342e-07, + "loss": 0.5273791551589966, + "step": 742, + "token_acc": 0.8440740254626592 + }, + { + "epoch": 1.8860679149476356, + "grad_norm": 1.5441467522187071, + "learning_rate": 6.268021954544096e-07, + "loss": 0.384202778339386, + "step": 743, + "token_acc": 0.8818364733857692 + }, + { + "epoch": 1.8886067914947635, + "grad_norm": 2.505114100587592, + "learning_rate": 5.993644724093888e-07, + "loss": 0.3963943123817444, + "step": 744, + "token_acc": 0.876434522873762 + }, + { + "epoch": 1.8911456680418914, + "grad_norm": 1.2437997984902442, + "learning_rate": 5.725335120772696e-07, + "loss": 0.4003443121910095, + "step": 745, + "token_acc": 0.8710174717368961 + }, + { + "epoch": 1.8936845445890194, + "grad_norm": 1.331827463412106, + "learning_rate": 5.463099816548579e-07, + "loss": 0.4340510666370392, + "step": 746, + "token_acc": 0.8663381582999692 + }, + { + "epoch": 1.8962234211361473, + "grad_norm": 1.4190786443096997, + "learning_rate": 5.206945332342145e-07, + "loss": 0.3998247981071472, + "step": 747, + "token_acc": 0.8734725444702243 + }, + { + "epoch": 1.8987622976832752, + "grad_norm": 2.094766604152409, + "learning_rate": 4.956878037864043e-07, + "loss": 0.4874383211135864, + "step": 748, + "token_acc": 0.8549134734239803 + }, + { + "epoch": 1.9013011742304031, + "grad_norm": 1.5313508891126637, + "learning_rate": 4.712904151456865e-07, + "loss": 0.4122732877731323, + "step": 749, + "token_acc": 0.8685121107266436 + }, + { + "epoch": 1.9038400507775308, + "grad_norm": 1.5749655783074934, + "learning_rate": 4.475029739940295e-07, + "loss": 0.4453129172325134, + "step": 750, + "token_acc": 0.8643138598595169 + }, + { + "epoch": 1.906378927324659, + "grad_norm": 2.959955749655575, + "learning_rate": 4.2432607184604565e-07, + "loss": 0.40033698081970215, + "step": 751, + "token_acc": 0.8760588497547926 + }, + { + "epoch": 1.9089178038717867, + "grad_norm": 3.4980328358387327, + "learning_rate": 4.0176028503425835e-07, + "loss": 0.4652397632598877, + "step": 752, + "token_acc": 0.8624653739612188 + }, + { + "epoch": 1.9114566804189146, + "grad_norm": 1.6458184889356613, + "learning_rate": 3.7980617469479953e-07, + "loss": 0.48083657026290894, + "step": 753, + "token_acc": 0.8546286031042128 + }, + { + "epoch": 1.9139955569660425, + "grad_norm": 1.738583203352863, + "learning_rate": 3.5846428675342657e-07, + "loss": 0.4572162330150604, + "step": 754, + "token_acc": 0.8617322388904614 + }, + { + "epoch": 1.9165344335131704, + "grad_norm": 1.7105542002101852, + "learning_rate": 3.377351519119665e-07, + "loss": 0.3839995265007019, + "step": 755, + "token_acc": 0.8739065852450899 + }, + { + "epoch": 1.9190733100602984, + "grad_norm": 1.4566722190683363, + "learning_rate": 3.1761928563510955e-07, + "loss": 0.520811915397644, + "step": 756, + "token_acc": 0.8475528611562916 + }, + { + "epoch": 1.921612186607426, + "grad_norm": 4.930881181951258, + "learning_rate": 2.981171881376005e-07, + "loss": 0.42392557859420776, + "step": 757, + "token_acc": 0.867098133654425 + }, + { + "epoch": 1.9241510631545542, + "grad_norm": 2.5750669305229668, + "learning_rate": 2.7922934437178695e-07, + "loss": 0.39813119173049927, + "step": 758, + "token_acc": 0.8691693290734824 + }, + { + "epoch": 1.926689939701682, + "grad_norm": 1.6090625449278606, + "learning_rate": 2.609562240155766e-07, + "loss": 0.4481539726257324, + "step": 759, + "token_acc": 0.8580213420148309 + }, + { + "epoch": 1.92922881624881, + "grad_norm": 3.2842110887604528, + "learning_rate": 2.4329828146074095e-07, + "loss": 0.4191648066043854, + "step": 760, + "token_acc": 0.8669804741980475 + }, + { + "epoch": 1.9317676927959377, + "grad_norm": 1.534636834190371, + "learning_rate": 2.262559558016325e-07, + "loss": 0.444943904876709, + "step": 761, + "token_acc": 0.8616028323141294 + }, + { + "epoch": 1.9343065693430657, + "grad_norm": 2.572406040218721, + "learning_rate": 2.0982967082424365e-07, + "loss": 0.4380544424057007, + "step": 762, + "token_acc": 0.8634925418110592 + }, + { + "epoch": 1.9368454458901936, + "grad_norm": 1.6314111923994719, + "learning_rate": 1.9401983499569842e-07, + "loss": 0.4693622887134552, + "step": 763, + "token_acc": 0.8523522908733571 + }, + { + "epoch": 1.9393843224373215, + "grad_norm": 1.3140820178419717, + "learning_rate": 1.7882684145406614e-07, + "loss": 0.4468652606010437, + "step": 764, + "token_acc": 0.8632042981126877 + }, + { + "epoch": 1.9419231989844494, + "grad_norm": 2.770527434708811, + "learning_rate": 1.642510679986109e-07, + "loss": 0.43155643343925476, + "step": 765, + "token_acc": 0.8636808957312806 + }, + { + "epoch": 1.9444620755315771, + "grad_norm": 4.227933234736166, + "learning_rate": 1.5029287708036854e-07, + "loss": 0.48541945219039917, + "step": 766, + "token_acc": 0.8526545454545454 + }, + { + "epoch": 1.9470009520787053, + "grad_norm": 1.764457046273328, + "learning_rate": 1.3695261579316777e-07, + "loss": 0.4071912169456482, + "step": 767, + "token_acc": 0.8712617943387174 + }, + { + "epoch": 1.949539828625833, + "grad_norm": 1.8525792515686663, + "learning_rate": 1.2423061586496477e-07, + "loss": 0.3983229994773865, + "step": 768, + "token_acc": 0.8684594200550786 + }, + { + "epoch": 1.9520787051729611, + "grad_norm": 3.0872401058271848, + "learning_rate": 1.1212719364962209e-07, + "loss": 0.40239977836608887, + "step": 769, + "token_acc": 0.8680657231169676 + }, + { + "epoch": 1.9546175817200888, + "grad_norm": 1.553786668573536, + "learning_rate": 1.006426501190233e-07, + "loss": 0.4544941186904907, + "step": 770, + "token_acc": 0.8616740088105727 + }, + { + "epoch": 1.9571564582672167, + "grad_norm": 1.6189188679364628, + "learning_rate": 8.977727085560383e-08, + "loss": 0.4375709295272827, + "step": 771, + "token_acc": 0.8633530445900591 + }, + { + "epoch": 1.9596953348143447, + "grad_norm": 1.185952954932519, + "learning_rate": 7.953132604522628e-08, + "loss": 0.5304610729217529, + "step": 772, + "token_acc": 0.8480695549661067 + }, + { + "epoch": 1.9622342113614726, + "grad_norm": 1.5057359010258355, + "learning_rate": 6.990507047049676e-08, + "loss": 0.3643919825553894, + "step": 773, + "token_acc": 0.881633870005963 + }, + { + "epoch": 1.9647730879086005, + "grad_norm": 1.4895998452895707, + "learning_rate": 6.089874350439506e-08, + "loss": 0.44290855526924133, + "step": 774, + "token_acc": 0.8621897365615958 + }, + { + "epoch": 1.9673119644557282, + "grad_norm": 2.18249507625831, + "learning_rate": 5.251256910434044e-08, + "loss": 0.48098024725914, + "step": 775, + "token_acc": 0.857872340425532 + }, + { + "epoch": 1.9698508410028563, + "grad_norm": 1.2925552471421722, + "learning_rate": 4.474675580662113e-08, + "loss": 0.4236471652984619, + "step": 776, + "token_acc": 0.8625148632580262 + }, + { + "epoch": 1.972389717549984, + "grad_norm": 3.3815823984137947, + "learning_rate": 3.760149672120683e-08, + "loss": 0.481804221868515, + "step": 777, + "token_acc": 0.8500443655723159 + }, + { + "epoch": 1.9749285940971122, + "grad_norm": 2.851125002231867, + "learning_rate": 3.107696952694139e-08, + "loss": 0.3899208903312683, + "step": 778, + "token_acc": 0.8718987341772152 + }, + { + "epoch": 1.9774674706442399, + "grad_norm": 1.8048399170508183, + "learning_rate": 2.5173336467135267e-08, + "loss": 0.45743489265441895, + "step": 779, + "token_acc": 0.856198347107438 + }, + { + "epoch": 1.9800063471913678, + "grad_norm": 4.130203256257943, + "learning_rate": 1.9890744345518742e-08, + "loss": 0.4771175980567932, + "step": 780, + "token_acc": 0.8569542253521126 + }, + { + "epoch": 1.9825452237384957, + "grad_norm": 9.563823062759168, + "learning_rate": 1.522932452260595e-08, + "loss": 0.4706335663795471, + "step": 781, + "token_acc": 0.8558704453441296 + }, + { + "epoch": 1.9850841002856237, + "grad_norm": 1.001929275901606, + "learning_rate": 1.1189192912416934e-08, + "loss": 0.3632867932319641, + "step": 782, + "token_acc": 0.8832913518052057 + }, + { + "epoch": 1.9876229768327516, + "grad_norm": 2.1169321646514394, + "learning_rate": 7.770449979593864e-09, + "loss": 0.47835835814476013, + "step": 783, + "token_acc": 0.8548891608867129 + }, + { + "epoch": 1.9901618533798793, + "grad_norm": 1.816652203024763, + "learning_rate": 4.9731807369113316e-09, + "loss": 0.3994428217411041, + "step": 784, + "token_acc": 0.8765561721913905 + }, + { + "epoch": 1.9927007299270074, + "grad_norm": 1.918559137763363, + "learning_rate": 2.797454743164174e-09, + "loss": 0.4687284231185913, + "step": 785, + "token_acc": 0.8569674647022714 + }, + { + "epoch": 1.9952396064741351, + "grad_norm": 2.3691499113905197, + "learning_rate": 1.2433261014244136e-09, + "loss": 0.43920624256134033, + "step": 786, + "token_acc": 0.8617910447761195 + }, + { + "epoch": 1.997778483021263, + "grad_norm": 1.3499799024190056, + "learning_rate": 3.108334577034411e-10, + "loss": 0.4326912462711334, + "step": 787, + "token_acc": 0.8671625929861849 + }, + { + "epoch": 2.0, + "grad_norm": 4.23464927720481, + "learning_rate": 0.0, + "loss": 0.4115853011608124, + "step": 788, + "token_acc": 0.8714167357083679 + }, + { + "epoch": 2.0, + "eval_loss": 0.3586970865726471, + "eval_runtime": 8.1551, + "eval_samples_per_second": 1.471, + "eval_steps_per_second": 0.368, + "eval_token_acc": 0.8812767613857532, + "step": 788 + }, + { + "epoch": 2.0, + "eval_loss": 0.3586970865726471, + "eval_runtime": 8.2383, + "eval_samples_per_second": 1.457, + "eval_steps_per_second": 0.364, + "eval_token_acc": 0.8812767613857532, + "step": 788 + } + ], + "logging_steps": 1, + "max_steps": 788, + "num_input_tokens_seen": 0, + "num_train_epochs": 2, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 4166480484106240.0, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/training_args.bin b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..16727af62765d5e4ce0975877aed57baf55e201e --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:127702dae975ef36e1701c2735de30b8da42177c8aab9767eeec06a55c650d06 +size 9873 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/zero_to_fp32.py b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters) diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_loss.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_loss.png new file mode 100644 index 0000000000000000000000000000000000000000..fc4ca3a925374bf69765c4ea20aeb3ac0a35e1bd Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_loss.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_runtime.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_runtime.png new file mode 100644 index 0000000000000000000000000000000000000000..e1cde3a3c3383d2567c3efadcf81f803153ee82c Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_runtime.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_samples_per_second.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_samples_per_second.png new file mode 100644 index 0000000000000000000000000000000000000000..d82d0ba346f04a5dd6d9419b5411fc526107b9b3 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_samples_per_second.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_steps_per_second.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_steps_per_second.png new file mode 100644 index 0000000000000000000000000000000000000000..b9dad89ec1d1d68c0be04af020a64f56bed0cf34 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_steps_per_second.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_token_acc.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_token_acc.png new file mode 100644 index 0000000000000000000000000000000000000000..6613500411ee74fa12d2b90991a33aca390a9c36 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/eval_token_acc.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_epoch.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_epoch.png new file mode 100644 index 0000000000000000000000000000000000000000..5dbe3acd2c87adfd54879b3decc1c85ce75d3032 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_epoch.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_grad_norm.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_grad_norm.png new file mode 100644 index 0000000000000000000000000000000000000000..76d357eb01f4344db10c81b8d2001ebc3ba50ff0 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_grad_norm.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_learning_rate.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_learning_rate.png new file mode 100644 index 0000000000000000000000000000000000000000..7ff60bd5d1c709bd829300167c3345d7d187e0fd Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_learning_rate.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_loss.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_loss.png new file mode 100644 index 0000000000000000000000000000000000000000..f67314f7d84165dad216f7326471b856d0e7307d Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_loss.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_token_acc.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_token_acc.png new file mode 100644 index 0000000000000000000000000000000000000000..b76814ca16901c65d26c797dea313abe89e7ea72 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_token_acc.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_total_flos.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_total_flos.png new file mode 100644 index 0000000000000000000000000000000000000000..f4cb835a52e6b388c1ba7fc6b551f95520323145 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_total_flos.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_loss.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_loss.png new file mode 100644 index 0000000000000000000000000000000000000000..1af83cca3f1e432890ffb5576b368a7fce905063 Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_loss.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_runtime.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_runtime.png new file mode 100644 index 0000000000000000000000000000000000000000..a8007ebc05a0f10dd91fba1e1cb5e7dcde2640ce Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_runtime.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_samples_per_second.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_samples_per_second.png new file mode 100644 index 0000000000000000000000000000000000000000..9a71743cf06b1c07225d35ba568a7973cc268a8d Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_samples_per_second.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_steps_per_second.png b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_steps_per_second.png new file mode 100644 index 0000000000000000000000000000000000000000..a4713d104ec37d7c79b1ffe5053c592d7f912d8b Binary files /dev/null and b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/images/train_train_steps_per_second.png differ diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/logging.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/logging.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..eb8b71bf3cf849f49c4826d7688b3324e5d5a471 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/logging.jsonl @@ -0,0 +1,793 @@ +{"loss": 1.31824553, "grad_norm": 3.64442025, "learning_rate": 3.2e-07, "token_acc": 0.7163965, "epoch": 0.00253888, "global_step/max_steps": "1/788", "elapsed_time": "1m 17s", "remaining_time": "16h 49m 55s", "memory(GiB)": 44.13, "train_speed(s/it)": 76.995455} +{"loss": 1.32138598, "grad_norm": 7.06633298, "learning_rate": 6.3e-07, "token_acc": 0.72733058, "epoch": 0.00507775, "global_step/max_steps": "2/788", "elapsed_time": "1m 54s", "remaining_time": "12h 29m 6s", "memory(GiB)": 44.13, "train_speed(s/it)": 57.182956} +{"loss": 1.36283529, "grad_norm": 10.19955751, "learning_rate": 9.5e-07, "token_acc": 0.70682353, "epoch": 0.00761663, "global_step/max_steps": "3/788", "elapsed_time": "2m 34s", "remaining_time": "11h 9m 26s", "memory(GiB)": 44.13, "train_speed(s/it)": 51.16736} +{"loss": 1.36540079, "grad_norm": 2.87581032, "learning_rate": 1.27e-06, "token_acc": 0.71170476, "epoch": 0.01015551, "global_step/max_steps": "4/788", "elapsed_time": "3m 11s", "remaining_time": "10h 23m 54s", "memory(GiB)": 44.13, "train_speed(s/it)": 47.74703} +{"loss": 1.40086353, "grad_norm": 3.29714039, "learning_rate": 1.58e-06, "token_acc": 0.69801114, "epoch": 0.01269438, "global_step/max_steps": "5/788", "elapsed_time": "3m 42s", "remaining_time": "9h 38m 42s", "memory(GiB)": 44.13, "train_speed(s/it)": 44.34455} +{"loss": 1.35938561, "grad_norm": 5.49315065, "learning_rate": 1.9e-06, "token_acc": 0.71491876, "epoch": 0.01523326, "global_step/max_steps": "6/788", "elapsed_time": "4m 19s", "remaining_time": "9h 22m 60s", "memory(GiB)": 44.13, "train_speed(s/it)": 43.196674} +{"loss": 1.30114555, "grad_norm": 8.17150003, "learning_rate": 2.22e-06, "token_acc": 0.72310493, "epoch": 0.01777214, "global_step/max_steps": "7/788", "elapsed_time": "4m 56s", "remaining_time": "9h 10m 26s", "memory(GiB)": 44.13, "train_speed(s/it)": 42.286615} +{"loss": 1.41773629, "grad_norm": 5.82721075, "learning_rate": 2.53e-06, "token_acc": 0.71441109, "epoch": 0.02031101, "global_step/max_steps": "8/788", "elapsed_time": "5m 28s", "remaining_time": "8h 52m 41s", "memory(GiB)": 44.13, "train_speed(s/it)": 40.975839} +{"loss": 1.3783288, "grad_norm": 6.12938746, "learning_rate": 2.85e-06, "token_acc": 0.70319241, "epoch": 0.02284989, "global_step/max_steps": "9/788", "elapsed_time": "6m 4s", "remaining_time": "8h 44m 59s", "memory(GiB)": 44.13, "train_speed(s/it)": 40.435687} +{"loss": 1.34322429, "grad_norm": 3.52036661, "learning_rate": 3.16e-06, "token_acc": 0.72279917, "epoch": 0.02538877, "global_step/max_steps": "10/788", "elapsed_time": "6m 36s", "remaining_time": "8h 33m 16s", "memory(GiB)": 44.13, "train_speed(s/it)": 39.583237} +{"loss": 1.39070272, "grad_norm": 3.65851288, "learning_rate": 3.48e-06, "token_acc": 0.70764066, "epoch": 0.02792764, "global_step/max_steps": "11/788", "elapsed_time": "7m 14s", "remaining_time": "8h 30m 37s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.430454} +{"loss": 1.35241425, "grad_norm": 6.21758128, "learning_rate": 3.8e-06, "token_acc": 0.70281273, "epoch": 0.03046652, "global_step/max_steps": "12/788", "elapsed_time": "7m 58s", "remaining_time": "8h 35m 36s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.86647} +{"loss": 1.39352083, "grad_norm": 3.38808642, "learning_rate": 4.11e-06, "token_acc": 0.70469067, "epoch": 0.0330054, "global_step/max_steps": "13/788", "elapsed_time": "8m 43s", "remaining_time": "8h 39m 37s", "memory(GiB)": 46.32, "train_speed(s/it)": 40.228908} +{"loss": 1.38781226, "grad_norm": 8.33293104, "learning_rate": 4.43e-06, "token_acc": 0.70469687, "epoch": 0.03554427, "global_step/max_steps": "14/788", "elapsed_time": "9m 12s", "remaining_time": "8h 28m 44s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.436104} +{"loss": 1.27546668, "grad_norm": 17.89638048, "learning_rate": 4.75e-06, "token_acc": 0.72423106, "epoch": 0.03808315, "global_step/max_steps": "15/788", "elapsed_time": "9m 52s", "remaining_time": "8h 28m 15s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.449793} +{"loss": 1.34685683, "grad_norm": 11.46365102, "learning_rate": 5.06e-06, "token_acc": 0.70849632, "epoch": 0.04062202, "global_step/max_steps": "16/788", "elapsed_time": "10m 32s", "remaining_time": "8h 28m 6s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.489264} +{"loss": 1.40608549, "grad_norm": 4.28212197, "learning_rate": 5.38e-06, "token_acc": 0.69685039, "epoch": 0.0431609, "global_step/max_steps": "17/788", "elapsed_time": "11m 12s", "remaining_time": "8h 27m 36s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.501897} +{"loss": 1.30042219, "grad_norm": 13.27882368, "learning_rate": 5.7e-06, "token_acc": 0.72421315, "epoch": 0.04569978, "global_step/max_steps": "18/788", "elapsed_time": "11m 48s", "remaining_time": "8h 24m 51s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.339151} +{"loss": 1.35422659, "grad_norm": 2.7785682, "learning_rate": 6.01e-06, "token_acc": 0.71102127, "epoch": 0.04823865, "global_step/max_steps": "19/788", "elapsed_time": "12m 20s", "remaining_time": "8h 19m 18s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.957087} +{"loss": 1.35494125, "grad_norm": 10.57531587, "learning_rate": 6.33e-06, "token_acc": 0.71200736, "epoch": 0.05077753, "global_step/max_steps": "20/788", "elapsed_time": "13m 2s", "remaining_time": "8h 20m 27s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.097901} +{"loss": 1.33150101, "grad_norm": 4.65176176, "learning_rate": 6.65e-06, "token_acc": 0.71729375, "epoch": 0.05331641, "global_step/max_steps": "21/788", "elapsed_time": "13m 33s", "remaining_time": "8h 14m 46s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.704474} +{"loss": 1.36074638, "grad_norm": 11.0394996, "learning_rate": 6.96e-06, "token_acc": 0.71190585, "epoch": 0.05585528, "global_step/max_steps": "22/788", "elapsed_time": "14m 9s", "remaining_time": "8h 12m 52s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.605918} +{"loss": 1.36792767, "grad_norm": 21.78644206, "learning_rate": 7.28e-06, "token_acc": 0.70606932, "epoch": 0.05839416, "global_step/max_steps": "23/788", "elapsed_time": "14m 52s", "remaining_time": "8h 14m 19s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.769519} +{"loss": 1.23081398, "grad_norm": 3.89264571, "learning_rate": 7.59e-06, "token_acc": 0.73030508, "epoch": 0.06093304, "global_step/max_steps": "24/788", "elapsed_time": "15m 34s", "remaining_time": "8h 15m 36s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.922089} +{"loss": 1.26617932, "grad_norm": 27.27305603, "learning_rate": 7.91e-06, "token_acc": 0.71914951, "epoch": 0.06347191, "global_step/max_steps": "25/788", "elapsed_time": "16m 26s", "remaining_time": "8h 21m 39s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.448314} +{"loss": 1.30033112, "grad_norm": 17.17075115, "learning_rate": 8.23e-06, "token_acc": 0.71851643, "epoch": 0.06601079, "global_step/max_steps": "26/788", "elapsed_time": "17m 13s", "remaining_time": "8h 24m 49s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.749429} +{"loss": 1.34722936, "grad_norm": 4.43770622, "learning_rate": 8.54e-06, "token_acc": 0.70840787, "epoch": 0.06854967, "global_step/max_steps": "27/788", "elapsed_time": "17m 49s", "remaining_time": "8h 22m 22s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.608654} +{"loss": 1.22102559, "grad_norm": 28.82445958, "learning_rate": 8.86e-06, "token_acc": 0.7316367, "epoch": 0.07108854, "global_step/max_steps": "28/788", "elapsed_time": "18m 26s", "remaining_time": "8h 20m 29s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.511861} +{"loss": 1.31949854, "grad_norm": 6.45371015, "learning_rate": 9.18e-06, "token_acc": 0.71225307, "epoch": 0.07362742, "global_step/max_steps": "29/788", "elapsed_time": "19m 4s", "remaining_time": "8h 18m 57s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.442102} +{"loss": 1.29121721, "grad_norm": 5.8340873, "learning_rate": 9.49e-06, "token_acc": 0.71860768, "epoch": 0.0761663, "global_step/max_steps": "30/788", "elapsed_time": "19m 43s", "remaining_time": "8h 18m 3s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.423344} +{"loss": 1.31563163, "grad_norm": 2.87154743, "learning_rate": 9.81e-06, "token_acc": 0.70805909, "epoch": 0.07870517, "global_step/max_steps": "31/788", "elapsed_time": "20m 21s", "remaining_time": "8h 17m 5s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.399156} +{"loss": 1.24599218, "grad_norm": 3.62213522, "learning_rate": 1.013e-05, "token_acc": 0.72261735, "epoch": 0.08124405, "global_step/max_steps": "32/788", "elapsed_time": "21m 1s", "remaining_time": "8h 16m 35s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.411052} +{"loss": 1.27164733, "grad_norm": 8.00038956, "learning_rate": 1.044e-05, "token_acc": 0.72181119, "epoch": 0.08378293, "global_step/max_steps": "33/788", "elapsed_time": "21m 38s", "remaining_time": "8h 15m 5s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.343809} +{"loss": 1.27423072, "grad_norm": 4.36154019, "learning_rate": 1.076e-05, "token_acc": 0.71356946, "epoch": 0.0863218, "global_step/max_steps": "34/788", "elapsed_time": "22m 14s", "remaining_time": "8h 13m 7s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.239628} +{"loss": 1.26852155, "grad_norm": 4.91471427, "learning_rate": 1.108e-05, "token_acc": 0.7207676, "epoch": 0.08886068, "global_step/max_steps": "35/788", "elapsed_time": "22m 48s", "remaining_time": "8h 10m 41s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.097765} +{"loss": 1.29947245, "grad_norm": 3.19515111, "learning_rate": 1.139e-05, "token_acc": 0.71253107, "epoch": 0.09139956, "global_step/max_steps": "36/788", "elapsed_time": "23m 28s", "remaining_time": "8h 10m 17s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.118783} +{"loss": 1.18428743, "grad_norm": 2.6222925, "learning_rate": 1.171e-05, "token_acc": 0.73534101, "epoch": 0.09393843, "global_step/max_steps": "37/788", "elapsed_time": "23m 57s", "remaining_time": "8h 6m 12s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.844792} +{"loss": 1.27054989, "grad_norm": 2.82073064, "learning_rate": 1.203e-05, "token_acc": 0.71837904, "epoch": 0.09647731, "global_step/max_steps": "38/788", "elapsed_time": "24m 39s", "remaining_time": "8h 6m 40s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.93295} +{"loss": 1.14102554, "grad_norm": 4.45136324, "learning_rate": 1.234e-05, "token_acc": 0.73430294, "epoch": 0.09901619, "global_step/max_steps": "39/788", "elapsed_time": "25m 16s", "remaining_time": "8h 5m 23s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.882641} +{"loss": 1.17825913, "grad_norm": 5.11367363, "learning_rate": 1.266e-05, "token_acc": 0.73272247, "epoch": 0.10155506, "global_step/max_steps": "40/788", "elapsed_time": "25m 60s", "remaining_time": "8h 6m 6s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.991663} +{"loss": 1.15862894, "grad_norm": 3.55939865, "learning_rate": 1.297e-05, "token_acc": 0.74299, "epoch": 0.10409394, "global_step/max_steps": "41/788", "elapsed_time": "26m 41s", "remaining_time": "8h 6m 9s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.047647} +{"loss": 1.13927269, "grad_norm": 2.91952566, "learning_rate": 1.329e-05, "token_acc": 0.74217772, "epoch": 0.10663281, "global_step/max_steps": "42/788", "elapsed_time": "27m 12s", "remaining_time": "8h 3m 12s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.863686} +{"loss": 1.17042923, "grad_norm": 20.8031043, "learning_rate": 1.361e-05, "token_acc": 0.72857964, "epoch": 0.10917169, "global_step/max_steps": "43/788", "elapsed_time": "27m 55s", "remaining_time": "8h 3m 35s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.946621} +{"loss": 1.13917601, "grad_norm": 3.47158984, "learning_rate": 1.392e-05, "token_acc": 0.73792288, "epoch": 0.11171057, "global_step/max_steps": "44/788", "elapsed_time": "28m 35s", "remaining_time": "8h 3m 24s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.983648} +{"loss": 1.10423946, "grad_norm": 5.20541745, "learning_rate": 1.424e-05, "token_acc": 0.74489796, "epoch": 0.11424944, "global_step/max_steps": "45/788", "elapsed_time": "29m 11s", "remaining_time": "8h 1m 57s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.918923} +{"loss": 1.06574535, "grad_norm": 4.35746721, "learning_rate": 1.456e-05, "token_acc": 0.74894543, "epoch": 0.11678832, "global_step/max_steps": "46/788", "elapsed_time": "29m 52s", "remaining_time": "8h 1m 50s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.962317} +{"loss": 1.19519305, "grad_norm": 23.05377842, "learning_rate": 1.487e-05, "token_acc": 0.72463973, "epoch": 0.1193272, "global_step/max_steps": "47/788", "elapsed_time": "30m 38s", "remaining_time": "8h 2m 50s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.09583} +{"loss": 1.09140825, "grad_norm": 3.8036299, "learning_rate": 1.519e-05, "token_acc": 0.7455208, "epoch": 0.12186607, "global_step/max_steps": "48/788", "elapsed_time": "31m 16s", "remaining_time": "8h 2m 5s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.08719} +{"loss": 1.11042261, "grad_norm": 6.68933651, "learning_rate": 1.551e-05, "token_acc": 0.73717398, "epoch": 0.12440495, "global_step/max_steps": "49/788", "elapsed_time": "31m 59s", "remaining_time": "8h 2m 20s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.160718} +{"loss": 1.11471188, "grad_norm": 13.29561146, "learning_rate": 1.582e-05, "token_acc": 0.73408431, "epoch": 0.12694383, "global_step/max_steps": "50/788", "elapsed_time": "32m 35s", "remaining_time": "8h 0m 59s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.104787} +{"loss": 1.08861232, "grad_norm": 3.68189306, "learning_rate": 1.614e-05, "token_acc": 0.74601024, "epoch": 0.1294827, "global_step/max_steps": "51/788", "elapsed_time": "33m 7s", "remaining_time": "7h 58m 34s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.961231} +{"loss": 0.99624664, "grad_norm": 2.06857282, "learning_rate": 1.646e-05, "token_acc": 0.76197118, "epoch": 0.13202158, "global_step/max_steps": "52/788", "elapsed_time": "33m 46s", "remaining_time": "7h 58m 1s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.968236} +{"loss": 1.04890215, "grad_norm": 2.30293284, "learning_rate": 1.677e-05, "token_acc": 0.74971231, "epoch": 0.13456046, "global_step/max_steps": "53/788", "elapsed_time": "34m 29s", "remaining_time": "7h 58m 10s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.03401} +{"loss": 1.01952457, "grad_norm": 5.70478604, "learning_rate": 1.709e-05, "token_acc": 0.76200528, "epoch": 0.13709933, "global_step/max_steps": "54/788", "elapsed_time": "35m 2s", "remaining_time": "7h 56m 15s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.929857} +{"loss": 1.08180118, "grad_norm": 6.47706151, "learning_rate": 1.741e-05, "token_acc": 0.74655394, "epoch": 0.13963821, "global_step/max_steps": "55/788", "elapsed_time": "35m 38s", "remaining_time": "7h 54m 58s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.878375} +{"loss": 1.03374732, "grad_norm": 6.23768247, "learning_rate": 1.772e-05, "token_acc": 0.76209262, "epoch": 0.14217709, "global_step/max_steps": "56/788", "elapsed_time": "36m 15s", "remaining_time": "7h 53m 57s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.847696} +{"loss": 1.023592, "grad_norm": 2.55848592, "learning_rate": 1.804e-05, "token_acc": 0.74795602, "epoch": 0.14471596, "global_step/max_steps": "57/788", "elapsed_time": "36m 56s", "remaining_time": "7h 53m 39s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.876368} +{"loss": 1.02662754, "grad_norm": 1.60073085, "learning_rate": 1.835e-05, "token_acc": 0.75450107, "epoch": 0.14725484, "global_step/max_steps": "58/788", "elapsed_time": "37m 31s", "remaining_time": "7h 52m 15s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.815114} +{"loss": 1.0003382, "grad_norm": 3.52561303, "learning_rate": 1.867e-05, "token_acc": 0.7527782, "epoch": 0.14979372, "global_step/max_steps": "59/788", "elapsed_time": "38m 7s", "remaining_time": "7h 50m 56s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.759401} +{"loss": 0.90818769, "grad_norm": 3.7023205, "learning_rate": 1.899e-05, "token_acc": 0.77703682, "epoch": 0.15233259, "global_step/max_steps": "60/788", "elapsed_time": "38m 46s", "remaining_time": "7h 50m 28s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.774204} +{"loss": 1.05217254, "grad_norm": 13.20775242, "learning_rate": 1.93e-05, "token_acc": 0.74982694, "epoch": 0.15487147, "global_step/max_steps": "61/788", "elapsed_time": "39m 23s", "remaining_time": "7h 49m 19s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.733786} +{"loss": 0.9959631, "grad_norm": 5.75860602, "learning_rate": 1.962e-05, "token_acc": 0.75399736, "epoch": 0.15741035, "global_step/max_steps": "62/788", "elapsed_time": "40m 9s", "remaining_time": "7h 50m 14s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.862869} +{"loss": 0.99360406, "grad_norm": 2.1358911, "learning_rate": 1.994e-05, "token_acc": 0.75733171, "epoch": 0.15994922, "global_step/max_steps": "63/788", "elapsed_time": "40m 51s", "remaining_time": "7h 50m 7s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.906225} +{"loss": 0.93025887, "grad_norm": 3.60658602, "learning_rate": 2.025e-05, "token_acc": 0.7660312, "epoch": 0.1624881, "global_step/max_steps": "64/788", "elapsed_time": "41m 30s", "remaining_time": "7h 49m 28s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.905709} +{"loss": 0.9686569, "grad_norm": 3.40100761, "learning_rate": 2.057e-05, "token_acc": 0.75880719, "epoch": 0.16502698, "global_step/max_steps": "65/788", "elapsed_time": "42m 14s", "remaining_time": "7h 49m 45s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.983557} +{"loss": 0.97523719, "grad_norm": 8.25772124, "learning_rate": 2.089e-05, "token_acc": 0.75347048, "epoch": 0.16756585, "global_step/max_steps": "66/788", "elapsed_time": "42m 53s", "remaining_time": "7h 49m 8s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.986526} +{"loss": 0.87816656, "grad_norm": 2.75969449, "learning_rate": 2.12e-05, "token_acc": 0.77669603, "epoch": 0.17010473, "global_step/max_steps": "67/788", "elapsed_time": "43m 32s", "remaining_time": "7h 48m 30s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.987917} +{"loss": 0.8539151, "grad_norm": 6.06538793, "learning_rate": 2.152e-05, "token_acc": 0.77785315, "epoch": 0.17264361, "global_step/max_steps": "68/788", "elapsed_time": "44m 6s", "remaining_time": "7h 46m 58s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.913581} +{"loss": 0.82063252, "grad_norm": 6.27375988, "learning_rate": 2.184e-05, "token_acc": 0.78511072, "epoch": 0.17518248, "global_step/max_steps": "69/788", "elapsed_time": "44m 49s", "remaining_time": "7h 47m 1s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.972113} +{"loss": 0.89905953, "grad_norm": 6.79772556, "learning_rate": 2.215e-05, "token_acc": 0.76924092, "epoch": 0.17772136, "global_step/max_steps": "70/788", "elapsed_time": "45m 37s", "remaining_time": "7h 47m 54s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.100671} +{"loss": 0.93758184, "grad_norm": 14.74124742, "learning_rate": 2.247e-05, "token_acc": 0.7635605, "epoch": 0.18026023, "global_step/max_steps": "71/788", "elapsed_time": "46m 10s", "remaining_time": "7h 46m 13s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.014463} +{"loss": 0.80301213, "grad_norm": 2.91554003, "learning_rate": 2.278e-05, "token_acc": 0.7937146, "epoch": 0.18279911, "global_step/max_steps": "72/788", "elapsed_time": "46m 41s", "remaining_time": "7h 44m 18s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.908422} +{"loss": 0.90645242, "grad_norm": 3.25614749, "learning_rate": 2.31e-05, "token_acc": 0.7655107, "epoch": 0.18533799, "global_step/max_steps": "73/788", "elapsed_time": "47m 21s", "remaining_time": "7h 43m 42s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.912231} +{"loss": 0.75698316, "grad_norm": 2.1899191, "learning_rate": 2.342e-05, "token_acc": 0.7891253, "epoch": 0.18787686, "global_step/max_steps": "74/788", "elapsed_time": "48m 1s", "remaining_time": "7h 43m 16s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.930426} +{"loss": 0.87833011, "grad_norm": 3.01682609, "learning_rate": 2.373e-05, "token_acc": 0.76898603, "epoch": 0.19041574, "global_step/max_steps": "75/788", "elapsed_time": "48m 43s", "remaining_time": "7h 43m 5s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.969264} +{"loss": 0.8693279, "grad_norm": 14.13725393, "learning_rate": 2.405e-05, "token_acc": 0.78323782, "epoch": 0.19295462, "global_step/max_steps": "76/788", "elapsed_time": "49m 18s", "remaining_time": "7h 41m 55s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.925127} +{"loss": 0.93678528, "grad_norm": 4.66317031, "learning_rate": 2.437e-05, "token_acc": 0.75876207, "epoch": 0.19549349, "global_step/max_steps": "77/788", "elapsed_time": "50m 9s", "remaining_time": "7h 43m 8s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.083058} +{"loss": 0.91051108, "grad_norm": 2.02513321, "learning_rate": 2.468e-05, "token_acc": 0.76969133, "epoch": 0.19803237, "global_step/max_steps": "78/788", "elapsed_time": "50m 48s", "remaining_time": "7h 42m 26s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.079029} +{"loss": 0.81276006, "grad_norm": 2.93534871, "learning_rate": 2.5e-05, "token_acc": 0.78610375, "epoch": 0.20057125, "global_step/max_steps": "79/788", "elapsed_time": "51m 31s", "remaining_time": "7h 42m 22s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.128} +{"loss": 0.84041113, "grad_norm": 6.81850589, "learning_rate": 2.532e-05, "token_acc": 0.78267374, "epoch": 0.20311012, "global_step/max_steps": "80/788", "elapsed_time": "52m 15s", "remaining_time": "7h 42m 27s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.190734} +{"loss": 0.7662273, "grad_norm": 5.86360331, "learning_rate": 2.563e-05, "token_acc": 0.79125338, "epoch": 0.205649, "global_step/max_steps": "81/788", "elapsed_time": "52m 58s", "remaining_time": "7h 42m 19s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.234137} +{"loss": 0.85506833, "grad_norm": 3.1667411, "learning_rate": 2.595e-05, "token_acc": 0.77639465, "epoch": 0.20818788, "global_step/max_steps": "82/788", "elapsed_time": "53m 37s", "remaining_time": "7h 41m 40s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.235438} +{"loss": 0.72825503, "grad_norm": 2.93828673, "learning_rate": 2.627e-05, "token_acc": 0.7997798, "epoch": 0.21072675, "global_step/max_steps": "83/788", "elapsed_time": "54m 17s", "remaining_time": "7h 41m 2s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.236413} +{"loss": 0.79531592, "grad_norm": 4.41393058, "learning_rate": 2.658e-05, "token_acc": 0.78510358, "epoch": 0.21326563, "global_step/max_steps": "84/788", "elapsed_time": "54m 49s", "remaining_time": "7h 39m 25s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.155123} +{"loss": 0.88437176, "grad_norm": 2.25482265, "learning_rate": 2.69e-05, "token_acc": 0.77686375, "epoch": 0.21580451, "global_step/max_steps": "85/788", "elapsed_time": "55m 28s", "remaining_time": "7h 38m 41s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.148046} +{"loss": 0.84808367, "grad_norm": 13.17264488, "learning_rate": 2.722e-05, "token_acc": 0.77694378, "epoch": 0.21834338, "global_step/max_steps": "86/788", "elapsed_time": "56m 10s", "remaining_time": "7h 38m 28s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.185703} +{"loss": 0.70500201, "grad_norm": 13.96235928, "learning_rate": 2.753e-05, "token_acc": 0.80568648, "epoch": 0.22088226, "global_step/max_steps": "87/788", "elapsed_time": "56m 46s", "remaining_time": "7h 37m 21s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.145966} +{"loss": 0.7555728, "grad_norm": 4.20192755, "learning_rate": 2.785e-05, "token_acc": 0.79755033, "epoch": 0.22342114, "global_step/max_steps": "88/788", "elapsed_time": "57m 30s", "remaining_time": "7h 37m 20s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.199514} +{"loss": 0.72490466, "grad_norm": 5.01533364, "learning_rate": 2.816e-05, "token_acc": 0.80177419, "epoch": 0.22596001, "global_step/max_steps": "89/788", "elapsed_time": "58m 2s", "remaining_time": "7h 35m 49s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.126498} +{"loss": 0.68889081, "grad_norm": 11.63320257, "learning_rate": 2.848e-05, "token_acc": 0.80806827, "epoch": 0.22849889, "global_step/max_steps": "90/788", "elapsed_time": "58m 42s", "remaining_time": "7h 35m 19s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.138623} +{"loss": 0.75105774, "grad_norm": 5.45739874, "learning_rate": 2.88e-05, "token_acc": 0.79536113, "epoch": 0.23103777, "global_step/max_steps": "91/788", "elapsed_time": "59m 22s", "remaining_time": "7h 34m 42s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.14153} +{"loss": 0.77404368, "grad_norm": 4.53000637, "learning_rate": 2.911e-05, "token_acc": 0.7910109, "epoch": 0.23357664, "global_step/max_steps": "92/788", "elapsed_time": "1h 0m 1s", "remaining_time": "7h 34m 3s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.141932} +{"loss": 0.69948971, "grad_norm": 3.28340899, "learning_rate": 2.943e-05, "token_acc": 0.8084581, "epoch": 0.23611552, "global_step/max_steps": "93/788", "elapsed_time": "1h 0m 47s", "remaining_time": "7h 34m 11s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.210175} +{"loss": 0.67458743, "grad_norm": 3.74567678, "learning_rate": 2.975e-05, "token_acc": 0.81210986, "epoch": 0.2386544, "global_step/max_steps": "94/788", "elapsed_time": "1h 1m 28s", "remaining_time": "7h 33m 52s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.239037} +{"loss": 0.74041593, "grad_norm": 2.48116064, "learning_rate": 3.006e-05, "token_acc": 0.80464988, "epoch": 0.24119327, "global_step/max_steps": "95/788", "elapsed_time": "1h 2m 11s", "remaining_time": "7h 33m 36s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.272146} +{"loss": 0.68837905, "grad_norm": 3.01198932, "learning_rate": 3.038e-05, "token_acc": 0.8137286, "epoch": 0.24373215, "global_step/max_steps": "96/788", "elapsed_time": "1h 2m 51s", "remaining_time": "7h 33m 1s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.278404} +{"loss": 0.73540664, "grad_norm": 3.97758868, "learning_rate": 3.07e-05, "token_acc": 0.80123242, "epoch": 0.24627103, "global_step/max_steps": "97/788", "elapsed_time": "1h 3m 28s", "remaining_time": "7h 32m 4s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.252955} +{"loss": 0.71021831, "grad_norm": 2.44172317, "learning_rate": 3.101e-05, "token_acc": 0.80150146, "epoch": 0.2488099, "global_step/max_steps": "98/788", "elapsed_time": "1h 4m 15s", "remaining_time": "7h 32m 23s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.337031} +{"loss": 0.72543663, "grad_norm": 5.21129736, "learning_rate": 3.133e-05, "token_acc": 0.80429742, "epoch": 0.25134878, "global_step/max_steps": "99/788", "elapsed_time": "1h 4m 52s", "remaining_time": "7h 31m 27s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.313914} +{"loss": 0.71342534, "grad_norm": 4.74007083, "learning_rate": 3.165e-05, "token_acc": 0.80915801, "epoch": 0.25388765, "global_step/max_steps": "100/788", "elapsed_time": "1h 5m 27s", "remaining_time": "7h 30m 20s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.272585} +{"loss": 0.73703778, "grad_norm": 5.2967761, "learning_rate": 3.196e-05, "token_acc": 0.80840756, "epoch": 0.25642653, "global_step/max_steps": "101/788", "elapsed_time": "1h 6m 8s", "remaining_time": "7h 29m 52s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.289253} +{"loss": 0.67131853, "grad_norm": 4.39658203, "learning_rate": 3.228e-05, "token_acc": 0.81838968, "epoch": 0.25896541, "global_step/max_steps": "102/788", "elapsed_time": "1h 6m 46s", "remaining_time": "7h 29m 1s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.273115} +{"loss": 0.65839064, "grad_norm": 2.63354542, "learning_rate": 3.259e-05, "token_acc": 0.8211532, "epoch": 0.26150428, "global_step/max_steps": "103/788", "elapsed_time": "1h 7m 17s", "remaining_time": "7h 27m 31s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.19799} +{"loss": 0.75365722, "grad_norm": 6.23641128, "learning_rate": 3.291e-05, "token_acc": 0.79750904, "epoch": 0.26404316, "global_step/max_steps": "104/788", "elapsed_time": "1h 8m 1s", "remaining_time": "7h 27m 21s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.241267} +{"loss": 0.67019302, "grad_norm": 2.53419226, "learning_rate": 3.323e-05, "token_acc": 0.81169284, "epoch": 0.26658204, "global_step/max_steps": "105/788", "elapsed_time": "1h 8m 31s", "remaining_time": "7h 25m 39s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.148857} +{"loss": 0.59090674, "grad_norm": 11.88107909, "learning_rate": 3.354e-05, "token_acc": 0.83459616, "epoch": 0.26912091, "global_step/max_steps": "106/788", "elapsed_time": "1h 9m 4s", "remaining_time": "7h 24m 20s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.091633} +{"loss": 0.62826121, "grad_norm": 2.38469744, "learning_rate": 3.386e-05, "token_acc": 0.82362882, "epoch": 0.27165979, "global_step/max_steps": "107/788", "elapsed_time": "1h 9m 38s", "remaining_time": "7h 23m 9s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.043631} +{"loss": 0.69366068, "grad_norm": 2.19950796, "learning_rate": 3.418e-05, "token_acc": 0.80206634, "epoch": 0.27419867, "global_step/max_steps": "108/788", "elapsed_time": "1h 10m 22s", "remaining_time": "7h 23m 1s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.089052} +{"loss": 0.77818418, "grad_norm": 4.86143235, "learning_rate": 3.449e-05, "token_acc": 0.78875, "epoch": 0.27673754, "global_step/max_steps": "109/788", "elapsed_time": "1h 10m 59s", "remaining_time": "7h 22m 12s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.075708} +{"loss": 0.67513686, "grad_norm": 9.57103993, "learning_rate": 3.481e-05, "token_acc": 0.81484236, "epoch": 0.27927642, "global_step/max_steps": "110/788", "elapsed_time": "1h 11m 39s", "remaining_time": "7h 21m 39s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.084249} +{"loss": 0.70300663, "grad_norm": 13.54956495, "learning_rate": 3.513e-05, "token_acc": 0.80543933, "epoch": 0.2818153, "global_step/max_steps": "111/788", "elapsed_time": "1h 12m 22s", "remaining_time": "7h 21m 22s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.117298} +{"loss": 0.68869197, "grad_norm": 5.10737251, "learning_rate": 3.544e-05, "token_acc": 0.80833333, "epoch": 0.28435417, "global_step/max_steps": "112/788", "elapsed_time": "1h 13m 0s", "remaining_time": "7h 20m 39s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.111554} +{"loss": 0.66101694, "grad_norm": 22.0635833, "learning_rate": 3.576e-05, "token_acc": 0.81504034, "epoch": 0.28689305, "global_step/max_steps": "113/788", "elapsed_time": "1h 13m 38s", "remaining_time": "7h 19m 49s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.094572} +{"loss": 0.68416989, "grad_norm": 18.72026765, "learning_rate": 3.608e-05, "token_acc": 0.81230329, "epoch": 0.28943193, "global_step/max_steps": "114/788", "elapsed_time": "1h 14m 22s", "remaining_time": "7h 19m 42s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.142303} +{"loss": 0.64669698, "grad_norm": 2.8648818, "learning_rate": 3.639e-05, "token_acc": 0.81721874, "epoch": 0.2919708, "global_step/max_steps": "115/788", "elapsed_time": "1h 15m 7s", "remaining_time": "7h 19m 36s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.192394} +{"loss": 0.60780287, "grad_norm": 6.71633771, "learning_rate": 3.671e-05, "token_acc": 0.83464973, "epoch": 0.29450968, "global_step/max_steps": "116/788", "elapsed_time": "1h 15m 38s", "remaining_time": "7h 18m 9s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.120692} +{"loss": 0.66484904, "grad_norm": 5.56474549, "learning_rate": 3.703e-05, "token_acc": 0.81901887, "epoch": 0.29704856, "global_step/max_steps": "117/788", "elapsed_time": "1h 16m 13s", "remaining_time": "7h 17m 5s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.084006} +{"loss": 0.63845342, "grad_norm": 28.63071789, "learning_rate": 3.734e-05, "token_acc": 0.82208301, "epoch": 0.29958743, "global_step/max_steps": "118/788", "elapsed_time": "1h 16m 47s", "remaining_time": "7h 15m 60s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.044605} +{"loss": 0.62018782, "grad_norm": 12.27339236, "learning_rate": 3.766e-05, "token_acc": 0.82507339, "epoch": 0.30212631, "global_step/max_steps": "119/788", "elapsed_time": "1h 17m 23s", "remaining_time": "7h 14m 60s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.013254} +{"loss": 0.69794965, "grad_norm": 4.19285245, "learning_rate": 3.797e-05, "token_acc": 0.81045209, "epoch": 0.30466519, "global_step/max_steps": "120/788", "elapsed_time": "1h 18m 2s", "remaining_time": "7h 14m 21s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.014186} +{"loss": 0.65500313, "grad_norm": 3.46571961, "learning_rate": 3.829e-05, "token_acc": 0.81875758, "epoch": 0.30720406, "global_step/max_steps": "121/788", "elapsed_time": "1h 18m 43s", "remaining_time": "7h 13m 56s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.033777} +{"loss": 0.65152782, "grad_norm": 27.78737402, "learning_rate": 3.861e-05, "token_acc": 0.81718523, "epoch": 0.30974294, "global_step/max_steps": "122/788", "elapsed_time": "1h 19m 20s", "remaining_time": "7h 13m 5s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.016632} +{"loss": 0.60548759, "grad_norm": 4.04175485, "learning_rate": 3.892e-05, "token_acc": 0.82658769, "epoch": 0.31228182, "global_step/max_steps": "123/788", "elapsed_time": "1h 19m 54s", "remaining_time": "7h 12m 0s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.977538} +{"loss": 0.66311383, "grad_norm": 3.82927489, "learning_rate": 3.924e-05, "token_acc": 0.81299324, "epoch": 0.31482069, "global_step/max_steps": "124/788", "elapsed_time": "1h 20m 35s", "remaining_time": "7h 11m 32s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.993706} +{"loss": 0.60870266, "grad_norm": 8.96047969, "learning_rate": 3.956e-05, "token_acc": 0.82819781, "epoch": 0.31735957, "global_step/max_steps": "125/788", "elapsed_time": "1h 21m 13s", "remaining_time": "7h 10m 44s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.980579} +{"loss": 0.71228874, "grad_norm": 4.01172246, "learning_rate": 3.987e-05, "token_acc": 0.80934827, "epoch": 0.31989844, "global_step/max_steps": "126/788", "elapsed_time": "1h 21m 52s", "remaining_time": "7h 10m 7s", "memory(GiB)": 46.32, "train_speed(s/it)": 38.98369} +{"loss": 0.66636443, "grad_norm": 31.39830165, "learning_rate": 4.019e-05, "token_acc": 0.81805485, "epoch": 0.32243732, "global_step/max_steps": "127/788", "elapsed_time": "1h 22m 33s", "remaining_time": "7h 9m 41s", "memory(GiB)": 46.32, "train_speed(s/it)": 39.002741} +{"loss": 0.63006914, "grad_norm": 4.42559633, "learning_rate": 4.051e-05, "token_acc": 0.82039074, "epoch": 0.3249762, "global_step/max_steps": "128/788", "elapsed_time": "1h 23m 19s", "remaining_time": "7h 9m 35s", "memory(GiB)": 49.18, "train_speed(s/it)": 39.053292} +{"loss": 0.67042875, "grad_norm": 16.10838492, "learning_rate": 4.082e-05, "token_acc": 0.80786276, "epoch": 0.32751507, "global_step/max_steps": "129/788", "elapsed_time": "1h 24m 6s", "remaining_time": "7h 9m 37s", "memory(GiB)": 49.18, "train_speed(s/it)": 39.115624} +{"loss": 0.71701485, "grad_norm": 2.2389484, "learning_rate": 4.114e-05, "token_acc": 0.80842196, "epoch": 0.33005395, "global_step/max_steps": "130/788", "elapsed_time": "1h 24m 46s", "remaining_time": "7h 9m 4s", "memory(GiB)": 50.94, "train_speed(s/it)": 39.125217} +{"loss": 0.67176509, "grad_norm": 3.61351312, "learning_rate": 4.146e-05, "token_acc": 0.81386529, "epoch": 0.33259283, "global_step/max_steps": "131/788", "elapsed_time": "1h 25m 22s", "remaining_time": "7h 8m 6s", "memory(GiB)": 50.94, "train_speed(s/it)": 39.0959} +{"loss": 0.60853851, "grad_norm": 5.58270286, "learning_rate": 4.177e-05, "token_acc": 0.82740162, "epoch": 0.3351317, "global_step/max_steps": "132/788", "elapsed_time": "1h 26m 12s", "remaining_time": "7h 8m 23s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.181424} +{"loss": 0.64450479, "grad_norm": 5.37295628, "learning_rate": 4.209e-05, "token_acc": 0.81346541, "epoch": 0.33767058, "global_step/max_steps": "133/788", "elapsed_time": "1h 26m 48s", "remaining_time": "7h 7m 28s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.157337} +{"loss": 0.5425458, "grad_norm": 2.17887578, "learning_rate": 4.241e-05, "token_acc": 0.83746556, "epoch": 0.34020946, "global_step/max_steps": "134/788", "elapsed_time": "1h 27m 21s", "remaining_time": "7h 6m 19s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.111785} +{"loss": 0.59626925, "grad_norm": 4.64940157, "learning_rate": 4.272e-05, "token_acc": 0.82252268, "epoch": 0.34274833, "global_step/max_steps": "135/788", "elapsed_time": "1h 27m 55s", "remaining_time": "7h 5m 18s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.077719} +{"loss": 0.60384178, "grad_norm": 3.17423032, "learning_rate": 4.304e-05, "token_acc": 0.83166487, "epoch": 0.34528721, "global_step/max_steps": "136/788", "elapsed_time": "1h 28m 34s", "remaining_time": "7h 4m 34s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.070833} +{"loss": 0.60167778, "grad_norm": 5.69698301, "learning_rate": 4.335e-05, "token_acc": 0.83210187, "epoch": 0.34782609, "global_step/max_steps": "137/788", "elapsed_time": "1h 29m 13s", "remaining_time": "7h 3m 55s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.070258} +{"loss": 0.65659213, "grad_norm": 5.79738818, "learning_rate": 4.367e-05, "token_acc": 0.81844298, "epoch": 0.35036496, "global_step/max_steps": "138/788", "elapsed_time": "1h 29m 51s", "remaining_time": "7h 3m 12s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.065149} +{"loss": 0.69124782, "grad_norm": 6.85427425, "learning_rate": 4.399e-05, "token_acc": 0.81434378, "epoch": 0.35290384, "global_step/max_steps": "139/788", "elapsed_time": "1h 30m 35s", "remaining_time": "7h 2m 56s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.100309} +{"loss": 0.62850547, "grad_norm": 2.61848696, "learning_rate": 4.43e-05, "token_acc": 0.82226314, "epoch": 0.35544272, "global_step/max_steps": "140/788", "elapsed_time": "1h 31m 18s", "remaining_time": "7h 2m 35s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.127818} +{"loss": 0.56716037, "grad_norm": 4.6533469, "learning_rate": 4.462e-05, "token_acc": 0.83806484, "epoch": 0.35798159, "global_step/max_steps": "141/788", "elapsed_time": "1h 31m 56s", "remaining_time": "7h 1m 50s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.119146} +{"loss": 0.60687077, "grad_norm": 4.52268127, "learning_rate": 4.494e-05, "token_acc": 0.83313014, "epoch": 0.36052047, "global_step/max_steps": "142/788", "elapsed_time": "1h 32m 38s", "remaining_time": "7h 1m 23s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.138417} +{"loss": 0.5732224, "grad_norm": 3.1810751, "learning_rate": 4.525e-05, "token_acc": 0.83674818, "epoch": 0.36305935, "global_step/max_steps": "143/788", "elapsed_time": "1h 33m 14s", "remaining_time": "7h 0m 31s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.11731} +{"loss": 0.70900506, "grad_norm": 5.24841114, "learning_rate": 4.557e-05, "token_acc": 0.80887707, "epoch": 0.36559822, "global_step/max_steps": "144/788", "elapsed_time": "1h 33m 51s", "remaining_time": "6h 59m 42s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.101853} +{"loss": 0.63957942, "grad_norm": 2.28418201, "learning_rate": 4.589e-05, "token_acc": 0.82517662, "epoch": 0.3681371, "global_step/max_steps": "145/788", "elapsed_time": "1h 34m 44s", "remaining_time": "7h 0m 5s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.198688} +{"loss": 0.56192756, "grad_norm": 3.1929514, "learning_rate": 4.62e-05, "token_acc": 0.83535324, "epoch": 0.37067598, "global_step/max_steps": "146/788", "elapsed_time": "1h 35m 20s", "remaining_time": "6h 59m 11s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.175826} +{"loss": 0.60762763, "grad_norm": 6.18498277, "learning_rate": 4.652e-05, "token_acc": 0.83217593, "epoch": 0.37321485, "global_step/max_steps": "147/788", "elapsed_time": "1h 35m 55s", "remaining_time": "6h 58m 13s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.146499} +{"loss": 0.5210973, "grad_norm": 3.926067, "learning_rate": 4.684e-05, "token_acc": 0.84576331, "epoch": 0.37575373, "global_step/max_steps": "148/788", "elapsed_time": "1h 36m 24s", "remaining_time": "6h 56m 54s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.083731} +{"loss": 0.46483064, "grad_norm": 3.69532612, "learning_rate": 4.715e-05, "token_acc": 0.85721954, "epoch": 0.37829261, "global_step/max_steps": "149/788", "elapsed_time": "1h 37m 0s", "remaining_time": "6h 56m 0s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.061679} +{"loss": 0.67604584, "grad_norm": 4.99212031, "learning_rate": 4.747e-05, "token_acc": 0.8171926, "epoch": 0.38083148, "global_step/max_steps": "150/788", "elapsed_time": "1h 37m 35s", "remaining_time": "6h 55m 4s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.035177} +{"loss": 0.6196934, "grad_norm": 20.42938552, "learning_rate": 4.778e-05, "token_acc": 0.83383383, "epoch": 0.38337036, "global_step/max_steps": "151/788", "elapsed_time": "1h 38m 12s", "remaining_time": "6h 54m 15s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.018939} +{"loss": 0.57433689, "grad_norm": 8.75540348, "learning_rate": 4.81e-05, "token_acc": 0.84128153, "epoch": 0.38590924, "global_step/max_steps": "152/788", "elapsed_time": "1h 38m 42s", "remaining_time": "6h 53m 0s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.962389} +{"loss": 0.64926016, "grad_norm": 3.20727607, "learning_rate": 4.842e-05, "token_acc": 0.81372017, "epoch": 0.38844811, "global_step/max_steps": "153/788", "elapsed_time": "1h 39m 32s", "remaining_time": "6h 53m 4s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.030129} +{"loss": 0.63616633, "grad_norm": 3.83165508, "learning_rate": 4.873e-05, "token_acc": 0.82316982, "epoch": 0.39098699, "global_step/max_steps": "154/788", "elapsed_time": "1h 40m 10s", "remaining_time": "6h 52m 21s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.023135} +{"loss": 0.69393128, "grad_norm": 3.97277239, "learning_rate": 4.905e-05, "token_acc": 0.81134693, "epoch": 0.39352586, "global_step/max_steps": "155/788", "elapsed_time": "1h 40m 54s", "remaining_time": "6h 52m 4s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.057967} +{"loss": 0.60085899, "grad_norm": 16.65764785, "learning_rate": 4.937e-05, "token_acc": 0.83163792, "epoch": 0.39606474, "global_step/max_steps": "156/788", "elapsed_time": "1h 41m 36s", "remaining_time": "6h 51m 35s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.074494} +{"loss": 0.57169521, "grad_norm": 2.81474259, "learning_rate": 4.968e-05, "token_acc": 0.83057342, "epoch": 0.39860362, "global_step/max_steps": "157/788", "elapsed_time": "1h 42m 13s", "remaining_time": "6h 50m 50s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.064946} +{"loss": 0.58925962, "grad_norm": 3.31830751, "learning_rate": 5e-05, "token_acc": 0.82359467, "epoch": 0.40114249, "global_step/max_steps": "158/788", "elapsed_time": "1h 42m 44s", "remaining_time": "6h 49m 38s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.013151} +{"loss": 0.5727576, "grad_norm": 3.80562223, "learning_rate": 5e-05, "token_acc": 0.83279649, "epoch": 0.40368137, "global_step/max_steps": "159/788", "elapsed_time": "1h 43m 24s", "remaining_time": "6h 49m 1s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.015874} +{"loss": 0.50017852, "grad_norm": 2.99590922, "learning_rate": 5e-05, "token_acc": 0.84749072, "epoch": 0.40622025, "global_step/max_steps": "160/788", "elapsed_time": "1h 43m 54s", "remaining_time": "6h 47m 50s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.965414} +{"loss": 0.61660254, "grad_norm": 2.92686535, "learning_rate": 5e-05, "token_acc": 0.82096134, "epoch": 0.40875912, "global_step/max_steps": "161/788", "elapsed_time": "1h 44m 32s", "remaining_time": "6h 47m 6s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.957349} +{"loss": 0.58356559, "grad_norm": 2.26654052, "learning_rate": 5e-05, "token_acc": 0.83141503, "epoch": 0.411298, "global_step/max_steps": "162/788", "elapsed_time": "1h 45m 4s", "remaining_time": "6h 45m 59s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.912032} +{"loss": 0.63065434, "grad_norm": 6.07722567, "learning_rate": 4.999e-05, "token_acc": 0.82029656, "epoch": 0.41383688, "global_step/max_steps": "163/788", "elapsed_time": "1h 45m 51s", "remaining_time": "6h 45m 52s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.963498} +{"loss": 0.60706753, "grad_norm": 9.20552391, "learning_rate": 4.999e-05, "token_acc": 0.83145009, "epoch": 0.41637575, "global_step/max_steps": "164/788", "elapsed_time": "1h 46m 32s", "remaining_time": "6h 45m 22s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.976983} +{"loss": 0.55497169, "grad_norm": 2.52016484, "learning_rate": 4.998e-05, "token_acc": 0.83796895, "epoch": 0.41891463, "global_step/max_steps": "165/788", "elapsed_time": "1h 47m 8s", "remaining_time": "6h 44m 31s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.958535} +{"loss": 0.51408619, "grad_norm": 2.3723529, "learning_rate": 4.998e-05, "token_acc": 0.84970009, "epoch": 0.42145351, "global_step/max_steps": "166/788", "elapsed_time": "1h 47m 42s", "remaining_time": "6h 43m 34s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.930015} +{"loss": 0.57132089, "grad_norm": 3.16839923, "learning_rate": 4.997e-05, "token_acc": 0.83426384, "epoch": 0.42399238, "global_step/max_steps": "167/788", "elapsed_time": "1h 48m 18s", "remaining_time": "6h 42m 42s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.907482} +{"loss": 0.56525695, "grad_norm": 3.15445279, "learning_rate": 4.997e-05, "token_acc": 0.84336804, "epoch": 0.42653126, "global_step/max_steps": "168/788", "elapsed_time": "1h 48m 54s", "remaining_time": "6h 41m 55s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.894855} +{"loss": 0.60103381, "grad_norm": 4.05050229, "learning_rate": 4.996e-05, "token_acc": 0.82999088, "epoch": 0.42907014, "global_step/max_steps": "169/788", "elapsed_time": "1h 49m 33s", "remaining_time": "6h 41m 14s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.891822} +{"loss": 0.6255517, "grad_norm": 2.32087445, "learning_rate": 4.996e-05, "token_acc": 0.82140957, "epoch": 0.43160901, "global_step/max_steps": "170/788", "elapsed_time": "1h 50m 17s", "remaining_time": "6h 40m 55s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.924509} +{"loss": 0.57635283, "grad_norm": 3.57529105, "learning_rate": 4.995e-05, "token_acc": 0.83702882, "epoch": 0.43414789, "global_step/max_steps": "171/788", "elapsed_time": "1h 50m 58s", "remaining_time": "6h 40m 23s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.934582} +{"loss": 0.58306009, "grad_norm": 5.1863677, "learning_rate": 4.994e-05, "token_acc": 0.83266013, "epoch": 0.43668677, "global_step/max_steps": "172/788", "elapsed_time": "1h 51m 44s", "remaining_time": "6h 40m 9s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.976018} +{"loss": 0.62052619, "grad_norm": 2.31472199, "learning_rate": 4.993e-05, "token_acc": 0.82038997, "epoch": 0.43922564, "global_step/max_steps": "173/788", "elapsed_time": "1h 52m 34s", "remaining_time": "6h 40m 10s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.040215} +{"loss": 0.5230633, "grad_norm": 3.35832252, "learning_rate": 4.992e-05, "token_acc": 0.84199206, "epoch": 0.44176452, "global_step/max_steps": "174/788", "elapsed_time": "1h 53m 9s", "remaining_time": "6h 39m 18s", "memory(GiB)": 50.95, "train_speed(s/it)": 39.019986} +{"loss": 0.51438594, "grad_norm": 4.04230628, "learning_rate": 4.991e-05, "token_acc": 0.84745448, "epoch": 0.4443034, "global_step/max_steps": "175/788", "elapsed_time": "1h 53m 38s", "remaining_time": "6h 38m 3s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.960647} +{"loss": 0.61440516, "grad_norm": 2.63215249, "learning_rate": 4.99e-05, "token_acc": 0.81750496, "epoch": 0.44684227, "global_step/max_steps": "176/788", "elapsed_time": "1h 54m 12s", "remaining_time": "6h 37m 8s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.934328} +{"loss": 0.49258965, "grad_norm": 2.36166022, "learning_rate": 4.989e-05, "token_acc": 0.84596614, "epoch": 0.44938115, "global_step/max_steps": "177/788", "elapsed_time": "1h 54m 49s", "remaining_time": "6h 36m 19s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.918712} +{"loss": 0.50392294, "grad_norm": 2.03699987, "learning_rate": 4.988e-05, "token_acc": 0.84878226, "epoch": 0.45192003, "global_step/max_steps": "178/788", "elapsed_time": "1h 55m 17s", "remaining_time": "6h 35m 3s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.857604} +{"loss": 0.58145666, "grad_norm": 6.93229029, "learning_rate": 4.986e-05, "token_acc": 0.82748025, "epoch": 0.4544589, "global_step/max_steps": "179/788", "elapsed_time": "1h 55m 51s", "remaining_time": "6h 34m 10s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.834457} +{"loss": 0.54276949, "grad_norm": 1.94421373, "learning_rate": 4.985e-05, "token_acc": 0.84497363, "epoch": 0.45699778, "global_step/max_steps": "180/788", "elapsed_time": "1h 56m 26s", "remaining_time": "6h 33m 17s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.810138} +{"loss": 0.50211084, "grad_norm": 3.82783657, "learning_rate": 4.984e-05, "token_acc": 0.84948212, "epoch": 0.45953666, "global_step/max_steps": "181/788", "elapsed_time": "1h 56m 58s", "remaining_time": "6h 32m 15s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.772299} +{"loss": 0.52931094, "grad_norm": 3.89816509, "learning_rate": 4.982e-05, "token_acc": 0.84565123, "epoch": 0.46207553, "global_step/max_steps": "182/788", "elapsed_time": "1h 57m 34s", "remaining_time": "6h 31m 29s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.760328} +{"loss": 0.51938421, "grad_norm": 5.78413802, "learning_rate": 4.981e-05, "token_acc": 0.84865293, "epoch": 0.46461441, "global_step/max_steps": "183/788", "elapsed_time": "1h 58m 20s", "remaining_time": "6h 31m 11s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.795461} +{"loss": 0.55104208, "grad_norm": 2.78608966, "learning_rate": 4.979e-05, "token_acc": 0.84273999, "epoch": 0.46715328, "global_step/max_steps": "184/788", "elapsed_time": "1h 58m 58s", "remaining_time": "6h 30m 33s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.796141} +{"loss": 0.5656364, "grad_norm": 2.3914785, "learning_rate": 4.977e-05, "token_acc": 0.83849729, "epoch": 0.46969216, "global_step/max_steps": "185/788", "elapsed_time": "1h 59m 40s", "remaining_time": "6h 30m 4s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.812245} +{"loss": 0.58371782, "grad_norm": 2.738147, "learning_rate": 4.976e-05, "token_acc": 0.83043862, "epoch": 0.47223104, "global_step/max_steps": "186/788", "elapsed_time": "2h 0m 14s", "remaining_time": "6h 29m 7s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.782913} +{"loss": 0.58793586, "grad_norm": 4.43622154, "learning_rate": 4.974e-05, "token_acc": 0.82547433, "epoch": 0.47476991, "global_step/max_steps": "187/788", "elapsed_time": "2h 0m 56s", "remaining_time": "6h 28m 41s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.803436} +{"loss": 0.58097124, "grad_norm": 3.16181244, "learning_rate": 4.972e-05, "token_acc": 0.83610077, "epoch": 0.47730879, "global_step/max_steps": "188/788", "elapsed_time": "2h 1m 42s", "remaining_time": "6h 28m 23s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.837909} +{"loss": 0.55799556, "grad_norm": 1.55203062, "learning_rate": 4.97e-05, "token_acc": 0.83728101, "epoch": 0.47984767, "global_step/max_steps": "189/788", "elapsed_time": "2h 2m 23s", "remaining_time": "6h 27m 52s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.851599} +{"loss": 0.58579421, "grad_norm": 3.72724848, "learning_rate": 4.968e-05, "token_acc": 0.83505013, "epoch": 0.48238654, "global_step/max_steps": "190/788", "elapsed_time": "2h 3m 5s", "remaining_time": "6h 27m 24s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.86917} +{"loss": 0.49055773, "grad_norm": 3.07950465, "learning_rate": 4.966e-05, "token_acc": 0.85434853, "epoch": 0.48492542, "global_step/max_steps": "191/788", "elapsed_time": "2h 3m 38s", "remaining_time": "6h 26m 27s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.83837} +{"loss": 0.6000843, "grad_norm": 2.22232043, "learning_rate": 4.964e-05, "token_acc": 0.82021169, "epoch": 0.4874643, "global_step/max_steps": "192/788", "elapsed_time": "2h 4m 20s", "remaining_time": "6h 25m 57s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.854661} +{"loss": 0.55314279, "grad_norm": 3.05449342, "learning_rate": 4.962e-05, "token_acc": 0.8378803, "epoch": 0.49000317, "global_step/max_steps": "193/788", "elapsed_time": "2h 5m 8s", "remaining_time": "6h 25m 47s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.903009} +{"loss": 0.49760789, "grad_norm": 1.48942864, "learning_rate": 4.96e-05, "token_acc": 0.84827134, "epoch": 0.49254205, "global_step/max_steps": "194/788", "elapsed_time": "2h 5m 40s", "remaining_time": "6h 24m 47s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.866464} +{"loss": 0.51263154, "grad_norm": 1.43374178, "learning_rate": 4.958e-05, "token_acc": 0.84686958, "epoch": 0.49508093, "global_step/max_steps": "195/788", "elapsed_time": "2h 6m 17s", "remaining_time": "6h 24m 2s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.856638} +{"loss": 0.51409096, "grad_norm": 1.82163771, "learning_rate": 4.955e-05, "token_acc": 0.84830769, "epoch": 0.4976198, "global_step/max_steps": "196/788", "elapsed_time": "2h 6m 55s", "remaining_time": "6h 23m 19s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.850474} +{"loss": 0.54833555, "grad_norm": 3.69892176, "learning_rate": 4.953e-05, "token_acc": 0.843615, "epoch": 0.50015868, "global_step/max_steps": "197/788", "elapsed_time": "2h 7m 28s", "remaining_time": "6h 22m 25s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.823793} +{"loss": 0.52586746, "grad_norm": 1.47936017, "learning_rate": 4.95e-05, "token_acc": 0.84477612, "epoch": 0.50269756, "global_step/max_steps": "198/788", "elapsed_time": "2h 8m 18s", "remaining_time": "6h 22m 19s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.878935} +{"loss": 0.54834813, "grad_norm": 3.32035865, "learning_rate": 4.948e-05, "token_acc": 0.84071058, "epoch": 0.50523643, "global_step/max_steps": "199/788", "elapsed_time": "2h 8m 60s", "remaining_time": "6h 21m 48s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.893037} +{"loss": 0.56989104, "grad_norm": 1.48369654, "learning_rate": 4.945e-05, "token_acc": 0.8355417, "epoch": 0.50777531, "global_step/max_steps": "200/788", "elapsed_time": "2h 9m 35s", "remaining_time": "6h 20m 58s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.874243} +{"loss": 0.62262577, "grad_norm": 1.98408066, "learning_rate": 4.943e-05, "token_acc": 0.82194159, "epoch": 0.51031419, "global_step/max_steps": "201/788", "elapsed_time": "2h 10m 11s", "remaining_time": "6h 20m 11s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.860685} +{"loss": 0.54858655, "grad_norm": 3.42001245, "learning_rate": 4.94e-05, "token_acc": 0.84237865, "epoch": 0.51285306, "global_step/max_steps": "202/788", "elapsed_time": "2h 10m 44s", "remaining_time": "6h 19m 15s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.83139} +{"loss": 0.48330563, "grad_norm": 1.41376457, "learning_rate": 4.937e-05, "token_acc": 0.85698162, "epoch": 0.51539194, "global_step/max_steps": "203/788", "elapsed_time": "2h 11m 16s", "remaining_time": "6h 18m 17s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.79883} +{"loss": 0.45035183, "grad_norm": 2.21613222, "learning_rate": 4.935e-05, "token_acc": 0.8646073, "epoch": 0.51793082, "global_step/max_steps": "204/788", "elapsed_time": "2h 11m 51s", "remaining_time": "6h 17m 26s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.777606} +{"loss": 0.50675356, "grad_norm": 4.42695108, "learning_rate": 4.932e-05, "token_acc": 0.85007776, "epoch": 0.52046969, "global_step/max_steps": "205/788", "elapsed_time": "2h 12m 28s", "remaining_time": "6h 16m 43s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.769918} +{"loss": 0.54933137, "grad_norm": 7.15430092, "learning_rate": 4.929e-05, "token_acc": 0.83781321, "epoch": 0.52300857, "global_step/max_steps": "206/788", "elapsed_time": "2h 12m 59s", "remaining_time": "6h 15m 44s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.734717} +{"loss": 0.49181426, "grad_norm": 1.96571216, "learning_rate": 4.926e-05, "token_acc": 0.85306012, "epoch": 0.52554745, "global_step/max_steps": "207/788", "elapsed_time": "2h 13m 44s", "remaining_time": "6h 15m 22s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.764083} +{"loss": 0.50236893, "grad_norm": 1.51248637, "learning_rate": 4.923e-05, "token_acc": 0.85121951, "epoch": 0.52808632, "global_step/max_steps": "208/788", "elapsed_time": "2h 14m 24s", "remaining_time": "6h 14m 46s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.769259} +{"loss": 0.56707466, "grad_norm": 2.33758258, "learning_rate": 4.92e-05, "token_acc": 0.83755523, "epoch": 0.5306252, "global_step/max_steps": "209/788", "elapsed_time": "2h 15m 7s", "remaining_time": "6h 14m 18s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.787251} +{"loss": 0.50014126, "grad_norm": 1.8418249, "learning_rate": 4.916e-05, "token_acc": 0.84730234, "epoch": 0.53316407, "global_step/max_steps": "210/788", "elapsed_time": "2h 15m 38s", "remaining_time": "6h 13m 19s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.752874} +{"loss": 0.58395779, "grad_norm": 2.42357772, "learning_rate": 4.913e-05, "token_acc": 0.83301513, "epoch": 0.53570295, "global_step/max_steps": "211/788", "elapsed_time": "2h 16m 16s", "remaining_time": "6h 12m 39s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.750522} +{"loss": 0.58909106, "grad_norm": 15.84128933, "learning_rate": 4.91e-05, "token_acc": 0.82998878, "epoch": 0.53824183, "global_step/max_steps": "212/788", "elapsed_time": "2h 17m 5s", "remaining_time": "6h 12m 28s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.798134} +{"loss": 0.51555121, "grad_norm": 2.12988456, "learning_rate": 4.907e-05, "token_acc": 0.84656085, "epoch": 0.5407807, "global_step/max_steps": "213/788", "elapsed_time": "2h 17m 45s", "remaining_time": "6h 11m 53s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.804716} +{"loss": 0.58695257, "grad_norm": 2.1579494, "learning_rate": 4.903e-05, "token_acc": 0.82644874, "epoch": 0.54331958, "global_step/max_steps": "214/788", "elapsed_time": "2h 18m 22s", "remaining_time": "6h 11m 9s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.79659} +{"loss": 0.53487408, "grad_norm": 3.01509103, "learning_rate": 4.9e-05, "token_acc": 0.83669598, "epoch": 0.54585846, "global_step/max_steps": "215/788", "elapsed_time": "2h 18m 55s", "remaining_time": "6h 10m 13s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.766384} +{"loss": 0.52151704, "grad_norm": 1.49831934, "learning_rate": 4.896e-05, "token_acc": 0.84550443, "epoch": 0.54839733, "global_step/max_steps": "216/788", "elapsed_time": "2h 19m 35s", "remaining_time": "6h 9m 38s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.772903} +{"loss": 0.62864077, "grad_norm": 7.63694619, "learning_rate": 4.893e-05, "token_acc": 0.82444417, "epoch": 0.55093621, "global_step/max_steps": "217/788", "elapsed_time": "2h 20m 20s", "remaining_time": "6h 9m 16s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.802445} +{"loss": 0.54050887, "grad_norm": 1.9091911, "learning_rate": 4.889e-05, "token_acc": 0.83981481, "epoch": 0.55347509, "global_step/max_steps": "218/788", "elapsed_time": "2h 21m 11s", "remaining_time": "6h 9m 9s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.858159} +{"loss": 0.52071071, "grad_norm": 2.12499447, "learning_rate": 4.885e-05, "token_acc": 0.85057831, "epoch": 0.55601396, "global_step/max_steps": "219/788", "elapsed_time": "2h 21m 50s", "remaining_time": "6h 8m 30s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.857925} +{"loss": 0.58135366, "grad_norm": 4.59013351, "learning_rate": 4.881e-05, "token_acc": 0.83187175, "epoch": 0.55855284, "global_step/max_steps": "220/788", "elapsed_time": "2h 22m 29s", "remaining_time": "6h 7m 52s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.859242} +{"loss": 0.54102373, "grad_norm": 1.64105202, "learning_rate": 4.878e-05, "token_acc": 0.83660468, "epoch": 0.56109172, "global_step/max_steps": "221/788", "elapsed_time": "2h 23m 4s", "remaining_time": "6h 7m 4s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.842195} +{"loss": 0.55335271, "grad_norm": 2.27749525, "learning_rate": 4.874e-05, "token_acc": 0.83638238, "epoch": 0.56363059, "global_step/max_steps": "222/788", "elapsed_time": "2h 23m 41s", "remaining_time": "6h 6m 20s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.833528} +{"loss": 0.55913615, "grad_norm": 4.15956652, "learning_rate": 4.87e-05, "token_acc": 0.83882668, "epoch": 0.56616947, "global_step/max_steps": "223/788", "elapsed_time": "2h 24m 21s", "remaining_time": "6h 5m 43s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.837003} +{"loss": 0.48401684, "grad_norm": 225.83355045, "learning_rate": 4.866e-05, "token_acc": 0.856043, "epoch": 0.56870835, "global_step/max_steps": "224/788", "elapsed_time": "2h 25m 2s", "remaining_time": "6h 5m 9s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.846072} +{"loss": 0.56712502, "grad_norm": 1.79417619, "learning_rate": 4.862e-05, "token_acc": 0.84050204, "epoch": 0.57124722, "global_step/max_steps": "225/788", "elapsed_time": "2h 25m 39s", "remaining_time": "6h 4m 26s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.83838} +{"loss": 0.55323219, "grad_norm": 1.69276956, "learning_rate": 4.858e-05, "token_acc": 0.83650772, "epoch": 0.5737861, "global_step/max_steps": "226/788", "elapsed_time": "2h 26m 20s", "remaining_time": "6h 3m 53s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.849171} +{"loss": 0.50393724, "grad_norm": 1.36773698, "learning_rate": 4.853e-05, "token_acc": 0.85330674, "epoch": 0.57632498, "global_step/max_steps": "227/788", "elapsed_time": "2h 27m 2s", "remaining_time": "6h 3m 22s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.862004} +{"loss": 0.498611, "grad_norm": 3.19859904, "learning_rate": 4.849e-05, "token_acc": 0.84534779, "epoch": 0.57886385, "global_step/max_steps": "228/788", "elapsed_time": "2h 27m 35s", "remaining_time": "6h 2m 29s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.837091} +{"loss": 0.51048326, "grad_norm": 2.54495766, "learning_rate": 4.845e-05, "token_acc": 0.84865024, "epoch": 0.58140273, "global_step/max_steps": "229/788", "elapsed_time": "2h 28m 13s", "remaining_time": "6h 1m 48s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.834493} +{"loss": 0.50585461, "grad_norm": 1.31187493, "learning_rate": 4.841e-05, "token_acc": 0.85320823, "epoch": 0.58394161, "global_step/max_steps": "230/788", "elapsed_time": "2h 28m 52s", "remaining_time": "6h 1m 10s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.835754} +{"loss": 0.55901521, "grad_norm": 2.18900447, "learning_rate": 4.836e-05, "token_acc": 0.83635603, "epoch": 0.58648048, "global_step/max_steps": "231/788", "elapsed_time": "2h 29m 35s", "remaining_time": "6h 0m 41s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.852036} +{"loss": 0.48457453, "grad_norm": 15.30797015, "learning_rate": 4.832e-05, "token_acc": 0.85255141, "epoch": 0.58901936, "global_step/max_steps": "232/788", "elapsed_time": "2h 30m 6s", "remaining_time": "5h 59m 44s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.819548} +{"loss": 0.57975549, "grad_norm": 1.71811636, "learning_rate": 4.827e-05, "token_acc": 0.83730811, "epoch": 0.59155824, "global_step/max_steps": "233/788", "elapsed_time": "2h 30m 50s", "remaining_time": "5h 59m 17s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.840989} +{"loss": 0.50129735, "grad_norm": 1.12884207, "learning_rate": 4.823e-05, "token_acc": 0.85294118, "epoch": 0.59409711, "global_step/max_steps": "234/788", "elapsed_time": "2h 31m 22s", "remaining_time": "5h 58m 23s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.813482} +{"loss": 0.55101192, "grad_norm": 1.43736842, "learning_rate": 4.818e-05, "token_acc": 0.83440226, "epoch": 0.59663599, "global_step/max_steps": "235/788", "elapsed_time": "2h 32m 7s", "remaining_time": "5h 57m 57s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.837951} +{"loss": 0.52165973, "grad_norm": 1.28900326, "learning_rate": 4.813e-05, "token_acc": 0.84932684, "epoch": 0.59917487, "global_step/max_steps": "236/788", "elapsed_time": "2h 32m 43s", "remaining_time": "5h 57m 12s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.826956} +{"loss": 0.6565842, "grad_norm": 1.40519649, "learning_rate": 4.809e-05, "token_acc": 0.81436877, "epoch": 0.60171374, "global_step/max_steps": "237/788", "elapsed_time": "2h 33m 24s", "remaining_time": "5h 56m 39s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.837255} +{"loss": 0.43846327, "grad_norm": 1.65190141, "learning_rate": 4.804e-05, "token_acc": 0.86470277, "epoch": 0.60425262, "global_step/max_steps": "238/788", "elapsed_time": "2h 33m 55s", "remaining_time": "5h 55m 41s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.801069} +{"loss": 0.50454819, "grad_norm": 1.89278139, "learning_rate": 4.799e-05, "token_acc": 0.85482156, "epoch": 0.60679149, "global_step/max_steps": "239/788", "elapsed_time": "2h 34m 34s", "remaining_time": "5h 55m 4s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.804971} +{"loss": 0.50446558, "grad_norm": 1.3750619, "learning_rate": 4.794e-05, "token_acc": 0.84568185, "epoch": 0.60933037, "global_step/max_steps": "240/788", "elapsed_time": "2h 35m 11s", "remaining_time": "5h 54m 20s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.795729} +{"loss": 0.43899271, "grad_norm": 1.77914255, "learning_rate": 4.789e-05, "token_acc": 0.86157104, "epoch": 0.61186925, "global_step/max_steps": "241/788", "elapsed_time": "2h 35m 40s", "remaining_time": "5h 53m 19s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.755012} +{"loss": 0.53678465, "grad_norm": 3.17491382, "learning_rate": 4.784e-05, "token_acc": 0.84129454, "epoch": 0.61440812, "global_step/max_steps": "242/788", "elapsed_time": "2h 36m 17s", "remaining_time": "5h 52m 37s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.749979} +{"loss": 0.50050223, "grad_norm": 2.44773411, "learning_rate": 4.779e-05, "token_acc": 0.84916634, "epoch": 0.616947, "global_step/max_steps": "243/788", "elapsed_time": "2h 37m 3s", "remaining_time": "5h 52m 14s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.777408} +{"loss": 0.54081184, "grad_norm": 2.8078141, "learning_rate": 4.774e-05, "token_acc": 0.83542111, "epoch": 0.61948588, "global_step/max_steps": "244/788", "elapsed_time": "2h 37m 52s", "remaining_time": "5h 51m 58s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.819455} +{"loss": 0.51596451, "grad_norm": 2.22799223, "learning_rate": 4.768e-05, "token_acc": 0.84291881, "epoch": 0.62202475, "global_step/max_steps": "245/788", "elapsed_time": "2h 38m 30s", "remaining_time": "5h 51m 18s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.81722} +{"loss": 0.54353952, "grad_norm": 3.92765593, "learning_rate": 4.763e-05, "token_acc": 0.83819289, "epoch": 0.62456363, "global_step/max_steps": "246/788", "elapsed_time": "2h 39m 9s", "remaining_time": "5h 50m 39s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.816905} +{"loss": 0.52800822, "grad_norm": 21.07592626, "learning_rate": 4.758e-05, "token_acc": 0.84378799, "epoch": 0.62710251, "global_step/max_steps": "247/788", "elapsed_time": "2h 40m 3s", "remaining_time": "5h 50m 34s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.880024} +{"loss": 0.54549384, "grad_norm": 2.43055282, "learning_rate": 4.752e-05, "token_acc": 0.83777112, "epoch": 0.62964138, "global_step/max_steps": "248/788", "elapsed_time": "2h 40m 32s", "remaining_time": "5h 49m 32s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.837487} +{"loss": 0.58961093, "grad_norm": 4.77444577, "learning_rate": 4.747e-05, "token_acc": 0.8303084, "epoch": 0.63218026, "global_step/max_steps": "249/788", "elapsed_time": "2h 41m 13s", "remaining_time": "5h 48m 60s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.849001} +{"loss": 0.52585483, "grad_norm": 2.92858749, "learning_rate": 4.741e-05, "token_acc": 0.84593063, "epoch": 0.63471914, "global_step/max_steps": "250/788", "elapsed_time": "2h 41m 55s", "remaining_time": "5h 48m 28s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.861972} +{"loss": 0.49738741, "grad_norm": 1.15517321, "learning_rate": 4.736e-05, "token_acc": 0.852301, "epoch": 0.63725801, "global_step/max_steps": "251/788", "elapsed_time": "2h 42m 32s", "remaining_time": "5h 47m 44s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.853696} +{"loss": 0.48979348, "grad_norm": 1.404758, "learning_rate": 4.73e-05, "token_acc": 0.85192336, "epoch": 0.63979689, "global_step/max_steps": "252/788", "elapsed_time": "2h 43m 10s", "remaining_time": "5h 47m 4s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.849821} +{"loss": 0.46714497, "grad_norm": 1.15990308, "learning_rate": 4.725e-05, "token_acc": 0.85476524, "epoch": 0.64233577, "global_step/max_steps": "253/788", "elapsed_time": "2h 43m 43s", "remaining_time": "5h 46m 13s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.827604} +{"loss": 0.52489072, "grad_norm": 9.76785777, "learning_rate": 4.719e-05, "token_acc": 0.84362386, "epoch": 0.64487464, "global_step/max_steps": "254/788", "elapsed_time": "2h 44m 29s", "remaining_time": "5h 45m 48s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.853915} +{"loss": 0.49223301, "grad_norm": 1.58362691, "learning_rate": 4.713e-05, "token_acc": 0.85374409, "epoch": 0.64741352, "global_step/max_steps": "255/788", "elapsed_time": "2h 45m 10s", "remaining_time": "5h 45m 14s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.863252} +{"loss": 0.4923901, "grad_norm": 1.67613357, "learning_rate": 4.707e-05, "token_acc": 0.8473175, "epoch": 0.6499524, "global_step/max_steps": "256/788", "elapsed_time": "2h 45m 42s", "remaining_time": "5h 44m 21s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.837309} +{"loss": 0.55488122, "grad_norm": 12.42057825, "learning_rate": 4.701e-05, "token_acc": 0.83599898, "epoch": 0.65249127, "global_step/max_steps": "257/788", "elapsed_time": "2h 46m 28s", "remaining_time": "5h 43m 57s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.864048} +{"loss": 0.53331125, "grad_norm": 2.74601324, "learning_rate": 4.696e-05, "token_acc": 0.84318628, "epoch": 0.65503015, "global_step/max_steps": "258/788", "elapsed_time": "2h 46m 58s", "remaining_time": "5h 42m 60s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.829661} +{"loss": 0.54084122, "grad_norm": 2.14376893, "learning_rate": 4.69e-05, "token_acc": 0.84373736, "epoch": 0.65756903, "global_step/max_steps": "259/788", "elapsed_time": "2h 47m 41s", "remaining_time": "5h 42m 29s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.844921} +{"loss": 0.51555502, "grad_norm": 1.55281405, "learning_rate": 4.684e-05, "token_acc": 0.84992101, "epoch": 0.6601079, "global_step/max_steps": "260/788", "elapsed_time": "2h 48m 12s", "remaining_time": "5h 41m 35s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.815572} +{"loss": 0.5099777, "grad_norm": 1.20344586, "learning_rate": 4.677e-05, "token_acc": 0.84720368, "epoch": 0.66264678, "global_step/max_steps": "261/788", "elapsed_time": "2h 48m 51s", "remaining_time": "5h 40m 55s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.81448} +{"loss": 0.59470832, "grad_norm": 2.9242207, "learning_rate": 4.671e-05, "token_acc": 0.82904509, "epoch": 0.66518566, "global_step/max_steps": "262/788", "elapsed_time": "2h 49m 29s", "remaining_time": "5h 40m 17s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.814866} +{"loss": 0.5068028, "grad_norm": 1.45595531, "learning_rate": 4.665e-05, "token_acc": 0.84820723, "epoch": 0.66772453, "global_step/max_steps": "263/788", "elapsed_time": "2h 50m 2s", "remaining_time": "5h 39m 25s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.789629} +{"loss": 0.53652614, "grad_norm": 3.34494526, "learning_rate": 4.659e-05, "token_acc": 0.84151922, "epoch": 0.67026341, "global_step/max_steps": "264/788", "elapsed_time": "2h 50m 39s", "remaining_time": "5h 38m 43s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.784409} +{"loss": 0.47964984, "grad_norm": 1.9005204, "learning_rate": 4.652e-05, "token_acc": 0.85550902, "epoch": 0.67280228, "global_step/max_steps": "265/788", "elapsed_time": "2h 51m 12s", "remaining_time": "5h 37m 53s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.763836} +{"loss": 0.49148357, "grad_norm": 2.87268997, "learning_rate": 4.646e-05, "token_acc": 0.85878753, "epoch": 0.67534116, "global_step/max_steps": "266/788", "elapsed_time": "2h 51m 54s", "remaining_time": "5h 37m 20s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.773903} +{"loss": 0.53795946, "grad_norm": 3.62028954, "learning_rate": 4.64e-05, "token_acc": 0.84428664, "epoch": 0.67788004, "global_step/max_steps": "267/788", "elapsed_time": "2h 52m 41s", "remaining_time": "5h 36m 57s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.804503} +{"loss": 0.40906715, "grad_norm": 1.88004863, "learning_rate": 4.633e-05, "token_acc": 0.86778659, "epoch": 0.68041891, "global_step/max_steps": "268/788", "elapsed_time": "2h 53m 16s", "remaining_time": "5h 36m 11s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.791127} +{"loss": 0.56982619, "grad_norm": 3.25297493, "learning_rate": 4.627e-05, "token_acc": 0.82951764, "epoch": 0.68295779, "global_step/max_steps": "269/788", "elapsed_time": "2h 53m 59s", "remaining_time": "5h 35m 41s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.807582} +{"loss": 0.54030013, "grad_norm": 1.41157564, "learning_rate": 4.62e-05, "token_acc": 0.83929323, "epoch": 0.68549667, "global_step/max_steps": "270/788", "elapsed_time": "2h 54m 44s", "remaining_time": "5h 35m 13s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.827866} +{"loss": 0.43809918, "grad_norm": 1.57319297, "learning_rate": 4.613e-05, "token_acc": 0.85817432, "epoch": 0.68803554, "global_step/max_steps": "271/788", "elapsed_time": "2h 55m 14s", "remaining_time": "5h 34m 18s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.796603} +{"loss": 0.44976079, "grad_norm": 2.42935394, "learning_rate": 4.607e-05, "token_acc": 0.86688312, "epoch": 0.69057442, "global_step/max_steps": "272/788", "elapsed_time": "2h 55m 52s", "remaining_time": "5h 33m 37s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.792527} +{"loss": 0.47947454, "grad_norm": 1.47404222, "learning_rate": 4.6e-05, "token_acc": 0.85823456, "epoch": 0.6931133, "global_step/max_steps": "273/788", "elapsed_time": "2h 56m 28s", "remaining_time": "5h 32m 53s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.783222} +{"loss": 0.57345837, "grad_norm": 1.49626725, "learning_rate": 4.593e-05, "token_acc": 0.83589897, "epoch": 0.69565217, "global_step/max_steps": "274/788", "elapsed_time": "2h 57m 10s", "remaining_time": "5h 32m 22s", "memory(GiB)": 50.95, "train_speed(s/it)": 38.797303} +{"loss": 0.47569674, "grad_norm": 2.58214021, "learning_rate": 4.586e-05, "token_acc": 0.85139263, "epoch": 0.69819105, "global_step/max_steps": "275/788", "elapsed_time": "2h 57m 50s", "remaining_time": "5h 31m 44s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.799251} +{"loss": 0.45139784, "grad_norm": 2.0299053, "learning_rate": 4.58e-05, "token_acc": 0.85953331, "epoch": 0.70072993, "global_step/max_steps": "276/788", "elapsed_time": "2h 58m 29s", "remaining_time": "5h 31m 5s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.799553} +{"loss": 0.49242127, "grad_norm": 1.46832368, "learning_rate": 4.573e-05, "token_acc": 0.85096306, "epoch": 0.7032688, "global_step/max_steps": "277/788", "elapsed_time": "2h 59m 4s", "remaining_time": "5h 30m 21s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.788072} +{"loss": 0.50971919, "grad_norm": 1.6692648, "learning_rate": 4.566e-05, "token_acc": 0.85046729, "epoch": 0.70580768, "global_step/max_steps": "278/788", "elapsed_time": "2h 59m 42s", "remaining_time": "5h 29m 40s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.783374} +{"loss": 0.47214332, "grad_norm": 2.77257377, "learning_rate": 4.559e-05, "token_acc": 0.85845718, "epoch": 0.70834656, "global_step/max_steps": "279/788", "elapsed_time": "3h 0m 19s", "remaining_time": "5h 28m 58s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.777131} +{"loss": 0.51758218, "grad_norm": 2.00607077, "learning_rate": 4.551e-05, "token_acc": 0.84688091, "epoch": 0.71088543, "global_step/max_steps": "280/788", "elapsed_time": "3h 0m 58s", "remaining_time": "5h 28m 19s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.777239} +{"loss": 0.52577788, "grad_norm": 1.84879861, "learning_rate": 4.544e-05, "token_acc": 0.8475199, "epoch": 0.71342431, "global_step/max_steps": "281/788", "elapsed_time": "3h 1m 32s", "remaining_time": "5h 27m 33s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.762427} +{"loss": 0.56299943, "grad_norm": 2.12778275, "learning_rate": 4.537e-05, "token_acc": 0.84088235, "epoch": 0.71596319, "global_step/max_steps": "282/788", "elapsed_time": "3h 2m 7s", "remaining_time": "5h 26m 47s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.749184} +{"loss": 0.52071071, "grad_norm": 2.56851783, "learning_rate": 4.53e-05, "token_acc": 0.84691474, "epoch": 0.71850206, "global_step/max_steps": "283/788", "elapsed_time": "3h 2m 47s", "remaining_time": "5h 26m 10s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.751604} +{"loss": 0.51153451, "grad_norm": 6.27752749, "learning_rate": 4.523e-05, "token_acc": 0.84542683, "epoch": 0.72104094, "global_step/max_steps": "284/788", "elapsed_time": "3h 3m 25s", "remaining_time": "5h 25m 30s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.750122} +{"loss": 0.48648286, "grad_norm": 1.29791639, "learning_rate": 4.515e-05, "token_acc": 0.85595486, "epoch": 0.72357982, "global_step/max_steps": "285/788", "elapsed_time": "3h 4m 7s", "remaining_time": "5h 24m 57s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.760747} +{"loss": 0.4941543, "grad_norm": 1.99528381, "learning_rate": 4.508e-05, "token_acc": 0.84802279, "epoch": 0.72611869, "global_step/max_steps": "286/788", "elapsed_time": "3h 4m 44s", "remaining_time": "5h 24m 15s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.754262} +{"loss": 0.5226168, "grad_norm": 1.73145564, "learning_rate": 4.5e-05, "token_acc": 0.84936122, "epoch": 0.72865757, "global_step/max_steps": "287/788", "elapsed_time": "3h 5m 32s", "remaining_time": "5h 23m 52s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.785959} +{"loss": 0.47298491, "grad_norm": 4.40006164, "learning_rate": 4.493e-05, "token_acc": 0.85313794, "epoch": 0.73119645, "global_step/max_steps": "288/788", "elapsed_time": "3h 6m 10s", "remaining_time": "5h 23m 12s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.784828} +{"loss": 0.55649346, "grad_norm": 6.39472451, "learning_rate": 4.485e-05, "token_acc": 0.83775039, "epoch": 0.73373532, "global_step/max_steps": "289/788", "elapsed_time": "3h 6m 48s", "remaining_time": "5h 22m 32s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.780589} +{"loss": 0.5449816, "grad_norm": 1.4562222, "learning_rate": 4.478e-05, "token_acc": 0.83879284, "epoch": 0.7362742, "global_step/max_steps": "290/788", "elapsed_time": "3h 7m 24s", "remaining_time": "5h 21m 49s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.773482} +{"loss": 0.53776956, "grad_norm": 2.12916422, "learning_rate": 4.47e-05, "token_acc": 0.84063047, "epoch": 0.73881308, "global_step/max_steps": "291/788", "elapsed_time": "3h 8m 10s", "remaining_time": "5h 21m 21s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.795737} +{"loss": 0.46235996, "grad_norm": 2.41237072, "learning_rate": 4.462e-05, "token_acc": 0.85586799, "epoch": 0.74135195, "global_step/max_steps": "292/788", "elapsed_time": "3h 8m 40s", "remaining_time": "5h 20m 28s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.767096} +{"loss": 0.55398488, "grad_norm": 2.31468148, "learning_rate": 4.455e-05, "token_acc": 0.84117234, "epoch": 0.74389083, "global_step/max_steps": "293/788", "elapsed_time": "3h 9m 14s", "remaining_time": "5h 19m 41s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.749224} +{"loss": 0.48377201, "grad_norm": 1.99697759, "learning_rate": 4.447e-05, "token_acc": 0.8496886, "epoch": 0.7464297, "global_step/max_steps": "294/788", "elapsed_time": "3h 9m 47s", "remaining_time": "5h 18m 54s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.73278} +{"loss": 0.56681049, "grad_norm": 2.86751777, "learning_rate": 4.439e-05, "token_acc": 0.83262685, "epoch": 0.74896858, "global_step/max_steps": "295/788", "elapsed_time": "3h 10m 33s", "remaining_time": "5h 18m 27s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.75665} +{"loss": 0.47740826, "grad_norm": 2.78751644, "learning_rate": 4.431e-05, "token_acc": 0.85590062, "epoch": 0.75150746, "global_step/max_steps": "296/788", "elapsed_time": "3h 11m 5s", "remaining_time": "5h 17m 36s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.732138} +{"loss": 0.50951183, "grad_norm": 3.72819969, "learning_rate": 4.423e-05, "token_acc": 0.8488717, "epoch": 0.75404633, "global_step/max_steps": "297/788", "elapsed_time": "3h 11m 51s", "remaining_time": "5h 17m 11s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.75866} +{"loss": 0.51457536, "grad_norm": 2.54127768, "learning_rate": 4.415e-05, "token_acc": 0.84568856, "epoch": 0.75658521, "global_step/max_steps": "298/788", "elapsed_time": "3h 12m 29s", "remaining_time": "5h 16m 30s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.754462} +{"loss": 0.43582511, "grad_norm": 3.10909066, "learning_rate": 4.407e-05, "token_acc": 0.86188754, "epoch": 0.75912409, "global_step/max_steps": "299/788", "elapsed_time": "3h 13m 1s", "remaining_time": "5h 15m 39s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.7309} +{"loss": 0.48396885, "grad_norm": 1.62975484, "learning_rate": 4.399e-05, "token_acc": 0.85289465, "epoch": 0.76166296, "global_step/max_steps": "300/788", "elapsed_time": "3h 13m 36s", "remaining_time": "5h 14m 56s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.721637} +{"loss": 0.53150791, "grad_norm": 1.61394295, "learning_rate": 4.391e-05, "token_acc": 0.84649611, "epoch": 0.76420184, "global_step/max_steps": "301/788", "elapsed_time": "3h 14m 14s", "remaining_time": "5h 14m 15s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.716043} +{"loss": 0.43339255, "grad_norm": 1.958784, "learning_rate": 4.383e-05, "token_acc": 0.86559232, "epoch": 0.76674072, "global_step/max_steps": "302/788", "elapsed_time": "3h 14m 46s", "remaining_time": "5h 13m 26s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.69545} +{"loss": 0.43618634, "grad_norm": 2.93439184, "learning_rate": 4.374e-05, "token_acc": 0.85984663, "epoch": 0.76927959, "global_step/max_steps": "303/788", "elapsed_time": "3h 15m 23s", "remaining_time": "5h 12m 45s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.690309} +{"loss": 0.51120341, "grad_norm": 3.23794047, "learning_rate": 4.366e-05, "token_acc": 0.84611187, "epoch": 0.77181847, "global_step/max_steps": "304/788", "elapsed_time": "3h 16m 7s", "remaining_time": "5h 12m 14s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.705713} +{"loss": 0.44543475, "grad_norm": 2.27414774, "learning_rate": 4.358e-05, "token_acc": 0.86011518, "epoch": 0.77435735, "global_step/max_steps": "305/788", "elapsed_time": "3h 16m 37s", "remaining_time": "5h 11m 22s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.678845} +{"loss": 0.51486075, "grad_norm": 4.94401544, "learning_rate": 4.349e-05, "token_acc": 0.84617617, "epoch": 0.77689622, "global_step/max_steps": "306/788", "elapsed_time": "3h 17m 18s", "remaining_time": "5h 10m 46s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.684821} +{"loss": 0.45893684, "grad_norm": 1.19291957, "learning_rate": 4.341e-05, "token_acc": 0.85548257, "epoch": 0.7794351, "global_step/max_steps": "307/788", "elapsed_time": "3h 17m 52s", "remaining_time": "5h 10m 1s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.671093} +{"loss": 0.44666591, "grad_norm": 2.32138976, "learning_rate": 4.333e-05, "token_acc": 0.85868587, "epoch": 0.78197398, "global_step/max_steps": "308/788", "elapsed_time": "3h 18m 25s", "remaining_time": "5h 9m 13s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.651636} +{"loss": 0.54382396, "grad_norm": 1.75075516, "learning_rate": 4.324e-05, "token_acc": 0.84348064, "epoch": 0.78451285, "global_step/max_steps": "309/788", "elapsed_time": "3h 19m 4s", "remaining_time": "5h 8m 36s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.655128} +{"loss": 0.45011503, "grad_norm": 1.7799819, "learning_rate": 4.316e-05, "token_acc": 0.86039886, "epoch": 0.78705173, "global_step/max_steps": "310/788", "elapsed_time": "3h 19m 45s", "remaining_time": "5h 8m 0s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.661959} +{"loss": 0.47440889, "grad_norm": 1.11734247, "learning_rate": 4.307e-05, "token_acc": 0.85557197, "epoch": 0.78959061, "global_step/max_steps": "311/788", "elapsed_time": "3h 20m 18s", "remaining_time": "5h 7m 12s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.642089} +{"loss": 0.44567794, "grad_norm": 1.66086508, "learning_rate": 4.298e-05, "token_acc": 0.86105707, "epoch": 0.79212948, "global_step/max_steps": "312/788", "elapsed_time": "3h 20m 53s", "remaining_time": "5h 6m 28s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.631105} +{"loss": 0.47883189, "grad_norm": 1.50832888, "learning_rate": 4.29e-05, "token_acc": 0.85518423, "epoch": 0.79466836, "global_step/max_steps": "313/788", "elapsed_time": "3h 21m 27s", "remaining_time": "5h 5m 42s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.615654} +{"loss": 0.46597987, "grad_norm": 1.29377805, "learning_rate": 4.281e-05, "token_acc": 0.85934765, "epoch": 0.79720724, "global_step/max_steps": "314/788", "elapsed_time": "3h 22m 1s", "remaining_time": "5h 4m 57s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.600935} +{"loss": 0.50889766, "grad_norm": 1.02330559, "learning_rate": 4.272e-05, "token_acc": 0.84296271, "epoch": 0.79974611, "global_step/max_steps": "315/788", "elapsed_time": "3h 22m 36s", "remaining_time": "5h 4m 13s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.589692} +{"loss": 0.44567388, "grad_norm": 1.0571729, "learning_rate": 4.263e-05, "token_acc": 0.86663826, "epoch": 0.80228499, "global_step/max_steps": "316/788", "elapsed_time": "3h 23m 17s", "remaining_time": "5h 3m 38s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.597428} +{"loss": 0.46786332, "grad_norm": 1.81983267, "learning_rate": 4.254e-05, "token_acc": 0.85468177, "epoch": 0.80482387, "global_step/max_steps": "317/788", "elapsed_time": "3h 23m 52s", "remaining_time": "5h 2m 55s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.587329} +{"loss": 0.50103366, "grad_norm": 1.5377357, "learning_rate": 4.246e-05, "token_acc": 0.84652788, "epoch": 0.80736274, "global_step/max_steps": "318/788", "elapsed_time": "3h 24m 30s", "remaining_time": "5h 2m 15s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.585715} +{"loss": 0.52334827, "grad_norm": 1.41816305, "learning_rate": 4.237e-05, "token_acc": 0.84360902, "epoch": 0.80990162, "global_step/max_steps": "319/788", "elapsed_time": "3h 25m 10s", "remaining_time": "5h 1m 38s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.58878} +{"loss": 0.45297539, "grad_norm": 2.79685176, "learning_rate": 4.228e-05, "token_acc": 0.85871219, "epoch": 0.8124405, "global_step/max_steps": "320/788", "elapsed_time": "3h 25m 41s", "remaining_time": "5h 0m 49s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.567019} +{"loss": 0.49113718, "grad_norm": 3.96325593, "learning_rate": 4.219e-05, "token_acc": 0.84995932, "epoch": 0.81497937, "global_step/max_steps": "321/788", "elapsed_time": "3h 26m 17s", "remaining_time": "5h 0m 6s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.556928} +{"loss": 0.47606844, "grad_norm": 1.52126786, "learning_rate": 4.21e-05, "token_acc": 0.85817308, "epoch": 0.81751825, "global_step/max_steps": "322/788", "elapsed_time": "3h 26m 48s", "remaining_time": "4h 59m 16s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.533013} +{"loss": 0.52879435, "grad_norm": 1.19798948, "learning_rate": 4.2e-05, "token_acc": 0.84003162, "epoch": 0.82005712, "global_step/max_steps": "323/788", "elapsed_time": "3h 27m 34s", "remaining_time": "4h 58m 49s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.557925} +{"loss": 0.45438772, "grad_norm": 13.23128336, "learning_rate": 4.191e-05, "token_acc": 0.85933749, "epoch": 0.822596, "global_step/max_steps": "324/788", "elapsed_time": "3h 28m 15s", "remaining_time": "4h 58m 13s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.563533} +{"loss": 0.46887136, "grad_norm": 1.95663557, "learning_rate": 4.182e-05, "token_acc": 0.86102496, "epoch": 0.82513488, "global_step/max_steps": "325/788", "elapsed_time": "3h 28m 47s", "remaining_time": "4h 57m 27s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.545673} +{"loss": 0.54284966, "grad_norm": 4.32383938, "learning_rate": 4.173e-05, "token_acc": 0.84134746, "epoch": 0.82767375, "global_step/max_steps": "326/788", "elapsed_time": "3h 29m 29s", "remaining_time": "4h 56m 53s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.555459} +{"loss": 0.56516427, "grad_norm": 2.71363967, "learning_rate": 4.164e-05, "token_acc": 0.8335643, "epoch": 0.83021263, "global_step/max_steps": "327/788", "elapsed_time": "3h 30m 11s", "remaining_time": "4h 56m 18s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.564537} +{"loss": 0.42816389, "grad_norm": 2.20056409, "learning_rate": 4.154e-05, "token_acc": 0.86552926, "epoch": 0.83275151, "global_step/max_steps": "328/788", "elapsed_time": "3h 30m 46s", "remaining_time": "4h 55m 35s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.554537} +{"loss": 0.54066759, "grad_norm": 1.76938525, "learning_rate": 4.145e-05, "token_acc": 0.8363126, "epoch": 0.83529038, "global_step/max_steps": "329/788", "elapsed_time": "3h 31m 24s", "remaining_time": "4h 54m 55s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.551864} +{"loss": 0.47528088, "grad_norm": 1.28249364, "learning_rate": 4.135e-05, "token_acc": 0.8529365, "epoch": 0.83782926, "global_step/max_steps": "330/788", "elapsed_time": "3h 32m 3s", "remaining_time": "4h 54m 19s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.555898} +{"loss": 0.47919372, "grad_norm": 2.12907558, "learning_rate": 4.126e-05, "token_acc": 0.85177767, "epoch": 0.84036814, "global_step/max_steps": "331/788", "elapsed_time": "3h 32m 56s", "remaining_time": "4h 53m 59s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.597977} +{"loss": 0.45833892, "grad_norm": 1.79232541, "learning_rate": 4.116e-05, "token_acc": 0.85786969, "epoch": 0.84290701, "global_step/max_steps": "332/788", "elapsed_time": "3h 33m 31s", "remaining_time": "4h 53m 15s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.586116} +{"loss": 0.47510171, "grad_norm": 3.83169695, "learning_rate": 4.107e-05, "token_acc": 0.85651618, "epoch": 0.84544589, "global_step/max_steps": "333/788", "elapsed_time": "3h 34m 4s", "remaining_time": "4h 52m 30s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.571082} +{"loss": 0.51709265, "grad_norm": 1.3534101, "learning_rate": 4.097e-05, "token_acc": 0.84457525, "epoch": 0.84798477, "global_step/max_steps": "334/788", "elapsed_time": "3h 34m 36s", "remaining_time": "4h 51m 42s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.551528} +{"loss": 0.56002092, "grad_norm": 1.72634717, "learning_rate": 4.088e-05, "token_acc": 0.83699749, "epoch": 0.85052364, "global_step/max_steps": "335/788", "elapsed_time": "3h 35m 14s", "remaining_time": "4h 51m 3s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.550106} +{"loss": 0.48105574, "grad_norm": 1.97689526, "learning_rate": 4.078e-05, "token_acc": 0.84865196, "epoch": 0.85306252, "global_step/max_steps": "336/788", "elapsed_time": "3h 35m 48s", "remaining_time": "4h 50m 18s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.535529} +{"loss": 0.53572255, "grad_norm": 1.36182341, "learning_rate": 4.068e-05, "token_acc": 0.84118117, "epoch": 0.8556014, "global_step/max_steps": "337/788", "elapsed_time": "3h 36m 33s", "remaining_time": "4h 49m 48s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.554349} +{"loss": 0.51016068, "grad_norm": 1.74109347, "learning_rate": 4.059e-05, "token_acc": 0.84135754, "epoch": 0.85814027, "global_step/max_steps": "338/788", "elapsed_time": "3h 37m 15s", "remaining_time": "4h 49m 14s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.564739} +{"loss": 0.49280506, "grad_norm": 1.64624469, "learning_rate": 4.049e-05, "token_acc": 0.84609676, "epoch": 0.86067915, "global_step/max_steps": "339/788", "elapsed_time": "3h 37m 53s", "remaining_time": "4h 48m 35s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.562445} +{"loss": 0.51749152, "grad_norm": 1.22893601, "learning_rate": 4.039e-05, "token_acc": 0.84376018, "epoch": 0.86321803, "global_step/max_steps": "340/788", "elapsed_time": "3h 38m 35s", "remaining_time": "4h 48m 1s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.573366} +{"loss": 0.41705322, "grad_norm": 1.46121436, "learning_rate": 4.029e-05, "token_acc": 0.86530993, "epoch": 0.8657569, "global_step/max_steps": "341/788", "elapsed_time": "3h 39m 11s", "remaining_time": "4h 47m 19s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.566375} +{"loss": 0.51543891, "grad_norm": 1.79705924, "learning_rate": 4.019e-05, "token_acc": 0.84392978, "epoch": 0.86829578, "global_step/max_steps": "342/788", "elapsed_time": "3h 39m 58s", "remaining_time": "4h 46m 52s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.590812} +{"loss": 0.45814094, "grad_norm": 2.0685484, "learning_rate": 4.01e-05, "token_acc": 0.85916156, "epoch": 0.87083466, "global_step/max_steps": "343/788", "elapsed_time": "3h 40m 36s", "remaining_time": "4h 46m 12s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.587876} +{"loss": 0.51065159, "grad_norm": 2.10634785, "learning_rate": 4e-05, "token_acc": 0.84444444, "epoch": 0.87337353, "global_step/max_steps": "344/788", "elapsed_time": "3h 41m 22s", "remaining_time": "4h 45m 43s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.609268} +{"loss": 0.52300489, "grad_norm": 2.27759959, "learning_rate": 3.99e-05, "token_acc": 0.84134165, "epoch": 0.87591241, "global_step/max_steps": "345/788", "elapsed_time": "3h 41m 57s", "remaining_time": "4h 44m 59s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.599084} +{"loss": 0.47959799, "grad_norm": 2.12251689, "learning_rate": 3.98e-05, "token_acc": 0.85663833, "epoch": 0.87845129, "global_step/max_steps": "346/788", "elapsed_time": "3h 42m 34s", "remaining_time": "4h 44m 19s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.595322} +{"loss": 0.41639, "grad_norm": 6.77149152, "learning_rate": 3.969e-05, "token_acc": 0.86964191, "epoch": 0.88099016, "global_step/max_steps": "347/788", "elapsed_time": "3h 43m 5s", "remaining_time": "4h 43m 31s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.573558} +{"loss": 0.44258282, "grad_norm": 8.92991954, "learning_rate": 3.959e-05, "token_acc": 0.85978876, "epoch": 0.88352904, "global_step/max_steps": "348/788", "elapsed_time": "3h 43m 47s", "remaining_time": "4h 42m 56s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.582911} +{"loss": 0.44385579, "grad_norm": 7.53078554, "learning_rate": 3.949e-05, "token_acc": 0.86576788, "epoch": 0.88606791, "global_step/max_steps": "349/788", "elapsed_time": "3h 44m 27s", "remaining_time": "4h 42m 19s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.586418} +{"loss": 0.48342395, "grad_norm": 2.63435209, "learning_rate": 3.939e-05, "token_acc": 0.8567626, "epoch": 0.88860679, "global_step/max_steps": "350/788", "elapsed_time": "3h 45m 0s", "remaining_time": "4h 41m 35s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.572363} +{"loss": 0.4776611, "grad_norm": 1.58014128, "learning_rate": 3.929e-05, "token_acc": 0.85212915, "epoch": 0.89114567, "global_step/max_steps": "351/788", "elapsed_time": "3h 45m 37s", "remaining_time": "4h 40m 53s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.565699} +{"loss": 0.45217645, "grad_norm": 3.7389218, "learning_rate": 3.919e-05, "token_acc": 0.85855619, "epoch": 0.89368454, "global_step/max_steps": "352/788", "elapsed_time": "3h 46m 14s", "remaining_time": "4h 40m 13s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.562393} +{"loss": 0.52420312, "grad_norm": 1.68905758, "learning_rate": 3.908e-05, "token_acc": 0.84535462, "epoch": 0.89622342, "global_step/max_steps": "353/788", "elapsed_time": "3h 46m 55s", "remaining_time": "4h 39m 37s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.568385} +{"loss": 0.48304439, "grad_norm": 1.99296535, "learning_rate": 3.898e-05, "token_acc": 0.85540149, "epoch": 0.8987623, "global_step/max_steps": "354/788", "elapsed_time": "3h 47m 32s", "remaining_time": "4h 38m 57s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.564353} +{"loss": 0.46630284, "grad_norm": 1.29644057, "learning_rate": 3.888e-05, "token_acc": 0.85612016, "epoch": 0.90130117, "global_step/max_steps": "355/788", "elapsed_time": "3h 48m 17s", "remaining_time": "4h 38m 27s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.583481} +{"loss": 0.50149602, "grad_norm": 8.39081588, "learning_rate": 3.877e-05, "token_acc": 0.85042621, "epoch": 0.90384005, "global_step/max_steps": "356/788", "elapsed_time": "3h 49m 0s", "remaining_time": "4h 37m 53s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.595732} +{"loss": 0.58279228, "grad_norm": 1.88617714, "learning_rate": 3.867e-05, "token_acc": 0.83222802, "epoch": 0.90637893, "global_step/max_steps": "357/788", "elapsed_time": "3h 49m 45s", "remaining_time": "4h 37m 23s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.614808} +{"loss": 0.52544308, "grad_norm": 1.63198289, "learning_rate": 3.856e-05, "token_acc": 0.84558943, "epoch": 0.9089178, "global_step/max_steps": "358/788", "elapsed_time": "3h 50m 29s", "remaining_time": "4h 36m 50s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.628434} +{"loss": 0.50341594, "grad_norm": 1.61849386, "learning_rate": 3.846e-05, "token_acc": 0.84778272, "epoch": 0.91145668, "global_step/max_steps": "359/788", "elapsed_time": "3h 51m 12s", "remaining_time": "4h 36m 17s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.641987} +{"loss": 0.44096446, "grad_norm": 2.61686602, "learning_rate": 3.835e-05, "token_acc": 0.86245582, "epoch": 0.91399556, "global_step/max_steps": "360/788", "elapsed_time": "3h 51m 51s", "remaining_time": "4h 35m 39s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.641737} +{"loss": 0.48268509, "grad_norm": 1.10821614, "learning_rate": 3.825e-05, "token_acc": 0.85427696, "epoch": 0.91653443, "global_step/max_steps": "361/788", "elapsed_time": "3h 52m 33s", "remaining_time": "4h 35m 4s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.651674} +{"loss": 0.55436856, "grad_norm": 1.47065204, "learning_rate": 3.814e-05, "token_acc": 0.8411547, "epoch": 0.91907331, "global_step/max_steps": "362/788", "elapsed_time": "3h 53m 11s", "remaining_time": "4h 34m 24s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.648742} +{"loss": 0.46426547, "grad_norm": 1.49375677, "learning_rate": 3.804e-05, "token_acc": 0.85845092, "epoch": 0.92161219, "global_step/max_steps": "363/788", "elapsed_time": "3h 53m 45s", "remaining_time": "4h 33m 41s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.637223} +{"loss": 0.43454286, "grad_norm": 1.16431937, "learning_rate": 3.793e-05, "token_acc": 0.86938268, "epoch": 0.92415106, "global_step/max_steps": "364/788", "elapsed_time": "3h 54m 27s", "remaining_time": "4h 33m 6s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.64679} +{"loss": 0.40108055, "grad_norm": 1.46474619, "learning_rate": 3.782e-05, "token_acc": 0.87421687, "epoch": 0.92668994, "global_step/max_steps": "365/788", "elapsed_time": "3h 55m 4s", "remaining_time": "4h 32m 25s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.640846} +{"loss": 0.4839457, "grad_norm": 1.63392808, "learning_rate": 3.772e-05, "token_acc": 0.85363671, "epoch": 0.92922882, "global_step/max_steps": "366/788", "elapsed_time": "3h 55m 48s", "remaining_time": "4h 31m 53s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.65549} +{"loss": 0.51642126, "grad_norm": 1.49900299, "learning_rate": 3.761e-05, "token_acc": 0.84878745, "epoch": 0.93176769, "global_step/max_steps": "367/788", "elapsed_time": "3h 56m 32s", "remaining_time": "4h 31m 21s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.671302} +{"loss": 0.51126027, "grad_norm": 1.24650539, "learning_rate": 3.75e-05, "token_acc": 0.84929024, "epoch": 0.93430657, "global_step/max_steps": "368/788", "elapsed_time": "3h 57m 18s", "remaining_time": "4h 30m 50s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.690444} +{"loss": 0.43839368, "grad_norm": 3.10741343, "learning_rate": 3.739e-05, "token_acc": 0.86068966, "epoch": 0.93684545, "global_step/max_steps": "369/788", "elapsed_time": "3h 58m 8s", "remaining_time": "4h 30m 24s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.720707} +{"loss": 0.46092716, "grad_norm": 37.63599594, "learning_rate": 3.728e-05, "token_acc": 0.85972123, "epoch": 0.93938432, "global_step/max_steps": "370/788", "elapsed_time": "3h 58m 43s", "remaining_time": "4h 29m 41s", "memory(GiB)": 51.83, "train_speed(s/it)": 38.711129} +{"loss": 0.54139423, "grad_norm": 3.57793752, "learning_rate": 3.717e-05, "token_acc": 0.83504261, "epoch": 0.9419232, "global_step/max_steps": "371/788", "elapsed_time": "3h 59m 34s", "remaining_time": "4h 29m 16s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.742593} +{"loss": 0.48648974, "grad_norm": 5.47409207, "learning_rate": 3.707e-05, "token_acc": 0.85858905, "epoch": 0.94446208, "global_step/max_steps": "372/788", "elapsed_time": "4h 0m 13s", "remaining_time": "4h 28m 38s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.745076} +{"loss": 0.471605, "grad_norm": 1.47412867, "learning_rate": 3.696e-05, "token_acc": 0.85024876, "epoch": 0.94700095, "global_step/max_steps": "373/788", "elapsed_time": "4h 0m 49s", "remaining_time": "4h 27m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.737732} +{"loss": 0.52644408, "grad_norm": 2.09094415, "learning_rate": 3.685e-05, "token_acc": 0.84245961, "epoch": 0.94953983, "global_step/max_steps": "374/788", "elapsed_time": "4h 1m 29s", "remaining_time": "4h 27m 18s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.739587} +{"loss": 0.46441877, "grad_norm": 5.39621796, "learning_rate": 3.674e-05, "token_acc": 0.85825411, "epoch": 0.95207871, "global_step/max_steps": "375/788", "elapsed_time": "4h 2m 2s", "remaining_time": "4h 26m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.72471} +{"loss": 0.49459615, "grad_norm": 2.54874108, "learning_rate": 3.663e-05, "token_acc": 0.84902597, "epoch": 0.95461758, "global_step/max_steps": "376/788", "elapsed_time": "4h 2m 34s", "remaining_time": "4h 25m 48s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.707965} +{"loss": 0.44490117, "grad_norm": 1.44871085, "learning_rate": 3.652e-05, "token_acc": 0.86342521, "epoch": 0.95715646, "global_step/max_steps": "377/788", "elapsed_time": "4h 3m 15s", "remaining_time": "4h 25m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.713593} +{"loss": 0.45414627, "grad_norm": 2.4501839, "learning_rate": 3.641e-05, "token_acc": 0.86117647, "epoch": 0.95969533, "global_step/max_steps": "378/788", "elapsed_time": "4h 3m 44s", "remaining_time": "4h 24m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.688151} +{"loss": 0.49571222, "grad_norm": 2.49867224, "learning_rate": 3.629e-05, "token_acc": 0.84772344, "epoch": 0.96223421, "global_step/max_steps": "379/788", "elapsed_time": "4h 4m 21s", "remaining_time": "4h 23m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.684053} +{"loss": 0.5208962, "grad_norm": 1.59232718, "learning_rate": 3.618e-05, "token_acc": 0.84321965, "epoch": 0.96477309, "global_step/max_steps": "380/788", "elapsed_time": "4h 5m 0s", "remaining_time": "4h 23m 3s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.68499} +{"loss": 0.54029775, "grad_norm": 4.2775333, "learning_rate": 3.607e-05, "token_acc": 0.84389656, "epoch": 0.96731196, "global_step/max_steps": "381/788", "elapsed_time": "4h 5m 44s", "remaining_time": "4h 22m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.698011} +{"loss": 0.51338452, "grad_norm": 1.39178584, "learning_rate": 3.596e-05, "token_acc": 0.84671861, "epoch": 0.96985084, "global_step/max_steps": "382/788", "elapsed_time": "4h 6m 16s", "remaining_time": "4h 21m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.68097} +{"loss": 0.46079654, "grad_norm": 1.66523008, "learning_rate": 3.585e-05, "token_acc": 0.85815483, "epoch": 0.97238972, "global_step/max_steps": "383/788", "elapsed_time": "4h 6m 47s", "remaining_time": "4h 20m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.660724} +{"loss": 0.55888593, "grad_norm": 3.04751673, "learning_rate": 3.573e-05, "token_acc": 0.83543534, "epoch": 0.97492859, "global_step/max_steps": "384/788", "elapsed_time": "4h 7m 24s", "remaining_time": "4h 20m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.656919} +{"loss": 0.45114434, "grad_norm": 1.73945484, "learning_rate": 3.562e-05, "token_acc": 0.8557377, "epoch": 0.97746747, "global_step/max_steps": "385/788", "elapsed_time": "4h 7m 57s", "remaining_time": "4h 19m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.642659} +{"loss": 0.47392058, "grad_norm": 2.37155676, "learning_rate": 3.551e-05, "token_acc": 0.85045495, "epoch": 0.98000635, "global_step/max_steps": "386/788", "elapsed_time": "4h 8m 34s", "remaining_time": "4h 18m 52s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.637276} +{"loss": 0.47992224, "grad_norm": 2.70510393, "learning_rate": 3.54e-05, "token_acc": 0.85144756, "epoch": 0.98254522, "global_step/max_steps": "387/788", "elapsed_time": "4h 9m 10s", "remaining_time": "4h 18m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.630917} +{"loss": 0.41233572, "grad_norm": 2.9508108, "learning_rate": 3.528e-05, "token_acc": 0.86795252, "epoch": 0.9850841, "global_step/max_steps": "388/788", "elapsed_time": "4h 9m 40s", "remaining_time": "4h 17m 23s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.608127} +{"loss": 0.53529304, "grad_norm": 1.48136603, "learning_rate": 3.517e-05, "token_acc": 0.843116, "epoch": 0.98762298, "global_step/max_steps": "389/788", "elapsed_time": "4h 10m 13s", "remaining_time": "4h 16m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594045} +{"loss": 0.46288723, "grad_norm": 3.13035571, "learning_rate": 3.505e-05, "token_acc": 0.86190834, "epoch": 0.99016185, "global_step/max_steps": "390/788", "elapsed_time": "4h 10m 48s", "remaining_time": "4h 15m 57s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584712} +{"loss": 0.45598948, "grad_norm": 1.46749159, "learning_rate": 3.494e-05, "token_acc": 0.86100821, "epoch": 0.99270073, "global_step/max_steps": "391/788", "elapsed_time": "4h 11m 30s", "remaining_time": "4h 15m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.593748} +{"loss": 0.4409754, "grad_norm": 1.9533489, "learning_rate": 3.483e-05, "token_acc": 0.86208037, "epoch": 0.99523961, "global_step/max_steps": "392/788", "elapsed_time": "4h 12m 9s", "remaining_time": "4h 14m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.59559} +{"loss": 0.45593995, "grad_norm": 4.31007471, "learning_rate": 3.471e-05, "token_acc": 0.8591593, "epoch": 0.99777848, "global_step/max_steps": "393/788", "elapsed_time": "4h 12m 48s", "remaining_time": "4h 14m 6s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.596326} +{"loss": 0.48068923, "grad_norm": 1.72190463, "learning_rate": 3.46e-05, "token_acc": 0.85672958, "epoch": 1.0, "global_step/max_steps": "394/788", "elapsed_time": "4h 13m 35s", "remaining_time": "4h 13m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.617813} +{"eval_loss": 0.38288021, "eval_runtime": 8.607, "eval_samples_per_second": 1.394, "eval_steps_per_second": 0.349, "eval_token_acc": 0.87427014, "epoch": 1.0, "global_step/max_steps": "394/788", "elapsed_time": "4h 13m 44s", "remaining_time": "4h 13m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.639684} +{"loss": 0.51435924, "grad_norm": 1.22296418, "learning_rate": 3.448e-05, "token_acc": 0.84727043, "epoch": 1.00253888, "global_step/max_steps": "395/788", "elapsed_time": "4h 14m 43s", "remaining_time": "4h 13m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.69223} +{"loss": 0.4523195, "grad_norm": 1.78281351, "learning_rate": 3.437e-05, "token_acc": 0.86170213, "epoch": 1.00507775, "global_step/max_steps": "396/788", "elapsed_time": "4h 15m 22s", "remaining_time": "4h 12m 48s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.693045} +{"loss": 0.45087862, "grad_norm": 2.5856576, "learning_rate": 3.425e-05, "token_acc": 0.86143453, "epoch": 1.00761663, "global_step/max_steps": "397/788", "elapsed_time": "4h 16m 4s", "remaining_time": "4h 12m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.701159} +{"loss": 0.48043075, "grad_norm": 2.74587508, "learning_rate": 3.413e-05, "token_acc": 0.8540305, "epoch": 1.01015551, "global_step/max_steps": "398/788", "elapsed_time": "4h 16m 49s", "remaining_time": "4h 11m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.715071} +{"loss": 0.47298595, "grad_norm": 1.35350802, "learning_rate": 3.402e-05, "token_acc": 0.84711343, "epoch": 1.01269438, "global_step/max_steps": "399/788", "elapsed_time": "4h 17m 23s", "remaining_time": "4h 10m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.704741} +{"loss": 0.48434469, "grad_norm": 6.25026535, "learning_rate": 3.39e-05, "token_acc": 0.84957067, "epoch": 1.01523326, "global_step/max_steps": "400/788", "elapsed_time": "4h 17m 57s", "remaining_time": "4h 10m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.691831} +{"loss": 0.49588215, "grad_norm": 1.51328503, "learning_rate": 3.378e-05, "token_acc": 0.84443126, "epoch": 1.01777214, "global_step/max_steps": "401/788", "elapsed_time": "4h 18m 32s", "remaining_time": "4h 9m 31s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.68413} +{"loss": 0.4410606, "grad_norm": 1.7410437, "learning_rate": 3.367e-05, "token_acc": 0.85921575, "epoch": 1.02031101, "global_step/max_steps": "402/788", "elapsed_time": "4h 19m 5s", "remaining_time": "4h 8m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.668251} +{"loss": 0.44970846, "grad_norm": 2.04666654, "learning_rate": 3.355e-05, "token_acc": 0.85925488, "epoch": 1.02284989, "global_step/max_steps": "403/788", "elapsed_time": "4h 19m 52s", "remaining_time": "4h 8m 16s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.691015} +{"loss": 0.38255981, "grad_norm": 1.4823524, "learning_rate": 3.343e-05, "token_acc": 0.87940288, "epoch": 1.02538877, "global_step/max_steps": "404/788", "elapsed_time": "4h 20m 29s", "remaining_time": "4h 7m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.685524} +{"loss": 0.45361936, "grad_norm": 2.39667517, "learning_rate": 3.332e-05, "token_acc": 0.86337064, "epoch": 1.02792764, "global_step/max_steps": "405/788", "elapsed_time": "4h 21m 0s", "remaining_time": "4h 6m 50s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.667365} +{"loss": 0.47394988, "grad_norm": 1.90633494, "learning_rate": 3.32e-05, "token_acc": 0.84661875, "epoch": 1.03046652, "global_step/max_steps": "406/788", "elapsed_time": "4h 21m 41s", "remaining_time": "4h 6m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.671199} +{"loss": 0.45363748, "grad_norm": 1.44745083, "learning_rate": 3.308e-05, "token_acc": 0.85652964, "epoch": 1.0330054, "global_step/max_steps": "407/788", "elapsed_time": "4h 22m 18s", "remaining_time": "4h 5m 32s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.667478} +{"loss": 0.48422605, "grad_norm": 2.00830184, "learning_rate": 3.296e-05, "token_acc": 0.85315757, "epoch": 1.03554427, "global_step/max_steps": "408/788", "elapsed_time": "4h 22m 57s", "remaining_time": "4h 4m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.668361} +{"loss": 0.47165206, "grad_norm": 2.88980127, "learning_rate": 3.284e-05, "token_acc": 0.85732525, "epoch": 1.03808315, "global_step/max_steps": "409/788", "elapsed_time": "4h 23m 30s", "remaining_time": "4h 4m 10s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.654564} +{"loss": 0.46738768, "grad_norm": 2.31391988, "learning_rate": 3.273e-05, "token_acc": 0.85764834, "epoch": 1.04062202, "global_step/max_steps": "410/788", "elapsed_time": "4h 24m 12s", "remaining_time": "4h 3m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.664483} +{"loss": 0.37850249, "grad_norm": 2.60444618, "learning_rate": 3.261e-05, "token_acc": 0.87549669, "epoch": 1.0431609, "global_step/max_steps": "411/788", "elapsed_time": "4h 24m 50s", "remaining_time": "4h 2m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.66206} +{"loss": 0.45416278, "grad_norm": 3.11312734, "learning_rate": 3.249e-05, "token_acc": 0.85863201, "epoch": 1.04569978, "global_step/max_steps": "412/788", "elapsed_time": "4h 25m 34s", "remaining_time": "4h 2m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.674758} +{"loss": 0.48604655, "grad_norm": 4.26660059, "learning_rate": 3.237e-05, "token_acc": 0.8502902, "epoch": 1.04823865, "global_step/max_steps": "413/788", "elapsed_time": "4h 26m 10s", "remaining_time": "4h 1m 41s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.668432} +{"loss": 0.42281398, "grad_norm": 2.57321271, "learning_rate": 3.225e-05, "token_acc": 0.86855534, "epoch": 1.05077753, "global_step/max_steps": "414/788", "elapsed_time": "4h 26m 39s", "remaining_time": "4h 0m 53s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.645135} +{"loss": 0.42420542, "grad_norm": 3.29032568, "learning_rate": 3.213e-05, "token_acc": 0.87020759, "epoch": 1.05331641, "global_step/max_steps": "415/788", "elapsed_time": "4h 27m 5s", "remaining_time": "4h 0m 3s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.614866} +{"loss": 0.50495064, "grad_norm": 1.87269694, "learning_rate": 3.201e-05, "token_acc": 0.84499332, "epoch": 1.05585528, "global_step/max_steps": "416/788", "elapsed_time": "4h 27m 51s", "remaining_time": "3h 59m 31s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.632281} +{"loss": 0.48016018, "grad_norm": 1.49903509, "learning_rate": 3.189e-05, "token_acc": 0.85461888, "epoch": 1.05839416, "global_step/max_steps": "417/788", "elapsed_time": "4h 28m 22s", "remaining_time": "3h 58m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.614618} +{"loss": 0.44322321, "grad_norm": 4.72530456, "learning_rate": 3.177e-05, "token_acc": 0.85981148, "epoch": 1.06093304, "global_step/max_steps": "418/788", "elapsed_time": "4h 29m 1s", "remaining_time": "3h 58m 8s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.615148} +{"loss": 0.47048905, "grad_norm": 1.83646822, "learning_rate": 3.165e-05, "token_acc": 0.85305139, "epoch": 1.06347191, "global_step/max_steps": "419/788", "elapsed_time": "4h 29m 42s", "remaining_time": "3h 57m 31s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.619693} +{"loss": 0.41579741, "grad_norm": 1.85847361, "learning_rate": 3.153e-05, "token_acc": 0.86694994, "epoch": 1.06601079, "global_step/max_steps": "420/788", "elapsed_time": "4h 30m 25s", "remaining_time": "3h 56m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.630699} +{"loss": 0.47378597, "grad_norm": 2.4486093, "learning_rate": 3.141e-05, "token_acc": 0.85590687, "epoch": 1.06854967, "global_step/max_steps": "421/788", "elapsed_time": "4h 30m 57s", "remaining_time": "3h 56m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.616225} +{"loss": 0.44109225, "grad_norm": 2.1221712, "learning_rate": 3.129e-05, "token_acc": 0.86534463, "epoch": 1.07108854, "global_step/max_steps": "422/788", "elapsed_time": "4h 31m 35s", "remaining_time": "3h 55m 32s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.612991} +{"loss": 0.42902139, "grad_norm": 1.66393231, "learning_rate": 3.117e-05, "token_acc": 0.87288718, "epoch": 1.07362742, "global_step/max_steps": "423/788", "elapsed_time": "4h 32m 15s", "remaining_time": "3h 54m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.616304} +{"loss": 0.48185477, "grad_norm": 3.28944882, "learning_rate": 3.105e-05, "token_acc": 0.85331861, "epoch": 1.0761663, "global_step/max_steps": "424/788", "elapsed_time": "4h 32m 54s", "remaining_time": "3h 54m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.617573} +{"loss": 0.4967986, "grad_norm": 1.88352621, "learning_rate": 3.093e-05, "token_acc": 0.84817056, "epoch": 1.07870517, "global_step/max_steps": "425/788", "elapsed_time": "4h 33m 43s", "remaining_time": "3h 53m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.642769} +{"loss": 0.47215161, "grad_norm": 7.19006831, "learning_rate": 3.081e-05, "token_acc": 0.85556068, "epoch": 1.08124405, "global_step/max_steps": "426/788", "elapsed_time": "4h 34m 18s", "remaining_time": "3h 53m 5s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.63263} +{"loss": 0.49559838, "grad_norm": 2.06785283, "learning_rate": 3.068e-05, "token_acc": 0.8468781, "epoch": 1.08378293, "global_step/max_steps": "427/788", "elapsed_time": "4h 34m 49s", "remaining_time": "3h 52m 21s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.616527} +{"loss": 0.42931715, "grad_norm": 1.16052748, "learning_rate": 3.056e-05, "token_acc": 0.8696649, "epoch": 1.0863218, "global_step/max_steps": "428/788", "elapsed_time": "4h 35m 22s", "remaining_time": "3h 51m 37s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.601794} +{"loss": 0.41385567, "grad_norm": 1.82993244, "learning_rate": 3.044e-05, "token_acc": 0.87350017, "epoch": 1.08886068, "global_step/max_steps": "429/788", "elapsed_time": "4h 35m 58s", "remaining_time": "3h 50m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.596595} +{"loss": 0.4980194, "grad_norm": 1.99179839, "learning_rate": 3.032e-05, "token_acc": 0.84782016, "epoch": 1.09139956, "global_step/max_steps": "430/788", "elapsed_time": "4h 36m 47s", "remaining_time": "3h 50m 27s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.621692} +{"loss": 0.43545026, "grad_norm": 1.83408869, "learning_rate": 3.02e-05, "token_acc": 0.8643157, "epoch": 1.09393843, "global_step/max_steps": "431/788", "elapsed_time": "4h 37m 15s", "remaining_time": "3h 49m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.595617} +{"loss": 0.42511299, "grad_norm": 3.72720068, "learning_rate": 3.008e-05, "token_acc": 0.86391252, "epoch": 1.09647731, "global_step/max_steps": "432/788", "elapsed_time": "4h 37m 47s", "remaining_time": "3h 48m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.580827} +{"loss": 0.51225317, "grad_norm": 3.1898245, "learning_rate": 2.995e-05, "token_acc": 0.84490834, "epoch": 1.09901619, "global_step/max_steps": "433/788", "elapsed_time": "4h 38m 32s", "remaining_time": "3h 48m 21s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.595189} +{"loss": 0.49831522, "grad_norm": 9.547666, "learning_rate": 2.983e-05, "token_acc": 0.84908099, "epoch": 1.10155506, "global_step/max_steps": "434/788", "elapsed_time": "4h 39m 21s", "remaining_time": "3h 47m 51s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.618799} +{"loss": 0.44010925, "grad_norm": 1.36884474, "learning_rate": 2.971e-05, "token_acc": 0.86483651, "epoch": 1.10409394, "global_step/max_steps": "435/788", "elapsed_time": "4h 39m 51s", "remaining_time": "3h 47m 6s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.599371} +{"loss": 0.47184882, "grad_norm": 1.51664596, "learning_rate": 2.959e-05, "token_acc": 0.86228015, "epoch": 1.10663281, "global_step/max_steps": "436/788", "elapsed_time": "4h 40m 27s", "remaining_time": "3h 46m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.593765} +{"loss": 0.44295204, "grad_norm": 8.52384238, "learning_rate": 2.946e-05, "token_acc": 0.86470588, "epoch": 1.10917169, "global_step/max_steps": "437/788", "elapsed_time": "4h 41m 2s", "remaining_time": "3h 45m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.586729} +{"loss": 0.45562118, "grad_norm": 1.73556887, "learning_rate": 2.934e-05, "token_acc": 0.85796345, "epoch": 1.11171057, "global_step/max_steps": "438/788", "elapsed_time": "4h 41m 32s", "remaining_time": "3h 44m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.565791} +{"loss": 0.4310703, "grad_norm": 2.84281202, "learning_rate": 2.922e-05, "token_acc": 0.86188748, "epoch": 1.11424944, "global_step/max_steps": "439/788", "elapsed_time": "4h 42m 3s", "remaining_time": "3h 44m 14s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.548767} +{"loss": 0.41620612, "grad_norm": 1.9815904, "learning_rate": 2.91e-05, "token_acc": 0.86927135, "epoch": 1.11678832, "global_step/max_steps": "440/788", "elapsed_time": "4h 42m 40s", "remaining_time": "3h 43m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.544453} +{"loss": 0.46872544, "grad_norm": 1.65615866, "learning_rate": 2.897e-05, "token_acc": 0.85244025, "epoch": 1.1193272, "global_step/max_steps": "441/788", "elapsed_time": "4h 43m 22s", "remaining_time": "3h 42m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.552377} +{"loss": 0.47369194, "grad_norm": 1.06973091, "learning_rate": 2.885e-05, "token_acc": 0.85866489, "epoch": 1.12186607, "global_step/max_steps": "442/788", "elapsed_time": "4h 43m 55s", "remaining_time": "3h 42m 15s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.540981} +{"loss": 0.51874453, "grad_norm": 2.27161373, "learning_rate": 2.873e-05, "token_acc": 0.83855384, "epoch": 1.12440495, "global_step/max_steps": "443/788", "elapsed_time": "4h 44m 29s", "remaining_time": "3h 41m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.52991} +{"loss": 0.48289764, "grad_norm": 2.0302272, "learning_rate": 2.86e-05, "token_acc": 0.8504065, "epoch": 1.12694383, "global_step/max_steps": "444/788", "elapsed_time": "4h 45m 15s", "remaining_time": "3h 41m 0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.547623} +{"loss": 0.43978974, "grad_norm": 2.51560144, "learning_rate": 2.848e-05, "token_acc": 0.86278586, "epoch": 1.1294827, "global_step/max_steps": "445/788", "elapsed_time": "4h 45m 47s", "remaining_time": "3h 40m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.53342} +{"loss": 0.44684976, "grad_norm": 1.63012051, "learning_rate": 2.836e-05, "token_acc": 0.85834633, "epoch": 1.13202158, "global_step/max_steps": "446/788", "elapsed_time": "4h 46m 23s", "remaining_time": "3h 39m 36s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.52719} +{"loss": 0.44376782, "grad_norm": 3.43951598, "learning_rate": 2.823e-05, "token_acc": 0.86021334, "epoch": 1.13456046, "global_step/max_steps": "447/788", "elapsed_time": "4h 47m 2s", "remaining_time": "3h 38m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.52756} +{"loss": 0.52566171, "grad_norm": 1.9688918, "learning_rate": 2.811e-05, "token_acc": 0.84162763, "epoch": 1.13709933, "global_step/max_steps": "448/788", "elapsed_time": "4h 47m 38s", "remaining_time": "3h 38m 18s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.522605} +{"loss": 0.50074846, "grad_norm": 1.45850111, "learning_rate": 2.798e-05, "token_acc": 0.84273662, "epoch": 1.13963821, "global_step/max_steps": "449/788", "elapsed_time": "4h 48m 19s", "remaining_time": "3h 37m 41s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.528876} +{"loss": 0.43378535, "grad_norm": 2.41960311, "learning_rate": 2.786e-05, "token_acc": 0.86535662, "epoch": 1.14217709, "global_step/max_steps": "450/788", "elapsed_time": "4h 48m 57s", "remaining_time": "3h 37m 2s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.526134} +{"loss": 0.47391105, "grad_norm": 2.05461754, "learning_rate": 2.774e-05, "token_acc": 0.8580179, "epoch": 1.14471596, "global_step/max_steps": "451/788", "elapsed_time": "4h 49m 33s", "remaining_time": "3h 36m 21s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.52031} +{"loss": 0.40218145, "grad_norm": 1.73442337, "learning_rate": 2.761e-05, "token_acc": 0.87510917, "epoch": 1.14725484, "global_step/max_steps": "452/788", "elapsed_time": "4h 50m 7s", "remaining_time": "3h 35m 40s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.511562} +{"loss": 0.45693746, "grad_norm": 2.49323178, "learning_rate": 2.749e-05, "token_acc": 0.85658122, "epoch": 1.14979372, "global_step/max_steps": "453/788", "elapsed_time": "4h 50m 48s", "remaining_time": "3h 35m 3s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.51662} +{"loss": 0.46150589, "grad_norm": 2.03942658, "learning_rate": 2.737e-05, "token_acc": 0.85787363, "epoch": 1.15233259, "global_step/max_steps": "454/788", "elapsed_time": "4h 51m 32s", "remaining_time": "3h 34m 29s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.529275} +{"loss": 0.48019898, "grad_norm": 1.30190265, "learning_rate": 2.724e-05, "token_acc": 0.85266925, "epoch": 1.15487147, "global_step/max_steps": "455/788", "elapsed_time": "4h 52m 17s", "remaining_time": "3h 33m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.542403} +{"loss": 0.48695469, "grad_norm": 1.23656896, "learning_rate": 2.712e-05, "token_acc": 0.85278668, "epoch": 1.15741035, "global_step/max_steps": "456/788", "elapsed_time": "4h 53m 10s", "remaining_time": "3h 33m 27s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.574202} +{"loss": 0.46715584, "grad_norm": 2.25547757, "learning_rate": 2.699e-05, "token_acc": 0.86327389, "epoch": 1.15994922, "global_step/max_steps": "457/788", "elapsed_time": "4h 53m 51s", "remaining_time": "3h 32m 50s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.580396} +{"loss": 0.45758605, "grad_norm": 2.83305479, "learning_rate": 2.687e-05, "token_acc": 0.86002944, "epoch": 1.1624881, "global_step/max_steps": "458/788", "elapsed_time": "4h 54m 32s", "remaining_time": "3h 32m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.586198} +{"loss": 0.43259293, "grad_norm": 2.53823415, "learning_rate": 2.674e-05, "token_acc": 0.86825368, "epoch": 1.16502698, "global_step/max_steps": "459/788", "elapsed_time": "4h 55m 5s", "remaining_time": "3h 31m 31s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.573777} +{"loss": 0.39597863, "grad_norm": 1.26968084, "learning_rate": 2.662e-05, "token_acc": 0.87664928, "epoch": 1.16756585, "global_step/max_steps": "460/788", "elapsed_time": "4h 55m 43s", "remaining_time": "3h 30m 52s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.572373} +{"loss": 0.39406574, "grad_norm": 1.75061421, "learning_rate": 2.65e-05, "token_acc": 0.87120369, "epoch": 1.17010473, "global_step/max_steps": "461/788", "elapsed_time": "4h 56m 19s", "remaining_time": "3h 30m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.565396} +{"loss": 0.50995409, "grad_norm": 1.71071965, "learning_rate": 2.637e-05, "token_acc": 0.84360545, "epoch": 1.17264361, "global_step/max_steps": "462/788", "elapsed_time": "4h 56m 60s", "remaining_time": "3h 29m 34s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.57121} +{"loss": 0.41936338, "grad_norm": 1.7833743, "learning_rate": 2.625e-05, "token_acc": 0.86833804, "epoch": 1.17518248, "global_step/max_steps": "463/788", "elapsed_time": "4h 57m 35s", "remaining_time": "3h 28m 53s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.563322} +{"loss": 0.46932033, "grad_norm": 2.3198991, "learning_rate": 2.612e-05, "token_acc": 0.85146387, "epoch": 1.17772136, "global_step/max_steps": "464/788", "elapsed_time": "4h 58m 23s", "remaining_time": "3h 28m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.585011} +{"loss": 0.40633985, "grad_norm": 1.2897818, "learning_rate": 2.6e-05, "token_acc": 0.86955123, "epoch": 1.18026023, "global_step/max_steps": "465/788", "elapsed_time": "4h 59m 0s", "remaining_time": "3h 27m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.581716} +{"loss": 0.44572172, "grad_norm": 1.44052325, "learning_rate": 2.587e-05, "token_acc": 0.86208523, "epoch": 1.18279911, "global_step/max_steps": "466/788", "elapsed_time": "4h 59m 36s", "remaining_time": "3h 27m 1s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.576086} +{"loss": 0.39872783, "grad_norm": 1.82176367, "learning_rate": 2.575e-05, "token_acc": 0.87064758, "epoch": 1.18533799, "global_step/max_steps": "467/788", "elapsed_time": "5h 0m 17s", "remaining_time": "3h 26m 24s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.58089} +{"loss": 0.37269577, "grad_norm": 3.18244545, "learning_rate": 2.562e-05, "token_acc": 0.8813061, "epoch": 1.18787686, "global_step/max_steps": "468/788", "elapsed_time": "5h 0m 55s", "remaining_time": "3h 25m 45s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.579052} +{"loss": 0.46122989, "grad_norm": 2.13837463, "learning_rate": 2.55e-05, "token_acc": 0.85671682, "epoch": 1.19041574, "global_step/max_steps": "469/788", "elapsed_time": "5h 1m 40s", "remaining_time": "3h 25m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592115} +{"loss": 0.44054481, "grad_norm": 2.34509057, "learning_rate": 2.537e-05, "token_acc": 0.8611957, "epoch": 1.19295462, "global_step/max_steps": "470/788", "elapsed_time": "5h 2m 17s", "remaining_time": "3h 24m 31s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.588898} +{"loss": 0.46581027, "grad_norm": 2.83975878, "learning_rate": 2.525e-05, "token_acc": 0.8541385, "epoch": 1.19549349, "global_step/max_steps": "471/788", "elapsed_time": "5h 2m 58s", "remaining_time": "3h 23m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.593527} +{"loss": 0.43622541, "grad_norm": 3.59366419, "learning_rate": 2.512e-05, "token_acc": 0.8644588, "epoch": 1.19803237, "global_step/max_steps": "472/788", "elapsed_time": "5h 3m 33s", "remaining_time": "3h 23m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.586209} +{"loss": 0.44690299, "grad_norm": 4.91138015, "learning_rate": 2.5e-05, "token_acc": 0.85884523, "epoch": 1.20057125, "global_step/max_steps": "473/788", "elapsed_time": "5h 4m 14s", "remaining_time": "3h 22m 37s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592683} +{"loss": 0.49759552, "grad_norm": 1.86758196, "learning_rate": 2.488e-05, "token_acc": 0.84907903, "epoch": 1.20311012, "global_step/max_steps": "474/788", "elapsed_time": "5h 4m 57s", "remaining_time": "3h 22m 1s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.600334} +{"loss": 0.40253413, "grad_norm": 1.65801012, "learning_rate": 2.475e-05, "token_acc": 0.87342394, "epoch": 1.205649, "global_step/max_steps": "475/788", "elapsed_time": "5h 5m 26s", "remaining_time": "3h 21m 16s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.58074} +{"loss": 0.39906147, "grad_norm": 5.72808535, "learning_rate": 2.463e-05, "token_acc": 0.87679671, "epoch": 1.20818788, "global_step/max_steps": "476/788", "elapsed_time": "5h 5m 58s", "remaining_time": "3h 20m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.568102} +{"loss": 0.51572508, "grad_norm": 1.53670823, "learning_rate": 2.45e-05, "token_acc": 0.84482759, "epoch": 1.21072675, "global_step/max_steps": "477/788", "elapsed_time": "5h 6m 45s", "remaining_time": "3h 19m 60s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584795} +{"loss": 0.44921684, "grad_norm": 3.59769042, "learning_rate": 2.438e-05, "token_acc": 0.86156619, "epoch": 1.21326563, "global_step/max_steps": "478/788", "elapsed_time": "5h 7m 20s", "remaining_time": "3h 19m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.577132} +{"loss": 0.37822384, "grad_norm": 1.49020411, "learning_rate": 2.425e-05, "token_acc": 0.87815505, "epoch": 1.21580451, "global_step/max_steps": "479/788", "elapsed_time": "5h 8m 5s", "remaining_time": "3h 18m 45s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.590677} +{"loss": 0.51907504, "grad_norm": 1.42624675, "learning_rate": 2.413e-05, "token_acc": 0.84865799, "epoch": 1.21834338, "global_step/max_steps": "480/788", "elapsed_time": "5h 8m 49s", "remaining_time": "3h 18m 9s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.601047} +{"loss": 0.51853955, "grad_norm": 2.77481384, "learning_rate": 2.4e-05, "token_acc": 0.84472834, "epoch": 1.22088226, "global_step/max_steps": "481/788", "elapsed_time": "5h 9m 31s", "remaining_time": "3h 17m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.610144} +{"loss": 0.47627416, "grad_norm": 1.40983809, "learning_rate": 2.388e-05, "token_acc": 0.85699768, "epoch": 1.22342114, "global_step/max_steps": "482/788", "elapsed_time": "5h 10m 9s", "remaining_time": "3h 16m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.608212} +{"loss": 0.4258928, "grad_norm": 1.78265645, "learning_rate": 2.375e-05, "token_acc": 0.86417095, "epoch": 1.22596001, "global_step/max_steps": "483/788", "elapsed_time": "5h 10m 41s", "remaining_time": "3h 16m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594484} +{"loss": 0.42886928, "grad_norm": 6.91426152, "learning_rate": 2.363e-05, "token_acc": 0.86735625, "epoch": 1.22849889, "global_step/max_steps": "484/788", "elapsed_time": "5h 11m 23s", "remaining_time": "3h 15m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.600945} +{"loss": 0.42893451, "grad_norm": 2.29368062, "learning_rate": 2.35e-05, "token_acc": 0.86193486, "epoch": 1.23103777, "global_step/max_steps": "485/788", "elapsed_time": "5h 12m 4s", "remaining_time": "3h 14m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.606476} +{"loss": 0.43507802, "grad_norm": 4.47787941, "learning_rate": 2.338e-05, "token_acc": 0.86261337, "epoch": 1.23357664, "global_step/max_steps": "486/788", "elapsed_time": "5h 12m 42s", "remaining_time": "3h 14m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.604431} +{"loss": 0.39745572, "grad_norm": 1.80581681, "learning_rate": 2.326e-05, "token_acc": 0.87328653, "epoch": 1.23611552, "global_step/max_steps": "487/788", "elapsed_time": "5h 13m 16s", "remaining_time": "3h 13m 37s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.595712} +{"loss": 0.40249121, "grad_norm": 2.26643305, "learning_rate": 2.313e-05, "token_acc": 0.87033068, "epoch": 1.2386544, "global_step/max_steps": "488/788", "elapsed_time": "5h 13m 57s", "remaining_time": "3h 13m 0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.600839} +{"loss": 0.46329951, "grad_norm": 5.08459082, "learning_rate": 2.301e-05, "token_acc": 0.85569044, "epoch": 1.24119327, "global_step/max_steps": "489/788", "elapsed_time": "5h 14m 33s", "remaining_time": "3h 12m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594856} +{"loss": 0.46391389, "grad_norm": 2.08743695, "learning_rate": 2.288e-05, "token_acc": 0.85628363, "epoch": 1.24373215, "global_step/max_steps": "490/788", "elapsed_time": "5h 15m 11s", "remaining_time": "3h 11m 41s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592953} +{"loss": 0.46406934, "grad_norm": 1.27071145, "learning_rate": 2.276e-05, "token_acc": 0.85453161, "epoch": 1.24627103, "global_step/max_steps": "491/788", "elapsed_time": "5h 15m 55s", "remaining_time": "3h 11m 6s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.604664} +{"loss": 0.44021913, "grad_norm": 5.75048948, "learning_rate": 2.263e-05, "token_acc": 0.86327078, "epoch": 1.2488099, "global_step/max_steps": "492/788", "elapsed_time": "5h 16m 28s", "remaining_time": "3h 10m 23s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592699} +{"loss": 0.39085916, "grad_norm": 2.6842432, "learning_rate": 2.251e-05, "token_acc": 0.87720835, "epoch": 1.25134878, "global_step/max_steps": "493/788", "elapsed_time": "5h 17m 8s", "remaining_time": "3h 9m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.596716} +{"loss": 0.4324193, "grad_norm": 1.15605454, "learning_rate": 2.239e-05, "token_acc": 0.86643891, "epoch": 1.25388765, "global_step/max_steps": "494/788", "elapsed_time": "5h 17m 46s", "remaining_time": "3h 9m 7s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594937} +{"loss": 0.40898955, "grad_norm": 1.68823614, "learning_rate": 2.226e-05, "token_acc": 0.86904386, "epoch": 1.25642653, "global_step/max_steps": "495/788", "elapsed_time": "5h 18m 21s", "remaining_time": "3h 8m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.588551} +{"loss": 0.46002007, "grad_norm": 0.97922186, "learning_rate": 2.214e-05, "token_acc": 0.85821832, "epoch": 1.25896541, "global_step/max_steps": "496/788", "elapsed_time": "5h 18m 57s", "remaining_time": "3h 7m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.58211} +{"loss": 0.3934142, "grad_norm": 2.08023272, "learning_rate": 2.202e-05, "token_acc": 0.86963334, "epoch": 1.26150428, "global_step/max_steps": "497/788", "elapsed_time": "5h 19m 33s", "remaining_time": "3h 7m 6s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.576756} +{"loss": 0.44040677, "grad_norm": 1.85861926, "learning_rate": 2.189e-05, "token_acc": 0.86449638, "epoch": 1.26404316, "global_step/max_steps": "498/788", "elapsed_time": "5h 20m 8s", "remaining_time": "3h 6m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.57079} +{"loss": 0.38156608, "grad_norm": 4.06956416, "learning_rate": 2.177e-05, "token_acc": 0.87089337, "epoch": 1.26658204, "global_step/max_steps": "499/788", "elapsed_time": "5h 20m 38s", "remaining_time": "3h 5m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.552129} +{"loss": 0.52746415, "grad_norm": 1.34498832, "learning_rate": 2.164e-05, "token_acc": 0.84248992, "epoch": 1.26912091, "global_step/max_steps": "500/788", "elapsed_time": "5h 21m 30s", "remaining_time": "3h 5m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.579343} +{"loss": 0.47970039, "grad_norm": 1.90860967, "learning_rate": 2.152e-05, "token_acc": 0.85522305, "epoch": 1.27165979, "global_step/max_steps": "501/788", "elapsed_time": "5h 22m 11s", "remaining_time": "3h 4m 34s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584895} +{"loss": 0.45994037, "grad_norm": 1.45971447, "learning_rate": 2.14e-05, "token_acc": 0.86010613, "epoch": 1.27419867, "global_step/max_steps": "502/788", "elapsed_time": "5h 22m 49s", "remaining_time": "3h 3m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.583414} +{"loss": 0.446244, "grad_norm": 1.92062103, "learning_rate": 2.127e-05, "token_acc": 0.86081062, "epoch": 1.27673754, "global_step/max_steps": "503/788", "elapsed_time": "5h 23m 20s", "remaining_time": "3h 3m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.568993} +{"loss": 0.39845449, "grad_norm": 2.0589969, "learning_rate": 2.115e-05, "token_acc": 0.87012574, "epoch": 1.27927642, "global_step/max_steps": "504/788", "elapsed_time": "5h 23m 55s", "remaining_time": "3h 2m 31s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.560667} +{"loss": 0.43291551, "grad_norm": 1.33838725, "learning_rate": 2.103e-05, "token_acc": 0.86822237, "epoch": 1.2818153, "global_step/max_steps": "505/788", "elapsed_time": "5h 24m 39s", "remaining_time": "3h 1m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.571365} +{"loss": 0.49285144, "grad_norm": 3.99672127, "learning_rate": 2.09e-05, "token_acc": 0.85561497, "epoch": 1.28435417, "global_step/max_steps": "506/788", "elapsed_time": "5h 25m 21s", "remaining_time": "3h 1m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.578412} +{"loss": 0.391406, "grad_norm": 1.37774808, "learning_rate": 2.078e-05, "token_acc": 0.87493441, "epoch": 1.28689305, "global_step/max_steps": "507/788", "elapsed_time": "5h 25m 57s", "remaining_time": "3h 0m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.573202} +{"loss": 0.43009251, "grad_norm": 2.16341285, "learning_rate": 2.066e-05, "token_acc": 0.87051822, "epoch": 1.28943193, "global_step/max_steps": "508/788", "elapsed_time": "5h 26m 37s", "remaining_time": "3h 0m 2s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.577137} +{"loss": 0.46016771, "grad_norm": 3.60135853, "learning_rate": 2.054e-05, "token_acc": 0.85946028, "epoch": 1.2919708, "global_step/max_steps": "509/788", "elapsed_time": "5h 27m 16s", "remaining_time": "2h 59m 23s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.576656} +{"loss": 0.43819711, "grad_norm": 8.44098559, "learning_rate": 2.041e-05, "token_acc": 0.86211415, "epoch": 1.29450968, "global_step/max_steps": "510/788", "elapsed_time": "5h 27m 54s", "remaining_time": "2h 58m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.575789} +{"loss": 0.41244525, "grad_norm": 1.85631876, "learning_rate": 2.029e-05, "token_acc": 0.86831133, "epoch": 1.29704856, "global_step/max_steps": "511/788", "elapsed_time": "5h 28m 24s", "remaining_time": "2h 58m 1s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.560561} +{"loss": 0.4147405, "grad_norm": 17.66087022, "learning_rate": 2.017e-05, "token_acc": 0.8669967, "epoch": 1.29958743, "global_step/max_steps": "512/788", "elapsed_time": "5h 28m 59s", "remaining_time": "2h 57m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.552192} +{"loss": 0.46553826, "grad_norm": 1.22860195, "learning_rate": 2.005e-05, "token_acc": 0.85459116, "epoch": 1.30212631, "global_step/max_steps": "513/788", "elapsed_time": "5h 29m 38s", "remaining_time": "2h 56m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.553844} +{"loss": 0.469439, "grad_norm": 1.4026697, "learning_rate": 1.992e-05, "token_acc": 0.85793872, "epoch": 1.30466519, "global_step/max_steps": "514/788", "elapsed_time": "5h 30m 14s", "remaining_time": "2h 56m 2s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.548469} +{"loss": 0.51689929, "grad_norm": 1.85399959, "learning_rate": 1.98e-05, "token_acc": 0.84897086, "epoch": 1.30720406, "global_step/max_steps": "515/788", "elapsed_time": "5h 31m 3s", "remaining_time": "2h 55m 29s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.569228} +{"loss": 0.42453352, "grad_norm": 3.67792657, "learning_rate": 1.968e-05, "token_acc": 0.86823242, "epoch": 1.30974294, "global_step/max_steps": "516/788", "elapsed_time": "5h 31m 39s", "remaining_time": "2h 54m 49s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.564223} +{"loss": 0.45314577, "grad_norm": 3.70477678, "learning_rate": 1.956e-05, "token_acc": 0.85945858, "epoch": 1.31228182, "global_step/max_steps": "517/788", "elapsed_time": "5h 32m 22s", "remaining_time": "2h 54m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.572412} +{"loss": 0.48053622, "grad_norm": 1.50174536, "learning_rate": 1.944e-05, "token_acc": 0.85546692, "epoch": 1.31482069, "global_step/max_steps": "518/788", "elapsed_time": "5h 33m 6s", "remaining_time": "2h 53m 37s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.582093} +{"loss": 0.40134004, "grad_norm": 1.26583611, "learning_rate": 1.932e-05, "token_acc": 0.87049704, "epoch": 1.31735957, "global_step/max_steps": "519/788", "elapsed_time": "5h 33m 46s", "remaining_time": "2h 52m 60s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.585664} +{"loss": 0.43935463, "grad_norm": 1.84473857, "learning_rate": 1.919e-05, "token_acc": 0.86407455, "epoch": 1.31989844, "global_step/max_steps": "520/788", "elapsed_time": "5h 34m 22s", "remaining_time": "2h 52m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.580846} +{"loss": 0.44726884, "grad_norm": 1.61405621, "learning_rate": 1.907e-05, "token_acc": 0.86072129, "epoch": 1.32243732, "global_step/max_steps": "521/788", "elapsed_time": "5h 35m 2s", "remaining_time": "2h 51m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584386} +{"loss": 0.47654542, "grad_norm": 2.72734806, "learning_rate": 1.895e-05, "token_acc": 0.85622501, "epoch": 1.3249762, "global_step/max_steps": "522/788", "elapsed_time": "5h 35m 41s", "remaining_time": "2h 51m 3s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.583616} +{"loss": 0.48387218, "grad_norm": 1.71110602, "learning_rate": 1.883e-05, "token_acc": 0.84748535, "epoch": 1.32751507, "global_step/max_steps": "523/788", "elapsed_time": "5h 36m 20s", "remaining_time": "2h 50m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584332} +{"loss": 0.46417087, "grad_norm": 1.19047175, "learning_rate": 1.871e-05, "token_acc": 0.85351124, "epoch": 1.33005395, "global_step/max_steps": "524/788", "elapsed_time": "5h 37m 4s", "remaining_time": "2h 49m 49s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.595916} +{"loss": 0.42533761, "grad_norm": 1.18489744, "learning_rate": 1.859e-05, "token_acc": 0.86900027, "epoch": 1.33259283, "global_step/max_steps": "525/788", "elapsed_time": "5h 37m 51s", "remaining_time": "2h 49m 15s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.611008} +{"loss": 0.41104877, "grad_norm": 3.7879554, "learning_rate": 1.847e-05, "token_acc": 0.8647343, "epoch": 1.3351317, "global_step/max_steps": "526/788", "elapsed_time": "5h 38m 29s", "remaining_time": "2h 48m 36s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.609453} +{"loss": 0.42806491, "grad_norm": 1.5655236, "learning_rate": 1.835e-05, "token_acc": 0.8654826, "epoch": 1.33767058, "global_step/max_steps": "527/788", "elapsed_time": "5h 39m 15s", "remaining_time": "2h 48m 1s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.624317} +{"loss": 0.43801093, "grad_norm": 2.89986799, "learning_rate": 1.823e-05, "token_acc": 0.86960239, "epoch": 1.34020946, "global_step/max_steps": "528/788", "elapsed_time": "5h 39m 53s", "remaining_time": "2h 47m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.624015} +{"loss": 0.42230463, "grad_norm": 1.63629721, "learning_rate": 1.811e-05, "token_acc": 0.86690647, "epoch": 1.34274833, "global_step/max_steps": "529/788", "elapsed_time": "5h 40m 23s", "remaining_time": "2h 46m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.606053} +{"loss": 0.44057074, "grad_norm": 1.34209181, "learning_rate": 1.799e-05, "token_acc": 0.8630623, "epoch": 1.34528721, "global_step/max_steps": "530/788", "elapsed_time": "5h 41m 1s", "remaining_time": "2h 46m 0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.605812} +{"loss": 0.45155153, "grad_norm": 2.12416938, "learning_rate": 1.787e-05, "token_acc": 0.86071332, "epoch": 1.34782609, "global_step/max_steps": "531/788", "elapsed_time": "5h 41m 43s", "remaining_time": "2h 45m 24s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.612958} +{"loss": 0.43257463, "grad_norm": 1.53040456, "learning_rate": 1.775e-05, "token_acc": 0.86379511, "epoch": 1.35036496, "global_step/max_steps": "532/788", "elapsed_time": "5h 42m 23s", "remaining_time": "2h 44m 45s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.614521} +{"loss": 0.43172079, "grad_norm": 1.59856119, "learning_rate": 1.763e-05, "token_acc": 0.86422668, "epoch": 1.35290384, "global_step/max_steps": "533/788", "elapsed_time": "5h 42m 55s", "remaining_time": "2h 44m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.602757} +{"loss": 0.49945721, "grad_norm": 18.31083208, "learning_rate": 1.751e-05, "token_acc": 0.84425848, "epoch": 1.35544272, "global_step/max_steps": "534/788", "elapsed_time": "5h 43m 33s", "remaining_time": "2h 43m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.601156} +{"loss": 0.43917203, "grad_norm": 7.99279049, "learning_rate": 1.739e-05, "token_acc": 0.85847398, "epoch": 1.35798159, "global_step/max_steps": "535/788", "elapsed_time": "5h 44m 9s", "remaining_time": "2h 42m 45s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.597127} +{"loss": 0.46626705, "grad_norm": 2.43098695, "learning_rate": 1.727e-05, "token_acc": 0.86096597, "epoch": 1.36052047, "global_step/max_steps": "536/788", "elapsed_time": "5h 44m 56s", "remaining_time": "2h 42m 10s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.611772} +{"loss": 0.48599222, "grad_norm": 1.42866145, "learning_rate": 1.716e-05, "token_acc": 0.85097604, "epoch": 1.36305935, "global_step/max_steps": "537/788", "elapsed_time": "5h 45m 36s", "remaining_time": "2h 41m 32s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.613881} +{"loss": 0.53527182, "grad_norm": 12.19485527, "learning_rate": 1.704e-05, "token_acc": 0.83726535, "epoch": 1.36559822, "global_step/max_steps": "538/788", "elapsed_time": "5h 46m 17s", "remaining_time": "2h 40m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.618937} +{"loss": 0.43956602, "grad_norm": 1.35990246, "learning_rate": 1.692e-05, "token_acc": 0.85991101, "epoch": 1.3681371, "global_step/max_steps": "539/788", "elapsed_time": "5h 46m 59s", "remaining_time": "2h 40m 18s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.625015} +{"loss": 0.42546415, "grad_norm": 2.36536881, "learning_rate": 1.68e-05, "token_acc": 0.86501241, "epoch": 1.37067598, "global_step/max_steps": "540/788", "elapsed_time": "5h 47m 36s", "remaining_time": "2h 39m 38s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.621623} +{"loss": 0.41960853, "grad_norm": 1.6701485, "learning_rate": 1.668e-05, "token_acc": 0.86803206, "epoch": 1.37321485, "global_step/max_steps": "541/788", "elapsed_time": "5h 48m 9s", "remaining_time": "2h 38m 57s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.612611} +{"loss": 0.41904294, "grad_norm": 1.10510149, "learning_rate": 1.657e-05, "token_acc": 0.86679087, "epoch": 1.37575373, "global_step/max_steps": "542/788", "elapsed_time": "5h 48m 52s", "remaining_time": "2h 38m 21s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.620688} +{"loss": 0.45707202, "grad_norm": 1.43807513, "learning_rate": 1.645e-05, "token_acc": 0.86152717, "epoch": 1.37829261, "global_step/max_steps": "543/788", "elapsed_time": "5h 49m 33s", "remaining_time": "2h 37m 43s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.623982} +{"loss": 0.48923773, "grad_norm": 3.98857037, "learning_rate": 1.633e-05, "token_acc": 0.84955621, "epoch": 1.38083148, "global_step/max_steps": "544/788", "elapsed_time": "5h 50m 14s", "remaining_time": "2h 37m 5s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.628327} +{"loss": 0.40648007, "grad_norm": 17.03238587, "learning_rate": 1.622e-05, "token_acc": 0.87271656, "epoch": 1.38337036, "global_step/max_steps": "545/788", "elapsed_time": "5h 50m 50s", "remaining_time": "2h 36m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.624104} +{"loss": 0.38652194, "grad_norm": 4.97964809, "learning_rate": 1.61e-05, "token_acc": 0.87841423, "epoch": 1.38590924, "global_step/max_steps": "546/788", "elapsed_time": "5h 51m 29s", "remaining_time": "2h 35m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.624681} +{"loss": 0.4779954, "grad_norm": 1.21210809, "learning_rate": 1.598e-05, "token_acc": 0.85471133, "epoch": 1.38844811, "global_step/max_steps": "547/788", "elapsed_time": "5h 52m 9s", "remaining_time": "2h 35m 9s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.627739} +{"loss": 0.44981125, "grad_norm": 1.50654208, "learning_rate": 1.587e-05, "token_acc": 0.85764796, "epoch": 1.39098699, "global_step/max_steps": "548/788", "elapsed_time": "5h 52m 43s", "remaining_time": "2h 34m 28s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.618469} +{"loss": 0.44178125, "grad_norm": 3.46887527, "learning_rate": 1.575e-05, "token_acc": 0.8575572, "epoch": 1.39352586, "global_step/max_steps": "549/788", "elapsed_time": "5h 53m 25s", "remaining_time": "2h 33m 51s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.624754} +{"loss": 0.44523174, "grad_norm": 1.61711691, "learning_rate": 1.563e-05, "token_acc": 0.86335713, "epoch": 1.39606474, "global_step/max_steps": "550/788", "elapsed_time": "5h 53m 55s", "remaining_time": "2h 33m 9s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.608993} +{"loss": 0.44791645, "grad_norm": 1.58611245, "learning_rate": 1.552e-05, "token_acc": 0.86252663, "epoch": 1.39860362, "global_step/max_steps": "551/788", "elapsed_time": "5h 54m 32s", "remaining_time": "2h 32m 29s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.605347} +{"loss": 0.48432773, "grad_norm": 1.76716911, "learning_rate": 1.54e-05, "token_acc": 0.84888598, "epoch": 1.40114249, "global_step/max_steps": "552/788", "elapsed_time": "5h 55m 19s", "remaining_time": "2h 31m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.620539} +{"loss": 0.42298254, "grad_norm": 1.45685039, "learning_rate": 1.529e-05, "token_acc": 0.86417066, "epoch": 1.40368137, "global_step/max_steps": "553/788", "elapsed_time": "5h 55m 55s", "remaining_time": "2h 31m 15s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.616518} +{"loss": 0.38800353, "grad_norm": 1.55833607, "learning_rate": 1.517e-05, "token_acc": 0.87745442, "epoch": 1.40622025, "global_step/max_steps": "554/788", "elapsed_time": "5h 56m 27s", "remaining_time": "2h 30m 34s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.60491} +{"loss": 0.40894312, "grad_norm": 1.31678065, "learning_rate": 1.506e-05, "token_acc": 0.87152034, "epoch": 1.40875912, "global_step/max_steps": "555/788", "elapsed_time": "5h 57m 7s", "remaining_time": "2h 29m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.606329} +{"loss": 0.43399125, "grad_norm": 1.45143597, "learning_rate": 1.495e-05, "token_acc": 0.86207846, "epoch": 1.411298, "global_step/max_steps": "556/788", "elapsed_time": "5h 57m 50s", "remaining_time": "2h 29m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.615443} +{"loss": 0.45627046, "grad_norm": 1.66515152, "learning_rate": 1.483e-05, "token_acc": 0.858122, "epoch": 1.41383688, "global_step/max_steps": "557/788", "elapsed_time": "5h 58m 31s", "remaining_time": "2h 28m 41s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.61918} +{"loss": 0.40736958, "grad_norm": 14.20747599, "learning_rate": 1.472e-05, "token_acc": 0.87405845, "epoch": 1.41637575, "global_step/max_steps": "558/788", "elapsed_time": "5h 59m 6s", "remaining_time": "2h 28m 1s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.612203} +{"loss": 0.3650285, "grad_norm": 1.69243801, "learning_rate": 1.46e-05, "token_acc": 0.87886109, "epoch": 1.41891463, "global_step/max_steps": "559/788", "elapsed_time": "5h 59m 36s", "remaining_time": "2h 27m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.598244} +{"loss": 0.4747892, "grad_norm": 2.65359527, "learning_rate": 1.449e-05, "token_acc": 0.85267176, "epoch": 1.42145351, "global_step/max_steps": "560/788", "elapsed_time": "6h 0m 9s", "remaining_time": "2h 26m 38s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.588315} +{"loss": 0.40597039, "grad_norm": 19.04443328, "learning_rate": 1.438e-05, "token_acc": 0.86813861, "epoch": 1.42399238, "global_step/max_steps": "561/788", "elapsed_time": "6h 0m 45s", "remaining_time": "2h 25m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.582569} +{"loss": 0.44224161, "grad_norm": 2.03783334, "learning_rate": 1.427e-05, "token_acc": 0.8635492, "epoch": 1.42653126, "global_step/max_steps": "562/788", "elapsed_time": "6h 1m 23s", "remaining_time": "2h 25m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.581263} +{"loss": 0.43661261, "grad_norm": 2.04487167, "learning_rate": 1.415e-05, "token_acc": 0.86493247, "epoch": 1.42907014, "global_step/max_steps": "563/788", "elapsed_time": "6h 1m 58s", "remaining_time": "2h 24m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.574818} +{"loss": 0.45890552, "grad_norm": 2.23158669, "learning_rate": 1.404e-05, "token_acc": 0.85383387, "epoch": 1.43160901, "global_step/max_steps": "564/788", "elapsed_time": "6h 2m 34s", "remaining_time": "2h 23m 60s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.570357} +{"loss": 0.46236128, "grad_norm": 1.44727489, "learning_rate": 1.393e-05, "token_acc": 0.85775934, "epoch": 1.43414789, "global_step/max_steps": "565/788", "elapsed_time": "6h 3m 6s", "remaining_time": "2h 23m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.55864} +{"loss": 0.42898571, "grad_norm": 5.33486651, "learning_rate": 1.382e-05, "token_acc": 0.86959441, "epoch": 1.43668677, "global_step/max_steps": "566/788", "elapsed_time": "6h 3m 55s", "remaining_time": "2h 22m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.577664} +{"loss": 0.45958161, "grad_norm": 1.39819216, "learning_rate": 1.371e-05, "token_acc": 0.8598717, "epoch": 1.43922564, "global_step/max_steps": "567/788", "elapsed_time": "6h 4m 28s", "remaining_time": "2h 22m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.568125} +{"loss": 0.37880981, "grad_norm": 1.73753297, "learning_rate": 1.359e-05, "token_acc": 0.87985517, "epoch": 1.44176452, "global_step/max_steps": "568/788", "elapsed_time": "6h 5m 1s", "remaining_time": "2h 21m 23s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.558814} +{"loss": 0.39907387, "grad_norm": 1.27741269, "learning_rate": 1.348e-05, "token_acc": 0.87829645, "epoch": 1.4443034, "global_step/max_steps": "569/788", "elapsed_time": "6h 5m 42s", "remaining_time": "2h 20m 45s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.562604} +{"loss": 0.44838536, "grad_norm": 2.26909696, "learning_rate": 1.337e-05, "token_acc": 0.86797517, "epoch": 1.44684227, "global_step/max_steps": "570/788", "elapsed_time": "6h 6m 14s", "remaining_time": "2h 20m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.551469} +{"loss": 0.43370157, "grad_norm": 1.76741268, "learning_rate": 1.326e-05, "token_acc": 0.86618241, "epoch": 1.44938115, "global_step/max_steps": "571/788", "elapsed_time": "6h 6m 45s", "remaining_time": "2h 19m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.536811} +{"loss": 0.449727, "grad_norm": 2.0207772, "learning_rate": 1.315e-05, "token_acc": 0.86176658, "epoch": 1.45192003, "global_step/max_steps": "572/788", "elapsed_time": "6h 7m 26s", "remaining_time": "2h 18m 45s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.541336} +{"loss": 0.40274125, "grad_norm": 1.31711489, "learning_rate": 1.304e-05, "token_acc": 0.87401353, "epoch": 1.4544589, "global_step/max_steps": "573/788", "elapsed_time": "6h 8m 6s", "remaining_time": "2h 18m 7s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.54439} +{"loss": 0.44188163, "grad_norm": 1.41327825, "learning_rate": 1.293e-05, "token_acc": 0.86149163, "epoch": 1.45699778, "global_step/max_steps": "574/788", "elapsed_time": "6h 8m 43s", "remaining_time": "2h 17m 28s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.542616} +{"loss": 0.44788957, "grad_norm": 5.83388492, "learning_rate": 1.283e-05, "token_acc": 0.8566862, "epoch": 1.45953666, "global_step/max_steps": "575/788", "elapsed_time": "6h 9m 13s", "remaining_time": "2h 16m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.527585} +{"loss": 0.44952667, "grad_norm": 1.98492532, "learning_rate": 1.272e-05, "token_acc": 0.8655306, "epoch": 1.46207553, "global_step/max_steps": "576/788", "elapsed_time": "6h 9m 54s", "remaining_time": "2h 16m 8s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.530618} +{"loss": 0.4790754, "grad_norm": 1.53151974, "learning_rate": 1.261e-05, "token_acc": 0.85574572, "epoch": 1.46461441, "global_step/max_steps": "577/788", "elapsed_time": "6h 10m 33s", "remaining_time": "2h 15m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.531441} +{"loss": 0.45951959, "grad_norm": 2.16660962, "learning_rate": 1.25e-05, "token_acc": 0.85766572, "epoch": 1.46715328, "global_step/max_steps": "578/788", "elapsed_time": "6h 11m 19s", "remaining_time": "2h 14m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.544572} +{"loss": 0.46253154, "grad_norm": 1.72992725, "learning_rate": 1.239e-05, "token_acc": 0.85541834, "epoch": 1.46969216, "global_step/max_steps": "579/788", "elapsed_time": "6h 12m 4s", "remaining_time": "2h 14m 18s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.556541} +{"loss": 0.38790345, "grad_norm": 3.19358572, "learning_rate": 1.228e-05, "token_acc": 0.8763918, "epoch": 1.47223104, "global_step/max_steps": "580/788", "elapsed_time": "6h 12m 42s", "remaining_time": "2h 13m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.554353} +{"loss": 0.48343977, "grad_norm": 2.48910235, "learning_rate": 1.218e-05, "token_acc": 0.85291899, "epoch": 1.47476991, "global_step/max_steps": "581/788", "elapsed_time": "6h 13m 29s", "remaining_time": "2h 13m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.570141} +{"loss": 0.48892277, "grad_norm": 3.17794532, "learning_rate": 1.207e-05, "token_acc": 0.8539147, "epoch": 1.47730879, "global_step/max_steps": "582/788", "elapsed_time": "6h 13m 59s", "remaining_time": "2h 12m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.555421} +{"loss": 0.42535967, "grad_norm": 1.58579308, "learning_rate": 1.196e-05, "token_acc": 0.87110895, "epoch": 1.47984767, "global_step/max_steps": "583/788", "elapsed_time": "6h 14m 39s", "remaining_time": "2h 11m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.557041} +{"loss": 0.48156631, "grad_norm": 3.71114376, "learning_rate": 1.186e-05, "token_acc": 0.85454316, "epoch": 1.48238654, "global_step/max_steps": "584/788", "elapsed_time": "6h 15m 25s", "remaining_time": "2h 11m 8s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.570283} +{"loss": 0.42791951, "grad_norm": 1.73662905, "learning_rate": 1.175e-05, "token_acc": 0.86533546, "epoch": 1.48492542, "global_step/max_steps": "585/788", "elapsed_time": "6h 16m 1s", "remaining_time": "2h 10m 29s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.566546} +{"loss": 0.5193693, "grad_norm": 1.7963881, "learning_rate": 1.165e-05, "token_acc": 0.8437994, "epoch": 1.4874643, "global_step/max_steps": "586/788", "elapsed_time": "6h 16m 38s", "remaining_time": "2h 9m 50s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.563004} +{"loss": 0.49178973, "grad_norm": 1.98841295, "learning_rate": 1.154e-05, "token_acc": 0.85257848, "epoch": 1.49000317, "global_step/max_steps": "587/788", "elapsed_time": "6h 17m 19s", "remaining_time": "2h 9m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.56656} +{"loss": 0.45126534, "grad_norm": 9.17683638, "learning_rate": 1.144e-05, "token_acc": 0.86047619, "epoch": 1.49254205, "global_step/max_steps": "588/788", "elapsed_time": "6h 17m 53s", "remaining_time": "2h 8m 32s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.559083} +{"loss": 0.40316868, "grad_norm": 2.97103171, "learning_rate": 1.133e-05, "token_acc": 0.8732302, "epoch": 1.49508093, "global_step/max_steps": "589/788", "elapsed_time": "6h 18m 43s", "remaining_time": "2h 7m 57s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.578847} +{"loss": 0.42821157, "grad_norm": 1.65185738, "learning_rate": 1.123e-05, "token_acc": 0.86299552, "epoch": 1.4976198, "global_step/max_steps": "590/788", "elapsed_time": "6h 19m 16s", "remaining_time": "2h 7m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.568989} +{"loss": 0.43416336, "grad_norm": 2.49544491, "learning_rate": 1.112e-05, "token_acc": 0.86382225, "epoch": 1.50015868, "global_step/max_steps": "591/788", "elapsed_time": "6h 19m 56s", "remaining_time": "2h 6m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.572463} +{"loss": 0.45839256, "grad_norm": 1.26015446, "learning_rate": 1.102e-05, "token_acc": 0.86342422, "epoch": 1.50269756, "global_step/max_steps": "592/788", "elapsed_time": "6h 20m 45s", "remaining_time": "2h 6m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.59035} +{"loss": 0.50257099, "grad_norm": 2.2375855, "learning_rate": 1.092e-05, "token_acc": 0.85082873, "epoch": 1.50523643, "global_step/max_steps": "593/788", "elapsed_time": "6h 21m 30s", "remaining_time": "2h 5m 27s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.600622} +{"loss": 0.45698214, "grad_norm": 1.3194427, "learning_rate": 1.081e-05, "token_acc": 0.85915493, "epoch": 1.50777531, "global_step/max_steps": "594/788", "elapsed_time": "6h 22m 12s", "remaining_time": "2h 4m 50s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.606077} +{"loss": 0.44513434, "grad_norm": 1.99291904, "learning_rate": 1.071e-05, "token_acc": 0.86144491, "epoch": 1.51031419, "global_step/max_steps": "595/788", "elapsed_time": "6h 22m 49s", "remaining_time": "2h 4m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.604116} +{"loss": 0.44361645, "grad_norm": 1.88164204, "learning_rate": 1.061e-05, "token_acc": 0.86067828, "epoch": 1.51285306, "global_step/max_steps": "596/788", "elapsed_time": "6h 23m 30s", "remaining_time": "2h 3m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.608016} +{"loss": 0.42596611, "grad_norm": 1.98383437, "learning_rate": 1.051e-05, "token_acc": 0.869474, "epoch": 1.51539194, "global_step/max_steps": "597/788", "elapsed_time": "6h 24m 13s", "remaining_time": "2h 2m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.614214} +{"loss": 0.46397817, "grad_norm": 4.82925949, "learning_rate": 1.041e-05, "token_acc": 0.85904129, "epoch": 1.51793082, "global_step/max_steps": "598/788", "elapsed_time": "6h 24m 56s", "remaining_time": "2h 2m 18s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.621243} +{"loss": 0.40976644, "grad_norm": 1.17774427, "learning_rate": 1.031e-05, "token_acc": 0.87270626, "epoch": 1.52046969, "global_step/max_steps": "599/788", "elapsed_time": "6h 25m 29s", "remaining_time": "2h 1m 38s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.612393} +{"loss": 0.39808822, "grad_norm": 1.82426104, "learning_rate": 1.02e-05, "token_acc": 0.87395918, "epoch": 1.52300857, "global_step/max_steps": "600/788", "elapsed_time": "6h 26m 4s", "remaining_time": "2h 0m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.60702} +{"loss": 0.45604527, "grad_norm": 2.48618987, "learning_rate": 1.01e-05, "token_acc": 0.86108049, "epoch": 1.52554745, "global_step/max_steps": "601/788", "elapsed_time": "6h 26m 44s", "remaining_time": "2h 0m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.608565} +{"loss": 0.41717058, "grad_norm": 1.60316018, "learning_rate": 1e-05, "token_acc": 0.86845559, "epoch": 1.52808632, "global_step/max_steps": "602/788", "elapsed_time": "6h 27m 27s", "remaining_time": "1h 59m 43s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.615862} +{"loss": 0.48043776, "grad_norm": 1.20645946, "learning_rate": 9.9e-06, "token_acc": 0.84922757, "epoch": 1.5306252, "global_step/max_steps": "603/788", "elapsed_time": "6h 28m 7s", "remaining_time": "1h 59m 5s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.619269} +{"loss": 0.50976884, "grad_norm": 1.26724955, "learning_rate": 9.81e-06, "token_acc": 0.85024155, "epoch": 1.53316407, "global_step/max_steps": "604/788", "elapsed_time": "6h 28m 42s", "remaining_time": "1h 58m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.612387} +{"loss": 0.47695497, "grad_norm": 4.05303449, "learning_rate": 9.71e-06, "token_acc": 0.85860207, "epoch": 1.53570295, "global_step/max_steps": "605/788", "elapsed_time": "6h 29m 24s", "remaining_time": "1h 57m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.618342} +{"loss": 0.44027835, "grad_norm": 4.46574101, "learning_rate": 9.61e-06, "token_acc": 0.86387014, "epoch": 1.53824183, "global_step/max_steps": "606/788", "elapsed_time": "6h 30m 1s", "remaining_time": "1h 57m 8s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.614725} +{"loss": 0.4480994, "grad_norm": 2.10044484, "learning_rate": 9.51e-06, "token_acc": 0.86493908, "epoch": 1.5407807, "global_step/max_steps": "607/788", "elapsed_time": "6h 30m 37s", "remaining_time": "1h 56m 29s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.611936} +{"loss": 0.40204972, "grad_norm": 1.59503453, "learning_rate": 9.41e-06, "token_acc": 0.8729817, "epoch": 1.54331958, "global_step/max_steps": "608/788", "elapsed_time": "6h 31m 17s", "remaining_time": "1h 55m 50s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.612772} +{"loss": 0.45930031, "grad_norm": 1.93799832, "learning_rate": 9.32e-06, "token_acc": 0.85345912, "epoch": 1.54585846, "global_step/max_steps": "609/788", "elapsed_time": "6h 31m 56s", "remaining_time": "1h 55m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.614864} +{"loss": 0.45823017, "grad_norm": 1.64367235, "learning_rate": 9.22e-06, "token_acc": 0.85930838, "epoch": 1.54839733, "global_step/max_steps": "610/788", "elapsed_time": "6h 32m 29s", "remaining_time": "1h 54m 32s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.604532} +{"loss": 0.42741185, "grad_norm": 1.5694933, "learning_rate": 9.12e-06, "token_acc": 0.86615921, "epoch": 1.55093621, "global_step/max_steps": "611/788", "elapsed_time": "6h 33m 6s", "remaining_time": "1h 53m 53s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.602027} +{"loss": 0.39782375, "grad_norm": 1.26779071, "learning_rate": 9.03e-06, "token_acc": 0.87171453, "epoch": 1.55347509, "global_step/max_steps": "612/788", "elapsed_time": "6h 33m 45s", "remaining_time": "1h 53m 14s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.60274} +{"loss": 0.39298624, "grad_norm": 1.79095139, "learning_rate": 8.93e-06, "token_acc": 0.87804878, "epoch": 1.55601396, "global_step/max_steps": "613/788", "elapsed_time": "6h 34m 19s", "remaining_time": "1h 52m 34s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594912} +{"loss": 0.41441351, "grad_norm": 2.16716781, "learning_rate": 8.84e-06, "token_acc": 0.86408297, "epoch": 1.55855284, "global_step/max_steps": "614/788", "elapsed_time": "6h 35m 1s", "remaining_time": "1h 51m 57s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.601223} +{"loss": 0.44686854, "grad_norm": 4.70868123, "learning_rate": 8.74e-06, "token_acc": 0.86021344, "epoch": 1.56109172, "global_step/max_steps": "615/788", "elapsed_time": "6h 35m 40s", "remaining_time": "1h 51m 18s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.60121} +{"loss": 0.4374513, "grad_norm": 2.69442443, "learning_rate": 8.65e-06, "token_acc": 0.86676995, "epoch": 1.56363059, "global_step/max_steps": "616/788", "elapsed_time": "6h 36m 14s", "remaining_time": "1h 50m 38s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594735} +{"loss": 0.43106562, "grad_norm": 8.52604842, "learning_rate": 8.55e-06, "token_acc": 0.86751134, "epoch": 1.56616947, "global_step/max_steps": "617/788", "elapsed_time": "6h 36m 52s", "remaining_time": "1h 49m 59s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592699} +{"loss": 0.5003854, "grad_norm": 1.33303523, "learning_rate": 8.46e-06, "token_acc": 0.84745763, "epoch": 1.56870835, "global_step/max_steps": "618/788", "elapsed_time": "6h 37m 28s", "remaining_time": "1h 49m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.589423} +{"loss": 0.44972062, "grad_norm": 4.97641673, "learning_rate": 8.36e-06, "token_acc": 0.86698873, "epoch": 1.57124722, "global_step/max_steps": "619/788", "elapsed_time": "6h 38m 7s", "remaining_time": "1h 48m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.590004} +{"loss": 0.44384253, "grad_norm": 1.32805368, "learning_rate": 8.27e-06, "token_acc": 0.86483855, "epoch": 1.5737861, "global_step/max_steps": "620/788", "elapsed_time": "6h 38m 45s", "remaining_time": "1h 48m 3s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.589033} +{"loss": 0.42214319, "grad_norm": 18.0134759, "learning_rate": 8.18e-06, "token_acc": 0.86708333, "epoch": 1.57632498, "global_step/max_steps": "621/788", "elapsed_time": "6h 39m 27s", "remaining_time": "1h 47m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.593496} +{"loss": 0.41414207, "grad_norm": 1.31430097, "learning_rate": 8.09e-06, "token_acc": 0.86898653, "epoch": 1.57886385, "global_step/max_steps": "622/788", "elapsed_time": "6h 40m 13s", "remaining_time": "1h 46m 49s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.606098} +{"loss": 0.42111027, "grad_norm": 2.72214742, "learning_rate": 8e-06, "token_acc": 0.86625725, "epoch": 1.58140273, "global_step/max_steps": "623/788", "elapsed_time": "6h 40m 53s", "remaining_time": "1h 46m 10s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.60801} +{"loss": 0.43198782, "grad_norm": 1.5392078, "learning_rate": 7.9e-06, "token_acc": 0.86562451, "epoch": 1.58394161, "global_step/max_steps": "624/788", "elapsed_time": "6h 41m 31s", "remaining_time": "1h 45m 32s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.607037} +{"loss": 0.39835155, "grad_norm": 1.44957295, "learning_rate": 7.81e-06, "token_acc": 0.87591478, "epoch": 1.58648048, "global_step/max_steps": "625/788", "elapsed_time": "6h 42m 2s", "remaining_time": "1h 44m 51s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.595123} +{"loss": 0.46018419, "grad_norm": 2.5571291, "learning_rate": 7.72e-06, "token_acc": 0.85752409, "epoch": 1.58901936, "global_step/max_steps": "626/788", "elapsed_time": "6h 42m 42s", "remaining_time": "1h 44m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.597385} +{"loss": 0.46355, "grad_norm": 1.41033577, "learning_rate": 7.63e-06, "token_acc": 0.86062452, "epoch": 1.59155824, "global_step/max_steps": "627/788", "elapsed_time": "6h 43m 24s", "remaining_time": "1h 43m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.602922} +{"loss": 0.35412008, "grad_norm": 2.34616044, "learning_rate": 7.54e-06, "token_acc": 0.88645183, "epoch": 1.59409711, "global_step/max_steps": "628/788", "elapsed_time": "6h 43m 53s", "remaining_time": "1h 42m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.587574} +{"loss": 0.45990786, "grad_norm": 1.71430444, "learning_rate": 7.46e-06, "token_acc": 0.85872738, "epoch": 1.59663599, "global_step/max_steps": "629/788", "elapsed_time": "6h 44m 34s", "remaining_time": "1h 42m 16s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592099} +{"loss": 0.44206625, "grad_norm": 2.6729292, "learning_rate": 7.37e-06, "token_acc": 0.86784351, "epoch": 1.59917487, "global_step/max_steps": "630/788", "elapsed_time": "6h 45m 12s", "remaining_time": "1h 41m 37s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.590888} +{"loss": 0.41721156, "grad_norm": 1.74211052, "learning_rate": 7.28e-06, "token_acc": 0.87183002, "epoch": 1.60171374, "global_step/max_steps": "631/788", "elapsed_time": "6h 45m 46s", "remaining_time": "1h 40m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.583039} +{"loss": 0.44701469, "grad_norm": 5.80854847, "learning_rate": 7.19e-06, "token_acc": 0.8587673, "epoch": 1.60425262, "global_step/max_steps": "632/788", "elapsed_time": "6h 46m 26s", "remaining_time": "1h 40m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.586083} +{"loss": 0.39006734, "grad_norm": 1.50138531, "learning_rate": 7.1e-06, "token_acc": 0.87354275, "epoch": 1.60679149, "global_step/max_steps": "633/788", "elapsed_time": "6h 47m 1s", "remaining_time": "1h 39m 40s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.580554} +{"loss": 0.42773885, "grad_norm": 2.53412527, "learning_rate": 7.02e-06, "token_acc": 0.86434754, "epoch": 1.60933037, "global_step/max_steps": "634/788", "elapsed_time": "6h 47m 37s", "remaining_time": "1h 39m 1s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.575238} +{"loss": 0.43224469, "grad_norm": 9.1095773, "learning_rate": 6.93e-06, "token_acc": 0.86675617, "epoch": 1.61186925, "global_step/max_steps": "635/788", "elapsed_time": "6h 48m 9s", "remaining_time": "1h 38m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.564917} +{"loss": 0.40752539, "grad_norm": 2.89822004, "learning_rate": 6.84e-06, "token_acc": 0.8719616, "epoch": 1.61440812, "global_step/max_steps": "636/788", "elapsed_time": "6h 48m 44s", "remaining_time": "1h 37m 41s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.559794} +{"loss": 0.42523566, "grad_norm": 2.4476072, "learning_rate": 6.76e-06, "token_acc": 0.87105969, "epoch": 1.616947, "global_step/max_steps": "637/788", "elapsed_time": "6h 49m 25s", "remaining_time": "1h 37m 3s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.563618} +{"loss": 0.49277842, "grad_norm": 3.95290187, "learning_rate": 6.67e-06, "token_acc": 0.85240063, "epoch": 1.61948588, "global_step/max_steps": "638/788", "elapsed_time": "6h 50m 5s", "remaining_time": "1h 36m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.56647} +{"loss": 0.45517564, "grad_norm": 1.99251032, "learning_rate": 6.59e-06, "token_acc": 0.86120174, "epoch": 1.62202475, "global_step/max_steps": "639/788", "elapsed_time": "6h 50m 50s", "remaining_time": "1h 35m 48s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.575716} +{"loss": 0.43744373, "grad_norm": 5.23114063, "learning_rate": 6.51e-06, "token_acc": 0.8593057, "epoch": 1.62456363, "global_step/max_steps": "640/788", "elapsed_time": "6h 51m 30s", "remaining_time": "1h 35m 10s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.577728} +{"loss": 0.48253945, "grad_norm": 1.35244045, "learning_rate": 6.42e-06, "token_acc": 0.85247884, "epoch": 1.62710251, "global_step/max_steps": "641/788", "elapsed_time": "6h 52m 4s", "remaining_time": "1h 34m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.570959} +{"loss": 0.40249798, "grad_norm": 2.01306057, "learning_rate": 6.34e-06, "token_acc": 0.87513882, "epoch": 1.62964138, "global_step/max_steps": "642/788", "elapsed_time": "6h 52m 40s", "remaining_time": "1h 33m 51s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.567738} +{"loss": 0.38909772, "grad_norm": 3.86211921, "learning_rate": 6.26e-06, "token_acc": 0.8722797, "epoch": 1.63218026, "global_step/max_steps": "643/788", "elapsed_time": "6h 53m 16s", "remaining_time": "1h 33m 12s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.563261} +{"loss": 0.40084201, "grad_norm": 1.65991069, "learning_rate": 6.17e-06, "token_acc": 0.87859922, "epoch": 1.63471914, "global_step/max_steps": "644/788", "elapsed_time": "6h 53m 53s", "remaining_time": "1h 32m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.560979} +{"loss": 0.47192597, "grad_norm": 1.28462132, "learning_rate": 6.09e-06, "token_acc": 0.85535551, "epoch": 1.63725801, "global_step/max_steps": "645/788", "elapsed_time": "6h 54m 34s", "remaining_time": "1h 31m 55s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.563859} +{"loss": 0.43028051, "grad_norm": 1.72523008, "learning_rate": 6.01e-06, "token_acc": 0.85889455, "epoch": 1.63979689, "global_step/max_steps": "646/788", "elapsed_time": "6h 55m 8s", "remaining_time": "1h 31m 15s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.556844} +{"loss": 0.42571247, "grad_norm": 1.7252628, "learning_rate": 5.93e-06, "token_acc": 0.86272594, "epoch": 1.64233577, "global_step/max_steps": "647/788", "elapsed_time": "6h 55m 40s", "remaining_time": "1h 30m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.546737} +{"loss": 0.46903479, "grad_norm": 2.66455301, "learning_rate": 5.85e-06, "token_acc": 0.85660157, "epoch": 1.64487464, "global_step/max_steps": "648/788", "elapsed_time": "6h 56m 21s", "remaining_time": "1h 29m 57s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.551641} +{"loss": 0.40596199, "grad_norm": 3.2780899, "learning_rate": 5.77e-06, "token_acc": 0.87183519, "epoch": 1.64741352, "global_step/max_steps": "649/788", "elapsed_time": "6h 56m 52s", "remaining_time": "1h 29m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.539815} +{"loss": 0.44327763, "grad_norm": 2.88386302, "learning_rate": 5.69e-06, "token_acc": 0.85643717, "epoch": 1.6499524, "global_step/max_steps": "650/788", "elapsed_time": "6h 57m 32s", "remaining_time": "1h 28m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.541633} +{"loss": 0.42719257, "grad_norm": 25.18291553, "learning_rate": 5.61e-06, "token_acc": 0.86615585, "epoch": 1.65249127, "global_step/max_steps": "651/788", "elapsed_time": "6h 58m 3s", "remaining_time": "1h 27m 59s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.530443} +{"loss": 0.46068427, "grad_norm": 1.57790866, "learning_rate": 5.53e-06, "token_acc": 0.8604612, "epoch": 1.65503015, "global_step/max_steps": "652/788", "elapsed_time": "6h 58m 39s", "remaining_time": "1h 27m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.525637} +{"loss": 0.45145622, "grad_norm": 1.693357, "learning_rate": 5.45e-06, "token_acc": 0.86347251, "epoch": 1.65756903, "global_step/max_steps": "653/788", "elapsed_time": "6h 59m 18s", "remaining_time": "1h 26m 41s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.526209} +{"loss": 0.43730107, "grad_norm": 8.51482009, "learning_rate": 5.38e-06, "token_acc": 0.86362993, "epoch": 1.6601079, "global_step/max_steps": "654/788", "elapsed_time": "7h 0m 3s", "remaining_time": "1h 26m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.53675} +{"loss": 0.4123272, "grad_norm": 1.11193199, "learning_rate": 5.3e-06, "token_acc": 0.87046558, "epoch": 1.66264678, "global_step/max_steps": "655/788", "elapsed_time": "7h 0m 38s", "remaining_time": "1h 25m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.531882} +{"loss": 0.4635973, "grad_norm": 2.63429224, "learning_rate": 5.22e-06, "token_acc": 0.85279109, "epoch": 1.66518566, "global_step/max_steps": "656/788", "elapsed_time": "7h 1m 13s", "remaining_time": "1h 24m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.526527} +{"loss": 0.42760304, "grad_norm": 5.05992395, "learning_rate": 5.15e-06, "token_acc": 0.8669181, "epoch": 1.66772453, "global_step/max_steps": "657/788", "elapsed_time": "7h 1m 45s", "remaining_time": "1h 24m 6s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.516428} +{"loss": 0.46151906, "grad_norm": 1.65279852, "learning_rate": 5.07e-06, "token_acc": 0.85627928, "epoch": 1.67026341, "global_step/max_steps": "658/788", "elapsed_time": "7h 2m 24s", "remaining_time": "1h 23m 27s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.51619} +{"loss": 0.43903154, "grad_norm": 4.50453977, "learning_rate": 5e-06, "token_acc": 0.86283784, "epoch": 1.67280228, "global_step/max_steps": "659/788", "elapsed_time": "7h 2m 55s", "remaining_time": "1h 22m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.505474} +{"loss": 0.4839735, "grad_norm": 1.71173257, "learning_rate": 4.92e-06, "token_acc": 0.85170768, "epoch": 1.67534116, "global_step/max_steps": "660/788", "elapsed_time": "7h 3m 41s", "remaining_time": "1h 22m 10s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.516767} +{"loss": 0.41646934, "grad_norm": 2.42835381, "learning_rate": 4.85e-06, "token_acc": 0.87110685, "epoch": 1.67788004, "global_step/max_steps": "661/788", "elapsed_time": "7h 4m 16s", "remaining_time": "1h 21m 31s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.511855} +{"loss": 0.49008977, "grad_norm": 1.25286731, "learning_rate": 4.77e-06, "token_acc": 0.84953704, "epoch": 1.68041891, "global_step/max_steps": "662/788", "elapsed_time": "7h 5m 3s", "remaining_time": "1h 20m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.5249} +{"loss": 0.41423997, "grad_norm": 1.52103229, "learning_rate": 4.7e-06, "token_acc": 0.87189349, "epoch": 1.68295779, "global_step/max_steps": "663/788", "elapsed_time": "7h 5m 45s", "remaining_time": "1h 20m 16s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.52984} +{"loss": 0.42122707, "grad_norm": 1.37120297, "learning_rate": 4.63e-06, "token_acc": 0.86745016, "epoch": 1.68549667, "global_step/max_steps": "664/788", "elapsed_time": "7h 6m 29s", "remaining_time": "1h 19m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.538153} +{"loss": 0.39592063, "grad_norm": 1.59059327, "learning_rate": 4.56e-06, "token_acc": 0.87699559, "epoch": 1.68803554, "global_step/max_steps": "665/788", "elapsed_time": "7h 7m 6s", "remaining_time": "1h 18m 60s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.535093} +{"loss": 0.46170676, "grad_norm": 1.83097986, "learning_rate": 4.49e-06, "token_acc": 0.85916359, "epoch": 1.69057442, "global_step/max_steps": "666/788", "elapsed_time": "7h 7m 48s", "remaining_time": "1h 18m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.540118} +{"loss": 0.44668224, "grad_norm": 1.09051421, "learning_rate": 4.41e-06, "token_acc": 0.8633254, "epoch": 1.6931133, "global_step/max_steps": "667/788", "elapsed_time": "7h 8m 30s", "remaining_time": "1h 17m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.546131} +{"loss": 0.47668242, "grad_norm": 2.89621752, "learning_rate": 4.34e-06, "token_acc": 0.85606149, "epoch": 1.69565217, "global_step/max_steps": "668/788", "elapsed_time": "7h 9m 27s", "remaining_time": "1h 17m 9s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.572958} +{"loss": 0.44002464, "grad_norm": 1.50353259, "learning_rate": 4.27e-06, "token_acc": 0.86660617, "epoch": 1.69819105, "global_step/max_steps": "669/788", "elapsed_time": "7h 10m 6s", "remaining_time": "1h 16m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.573418} +{"loss": 0.4330124, "grad_norm": 1.13111325, "learning_rate": 4.2e-06, "token_acc": 0.85733237, "epoch": 1.70072993, "global_step/max_steps": "670/788", "elapsed_time": "7h 10m 50s", "remaining_time": "1h 15m 53s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.582192} +{"loss": 0.47577754, "grad_norm": 2.00108512, "learning_rate": 4.14e-06, "token_acc": 0.85383878, "epoch": 1.7032688, "global_step/max_steps": "671/788", "elapsed_time": "7h 11m 26s", "remaining_time": "1h 15m 14s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.578957} +{"loss": 0.4560515, "grad_norm": 3.13187986, "learning_rate": 4.07e-06, "token_acc": 0.85871157, "epoch": 1.70580768, "global_step/max_steps": "672/788", "elapsed_time": "7h 12m 8s", "remaining_time": "1h 14m 36s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.583786} +{"loss": 0.48498058, "grad_norm": 3.24379337, "learning_rate": 4e-06, "token_acc": 0.84647447, "epoch": 1.70834656, "global_step/max_steps": "673/788", "elapsed_time": "7h 12m 54s", "remaining_time": "1h 13m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594668} +{"loss": 0.48205879, "grad_norm": 1.83493326, "learning_rate": 3.93e-06, "token_acc": 0.85741679, "epoch": 1.71088543, "global_step/max_steps": "674/788", "elapsed_time": "7h 13m 37s", "remaining_time": "1h 13m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.600786} +{"loss": 0.4072606, "grad_norm": 1.3519819, "learning_rate": 3.87e-06, "token_acc": 0.87619356, "epoch": 1.71342431, "global_step/max_steps": "675/788", "elapsed_time": "7h 14m 19s", "remaining_time": "1h 12m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.605692} +{"loss": 0.46223205, "grad_norm": 2.3240652, "learning_rate": 3.8e-06, "token_acc": 0.85970431, "epoch": 1.71596319, "global_step/max_steps": "676/788", "elapsed_time": "7h 14m 57s", "remaining_time": "1h 12m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.604569} +{"loss": 0.43341649, "grad_norm": 3.13446639, "learning_rate": 3.73e-06, "token_acc": 0.86268894, "epoch": 1.71850206, "global_step/max_steps": "677/788", "elapsed_time": "7h 15m 33s", "remaining_time": "1h 11m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.600624} +{"loss": 0.40910569, "grad_norm": 3.1262055, "learning_rate": 3.67e-06, "token_acc": 0.87068452, "epoch": 1.72104094, "global_step/max_steps": "678/788", "elapsed_time": "7h 16m 17s", "remaining_time": "1h 10m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.609871} +{"loss": 0.48174021, "grad_norm": 2.6627383, "learning_rate": 3.6e-06, "token_acc": 0.85176471, "epoch": 1.72357982, "global_step/max_steps": "679/788", "elapsed_time": "7h 16m 55s", "remaining_time": "1h 10m 8s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.607825} +{"loss": 0.3952204, "grad_norm": 1.63932372, "learning_rate": 3.54e-06, "token_acc": 0.87413488, "epoch": 1.72611869, "global_step/max_steps": "680/788", "elapsed_time": "7h 17m 33s", "remaining_time": "1h 9m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.607551} +{"loss": 0.47784877, "grad_norm": 2.70788925, "learning_rate": 3.48e-06, "token_acc": 0.85289279, "epoch": 1.72865757, "global_step/max_steps": "681/788", "elapsed_time": "7h 18m 9s", "remaining_time": "1h 8m 51s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.602829} +{"loss": 0.38262337, "grad_norm": 2.82020099, "learning_rate": 3.41e-06, "token_acc": 0.88222838, "epoch": 1.73119645, "global_step/max_steps": "682/788", "elapsed_time": "7h 18m 42s", "remaining_time": "1h 8m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.595391} +{"loss": 0.44565722, "grad_norm": 1.30778914, "learning_rate": 3.35e-06, "token_acc": 0.86067601, "epoch": 1.73373532, "global_step/max_steps": "683/788", "elapsed_time": "7h 19m 23s", "remaining_time": "1h 7m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.59856} +{"loss": 0.45349833, "grad_norm": 1.98208956, "learning_rate": 3.29e-06, "token_acc": 0.85901453, "epoch": 1.7362742, "global_step/max_steps": "684/788", "elapsed_time": "7h 20m 0s", "remaining_time": "1h 6m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.596938} +{"loss": 0.45160028, "grad_norm": 1.23557492, "learning_rate": 3.23e-06, "token_acc": 0.86441681, "epoch": 1.73881308, "global_step/max_steps": "685/788", "elapsed_time": "7h 20m 37s", "remaining_time": "1h 6m 15s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.593602} +{"loss": 0.43854171, "grad_norm": 1.79439653, "learning_rate": 3.16e-06, "token_acc": 0.86316104, "epoch": 1.74135195, "global_step/max_steps": "686/788", "elapsed_time": "7h 21m 16s", "remaining_time": "1h 5m 37s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594658} +{"loss": 0.47738582, "grad_norm": 1.39320996, "learning_rate": 3.1e-06, "token_acc": 0.85371703, "epoch": 1.74389083, "global_step/max_steps": "687/788", "elapsed_time": "7h 21m 53s", "remaining_time": "1h 4m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592458} +{"loss": 0.45275977, "grad_norm": 2.27633759, "learning_rate": 3.04e-06, "token_acc": 0.85986933, "epoch": 1.7464297, "global_step/max_steps": "688/788", "elapsed_time": "7h 22m 28s", "remaining_time": "1h 4m 19s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.587516} +{"loss": 0.362638, "grad_norm": 1.54107895, "learning_rate": 2.99e-06, "token_acc": 0.87997966, "epoch": 1.74896858, "global_step/max_steps": "689/788", "elapsed_time": "7h 23m 3s", "remaining_time": "1h 3m 40s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.582232} +{"loss": 0.43140548, "grad_norm": 1.5215648, "learning_rate": 2.93e-06, "token_acc": 0.86904204, "epoch": 1.75150746, "global_step/max_steps": "690/788", "elapsed_time": "7h 23m 36s", "remaining_time": "1h 3m 0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.573451} +{"loss": 0.44865778, "grad_norm": 1.77439033, "learning_rate": 2.87e-06, "token_acc": 0.86565325, "epoch": 1.75404633, "global_step/max_steps": "691/788", "elapsed_time": "7h 24m 17s", "remaining_time": "1h 2m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.576954} +{"loss": 0.41996461, "grad_norm": 1.33883869, "learning_rate": 2.81e-06, "token_acc": 0.87182066, "epoch": 1.75658521, "global_step/max_steps": "692/788", "elapsed_time": "7h 24m 57s", "remaining_time": "1h 1m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.579216} +{"loss": 0.41886464, "grad_norm": 1.33894066, "learning_rate": 2.75e-06, "token_acc": 0.86673554, "epoch": 1.75912409, "global_step/max_steps": "693/788", "elapsed_time": "7h 25m 27s", "remaining_time": "1h 1m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.566481} +{"loss": 0.44109213, "grad_norm": 1.15600224, "learning_rate": 2.7e-06, "token_acc": 0.86528354, "epoch": 1.76166296, "global_step/max_steps": "694/788", "elapsed_time": "7h 26m 14s", "remaining_time": "1h 0m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.579166} +{"loss": 0.4875491, "grad_norm": 2.06185539, "learning_rate": 2.64e-06, "token_acc": 0.85233125, "epoch": 1.76420184, "global_step/max_steps": "695/788", "elapsed_time": "7h 27m 3s", "remaining_time": "59m 49s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.594958} +{"loss": 0.42366081, "grad_norm": 1.29477067, "learning_rate": 2.59e-06, "token_acc": 0.86940299, "epoch": 1.76674072, "global_step/max_steps": "696/788", "elapsed_time": "7h 27m 47s", "remaining_time": "59m 11s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.60167} +{"loss": 0.46329659, "grad_norm": 2.42680792, "learning_rate": 2.53e-06, "token_acc": 0.85775291, "epoch": 1.76927959, "global_step/max_steps": "697/788", "elapsed_time": "7h 28m 27s", "remaining_time": "58m 33s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.604062} +{"loss": 0.46320936, "grad_norm": 15.35105366, "learning_rate": 2.48e-06, "token_acc": 0.85718613, "epoch": 1.77181847, "global_step/max_steps": "698/788", "elapsed_time": "7h 29m 2s", "remaining_time": "57m 54s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.598753} +{"loss": 0.46449089, "grad_norm": 1.23345052, "learning_rate": 2.42e-06, "token_acc": 0.86224042, "epoch": 1.77435735, "global_step/max_steps": "699/788", "elapsed_time": "7h 29m 43s", "remaining_time": "57m 16s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.60289} +{"loss": 0.51305586, "grad_norm": 1.16093731, "learning_rate": 2.37e-06, "token_acc": 0.84254884, "epoch": 1.77689622, "global_step/max_steps": "700/788", "elapsed_time": "7h 30m 24s", "remaining_time": "56m 37s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.606354} +{"loss": 0.44971961, "grad_norm": 1.58226301, "learning_rate": 2.32e-06, "token_acc": 0.85797699, "epoch": 1.7794351, "global_step/max_steps": "701/788", "elapsed_time": "7h 31m 1s", "remaining_time": "55m 58s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.603442} +{"loss": 0.46931356, "grad_norm": 1.57041318, "learning_rate": 2.26e-06, "token_acc": 0.85593705, "epoch": 1.78197398, "global_step/max_steps": "702/788", "elapsed_time": "7h 31m 37s", "remaining_time": "55m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.599984} +{"loss": 0.4473998, "grad_norm": 3.06125166, "learning_rate": 2.21e-06, "token_acc": 0.85918125, "epoch": 1.78451285, "global_step/max_steps": "703/788", "elapsed_time": "7h 32m 6s", "remaining_time": "54m 40s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.586021} +{"loss": 0.45030868, "grad_norm": 2.94830852, "learning_rate": 2.16e-06, "token_acc": 0.86237738, "epoch": 1.78705173, "global_step/max_steps": "704/788", "elapsed_time": "7h 32m 44s", "remaining_time": "54m 1s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584765} +{"loss": 0.42292541, "grad_norm": 1.9136507, "learning_rate": 2.11e-06, "token_acc": 0.86543806, "epoch": 1.78959061, "global_step/max_steps": "705/788", "elapsed_time": "7h 33m 24s", "remaining_time": "53m 23s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.587263} +{"loss": 0.4149496, "grad_norm": 1.57775853, "learning_rate": 2.06e-06, "token_acc": 0.86329815, "epoch": 1.79212948, "global_step/max_steps": "706/788", "elapsed_time": "7h 33m 58s", "remaining_time": "52m 44s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.580924} +{"loss": 0.39806831, "grad_norm": 28.45399757, "learning_rate": 2.01e-06, "token_acc": 0.87619048, "epoch": 1.79466836, "global_step/max_steps": "707/788", "elapsed_time": "7h 34m 27s", "remaining_time": "52m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.566926} +{"loss": 0.47827813, "grad_norm": 1.44201162, "learning_rate": 1.96e-06, "token_acc": 0.85598216, "epoch": 1.79720724, "global_step/max_steps": "708/788", "elapsed_time": "7h 35m 0s", "remaining_time": "51m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.559848} +{"loss": 0.41705847, "grad_norm": 1.3684846, "learning_rate": 1.91e-06, "token_acc": 0.86560614, "epoch": 1.79974611, "global_step/max_steps": "709/788", "elapsed_time": "7h 35m 34s", "remaining_time": "50m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.553425} +{"loss": 0.41759837, "grad_norm": 1.40488382, "learning_rate": 1.87e-06, "token_acc": 0.86650896, "epoch": 1.80228499, "global_step/max_steps": "710/788", "elapsed_time": "7h 36m 10s", "remaining_time": "50m 7s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.549839} +{"loss": 0.37564218, "grad_norm": 1.65248742, "learning_rate": 1.82e-06, "token_acc": 0.88255361, "epoch": 1.80482387, "global_step/max_steps": "711/788", "elapsed_time": "7h 36m 48s", "remaining_time": "49m 28s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.54805} +{"loss": 0.41721421, "grad_norm": 1.43665563, "learning_rate": 1.77e-06, "token_acc": 0.87026569, "epoch": 1.80736274, "global_step/max_steps": "712/788", "elapsed_time": "7h 37m 23s", "remaining_time": "48m 49s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.543905} +{"loss": 0.39479968, "grad_norm": 1.65822236, "learning_rate": 1.73e-06, "token_acc": 0.87113647, "epoch": 1.80990162, "global_step/max_steps": "713/788", "elapsed_time": "7h 37m 56s", "remaining_time": "48m 10s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.5364} +{"loss": 0.47038803, "grad_norm": 2.08941566, "learning_rate": 1.68e-06, "token_acc": 0.85869106, "epoch": 1.8124405, "global_step/max_steps": "714/788", "elapsed_time": "7h 38m 41s", "remaining_time": "47m 32s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.544509} +{"loss": 0.50214553, "grad_norm": 2.2836605, "learning_rate": 1.64e-06, "token_acc": 0.84855438, "epoch": 1.81497937, "global_step/max_steps": "715/788", "elapsed_time": "7h 39m 12s", "remaining_time": "46m 53s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.534785} +{"loss": 0.43437493, "grad_norm": 1.8788922, "learning_rate": 1.59e-06, "token_acc": 0.85974471, "epoch": 1.81751825, "global_step/max_steps": "716/788", "elapsed_time": "7h 39m 54s", "remaining_time": "46m 15s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.538744} +{"loss": 0.50359339, "grad_norm": 1.99288549, "learning_rate": 1.55e-06, "token_acc": 0.84481189, "epoch": 1.82005712, "global_step/max_steps": "717/788", "elapsed_time": "7h 40m 28s", "remaining_time": "45m 36s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.532888} +{"loss": 0.43502116, "grad_norm": 1.87509711, "learning_rate": 1.51e-06, "token_acc": 0.86664238, "epoch": 1.822596, "global_step/max_steps": "718/788", "elapsed_time": "7h 41m 1s", "remaining_time": "44m 57s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.52511} +{"loss": 0.43207881, "grad_norm": 1.45044064, "learning_rate": 1.47e-06, "token_acc": 0.86461126, "epoch": 1.82513488, "global_step/max_steps": "719/788", "elapsed_time": "7h 41m 41s", "remaining_time": "44m 18s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.526519} +{"loss": 0.40384841, "grad_norm": 1.90977553, "learning_rate": 1.42e-06, "token_acc": 0.87336926, "epoch": 1.82767375, "global_step/max_steps": "720/788", "elapsed_time": "7h 42m 27s", "remaining_time": "43m 41s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.536842} +{"loss": 0.39674959, "grad_norm": 6.19991714, "learning_rate": 1.38e-06, "token_acc": 0.87482785, "epoch": 1.83021263, "global_step/max_steps": "721/788", "elapsed_time": "7h 43m 6s", "remaining_time": "43m 2s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.538316} +{"loss": 0.45204362, "grad_norm": 2.00244785, "learning_rate": 1.34e-06, "token_acc": 0.85918397, "epoch": 1.83275151, "global_step/max_steps": "722/788", "elapsed_time": "7h 43m 55s", "remaining_time": "42m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.553119} +{"loss": 0.45737043, "grad_norm": 6.09868347, "learning_rate": 1.3e-06, "token_acc": 0.85869005, "epoch": 1.83529038, "global_step/max_steps": "723/788", "elapsed_time": "7h 44m 35s", "remaining_time": "41m 46s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.554688} +{"loss": 0.48026317, "grad_norm": 1.28678124, "learning_rate": 1.26e-06, "token_acc": 0.85346148, "epoch": 1.83782926, "global_step/max_steps": "724/788", "elapsed_time": "7h 45m 13s", "remaining_time": "41m 7s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.553696} +{"loss": 0.47273803, "grad_norm": 3.19571686, "learning_rate": 1.22e-06, "token_acc": 0.85612258, "epoch": 1.84036814, "global_step/max_steps": "725/788", "elapsed_time": "7h 45m 54s", "remaining_time": "40m 29s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.556743} +{"loss": 0.4856033, "grad_norm": 3.28029395, "learning_rate": 1.19e-06, "token_acc": 0.85260575, "epoch": 1.84290701, "global_step/max_steps": "726/788", "elapsed_time": "7h 46m 33s", "remaining_time": "39m 51s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.557517} +{"loss": 0.45862627, "grad_norm": 2.27924702, "learning_rate": 1.15e-06, "token_acc": 0.85715935, "epoch": 1.84544589, "global_step/max_steps": "727/788", "elapsed_time": "7h 47m 31s", "remaining_time": "39m 14s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584624} +{"loss": 0.42885906, "grad_norm": 1.55874048, "learning_rate": 1.11e-06, "token_acc": 0.8708909, "epoch": 1.84798477, "global_step/max_steps": "728/788", "elapsed_time": "7h 48m 9s", "remaining_time": "38m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.583711} +{"loss": 0.47851318, "grad_norm": 3.06823799, "learning_rate": 1.07e-06, "token_acc": 0.85612228, "epoch": 1.85052364, "global_step/max_steps": "729/788", "elapsed_time": "7h 48m 42s", "remaining_time": "37m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.57612} +{"loss": 0.39384454, "grad_norm": 1.89895348, "learning_rate": 1.04e-06, "token_acc": 0.87942535, "epoch": 1.85306252, "global_step/max_steps": "730/788", "elapsed_time": "7h 49m 10s", "remaining_time": "37m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.561567} +{"loss": 0.40233713, "grad_norm": 1.27248538, "learning_rate": 1e-06, "token_acc": 0.87211883, "epoch": 1.8556014, "global_step/max_steps": "731/788", "elapsed_time": "7h 49m 45s", "remaining_time": "36m 38s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.556379} +{"loss": 0.40896982, "grad_norm": 1.2336935, "learning_rate": 9.7e-07, "token_acc": 0.87028937, "epoch": 1.85814027, "global_step/max_steps": "732/788", "elapsed_time": "7h 50m 17s", "remaining_time": "35m 59s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.548109} +{"loss": 0.46357673, "grad_norm": 2.40521718, "learning_rate": 9.3e-07, "token_acc": 0.85808627, "epoch": 1.86067915, "global_step/max_steps": "733/788", "elapsed_time": "7h 50m 58s", "remaining_time": "35m 20s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.55156} +{"loss": 0.45178261, "grad_norm": 1.40028551, "learning_rate": 9e-07, "token_acc": 0.86535399, "epoch": 1.86321803, "global_step/max_steps": "734/788", "elapsed_time": "7h 51m 41s", "remaining_time": "34m 42s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.557068} +{"loss": 0.38833541, "grad_norm": 1.92425947, "learning_rate": 8.7e-07, "token_acc": 0.87727273, "epoch": 1.8657569, "global_step/max_steps": "735/788", "elapsed_time": "7h 52m 24s", "remaining_time": "34m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.563668} +{"loss": 0.49033722, "grad_norm": 1.31476536, "learning_rate": 8.4e-07, "token_acc": 0.85303853, "epoch": 1.86829578, "global_step/max_steps": "736/788", "elapsed_time": "7h 53m 6s", "remaining_time": "33m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.567472} +{"loss": 0.39452702, "grad_norm": 2.02014882, "learning_rate": 8e-07, "token_acc": 0.87274739, "epoch": 1.87083466, "global_step/max_steps": "737/788", "elapsed_time": "7h 53m 42s", "remaining_time": "32m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.564602} +{"loss": 0.41123521, "grad_norm": 1.3190323, "learning_rate": 7.7e-07, "token_acc": 0.87227233, "epoch": 1.87337353, "global_step/max_steps": "738/788", "elapsed_time": "7h 54m 21s", "remaining_time": "32m 8s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.565119} +{"loss": 0.47771162, "grad_norm": 1.47905905, "learning_rate": 7.4e-07, "token_acc": 0.85430464, "epoch": 1.87591241, "global_step/max_steps": "739/788", "elapsed_time": "7h 55m 3s", "remaining_time": "31m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.569992} +{"loss": 0.45625889, "grad_norm": 3.45615926, "learning_rate": 7.1e-07, "token_acc": 0.85805923, "epoch": 1.87845129, "global_step/max_steps": "740/788", "elapsed_time": "7h 55m 43s", "remaining_time": "30m 51s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.572229} +{"loss": 0.36923718, "grad_norm": 8.34125856, "learning_rate": 6.8e-07, "token_acc": 0.88174204, "epoch": 1.88099016, "global_step/max_steps": "741/788", "elapsed_time": "7h 56m 21s", "remaining_time": "30m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.570671} +{"loss": 0.52737916, "grad_norm": 1.97159954, "learning_rate": 6.5e-07, "token_acc": 0.84407403, "epoch": 1.88352904, "global_step/max_steps": "742/788", "elapsed_time": "7h 57m 6s", "remaining_time": "29m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.57936} +{"loss": 0.38420278, "grad_norm": 1.54414675, "learning_rate": 6.3e-07, "token_acc": 0.88183647, "epoch": 1.88606791, "global_step/max_steps": "743/788", "elapsed_time": "7h 57m 37s", "remaining_time": "28m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.568684} +{"loss": 0.39639431, "grad_norm": 2.5051141, "learning_rate": 6e-07, "token_acc": 0.87643452, "epoch": 1.88860679, "global_step/max_steps": "744/788", "elapsed_time": "7h 58m 15s", "remaining_time": "28m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.568226} +{"loss": 0.40034431, "grad_norm": 1.2437998, "learning_rate": 5.7e-07, "token_acc": 0.87101747, "epoch": 1.89114567, "global_step/max_steps": "745/788", "elapsed_time": "7h 58m 51s", "remaining_time": "27m 38s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.565428} +{"loss": 0.43405107, "grad_norm": 1.33182746, "learning_rate": 5.5e-07, "token_acc": 0.86633816, "epoch": 1.89368454, "global_step/max_steps": "746/788", "elapsed_time": "7h 59m 35s", "remaining_time": "27m 0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.572913} +{"loss": 0.3998248, "grad_norm": 1.41907864, "learning_rate": 5.2e-07, "token_acc": 0.87347254, "epoch": 1.89622342, "global_step/max_steps": "747/788", "elapsed_time": "8h 0m 15s", "remaining_time": "26m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.574033} +{"loss": 0.48743832, "grad_norm": 2.0947666, "learning_rate": 5e-07, "token_acc": 0.85491347, "epoch": 1.8987623, "global_step/max_steps": "748/788", "elapsed_time": "8h 0m 51s", "remaining_time": "25m 43s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.57046} +{"loss": 0.41227329, "grad_norm": 1.53135089, "learning_rate": 4.7e-07, "token_acc": 0.86851211, "epoch": 1.90130117, "global_step/max_steps": "749/788", "elapsed_time": "8h 1m 22s", "remaining_time": "25m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.561313} +{"loss": 0.44531292, "grad_norm": 1.57496558, "learning_rate": 4.5e-07, "token_acc": 0.86431386, "epoch": 1.90384005, "global_step/max_steps": "750/788", "elapsed_time": "8h 1m 58s", "remaining_time": "24m 25s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.557107} +{"loss": 0.40033698, "grad_norm": 2.95995575, "learning_rate": 4.2e-07, "token_acc": 0.87605885, "epoch": 1.90637893, "global_step/max_steps": "751/788", "elapsed_time": "8h 2m 40s", "remaining_time": "23m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.561705} +{"loss": 0.46523976, "grad_norm": 3.49803284, "learning_rate": 4e-07, "token_acc": 0.86246537, "epoch": 1.9089178, "global_step/max_steps": "752/788", "elapsed_time": "8h 3m 19s", "remaining_time": "23m 8s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.561909} +{"loss": 0.48083657, "grad_norm": 1.64581849, "learning_rate": 3.8e-07, "token_acc": 0.8546286, "epoch": 1.91145668, "global_step/max_steps": "753/788", "elapsed_time": "8h 4m 1s", "remaining_time": "22m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.566512} +{"loss": 0.45721623, "grad_norm": 1.7385832, "learning_rate": 3.6e-07, "token_acc": 0.86173224, "epoch": 1.91399556, "global_step/max_steps": "754/788", "elapsed_time": "8h 4m 45s", "remaining_time": "21m 52s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.573969} +{"loss": 0.38399953, "grad_norm": 1.7105542, "learning_rate": 3.4e-07, "token_acc": 0.87390659, "epoch": 1.91653443, "global_step/max_steps": "755/788", "elapsed_time": "8h 5m 20s", "remaining_time": "21m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.569651} +{"loss": 0.52081192, "grad_norm": 1.45667222, "learning_rate": 3.2e-07, "token_acc": 0.84755286, "epoch": 1.91907331, "global_step/max_steps": "756/788", "elapsed_time": "8h 6m 2s", "remaining_time": "20m 34s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.574189} +{"loss": 0.42392558, "grad_norm": 4.93088118, "learning_rate": 3e-07, "token_acc": 0.86709813, "epoch": 1.92161219, "global_step/max_steps": "757/788", "elapsed_time": "8h 6m 43s", "remaining_time": "19m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.576989} +{"loss": 0.39813119, "grad_norm": 2.57506693, "learning_rate": 2.8e-07, "token_acc": 0.86916933, "epoch": 1.92415106, "global_step/max_steps": "758/788", "elapsed_time": "8h 7m 23s", "remaining_time": "19m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.579272} +{"loss": 0.44815397, "grad_norm": 1.60906254, "learning_rate": 2.6e-07, "token_acc": 0.85802134, "epoch": 1.92668994, "global_step/max_steps": "759/788", "elapsed_time": "8h 8m 2s", "remaining_time": "18m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.580205} +{"loss": 0.41916481, "grad_norm": 3.28421109, "learning_rate": 2.4e-07, "token_acc": 0.86698047, "epoch": 1.92922882, "global_step/max_steps": "760/788", "elapsed_time": "8h 8m 34s", "remaining_time": "17m 60s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.57065} +{"loss": 0.4449439, "grad_norm": 1.53463683, "learning_rate": 2.3e-07, "token_acc": 0.86160283, "epoch": 1.93176769, "global_step/max_steps": "761/788", "elapsed_time": "8h 9m 8s", "remaining_time": "17m 21s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.565313} +{"loss": 0.43805444, "grad_norm": 2.57240604, "learning_rate": 2.1e-07, "token_acc": 0.86349254, "epoch": 1.93430657, "global_step/max_steps": "762/788", "elapsed_time": "8h 9m 48s", "remaining_time": "16m 43s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.567146} +{"loss": 0.46936229, "grad_norm": 1.63141119, "learning_rate": 1.9e-07, "token_acc": 0.85235229, "epoch": 1.93684545, "global_step/max_steps": "763/788", "elapsed_time": "8h 10m 39s", "remaining_time": "16m 5s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.583566} +{"loss": 0.44686526, "grad_norm": 1.31408202, "learning_rate": 1.8e-07, "token_acc": 0.8632043, "epoch": 1.93938432, "global_step/max_steps": "764/788", "elapsed_time": "8h 11m 17s", "remaining_time": "15m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.582268} +{"loss": 0.43155643, "grad_norm": 2.77052743, "learning_rate": 1.6e-07, "token_acc": 0.8636809, "epoch": 1.9419232, "global_step/max_steps": "765/788", "elapsed_time": "8h 11m 54s", "remaining_time": "14m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.580079} +{"loss": 0.48541945, "grad_norm": 4.22793323, "learning_rate": 1.5e-07, "token_acc": 0.85265455, "epoch": 1.94446208, "global_step/max_steps": "766/788", "elapsed_time": "8h 12m 32s", "remaining_time": "14m 9s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.578994} +{"loss": 0.40719122, "grad_norm": 1.76445705, "learning_rate": 1.4e-07, "token_acc": 0.87126179, "epoch": 1.94700095, "global_step/max_steps": "767/788", "elapsed_time": "8h 13m 7s", "remaining_time": "13m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.574479} +{"loss": 0.398323, "grad_norm": 1.85257925, "learning_rate": 1.2e-07, "token_acc": 0.86845942, "epoch": 1.94953983, "global_step/max_steps": "768/788", "elapsed_time": "8h 13m 46s", "remaining_time": "12m 52s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.575412} +{"loss": 0.40239978, "grad_norm": 3.08724011, "learning_rate": 1.1e-07, "token_acc": 0.86806572, "epoch": 1.95207871, "global_step/max_steps": "769/788", "elapsed_time": "8h 14m 21s", "remaining_time": "12m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.570741} +{"loss": 0.45449412, "grad_norm": 1.55378667, "learning_rate": 1e-07, "token_acc": 0.86167401, "epoch": 1.95461758, "global_step/max_steps": "770/788", "elapsed_time": "8h 15m 6s", "remaining_time": "11m 34s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.57949} +{"loss": 0.43757093, "grad_norm": 1.61891887, "learning_rate": 9e-08, "token_acc": 0.86335304, "epoch": 1.95715646, "global_step/max_steps": "771/788", "elapsed_time": "8h 15m 45s", "remaining_time": "10m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.579122} +{"loss": 0.53046107, "grad_norm": 1.18595295, "learning_rate": 8e-08, "token_acc": 0.84806955, "epoch": 1.95969533, "global_step/max_steps": "772/788", "elapsed_time": "8h 16m 18s", "remaining_time": "10m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.572974} +{"loss": 0.36439198, "grad_norm": 1.5057359, "learning_rate": 7e-08, "token_acc": 0.88163387, "epoch": 1.96223421, "global_step/max_steps": "773/788", "elapsed_time": "8h 16m 53s", "remaining_time": "9m 39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.568069} +{"loss": 0.44290856, "grad_norm": 1.48959985, "learning_rate": 6e-08, "token_acc": 0.86218974, "epoch": 1.96477309, "global_step/max_steps": "774/788", "elapsed_time": "8h 17m 36s", "remaining_time": "9m 0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.573365} +{"loss": 0.48098025, "grad_norm": 2.18249508, "learning_rate": 5e-08, "token_acc": 0.85787234, "epoch": 1.96731196, "global_step/max_steps": "775/788", "elapsed_time": "8h 18m 25s", "remaining_time": "8m 22s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.58714} +{"loss": 0.42364717, "grad_norm": 1.29255525, "learning_rate": 4e-08, "token_acc": 0.86251486, "epoch": 1.96985084, "global_step/max_steps": "776/788", "elapsed_time": "8h 19m 1s", "remaining_time": "7m 43s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.584371} +{"loss": 0.48180422, "grad_norm": 3.3815824, "learning_rate": 4e-08, "token_acc": 0.85004437, "epoch": 1.97238972, "global_step/max_steps": "777/788", "elapsed_time": "8h 19m 45s", "remaining_time": "7m 4s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.590246} +{"loss": 0.38992089, "grad_norm": 2.851125, "learning_rate": 3e-08, "token_acc": 0.87189873, "epoch": 1.97492859, "global_step/max_steps": "778/788", "elapsed_time": "8h 20m 20s", "remaining_time": "6m 26s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.586037} +{"loss": 0.45743489, "grad_norm": 1.80483992, "learning_rate": 3e-08, "token_acc": 0.85619835, "epoch": 1.97746747, "global_step/max_steps": "779/788", "elapsed_time": "8h 20m 56s", "remaining_time": "5m 47s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.582796} +{"loss": 0.4771176, "grad_norm": 4.13020326, "learning_rate": 2e-08, "token_acc": 0.85695423, "epoch": 1.98000635, "global_step/max_steps": "780/788", "elapsed_time": "8h 21m 42s", "remaining_time": "5m 9s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.592388} +{"loss": 0.47063357, "grad_norm": 9.56382306, "learning_rate": 2e-08, "token_acc": 0.85587045, "epoch": 1.98254522, "global_step/max_steps": "781/788", "elapsed_time": "8h 22m 56s", "remaining_time": "4m 30s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.637784} +{"loss": 0.36328679, "grad_norm": 1.00192928, "learning_rate": 1e-08, "token_acc": 0.88329135, "epoch": 1.9850841, "global_step/max_steps": "782/788", "elapsed_time": "8h 23m 35s", "remaining_time": "3m 52s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.63851} +{"loss": 0.47835836, "grad_norm": 2.11693216, "learning_rate": 1e-08, "token_acc": 0.85488916, "epoch": 1.98762298, "global_step/max_steps": "783/788", "elapsed_time": "8h 24m 21s", "remaining_time": "3m 13s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.647463} +{"loss": 0.39944282, "grad_norm": 1.8166522, "learning_rate": 0.0, "token_acc": 0.87655617, "epoch": 1.99016185, "global_step/max_steps": "784/788", "elapsed_time": "8h 25m 4s", "remaining_time": "2m 35s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.653167} +{"loss": 0.46872842, "grad_norm": 1.91855914, "learning_rate": 0.0, "token_acc": 0.85696746, "epoch": 1.99270073, "global_step/max_steps": "785/788", "elapsed_time": "8h 25m 33s", "remaining_time": "1m 56s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.640474} +{"loss": 0.43920624, "grad_norm": 2.36914991, "learning_rate": 0.0, "token_acc": 0.86179104, "epoch": 1.99523961, "global_step/max_steps": "786/788", "elapsed_time": "8h 26m 3s", "remaining_time": "1m 17s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.630188} +{"loss": 0.43269125, "grad_norm": 1.3499799, "learning_rate": 0.0, "token_acc": 0.86716259, "epoch": 1.99777848, "global_step/max_steps": "787/788", "elapsed_time": "8h 26m 35s", "remaining_time": "39s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.621615} +{"loss": 0.4115853, "grad_norm": 4.23464928, "learning_rate": 0.0, "token_acc": 0.87141674, "epoch": 2.0, "global_step/max_steps": "788/788", "elapsed_time": "8h 27m 8s", "remaining_time": "0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.614084} +{"eval_loss": 0.35869709, "eval_runtime": 8.1551, "eval_samples_per_second": 1.471, "eval_steps_per_second": 0.368, "eval_token_acc": 0.88127676, "epoch": 2.0, "global_step/max_steps": "788/788", "elapsed_time": "8h 27m 16s", "remaining_time": "0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.624445} +{"eval_loss": 0.35869709, "eval_runtime": 8.2383, "eval_samples_per_second": 1.457, "eval_steps_per_second": 0.364, "eval_token_acc": 0.88127676, "epoch": 2.0, "global_step/max_steps": "788/788", "elapsed_time": "8h 27m 28s", "remaining_time": "0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.639886} +{"train_runtime": 30451.4296, "train_samples_per_second": 0.828, "train_steps_per_second": 0.026, "total_flos": 4166480484106240.0, "train_loss": 0.55871918, "epoch": 2.0, "global_step/max_steps": "788/788", "elapsed_time": "8h 27m 31s", "remaining_time": "0s", "memory(GiB)": 52.28, "train_speed(s/it)": 38.643936} +{"model_parameter_info": "PeftModelForCausalLM: 8343.6882M Params (51.5215M Trainable [0.6175%]), 0.0019M Buffers.", "last_model_checkpoint": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788", "best_model_checkpoint": "/data/yutao/lzt/BrowserAgent_v2/sft/output/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/checkpoint-788", "best_metric": 0.35869709, "global_step": 788, "log_history": [{"loss": 1.318245530128479, "grad_norm": 3.644420246106802, "learning_rate": 3.1645569620253163e-07, "token_acc": 0.7163964997848228, "epoch": 0.0025388765471278957, "step": 1}, {"loss": 1.3213859796524048, "grad_norm": 7.066332979169105, "learning_rate": 6.329113924050633e-07, "token_acc": 0.7273305758829144, "epoch": 0.0050777530942557915, "step": 2}, {"loss": 1.3628352880477905, "grad_norm": 10.199557510236037, "learning_rate": 9.493670886075951e-07, "token_acc": 0.7068235294117647, "epoch": 0.007616629641383688, "step": 3}, {"loss": 1.365400791168213, "grad_norm": 2.8758103179283525, "learning_rate": 1.2658227848101265e-06, "token_acc": 0.7117047560222359, "epoch": 0.010155506188511583, "step": 4}, {"loss": 1.400863528251648, "grad_norm": 3.297140385498391, "learning_rate": 1.5822784810126583e-06, "token_acc": 0.698011137629276, "epoch": 0.012694382735639479, "step": 5}, {"loss": 1.35938560962677, "grad_norm": 5.493150648764733, "learning_rate": 1.8987341772151901e-06, "token_acc": 0.7149187592319055, "epoch": 0.015233259282767376, "step": 6}, {"loss": 1.3011455535888672, "grad_norm": 8.171500030817667, "learning_rate": 2.2151898734177215e-06, "token_acc": 0.7231049321416749, "epoch": 0.017772135829895272, "step": 7}, {"loss": 1.417736291885376, "grad_norm": 5.827210745414414, "learning_rate": 2.531645569620253e-06, "token_acc": 0.714411093558013, "epoch": 0.020311012377023166, "step": 8}, {"loss": 1.378328800201416, "grad_norm": 6.1293874585644526, "learning_rate": 2.848101265822785e-06, "token_acc": 0.7031924072476272, "epoch": 0.022849888924151063, "step": 9}, {"loss": 1.343224287033081, "grad_norm": 3.520366609215098, "learning_rate": 3.1645569620253167e-06, "token_acc": 0.7227991691963572, "epoch": 0.025388765471278957, "step": 10}, {"loss": 1.390702724456787, "grad_norm": 3.6585128819526824, "learning_rate": 3.4810126582278482e-06, "token_acc": 0.7076406649616368, "epoch": 0.027927642018406855, "step": 11}, {"loss": 1.3524142503738403, "grad_norm": 6.217581279052289, "learning_rate": 3.7974683544303802e-06, "token_acc": 0.7028127313101407, "epoch": 0.030466518565534752, "step": 12}, {"loss": 1.3935208320617676, "grad_norm": 3.388086422416274, "learning_rate": 4.113924050632911e-06, "token_acc": 0.7046906654199782, "epoch": 0.03300539511266265, "step": 13}, {"loss": 1.3878122568130493, "grad_norm": 8.332931037303998, "learning_rate": 4.430379746835443e-06, "token_acc": 0.7046968687541639, "epoch": 0.035544271659790544, "step": 14}, {"loss": 1.2754666805267334, "grad_norm": 17.896380479546966, "learning_rate": 4.746835443037975e-06, "token_acc": 0.7242310577644411, "epoch": 0.03808314820691844, "step": 15}, {"loss": 1.3468568325042725, "grad_norm": 11.46365102116194, "learning_rate": 5.063291139240506e-06, "token_acc": 0.7084963229541543, "epoch": 0.04062202475404633, "step": 16}, {"loss": 1.40608549118042, "grad_norm": 4.2821219745746655, "learning_rate": 5.379746835443038e-06, "token_acc": 0.6968503937007874, "epoch": 0.04316090130117423, "step": 17}, {"loss": 1.300422191619873, "grad_norm": 13.278823682877052, "learning_rate": 5.69620253164557e-06, "token_acc": 0.7242131505141789, "epoch": 0.04569977784830213, "step": 18}, {"loss": 1.3542265892028809, "grad_norm": 2.778568201618841, "learning_rate": 6.012658227848101e-06, "token_acc": 0.7110212691158376, "epoch": 0.04823865439543002, "step": 19}, {"loss": 1.3549412488937378, "grad_norm": 10.575315873473542, "learning_rate": 6.329113924050633e-06, "token_acc": 0.7120073608342279, "epoch": 0.050777530942557915, "step": 20}, {"loss": 1.3315010070800781, "grad_norm": 4.651761760848563, "learning_rate": 6.6455696202531645e-06, "token_acc": 0.7172937521574042, "epoch": 0.053316407489685816, "step": 21}, {"loss": 1.3607463836669922, "grad_norm": 11.039499603303584, "learning_rate": 6.9620253164556965e-06, "token_acc": 0.7119058535839828, "epoch": 0.05585528403681371, "step": 22}, {"loss": 1.3679276704788208, "grad_norm": 21.786442056735186, "learning_rate": 7.2784810126582285e-06, "token_acc": 0.7060693204177387, "epoch": 0.058394160583941604, "step": 23}, {"loss": 1.230813980102539, "grad_norm": 3.8926457068624027, "learning_rate": 7.5949367088607605e-06, "token_acc": 0.7303050847457627, "epoch": 0.060933037131069505, "step": 24}, {"loss": 1.2661793231964111, "grad_norm": 27.273056033594486, "learning_rate": 7.911392405063292e-06, "token_acc": 0.7191495088144261, "epoch": 0.06347191367819739, "step": 25}, {"loss": 1.3003311157226562, "grad_norm": 17.170751148909975, "learning_rate": 8.227848101265822e-06, "token_acc": 0.7185164292765477, "epoch": 0.0660107902253253, "step": 26}, {"loss": 1.3472293615341187, "grad_norm": 4.4377062155304925, "learning_rate": 8.544303797468354e-06, "token_acc": 0.7084078711985689, "epoch": 0.0685496667724532, "step": 27}, {"loss": 1.2210255861282349, "grad_norm": 28.824459578387078, "learning_rate": 8.860759493670886e-06, "token_acc": 0.7316366961292289, "epoch": 0.07108854331958109, "step": 28}, {"loss": 1.3194985389709473, "grad_norm": 6.453710147572056, "learning_rate": 9.177215189873418e-06, "token_acc": 0.7122530736289543, "epoch": 0.07362741986670898, "step": 29}, {"loss": 1.2912172079086304, "grad_norm": 5.834087298103824, "learning_rate": 9.49367088607595e-06, "token_acc": 0.7186076772934288, "epoch": 0.07616629641383688, "step": 30}, {"loss": 1.315631628036499, "grad_norm": 2.871547428905148, "learning_rate": 9.81012658227848e-06, "token_acc": 0.7080590902442592, "epoch": 0.07870517296096477, "step": 31}, {"loss": 1.2459921836853027, "grad_norm": 3.6221352179116657, "learning_rate": 1.0126582278481012e-05, "token_acc": 0.7226173541963016, "epoch": 0.08124404950809266, "step": 32}, {"loss": 1.271647334098816, "grad_norm": 8.000389558921656, "learning_rate": 1.0443037974683544e-05, "token_acc": 0.7218111867416396, "epoch": 0.08378292605522057, "step": 33}, {"loss": 1.274230718612671, "grad_norm": 4.361540191205865, "learning_rate": 1.0759493670886076e-05, "token_acc": 0.7135694646611677, "epoch": 0.08632180260234847, "step": 34}, {"loss": 1.2685215473175049, "grad_norm": 4.9147142745551164, "learning_rate": 1.1075949367088608e-05, "token_acc": 0.7207676044885347, "epoch": 0.08886067914947636, "step": 35}, {"loss": 1.299472451210022, "grad_norm": 3.195151105054266, "learning_rate": 1.139240506329114e-05, "token_acc": 0.7125310717941219, "epoch": 0.09139955569660425, "step": 36}, {"loss": 1.184287428855896, "grad_norm": 2.6222925030737736, "learning_rate": 1.170886075949367e-05, "token_acc": 0.7353410097431355, "epoch": 0.09393843224373215, "step": 37}, {"loss": 1.2705498933792114, "grad_norm": 2.8207306382492585, "learning_rate": 1.2025316455696203e-05, "token_acc": 0.7183790421612771, "epoch": 0.09647730879086004, "step": 38}, {"loss": 1.1410255432128906, "grad_norm": 4.451363242439522, "learning_rate": 1.2341772151898735e-05, "token_acc": 0.7343029443064917, "epoch": 0.09901618533798794, "step": 39}, {"loss": 1.1782591342926025, "grad_norm": 5.113673628483296, "learning_rate": 1.2658227848101267e-05, "token_acc": 0.7327224724336077, "epoch": 0.10155506188511583, "step": 40}, {"loss": 1.1586289405822754, "grad_norm": 3.5593986457435083, "learning_rate": 1.2974683544303799e-05, "token_acc": 0.7429899957728617, "epoch": 0.10409393843224374, "step": 41}, {"loss": 1.139272689819336, "grad_norm": 2.9195256626560684, "learning_rate": 1.3291139240506329e-05, "token_acc": 0.7421777221526908, "epoch": 0.10663281497937163, "step": 42}, {"loss": 1.1704292297363281, "grad_norm": 20.803104301053065, "learning_rate": 1.3607594936708861e-05, "token_acc": 0.7285796434732605, "epoch": 0.10917169152649953, "step": 43}, {"loss": 1.1391760110855103, "grad_norm": 3.471589836187823, "learning_rate": 1.3924050632911393e-05, "token_acc": 0.7379228837346727, "epoch": 0.11171056807362742, "step": 44}, {"loss": 1.1042394638061523, "grad_norm": 5.205417449479473, "learning_rate": 1.4240506329113925e-05, "token_acc": 0.7448979591836735, "epoch": 0.11424944462075531, "step": 45}, {"loss": 1.0657453536987305, "grad_norm": 4.3574672102801015, "learning_rate": 1.4556962025316457e-05, "token_acc": 0.7489454347530277, "epoch": 0.11678832116788321, "step": 46}, {"loss": 1.1951930522918701, "grad_norm": 23.053778423920146, "learning_rate": 1.4873417721518987e-05, "token_acc": 0.7246397287369314, "epoch": 0.1193271977150111, "step": 47}, {"loss": 1.0914082527160645, "grad_norm": 3.803629904444073, "learning_rate": 1.5189873417721521e-05, "token_acc": 0.745520801700577, "epoch": 0.12186607426213901, "step": 48}, {"loss": 1.1104226112365723, "grad_norm": 6.689336514482712, "learning_rate": 1.550632911392405e-05, "token_acc": 0.7371739753511035, "epoch": 0.1244049508092669, "step": 49}, {"loss": 1.114711880683899, "grad_norm": 13.295611456338577, "learning_rate": 1.5822784810126583e-05, "token_acc": 0.734084314729476, "epoch": 0.12694382735639478, "step": 50}, {"loss": 1.0886123180389404, "grad_norm": 3.6818930607365474, "learning_rate": 1.6139240506329115e-05, "token_acc": 0.7460102378801566, "epoch": 0.12948270390352268, "step": 51}, {"loss": 0.9962466359138489, "grad_norm": 2.068572818027539, "learning_rate": 1.6455696202531644e-05, "token_acc": 0.7619711761971176, "epoch": 0.1320215804506506, "step": 52}, {"loss": 1.048902153968811, "grad_norm": 2.3029328438465955, "learning_rate": 1.677215189873418e-05, "token_acc": 0.7497123130034522, "epoch": 0.1345604569977785, "step": 53}, {"loss": 1.0195245742797852, "grad_norm": 5.7047860384924505, "learning_rate": 1.7088607594936708e-05, "token_acc": 0.7620052770448549, "epoch": 0.1370993335449064, "step": 54}, {"loss": 1.081801176071167, "grad_norm": 6.477061508345248, "learning_rate": 1.7405063291139243e-05, "token_acc": 0.7465539422900203, "epoch": 0.13963821009203428, "step": 55}, {"loss": 1.0337473154067993, "grad_norm": 6.2376824743665855, "learning_rate": 1.7721518987341772e-05, "token_acc": 0.7620926243567753, "epoch": 0.14217708663916218, "step": 56}, {"loss": 1.0235919952392578, "grad_norm": 2.5584859222177037, "learning_rate": 1.8037974683544304e-05, "token_acc": 0.7479560191711305, "epoch": 0.14471596318629007, "step": 57}, {"loss": 1.026627540588379, "grad_norm": 1.6007308463984253, "learning_rate": 1.8354430379746836e-05, "token_acc": 0.7545010680500458, "epoch": 0.14725483973341796, "step": 58}, {"loss": 1.0003381967544556, "grad_norm": 3.5256130287772764, "learning_rate": 1.8670886075949368e-05, "token_acc": 0.7527782006393667, "epoch": 0.14979371628054586, "step": 59}, {"loss": 0.9081876873970032, "grad_norm": 3.7023204963636838, "learning_rate": 1.89873417721519e-05, "token_acc": 0.7770368222673238, "epoch": 0.15233259282767375, "step": 60}, {"loss": 1.0521725416183472, "grad_norm": 13.207752417441773, "learning_rate": 1.9303797468354432e-05, "token_acc": 0.7498269417139692, "epoch": 0.15487146937480165, "step": 61}, {"loss": 0.9959630966186523, "grad_norm": 5.75860602043051, "learning_rate": 1.962025316455696e-05, "token_acc": 0.7539973595423207, "epoch": 0.15741034592192954, "step": 62}, {"loss": 0.9936040639877319, "grad_norm": 2.1358911014473065, "learning_rate": 1.9936708860759496e-05, "token_acc": 0.7573317125056982, "epoch": 0.15994922246905743, "step": 63}, {"loss": 0.9302588701248169, "grad_norm": 3.6065860167804553, "learning_rate": 2.0253164556962025e-05, "token_acc": 0.7660311958405546, "epoch": 0.16248809901618533, "step": 64}, {"loss": 0.9686568975448608, "grad_norm": 3.4010076126873536, "learning_rate": 2.056962025316456e-05, "token_acc": 0.7588071919310042, "epoch": 0.16502697556331322, "step": 65}, {"loss": 0.9752371907234192, "grad_norm": 8.25772123801425, "learning_rate": 2.088607594936709e-05, "token_acc": 0.7534704800133801, "epoch": 0.16756585211044114, "step": 66}, {"loss": 0.8781665563583374, "grad_norm": 2.759694488314889, "learning_rate": 2.120253164556962e-05, "token_acc": 0.7766960284345542, "epoch": 0.17010472865756904, "step": 67}, {"loss": 0.8539150953292847, "grad_norm": 6.065387925549159, "learning_rate": 2.1518987341772153e-05, "token_acc": 0.7778531456672885, "epoch": 0.17264360520469693, "step": 68}, {"loss": 0.8206325173377991, "grad_norm": 6.273759879651115, "learning_rate": 2.1835443037974685e-05, "token_acc": 0.7851107226107226, "epoch": 0.17518248175182483, "step": 69}, {"loss": 0.899059534072876, "grad_norm": 6.797725562475832, "learning_rate": 2.2151898734177217e-05, "token_acc": 0.7692409240924093, "epoch": 0.17772135829895272, "step": 70}, {"loss": 0.9375818371772766, "grad_norm": 14.741247422293133, "learning_rate": 2.246835443037975e-05, "token_acc": 0.7635605006954103, "epoch": 0.1802602348460806, "step": 71}, {"loss": 0.8030121326446533, "grad_norm": 2.91554003314857, "learning_rate": 2.278481012658228e-05, "token_acc": 0.7937145989402521, "epoch": 0.1827991113932085, "step": 72}, {"loss": 0.9064524173736572, "grad_norm": 3.256147486736755, "learning_rate": 2.3101265822784813e-05, "token_acc": 0.7655107017068545, "epoch": 0.1853379879403364, "step": 73}, {"loss": 0.7569831609725952, "grad_norm": 2.189919100543407, "learning_rate": 2.341772151898734e-05, "token_acc": 0.7891252955082743, "epoch": 0.1878768644874643, "step": 74}, {"loss": 0.8783301115036011, "grad_norm": 3.0168260923297563, "learning_rate": 2.3734177215189873e-05, "token_acc": 0.7689860284963342, "epoch": 0.1904157410345922, "step": 75}, {"loss": 0.8693279027938843, "grad_norm": 14.13725393363498, "learning_rate": 2.4050632911392405e-05, "token_acc": 0.7832378223495702, "epoch": 0.19295461758172008, "step": 76}, {"loss": 0.9367852807044983, "grad_norm": 4.663170307038689, "learning_rate": 2.4367088607594937e-05, "token_acc": 0.7587620685094564, "epoch": 0.19549349412884798, "step": 77}, {"loss": 0.9105110764503479, "grad_norm": 2.0251332116596314, "learning_rate": 2.468354430379747e-05, "token_acc": 0.7696913251729643, "epoch": 0.19803237067597587, "step": 78}, {"loss": 0.812760055065155, "grad_norm": 2.9353487138799976, "learning_rate": 2.5e-05, "token_acc": 0.7861037544788908, "epoch": 0.20057124722310377, "step": 79}, {"loss": 0.8404111266136169, "grad_norm": 6.81850589494243, "learning_rate": 2.5316455696202533e-05, "token_acc": 0.7826737386100912, "epoch": 0.20311012377023166, "step": 80}, {"loss": 0.7662273049354553, "grad_norm": 5.8636033139277925, "learning_rate": 2.5632911392405062e-05, "token_acc": 0.7912533814247069, "epoch": 0.20564900031735958, "step": 81}, {"loss": 0.8550683259963989, "grad_norm": 3.1667411014534554, "learning_rate": 2.5949367088607597e-05, "token_acc": 0.7763946519133241, "epoch": 0.20818787686448748, "step": 82}, {"loss": 0.728255033493042, "grad_norm": 2.9382867326927786, "learning_rate": 2.626582278481013e-05, "token_acc": 0.7997798049701164, "epoch": 0.21072675341161537, "step": 83}, {"loss": 0.7953159213066101, "grad_norm": 4.413930575957828, "learning_rate": 2.6582278481012658e-05, "token_acc": 0.7851035843472542, "epoch": 0.21326562995874326, "step": 84}, {"loss": 0.8843717575073242, "grad_norm": 2.2548226528829085, "learning_rate": 2.689873417721519e-05, "token_acc": 0.7768637532133676, "epoch": 0.21580450650587116, "step": 85}, {"loss": 0.8480836749076843, "grad_norm": 13.172644883413941, "learning_rate": 2.7215189873417722e-05, "token_acc": 0.7769437756691687, "epoch": 0.21834338305299905, "step": 86}, {"loss": 0.7050020098686218, "grad_norm": 13.962359276231266, "learning_rate": 2.7531645569620257e-05, "token_acc": 0.8056864831990269, "epoch": 0.22088225960012695, "step": 87}, {"loss": 0.7555727958679199, "grad_norm": 4.2019275549330555, "learning_rate": 2.7848101265822786e-05, "token_acc": 0.7975503308461214, "epoch": 0.22342113614725484, "step": 88}, {"loss": 0.7249046564102173, "grad_norm": 5.0153336369322, "learning_rate": 2.8164556962025318e-05, "token_acc": 0.8017741935483871, "epoch": 0.22596001269438273, "step": 89}, {"loss": 0.688890814781189, "grad_norm": 11.63320257189594, "learning_rate": 2.848101265822785e-05, "token_acc": 0.8080682699767261, "epoch": 0.22849888924151063, "step": 90}, {"loss": 0.7510577440261841, "grad_norm": 5.457398735429565, "learning_rate": 2.879746835443038e-05, "token_acc": 0.7953611274221961, "epoch": 0.23103776578863852, "step": 91}, {"loss": 0.7740436792373657, "grad_norm": 4.530006374919538, "learning_rate": 2.9113924050632914e-05, "token_acc": 0.7910108958837773, "epoch": 0.23357664233576642, "step": 92}, {"loss": 0.6994897127151489, "grad_norm": 3.283408990769055, "learning_rate": 2.9430379746835446e-05, "token_acc": 0.8084580953850903, "epoch": 0.2361155188828943, "step": 93}, {"loss": 0.6745874285697937, "grad_norm": 3.74567677581687, "learning_rate": 2.9746835443037974e-05, "token_acc": 0.8121098626716604, "epoch": 0.2386543954300222, "step": 94}, {"loss": 0.7404159307479858, "grad_norm": 2.481160635241608, "learning_rate": 3.0063291139240506e-05, "token_acc": 0.8046498830650709, "epoch": 0.2411932719771501, "step": 95}, {"loss": 0.6883790493011475, "grad_norm": 3.011989315773918, "learning_rate": 3.0379746835443042e-05, "token_acc": 0.8137285986049461, "epoch": 0.24373214852427802, "step": 96}, {"loss": 0.7354066371917725, "grad_norm": 3.977588680498373, "learning_rate": 3.0696202531645574e-05, "token_acc": 0.8012324221835994, "epoch": 0.2462710250714059, "step": 97}, {"loss": 0.7102183103561401, "grad_norm": 2.4417231744019787, "learning_rate": 3.10126582278481e-05, "token_acc": 0.801501463290495, "epoch": 0.2488099016185338, "step": 98}, {"loss": 0.7254366278648376, "grad_norm": 5.211297364565694, "learning_rate": 3.132911392405064e-05, "token_acc": 0.8042974184572577, "epoch": 0.2513487781656617, "step": 99}, {"loss": 0.71342533826828, "grad_norm": 4.740070832115608, "learning_rate": 3.1645569620253167e-05, "token_acc": 0.8091580057237536, "epoch": 0.25388765471278957, "step": 100}, {"loss": 0.7370377779006958, "grad_norm": 5.296776098340419, "learning_rate": 3.1962025316455695e-05, "token_acc": 0.8084075636818253, "epoch": 0.2564265312599175, "step": 101}, {"loss": 0.671318531036377, "grad_norm": 4.396582033002235, "learning_rate": 3.227848101265823e-05, "token_acc": 0.8183896782622897, "epoch": 0.25896540780704536, "step": 102}, {"loss": 0.6583906412124634, "grad_norm": 2.6335454183216696, "learning_rate": 3.2594936708860766e-05, "token_acc": 0.8211532014750251, "epoch": 0.2615042843541733, "step": 103}, {"loss": 0.7536572217941284, "grad_norm": 6.236411278449773, "learning_rate": 3.291139240506329e-05, "token_acc": 0.7975090397750101, "epoch": 0.2640431609013012, "step": 104}, {"loss": 0.6701930165290833, "grad_norm": 2.5341922649732602, "learning_rate": 3.322784810126582e-05, "token_acc": 0.8116928446771379, "epoch": 0.26658203744842907, "step": 105}, {"loss": 0.5909067392349243, "grad_norm": 11.881079085435806, "learning_rate": 3.354430379746836e-05, "token_acc": 0.8345961631468645, "epoch": 0.269120913995557, "step": 106}, {"loss": 0.6282612085342407, "grad_norm": 2.384697440414924, "learning_rate": 3.386075949367089e-05, "token_acc": 0.823628821631587, "epoch": 0.27165979054268485, "step": 107}, {"loss": 0.6936606764793396, "grad_norm": 2.1995079597886673, "learning_rate": 3.4177215189873416e-05, "token_acc": 0.8020663404023926, "epoch": 0.2741986670898128, "step": 108}, {"loss": 0.778184175491333, "grad_norm": 4.861432353099602, "learning_rate": 3.449367088607595e-05, "token_acc": 0.78875, "epoch": 0.27673754363694064, "step": 109}, {"loss": 0.6751368641853333, "grad_norm": 9.57103993272581, "learning_rate": 3.4810126582278487e-05, "token_acc": 0.8148423557406306, "epoch": 0.27927642018406856, "step": 110}, {"loss": 0.7030066251754761, "grad_norm": 13.549564951896668, "learning_rate": 3.5126582278481015e-05, "token_acc": 0.805439330543933, "epoch": 0.28181529673119643, "step": 111}, {"loss": 0.6886919736862183, "grad_norm": 5.1073725117939475, "learning_rate": 3.5443037974683544e-05, "token_acc": 0.8083333333333333, "epoch": 0.28435417327832435, "step": 112}, {"loss": 0.6610169410705566, "grad_norm": 22.063583297317187, "learning_rate": 3.575949367088608e-05, "token_acc": 0.8150403409955853, "epoch": 0.2868930498254522, "step": 113}, {"loss": 0.6841698884963989, "grad_norm": 18.72026765015026, "learning_rate": 3.607594936708861e-05, "token_acc": 0.8123032904148784, "epoch": 0.28943192637258014, "step": 114}, {"loss": 0.6466969847679138, "grad_norm": 2.864881799429328, "learning_rate": 3.639240506329114e-05, "token_acc": 0.8172187406744256, "epoch": 0.291970802919708, "step": 115}, {"loss": 0.6078028678894043, "grad_norm": 6.716337706090099, "learning_rate": 3.670886075949367e-05, "token_acc": 0.8346497252747253, "epoch": 0.2945096794668359, "step": 116}, {"loss": 0.664849042892456, "grad_norm": 5.564745491758841, "learning_rate": 3.70253164556962e-05, "token_acc": 0.8190188679245283, "epoch": 0.2970485560139638, "step": 117}, {"loss": 0.6384534239768982, "grad_norm": 28.630717891823956, "learning_rate": 3.7341772151898736e-05, "token_acc": 0.8220830070477682, "epoch": 0.2995874325610917, "step": 118}, {"loss": 0.6201878190040588, "grad_norm": 12.273392356907912, "learning_rate": 3.765822784810127e-05, "token_acc": 0.8250733897427042, "epoch": 0.30212630910821964, "step": 119}, {"loss": 0.6979496479034424, "grad_norm": 4.192852448588315, "learning_rate": 3.79746835443038e-05, "token_acc": 0.8104520945665699, "epoch": 0.3046651856553475, "step": 120}, {"loss": 0.6550031304359436, "grad_norm": 3.4657196050906567, "learning_rate": 3.829113924050633e-05, "token_acc": 0.8187575798409917, "epoch": 0.3072040622024754, "step": 121}, {"loss": 0.6515278220176697, "grad_norm": 27.787374024365484, "learning_rate": 3.8607594936708864e-05, "token_acc": 0.8171852329517976, "epoch": 0.3097429387496033, "step": 122}, {"loss": 0.605487585067749, "grad_norm": 4.0417548472450715, "learning_rate": 3.89240506329114e-05, "token_acc": 0.8265876933201711, "epoch": 0.3122818152967312, "step": 123}, {"loss": 0.6631138324737549, "grad_norm": 3.8292748886400765, "learning_rate": 3.924050632911392e-05, "token_acc": 0.8129932356257046, "epoch": 0.3148206918438591, "step": 124}, {"loss": 0.6087026596069336, "grad_norm": 8.960479693493973, "learning_rate": 3.9556962025316456e-05, "token_acc": 0.8281978055012776, "epoch": 0.317359568390987, "step": 125}, {"loss": 0.7122887372970581, "grad_norm": 4.011722457924042, "learning_rate": 3.987341772151899e-05, "token_acc": 0.8093482748451785, "epoch": 0.31989844493811487, "step": 126}, {"loss": 0.6663644313812256, "grad_norm": 31.39830164995725, "learning_rate": 4.018987341772152e-05, "token_acc": 0.8180548501777553, "epoch": 0.3224373214852428, "step": 127}, {"loss": 0.6300691366195679, "grad_norm": 4.425596331791689, "learning_rate": 4.050632911392405e-05, "token_acc": 0.8203907404367099, "epoch": 0.32497619803237066, "step": 128}, {"loss": 0.6704287528991699, "grad_norm": 16.1083849209539, "learning_rate": 4.0822784810126584e-05, "token_acc": 0.8078627591136526, "epoch": 0.3275150745794986, "step": 129}, {"loss": 0.7170148491859436, "grad_norm": 2.2389483956009752, "learning_rate": 4.113924050632912e-05, "token_acc": 0.8084219603334292, "epoch": 0.33005395112662644, "step": 130}, {"loss": 0.6717650890350342, "grad_norm": 3.613513118589346, "learning_rate": 4.145569620253165e-05, "token_acc": 0.8138652912621359, "epoch": 0.33259282767375437, "step": 131}, {"loss": 0.6085385084152222, "grad_norm": 5.5827028571809105, "learning_rate": 4.177215189873418e-05, "token_acc": 0.8274016203703703, "epoch": 0.3351317042208823, "step": 132}, {"loss": 0.6445047855377197, "grad_norm": 5.37295628319291, "learning_rate": 4.208860759493671e-05, "token_acc": 0.8134654130288784, "epoch": 0.33767058076801015, "step": 133}, {"loss": 0.5425457954406738, "grad_norm": 2.1788757767041003, "learning_rate": 4.240506329113924e-05, "token_acc": 0.837465564738292, "epoch": 0.3402094573151381, "step": 134}, {"loss": 0.5962692499160767, "grad_norm": 4.649401574423171, "learning_rate": 4.2721518987341776e-05, "token_acc": 0.8225226767071709, "epoch": 0.34274833386226594, "step": 135}, {"loss": 0.6038417816162109, "grad_norm": 3.1742303151683506, "learning_rate": 4.3037974683544305e-05, "token_acc": 0.8316648698598491, "epoch": 0.34528721040939386, "step": 136}, {"loss": 0.6016777753829956, "grad_norm": 5.696983011175984, "learning_rate": 4.3354430379746834e-05, "token_acc": 0.8321018707750354, "epoch": 0.34782608695652173, "step": 137}, {"loss": 0.6565921306610107, "grad_norm": 5.797388182589766, "learning_rate": 4.367088607594937e-05, "token_acc": 0.8184429761562769, "epoch": 0.35036496350364965, "step": 138}, {"loss": 0.691247820854187, "grad_norm": 6.854274250412749, "learning_rate": 4.3987341772151904e-05, "token_acc": 0.8143437786810017, "epoch": 0.3529038400507775, "step": 139}, {"loss": 0.6285054683685303, "grad_norm": 2.6184869642829267, "learning_rate": 4.430379746835443e-05, "token_acc": 0.8222631355332106, "epoch": 0.35544271659790544, "step": 140}, {"loss": 0.5671603679656982, "grad_norm": 4.653346904540878, "learning_rate": 4.462025316455696e-05, "token_acc": 0.8380648412565094, "epoch": 0.3579815931450333, "step": 141}, {"loss": 0.6068707704544067, "grad_norm": 4.522681266549905, "learning_rate": 4.49367088607595e-05, "token_acc": 0.8331301432490095, "epoch": 0.3605204696921612, "step": 142}, {"loss": 0.5732223987579346, "grad_norm": 3.181075099904124, "learning_rate": 4.525316455696203e-05, "token_acc": 0.836748182419035, "epoch": 0.3630593462392891, "step": 143}, {"loss": 0.7090050578117371, "grad_norm": 5.248411142229925, "learning_rate": 4.556962025316456e-05, "token_acc": 0.8088770652478298, "epoch": 0.365598222786417, "step": 144}, {"loss": 0.6395794153213501, "grad_norm": 2.2841820115958877, "learning_rate": 4.588607594936709e-05, "token_acc": 0.8251766217084137, "epoch": 0.3681370993335449, "step": 145}, {"loss": 0.5619275569915771, "grad_norm": 3.192951403479268, "learning_rate": 4.6202531645569625e-05, "token_acc": 0.8353532367720957, "epoch": 0.3706759758806728, "step": 146}, {"loss": 0.6076276302337646, "grad_norm": 6.184982774052421, "learning_rate": 4.6518987341772154e-05, "token_acc": 0.8321759259259259, "epoch": 0.3732148524278007, "step": 147}, {"loss": 0.5210973024368286, "grad_norm": 3.9260670039543686, "learning_rate": 4.683544303797468e-05, "token_acc": 0.8457633053221288, "epoch": 0.3757537289749286, "step": 148}, {"loss": 0.4648306369781494, "grad_norm": 3.6953261186445467, "learning_rate": 4.715189873417722e-05, "token_acc": 0.8572195383789587, "epoch": 0.3782926055220565, "step": 149}, {"loss": 0.676045835018158, "grad_norm": 4.9921203101786045, "learning_rate": 4.7468354430379746e-05, "token_acc": 0.8171926006528836, "epoch": 0.3808314820691844, "step": 150}, {"loss": 0.619693398475647, "grad_norm": 20.42938551967448, "learning_rate": 4.778481012658228e-05, "token_acc": 0.8338338338338338, "epoch": 0.3833703586163123, "step": 151}, {"loss": 0.5743368864059448, "grad_norm": 8.755403481608779, "learning_rate": 4.810126582278481e-05, "token_acc": 0.8412815319462346, "epoch": 0.38590923516344017, "step": 152}, {"loss": 0.6492601633071899, "grad_norm": 3.2072760680708425, "learning_rate": 4.8417721518987346e-05, "token_acc": 0.8137201735357917, "epoch": 0.3884481117105681, "step": 153}, {"loss": 0.6361663341522217, "grad_norm": 3.8316550813580914, "learning_rate": 4.8734177215189874e-05, "token_acc": 0.8231698225734307, "epoch": 0.39098698825769596, "step": 154}, {"loss": 0.6939312815666199, "grad_norm": 3.972772394188529, "learning_rate": 4.905063291139241e-05, "token_acc": 0.8113469274517964, "epoch": 0.3935258648048239, "step": 155}, {"loss": 0.6008589863777161, "grad_norm": 16.657647846984553, "learning_rate": 4.936708860759494e-05, "token_acc": 0.8316379183252248, "epoch": 0.39606474135195174, "step": 156}, {"loss": 0.5716952085494995, "grad_norm": 2.814742590512491, "learning_rate": 4.968354430379747e-05, "token_acc": 0.8305734227453128, "epoch": 0.39860361789907967, "step": 157}, {"loss": 0.5892596244812012, "grad_norm": 3.3183075108254605, "learning_rate": 5e-05, "token_acc": 0.823594674556213, "epoch": 0.40114249444620753, "step": 158}, {"loss": 0.5727576017379761, "grad_norm": 3.805622229512587, "learning_rate": 4.9999689166542295e-05, "token_acc": 0.832796486090776, "epoch": 0.40368137099333545, "step": 159}, {"loss": 0.5001785159111023, "grad_norm": 2.9959092236114975, "learning_rate": 4.999875667389858e-05, "token_acc": 0.8474907244678773, "epoch": 0.4062202475404633, "step": 160}, {"loss": 0.6166025400161743, "grad_norm": 2.926865350121703, "learning_rate": 4.999720254525684e-05, "token_acc": 0.820961340585036, "epoch": 0.40875912408759124, "step": 161}, {"loss": 0.5835655927658081, "grad_norm": 2.2665405249006403, "learning_rate": 4.999502681926309e-05, "token_acc": 0.8314150304671631, "epoch": 0.41129800063471916, "step": 162}, {"loss": 0.6306543350219727, "grad_norm": 6.077225672698818, "learning_rate": 4.999222955002041e-05, "token_acc": 0.8202965582913889, "epoch": 0.41383687718184703, "step": 163}, {"loss": 0.6070675253868103, "grad_norm": 9.205523914845546, "learning_rate": 4.9988810807087584e-05, "token_acc": 0.8314500941619586, "epoch": 0.41637575372897495, "step": 164}, {"loss": 0.5549716949462891, "grad_norm": 2.520164837218412, "learning_rate": 4.99847706754774e-05, "token_acc": 0.8379689521345407, "epoch": 0.4189146302761028, "step": 165}, {"loss": 0.5140861868858337, "grad_norm": 2.3723529006989215, "learning_rate": 4.998010925565448e-05, "token_acc": 0.8497000856898029, "epoch": 0.42145350682323074, "step": 166}, {"loss": 0.5713208913803101, "grad_norm": 3.168399232927889, "learning_rate": 4.997482666353287e-05, "token_acc": 0.8342638379326847, "epoch": 0.4239923833703586, "step": 167}, {"loss": 0.5652569532394409, "grad_norm": 3.1544527876057353, "learning_rate": 4.996892303047306e-05, "token_acc": 0.8433680398370303, "epoch": 0.4265312599174865, "step": 168}, {"loss": 0.6010338068008423, "grad_norm": 4.050502290302643, "learning_rate": 4.99623985032788e-05, "token_acc": 0.8299908842297175, "epoch": 0.4290701364646144, "step": 169}, {"loss": 0.625551700592041, "grad_norm": 2.3208744483079924, "learning_rate": 4.9955253244193375e-05, "token_acc": 0.8214095744680852, "epoch": 0.4316090130117423, "step": 170}, {"loss": 0.5763528347015381, "grad_norm": 3.5752910543983734, "learning_rate": 4.994748743089566e-05, "token_acc": 0.8370288248337029, "epoch": 0.4341478895588702, "step": 171}, {"loss": 0.583060085773468, "grad_norm": 5.186367702439989, "learning_rate": 4.993910125649561e-05, "token_acc": 0.8326601269474899, "epoch": 0.4366867661059981, "step": 172}, {"loss": 0.6205261945724487, "grad_norm": 2.314721989016231, "learning_rate": 4.9930094929529506e-05, "token_acc": 0.8203899721448468, "epoch": 0.43922564265312597, "step": 173}, {"loss": 0.5230633020401001, "grad_norm": 3.3583225237625016, "learning_rate": 4.992046867395478e-05, "token_acc": 0.8419920582395765, "epoch": 0.4417645192002539, "step": 174}, {"loss": 0.5143859386444092, "grad_norm": 4.042306283685085, "learning_rate": 4.99102227291444e-05, "token_acc": 0.8474544778892605, "epoch": 0.44430339574738176, "step": 175}, {"loss": 0.6144051551818848, "grad_norm": 2.6321524863816603, "learning_rate": 4.989935734988098e-05, "token_acc": 0.8175049636002647, "epoch": 0.4468422722945097, "step": 176}, {"loss": 0.49258965253829956, "grad_norm": 2.361660215036252, "learning_rate": 4.988787280635038e-05, "token_acc": 0.8459661430532256, "epoch": 0.4493811488416376, "step": 177}, {"loss": 0.5039229393005371, "grad_norm": 2.0369998726790266, "learning_rate": 4.987576938413504e-05, "token_acc": 0.8487822609960014, "epoch": 0.45192002538876547, "step": 178}, {"loss": 0.5814566612243652, "grad_norm": 6.93229029448243, "learning_rate": 4.9863047384206835e-05, "token_acc": 0.8274802458296752, "epoch": 0.4544589019358934, "step": 179}, {"loss": 0.5427694916725159, "grad_norm": 1.9442137330470775, "learning_rate": 4.984970712291963e-05, "token_acc": 0.8449736295349208, "epoch": 0.45699777848302126, "step": 180}, {"loss": 0.5021108388900757, "grad_norm": 3.8278365677194706, "learning_rate": 4.983574893200139e-05, "token_acc": 0.8494821249582358, "epoch": 0.4595366550301492, "step": 181}, {"loss": 0.529310941696167, "grad_norm": 3.898165087457517, "learning_rate": 4.9821173158545936e-05, "token_acc": 0.8456512269493248, "epoch": 0.46207553157727704, "step": 182}, {"loss": 0.5193842053413391, "grad_norm": 5.784138022488126, "learning_rate": 4.9805980165004304e-05, "token_acc": 0.8486529318541997, "epoch": 0.46461440812440497, "step": 183}, {"loss": 0.5510420799255371, "grad_norm": 2.7860896602561755, "learning_rate": 4.9790170329175754e-05, "token_acc": 0.8427399903521466, "epoch": 0.46715328467153283, "step": 184}, {"loss": 0.565636396408081, "grad_norm": 2.391478502605225, "learning_rate": 4.977374404419837e-05, "token_acc": 0.8384972889233152, "epoch": 0.46969216121866075, "step": 185}, {"loss": 0.5837178230285645, "grad_norm": 2.7381469955000233, "learning_rate": 4.975670171853926e-05, "token_acc": 0.8304386223138063, "epoch": 0.4722310377657886, "step": 186}, {"loss": 0.5879358649253845, "grad_norm": 4.436221537482703, "learning_rate": 4.973904377598443e-05, "token_acc": 0.8254743303571429, "epoch": 0.47476991431291654, "step": 187}, {"loss": 0.5809712409973145, "grad_norm": 3.161812435220317, "learning_rate": 4.972077065562821e-05, "token_acc": 0.8361007729745205, "epoch": 0.4773087908600444, "step": 188}, {"loss": 0.5579955577850342, "grad_norm": 1.5520306180347663, "learning_rate": 4.970188281186241e-05, "token_acc": 0.837281009110021, "epoch": 0.47984766740717233, "step": 189}, {"loss": 0.58579421043396, "grad_norm": 3.727248476475511, "learning_rate": 4.9682380714364897e-05, "token_acc": 0.8350501304765829, "epoch": 0.4823865439543002, "step": 190}, {"loss": 0.4905577301979065, "grad_norm": 3.0795046455062614, "learning_rate": 4.9662264848088034e-05, "token_acc": 0.8543485289363077, "epoch": 0.4849254205014281, "step": 191}, {"loss": 0.6000843048095703, "grad_norm": 2.222320433523395, "learning_rate": 4.964153571324658e-05, "token_acc": 0.8202116862403944, "epoch": 0.48746429704855604, "step": 192}, {"loss": 0.553142786026001, "grad_norm": 3.054493416036562, "learning_rate": 4.962019382530521e-05, "token_acc": 0.8378803028138837, "epoch": 0.4900031735956839, "step": 193}, {"loss": 0.49760788679122925, "grad_norm": 1.48942863662551, "learning_rate": 4.959823971496574e-05, "token_acc": 0.848271341962969, "epoch": 0.4925420501428118, "step": 194}, {"loss": 0.5126315355300903, "grad_norm": 1.4337417758608024, "learning_rate": 4.9575673928153957e-05, "token_acc": 0.846869578930768, "epoch": 0.4950809266899397, "step": 195}, {"loss": 0.5140909552574158, "grad_norm": 1.8216377101814463, "learning_rate": 4.9552497026005974e-05, "token_acc": 0.8483076923076923, "epoch": 0.4976198032370676, "step": 196}, {"loss": 0.5483355522155762, "grad_norm": 3.6989217579732125, "learning_rate": 4.952870958485432e-05, "token_acc": 0.8436149991359945, "epoch": 0.5001586797841955, "step": 197}, {"loss": 0.5258674621582031, "grad_norm": 1.4793601703477388, "learning_rate": 4.9504312196213596e-05, "token_acc": 0.844776119402985, "epoch": 0.5026975563313234, "step": 198}, {"loss": 0.5483481287956238, "grad_norm": 3.320358649604752, "learning_rate": 4.947930546676579e-05, "token_acc": 0.8407105847520355, "epoch": 0.5052364328784513, "step": 199}, {"loss": 0.5698910355567932, "grad_norm": 1.4836965410501335, "learning_rate": 4.9453690018345144e-05, "token_acc": 0.8355416991426344, "epoch": 0.5077753094255791, "step": 200}, {"loss": 0.6226257681846619, "grad_norm": 1.9840806554207313, "learning_rate": 4.942746648792274e-05, "token_acc": 0.821941594317285, "epoch": 0.5103141859727071, "step": 201}, {"loss": 0.5485865473747253, "grad_norm": 3.4200124483670358, "learning_rate": 4.940063552759061e-05, "token_acc": 0.8423786494716102, "epoch": 0.512853062519835, "step": 202}, {"loss": 0.4833056330680847, "grad_norm": 1.4137645693467988, "learning_rate": 4.937319780454559e-05, "token_acc": 0.8569816188326347, "epoch": 0.5153919390669629, "step": 203}, {"loss": 0.4503518342971802, "grad_norm": 2.216132222614037, "learning_rate": 4.934515400107266e-05, "token_acc": 0.8646072954321393, "epoch": 0.5179308156140907, "step": 204}, {"loss": 0.5067535638809204, "grad_norm": 4.426951079644797, "learning_rate": 4.931650481452801e-05, "token_acc": 0.8500777604976671, "epoch": 0.5204696921612186, "step": 205}, {"loss": 0.5493313670158386, "grad_norm": 7.154300916510774, "learning_rate": 4.928725095732169e-05, "token_acc": 0.8378132118451025, "epoch": 0.5230085687083466, "step": 206}, {"loss": 0.4918142557144165, "grad_norm": 1.965712161044352, "learning_rate": 4.925739315689991e-05, "token_acc": 0.8530601240226476, "epoch": 0.5255474452554745, "step": 207}, {"loss": 0.5023689270019531, "grad_norm": 1.5124863710410141, "learning_rate": 4.922693215572695e-05, "token_acc": 0.8512195121951219, "epoch": 0.5280863218026024, "step": 208}, {"loss": 0.5670746564865112, "grad_norm": 2.3375825804294723, "learning_rate": 4.919586871126667e-05, "token_acc": 0.8375552282768778, "epoch": 0.5306251983497302, "step": 209}, {"loss": 0.5001412630081177, "grad_norm": 1.8418248968647637, "learning_rate": 4.916420359596368e-05, "token_acc": 0.8473023413640991, "epoch": 0.5331640748968581, "step": 210}, {"loss": 0.5839577913284302, "grad_norm": 2.4235777237942924, "learning_rate": 4.9131937597224185e-05, "token_acc": 0.8330151270377442, "epoch": 0.535702951443986, "step": 211}, {"loss": 0.5890910625457764, "grad_norm": 15.841289330503669, "learning_rate": 4.909907151739633e-05, "token_acc": 0.8299887822510283, "epoch": 0.538241827991114, "step": 212}, {"loss": 0.5155512094497681, "grad_norm": 2.1298845605680197, "learning_rate": 4.90656061737503e-05, "token_acc": 0.8465608465608465, "epoch": 0.5407807045382418, "step": 213}, {"loss": 0.5869525671005249, "grad_norm": 2.1579493985693454, "learning_rate": 4.9031542398457974e-05, "token_acc": 0.8264487369985141, "epoch": 0.5433195810853697, "step": 214}, {"loss": 0.5348740816116333, "grad_norm": 3.015091026973871, "learning_rate": 4.899688103857223e-05, "token_acc": 0.8366959820658735, "epoch": 0.5458584576324976, "step": 215}, {"loss": 0.5215170383453369, "grad_norm": 1.4983193386255376, "learning_rate": 4.896162295600589e-05, "token_acc": 0.8455044322498945, "epoch": 0.5483973341796256, "step": 216}, {"loss": 0.6286407709121704, "grad_norm": 7.6369461867236215, "learning_rate": 4.892576902751031e-05, "token_acc": 0.8244441744623983, "epoch": 0.5509362107267534, "step": 217}, {"loss": 0.5405088663101196, "grad_norm": 1.909191100547535, "learning_rate": 4.888932014465352e-05, "token_acc": 0.8398148148148148, "epoch": 0.5534750872738813, "step": 218}, {"loss": 0.5207107067108154, "grad_norm": 2.1249944661063713, "learning_rate": 4.8852277213798106e-05, "token_acc": 0.8505783057205377, "epoch": 0.5560139638210092, "step": 219}, {"loss": 0.5813536643981934, "grad_norm": 4.590133511444357, "learning_rate": 4.881464115607865e-05, "token_acc": 0.831871745683749, "epoch": 0.5585528403681371, "step": 220}, {"loss": 0.5410237312316895, "grad_norm": 1.641052016603602, "learning_rate": 4.877641290737884e-05, "token_acc": 0.8366046831955923, "epoch": 0.561091716915265, "step": 221}, {"loss": 0.5533527135848999, "grad_norm": 2.277495246079136, "learning_rate": 4.8737593418308156e-05, "token_acc": 0.8363823756763721, "epoch": 0.5636305934623929, "step": 222}, {"loss": 0.559136152267456, "grad_norm": 4.159566523283519, "learning_rate": 4.86981836541783e-05, "token_acc": 0.8388266834884087, "epoch": 0.5661694700095208, "step": 223}, {"loss": 0.4840168356895447, "grad_norm": 225.83355044511626, "learning_rate": 4.865818459497911e-05, "token_acc": 0.8560429982568274, "epoch": 0.5687083465566487, "step": 224}, {"loss": 0.5671250224113464, "grad_norm": 1.7941761886315637, "learning_rate": 4.861759723535426e-05, "token_acc": 0.8405020448455789, "epoch": 0.5712472231037766, "step": 225}, {"loss": 0.5532321929931641, "grad_norm": 1.6927695579956952, "learning_rate": 4.8576422584576514e-05, "token_acc": 0.8365077158348394, "epoch": 0.5737860996509044, "step": 226}, {"loss": 0.5039372444152832, "grad_norm": 1.3677369838188163, "learning_rate": 4.8534661666522584e-05, "token_acc": 0.8533067362283259, "epoch": 0.5763249761980324, "step": 227}, {"loss": 0.4986110031604767, "grad_norm": 3.1985990377060944, "learning_rate": 4.849231551964771e-05, "token_acc": 0.8453477868112015, "epoch": 0.5788638527451603, "step": 228}, {"loss": 0.5104832649230957, "grad_norm": 2.5449576622123646, "learning_rate": 4.844938519695984e-05, "token_acc": 0.8486502433987314, "epoch": 0.5814027292922882, "step": 229}, {"loss": 0.505854606628418, "grad_norm": 1.3118749339834277, "learning_rate": 4.8405871765993433e-05, "token_acc": 0.8532082324455206, "epoch": 0.583941605839416, "step": 230}, {"loss": 0.5590152144432068, "grad_norm": 2.18900446561014, "learning_rate": 4.836177630878289e-05, "token_acc": 0.8363560267857143, "epoch": 0.5864804823865439, "step": 231}, {"loss": 0.4845745265483856, "grad_norm": 15.30797015176157, "learning_rate": 4.8317099921835697e-05, "token_acc": 0.8525514089870525, "epoch": 0.5890193589336719, "step": 232}, {"loss": 0.5797554850578308, "grad_norm": 1.7181163596035074, "learning_rate": 4.827184371610511e-05, "token_acc": 0.8373081140350878, "epoch": 0.5915582354807998, "step": 233}, {"loss": 0.5012973546981812, "grad_norm": 1.1288420718760477, "learning_rate": 4.822600881696256e-05, "token_acc": 0.8529411764705882, "epoch": 0.5940971120279276, "step": 234}, {"loss": 0.5510119199752808, "grad_norm": 1.437368423568747, "learning_rate": 4.817959636416969e-05, "token_acc": 0.8344022575679836, "epoch": 0.5966359885750555, "step": 235}, {"loss": 0.5216597318649292, "grad_norm": 1.2890032605357924, "learning_rate": 4.813260751184992e-05, "token_acc": 0.8493268404468634, "epoch": 0.5991748651221834, "step": 236}, {"loss": 0.6565842032432556, "grad_norm": 1.405196489873568, "learning_rate": 4.808504342845986e-05, "token_acc": 0.8143687707641196, "epoch": 0.6017137416693114, "step": 237}, {"loss": 0.4384632706642151, "grad_norm": 1.6519014060456265, "learning_rate": 4.803690529676019e-05, "token_acc": 0.8647027694478744, "epoch": 0.6042526182164393, "step": 238}, {"loss": 0.504548192024231, "grad_norm": 1.8927813931053827, "learning_rate": 4.7988194313786275e-05, "token_acc": 0.8548215641609719, "epoch": 0.6067914947635671, "step": 239}, {"loss": 0.5044655799865723, "grad_norm": 1.3750618958063838, "learning_rate": 4.7938911690818347e-05, "token_acc": 0.8456818530449456, "epoch": 0.609330371310695, "step": 240}, {"loss": 0.4389927089214325, "grad_norm": 1.7791425452801302, "learning_rate": 4.7889058653351485e-05, "token_acc": 0.8615710435117443, "epoch": 0.6118692478578229, "step": 241}, {"loss": 0.5367846488952637, "grad_norm": 3.174913815120615, "learning_rate": 4.783863644106502e-05, "token_acc": 0.841294538665007, "epoch": 0.6144081244049509, "step": 242}, {"loss": 0.5005022287368774, "grad_norm": 2.447734108467047, "learning_rate": 4.778764630779183e-05, "token_acc": 0.8491663435440093, "epoch": 0.6169470009520787, "step": 243}, {"loss": 0.5408118367195129, "grad_norm": 2.807814103600755, "learning_rate": 4.773608952148706e-05, "token_acc": 0.8354211087420043, "epoch": 0.6194858774992066, "step": 244}, {"loss": 0.5159645080566406, "grad_norm": 2.227992234463683, "learning_rate": 4.7683967364196624e-05, "token_acc": 0.8429188135357193, "epoch": 0.6220247540463345, "step": 245}, {"loss": 0.5435395240783691, "grad_norm": 3.9276559319284314, "learning_rate": 4.763128113202537e-05, "token_acc": 0.8381928868952259, "epoch": 0.6245636305934624, "step": 246}, {"loss": 0.528008222579956, "grad_norm": 21.07592625562304, "learning_rate": 4.7578032135104796e-05, "token_acc": 0.8437879893022125, "epoch": 0.6271025071405902, "step": 247}, {"loss": 0.5454938411712646, "grad_norm": 2.4305528198591606, "learning_rate": 4.752422169756048e-05, "token_acc": 0.8377711162052548, "epoch": 0.6296413836877182, "step": 248}, {"loss": 0.5896109342575073, "grad_norm": 4.774445766197441, "learning_rate": 4.7469851157479177e-05, "token_acc": 0.8303083960454478, "epoch": 0.6321802602348461, "step": 249}, {"loss": 0.5258548259735107, "grad_norm": 2.9285874898965036, "learning_rate": 4.7414921866875524e-05, "token_acc": 0.8459306342407075, "epoch": 0.634719136781974, "step": 250}, {"loss": 0.4973874092102051, "grad_norm": 1.1551732083505906, "learning_rate": 4.7359435191658425e-05, "token_acc": 0.8523009950248757, "epoch": 0.6372580133291019, "step": 251}, {"loss": 0.48979347944259644, "grad_norm": 1.404758000704147, "learning_rate": 4.730339251159709e-05, "token_acc": 0.8519233625427002, "epoch": 0.6397968898762297, "step": 252}, {"loss": 0.4671449661254883, "grad_norm": 1.1599030830108534, "learning_rate": 4.724679522028672e-05, "token_acc": 0.8547652417659425, "epoch": 0.6423357664233577, "step": 253}, {"loss": 0.5248907208442688, "grad_norm": 9.767857767777004, "learning_rate": 4.718964472511386e-05, "token_acc": 0.8436238600687697, "epoch": 0.6448746429704856, "step": 254}, {"loss": 0.492233008146286, "grad_norm": 1.5836269105977552, "learning_rate": 4.713194244722138e-05, "token_acc": 0.8537440902851914, "epoch": 0.6474135195176135, "step": 255}, {"loss": 0.49239009618759155, "grad_norm": 1.676133573613313, "learning_rate": 4.707368982147318e-05, "token_acc": 0.8473175021987687, "epoch": 0.6499523960647413, "step": 256}, {"loss": 0.55488121509552, "grad_norm": 12.420578245961337, "learning_rate": 4.701488829641845e-05, "token_acc": 0.835998984513836, "epoch": 0.6524912726118692, "step": 257}, {"loss": 0.5333112478256226, "grad_norm": 2.7460132417830643, "learning_rate": 4.6955539334255716e-05, "token_acc": 0.8431862832648688, "epoch": 0.6550301491589972, "step": 258}, {"loss": 0.5408412218093872, "grad_norm": 2.143768931475659, "learning_rate": 4.6895644410796416e-05, "token_acc": 0.8437373601186463, "epoch": 0.6575690257061251, "step": 259}, {"loss": 0.5155550241470337, "grad_norm": 1.552814047782724, "learning_rate": 4.6835205015428246e-05, "token_acc": 0.8499210110584519, "epoch": 0.6601079022532529, "step": 260}, {"loss": 0.5099776983261108, "grad_norm": 1.2034458590422716, "learning_rate": 4.6774222651078106e-05, "token_acc": 0.8472036789793799, "epoch": 0.6626467788003808, "step": 261}, {"loss": 0.5947083234786987, "grad_norm": 2.924220695079595, "learning_rate": 4.671269883417473e-05, "token_acc": 0.8290450928381963, "epoch": 0.6651856553475087, "step": 262}, {"loss": 0.5068027973175049, "grad_norm": 1.455955314620601, "learning_rate": 4.665063509461097e-05, "token_acc": 0.8482072342441952, "epoch": 0.6677245318946367, "step": 263}, {"loss": 0.5365261435508728, "grad_norm": 3.344945263340371, "learning_rate": 4.658803297570577e-05, "token_acc": 0.8415192190359976, "epoch": 0.6702634084417646, "step": 264}, {"loss": 0.4796498417854309, "grad_norm": 1.9005203964312098, "learning_rate": 4.652489403416579e-05, "token_acc": 0.8555090206185567, "epoch": 0.6728022849888924, "step": 265}, {"loss": 0.49148356914520264, "grad_norm": 2.8726899682034412, "learning_rate": 4.6461219840046654e-05, "token_acc": 0.8587875255027688, "epoch": 0.6753411615360203, "step": 266}, {"loss": 0.5379594564437866, "grad_norm": 3.620289535245779, "learning_rate": 4.639701197671397e-05, "token_acc": 0.844286636539703, "epoch": 0.6778800380831482, "step": 267}, {"loss": 0.40906715393066406, "grad_norm": 1.880048630363598, "learning_rate": 4.6332272040803895e-05, "token_acc": 0.8677865920049774, "epoch": 0.6804189146302762, "step": 268}, {"loss": 0.5698261857032776, "grad_norm": 3.2529749263524854, "learning_rate": 4.6267001642183496e-05, "token_acc": 0.8295176385889129, "epoch": 0.682957791177404, "step": 269}, {"loss": 0.5403001308441162, "grad_norm": 1.4115756433255298, "learning_rate": 4.620120240391065e-05, "token_acc": 0.8392932267564156, "epoch": 0.6854966677245319, "step": 270}, {"loss": 0.4380991756916046, "grad_norm": 1.5731929659655102, "learning_rate": 4.613487596219376e-05, "token_acc": 0.8581743166580712, "epoch": 0.6880355442716598, "step": 271}, {"loss": 0.4497607946395874, "grad_norm": 2.429353942954586, "learning_rate": 4.606802396635098e-05, "token_acc": 0.8668831168831169, "epoch": 0.6905744208187877, "step": 272}, {"loss": 0.4794745445251465, "grad_norm": 1.4740422171009888, "learning_rate": 4.600064807876929e-05, "token_acc": 0.8582345601996257, "epoch": 0.6931132973659155, "step": 273}, {"loss": 0.5734583735466003, "grad_norm": 1.4962672531000716, "learning_rate": 4.593274997486309e-05, "token_acc": 0.8358989687640114, "epoch": 0.6956521739130435, "step": 274}, {"loss": 0.47569674253463745, "grad_norm": 2.582140206521716, "learning_rate": 4.586433134303257e-05, "token_acc": 0.851392632524708, "epoch": 0.6981910504601714, "step": 275}, {"loss": 0.4513978362083435, "grad_norm": 2.0299052997394145, "learning_rate": 4.579539388462173e-05, "token_acc": 0.8595333128645993, "epoch": 0.7007299270072993, "step": 276}, {"loss": 0.4924212694168091, "grad_norm": 1.4683236839939144, "learning_rate": 4.572593931387604e-05, "token_acc": 0.8509630565203663, "epoch": 0.7032688035544271, "step": 277}, {"loss": 0.50971919298172, "grad_norm": 1.6692647992426015, "learning_rate": 4.5655969357899874e-05, "token_acc": 0.8504672897196262, "epoch": 0.705807680101555, "step": 278}, {"loss": 0.4721433222293854, "grad_norm": 2.772573768796691, "learning_rate": 4.5585485756613486e-05, "token_acc": 0.8584571832979476, "epoch": 0.708346556648683, "step": 279}, {"loss": 0.5175821781158447, "grad_norm": 2.0060707686440407, "learning_rate": 4.551449026270979e-05, "token_acc": 0.8468809073724007, "epoch": 0.7108854331958109, "step": 280}, {"loss": 0.5257778763771057, "grad_norm": 1.8487986104225613, "learning_rate": 4.544298464161079e-05, "token_acc": 0.8475199020208206, "epoch": 0.7134243097429388, "step": 281}, {"loss": 0.562999427318573, "grad_norm": 2.127782753744905, "learning_rate": 4.537097067142363e-05, "token_acc": 0.8408823529411765, "epoch": 0.7159631862900666, "step": 282}, {"loss": 0.5207107067108154, "grad_norm": 2.5685178275153957, "learning_rate": 4.529845014289642e-05, "token_acc": 0.8469147432878003, "epoch": 0.7185020628371945, "step": 283}, {"loss": 0.5115345120429993, "grad_norm": 6.2775274916114014, "learning_rate": 4.522542485937369e-05, "token_acc": 0.8454268292682927, "epoch": 0.7210409393843225, "step": 284}, {"loss": 0.4864828586578369, "grad_norm": 1.2979163949839545, "learning_rate": 4.5151896636751556e-05, "token_acc": 0.855954855954856, "epoch": 0.7235798159314504, "step": 285}, {"loss": 0.49415430426597595, "grad_norm": 1.9952838067379783, "learning_rate": 4.5077867303432546e-05, "token_acc": 0.8480227882037533, "epoch": 0.7261186924785782, "step": 286}, {"loss": 0.5226168036460876, "grad_norm": 1.7314556438703808, "learning_rate": 4.500333870028016e-05, "token_acc": 0.8493612242032851, "epoch": 0.7286575690257061, "step": 287}, {"loss": 0.4729849100112915, "grad_norm": 4.40006164102703, "learning_rate": 4.4928312680573064e-05, "token_acc": 0.8531379420197515, "epoch": 0.731196445572834, "step": 288}, {"loss": 0.5564934611320496, "grad_norm": 6.394724509170586, "learning_rate": 4.485279110995903e-05, "token_acc": 0.8377503852080124, "epoch": 0.733735322119962, "step": 289}, {"loss": 0.5449815988540649, "grad_norm": 1.4562222001050333, "learning_rate": 4.477677586640854e-05, "token_acc": 0.8387928419775553, "epoch": 0.7362741986670898, "step": 290}, {"loss": 0.5377695560455322, "grad_norm": 2.12916421678339, "learning_rate": 4.4700268840168045e-05, "token_acc": 0.840630472854641, "epoch": 0.7388130752142177, "step": 291}, {"loss": 0.4623599648475647, "grad_norm": 2.4123707155531, "learning_rate": 4.4623271933713065e-05, "token_acc": 0.8558679912443172, "epoch": 0.7413519517613456, "step": 292}, {"loss": 0.5539848804473877, "grad_norm": 2.3146814777436333, "learning_rate": 4.454578706170075e-05, "token_acc": 0.8411723411723412, "epoch": 0.7438908283084735, "step": 293}, {"loss": 0.48377200961112976, "grad_norm": 1.9969775879325171, "learning_rate": 4.446781615092235e-05, "token_acc": 0.8496886046120182, "epoch": 0.7464297048556015, "step": 294}, {"loss": 0.5668104887008667, "grad_norm": 2.8675177730517296, "learning_rate": 4.4389361140255306e-05, "token_acc": 0.8326268464996789, "epoch": 0.7489685814027293, "step": 295}, {"loss": 0.4774082601070404, "grad_norm": 2.7875164416704923, "learning_rate": 4.431042398061499e-05, "token_acc": 0.8559006211180125, "epoch": 0.7515074579498572, "step": 296}, {"loss": 0.5095118284225464, "grad_norm": 3.728199688522229, "learning_rate": 4.4231006634906224e-05, "token_acc": 0.8488716956802064, "epoch": 0.7540463344969851, "step": 297}, {"loss": 0.5145753622055054, "grad_norm": 2.5412776821938974, "learning_rate": 4.415111107797445e-05, "token_acc": 0.8456885637923759, "epoch": 0.756585211044113, "step": 298}, {"loss": 0.4358251094818115, "grad_norm": 3.109090657017562, "learning_rate": 4.407073929655666e-05, "token_acc": 0.8618875369944098, "epoch": 0.7591240875912408, "step": 299}, {"loss": 0.4839688539505005, "grad_norm": 1.6297548376808046, "learning_rate": 4.3989893289231954e-05, "token_acc": 0.8528946535906359, "epoch": 0.7616629641383688, "step": 300}, {"loss": 0.5315079092979431, "grad_norm": 1.6139429460706416, "learning_rate": 4.3908575066371835e-05, "token_acc": 0.8464961067853171, "epoch": 0.7642018406854967, "step": 301}, {"loss": 0.43339255452156067, "grad_norm": 1.958784000024998, "learning_rate": 4.382678665009028e-05, "token_acc": 0.8655923195611178, "epoch": 0.7667407172326246, "step": 302}, {"loss": 0.4361863434314728, "grad_norm": 2.9343918370531257, "learning_rate": 4.374453007419336e-05, "token_acc": 0.859846630771741, "epoch": 0.7692795937797524, "step": 303}, {"loss": 0.511203408241272, "grad_norm": 3.237940469376079, "learning_rate": 4.366180738412876e-05, "token_acc": 0.8461118690313779, "epoch": 0.7718184703268803, "step": 304}, {"loss": 0.4454347491264343, "grad_norm": 2.274147737832287, "learning_rate": 4.357862063693486e-05, "token_acc": 0.8601151774103659, "epoch": 0.7743573468740083, "step": 305}, {"loss": 0.5148607492446899, "grad_norm": 4.944015444600801, "learning_rate": 4.34949719011896e-05, "token_acc": 0.8461761718183137, "epoch": 0.7768962234211362, "step": 306}, {"loss": 0.4589368402957916, "grad_norm": 1.192919570288064, "learning_rate": 4.341086325695905e-05, "token_acc": 0.8554825669530066, "epoch": 0.779435099968264, "step": 307}, {"loss": 0.4466659128665924, "grad_norm": 2.321389755226125, "learning_rate": 4.332629679574566e-05, "token_acc": 0.8586858685868587, "epoch": 0.7819739765153919, "step": 308}, {"loss": 0.5438239574432373, "grad_norm": 1.7507551558813503, "learning_rate": 4.324127462043627e-05, "token_acc": 0.8434806403064715, "epoch": 0.7845128530625198, "step": 309}, {"loss": 0.45011502504348755, "grad_norm": 1.779981899957501, "learning_rate": 4.3155798845249827e-05, "token_acc": 0.8603988603988604, "epoch": 0.7870517296096478, "step": 310}, {"loss": 0.474408894777298, "grad_norm": 1.1173424722276424, "learning_rate": 4.306987159568479e-05, "token_acc": 0.8555719678319383, "epoch": 0.7895906061567757, "step": 311}, {"loss": 0.4456779360771179, "grad_norm": 1.6608650795823556, "learning_rate": 4.2983495008466276e-05, "token_acc": 0.8610570687418937, "epoch": 0.7921294827039035, "step": 312}, {"loss": 0.4788318872451782, "grad_norm": 1.5083288797918926, "learning_rate": 4.2896671231492966e-05, "token_acc": 0.8551842330762639, "epoch": 0.7946683592510314, "step": 313}, {"loss": 0.4659798741340637, "grad_norm": 1.2937780524566131, "learning_rate": 4.2809402423783624e-05, "token_acc": 0.8593476531424026, "epoch": 0.7972072357981593, "step": 314}, {"loss": 0.5088976621627808, "grad_norm": 1.0233055916579001, "learning_rate": 4.272169075542348e-05, "token_acc": 0.8429627141417534, "epoch": 0.7997461123452873, "step": 315}, {"loss": 0.4456738829612732, "grad_norm": 1.0571728981681126, "learning_rate": 4.263353840751022e-05, "token_acc": 0.8666382616105667, "epoch": 0.8022849888924151, "step": 316}, {"loss": 0.4678633213043213, "grad_norm": 1.8198326747222258, "learning_rate": 4.254494757209979e-05, "token_acc": 0.8546817674270218, "epoch": 0.804823865439543, "step": 317}, {"loss": 0.5010336637496948, "grad_norm": 1.5377357010824237, "learning_rate": 4.245592045215182e-05, "token_acc": 0.8465278833004103, "epoch": 0.8073627419866709, "step": 318}, {"loss": 0.5233482718467712, "grad_norm": 1.4181630525718223, "learning_rate": 4.2366459261474933e-05, "token_acc": 0.843609022556391, "epoch": 0.8099016185337988, "step": 319}, {"loss": 0.45297539234161377, "grad_norm": 2.7968517592507247, "learning_rate": 4.227656622467162e-05, "token_acc": 0.8587121852290012, "epoch": 0.8124404950809266, "step": 320}, {"loss": 0.49113717675209045, "grad_norm": 3.9632559263367324, "learning_rate": 4.2186243577082954e-05, "token_acc": 0.8499593165174939, "epoch": 0.8149793716280546, "step": 321}, {"loss": 0.4760684370994568, "grad_norm": 1.5212678599870548, "learning_rate": 4.2095493564733005e-05, "token_acc": 0.8581730769230769, "epoch": 0.8175182481751825, "step": 322}, {"loss": 0.5287943482398987, "grad_norm": 1.1979894810329197, "learning_rate": 4.2004318444272985e-05, "token_acc": 0.8400316247199895, "epoch": 0.8200571247223104, "step": 323}, {"loss": 0.45438772439956665, "grad_norm": 13.231283362213604, "learning_rate": 4.191272048292513e-05, "token_acc": 0.8593374939990398, "epoch": 0.8225960012694383, "step": 324}, {"loss": 0.4688713550567627, "grad_norm": 1.9566355667367066, "learning_rate": 4.1820701958426325e-05, "token_acc": 0.8610249593856151, "epoch": 0.8251348778165661, "step": 325}, {"loss": 0.5428496599197388, "grad_norm": 4.323839382951773, "learning_rate": 4.172826515897146e-05, "token_acc": 0.841347459929367, "epoch": 0.8276737543636941, "step": 326}, {"loss": 0.5651642680168152, "grad_norm": 2.713639671675627, "learning_rate": 4.163541238315653e-05, "token_acc": 0.8335643015521065, "epoch": 0.830212630910822, "step": 327}, {"loss": 0.42816388607025146, "grad_norm": 2.2005640892547205, "learning_rate": 4.154214593992149e-05, "token_acc": 0.8655292606861127, "epoch": 0.8327515074579499, "step": 328}, {"loss": 0.5406675934791565, "grad_norm": 1.7693852546194808, "learning_rate": 4.144846814849282e-05, "token_acc": 0.8363126015659624, "epoch": 0.8352903840050777, "step": 329}, {"loss": 0.47528088092803955, "grad_norm": 1.2824936447977062, "learning_rate": 4.1354381338325864e-05, "token_acc": 0.8529364953047907, "epoch": 0.8378292605522056, "step": 330}, {"loss": 0.47919371724128723, "grad_norm": 2.1290755841224964, "learning_rate": 4.1259887849046906e-05, "token_acc": 0.8517776664997496, "epoch": 0.8403681370993336, "step": 331}, {"loss": 0.4583389163017273, "grad_norm": 1.7923254144391947, "learning_rate": 4.116499003039499e-05, "token_acc": 0.8578696865255211, "epoch": 0.8429070136464615, "step": 332}, {"loss": 0.4751017093658447, "grad_norm": 3.831696945491014, "learning_rate": 4.1069690242163484e-05, "token_acc": 0.8565161762017912, "epoch": 0.8454458901935893, "step": 333}, {"loss": 0.5170926451683044, "grad_norm": 1.3534101044854359, "learning_rate": 4.09739908541414e-05, "token_acc": 0.844575246579701, "epoch": 0.8479847667407172, "step": 334}, {"loss": 0.560020923614502, "grad_norm": 1.7263471686071763, "learning_rate": 4.087789424605447e-05, "token_acc": 0.8369974874371859, "epoch": 0.8505236432878451, "step": 335}, {"loss": 0.48105573654174805, "grad_norm": 1.976895260311541, "learning_rate": 4.078140280750597e-05, "token_acc": 0.8486519607843137, "epoch": 0.853062519834973, "step": 336}, {"loss": 0.535722553730011, "grad_norm": 1.3618234100955324, "learning_rate": 4.0684518937917315e-05, "token_acc": 0.8411811652035116, "epoch": 0.8556013963821009, "step": 337}, {"loss": 0.5101606845855713, "grad_norm": 1.7410934714261248, "learning_rate": 4.058724504646834e-05, "token_acc": 0.8413575374901342, "epoch": 0.8581402729292288, "step": 338}, {"loss": 0.4928050637245178, "grad_norm": 1.6462446903462482, "learning_rate": 4.048958355203746e-05, "token_acc": 0.8460967646185812, "epoch": 0.8606791494763567, "step": 339}, {"loss": 0.5174915194511414, "grad_norm": 1.228936011236623, "learning_rate": 4.039153688314145e-05, "token_acc": 0.8437601824698598, "epoch": 0.8632180260234846, "step": 340}, {"loss": 0.41705322265625, "grad_norm": 1.4612143586664255, "learning_rate": 4.029310747787516e-05, "token_acc": 0.8653099269846202, "epoch": 0.8657569025706126, "step": 341}, {"loss": 0.5154389142990112, "grad_norm": 1.797059242292307, "learning_rate": 4.0194297783850755e-05, "token_acc": 0.8439297831538575, "epoch": 0.8682957791177404, "step": 342}, {"loss": 0.45814093947410583, "grad_norm": 2.068548395822149, "learning_rate": 4.009511025813694e-05, "token_acc": 0.8591615638247763, "epoch": 0.8708346556648683, "step": 343}, {"loss": 0.5106515884399414, "grad_norm": 2.106347854495477, "learning_rate": 3.9995547367197845e-05, "token_acc": 0.8444444444444444, "epoch": 0.8733735322119962, "step": 344}, {"loss": 0.5230048894882202, "grad_norm": 2.277599588151966, "learning_rate": 3.9895611586831685e-05, "token_acc": 0.8413416536661467, "epoch": 0.8759124087591241, "step": 345}, {"loss": 0.4795979857444763, "grad_norm": 2.12251688559056, "learning_rate": 3.9795305402109195e-05, "token_acc": 0.8566383257030739, "epoch": 0.8784512853062519, "step": 346}, {"loss": 0.41639000177383423, "grad_norm": 6.771491520442473, "learning_rate": 3.969463130731183e-05, "token_acc": 0.869641912153819, "epoch": 0.8809901618533799, "step": 347}, {"loss": 0.4425828158855438, "grad_norm": 8.929919537256396, "learning_rate": 3.959359180586975e-05, "token_acc": 0.8597887647328946, "epoch": 0.8835290384005078, "step": 348}, {"loss": 0.44385579228401184, "grad_norm": 7.530785543727866, "learning_rate": 3.9492189410299566e-05, "token_acc": 0.865767878077374, "epoch": 0.8860679149476357, "step": 349}, {"loss": 0.48342394828796387, "grad_norm": 2.6343520915908716, "learning_rate": 3.939042664214184e-05, "token_acc": 0.8567626018965231, "epoch": 0.8886067914947635, "step": 350}, {"loss": 0.4776611030101776, "grad_norm": 1.5801412806386852, "learning_rate": 3.928830603189844e-05, "token_acc": 0.8521291530182499, "epoch": 0.8911456680418914, "step": 351}, {"loss": 0.45217645168304443, "grad_norm": 3.7389218036878478, "learning_rate": 3.918583011896955e-05, "token_acc": 0.8585561910650796, "epoch": 0.8936845445890194, "step": 352}, {"loss": 0.5242031216621399, "grad_norm": 1.6890575760456612, "learning_rate": 3.908300145159055e-05, "token_acc": 0.8453546152687849, "epoch": 0.8962234211361473, "step": 353}, {"loss": 0.4830443859100342, "grad_norm": 1.992965354554827, "learning_rate": 3.897982258676867e-05, "token_acc": 0.8554014932195643, "epoch": 0.8987622976832752, "step": 354}, {"loss": 0.4663028419017792, "grad_norm": 1.2964405728485144, "learning_rate": 3.887629609021938e-05, "token_acc": 0.8561201572150478, "epoch": 0.901301174230403, "step": 355}, {"loss": 0.5014960169792175, "grad_norm": 8.39081588467176, "learning_rate": 3.8772424536302564e-05, "token_acc": 0.8504262120404902, "epoch": 0.9038400507775309, "step": 356}, {"loss": 0.5827922821044922, "grad_norm": 1.8861771407475878, "learning_rate": 3.866821050795859e-05, "token_acc": 0.8322280231409623, "epoch": 0.9063789273246589, "step": 357}, {"loss": 0.5254430770874023, "grad_norm": 1.631982885362827, "learning_rate": 3.856365659664399e-05, "token_acc": 0.8455894342083808, "epoch": 0.9089178038717868, "step": 358}, {"loss": 0.5034159421920776, "grad_norm": 1.6184938593440648, "learning_rate": 3.845876540226706e-05, "token_acc": 0.8477827221114009, "epoch": 0.9114566804189146, "step": 359}, {"loss": 0.4409644603729248, "grad_norm": 2.616866018868145, "learning_rate": 3.835353953312322e-05, "token_acc": 0.8624558168126633, "epoch": 0.9139955569660425, "step": 360}, {"loss": 0.4826850891113281, "grad_norm": 1.1082161386999507, "learning_rate": 3.824798160583012e-05, "token_acc": 0.8542769573697409, "epoch": 0.9165344335131704, "step": 361}, {"loss": 0.5543685555458069, "grad_norm": 1.4706520431007584, "learning_rate": 3.814209424526262e-05, "token_acc": 0.8411547002220577, "epoch": 0.9190733100602984, "step": 362}, {"loss": 0.46426546573638916, "grad_norm": 1.4937567660832907, "learning_rate": 3.803588008448745e-05, "token_acc": 0.8584509156409487, "epoch": 0.9216121866074262, "step": 363}, {"loss": 0.43454286456108093, "grad_norm": 1.164319366810129, "learning_rate": 3.7929341764697816e-05, "token_acc": 0.869382677655108, "epoch": 0.9241510631545541, "step": 364}, {"loss": 0.40108054876327515, "grad_norm": 1.4647461875367664, "learning_rate": 3.782248193514766e-05, "token_acc": 0.8742168674698795, "epoch": 0.926689939701682, "step": 365}, {"loss": 0.48394569754600525, "grad_norm": 1.6339280778635523, "learning_rate": 3.771530325308579e-05, "token_acc": 0.8536367122587243, "epoch": 0.9292288162488099, "step": 366}, {"loss": 0.5164212584495544, "grad_norm": 1.4990029947108798, "learning_rate": 3.7607808383689856e-05, "token_acc": 0.8487874465049928, "epoch": 0.9317676927959379, "step": 367}, {"loss": 0.5112602710723877, "grad_norm": 1.246505387725808, "learning_rate": 3.7500000000000003e-05, "token_acc": 0.8492902446390819, "epoch": 0.9343065693430657, "step": 368}, {"loss": 0.4383936822414398, "grad_norm": 3.107413430389552, "learning_rate": 3.739188078285244e-05, "token_acc": 0.8606896551724138, "epoch": 0.9368454458901936, "step": 369}, {"loss": 0.46092715859413147, "grad_norm": 37.635995940969075, "learning_rate": 3.7283453420812786e-05, "token_acc": 0.8597212294496068, "epoch": 0.9393843224373215, "step": 370}, {"loss": 0.5413942337036133, "grad_norm": 3.577937521692329, "learning_rate": 3.717472061010918e-05, "token_acc": 0.8350426115845732, "epoch": 0.9419231989844494, "step": 371}, {"loss": 0.48648974299430847, "grad_norm": 5.47409206936157, "learning_rate": 3.706568505456527e-05, "token_acc": 0.8585890540968049, "epoch": 0.9444620755315772, "step": 372}, {"loss": 0.47160500288009644, "grad_norm": 1.4741286710796073, "learning_rate": 3.695634946553296e-05, "token_acc": 0.8502487562189055, "epoch": 0.9470009520787052, "step": 373}, {"loss": 0.5264440774917603, "grad_norm": 2.090944147666011, "learning_rate": 3.6846716561824965e-05, "token_acc": 0.84245960502693, "epoch": 0.9495398286258331, "step": 374}, {"loss": 0.46441876888275146, "grad_norm": 5.396217963829348, "learning_rate": 3.673678906964727e-05, "token_acc": 0.8582541054451167, "epoch": 0.952078705172961, "step": 375}, {"loss": 0.4945961534976959, "grad_norm": 2.5487410815491325, "learning_rate": 3.662656972253127e-05, "token_acc": 0.849025974025974, "epoch": 0.9546175817200888, "step": 376}, {"loss": 0.44490116834640503, "grad_norm": 1.4487108456202973, "learning_rate": 3.651606126126581e-05, "token_acc": 0.8634252090430474, "epoch": 0.9571564582672167, "step": 377}, {"loss": 0.45414626598358154, "grad_norm": 2.4501839034153567, "learning_rate": 3.6405266433829075e-05, "token_acc": 0.8611764705882353, "epoch": 0.9596953348143447, "step": 378}, {"loss": 0.4957122206687927, "grad_norm": 2.498672242292354, "learning_rate": 3.6294187995320214e-05, "token_acc": 0.8477234401349073, "epoch": 0.9622342113614726, "step": 379}, {"loss": 0.5208961963653564, "grad_norm": 1.5923271833585566, "learning_rate": 3.6182828707890816e-05, "token_acc": 0.8432196541134637, "epoch": 0.9647730879086004, "step": 380}, {"loss": 0.5402977466583252, "grad_norm": 4.277533304496898, "learning_rate": 3.607119134067629e-05, "token_acc": 0.8438965563446336, "epoch": 0.9673119644557283, "step": 381}, {"loss": 0.5133845210075378, "grad_norm": 1.391785836034451, "learning_rate": 3.5959278669726935e-05, "token_acc": 0.8467186095295175, "epoch": 0.9698508410028562, "step": 382}, {"loss": 0.4607965350151062, "grad_norm": 1.6652300791673929, "learning_rate": 3.5847093477938956e-05, "token_acc": 0.8581548321808062, "epoch": 0.9723897175499842, "step": 383}, {"loss": 0.558885931968689, "grad_norm": 3.047516730060917, "learning_rate": 3.5734638554985236e-05, "token_acc": 0.8354353441726181, "epoch": 0.9749285940971121, "step": 384}, {"loss": 0.45114433765411377, "grad_norm": 1.7394548434827772, "learning_rate": 3.562191669724597e-05, "token_acc": 0.8557377049180328, "epoch": 0.9774674706442399, "step": 385}, {"loss": 0.4739205837249756, "grad_norm": 2.3715567586043527, "learning_rate": 3.550893070773914e-05, "token_acc": 0.8504549457000293, "epoch": 0.9800063471913678, "step": 386}, {"loss": 0.47992223501205444, "grad_norm": 2.7051039254253944, "learning_rate": 3.5395683396050825e-05, "token_acc": 0.8514475557664927, "epoch": 0.9825452237384957, "step": 387}, {"loss": 0.41233572363853455, "grad_norm": 2.9508108026603526, "learning_rate": 3.5282177578265296e-05, "token_acc": 0.8679525222551929, "epoch": 0.9850841002856237, "step": 388}, {"loss": 0.5352930426597595, "grad_norm": 1.4813660303012237, "learning_rate": 3.516841607689501e-05, "token_acc": 0.8431159981415518, "epoch": 0.9876229768327515, "step": 389}, {"loss": 0.4628872275352478, "grad_norm": 3.1303557072936457, "learning_rate": 3.505440172081044e-05, "token_acc": 0.86190833959429, "epoch": 0.9901618533798794, "step": 390}, {"loss": 0.4559894800186157, "grad_norm": 1.4674915872936216, "learning_rate": 3.494013734516971e-05, "token_acc": 0.8610082138830729, "epoch": 0.9927007299270073, "step": 391}, {"loss": 0.4409753978252411, "grad_norm": 1.953348901842891, "learning_rate": 3.4825625791348096e-05, "token_acc": 0.862080370431619, "epoch": 0.9952396064741352, "step": 392}, {"loss": 0.4559399485588074, "grad_norm": 4.310074710886207, "learning_rate": 3.471086990686737e-05, "token_acc": 0.8591592988987126, "epoch": 0.997778483021263, "step": 393}, {"loss": 0.48068922758102417, "grad_norm": 1.7219046332106547, "learning_rate": 3.459587254532502e-05, "token_acc": 0.8567295770767324, "epoch": 1.0, "step": 394}, {"eval_loss": 0.38288021087646484, "eval_runtime": 8.607, "eval_samples_per_second": 1.394, "eval_steps_per_second": 0.349, "eval_token_acc": 0.8742701440249124, "epoch": 1.0, "step": 394}, {"loss": 0.5143592357635498, "grad_norm": 1.2229641769370543, "learning_rate": 3.4480636566323215e-05, "token_acc": 0.8472704323130325, "epoch": 1.002538876547128, "step": 395}, {"loss": 0.45231950283050537, "grad_norm": 1.782813512616928, "learning_rate": 3.436516483539781e-05, "token_acc": 0.8617021276595744, "epoch": 1.0050777530942558, "step": 396}, {"loss": 0.4508786201477051, "grad_norm": 2.5856575991238056, "learning_rate": 3.4249460223946975e-05, "token_acc": 0.8614345263763117, "epoch": 1.0076166296413838, "step": 397}, {"loss": 0.4804307520389557, "grad_norm": 2.745875080779602, "learning_rate": 3.413352560915988e-05, "token_acc": 0.8540305010893247, "epoch": 1.0101555061885117, "step": 398}, {"loss": 0.4729859530925751, "grad_norm": 1.3535080212876127, "learning_rate": 3.40173638739451e-05, "token_acc": 0.8471134319698288, "epoch": 1.0126943827356394, "step": 399}, {"loss": 0.4843446910381317, "grad_norm": 6.2502653542713045, "learning_rate": 3.390097790685892e-05, "token_acc": 0.8495706737120211, "epoch": 1.0152332592827673, "step": 400}, {"loss": 0.49588215351104736, "grad_norm": 1.5132850287078201, "learning_rate": 3.378437060203357e-05, "token_acc": 0.8444312620495329, "epoch": 1.0177721358298952, "step": 401}, {"loss": 0.4410606026649475, "grad_norm": 1.741043699741523, "learning_rate": 3.366754485910518e-05, "token_acc": 0.8592157540162377, "epoch": 1.0203110123770232, "step": 402}, {"loss": 0.4497084617614746, "grad_norm": 2.0466665441953373, "learning_rate": 3.355050358314172e-05, "token_acc": 0.8592548787699587, "epoch": 1.022849888924151, "step": 403}, {"loss": 0.38255980610847473, "grad_norm": 1.4823523958796039, "learning_rate": 3.343324968457076e-05, "token_acc": 0.8794028849379403, "epoch": 1.025388765471279, "step": 404}, {"loss": 0.4536193609237671, "grad_norm": 2.3966751712341288, "learning_rate": 3.3315786079107055e-05, "token_acc": 0.8633706363788208, "epoch": 1.027927642018407, "step": 405}, {"loss": 0.4739498794078827, "grad_norm": 1.9063349365942874, "learning_rate": 3.3198115687680115e-05, "token_acc": 0.8466187520418164, "epoch": 1.0304665185655348, "step": 406}, {"loss": 0.4536374807357788, "grad_norm": 1.4474508319260888, "learning_rate": 3.3080241436361506e-05, "token_acc": 0.856529635132904, "epoch": 1.0330053951126628, "step": 407}, {"loss": 0.4842260479927063, "grad_norm": 2.0083018432623465, "learning_rate": 3.2962166256292113e-05, "token_acc": 0.8531575720416922, "epoch": 1.0355442716597905, "step": 408}, {"loss": 0.4716520607471466, "grad_norm": 2.8898012681351974, "learning_rate": 3.284389308360927e-05, "token_acc": 0.8573252473667411, "epoch": 1.0380831482069184, "step": 409}, {"loss": 0.46738767623901367, "grad_norm": 2.3139198848727585, "learning_rate": 3.272542485937369e-05, "token_acc": 0.8576483396842678, "epoch": 1.0406220247540463, "step": 410}, {"loss": 0.3785024881362915, "grad_norm": 2.6044461796538103, "learning_rate": 3.260676452949641e-05, "token_acc": 0.8754966887417218, "epoch": 1.0431609013011742, "step": 411}, {"loss": 0.4541627764701843, "grad_norm": 3.1131273390710468, "learning_rate": 3.248791504466548e-05, "token_acc": 0.8586320148507782, "epoch": 1.0456997778483021, "step": 412}, {"loss": 0.48604655265808105, "grad_norm": 4.266600593708534, "learning_rate": 3.2368879360272606e-05, "token_acc": 0.8502902014339365, "epoch": 1.04823865439543, "step": 413}, {"loss": 0.4228139817714691, "grad_norm": 2.5732127120225754, "learning_rate": 3.224966043633966e-05, "token_acc": 0.8685553404891783, "epoch": 1.050777530942558, "step": 414}, {"loss": 0.4242054224014282, "grad_norm": 3.290325675872062, "learning_rate": 3.213026123744506e-05, "token_acc": 0.8702075930428278, "epoch": 1.053316407489686, "step": 415}, {"loss": 0.5049506425857544, "grad_norm": 1.8726969443881516, "learning_rate": 3.201068473265007e-05, "token_acc": 0.8449933244325768, "epoch": 1.0558552840368136, "step": 416}, {"loss": 0.4801601767539978, "grad_norm": 1.4990350894397084, "learning_rate": 3.1890933895424976e-05, "token_acc": 0.8546188793538617, "epoch": 1.0583941605839415, "step": 417}, {"loss": 0.4432232081890106, "grad_norm": 4.725304561377453, "learning_rate": 3.177101170357513e-05, "token_acc": 0.8598114824335904, "epoch": 1.0609330371310695, "step": 418}, {"loss": 0.4704890549182892, "grad_norm": 1.8364682243485244, "learning_rate": 3.165092113916688e-05, "token_acc": 0.853051391862955, "epoch": 1.0634719136781974, "step": 419}, {"loss": 0.4157974123954773, "grad_norm": 1.8584736101795611, "learning_rate": 3.1530665188453464e-05, "token_acc": 0.8669499402469791, "epoch": 1.0660107902253253, "step": 420}, {"loss": 0.47378596663475037, "grad_norm": 2.4486092965062944, "learning_rate": 3.141024684180071e-05, "token_acc": 0.8559068743117823, "epoch": 1.0685496667724532, "step": 421}, {"loss": 0.44109225273132324, "grad_norm": 2.122171195805963, "learning_rate": 3.1289669093612714e-05, "token_acc": 0.8653446345754038, "epoch": 1.0710885433195811, "step": 422}, {"loss": 0.4290213882923126, "grad_norm": 1.663932313816282, "learning_rate": 3.116893494225734e-05, "token_acc": 0.8728871787824654, "epoch": 1.073627419866709, "step": 423}, {"loss": 0.48185476660728455, "grad_norm": 3.2894488241422595, "learning_rate": 3.104804738999169e-05, "token_acc": 0.8533186145991445, "epoch": 1.0761662964138368, "step": 424}, {"loss": 0.4967986047267914, "grad_norm": 1.8835262069474619, "learning_rate": 3.092700944288744e-05, "token_acc": 0.8481705560357246, "epoch": 1.0787051729609647, "step": 425}, {"loss": 0.47215160727500916, "grad_norm": 7.1900683103196394, "learning_rate": 3.0805824110756064e-05, "token_acc": 0.8555606829718505, "epoch": 1.0812440495080926, "step": 426}, {"loss": 0.49559837579727173, "grad_norm": 2.0678528290425673, "learning_rate": 3.068449440707404e-05, "token_acc": 0.8468780971258671, "epoch": 1.0837829260552205, "step": 427}, {"loss": 0.4293171465396881, "grad_norm": 1.1605274764312772, "learning_rate": 3.056302334890786e-05, "token_acc": 0.8696649029982363, "epoch": 1.0863218026023485, "step": 428}, {"loss": 0.4138556718826294, "grad_norm": 1.829932435079925, "learning_rate": 3.044141395683906e-05, "token_acc": 0.8735001714089818, "epoch": 1.0888606791494764, "step": 429}, {"loss": 0.49801939725875854, "grad_norm": 1.9917983924455804, "learning_rate": 3.0319669254889055e-05, "token_acc": 0.8478201634877384, "epoch": 1.0913995556966043, "step": 430}, {"loss": 0.4354502558708191, "grad_norm": 1.8340886864271402, "learning_rate": 3.0197792270443982e-05, "token_acc": 0.8643157010915198, "epoch": 1.0939384322437322, "step": 431}, {"loss": 0.4251129925251007, "grad_norm": 3.7272006794934955, "learning_rate": 3.0075786034179405e-05, "token_acc": 0.8639125151883353, "epoch": 1.0964773087908601, "step": 432}, {"loss": 0.5122531652450562, "grad_norm": 3.189824496796892, "learning_rate": 2.9953653579984942e-05, "token_acc": 0.84490833667871, "epoch": 1.0990161853379878, "step": 433}, {"loss": 0.4983152151107788, "grad_norm": 9.547665998376548, "learning_rate": 2.9831397944888833e-05, "token_acc": 0.8490809879379667, "epoch": 1.1015550618851158, "step": 434}, {"loss": 0.4401092529296875, "grad_norm": 1.368844738455595, "learning_rate": 2.9709022168982426e-05, "token_acc": 0.8648365098793496, "epoch": 1.1040939384322437, "step": 435}, {"loss": 0.47184881567955017, "grad_norm": 1.5166459641814631, "learning_rate": 2.958652929534456e-05, "token_acc": 0.8622801507537688, "epoch": 1.1066328149793716, "step": 436}, {"loss": 0.442952036857605, "grad_norm": 8.52384238349447, "learning_rate": 2.9463922369965917e-05, "token_acc": 0.8647058823529412, "epoch": 1.1091716915264995, "step": 437}, {"loss": 0.4556211829185486, "grad_norm": 1.7355688744377027, "learning_rate": 2.9341204441673266e-05, "token_acc": 0.8579634464751958, "epoch": 1.1117105680736274, "step": 438}, {"loss": 0.4310702979564667, "grad_norm": 2.842812023165703, "learning_rate": 2.9218378562053623e-05, "token_acc": 0.8618874773139746, "epoch": 1.1142494446207554, "step": 439}, {"loss": 0.41620612144470215, "grad_norm": 1.981590398544929, "learning_rate": 2.9095447785378443e-05, "token_acc": 0.8692713484998351, "epoch": 1.1167883211678833, "step": 440}, {"loss": 0.46872544288635254, "grad_norm": 1.6561586631847878, "learning_rate": 2.8972415168527584e-05, "token_acc": 0.8524402461714613, "epoch": 1.1193271977150112, "step": 441}, {"loss": 0.4736919403076172, "grad_norm": 1.0697309113408602, "learning_rate": 2.8849283770913337e-05, "token_acc": 0.858664890960546, "epoch": 1.121866074262139, "step": 442}, {"loss": 0.5187445282936096, "grad_norm": 2.271613730200828, "learning_rate": 2.872605665440436e-05, "token_acc": 0.8385538413588904, "epoch": 1.1244049508092668, "step": 443}, {"loss": 0.48289763927459717, "grad_norm": 2.0302271966788226, "learning_rate": 2.8602736883249503e-05, "token_acc": 0.8504065040650407, "epoch": 1.1269438273563948, "step": 444}, {"loss": 0.439789742231369, "grad_norm": 2.5156014361955505, "learning_rate": 2.8479327524001636e-05, "token_acc": 0.8627858627858628, "epoch": 1.1294827039035227, "step": 445}, {"loss": 0.4468497633934021, "grad_norm": 1.630120505800982, "learning_rate": 2.8355831645441388e-05, "token_acc": 0.8583463338533541, "epoch": 1.1320215804506506, "step": 446}, {"loss": 0.44376781582832336, "grad_norm": 3.439515982340311, "learning_rate": 2.8232252318500834e-05, "token_acc": 0.8602133418245502, "epoch": 1.1345604569977785, "step": 447}, {"loss": 0.5256617069244385, "grad_norm": 1.9688918033614031, "learning_rate": 2.8108592616187133e-05, "token_acc": 0.8416276346604216, "epoch": 1.1370993335449064, "step": 448}, {"loss": 0.5007484555244446, "grad_norm": 1.458501108793647, "learning_rate": 2.7984855613506107e-05, "token_acc": 0.8427366200896388, "epoch": 1.1396382100920344, "step": 449}, {"loss": 0.4337853491306305, "grad_norm": 2.419603108383009, "learning_rate": 2.78610443873858e-05, "token_acc": 0.8653566229985444, "epoch": 1.1421770866391623, "step": 450}, {"loss": 0.4739110469818115, "grad_norm": 2.0546175364709973, "learning_rate": 2.7737162016599927e-05, "token_acc": 0.8580179048217371, "epoch": 1.14471596318629, "step": 451}, {"loss": 0.4021814465522766, "grad_norm": 1.7344233726597045, "learning_rate": 2.761321158169134e-05, "token_acc": 0.8751091703056768, "epoch": 1.147254839733418, "step": 452}, {"loss": 0.4569374620914459, "grad_norm": 2.4932317823051235, "learning_rate": 2.748919616489542e-05, "token_acc": 0.8565812234628086, "epoch": 1.1497937162805458, "step": 453}, {"loss": 0.4615058898925781, "grad_norm": 2.039426578941072, "learning_rate": 2.736511885006343e-05, "token_acc": 0.857873634729711, "epoch": 1.1523325928276738, "step": 454}, {"loss": 0.4801989793777466, "grad_norm": 1.301902650044201, "learning_rate": 2.724098272258584e-05, "token_acc": 0.8526692514166418, "epoch": 1.1548714693748017, "step": 455}, {"loss": 0.4869546890258789, "grad_norm": 1.2365689612139248, "learning_rate": 2.7116790869315582e-05, "token_acc": 0.8527866752081998, "epoch": 1.1574103459219296, "step": 456}, {"loss": 0.4671558439731598, "grad_norm": 2.2554775681141472, "learning_rate": 2.6992546378491318e-05, "token_acc": 0.8632738871973322, "epoch": 1.1599492224690575, "step": 457}, {"loss": 0.45758605003356934, "grad_norm": 2.8330547866128533, "learning_rate": 2.686825233966061e-05, "token_acc": 0.8600294393148669, "epoch": 1.1624880990161852, "step": 458}, {"loss": 0.4325929284095764, "grad_norm": 2.5382341534463375, "learning_rate": 2.674391184360313e-05, "token_acc": 0.8682536798110122, "epoch": 1.1650269755633131, "step": 459}, {"loss": 0.3959786295890808, "grad_norm": 1.2696808367267984, "learning_rate": 2.6619527982253794e-05, "token_acc": 0.8766492789199141, "epoch": 1.167565852110441, "step": 460}, {"loss": 0.3940657377243042, "grad_norm": 1.7506142140382555, "learning_rate": 2.649510384862586e-05, "token_acc": 0.8712036889807601, "epoch": 1.170104728657569, "step": 461}, {"loss": 0.5099540948867798, "grad_norm": 1.7107196519705088, "learning_rate": 2.6370642536734004e-05, "token_acc": 0.8436054506813352, "epoch": 1.172643605204697, "step": 462}, {"loss": 0.4193633794784546, "grad_norm": 1.7833742981941938, "learning_rate": 2.624614714151743e-05, "token_acc": 0.8683380375228291, "epoch": 1.1751824817518248, "step": 463}, {"loss": 0.4693203270435333, "grad_norm": 2.3198990995406725, "learning_rate": 2.6121620758762877e-05, "token_acc": 0.8514638732205211, "epoch": 1.1777213582989527, "step": 464}, {"loss": 0.4063398540019989, "grad_norm": 1.2897817969202603, "learning_rate": 2.5997066485027626e-05, "token_acc": 0.8695512304970243, "epoch": 1.1802602348460807, "step": 465}, {"loss": 0.44572171568870544, "grad_norm": 1.4405232549772193, "learning_rate": 2.587248741756253e-05, "token_acc": 0.8620852335272842, "epoch": 1.1827991113932086, "step": 466}, {"loss": 0.3987278342247009, "grad_norm": 1.8217636722356765, "learning_rate": 2.5747886654234967e-05, "token_acc": 0.8706475756589652, "epoch": 1.1853379879403363, "step": 467}, {"loss": 0.37269577383995056, "grad_norm": 3.1824454514895275, "learning_rate": 2.5623267293451826e-05, "token_acc": 0.8813060971835345, "epoch": 1.1878768644874642, "step": 468}, {"loss": 0.4612298905849457, "grad_norm": 2.138374626937944, "learning_rate": 2.5498632434082452e-05, "token_acc": 0.8567168225565949, "epoch": 1.1904157410345921, "step": 469}, {"loss": 0.44054481387138367, "grad_norm": 2.3450905694863304, "learning_rate": 2.5373985175381594e-05, "token_acc": 0.8611957044398141, "epoch": 1.19295461758172, "step": 470}, {"loss": 0.46581026911735535, "grad_norm": 2.839758777918868, "learning_rate": 2.5249328616912316e-05, "token_acc": 0.854138500826198, "epoch": 1.195493494128848, "step": 471}, {"loss": 0.43622541427612305, "grad_norm": 3.5936641880132116, "learning_rate": 2.5124665858468954e-05, "token_acc": 0.8644588045234248, "epoch": 1.198032370675976, "step": 472}, {"loss": 0.4469029903411865, "grad_norm": 4.911380154668555, "learning_rate": 2.5e-05, "token_acc": 0.8588452262732302, "epoch": 1.2005712472231038, "step": 473}, {"loss": 0.49759551882743835, "grad_norm": 1.8675819623640426, "learning_rate": 2.4875334141531052e-05, "token_acc": 0.8490790255496138, "epoch": 1.2031101237702317, "step": 474}, {"loss": 0.4025341272354126, "grad_norm": 1.6580101212399494, "learning_rate": 2.475067138308769e-05, "token_acc": 0.8734239397412805, "epoch": 1.2056490003173597, "step": 475}, {"loss": 0.3990614712238312, "grad_norm": 5.728085354938939, "learning_rate": 2.4626014824618415e-05, "token_acc": 0.8767967145790554, "epoch": 1.2081878768644874, "step": 476}, {"loss": 0.5157250761985779, "grad_norm": 1.5367082341872766, "learning_rate": 2.4501367565917554e-05, "token_acc": 0.8448275862068966, "epoch": 1.2107267534116153, "step": 477}, {"loss": 0.4492168426513672, "grad_norm": 3.597690424641379, "learning_rate": 2.4376732706548183e-05, "token_acc": 0.8615661861074705, "epoch": 1.2132656299587432, "step": 478}, {"loss": 0.37822383642196655, "grad_norm": 1.4902041072493963, "learning_rate": 2.4252113345765046e-05, "token_acc": 0.8781550480769231, "epoch": 1.2158045065058711, "step": 479}, {"loss": 0.5190750360488892, "grad_norm": 1.426246751443822, "learning_rate": 2.4127512582437485e-05, "token_acc": 0.8486579856497476, "epoch": 1.218343383052999, "step": 480}, {"loss": 0.518539547920227, "grad_norm": 2.774813842177893, "learning_rate": 2.4002933514972383e-05, "token_acc": 0.84472834479854, "epoch": 1.220882259600127, "step": 481}, {"loss": 0.47627416253089905, "grad_norm": 1.4098380882633827, "learning_rate": 2.3878379241237136e-05, "token_acc": 0.8569976771196284, "epoch": 1.223421136147255, "step": 482}, {"loss": 0.42589280009269714, "grad_norm": 1.7826564526094135, "learning_rate": 2.375385285848257e-05, "token_acc": 0.8641709458340235, "epoch": 1.2259600126943828, "step": 483}, {"loss": 0.4288692772388458, "grad_norm": 6.914261522969829, "learning_rate": 2.3629357463265995e-05, "token_acc": 0.8673562519014298, "epoch": 1.2284988892415107, "step": 484}, {"loss": 0.4289345145225525, "grad_norm": 2.2936806230614, "learning_rate": 2.3504896151374144e-05, "token_acc": 0.861934856587263, "epoch": 1.2310377657886384, "step": 485}, {"loss": 0.4350780248641968, "grad_norm": 4.477879405699933, "learning_rate": 2.3380472017746202e-05, "token_acc": 0.8626133691635876, "epoch": 1.2335766423357664, "step": 486}, {"loss": 0.39745572209358215, "grad_norm": 1.8058168095565652, "learning_rate": 2.3256088156396868e-05, "token_acc": 0.8732865262454029, "epoch": 1.2361155188828943, "step": 487}, {"loss": 0.4024912118911743, "grad_norm": 2.2664330502994345, "learning_rate": 2.3131747660339394e-05, "token_acc": 0.8703306797305572, "epoch": 1.2386543954300222, "step": 488}, {"loss": 0.4632995128631592, "grad_norm": 5.084590822735379, "learning_rate": 2.300745362150869e-05, "token_acc": 0.855690440060698, "epoch": 1.2411932719771501, "step": 489}, {"loss": 0.4639138877391815, "grad_norm": 2.0874369543957347, "learning_rate": 2.288320913068442e-05, "token_acc": 0.8562836340614118, "epoch": 1.243732148524278, "step": 490}, {"loss": 0.46406933665275574, "grad_norm": 1.2707114462172824, "learning_rate": 2.2759017277414166e-05, "token_acc": 0.8545316070068545, "epoch": 1.246271025071406, "step": 491}, {"loss": 0.44021913409233093, "grad_norm": 5.750489479727684, "learning_rate": 2.2634881149936575e-05, "token_acc": 0.8632707774798928, "epoch": 1.248809901618534, "step": 492}, {"loss": 0.3908591568470001, "grad_norm": 2.6842431999286265, "learning_rate": 2.251080383510459e-05, "token_acc": 0.8772083515841729, "epoch": 1.2513487781656618, "step": 493}, {"loss": 0.4324193000793457, "grad_norm": 1.1560545363753385, "learning_rate": 2.238678841830867e-05, "token_acc": 0.8664389132910363, "epoch": 1.2538876547127895, "step": 494}, {"loss": 0.4089895486831665, "grad_norm": 1.6882361440401292, "learning_rate": 2.2262837983400082e-05, "token_acc": 0.8690438624171662, "epoch": 1.2564265312599174, "step": 495}, {"loss": 0.4600200653076172, "grad_norm": 0.9792218604145349, "learning_rate": 2.2138955612614207e-05, "token_acc": 0.8582183186951067, "epoch": 1.2589654078070454, "step": 496}, {"loss": 0.3934141993522644, "grad_norm": 2.080232718858842, "learning_rate": 2.2015144386493896e-05, "token_acc": 0.8696333437793795, "epoch": 1.2615042843541733, "step": 497}, {"loss": 0.44040676951408386, "grad_norm": 1.8586192597126465, "learning_rate": 2.189140738381288e-05, "token_acc": 0.8644963828603227, "epoch": 1.2640431609013012, "step": 498}, {"loss": 0.3815660774707794, "grad_norm": 4.06956415958539, "learning_rate": 2.1767747681499176e-05, "token_acc": 0.870893371757925, "epoch": 1.2665820374484291, "step": 499}, {"loss": 0.5274641513824463, "grad_norm": 1.3449883177756365, "learning_rate": 2.164416835455862e-05, "token_acc": 0.8424899193548387, "epoch": 1.269120913995557, "step": 500}, {"loss": 0.47970038652420044, "grad_norm": 1.9086096747495165, "learning_rate": 2.1520672475998373e-05, "token_acc": 0.8552230534774176, "epoch": 1.2716597905426847, "step": 501}, {"loss": 0.4599403738975525, "grad_norm": 1.4597144720924924, "learning_rate": 2.1397263116750503e-05, "token_acc": 0.8601061263868789, "epoch": 1.2741986670898129, "step": 502}, {"loss": 0.4462440013885498, "grad_norm": 1.9206210272302051, "learning_rate": 2.1273943345595637e-05, "token_acc": 0.860810615894995, "epoch": 1.2767375436369406, "step": 503}, {"loss": 0.398454487323761, "grad_norm": 2.0589969018981424, "learning_rate": 2.115071622908666e-05, "token_acc": 0.8701257361133217, "epoch": 1.2792764201840685, "step": 504}, {"loss": 0.43291550874710083, "grad_norm": 1.338387248924533, "learning_rate": 2.1027584831472418e-05, "token_acc": 0.8682223747426219, "epoch": 1.2818152967311964, "step": 505}, {"loss": 0.4928514361381531, "grad_norm": 3.9967212680040456, "learning_rate": 2.090455221462156e-05, "token_acc": 0.8556149732620321, "epoch": 1.2843541732783244, "step": 506}, {"loss": 0.39140599966049194, "grad_norm": 1.3777480828704425, "learning_rate": 2.0781621437946376e-05, "token_acc": 0.8749344061570754, "epoch": 1.2868930498254523, "step": 507}, {"loss": 0.4300925135612488, "grad_norm": 2.163412854039733, "learning_rate": 2.0658795558326743e-05, "token_acc": 0.8705182174481056, "epoch": 1.2894319263725802, "step": 508}, {"loss": 0.46016770601272583, "grad_norm": 3.6013585326036526, "learning_rate": 2.0536077630034086e-05, "token_acc": 0.8594602789569437, "epoch": 1.2919708029197081, "step": 509}, {"loss": 0.4381971061229706, "grad_norm": 8.4409855883816, "learning_rate": 2.0413470704655445e-05, "token_acc": 0.8621141525917297, "epoch": 1.2945096794668358, "step": 510}, {"loss": 0.4124452471733093, "grad_norm": 1.856318757657611, "learning_rate": 2.0290977831017583e-05, "token_acc": 0.8683113273106324, "epoch": 1.2970485560139637, "step": 511}, {"loss": 0.41474050283432007, "grad_norm": 17.66087022350861, "learning_rate": 2.0168602055111173e-05, "token_acc": 0.866996699669967, "epoch": 1.2995874325610917, "step": 512}, {"loss": 0.46553826332092285, "grad_norm": 1.2286019548778255, "learning_rate": 2.0046346420015067e-05, "token_acc": 0.8545911616829849, "epoch": 1.3021263091082196, "step": 513}, {"loss": 0.46943899989128113, "grad_norm": 1.4026697049092485, "learning_rate": 1.99242139658206e-05, "token_acc": 0.8579387186629527, "epoch": 1.3046651856553475, "step": 514}, {"loss": 0.5168992877006531, "grad_norm": 1.8539995874816066, "learning_rate": 1.980220772955602e-05, "token_acc": 0.8489708634055065, "epoch": 1.3072040622024754, "step": 515}, {"loss": 0.42453351616859436, "grad_norm": 3.677926572991036, "learning_rate": 1.9680330745110954e-05, "token_acc": 0.8682324233643435, "epoch": 1.3097429387496033, "step": 516}, {"loss": 0.4531457722187042, "grad_norm": 3.7047767816786488, "learning_rate": 1.9558586043160944e-05, "token_acc": 0.8594585832387746, "epoch": 1.3122818152967313, "step": 517}, {"loss": 0.48053622245788574, "grad_norm": 1.5017453573561992, "learning_rate": 1.9436976651092144e-05, "token_acc": 0.8554669169404036, "epoch": 1.3148206918438592, "step": 518}, {"loss": 0.4013400375843048, "grad_norm": 1.2658361060226122, "learning_rate": 1.931550559292597e-05, "token_acc": 0.8704970360237118, "epoch": 1.317359568390987, "step": 519}, {"loss": 0.43935462832450867, "grad_norm": 1.8447385702822394, "learning_rate": 1.919417588924394e-05, "token_acc": 0.8640745501285347, "epoch": 1.3198984449381148, "step": 520}, {"loss": 0.44726884365081787, "grad_norm": 1.6140562094589839, "learning_rate": 1.9072990557112564e-05, "token_acc": 0.8607212916855289, "epoch": 1.3224373214852427, "step": 521}, {"loss": 0.47654542326927185, "grad_norm": 2.727348058003196, "learning_rate": 1.895195261000831e-05, "token_acc": 0.8562250142775557, "epoch": 1.3249761980323707, "step": 522}, {"loss": 0.4838721752166748, "grad_norm": 1.7111060247682721, "learning_rate": 1.8831065057742657e-05, "token_acc": 0.8474853482349735, "epoch": 1.3275150745794986, "step": 523}, {"loss": 0.4641708731651306, "grad_norm": 1.1904717534818117, "learning_rate": 1.871033090638729e-05, "token_acc": 0.8535112359550562, "epoch": 1.3300539511266265, "step": 524}, {"loss": 0.42533761262893677, "grad_norm": 1.1848974404987074, "learning_rate": 1.858975315819929e-05, "token_acc": 0.8690002651816494, "epoch": 1.3325928276737544, "step": 525}, {"loss": 0.4110487699508667, "grad_norm": 3.787955396097398, "learning_rate": 1.8469334811546542e-05, "token_acc": 0.8647342995169082, "epoch": 1.3351317042208823, "step": 526}, {"loss": 0.42806491255760193, "grad_norm": 1.5655236026657533, "learning_rate": 1.8349078860833123e-05, "token_acc": 0.8654826029989809, "epoch": 1.3376705807680103, "step": 527}, {"loss": 0.43801093101501465, "grad_norm": 2.8998679857731413, "learning_rate": 1.8228988296424877e-05, "token_acc": 0.8696023941855494, "epoch": 1.340209457315138, "step": 528}, {"loss": 0.422304630279541, "grad_norm": 1.636297205622352, "learning_rate": 1.8109066104575023e-05, "token_acc": 0.8669064748201439, "epoch": 1.3427483338622659, "step": 529}, {"loss": 0.44057074189186096, "grad_norm": 1.3420918097116232, "learning_rate": 1.7989315267349936e-05, "token_acc": 0.8630622960124876, "epoch": 1.3452872104093938, "step": 530}, {"loss": 0.45155152678489685, "grad_norm": 2.1241693763789637, "learning_rate": 1.786973876255495e-05, "token_acc": 0.8607133207241286, "epoch": 1.3478260869565217, "step": 531}, {"loss": 0.43257462978363037, "grad_norm": 1.5304045614948183, "learning_rate": 1.7750339563660347e-05, "token_acc": 0.8637951105937136, "epoch": 1.3503649635036497, "step": 532}, {"loss": 0.4317207932472229, "grad_norm": 1.5985611897798757, "learning_rate": 1.7631120639727393e-05, "token_acc": 0.8642266824085005, "epoch": 1.3529038400507776, "step": 533}, {"loss": 0.4994572103023529, "grad_norm": 18.310832077778397, "learning_rate": 1.751208495533452e-05, "token_acc": 0.8442584844258484, "epoch": 1.3554427165979055, "step": 534}, {"loss": 0.43917202949523926, "grad_norm": 7.992790487896188, "learning_rate": 1.7393235470503594e-05, "token_acc": 0.8584739803094233, "epoch": 1.3579815931450332, "step": 535}, {"loss": 0.46626704931259155, "grad_norm": 2.4309869470711605, "learning_rate": 1.7274575140626318e-05, "token_acc": 0.8609659742576781, "epoch": 1.3605204696921613, "step": 536}, {"loss": 0.4859922230243683, "grad_norm": 1.4286614492442966, "learning_rate": 1.7156106916390742e-05, "token_acc": 0.8509760355499127, "epoch": 1.363059346239289, "step": 537}, {"loss": 0.5352718234062195, "grad_norm": 12.19485526753234, "learning_rate": 1.7037833743707892e-05, "token_acc": 0.8372653475393201, "epoch": 1.365598222786417, "step": 538}, {"loss": 0.4395660161972046, "grad_norm": 1.359902459346923, "learning_rate": 1.6919758563638504e-05, "token_acc": 0.8599110090426295, "epoch": 1.3681370993335449, "step": 539}, {"loss": 0.4254641532897949, "grad_norm": 2.3653688053773174, "learning_rate": 1.6801884312319895e-05, "token_acc": 0.8650124069478908, "epoch": 1.3706759758806728, "step": 540}, {"loss": 0.41960853338241577, "grad_norm": 1.6701485031120074, "learning_rate": 1.6684213920892954e-05, "token_acc": 0.8680320569902048, "epoch": 1.3732148524278007, "step": 541}, {"loss": 0.4190429449081421, "grad_norm": 1.1051014859233328, "learning_rate": 1.6566750315429254e-05, "token_acc": 0.8667908709827666, "epoch": 1.3757537289749286, "step": 542}, {"loss": 0.45707201957702637, "grad_norm": 1.4380751334871487, "learning_rate": 1.6449496416858284e-05, "token_acc": 0.8615271659324523, "epoch": 1.3782926055220566, "step": 543}, {"loss": 0.4892377257347107, "grad_norm": 3.9885703693887793, "learning_rate": 1.633245514089482e-05, "token_acc": 0.8495562130177515, "epoch": 1.3808314820691843, "step": 544}, {"loss": 0.406480073928833, "grad_norm": 17.032385872575972, "learning_rate": 1.621562939796643e-05, "token_acc": 0.8727165586328816, "epoch": 1.3833703586163124, "step": 545}, {"loss": 0.38652193546295166, "grad_norm": 4.979648086866017, "learning_rate": 1.609902209314108e-05, "token_acc": 0.878414234431091, "epoch": 1.3859092351634401, "step": 546}, {"loss": 0.4779953956604004, "grad_norm": 1.2121080853043547, "learning_rate": 1.5982636126054908e-05, "token_acc": 0.8547113289760349, "epoch": 1.388448111710568, "step": 547}, {"loss": 0.44981124997138977, "grad_norm": 1.5065420828046852, "learning_rate": 1.5866474390840125e-05, "token_acc": 0.8576479631053037, "epoch": 1.390986988257696, "step": 548}, {"loss": 0.44178125262260437, "grad_norm": 3.4688752703683976, "learning_rate": 1.575053977605303e-05, "token_acc": 0.8575572027070577, "epoch": 1.3935258648048239, "step": 549}, {"loss": 0.44523173570632935, "grad_norm": 1.6171169118006599, "learning_rate": 1.56348351646022e-05, "token_acc": 0.8633571309978416, "epoch": 1.3960647413519518, "step": 550}, {"loss": 0.4479164481163025, "grad_norm": 1.586112451088612, "learning_rate": 1.551936343367679e-05, "token_acc": 0.8625266262493856, "epoch": 1.3986036178990797, "step": 551}, {"loss": 0.4843277335166931, "grad_norm": 1.767169114419103, "learning_rate": 1.5404127454674995e-05, "token_acc": 0.8488859764089122, "epoch": 1.4011424944462076, "step": 552}, {"loss": 0.4229825437068939, "grad_norm": 1.4568503886378839, "learning_rate": 1.5289130093132632e-05, "token_acc": 0.8641706573791903, "epoch": 1.4036813709933353, "step": 553}, {"loss": 0.38800352811813354, "grad_norm": 1.5583360742463694, "learning_rate": 1.5174374208651912e-05, "token_acc": 0.8774544179523142, "epoch": 1.4062202475404633, "step": 554}, {"loss": 0.4089431166648865, "grad_norm": 1.3167806496310293, "learning_rate": 1.5059862654830298e-05, "token_acc": 0.8715203426124197, "epoch": 1.4087591240875912, "step": 555}, {"loss": 0.4339912533760071, "grad_norm": 1.4514359662418896, "learning_rate": 1.4945598279189565e-05, "token_acc": 0.8620784583620096, "epoch": 1.411298000634719, "step": 556}, {"loss": 0.4562704563140869, "grad_norm": 1.6651515172850537, "learning_rate": 1.4831583923104999e-05, "token_acc": 0.858122001370802, "epoch": 1.413836877181847, "step": 557}, {"loss": 0.40736958384513855, "grad_norm": 14.207475985132781, "learning_rate": 1.4717822421734718e-05, "token_acc": 0.8740584513407653, "epoch": 1.416375753728975, "step": 558}, {"loss": 0.3650285005569458, "grad_norm": 1.692438013357271, "learning_rate": 1.4604316603949186e-05, "token_acc": 0.8788610871440897, "epoch": 1.4189146302761029, "step": 559}, {"loss": 0.47478920221328735, "grad_norm": 2.6535952737736994, "learning_rate": 1.4491069292260868e-05, "token_acc": 0.8526717557251908, "epoch": 1.4214535068232308, "step": 560}, {"loss": 0.40597039461135864, "grad_norm": 19.04443327976999, "learning_rate": 1.4378083302754042e-05, "token_acc": 0.8681386077890217, "epoch": 1.4239923833703587, "step": 561}, {"loss": 0.4422416090965271, "grad_norm": 2.0378333351281386, "learning_rate": 1.4265361445014768e-05, "token_acc": 0.8635491960466145, "epoch": 1.4265312599174864, "step": 562}, {"loss": 0.436612606048584, "grad_norm": 2.044871674991076, "learning_rate": 1.4152906522061048e-05, "token_acc": 0.8649324662331166, "epoch": 1.4290701364646143, "step": 563}, {"loss": 0.45890551805496216, "grad_norm": 2.2315866852201003, "learning_rate": 1.4040721330273062e-05, "token_acc": 0.8538338658146964, "epoch": 1.4316090130117423, "step": 564}, {"loss": 0.46236127614974976, "grad_norm": 1.4472748890794247, "learning_rate": 1.3928808659323717e-05, "token_acc": 0.8577593360995851, "epoch": 1.4341478895588702, "step": 565}, {"loss": 0.42898571491241455, "grad_norm": 5.334866510249806, "learning_rate": 1.3817171292109183e-05, "token_acc": 0.8695944131077088, "epoch": 1.436686766105998, "step": 566}, {"loss": 0.4595816135406494, "grad_norm": 1.398192162767741, "learning_rate": 1.3705812004679797e-05, "token_acc": 0.8598717034925161, "epoch": 1.439225642653126, "step": 567}, {"loss": 0.3788098096847534, "grad_norm": 1.7375329727298936, "learning_rate": 1.3594733566170926e-05, "token_acc": 0.8798551678736011, "epoch": 1.441764519200254, "step": 568}, {"loss": 0.39907386898994446, "grad_norm": 1.2774126876702627, "learning_rate": 1.3483938738734198e-05, "token_acc": 0.8782964534707487, "epoch": 1.4443033957473816, "step": 569}, {"loss": 0.4483853578567505, "grad_norm": 2.2690969610790526, "learning_rate": 1.337343027746874e-05, "token_acc": 0.8679751719510149, "epoch": 1.4468422722945098, "step": 570}, {"loss": 0.4337015748023987, "grad_norm": 1.767412679641127, "learning_rate": 1.3263210930352737e-05, "token_acc": 0.866182405165456, "epoch": 1.4493811488416375, "step": 571}, {"loss": 0.44972699880599976, "grad_norm": 2.020777202559013, "learning_rate": 1.3153283438175034e-05, "token_acc": 0.8617665816326531, "epoch": 1.4519200253887654, "step": 572}, {"loss": 0.4027412533760071, "grad_norm": 1.3171148885726507, "learning_rate": 1.3043650534467053e-05, "token_acc": 0.8740135287485907, "epoch": 1.4544589019358933, "step": 573}, {"loss": 0.44188162684440613, "grad_norm": 1.413278248705783, "learning_rate": 1.2934314945434734e-05, "token_acc": 0.8614916286149162, "epoch": 1.4569977784830213, "step": 574}, {"loss": 0.4478895664215088, "grad_norm": 5.833884922458294, "learning_rate": 1.2825279389890817e-05, "token_acc": 0.8566862013851891, "epoch": 1.4595366550301492, "step": 575}, {"loss": 0.44952666759490967, "grad_norm": 1.9849253184994973, "learning_rate": 1.271654657918722e-05, "token_acc": 0.8655305964368707, "epoch": 1.462075531577277, "step": 576}, {"loss": 0.4790754020214081, "grad_norm": 1.5315197381415413, "learning_rate": 1.260811921714756e-05, "token_acc": 0.8557457212713936, "epoch": 1.464614408124405, "step": 577}, {"loss": 0.4595195949077606, "grad_norm": 2.1666096227689517, "learning_rate": 1.2500000000000006e-05, "token_acc": 0.8576657177714518, "epoch": 1.4671532846715327, "step": 578}, {"loss": 0.46253153681755066, "grad_norm": 1.7299272521309481, "learning_rate": 1.2392191616310148e-05, "token_acc": 0.8554183432773692, "epoch": 1.4696921612186609, "step": 579}, {"loss": 0.38790345191955566, "grad_norm": 3.1935857212226444, "learning_rate": 1.2284696746914216e-05, "token_acc": 0.8763918024850734, "epoch": 1.4722310377657886, "step": 580}, {"loss": 0.48343977332115173, "grad_norm": 2.4891023520531306, "learning_rate": 1.217751806485235e-05, "token_acc": 0.8529189923065319, "epoch": 1.4747699143129165, "step": 581}, {"loss": 0.48892277479171753, "grad_norm": 3.177945315387868, "learning_rate": 1.2070658235302181e-05, "token_acc": 0.8539147040101845, "epoch": 1.4773087908600444, "step": 582}, {"loss": 0.42535966634750366, "grad_norm": 1.5857930798647957, "learning_rate": 1.196411991551255e-05, "token_acc": 0.8711089494163424, "epoch": 1.4798476674071723, "step": 583}, {"loss": 0.48156630992889404, "grad_norm": 3.7111437583115316, "learning_rate": 1.185790575473738e-05, "token_acc": 0.8545431568305321, "epoch": 1.4823865439543003, "step": 584}, {"loss": 0.42791950702667236, "grad_norm": 1.7366290492440477, "learning_rate": 1.175201839416988e-05, "token_acc": 0.865335463258786, "epoch": 1.4849254205014282, "step": 585}, {"loss": 0.5193693041801453, "grad_norm": 1.7963881029673523, "learning_rate": 1.1646460466876783e-05, "token_acc": 0.8437993964650093, "epoch": 1.487464297048556, "step": 586}, {"loss": 0.49178972840309143, "grad_norm": 1.988412951732855, "learning_rate": 1.1541234597732947e-05, "token_acc": 0.8525784753363229, "epoch": 1.4900031735956838, "step": 587}, {"loss": 0.4512653350830078, "grad_norm": 9.176836375495418, "learning_rate": 1.1436343403356017e-05, "token_acc": 0.8604761904761905, "epoch": 1.492542050142812, "step": 588}, {"loss": 0.4031686782836914, "grad_norm": 2.971031706591444, "learning_rate": 1.133178949204141e-05, "token_acc": 0.8732302045097011, "epoch": 1.4950809266899396, "step": 589}, {"loss": 0.4282115697860718, "grad_norm": 1.651857378948217, "learning_rate": 1.122757546369744e-05, "token_acc": 0.8629955216453806, "epoch": 1.4976198032370676, "step": 590}, {"loss": 0.434163361787796, "grad_norm": 2.4954449061301864, "learning_rate": 1.1123703909780628e-05, "token_acc": 0.8638222464558343, "epoch": 1.5001586797841955, "step": 591}, {"loss": 0.45839256048202515, "grad_norm": 1.2601544635386799, "learning_rate": 1.1020177413231334e-05, "token_acc": 0.8634242200933432, "epoch": 1.5026975563313234, "step": 592}, {"loss": 0.5025709867477417, "grad_norm": 2.2375854968960875, "learning_rate": 1.0916998548409449e-05, "token_acc": 0.850828729281768, "epoch": 1.5052364328784513, "step": 593}, {"loss": 0.4569821357727051, "grad_norm": 1.319442700362402, "learning_rate": 1.0814169881030459e-05, "token_acc": 0.8591549295774648, "epoch": 1.507775309425579, "step": 594}, {"loss": 0.44513434171676636, "grad_norm": 1.9929190447195282, "learning_rate": 1.0711693968101564e-05, "token_acc": 0.8614449109598957, "epoch": 1.5103141859727072, "step": 595}, {"loss": 0.44361644983291626, "grad_norm": 1.881642036542598, "learning_rate": 1.0609573357858166e-05, "token_acc": 0.8606782768102658, "epoch": 1.5128530625198349, "step": 596}, {"loss": 0.4259661138057709, "grad_norm": 1.9838343655923574, "learning_rate": 1.0507810589700445e-05, "token_acc": 0.8694739997002847, "epoch": 1.515391939066963, "step": 597}, {"loss": 0.4639781713485718, "grad_norm": 4.829259494993677, "learning_rate": 1.0406408194130259e-05, "token_acc": 0.8590412909349786, "epoch": 1.5179308156140907, "step": 598}, {"loss": 0.40976643562316895, "grad_norm": 1.177744266394994, "learning_rate": 1.0305368692688174e-05, "token_acc": 0.8727062563213408, "epoch": 1.5204696921612186, "step": 599}, {"loss": 0.3980882167816162, "grad_norm": 1.824261035759033, "learning_rate": 1.0204694597890812e-05, "token_acc": 0.8739591836734694, "epoch": 1.5230085687083466, "step": 600}, {"loss": 0.4560452699661255, "grad_norm": 2.4861898678492875, "learning_rate": 1.010438841316831e-05, "token_acc": 0.8610804851157663, "epoch": 1.5255474452554745, "step": 601}, {"loss": 0.41717058420181274, "grad_norm": 1.6031601811839713, "learning_rate": 1.0004452632802158e-05, "token_acc": 0.8684555928248505, "epoch": 1.5280863218026024, "step": 602}, {"loss": 0.4804377555847168, "grad_norm": 1.2064594649724982, "learning_rate": 9.90488974186306e-06, "token_acc": 0.8492275698158052, "epoch": 1.53062519834973, "step": 603}, {"loss": 0.5097688436508179, "grad_norm": 1.2672495489324482, "learning_rate": 9.805702216149251e-06, "token_acc": 0.8502415458937198, "epoch": 1.5331640748968582, "step": 604}, {"loss": 0.47695496678352356, "grad_norm": 4.053034491495449, "learning_rate": 9.706892522124839e-06, "token_acc": 0.8586020720852181, "epoch": 1.535702951443986, "step": 605}, {"loss": 0.4402783513069153, "grad_norm": 4.465741013251589, "learning_rate": 9.608463116858542e-06, "token_acc": 0.8638701382192221, "epoch": 1.538241827991114, "step": 606}, {"loss": 0.44809940457344055, "grad_norm": 2.100444839862141, "learning_rate": 9.510416447962544e-06, "token_acc": 0.8649390767118585, "epoch": 1.5407807045382418, "step": 607}, {"loss": 0.402049720287323, "grad_norm": 1.5950345297195268, "learning_rate": 9.412754953531663e-06, "token_acc": 0.8729817007534983, "epoch": 1.5433195810853697, "step": 608}, {"loss": 0.45930030941963196, "grad_norm": 1.9379983192487504, "learning_rate": 9.315481062082687e-06, "token_acc": 0.8534591194968554, "epoch": 1.5458584576324976, "step": 609}, {"loss": 0.4582301676273346, "grad_norm": 1.6436723545662089, "learning_rate": 9.21859719249403e-06, "token_acc": 0.8593083846518238, "epoch": 1.5483973341796256, "step": 610}, {"loss": 0.42741185426712036, "grad_norm": 1.5694932995169957, "learning_rate": 9.122105753945531e-06, "token_acc": 0.8661592134475103, "epoch": 1.5509362107267535, "step": 611}, {"loss": 0.3978237509727478, "grad_norm": 1.2677907142399418, "learning_rate": 9.026009145858607e-06, "token_acc": 0.8717145343777197, "epoch": 1.5534750872738812, "step": 612}, {"loss": 0.3929862380027771, "grad_norm": 1.7909513896650815, "learning_rate": 8.930309757836517e-06, "token_acc": 0.8780487804878049, "epoch": 1.5560139638210093, "step": 613}, {"loss": 0.4144135117530823, "grad_norm": 2.1671678126879192, "learning_rate": 8.835009969605012e-06, "token_acc": 0.8640829694323144, "epoch": 1.558552840368137, "step": 614}, {"loss": 0.44686853885650635, "grad_norm": 4.708681225228973, "learning_rate": 8.740112150953095e-06, "token_acc": 0.8602134375469713, "epoch": 1.5610917169152652, "step": 615}, {"loss": 0.4374513030052185, "grad_norm": 2.694424425912483, "learning_rate": 8.645618661674142e-06, "token_acc": 0.8667699457784663, "epoch": 1.5636305934623929, "step": 616}, {"loss": 0.4310656189918518, "grad_norm": 8.526048424431572, "learning_rate": 8.551531851507186e-06, "token_acc": 0.8675113405287033, "epoch": 1.5661694700095208, "step": 617}, {"loss": 0.5003854036331177, "grad_norm": 1.3330352300976973, "learning_rate": 8.45785406007852e-06, "token_acc": 0.847457627118644, "epoch": 1.5687083465566487, "step": 618}, {"loss": 0.4497206211090088, "grad_norm": 4.976416729285302, "learning_rate": 8.364587616843477e-06, "token_acc": 0.8669887278582931, "epoch": 1.5712472231037766, "step": 619}, {"loss": 0.4438425302505493, "grad_norm": 1.328053676437707, "learning_rate": 8.271734841028553e-06, "token_acc": 0.8648385526529287, "epoch": 1.5737860996509045, "step": 620}, {"loss": 0.42214319109916687, "grad_norm": 18.013475899545398, "learning_rate": 8.17929804157367e-06, "token_acc": 0.8670833333333333, "epoch": 1.5763249761980322, "step": 621}, {"loss": 0.41414207220077515, "grad_norm": 1.3143009672659078, "learning_rate": 8.08727951707487e-06, "token_acc": 0.868986529826812, "epoch": 1.5788638527451604, "step": 622}, {"loss": 0.42111027240753174, "grad_norm": 2.7221474239289822, "learning_rate": 7.99568155572701e-06, "token_acc": 0.8662572500852951, "epoch": 1.581402729292288, "step": 623}, {"loss": 0.43198782205581665, "grad_norm": 1.5392077956981898, "learning_rate": 7.904506435266998e-06, "token_acc": 0.8656245065529765, "epoch": 1.583941605839416, "step": 624}, {"loss": 0.3983515501022339, "grad_norm": 1.449572952125542, "learning_rate": 7.813756422917046e-06, "token_acc": 0.8759147828915271, "epoch": 1.586480482386544, "step": 625}, {"loss": 0.4601841866970062, "grad_norm": 2.557129100686671, "learning_rate": 7.723433775328384e-06, "token_acc": 0.8575240919199407, "epoch": 1.5890193589336719, "step": 626}, {"loss": 0.46355000138282776, "grad_norm": 1.410335769896056, "learning_rate": 7.633540738525066e-06, "token_acc": 0.8606245239908606, "epoch": 1.5915582354807998, "step": 627}, {"loss": 0.35412007570266724, "grad_norm": 2.3461604442237443, "learning_rate": 7.5440795478481815e-06, "token_acc": 0.8864518306057028, "epoch": 1.5940971120279275, "step": 628}, {"loss": 0.4599078595638275, "grad_norm": 1.7143044424108447, "learning_rate": 7.455052427900213e-06, "token_acc": 0.858727378867484, "epoch": 1.5966359885750556, "step": 629}, {"loss": 0.4420662522315979, "grad_norm": 2.6729291996865556, "learning_rate": 7.366461592489782e-06, "token_acc": 0.8678435114503816, "epoch": 1.5991748651221833, "step": 630}, {"loss": 0.4172115623950958, "grad_norm": 1.7421105240693378, "learning_rate": 7.278309244576526e-06, "token_acc": 0.8718300205620287, "epoch": 1.6017137416693115, "step": 631}, {"loss": 0.4470146894454956, "grad_norm": 5.808548468818688, "learning_rate": 7.190597576216385e-06, "token_acc": 0.8587673038892552, "epoch": 1.6042526182164392, "step": 632}, {"loss": 0.39006733894348145, "grad_norm": 1.501385308932159, "learning_rate": 7.103328768507039e-06, "token_acc": 0.8735427461139896, "epoch": 1.606791494763567, "step": 633}, {"loss": 0.42773884534835815, "grad_norm": 2.5341252686226583, "learning_rate": 7.016504991533726e-06, "token_acc": 0.8643475366178429, "epoch": 1.609330371310695, "step": 634}, {"loss": 0.4322446882724762, "grad_norm": 9.109577297686016, "learning_rate": 6.930128404315214e-06, "token_acc": 0.866756167142138, "epoch": 1.611869247857823, "step": 635}, {"loss": 0.4075253903865814, "grad_norm": 2.8982200371462725, "learning_rate": 6.844201154750177e-06, "token_acc": 0.8719616039634618, "epoch": 1.6144081244049509, "step": 636}, {"loss": 0.42523565888404846, "grad_norm": 2.4476071961529473, "learning_rate": 6.758725379563729e-06, "token_acc": 0.8710596914822267, "epoch": 1.6169470009520786, "step": 637}, {"loss": 0.4927784204483032, "grad_norm": 3.952901868685563, "learning_rate": 6.673703204254347e-06, "token_acc": 0.8524006268699245, "epoch": 1.6194858774992067, "step": 638}, {"loss": 0.45517563819885254, "grad_norm": 1.9925103239226836, "learning_rate": 6.589136743040955e-06, "token_acc": 0.8612017400761284, "epoch": 1.6220247540463344, "step": 639}, {"loss": 0.43744373321533203, "grad_norm": 5.231140628017069, "learning_rate": 6.505028098810406e-06, "token_acc": 0.8593057042361217, "epoch": 1.6245636305934625, "step": 640}, {"loss": 0.48253944516181946, "grad_norm": 1.3524404530982062, "learning_rate": 6.421379363065142e-06, "token_acc": 0.8524788391777509, "epoch": 1.6271025071405902, "step": 641}, {"loss": 0.4024979770183563, "grad_norm": 2.0130605650206963, "learning_rate": 6.338192615871247e-06, "token_acc": 0.8751388227828019, "epoch": 1.6296413836877182, "step": 642}, {"loss": 0.3890977203845978, "grad_norm": 3.8621192074051556, "learning_rate": 6.255469925806643e-06, "token_acc": 0.8722797003210846, "epoch": 1.632180260234846, "step": 643}, {"loss": 0.40084201097488403, "grad_norm": 1.6599106938742667, "learning_rate": 6.173213349909729e-06, "token_acc": 0.8785992217898833, "epoch": 1.634719136781974, "step": 644}, {"loss": 0.4719259738922119, "grad_norm": 1.2846213190178855, "learning_rate": 6.091424933628159e-06, "token_acc": 0.8553555080866646, "epoch": 1.637258013329102, "step": 645}, {"loss": 0.43028050661087036, "grad_norm": 1.7252300824422093, "learning_rate": 6.010106710768052e-06, "token_acc": 0.8588945481984531, "epoch": 1.6397968898762296, "step": 646}, {"loss": 0.4257124662399292, "grad_norm": 1.7252627976692818, "learning_rate": 5.9292607034433375e-06, "token_acc": 0.8627259404005863, "epoch": 1.6423357664233578, "step": 647}, {"loss": 0.4690347909927368, "grad_norm": 2.6645530077871546, "learning_rate": 5.848888922025553e-06, "token_acc": 0.8566015738851647, "epoch": 1.6448746429704855, "step": 648}, {"loss": 0.4059619903564453, "grad_norm": 3.2780898962364864, "learning_rate": 5.768993365093783e-06, "token_acc": 0.8718351942129265, "epoch": 1.6474135195176136, "step": 649}, {"loss": 0.44327762722969055, "grad_norm": 2.8838630249451653, "learning_rate": 5.689576019385015e-06, "token_acc": 0.8564371719666564, "epoch": 1.6499523960647413, "step": 650}, {"loss": 0.4271925687789917, "grad_norm": 25.182915532896892, "learning_rate": 5.610638859744693e-06, "token_acc": 0.8661558526247147, "epoch": 1.6524912726118692, "step": 651}, {"loss": 0.46068426966667175, "grad_norm": 1.5779086626122172, "learning_rate": 5.532183849077652e-06, "token_acc": 0.8604612018178758, "epoch": 1.6550301491589972, "step": 652}, {"loss": 0.451456218957901, "grad_norm": 1.693357004070117, "learning_rate": 5.454212938299255e-06, "token_acc": 0.8634725142685491, "epoch": 1.657569025706125, "step": 653}, {"loss": 0.43730106949806213, "grad_norm": 8.514820092384175, "learning_rate": 5.376728066286943e-06, "token_acc": 0.8636299335125195, "epoch": 1.660107902253253, "step": 654}, {"loss": 0.41232720017433167, "grad_norm": 1.111931988912096, "learning_rate": 5.299731159831953e-06, "token_acc": 0.8704655812624964, "epoch": 1.6626467788003807, "step": 655}, {"loss": 0.46359729766845703, "grad_norm": 2.634292237533276, "learning_rate": 5.223224133591476e-06, "token_acc": 0.8527910932426164, "epoch": 1.6651856553475088, "step": 656}, {"loss": 0.4276030361652374, "grad_norm": 5.059923947440153, "learning_rate": 5.147208890040975e-06, "token_acc": 0.8669181034482759, "epoch": 1.6677245318946365, "step": 657}, {"loss": 0.4615190625190735, "grad_norm": 1.6527985205614077, "learning_rate": 5.071687319426946e-06, "token_acc": 0.8562792806407737, "epoch": 1.6702634084417647, "step": 658}, {"loss": 0.43903154134750366, "grad_norm": 4.504539765572017, "learning_rate": 4.996661299719846e-06, "token_acc": 0.8628378378378379, "epoch": 1.6728022849888924, "step": 659}, {"loss": 0.48397350311279297, "grad_norm": 1.7117325712294194, "learning_rate": 4.922132696567464e-06, "token_acc": 0.8517076845806127, "epoch": 1.6753411615360203, "step": 660}, {"loss": 0.4164693355560303, "grad_norm": 2.4283538134736293, "learning_rate": 4.8481033632484464e-06, "token_acc": 0.8711068519405846, "epoch": 1.6778800380831482, "step": 661}, {"loss": 0.4900897741317749, "grad_norm": 1.2528673067956313, "learning_rate": 4.7745751406263165e-06, "token_acc": 0.8495370370370371, "epoch": 1.6804189146302762, "step": 662}, {"loss": 0.4142399728298187, "grad_norm": 1.5210322880049643, "learning_rate": 4.701549857103588e-06, "token_acc": 0.8718934911242604, "epoch": 1.682957791177404, "step": 663}, {"loss": 0.4212270677089691, "grad_norm": 1.3712029731634767, "learning_rate": 4.629029328576381e-06, "token_acc": 0.8674501636417733, "epoch": 1.6854966677245318, "step": 664}, {"loss": 0.39592063426971436, "grad_norm": 1.590593266989074, "learning_rate": 4.5570153583892165e-06, "token_acc": 0.8769955906948457, "epoch": 1.68803554427166, "step": 665}, {"loss": 0.4617067575454712, "grad_norm": 1.8309798554500323, "learning_rate": 4.4855097372902135e-06, "token_acc": 0.8591635916359164, "epoch": 1.6905744208187876, "step": 666}, {"loss": 0.44668224453926086, "grad_norm": 1.0905142063588467, "learning_rate": 4.41451424338652e-06, "token_acc": 0.8633254015466983, "epoch": 1.6931132973659155, "step": 667}, {"loss": 0.4766824245452881, "grad_norm": 2.896217519377637, "learning_rate": 4.344030642100133e-06, "token_acc": 0.8560614882962618, "epoch": 1.6956521739130435, "step": 668}, {"loss": 0.44002464413642883, "grad_norm": 1.5035325936138646, "learning_rate": 4.274060686123959e-06, "token_acc": 0.8666061705989111, "epoch": 1.6981910504601714, "step": 669}, {"loss": 0.4330123960971832, "grad_norm": 1.1311132458603954, "learning_rate": 4.204606115378282e-06, "token_acc": 0.8573323685479981, "epoch": 1.7007299270072993, "step": 670}, {"loss": 0.4757775366306305, "grad_norm": 2.001085120015709, "learning_rate": 4.135668656967434e-06, "token_acc": 0.8538387847269742, "epoch": 1.703268803554427, "step": 671}, {"loss": 0.4560514986515045, "grad_norm": 3.131879855652598, "learning_rate": 4.067250025136921e-06, "token_acc": 0.8587115666178624, "epoch": 1.7058076801015551, "step": 672}, {"loss": 0.48498058319091797, "grad_norm": 3.243793366725845, "learning_rate": 3.9993519212307154e-06, "token_acc": 0.8464744703021883, "epoch": 1.7083465566486828, "step": 673}, {"loss": 0.4820587933063507, "grad_norm": 1.8349332605705886, "learning_rate": 3.931976033649021e-06, "token_acc": 0.8574167922202438, "epoch": 1.710885433195811, "step": 674}, {"loss": 0.40726059675216675, "grad_norm": 1.351981900157725, "learning_rate": 3.86512403780625e-06, "token_acc": 0.8761935588282894, "epoch": 1.7134243097429387, "step": 675}, {"loss": 0.4622320532798767, "grad_norm": 2.3240652003253173, "learning_rate": 3.798797596089351e-06, "token_acc": 0.8597043095312992, "epoch": 1.7159631862900666, "step": 676}, {"loss": 0.433416485786438, "grad_norm": 3.134466385053714, "learning_rate": 3.732998357816514e-06, "token_acc": 0.8626889419252187, "epoch": 1.7185020628371945, "step": 677}, {"loss": 0.40910568833351135, "grad_norm": 3.126205495024486, "learning_rate": 3.66772795919611e-06, "token_acc": 0.8706845238095238, "epoch": 1.7210409393843225, "step": 678}, {"loss": 0.48174020648002625, "grad_norm": 2.662738301930067, "learning_rate": 3.6029880232860413e-06, "token_acc": 0.851764705882353, "epoch": 1.7235798159314504, "step": 679}, {"loss": 0.39522039890289307, "grad_norm": 1.6393237243792689, "learning_rate": 3.5387801599533475e-06, "token_acc": 0.8741348784806052, "epoch": 1.726118692478578, "step": 680}, {"loss": 0.47784876823425293, "grad_norm": 2.70788924806579, "learning_rate": 3.4751059658342105e-06, "token_acc": 0.8528927885933644, "epoch": 1.7286575690257062, "step": 681}, {"loss": 0.3826233744621277, "grad_norm": 2.820200992606637, "learning_rate": 3.41196702429423e-06, "token_acc": 0.8822283759569962, "epoch": 1.731196445572834, "step": 682}, {"loss": 0.44565722346305847, "grad_norm": 1.307789139772657, "learning_rate": 3.3493649053890326e-06, "token_acc": 0.8606760098928277, "epoch": 1.733735322119962, "step": 683}, {"loss": 0.45349833369255066, "grad_norm": 1.982089557516867, "learning_rate": 3.2873011658252796e-06, "token_acc": 0.8590145257761321, "epoch": 1.7362741986670898, "step": 684}, {"loss": 0.4516002833843231, "grad_norm": 1.2355749205318602, "learning_rate": 3.225777348921899e-06, "token_acc": 0.8644168146832445, "epoch": 1.7388130752142177, "step": 685}, {"loss": 0.4385417103767395, "grad_norm": 1.794396532306371, "learning_rate": 3.164794984571759e-06, "token_acc": 0.863161039737078, "epoch": 1.7413519517613456, "step": 686}, {"loss": 0.47738581895828247, "grad_norm": 1.3932099565380185, "learning_rate": 3.1043555892035865e-06, "token_acc": 0.8537170263788969, "epoch": 1.7438908283084735, "step": 687}, {"loss": 0.4527597725391388, "grad_norm": 2.276337589217584, "learning_rate": 3.044460665744284e-06, "token_acc": 0.859869325997249, "epoch": 1.7464297048556015, "step": 688}, {"loss": 0.362637996673584, "grad_norm": 1.5410789525322917, "learning_rate": 2.98511170358155e-06, "token_acc": 0.8799796575690795, "epoch": 1.7489685814027291, "step": 689}, {"loss": 0.4314054846763611, "grad_norm": 1.5215647982798974, "learning_rate": 2.9263101785268254e-06, "token_acc": 0.8690420378184092, "epoch": 1.7515074579498573, "step": 690}, {"loss": 0.4486577808856964, "grad_norm": 1.774390329095064, "learning_rate": 2.8680575527786247e-06, "token_acc": 0.8656532456861133, "epoch": 1.754046334496985, "step": 691}, {"loss": 0.41996461153030396, "grad_norm": 1.3388386880862562, "learning_rate": 2.8103552748861476e-06, "token_acc": 0.8718206638884898, "epoch": 1.7565852110441131, "step": 692}, {"loss": 0.4188646376132965, "grad_norm": 1.3389406554357517, "learning_rate": 2.7532047797132867e-06, "token_acc": 0.8667355371900827, "epoch": 1.7591240875912408, "step": 693}, {"loss": 0.4410921335220337, "grad_norm": 1.156002235003077, "learning_rate": 2.6966074884029164e-06, "token_acc": 0.865283540802213, "epoch": 1.7616629641383688, "step": 694}, {"loss": 0.4875490963459015, "grad_norm": 2.061855392222814, "learning_rate": 2.6405648083415834e-06, "token_acc": 0.8523312456506611, "epoch": 1.7642018406854967, "step": 695}, {"loss": 0.4236608147621155, "grad_norm": 1.2947706686947225, "learning_rate": 2.58507813312448e-06, "token_acc": 0.8694029850746269, "epoch": 1.7667407172326246, "step": 696}, {"loss": 0.4632965922355652, "grad_norm": 2.4268079188473766, "learning_rate": 2.5301488425208296e-06, "token_acc": 0.8577529082609335, "epoch": 1.7692795937797525, "step": 697}, {"loss": 0.4632093608379364, "grad_norm": 15.351053657190288, "learning_rate": 2.475778302439524e-06, "token_acc": 0.857186127517795, "epoch": 1.7718184703268802, "step": 698}, {"loss": 0.4644908905029297, "grad_norm": 1.233450519862793, "learning_rate": 2.421967864895211e-06, "token_acc": 0.8622404211757824, "epoch": 1.7743573468740084, "step": 699}, {"loss": 0.5130558609962463, "grad_norm": 1.1609373101377098, "learning_rate": 2.3687188679746315e-06, "token_acc": 0.8425488443366109, "epoch": 1.776896223421136, "step": 700}, {"loss": 0.4497196078300476, "grad_norm": 1.5822630142900636, "learning_rate": 2.316032635803378e-06, "token_acc": 0.8579769878069724, "epoch": 1.779435099968264, "step": 701}, {"loss": 0.4693135619163513, "grad_norm": 1.570413179886022, "learning_rate": 2.2639104785129455e-06, "token_acc": 0.8559370529327611, "epoch": 1.781973976515392, "step": 702}, {"loss": 0.4473997950553894, "grad_norm": 3.061251657790942, "learning_rate": 2.212353692208172e-06, "token_acc": 0.8591812468150162, "epoch": 1.7845128530625198, "step": 703}, {"loss": 0.4503086805343628, "grad_norm": 2.948308520618527, "learning_rate": 2.1613635589349756e-06, "token_acc": 0.8623773802654356, "epoch": 1.7870517296096478, "step": 704}, {"loss": 0.4229254126548767, "grad_norm": 1.913650702279099, "learning_rate": 2.1109413466485234e-06, "token_acc": 0.8654380576276145, "epoch": 1.7895906061567757, "step": 705}, {"loss": 0.41494959592819214, "grad_norm": 1.577758527103726, "learning_rate": 2.0610883091816525e-06, "token_acc": 0.8632981484685932, "epoch": 1.7921294827039036, "step": 706}, {"loss": 0.39806830883026123, "grad_norm": 28.453997574496324, "learning_rate": 2.0118056862137357e-06, "token_acc": 0.8761904761904762, "epoch": 1.7946683592510313, "step": 707}, {"loss": 0.47827813029289246, "grad_norm": 1.442011622440876, "learning_rate": 1.9630947032398067e-06, "token_acc": 0.8559821570814083, "epoch": 1.7972072357981594, "step": 708}, {"loss": 0.41705846786499023, "grad_norm": 1.3684845981941494, "learning_rate": 1.9149565715401415e-06, "token_acc": 0.8656061437191442, "epoch": 1.7997461123452871, "step": 709}, {"loss": 0.4175983667373657, "grad_norm": 1.40488381846196, "learning_rate": 1.8673924881500826e-06, "token_acc": 0.8665089557282866, "epoch": 1.802284988892415, "step": 710}, {"loss": 0.37564218044281006, "grad_norm": 1.6524874244872123, "learning_rate": 1.8204036358303173e-06, "token_acc": 0.8825536062378168, "epoch": 1.804823865439543, "step": 711}, {"loss": 0.41721421480178833, "grad_norm": 1.4366556315978845, "learning_rate": 1.773991183037435e-06, "token_acc": 0.8702656868287167, "epoch": 1.807362741986671, "step": 712}, {"loss": 0.39479967951774597, "grad_norm": 1.658222363219091, "learning_rate": 1.7281562838948966e-06, "token_acc": 0.8711364717070851, "epoch": 1.8099016185337988, "step": 713}, {"loss": 0.4703880250453949, "grad_norm": 2.089415658710758, "learning_rate": 1.6829000781643094e-06, "token_acc": 0.8586910626319494, "epoch": 1.8124404950809265, "step": 714}, {"loss": 0.502145528793335, "grad_norm": 2.2836604994483953, "learning_rate": 1.638223691217114e-06, "token_acc": 0.8485543827443781, "epoch": 1.8149793716280547, "step": 715}, {"loss": 0.43437492847442627, "grad_norm": 1.8788922029695805, "learning_rate": 1.59412823400657e-06, "token_acc": 0.8597447073474471, "epoch": 1.8175182481751824, "step": 716}, {"loss": 0.503593385219574, "grad_norm": 1.9928854925573405, "learning_rate": 1.5506148030401596e-06, "token_acc": 0.8448118932038835, "epoch": 1.8200571247223105, "step": 717}, {"loss": 0.43502116203308105, "grad_norm": 1.8750971097385831, "learning_rate": 1.5076844803522922e-06, "token_acc": 0.8666423756604117, "epoch": 1.8225960012694382, "step": 718}, {"loss": 0.4320788085460663, "grad_norm": 1.4504406407026815, "learning_rate": 1.465338333477423e-06, "token_acc": 0.8646112600536193, "epoch": 1.8251348778165661, "step": 719}, {"loss": 0.40384840965270996, "grad_norm": 1.90977553356785, "learning_rate": 1.4235774154234855e-06, "token_acc": 0.8733692569483834, "epoch": 1.827673754363694, "step": 720}, {"loss": 0.3967495858669281, "grad_norm": 6.19991714045044, "learning_rate": 1.3824027646457376e-06, "token_acc": 0.8748278500382556, "epoch": 1.830212630910822, "step": 721}, {"loss": 0.4520436227321625, "grad_norm": 2.002447851723243, "learning_rate": 1.3418154050208936e-06, "token_acc": 0.8591839740757107, "epoch": 1.83275150745795, "step": 722}, {"loss": 0.45737043023109436, "grad_norm": 6.098683471560786, "learning_rate": 1.3018163458217076e-06, "token_acc": 0.8586900464156781, "epoch": 1.8352903840050776, "step": 723}, {"loss": 0.4802631735801697, "grad_norm": 1.2867812390877849, "learning_rate": 1.2624065816918413e-06, "token_acc": 0.8534614848864744, "epoch": 1.8378292605522057, "step": 724}, {"loss": 0.47273802757263184, "grad_norm": 3.1957168567594025, "learning_rate": 1.2235870926211619e-06, "token_acc": 0.8561225814829243, "epoch": 1.8403681370993334, "step": 725}, {"loss": 0.48560330271720886, "grad_norm": 3.280293947027647, "learning_rate": 1.1853588439213442e-06, "token_acc": 0.8526057456330302, "epoch": 1.8429070136464616, "step": 726}, {"loss": 0.45862627029418945, "grad_norm": 2.2792470189790377, "learning_rate": 1.1477227862018936e-06, "token_acc": 0.8571593533487298, "epoch": 1.8454458901935893, "step": 727}, {"loss": 0.42885905504226685, "grad_norm": 1.5587404762398274, "learning_rate": 1.1106798553464804e-06, "token_acc": 0.8708909004287756, "epoch": 1.8479847667407172, "step": 728}, {"loss": 0.4785131812095642, "grad_norm": 3.06823799070072, "learning_rate": 1.0742309724896925e-06, "token_acc": 0.8561222794484133, "epoch": 1.8505236432878451, "step": 729}, {"loss": 0.3938445448875427, "grad_norm": 1.8989534799725791, "learning_rate": 1.038377043994107e-06, "token_acc": 0.879425346331452, "epoch": 1.853062519834973, "step": 730}, {"loss": 0.40233713388442993, "grad_norm": 1.2724853752055847, "learning_rate": 1.0031189614277765e-06, "token_acc": 0.8721188321666382, "epoch": 1.855601396382101, "step": 731}, {"loss": 0.40896981954574585, "grad_norm": 1.2336935005972807, "learning_rate": 9.684576015420278e-07, "token_acc": 0.8702893674293405, "epoch": 1.8581402729292287, "step": 732}, {"loss": 0.4635767340660095, "grad_norm": 2.4052171825994617, "learning_rate": 9.343938262496993e-07, "token_acc": 0.8580862723057469, "epoch": 1.8606791494763568, "step": 733}, {"loss": 0.45178261399269104, "grad_norm": 1.4002855058918304, "learning_rate": 9.009284826036691e-07, "token_acc": 0.8653539887071088, "epoch": 1.8632180260234845, "step": 734}, {"loss": 0.3883354067802429, "grad_norm": 1.9242594727542799, "learning_rate": 8.680624027758183e-07, "token_acc": 0.8772727272727273, "epoch": 1.8657569025706127, "step": 735}, {"loss": 0.49033722281455994, "grad_norm": 1.3147653580408487, "learning_rate": 8.357964040363209e-07, "token_acc": 0.8530385277373229, "epoch": 1.8682957791177404, "step": 736}, {"loss": 0.39452701807022095, "grad_norm": 2.0201488165176626, "learning_rate": 8.041312887333397e-07, "token_acc": 0.8727473917167247, "epoch": 1.8708346556648683, "step": 737}, {"loss": 0.4112352132797241, "grad_norm": 1.3190322958534526, "learning_rate": 7.730678442730538e-07, "token_acc": 0.872272330520803, "epoch": 1.8733735322119962, "step": 738}, {"loss": 0.47771161794662476, "grad_norm": 1.479059054445775, "learning_rate": 7.426068431000882e-07, "token_acc": 0.8543046357615894, "epoch": 1.8759124087591241, "step": 739}, {"loss": 0.4562588930130005, "grad_norm": 3.4561592643709336, "learning_rate": 7.127490426783123e-07, "token_acc": 0.858059232973932, "epoch": 1.878451285306252, "step": 740}, {"loss": 0.36923718452453613, "grad_norm": 8.34125855841703, "learning_rate": 6.834951854719967e-07, "token_acc": 0.8817420435510888, "epoch": 1.8809901618533797, "step": 741}, {"loss": 0.5273791551589966, "grad_norm": 1.9715995397748214, "learning_rate": 6.54845998927342e-07, "token_acc": 0.8440740254626592, "epoch": 1.883529038400508, "step": 742}, {"loss": 0.384202778339386, "grad_norm": 1.5441467522187071, "learning_rate": 6.268021954544096e-07, "token_acc": 0.8818364733857692, "epoch": 1.8860679149476356, "step": 743}, {"loss": 0.3963943123817444, "grad_norm": 2.505114100587592, "learning_rate": 5.993644724093888e-07, "token_acc": 0.876434522873762, "epoch": 1.8886067914947635, "step": 744}, {"loss": 0.4003443121910095, "grad_norm": 1.2437997984902442, "learning_rate": 5.725335120772696e-07, "token_acc": 0.8710174717368961, "epoch": 1.8911456680418914, "step": 745}, {"loss": 0.4340510666370392, "grad_norm": 1.331827463412106, "learning_rate": 5.463099816548579e-07, "token_acc": 0.8663381582999692, "epoch": 1.8936845445890194, "step": 746}, {"loss": 0.3998247981071472, "grad_norm": 1.4190786443096997, "learning_rate": 5.206945332342145e-07, "token_acc": 0.8734725444702243, "epoch": 1.8962234211361473, "step": 747}, {"loss": 0.4874383211135864, "grad_norm": 2.094766604152409, "learning_rate": 4.956878037864043e-07, "token_acc": 0.8549134734239803, "epoch": 1.8987622976832752, "step": 748}, {"loss": 0.4122732877731323, "grad_norm": 1.5313508891126637, "learning_rate": 4.712904151456865e-07, "token_acc": 0.8685121107266436, "epoch": 1.9013011742304031, "step": 749}, {"loss": 0.4453129172325134, "grad_norm": 1.5749655783074934, "learning_rate": 4.475029739940295e-07, "token_acc": 0.8643138598595169, "epoch": 1.9038400507775308, "step": 750}, {"loss": 0.40033698081970215, "grad_norm": 2.959955749655575, "learning_rate": 4.2432607184604565e-07, "token_acc": 0.8760588497547926, "epoch": 1.906378927324659, "step": 751}, {"loss": 0.4652397632598877, "grad_norm": 3.4980328358387327, "learning_rate": 4.0176028503425835e-07, "token_acc": 0.8624653739612188, "epoch": 1.9089178038717867, "step": 752}, {"loss": 0.48083657026290894, "grad_norm": 1.6458184889356613, "learning_rate": 3.7980617469479953e-07, "token_acc": 0.8546286031042128, "epoch": 1.9114566804189146, "step": 753}, {"loss": 0.4572162330150604, "grad_norm": 1.738583203352863, "learning_rate": 3.5846428675342657e-07, "token_acc": 0.8617322388904614, "epoch": 1.9139955569660425, "step": 754}, {"loss": 0.3839995265007019, "grad_norm": 1.7105542002101852, "learning_rate": 3.377351519119665e-07, "token_acc": 0.8739065852450899, "epoch": 1.9165344335131704, "step": 755}, {"loss": 0.520811915397644, "grad_norm": 1.4566722190683363, "learning_rate": 3.1761928563510955e-07, "token_acc": 0.8475528611562916, "epoch": 1.9190733100602984, "step": 756}, {"loss": 0.42392557859420776, "grad_norm": 4.930881181951258, "learning_rate": 2.981171881376005e-07, "token_acc": 0.867098133654425, "epoch": 1.921612186607426, "step": 757}, {"loss": 0.39813119173049927, "grad_norm": 2.5750669305229668, "learning_rate": 2.7922934437178695e-07, "token_acc": 0.8691693290734824, "epoch": 1.9241510631545542, "step": 758}, {"loss": 0.4481539726257324, "grad_norm": 1.6090625449278606, "learning_rate": 2.609562240155766e-07, "token_acc": 0.8580213420148309, "epoch": 1.926689939701682, "step": 759}, {"loss": 0.4191648066043854, "grad_norm": 3.2842110887604528, "learning_rate": 2.4329828146074095e-07, "token_acc": 0.8669804741980475, "epoch": 1.92922881624881, "step": 760}, {"loss": 0.444943904876709, "grad_norm": 1.534636834190371, "learning_rate": 2.262559558016325e-07, "token_acc": 0.8616028323141294, "epoch": 1.9317676927959377, "step": 761}, {"loss": 0.4380544424057007, "grad_norm": 2.572406040218721, "learning_rate": 2.0982967082424365e-07, "token_acc": 0.8634925418110592, "epoch": 1.9343065693430657, "step": 762}, {"loss": 0.4693622887134552, "grad_norm": 1.6314111923994719, "learning_rate": 1.9401983499569842e-07, "token_acc": 0.8523522908733571, "epoch": 1.9368454458901936, "step": 763}, {"loss": 0.4468652606010437, "grad_norm": 1.3140820178419717, "learning_rate": 1.7882684145406614e-07, "token_acc": 0.8632042981126877, "epoch": 1.9393843224373215, "step": 764}, {"loss": 0.43155643343925476, "grad_norm": 2.770527434708811, "learning_rate": 1.642510679986109e-07, "token_acc": 0.8636808957312806, "epoch": 1.9419231989844494, "step": 765}, {"loss": 0.48541945219039917, "grad_norm": 4.227933234736166, "learning_rate": 1.5029287708036854e-07, "token_acc": 0.8526545454545454, "epoch": 1.9444620755315771, "step": 766}, {"loss": 0.4071912169456482, "grad_norm": 1.764457046273328, "learning_rate": 1.3695261579316777e-07, "token_acc": 0.8712617943387174, "epoch": 1.9470009520787053, "step": 767}, {"loss": 0.3983229994773865, "grad_norm": 1.8525792515686663, "learning_rate": 1.2423061586496477e-07, "token_acc": 0.8684594200550786, "epoch": 1.949539828625833, "step": 768}, {"loss": 0.40239977836608887, "grad_norm": 3.0872401058271848, "learning_rate": 1.1212719364962209e-07, "token_acc": 0.8680657231169676, "epoch": 1.9520787051729611, "step": 769}, {"loss": 0.4544941186904907, "grad_norm": 1.553786668573536, "learning_rate": 1.006426501190233e-07, "token_acc": 0.8616740088105727, "epoch": 1.9546175817200888, "step": 770}, {"loss": 0.4375709295272827, "grad_norm": 1.6189188679364628, "learning_rate": 8.977727085560383e-08, "token_acc": 0.8633530445900591, "epoch": 1.9571564582672167, "step": 771}, {"loss": 0.5304610729217529, "grad_norm": 1.185952954932519, "learning_rate": 7.953132604522628e-08, "token_acc": 0.8480695549661067, "epoch": 1.9596953348143447, "step": 772}, {"loss": 0.3643919825553894, "grad_norm": 1.5057359010258355, "learning_rate": 6.990507047049676e-08, "token_acc": 0.881633870005963, "epoch": 1.9622342113614726, "step": 773}, {"loss": 0.44290855526924133, "grad_norm": 1.4895998452895707, "learning_rate": 6.089874350439506e-08, "token_acc": 0.8621897365615958, "epoch": 1.9647730879086005, "step": 774}, {"loss": 0.48098024725914, "grad_norm": 2.18249507625831, "learning_rate": 5.251256910434044e-08, "token_acc": 0.857872340425532, "epoch": 1.9673119644557282, "step": 775}, {"loss": 0.4236471652984619, "grad_norm": 1.2925552471421722, "learning_rate": 4.474675580662113e-08, "token_acc": 0.8625148632580262, "epoch": 1.9698508410028563, "step": 776}, {"loss": 0.481804221868515, "grad_norm": 3.3815823984137947, "learning_rate": 3.760149672120683e-08, "token_acc": 0.8500443655723159, "epoch": 1.972389717549984, "step": 777}, {"loss": 0.3899208903312683, "grad_norm": 2.851125002231867, "learning_rate": 3.107696952694139e-08, "token_acc": 0.8718987341772152, "epoch": 1.9749285940971122, "step": 778}, {"loss": 0.45743489265441895, "grad_norm": 1.8048399170508183, "learning_rate": 2.5173336467135267e-08, "token_acc": 0.856198347107438, "epoch": 1.9774674706442399, "step": 779}, {"loss": 0.4771175980567932, "grad_norm": 4.130203256257943, "learning_rate": 1.9890744345518742e-08, "token_acc": 0.8569542253521126, "epoch": 1.9800063471913678, "step": 780}, {"loss": 0.4706335663795471, "grad_norm": 9.563823062759168, "learning_rate": 1.522932452260595e-08, "token_acc": 0.8558704453441296, "epoch": 1.9825452237384957, "step": 781}, {"loss": 0.3632867932319641, "grad_norm": 1.001929275901606, "learning_rate": 1.1189192912416934e-08, "token_acc": 0.8832913518052057, "epoch": 1.9850841002856237, "step": 782}, {"loss": 0.47835835814476013, "grad_norm": 2.1169321646514394, "learning_rate": 7.770449979593864e-09, "token_acc": 0.8548891608867129, "epoch": 1.9876229768327516, "step": 783}, {"loss": 0.3994428217411041, "grad_norm": 1.816652203024763, "learning_rate": 4.9731807369113316e-09, "token_acc": 0.8765561721913905, "epoch": 1.9901618533798793, "step": 784}, {"loss": 0.4687284231185913, "grad_norm": 1.918559137763363, "learning_rate": 2.797454743164174e-09, "token_acc": 0.8569674647022714, "epoch": 1.9927007299270074, "step": 785}, {"loss": 0.43920624256134033, "grad_norm": 2.3691499113905197, "learning_rate": 1.2433261014244136e-09, "token_acc": 0.8617910447761195, "epoch": 1.9952396064741351, "step": 786}, {"loss": 0.4326912462711334, "grad_norm": 1.3499799024190056, "learning_rate": 3.108334577034411e-10, "token_acc": 0.8671625929861849, "epoch": 1.997778483021263, "step": 787}, {"loss": 0.4115853011608124, "grad_norm": 4.23464927720481, "learning_rate": 0.0, "token_acc": 0.8714167357083679, "epoch": 2.0, "step": 788}, {"eval_loss": 0.3586970865726471, "eval_runtime": 8.1551, "eval_samples_per_second": 1.471, "eval_steps_per_second": 0.368, "eval_token_acc": 0.8812767613857532, "epoch": 2.0, "step": 788}, {"eval_loss": 0.3586970865726471, "eval_runtime": 8.2383, "eval_samples_per_second": 1.457, "eval_steps_per_second": 0.364, "eval_token_acc": 0.8812767613857532, "epoch": 2.0, "step": 788}, {"train_runtime": 30451.4296, "train_samples_per_second": 0.828, "train_steps_per_second": 0.026, "total_flos": 4166480484106240.0, "train_loss": 0.5587191793141026, "epoch": 2.0, "step": 788}], "memory": 52.275390625} diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs/events.out.tfevents.1777794124.719f293e94d0.3199812.0 b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs/events.out.tfevents.1777794124.719f293e94d0.3199812.0 new file mode 100644 index 0000000000000000000000000000000000000000..ad87766359ab1307a4b910ffb8cf0291e58d6449 --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/runs/events.out.tfevents.1777794124.719f293e94d0.3199812.0 @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5f5b8ad3ad242c4b363b39360ff434bc44514664039272d9cc2046021dcb8ee8 +size 219879 diff --git a/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/val_dataset.jsonl b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/val_dataset.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..fa8b512fcbfbc9dc5e9be50487b1c559cd95fa1a --- /dev/null +++ b/Qwen2.5-VL-7B-Instruct-task-opsrc_12619-sft-5e-5lr-freeze_false/v0-20260503-074057/val_dataset.jsonl @@ -0,0 +1,12 @@ +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Who was the husband of the artist of Love Again: The Music of Richard Rodgers?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need find husband of artist of \"Love Again: The Music of Richard Rodgers\". Likely album page then artist page. We are on not found page with search box. Search target title.Need identify artist of \"Love Again: The Music of Richard Rodgers\", then that artist's husband.\n```type [53] [Love Again: The Music of Richard Rodgers] [1]```", "loss": null}, {"role": "user", "content": "Objective: Who was the husband of the artist of Love Again: The Music of Richard Rodgers?\nObservation: \nHISTORY_ACTION: type [53] [Love Again: The Music of Richard Rodgers] [1]\nHISTORY_info: Need identify artist of \"Love Again: The Music of Richard Rodgers\", then that artist's husband.\n", "loss": null}, {"role": "assistant", "content": "The result snippet shows the album page \"In Love Again: The Music of Richard Rodgers\" and identifies the artist as Stacey Kent. To find her husband, open that page or her page. Artist: Stacey Kent\n```click [140] [In Love Again: The Music of Richard Rodgers]```", "loss": null}, {"role": "user", "content": "Objective: Who was the husband of the artist of Love Again: The Music of Richard Rodgers?\nObservation: \nHISTORY_ACTION: type [53] [Love Again: The Music of Richard Rodgers] [1]\nclick [140] [In Love Again: The Music of Richard Rodgers]\nHISTORY_info: Need identify artist of \"Love Again: The Music of Richard Rodgers\", then that artist's husband.\nArtist: Stacey Kent\n", "loss": null}, {"role": "assistant", "content": "We already know the artist is Stacey Kent. To answer who her husband was, the most direct next step is to open Stacey Kent's page from the current article.Artist: Stacey Kent\n```click [1597] [Stacey Kent]```", "loss": null}, {"role": "user", "content": "Objective: Who was the husband of the artist of Love Again: The Music of Richard Rodgers?\nObservation: \nHISTORY_ACTION: type [53] [Love Again: The Music of Richard Rodgers] [1]\nclick [140] [In Love Again: The Music of Richard Rodgers]\nclick [1597] [Stacey Kent]\nHISTORY_info: Need identify artist of \"Love Again: The Music of Richard Rodgers\", then that artist's husband.\nArtist: Stacey Kent\nArtist: Stacey Kent\n", "loss": null}, {"role": "assistant", "content": "Stacey Kent is the artist of \"Love Again: The Music of Richard Rodgers.\" The page states she is married to saxophonist and composer Jim Tomlinson.\n```stop [Jim Tomlinson]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_723e1ef7f48e4ee4771a5cf33f704d4c.png"}, {"bytes": null, "path": "images/obs_6697c497664cf7a9e079ae6606fdeef0.png"}, {"bytes": null, "path": "images/obs_83787c43453530b875018983cf35c749.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who wrote the battle hymm of the republic\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search.\n```type [53] [Battle Hymn of the Republic] [1]```", "loss": null}, {"role": "user", "content": "Objective: who wrote the battle hymm of the republic\nObservation: \nHISTORY_ACTION: type [53] [Battle Hymn of the Republic] [1]\n", "loss": null}, {"role": "assistant", "content": "I should use the existing search box on this not found page to search for the song title and find who wrote it.\n```type [53] [Battle Hymn of the Republic] [1]```", "loss": null}, {"role": "user", "content": "Objective: who wrote the battle hymm of the republic\nObservation: \nHISTORY_ACTION: type [53] [Battle Hymn of the Republic] [1]\ntype [53] [Battle Hymn of the Republic] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results snippet already states the song is by the abolitionist writer Julia Ward Howe. That directly answers who wrote it.Julia Ward Howe\n```stop [Julia Ward Howe]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_790754e5d0c0214e2ba2f95fcc7ea2fb.png"}, {"bytes": null, "path": "images/obs_0ffde4c6d494876755764272410bc24b.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: What year was the company, which created the M6 Bomb Service Truck during World War II, founded?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need find company that created M6 Bomb Service Truck during WWII and its founding year. Current page is not found; use search. No answer yet.\n```type [53] [M6 Bomb Service Truck] [1]```", "loss": null}, {"role": "user", "content": "Objective: What year was the company, which created the M6 Bomb Service Truck during World War II, founded?\nObservation: \nHISTORY_ACTION: type [53] [M6 Bomb Service Truck] [1]\nHISTORY_info: No answer yet.\n", "loss": null}, {"role": "assistant", "content": "Open the M6 Bomb Service Truck article to identify the company, then find that company's founding year.M6 Bomb Service Truck was produced by Chevrolet.\n```click [140] [M6 Bomb Service Truck]```", "loss": null}, {"role": "user", "content": "Objective: What year was the company, which created the M6 Bomb Service Truck during World War II, founded?\nObservation: \nHISTORY_ACTION: type [53] [M6 Bomb Service Truck] [1]\nclick [140] [M6 Bomb Service Truck]\nHISTORY_info: No answer yet.\nM6 Bomb Service Truck was produced by Chevrolet.\n", "loss": null}, {"role": "assistant", "content": "Need find founding year of Chevrolet. Click Chevrolet link on page. Manufacturer of the M6 Bomb Service Truck: Chevrolet.\n```click [1000] [Chevrolet]```", "loss": null}, {"role": "user", "content": "Objective: What year was the company, which created the M6 Bomb Service Truck during World War II, founded?\nObservation: \nHISTORY_ACTION: type [53] [M6 Bomb Service Truck] [1]\nclick [140] [M6 Bomb Service Truck]\nclick [1000] [Chevrolet]\nHISTORY_info: No answer yet.\nM6 Bomb Service Truck was produced by Chevrolet.\nManufacturer of the M6 Bomb Service Truck: Chevrolet.\n", "loss": null}, {"role": "assistant", "content": "The current Chevrolet page directly states the company was started on November 3, 1911. Since the M6 Bomb Service Truck was produced by Chevrolet, the founding year asked is 1911.Chevrolet, the company that created the M6 Bomb Service Truck, was founded in 1911.\n```stop [1911]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_c84d4d6b46a5ccf0ddd19b5f6cf90280.png"}, {"bytes": null, "path": "images/obs_731395bcede49104fc0b1a357e6d5c49.png"}, {"bytes": null, "path": "images/obs_061e2240b41fb5618a51f82eebd63314.png"}, {"bytes": null, "path": "images/obs_b782c10f4965533a81259671dc947b5b.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: In what city is the Fort that Lester Martínez López headed the Army Medical and Research Command at located?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search likely for Lester Martínez López. Use search box. \n```type [53] [Lester Martínez López] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: In what city is the Fort that Lester Martínez López headed the Army Medical and Research Command at located?\nObservation: \nHISTORY_ACTION: type [53] [Lester Martínez López] [1]\n", "loss": null}, {"role": "assistant", "content": "Search returned no results. Need broader web navigation within local wiki likely by searching less accented or related title. Could search for Lester Martinez without accent or Army Medical and Research Command.No results for exact search \"Lester Martínez López\".\n```type [156] [Lester Martinez Lopez] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: In what city is the Fort that Lester Martínez López headed the Army Medical and Research Command at located?\nObservation: \nHISTORY_ACTION: type [53] [Lester Martínez López] [1]\ntype [156] [Lester Martinez Lopez] [1]\nHISTORY_info: No results for exact search \"Lester Martínez López\".\n", "loss": null}, {"role": "assistant", "content": "Search results snippet already states he headed the Army Medical and Research Command at Fort Detrick, Maryland. Fort Detrick is located in Frederick, Maryland. Frederick\n```stop [Frederick]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_4bc157f57d7cc25fb0af5bd980e490df.png"}, {"bytes": null, "path": "images/obs_a606048404e77989a34370d1fa81de08.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: What railroad company with 8,500 locomotives runs through a community 5 miles east-northeast of Davis, California?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need answer via Wikipedia offline. Search likely for community east-northeast of Davis, CA, then identify railroad company with 8,500 locomotives from its page. Start with search for phrase.\n```type [53] [community 5 miles east-northeast of Davis, California] [1]```", "loss": null}, {"role": "user", "content": "Objective: What railroad company with 8,500 locomotives runs through a community 5 miles east-northeast of Davis, California?\nObservation: \nHISTORY_ACTION: type [53] [community 5 miles east-northeast of Davis, California] [1]\n", "loss": null}, {"role": "assistant", "content": "The search results show the relevant community is Webster, California, described as located on the Union Pacific Railroad 5 miles east-northeast of Davis. The question asks what railroad company with 8,500 locomotives runs through that community. That is Union Pacific Railroad.Union Pacific Railroad\n```stop [Union Pacific Railroad]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_c70a3ca96d2749b9e9035f468ea9da1a.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when does movie life of the party come out\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search movie life of the party release date. Use search box.\n```type [53] [Life of the Party movie] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: when does movie life of the party come out\nObservation: \nHISTORY_ACTION: type [53] [Life of the Party movie] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results don't show the target directly. The Wikipedia search box is available; searching the exact movie title should find the page. \n```type [780] [Life of the Party (film)] [1]```", "loss": null}, {"role": "user", "content": "Objective: when does movie life of the party come out\nObservation: \nHISTORY_ACTION: type [53] [Life of the Party movie] [1]\ntype [780] [Life of the Party (film)] [1]\n", "loss": null}, {"role": "assistant", "content": "Open the specific 2018 film result to find its release date.Relevant result: Life of the Party (2018 film).\n```click [2276] [Life of the Party (2018 film)]```", "loss": null}, {"role": "user", "content": "Objective: when does movie life of the party come out\nObservation: \nHISTORY_ACTION: type [53] [Life of the Party movie] [1]\ntype [780] [Life of the Party (film)] [1]\nclick [2276] [Life of the Party (2018 film)]\nHISTORY_info: Relevant result: Life of the Party (2018 film).\n", "loss": null}, {"role": "assistant", "content": "The page text already states the release date: \"the film was released on May 11, 2018.\" May 11, 2018\n```stop [May 11, 2018]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_c84d4d6b46a5ccf0ddd19b5f6cf90280.png"}, {"bytes": null, "path": "images/obs_ea2ef22aba15e9a6e554b2d0849bacaa.png"}, {"bytes": null, "path": "images/obs_09a41256ca189ad04ea7a17ffaded205.png"}, {"bytes": null, "path": "images/obs_c6660109611135be722aa05bd99ecd6c.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when was national emergency declared for the first time in india\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We are on a not found page in a local Wikipedia mirror. Need answer: first time national emergency declared in India. Best is to search. \n```type [53] [National emergency India first declared] [1]```", "loss": null}, {"role": "user", "content": "Objective: when was national emergency declared for the first time in india\nObservation: \nHISTORY_ACTION: type [53] [National emergency India first declared] [1]\n", "loss": null}, {"role": "assistant", "content": "The search result snippet directly states the first instance of emergency in independent India was between 26 October 1962. That answers when it was first declared.First declared on 26 October 1962.\n```stop [26 October 1962]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_e157b03a0f3cd70d2aa652d23a0790be.png"}, {"bytes": null, "path": "images/obs_8c0ff022adc91f5c347c84ed98d1e349.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who is the voice of marlin in finding nemo\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need answer by searching. On not found page with search box. Use search for query. \n```type [53] [Finding Nemo Marlin voice] [1]```", "loss": null}, {"role": "user", "content": "Objective: who is the voice of marlin in finding nemo\nObservation: \nHISTORY_ACTION: type [53] [Finding Nemo Marlin voice] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show the Wikipedia page for \"Finding Nemo\", which should contain the cast information for Marlin's voice actor. Need to open the Finding Nemo page to identify Marlin's voice actor.\n```click [449] [Finding Nemo]```", "loss": null}, {"role": "user", "content": "Objective: who is the voice of marlin in finding nemo\nObservation: \nHISTORY_ACTION: type [53] [Finding Nemo Marlin voice] [1]\nclick [449] [Finding Nemo]\nHISTORY_info: Need to open the Finding Nemo page to identify Marlin's voice actor.\n", "loss": null}, {"role": "assistant", "content": "Marlin in Finding Nemo is voiced by Albert Brooks.The page text says the film stars the voices of Albert Brooks, Ellen DeGeneres, Alexander Gould, Willem Dafoe, and Geoffrey Rush, and describes Marlin as the clownfish protagonist. Therefore Marlin's voice is Albert Brooks.\n```stop [Albert Brooks]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_5921b7095e675cf2d2b225302da5f400.png"}, {"bytes": null, "path": "images/obs_b8913a4a4ce905f2d7991201f01fb877.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: when did the yamaha xt250 get fuel injection\nObservation: \n", "loss": null}, {"role": "assistant", "content": "We need find when Yamaha XT250 got fuel injection. Current page is not found; use search box. \n```type [53] [Yamaha XT250 fuel injection] [1]```", "loss": null}, {"role": "user", "content": "Objective: when did the yamaha xt250 get fuel injection\nObservation: \nHISTORY_ACTION: type [53] [Yamaha XT250 fuel injection] [1]\n", "loss": null}, {"role": "assistant", "content": "Search results show the Yamaha XT250 page, which likely contains the model year details needed. I should open it and look for when fuel injection was introduced.\n```click [140] [Yamaha XT250]```", "loss": null}, {"role": "user", "content": "Objective: when did the yamaha xt250 get fuel injection\nObservation: \nHISTORY_ACTION: type [53] [Yamaha XT250 fuel injection] [1]\nclick [140] [Yamaha XT250]\n", "loss": null}, {"role": "assistant", "content": "The page directly states when the XT250 got fuel injection. In 2013, the USA XT250 received a fuel-injected engine.\n```stop [2013]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_17bb5f077db595fe9d080dbf36676523.png"}, {"bytes": null, "path": "images/obs_2fd7d91e2595e7280fb20c4a63603600.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: Which documentary film was released first: V-Day: Until the Violence Stops or The Emperor's Naked Army Marches On?\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need find release years via search. On not found page with search box. \n```type [54] [V-Day: Until the Violence Stops] [1]```", "loss": null}, {"role": "user", "content": "Objective: Which documentary film was released first: V-Day: Until the Violence Stops or The Emperor's Naked Army Marches On?\nObservation: \nHISTORY_ACTION: type [54] [V-Day: Until the Violence Stops] [1]\n", "loss": null}, {"role": "assistant", "content": "Need find release dates for both films. Open first result for V-Day. \n```click [140] [V-Day: Until the Violence Stops]```", "loss": null}, {"role": "user", "content": "Objective: Which documentary film was released first: V-Day: Until the Violence Stops or The Emperor's Naked Army Marches On?\nObservation: \nHISTORY_ACTION: type [54] [V-Day: Until the Violence Stops] [1]\nclick [140] [V-Day: Until the Violence Stops]\n", "loss": null}, {"role": "assistant", "content": "Need compare release years. Current page shows V-Day is 2003. Need find The Emperor's Naked Army Marches On year. V-Day: Until the Violence Stops was released in 2003.\n```type [1336] [The Emperor's Naked Army Marches On] [1]```", "loss": null}, {"role": "user", "content": "Objective: Which documentary film was released first: V-Day: Until the Violence Stops or The Emperor's Naked Army Marches On?\nObservation: \nHISTORY_ACTION: type [54] [V-Day: Until the Violence Stops] [1]\nclick [140] [V-Day: Until the Violence Stops]\ntype [1336] [The Emperor's Naked Army Marches On] [1]\nHISTORY_info: V-Day: Until the Violence Stops was released in 2003.\n", "loss": null}, {"role": "assistant", "content": "Need open result to get release year. V-Day: Until the Violence Stops was released in 2003.\n```click [2631] [The Emperor's Naked Army Marches On]```", "loss": null}, {"role": "user", "content": "Objective: Which documentary film was released first: V-Day: Until the Violence Stops or The Emperor's Naked Army Marches On?\nObservation: \nHISTORY_ACTION: type [54] [V-Day: Until the Violence Stops] [1]\nclick [140] [V-Day: Until the Violence Stops]\ntype [1336] [The Emperor's Naked Army Marches On] [1]\nclick [2631] [The Emperor's Naked Army Marches On]\nHISTORY_info: V-Day: Until the Violence Stops was released in 2003.\nV-Day: Until the Violence Stops was released in 2003.\n", "loss": null}, {"role": "assistant", "content": "We already know V-Day: Until the Violence Stops was released in 2003. The current page states The Emperor's Naked Army Marches On is a 1987 Japanese documentary film. Since 1987 is earlier than 2003, The Emperor's Naked Army Marches On was released first.The Emperor's Naked Army Marches On (1987) was released before V-Day: Until the Violence Stops (2003).\n```stop [The Emperor's Naked Army Marches On]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_bc8389912e4d34512f2454974b95e7e3.png"}, {"bytes": null, "path": "images/obs_259d8858f4ec9913d6997f10e1b5824a.png"}, {"bytes": null, "path": "images/obs_be4254e67603f73a2e9b86735f96fa4d.png"}, {"bytes": null, "path": "images/obs_9ca8ded3ddcfdb96ed277173148afdcb.png"}, {"bytes": null, "path": "images/obs_2b884d94c199da971bd1037b9d40fbe1.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who is the male model on price is right\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search for query from current not found page. Use search box.\n```type [53] [The Price Is Right male model] [1]```", "loss": null}, {"role": "user", "content": "Objective: who is the male model on price is right\nObservation: \nHISTORY_ACTION: type [53] [The Price Is Right male model] [1]\n", "loss": null}, {"role": "assistant", "content": "Robert Scott Wilson was the first male model on The Price Is Right; James O'Halloran was the second.The query asks singular \"who is the male model on price is right.\" Search results directly show named male models. The current male model commonly referred to on the show is James O'Halloran, while Robert Scott Wilson was the first male model. Since the question is singular and present tense \"is,\" answer with James O'Halloran.\n```stop [James O'Halloran]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_048cb39a2989ab47f0afd7f3ec6ddcaf.png"}]} +{"messages": [{"role": "system", "content": "You are a browser interaction assistant designed to execute step-by-step browser operations efficiently and precisely to complete the user's task. You are provided with specific tasks and webpage-related information, and you need to output accurate actions to accomplish the user's task.\n\nHere's the information you'll have:\nThe user's objective: This is the task you're trying to complete.\nThe current web page's accessibility tree: This is a simplified representation of the webpage, providing key information.\nThe open tabs: These are the tabs you have open.\nThe previous actions: There are the actions you just performed. It may be helpful to track your progress.\nInformation already found: Information related to the current query that has been identified in historical actions. You need to integrate and supplement this information.\n\nThe actions you can perform fall into several categories:\n\nPage Operation Actions:\n`click [id] [content]`: This action clicks on an element with a specific id on the webpage.\n`type [id] [content] [press_enter_after=0|1]`: Use this to type the content into the field with id. By default, the \"\"Enter\"\" key is pressed after typing unless press_enter_after is set to 0.\n`hover [id] [content]`: Hover over an element with id.\n`press [key_comb]`: Simulates the pressing of a key combination on the keyboard (e.g., Ctrl+v).\n`scroll [down|up]`: Scroll the page up or down.\n\nTab Management Actions:\n`new_tab`: Open a new, empty browser tab.\n`tab_focus [tab_index]`: Switch the browser's focus to a specific tab using its index.\n`close_tab`: Close the currently active tab.\n\nURL Navigation Actions:\n`goto [url]`: Navigate to a specific URL.\n`go_back`: Navigate to the previously viewed page.\n`go_forward`: Navigate to the next page (if a previous 'go_back' action was performed).\n\nCompletion Action:\n`stop [answer]`: Issue this action when you believe the task is complete. If the objective is to find a text-based answer, provide the answer in the bracket. If you believe the task is impossible to complete, provide the answer as \"\"N/A\"\" in the bracket.\n\nTo be successful, it is very important to follow the following rules:\n1. You should only issue an action that is valid given the current observation.\n2. You should only issue one action at a time.\n3. You should follow the examples to reason step by step and then issue the next action.\n4. You should refer to historical actions when issue an action and try not to make repetitive actions\n5. All reasoning must be inside `` tags, and there must be no output before ``.\n6. After ``, only the action should be generated in the correct format, enclosed in code fences. For example:\n This button looks relevant to my goal. Clicking it should take me to the next step.\n ```click [id] [content]```\n7. Issue the stop action when you think you have achieved the objective. Don’t generate anything after stop.\n8. Always format actions correctly: \n```command [parameters]```\nFor example, if searching for \"\"death row inmates in the US\"\" in a search field with ID `21`, correctly format it as:\n```type [21] [death row inmates in the US] [1]```\nAvoid incorrect formats that omit brackets around parameters or numeric values.\n9.Between ``, you need to use `` to enclose the information obtained in this round that is relevant to the current query. Note that if there is no valid information, this part is not required. The enclosed information must be directly usable to answer the original query. And the final anwser should be as simple as possible.", "loss": null}, {"role": "user", "content": "Objective: who played cliff's dad on the cosby show\nObservation: \n", "loss": null}, {"role": "assistant", "content": "Need search. \n```type [53] [Cliff Huxtable's father The Cosby Show] [1]```\n", "loss": null}, {"role": "user", "content": "Objective: who played cliff's dad on the cosby show\nObservation: \nHISTORY_ACTION: type [53] [Cliff Huxtable's father The Cosby Show] [1]\n", "loss": null}, {"role": "assistant", "content": "The search result snippet for \"Cliff Huxtable\" shows his father is Russell Huxtable. The question asks who played Cliff's dad on The Cosby Show, so I should open the Cliff Huxtable page to find who portrayed Russell Huxtable.Cliff Huxtable's father is Russell Huxtable.\n```click [692] [Cliff Huxtable]```", "loss": null}, {"role": "user", "content": "Objective: who played cliff's dad on the cosby show\nObservation: \nHISTORY_ACTION: type [53] [Cliff Huxtable's father The Cosby Show] [1]\nclick [692] [Cliff Huxtable]\nHISTORY_info: Cliff Huxtable's father is Russell Huxtable.\n", "loss": null}, {"role": "assistant", "content": "Need answer who played Cliff's dad. Page shows father is Russell Huxtable, but not actor. Search Russell Huxtable page.Cliff Huxtable's father is Russell Huxtable.\n```click [1324] [Russell Huxtable (father) Anna Huxtable (mother) James Theodore Huxtable (brother; deceased) Harriet McCutcheon (paternal great-aunt)]```", "loss": null}, {"role": "user", "content": "Objective: who played cliff's dad on the cosby show\nObservation: \nHISTORY_ACTION: type [53] [Cliff Huxtable's father The Cosby Show] [1]\nclick [692] [Cliff Huxtable]\nclick [1324] [Russell Huxtable (father) Anna Huxtable (mother) James Theodore Huxtable (brother; deceased) Harriet McCutcheon (paternal great-aunt)]\nHISTORY_info: Cliff Huxtable's father is Russell Huxtable.\nCliff Huxtable's father is Russell Huxtable.\n", "loss": null}, {"role": "assistant", "content": "We know Cliff Huxtable's father is Russell Huxtable. The question asks who played Cliff's dad on The Cosby Show, i.e., the actor who portrayed Russell Huxtable. Cliff's dad, Russell Huxtable, was played by Earle Hyman.\n```stop [Earle Hyman]```", "loss": null}], "images": [{"bytes": null, "path": "images/obs_a0a55552e0c86d8b60a35fe87d820f32.png"}, {"bytes": null, "path": "images/obs_ef68816a2c7fa4a1f2134cfa82a23c50.png"}, {"bytes": null, "path": "images/obs_911f85e414d25dbeec5cfbb41fdda235.png"}, {"bytes": null, "path": "images/obs_911f85e414d25dbeec5cfbb41fdda235.png"}]}