wei682 commited on May 9, 2025

Commit

c5addbb

verified ·

1 Parent(s): eb4f722

Upload folder using huggingface_hub

Browse files

Files changed (37) hide show

v0-20250508-223159/args.json +371 -0
v0-20250508-223159/checkpoint-500/README.md +202 -0
v0-20250508-223159/checkpoint-500/adapter_config.json +31 -0
v0-20250508-223159/checkpoint-500/adapter_model.safetensors +3 -0
v0-20250508-223159/checkpoint-500/additional_config.json +1 -0
v0-20250508-223159/checkpoint-500/args.json +371 -0
v0-20250508-223159/checkpoint-500/trainer_state.json +1089 -0
v0-20250508-223159/checkpoint-500/training_args.bin +3 -0
v0-20250508-223159/checkpoint-500/vit.safetensors +3 -0
v0-20250508-223159/checkpoint-599/README.md +202 -0
v0-20250508-223159/checkpoint-599/adapter_config.json +31 -0
v0-20250508-223159/checkpoint-599/adapter_model.safetensors +3 -0
v0-20250508-223159/checkpoint-599/additional_config.json +1 -0
v0-20250508-223159/checkpoint-599/args.json +371 -0
v0-20250508-223159/checkpoint-599/trainer_state.json +1288 -0
v0-20250508-223159/checkpoint-599/training_args.bin +3 -0
v0-20250508-223159/checkpoint-599/vit.safetensors +3 -0
v0-20250508-223159/images/eval_loss.png +0 -0
v0-20250508-223159/images/eval_runtime.png +0 -0
v0-20250508-223159/images/eval_samples_per_second.png +0 -0
v0-20250508-223159/images/eval_steps_per_second.png +0 -0
v0-20250508-223159/images/eval_token_acc.png +0 -0
v0-20250508-223159/images/train_epoch.png +0 -0
v0-20250508-223159/images/train_grad_norm.png +0 -0
v0-20250508-223159/images/train_learning_rate.png +0 -0
v0-20250508-223159/images/train_loss.png +0 -0
v0-20250508-223159/images/train_memory(GiB).png +0 -0
v0-20250508-223159/images/train_token_acc.png +0 -0
v0-20250508-223159/images/train_total_flos.png +0 -0
v0-20250508-223159/images/train_train_loss.png +0 -0
v0-20250508-223159/images/train_train_runtime.png +0 -0
v0-20250508-223159/images/train_train_samples_per_second.png +0 -0
v0-20250508-223159/images/train_train_speed(iter_s).png +0 -0
v0-20250508-223159/images/train_train_steps_per_second.png +0 -0
v0-20250508-223159/logging.jsonl +128 -0
v0-20250508-223159/runs/events.out.tfevents.1746714741.dsw-2138-644b4b995d-5j9mw.1741121.0 +3 -0
v0-20250508-223159/val_dataset.jsonl +0 -0

v0-20250508-223159/args.json ADDED Viewed

	@@ -0,0 +1,371 @@

+{
+  "model": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "model_type": "qwen2_5_vl",
+  "model_revision": null,
+  "task_type": "causal_lm",
+  "torch_dtype": "bfloat16",
+  "attn_impl": null,
+  "num_labels": null,
+  "problem_type": null,
+  "rope_scaling": null,
+  "device_map": null,
+  "max_memory": {},
+  "local_repo_path": null,
+  "template": "qwen2_5_vl",
+  "system": null,
+  "max_length": 8192,
+  "truncation_strategy": "delete",
+  "max_pixels": null,
+  "agent_template": null,
+  "norm_bbox": null,
+  "response_prefix": null,
+  "padding_side": "right",
+  "loss_scale": "default",
+  "sequence_parallel_size": 1,
+  "use_chat_template": true,
+  "template_backend": "swift",
+  "dataset": [
+    "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/msdata/wei682/amazon-qwen-file/updated_merged_data.json"
+  ],
+  "val_dataset": [],
+  "split_dataset_ratio": 0.01,
+  "data_seed": 42,
+  "dataset_num_proc": 2,
+  "dataset_shuffle": true,
+  "val_dataset_shuffle": false,
+  "streaming": false,
+  "interleave_prob": null,
+  "stopping_strategy": "first_exhausted",
+  "shuffle_buffer_size": 1000,
+  "enable_cache": false,
+  "download_mode": "reuse_dataset_if_exists",
+  "columns": {},
+  "strict": false,
+  "remove_unused_columns": true,
+  "model_name": [
+    null,
+    null
+  ],
+  "model_author": [
+    null,
+    null
+  ],
+  "custom_dataset_info": [],
+  "quant_method": null,
+  "quant_bits": null,
+  "hqq_axis": null,
+  "bnb_4bit_compute_dtype": "bfloat16",
+  "bnb_4bit_quant_type": "nf4",
+  "bnb_4bit_use_double_quant": true,
+  "bnb_4bit_quant_storage": null,
+  "max_new_tokens": 64,
+  "temperature": 0.0,
+  "top_k": null,
+  "top_p": null,
+  "repetition_penalty": null,
+  "num_beams": 1,
+  "stream": false,
+  "stop_words": [],
+  "logprobs": false,
+  "top_logprobs": null,
+  "ckpt_dir": null,
+  "load_dataset_config": null,
+  "lora_modules": [],
+  "tuner_backend": "peft",
+  "train_type": "custom",
+  "adapters": [],
+  "external_plugins": [
+    "examples/train/multimodal/lora_llm_full_vit/custom_plugin.py"
+  ],
+  "seed": 42,
+  "model_kwargs": {},
+  "load_args": false,
+  "load_data_args": false,
+  "use_hf": false,
+  "hub_token": null,
+  "custom_register_path": [],
+  "ignore_args_error": false,
+  "use_swift_lora": false,
+  "output_dir": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159",
+  "overwrite_output_dir": false,
+  "do_train": false,
+  "do_eval": false,
+  "do_predict": false,
+  "eval_strategy": "steps",
+  "prediction_loss_only": false,
+  "per_device_train_batch_size": 4,
+  "per_device_eval_batch_size": 4,
+  "per_gpu_train_batch_size": null,
+  "per_gpu_eval_batch_size": null,
+  "gradient_accumulation_steps": 4,
+  "eval_accumulation_steps": null,
+  "eval_delay": 0,
+  "torch_empty_cache_steps": null,
+  "learning_rate": 1e-05,
+  "weight_decay": 0.1,
+  "adam_beta1": 0.9,
+  "adam_beta2": 0.95,
+  "adam_epsilon": 1e-08,
+  "max_grad_norm": 1.0,
+  "num_train_epochs": 1.0,
+  "max_steps": -1,
+  "lr_scheduler_type": "cosine",
+  "lr_scheduler_kwargs": null,
+  "warmup_ratio": 0.05,
+  "warmup_steps": 0,
+  "log_level": "passive",
+  "log_level_replica": "warning",
+  "log_on_each_node": true,
+  "logging_dir": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/runs",
+  "logging_strategy": "steps",
+  "logging_first_step": true,
+  "logging_steps": 5,
+  "logging_nan_inf_filter": true,
+  "save_strategy": "steps",
+  "save_steps": 100.0,
+  "save_total_limit": 2,
+  "save_safetensors": true,
+  "save_on_each_node": false,
+  "save_only_model": true,
+  "restore_callback_states_from_checkpoint": false,
+  "no_cuda": false,
+  "use_cpu": false,
+  "use_mps_device": false,
+  "jit_mode_eval": false,
+  "use_ipex": false,
+  "bf16": true,
+  "fp16": false,
+  "fp16_opt_level": "O1",
+  "half_precision_backend": "auto",
+  "bf16_full_eval": false,
+  "fp16_full_eval": false,
+  "tf32": null,
+  "local_rank": 0,
+  "ddp_backend": null,
+  "tpu_num_cores": null,
+  "tpu_metrics_debug": false,
+  "debug": null,
+  "dataloader_drop_last": false,
+  "eval_steps": 100.0,
+  "dataloader_num_workers": 2,
+  "dataloader_prefetch_factor": null,
+  "past_index": -1,
+  "run_name": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159",
+  "disable_tqdm": null,
+  "label_names": null,
+  "load_best_model_at_end": false,
+  "metric_for_best_model": "loss",
+  "greater_is_better": false,
+  "ignore_data_skip": false,
+  "fsdp": "",
+  "fsdp_min_num_params": 0,
+  "fsdp_config": null,
+  "tp_size": 0,
+  "fsdp_transformer_layer_cls_to_wrap": null,
+  "accelerator_config": {
+    "dispatch_batches": false
+  },
+  "deepspeed": {
+    "fp16": {
+      "enabled": "auto",
+      "loss_scale": 0,
+      "loss_scale_window": 1000,
+      "initial_scale_power": 16,
+      "hysteresis": 2,
+      "min_loss_scale": 1
+    },
+    "bf16": {
+      "enabled": "auto"
+    },
+    "zero_optimization": {
+      "stage": 3,
+      "offload_optimizer": {
+        "device": "none",
+        "pin_memory": true
+      },
+      "offload_param": {
+        "device": "none",
+        "pin_memory": true
+      },
+      "overlap_comm": false,
+      "contiguous_gradients": true,
+      "sub_group_size": 1000000000.0,
+      "reduce_bucket_size": "auto",
+      "zero_quantized_weights": false,
+      "zero_quantized_gradients": false,
+      "stage3_prefetch_bucket_size": "auto",
+      "stage3_param_persistence_threshold": "auto",
+      "stage3_max_live_parameters": 1000000000.0,
+      "stage3_max_reuse_distance": 1000000000.0,
+      "stage3_gather_16bit_weights_on_model_save": true
+    },
+    "gradient_accumulation_steps": "auto",
+    "gradient_clipping": "auto",
+    "steps_per_print": 2000,
+    "train_batch_size": "auto",
+    "train_micro_batch_size_per_gpu": "auto",
+    "wall_clock_breakdown": false
+  },
+  "label_smoothing_factor": 0.0,
+  "optim": "adamw_torch",
+  "optim_args": null,
+  "adafactor": false,
+  "group_by_length": false,
+  "length_column_name": "length",
+  "report_to": [
+    "tensorboard"
+  ],
+  "ddp_find_unused_parameters": null,
+  "ddp_bucket_cap_mb": null,
+  "ddp_broadcast_buffers": null,
+  "dataloader_pin_memory": true,
+  "dataloader_persistent_workers": false,
+  "skip_memory_metrics": true,
+  "use_legacy_prediction_loop": false,
+  "push_to_hub": false,
+  "resume_from_checkpoint": null,
+  "hub_model_id": null,
+  "hub_strategy": "every_save",
+  "hub_private_repo": null,
+  "hub_always_push": false,
+  "gradient_checkpointing": true,
+  "gradient_checkpointing_kwargs": null,
+  "include_inputs_for_metrics": false,
+  "include_for_metrics": [],
+  "eval_do_concat_batches": true,
+  "fp16_backend": "auto",
+  "push_to_hub_model_id": null,
+  "push_to_hub_organization": null,
+  "push_to_hub_token": null,
+  "mp_parameters": "",
+  "auto_find_batch_size": false,
+  "full_determinism": false,
+  "torchdynamo": null,
+  "ray_scope": "last",
+  "ddp_timeout": 1800,
+  "torch_compile": false,
+  "torch_compile_backend": null,
+  "torch_compile_mode": null,
+  "include_tokens_per_second": false,
+  "include_num_input_tokens_seen": false,
+  "neftune_noise_alpha": null,
+  "optim_target_modules": null,
+  "batch_eval_metrics": false,
+  "eval_on_start": false,
+  "use_liger_kernel": false,
+  "eval_use_gather_object": false,
+  "average_tokens_across_devices": false,
+  "sortish_sampler": false,
+  "predict_with_generate": false,
+  "generation_max_length": null,
+  "generation_num_beams": null,
+  "generation_config": null,
+  "check_model": true,
+  "acc_strategy": "token",
+  "train_dataloader_shuffle": true,
+  "metric_warmup_step": 0,
+  "fsdp_num": 1,
+  "acc_steps": 1,
+  "eval_use_evalscope": false,
+  "eval_datasets": [],
+  "eval_limit": null,
+  "eval_datasets_args": null,
+  "eval_generation_config": null,
+  "freeze_parameters": [
+    "visual",
+    "visual.merger"
+  ],
+  "freeze_parameters_ratio": 0.0,
+  "trainable_parameters": [],
+  "freeze_llm": false,
+  "freeze_vit": true,
+  "freeze_aligner": true,
+  "target_modules": [
+    "all-linear"
+  ],
+  "target_regex": null,
+  "modules_to_save": [],
+  "lora_rank": 64,
+  "lora_alpha": 32,
+  "lora_dropout": 0.05,
+  "lora_bias": "none",
+  "lora_dtype": null,
+  "lorap_lr_ratio": null,
+  "use_rslora": false,
+  "use_dora": false,
+  "lora_ga_batch_size": 2,
+  "lora_ga_iters": 2,
+  "lora_ga_max_length": 1024,
+  "lora_ga_direction": "ArB2r",
+  "lora_ga_scale": "stable",
+  "lora_ga_stable_gamma": 16,
+  "init_weights": true,
+  "fourier_n_frequency": 2000,
+  "fourier_scaling": 300.0,
+  "boft_block_size": 4,
+  "boft_block_num": 0,
+  "boft_n_butterfly_factor": 1,
+  "boft_dropout": 0.0,
+  "vera_rank": 256,
+  "vera_projection_prng_key": 0,
+  "vera_dropout": 0.0,
+  "vera_d_initial": 0.1,
+  "adapter_act": "gelu",
+  "adapter_length": 128,
+  "use_galore": false,
+  "galore_target_modules": null,
+  "galore_rank": 128,
+  "galore_update_proj_gap": 50,
+  "galore_scale": 1.0,
+  "galore_proj_type": "std",
+  "galore_optim_per_parameter": false,
+  "galore_with_embedding": false,
+  "galore_quantization": false,
+  "galore_proj_quant": false,
+  "galore_proj_bits": 4,
+  "galore_proj_group_size": 256,
+  "galore_cos_threshold": 0.4,
+  "galore_gamma_proj": 2,
+  "galore_queue_size": 5,
+  "adalora_target_r": 8,
+  "adalora_init_r": 12,
+  "adalora_tinit": 0,
+  "adalora_tfinal": 0,
+  "adalora_deltaT": 1,
+  "adalora_beta1": 0.85,
+  "adalora_beta2": 0.85,
+  "adalora_orth_reg_weight": 0.5,
+  "llamapro_num_new_blocks": 4,
+  "llamapro_num_groups": null,
+  "lisa_activated_layers": 0,
+  "lisa_step_interval": 20,
+  "reft_layer_key": null,
+  "reft_layers": null,
+  "reft_rank": 4,
+  "reft_intervention_type": "LoreftIntervention",
+  "reft_args": null,
+  "swanlab_token": null,
+  "swanlab_project": null,
+  "swanlab_workspace": null,
+  "swanlab_exp_name": null,
+  "swanlab_mode": "cloud",
+  "add_version": true,
+  "resume_only_model": false,
+  "create_checkpoint_symlink": false,
+  "packing": false,
+  "lazy_tokenize": true,
+  "loss_type": null,
+  "optimizer": "custom",
+  "metric": null,
+  "zero_hpz_partition_size": null,
+  "rank": 0,
+  "global_world_size": 4,
+  "local_world_size": 4,
+  "model_suffix": "Qwen2.5-VL-3B-Instruct",
+  "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, config=None, task_type='causal_lm', num_labels=None)",
+  "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=<function get_model_tokenizer_qwen2_5_vl at 0x7efddeda5bd0>, model_arch='qwen2_vl', architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=[])",
+  "model_dir": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "hub": "<class 'swift.hub.hub.MSHub'>",
+  "evaluation_strategy": "steps",
+  "training_args": "Seq2SeqTrainingArguments(output_dir='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=<IntervalStrategy.STEPS: 'steps'>, prediction_loss_only=False, per_device_train_batch_size=4, per_device_eval_batch_size=4, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=<SchedulerType.COSINE: 'cosine'>, lr_scheduler_kwargs=None, warmup_ratio=0.05, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/runs', logging_strategy=<IntervalStrategy.STEPS: 'steps'>, logging_first_step=True, logging_steps=5, logging_nan_inf_filter=True, save_strategy=<SaveStrategy.STEPS: 'steps'>, save_steps=100, save_total_limit=2, save_safetensors=True, save_on_each_node=False, save_only_model=True, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=100, dataloader_num_workers=2, dataloader_prefetch_factor=10, past_index=-1, run_name='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, tp_size=0, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 3, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'offload_param': {'device': 'none', 'pin_memory': True}, 'overlap_comm': False, 'contiguous_gradients': True, 'sub_group_size': 1000000000.0, 'reduce_bucket_size': 'auto', 'zero_quantized_weights': False, 'zero_quantized_gradients': False, 'stage3_prefetch_bucket_size': 'auto', 'stage3_param_persistence_threshold': 'auto', 'stage3_max_live_parameters': 1000000000.0, 'stage3_max_reuse_distance': 1000000000.0, 'stage3_gather_16bit_weights_on_model_save': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=<OptimizerNames.ADAMW_TORCH: 'adamw_torch'>, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=<HubStrategy.EVERY_SAVE: 'every_save'>, hub_token=None, hub_private_repo=None, hub_always_push=False, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=1800, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, metric_warmup_step=0, fsdp_num=1, acc_steps=1, eval_use_evalscope=False, eval_datasets=[], eval_limit=None, eval_datasets_args=None, eval_generation_config=None, train_type='custom', optimizer='custom', local_repo_path=None, galore_config=None)"
+}

v0-20250508-223159/checkpoint-500/README.md ADDED Viewed

	@@ -0,0 +1,202 @@

+---
+base_model: /cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct
+library_name: peft
+---
+# Model Card for Model ID
+<!-- Provide a quick summary of what the model is/does. -->
+## Model Details
+### Model Description
+<!-- Provide a longer summary of what this model is. -->
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+### Model Sources [optional]
+<!-- Provide the basic links for the model. -->
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+## Uses
+<!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
+### Direct Use
+<!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
+[More Information Needed]
+### Downstream Use [optional]
+<!-- This section is for the model use when fine-tuned for a task, or when plugged into a larger ecosystem/app -->
+[More Information Needed]
+### Out-of-Scope Use
+<!-- This section addresses misuse, malicious use, and uses that the model will not work well for. -->
+[More Information Needed]
+## Bias, Risks, and Limitations
+<!-- This section is meant to convey both technical and sociotechnical limitations. -->
+[More Information Needed]
+### Recommendations
+<!-- This section is meant to convey recommendations with respect to the bias, risk, and technical limitations. -->
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+## How to Get Started with the Model
+Use the code below to get started with the model.
+[More Information Needed]
+## Training Details
+### Training Data
+<!-- This should link to a Dataset Card, perhaps with a short stub of information on what the training data is all about as well as documentation related to data pre-processing or additional filtering. -->
+[More Information Needed]
+### Training Procedure
+<!-- This relates heavily to the Technical Specifications. Content here should link to that section when it is relevant to the training procedure. -->
+#### Preprocessing [optional]
+[More Information Needed]
+#### Training Hyperparameters
+- **Training regime:** [More Information Needed] <!--fp32, fp16 mixed precision, bf16 mixed precision, bf16 non-mixed precision, fp16 non-mixed precision, fp8 mixed precision -->
+#### Speeds, Sizes, Times [optional]
+<!-- This section provides information about throughput, start/end time, checkpoint size if relevant, etc. -->
+[More Information Needed]
+## Evaluation
+<!-- This section describes the evaluation protocols and provides the results. -->
+### Testing Data, Factors & Metrics
+#### Testing Data
+<!-- This should link to a Dataset Card if possible. -->
+[More Information Needed]
+#### Factors
+<!-- These are the things the evaluation is disaggregating by, e.g., subpopulations or domains. -->
+[More Information Needed]
+#### Metrics
+<!-- These are the evaluation metrics being used, ideally with a description of why. -->
+[More Information Needed]
+### Results
+[More Information Needed]
+#### Summary
+## Model Examination [optional]
+<!-- Relevant interpretability work for the model goes here -->
+[More Information Needed]
+## Environmental Impact
+<!-- Total emissions (in grams of CO2eq) and additional considerations, such as electricity usage, go here. Edit the suggested text below accordingly -->
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+## Technical Specifications [optional]
+### Model Architecture and Objective
+[More Information Needed]
+### Compute Infrastructure
+[More Information Needed]
+#### Hardware
+[More Information Needed]
+#### Software
+[More Information Needed]
+## Citation [optional]
+<!-- If there is a paper or blog post introducing the model, the APA and Bibtex information for that should go in this section. -->
+**BibTeX:**
+[More Information Needed]
+**APA:**
+[More Information Needed]
+## Glossary [optional]
+<!-- If relevant, include terms and calculations in this section that can help readers understand the model or model card. -->
+[More Information Needed]
+## More Information [optional]
+[More Information Needed]
+## Model Card Authors [optional]
+[More Information Needed]
+## Model Card Contact
+[More Information Needed]
+### Framework versions
+- PEFT 0.15.2

v0-20250508-223159/checkpoint-500/adapter_config.json ADDED Viewed

	@@ -0,0 +1,31 @@

+{
+  "alpha_pattern": {},
+  "auto_mapping": null,
+  "base_model_name_or_path": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "bias": "none",
+  "corda_config": null,
+  "eva_config": null,
+  "exclude_modules": null,
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layer_replication": null,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "loftq_config": {},
+  "lora_alpha": 32,
+  "lora_bias": false,
+  "lora_dropout": 0.0,
+  "megatron_config": null,
+  "megatron_core": "megatron.core",
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 64,
+  "rank_pattern": {},
+  "revision": null,
+  "target_modules": "^(model).*\\.(gate_proj|down_proj|o_proj|v_proj|q_proj|up_proj|k_proj)$",
+  "task_type": "CAUSAL_LM",
+  "trainable_token_indices": null,
+  "use_dora": false,
+  "use_rslora": false
+}

v0-20250508-223159/checkpoint-500/adapter_model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:a284fd5d614fa70a3d63120811a47b141245a969e944a04e755a4fd83d123da3
+size 239536776

v0-20250508-223159/checkpoint-500/additional_config.json ADDED Viewed

	@@ -0,0 +1 @@


1	+ {"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06}

v0-20250508-223159/checkpoint-500/args.json ADDED Viewed

	@@ -0,0 +1,371 @@

+{
+  "model": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "model_type": "qwen2_5_vl",
+  "model_revision": null,
+  "task_type": "causal_lm",
+  "torch_dtype": "bfloat16",
+  "attn_impl": null,
+  "num_labels": null,
+  "problem_type": null,
+  "rope_scaling": null,
+  "device_map": null,
+  "max_memory": {},
+  "local_repo_path": null,
+  "template": "qwen2_5_vl",
+  "system": null,
+  "max_length": 8192,
+  "truncation_strategy": "delete",
+  "max_pixels": null,
+  "agent_template": null,
+  "norm_bbox": null,
+  "response_prefix": null,
+  "padding_side": "right",
+  "loss_scale": "default",
+  "sequence_parallel_size": 1,
+  "use_chat_template": true,
+  "template_backend": "swift",
+  "dataset": [
+    "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/msdata/wei682/amazon-qwen-file/updated_merged_data.json"
+  ],
+  "val_dataset": [],
+  "split_dataset_ratio": 0.01,
+  "data_seed": 42,
+  "dataset_num_proc": 2,
+  "dataset_shuffle": true,
+  "val_dataset_shuffle": false,
+  "streaming": false,
+  "interleave_prob": null,
+  "stopping_strategy": "first_exhausted",
+  "shuffle_buffer_size": 1000,
+  "enable_cache": false,
+  "download_mode": "reuse_dataset_if_exists",
+  "columns": {},
+  "strict": false,
+  "remove_unused_columns": true,
+  "model_name": [
+    null,
+    null
+  ],
+  "model_author": [
+    null,
+    null
+  ],
+  "custom_dataset_info": [],
+  "quant_method": null,
+  "quant_bits": null,
+  "hqq_axis": null,
+  "bnb_4bit_compute_dtype": "bfloat16",
+  "bnb_4bit_quant_type": "nf4",
+  "bnb_4bit_use_double_quant": true,
+  "bnb_4bit_quant_storage": null,
+  "max_new_tokens": 64,
+  "temperature": 0.0,
+  "top_k": null,
+  "top_p": null,
+  "repetition_penalty": null,
+  "num_beams": 1,
+  "stream": false,
+  "stop_words": [],
+  "logprobs": false,
+  "top_logprobs": null,
+  "ckpt_dir": null,
+  "load_dataset_config": null,
+  "lora_modules": [],
+  "tuner_backend": "peft",
+  "train_type": "custom",
+  "adapters": [],
+  "external_plugins": [
+    "examples/train/multimodal/lora_llm_full_vit/custom_plugin.py"
+  ],
+  "seed": 42,
+  "model_kwargs": {},
+  "load_args": false,
+  "load_data_args": false,
+  "use_hf": false,
+  "hub_token": null,
+  "custom_register_path": [],
+  "ignore_args_error": false,
+  "use_swift_lora": false,
+  "output_dir": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159",
+  "overwrite_output_dir": false,
+  "do_train": false,
+  "do_eval": false,
+  "do_predict": false,
+  "eval_strategy": "steps",
+  "prediction_loss_only": false,
+  "per_device_train_batch_size": 4,
+  "per_device_eval_batch_size": 4,
+  "per_gpu_train_batch_size": null,
+  "per_gpu_eval_batch_size": null,
+  "gradient_accumulation_steps": 4,
+  "eval_accumulation_steps": null,
+  "eval_delay": 0,
+  "torch_empty_cache_steps": null,
+  "learning_rate": 1e-05,
+  "weight_decay": 0.1,
+  "adam_beta1": 0.9,
+  "adam_beta2": 0.95,
+  "adam_epsilon": 1e-08,
+  "max_grad_norm": 1.0,
+  "num_train_epochs": 1.0,
+  "max_steps": -1,
+  "lr_scheduler_type": "cosine",
+  "lr_scheduler_kwargs": null,
+  "warmup_ratio": 0.05,
+  "warmup_steps": 0,
+  "log_level": "passive",
+  "log_level_replica": "warning",
+  "log_on_each_node": true,
+  "logging_dir": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/runs",
+  "logging_strategy": "steps",
+  "logging_first_step": true,
+  "logging_steps": 5,
+  "logging_nan_inf_filter": true,
+  "save_strategy": "steps",
+  "save_steps": 100.0,
+  "save_total_limit": 2,
+  "save_safetensors": true,
+  "save_on_each_node": false,
+  "save_only_model": true,
+  "restore_callback_states_from_checkpoint": false,
+  "no_cuda": false,
+  "use_cpu": false,
+  "use_mps_device": false,
+  "jit_mode_eval": false,
+  "use_ipex": false,
+  "bf16": true,
+  "fp16": false,
+  "fp16_opt_level": "O1",
+  "half_precision_backend": "auto",
+  "bf16_full_eval": false,
+  "fp16_full_eval": false,
+  "tf32": null,
+  "local_rank": 0,
+  "ddp_backend": null,
+  "tpu_num_cores": null,
+  "tpu_metrics_debug": false,
+  "debug": null,
+  "dataloader_drop_last": false,
+  "eval_steps": 100.0,
+  "dataloader_num_workers": 2,
+  "dataloader_prefetch_factor": null,
+  "past_index": -1,
+  "run_name": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159",
+  "disable_tqdm": null,
+  "label_names": null,
+  "load_best_model_at_end": false,
+  "metric_for_best_model": "loss",
+  "greater_is_better": false,
+  "ignore_data_skip": false,
+  "fsdp": "",
+  "fsdp_min_num_params": 0,
+  "fsdp_config": null,
+  "tp_size": 0,
+  "fsdp_transformer_layer_cls_to_wrap": null,
+  "accelerator_config": {
+    "dispatch_batches": false
+  },
+  "deepspeed": {
+    "fp16": {
+      "enabled": "auto",
+      "loss_scale": 0,
+      "loss_scale_window": 1000,
+      "initial_scale_power": 16,
+      "hysteresis": 2,
+      "min_loss_scale": 1
+    },
+    "bf16": {
+      "enabled": "auto"
+    },
+    "zero_optimization": {
+      "stage": 3,
+      "offload_optimizer": {
+        "device": "none",
+        "pin_memory": true
+      },
+      "offload_param": {
+        "device": "none",
+        "pin_memory": true
+      },
+      "overlap_comm": false,
+      "contiguous_gradients": true,
+      "sub_group_size": 1000000000.0,
+      "reduce_bucket_size": "auto",
+      "zero_quantized_weights": false,
+      "zero_quantized_gradients": false,
+      "stage3_prefetch_bucket_size": "auto",
+      "stage3_param_persistence_threshold": "auto",
+      "stage3_max_live_parameters": 1000000000.0,
+      "stage3_max_reuse_distance": 1000000000.0,
+      "stage3_gather_16bit_weights_on_model_save": true
+    },
+    "gradient_accumulation_steps": "auto",
+    "gradient_clipping": "auto",
+    "steps_per_print": 2000,
+    "train_batch_size": "auto",
+    "train_micro_batch_size_per_gpu": "auto",
+    "wall_clock_breakdown": false
+  },
+  "label_smoothing_factor": 0.0,
+  "optim": "adamw_torch",
+  "optim_args": null,
+  "adafactor": false,
+  "group_by_length": false,
+  "length_column_name": "length",
+  "report_to": [
+    "tensorboard"
+  ],
+  "ddp_find_unused_parameters": null,
+  "ddp_bucket_cap_mb": null,
+  "ddp_broadcast_buffers": null,
+  "dataloader_pin_memory": true,
+  "dataloader_persistent_workers": false,
+  "skip_memory_metrics": true,
+  "use_legacy_prediction_loop": false,
+  "push_to_hub": false,
+  "resume_from_checkpoint": null,
+  "hub_model_id": null,
+  "hub_strategy": "every_save",
+  "hub_private_repo": null,
+  "hub_always_push": false,
+  "gradient_checkpointing": true,
+  "gradient_checkpointing_kwargs": null,
+  "include_inputs_for_metrics": false,
+  "include_for_metrics": [],
+  "eval_do_concat_batches": true,
+  "fp16_backend": "auto",
+  "push_to_hub_model_id": null,
+  "push_to_hub_organization": null,
+  "push_to_hub_token": null,
+  "mp_parameters": "",
+  "auto_find_batch_size": false,
+  "full_determinism": false,
+  "torchdynamo": null,
+  "ray_scope": "last",
+  "ddp_timeout": 1800,
+  "torch_compile": false,
+  "torch_compile_backend": null,
+  "torch_compile_mode": null,
+  "include_tokens_per_second": false,
+  "include_num_input_tokens_seen": false,
+  "neftune_noise_alpha": null,
+  "optim_target_modules": null,
+  "batch_eval_metrics": false,
+  "eval_on_start": false,
+  "use_liger_kernel": false,
+  "eval_use_gather_object": false,
+  "average_tokens_across_devices": false,
+  "sortish_sampler": false,
+  "predict_with_generate": false,
+  "generation_max_length": null,
+  "generation_num_beams": null,
+  "generation_config": null,
+  "check_model": true,
+  "acc_strategy": "token",
+  "train_dataloader_shuffle": true,
+  "metric_warmup_step": 0,
+  "fsdp_num": 1,
+  "acc_steps": 1,
+  "eval_use_evalscope": false,
+  "eval_datasets": [],
+  "eval_limit": null,
+  "eval_datasets_args": null,
+  "eval_generation_config": null,
+  "freeze_parameters": [
+    "visual",
+    "visual.merger"
+  ],
+  "freeze_parameters_ratio": 0.0,
+  "trainable_parameters": [],
+  "freeze_llm": false,
+  "freeze_vit": true,
+  "freeze_aligner": true,
+  "target_modules": [
+    "all-linear"
+  ],
+  "target_regex": null,
+  "modules_to_save": [],
+  "lora_rank": 64,
+  "lora_alpha": 32,
+  "lora_dropout": 0.05,
+  "lora_bias": "none",
+  "lora_dtype": null,
+  "lorap_lr_ratio": null,
+  "use_rslora": false,
+  "use_dora": false,
+  "lora_ga_batch_size": 2,
+  "lora_ga_iters": 2,
+  "lora_ga_max_length": 1024,
+  "lora_ga_direction": "ArB2r",
+  "lora_ga_scale": "stable",
+  "lora_ga_stable_gamma": 16,
+  "init_weights": true,
+  "fourier_n_frequency": 2000,
+  "fourier_scaling": 300.0,
+  "boft_block_size": 4,
+  "boft_block_num": 0,
+  "boft_n_butterfly_factor": 1,
+  "boft_dropout": 0.0,
+  "vera_rank": 256,
+  "vera_projection_prng_key": 0,
+  "vera_dropout": 0.0,
+  "vera_d_initial": 0.1,
+  "adapter_act": "gelu",
+  "adapter_length": 128,
+  "use_galore": false,
+  "galore_target_modules": null,
+  "galore_rank": 128,
+  "galore_update_proj_gap": 50,
+  "galore_scale": 1.0,
+  "galore_proj_type": "std",
+  "galore_optim_per_parameter": false,
+  "galore_with_embedding": false,
+  "galore_quantization": false,
+  "galore_proj_quant": false,
+  "galore_proj_bits": 4,
+  "galore_proj_group_size": 256,
+  "galore_cos_threshold": 0.4,
+  "galore_gamma_proj": 2,
+  "galore_queue_size": 5,
+  "adalora_target_r": 8,
+  "adalora_init_r": 12,
+  "adalora_tinit": 0,
+  "adalora_tfinal": 0,
+  "adalora_deltaT": 1,
+  "adalora_beta1": 0.85,
+  "adalora_beta2": 0.85,
+  "adalora_orth_reg_weight": 0.5,
+  "llamapro_num_new_blocks": 4,
+  "llamapro_num_groups": null,
+  "lisa_activated_layers": 0,
+  "lisa_step_interval": 20,
+  "reft_layer_key": null,
+  "reft_layers": null,
+  "reft_rank": 4,
+  "reft_intervention_type": "LoreftIntervention",
+  "reft_args": null,
+  "swanlab_token": null,
+  "swanlab_project": null,
+  "swanlab_workspace": null,
+  "swanlab_exp_name": null,
+  "swanlab_mode": "cloud",
+  "add_version": true,
+  "resume_only_model": false,
+  "create_checkpoint_symlink": false,
+  "packing": false,
+  "lazy_tokenize": true,
+  "loss_type": null,
+  "optimizer": "custom",
+  "metric": null,
+  "zero_hpz_partition_size": null,
+  "rank": 0,
+  "global_world_size": 4,
+  "local_world_size": 4,
+  "model_suffix": "Qwen2.5-VL-3B-Instruct",
+  "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, config=None, task_type='causal_lm', num_labels=None)",
+  "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=<function get_model_tokenizer_qwen2_5_vl at 0x7efddeda5bd0>, model_arch='qwen2_vl', architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=[])",
+  "model_dir": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "hub": "<class 'swift.hub.hub.MSHub'>",
+  "evaluation_strategy": "steps",
+  "training_args": "Seq2SeqTrainingArguments(output_dir='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=<IntervalStrategy.STEPS: 'steps'>, prediction_loss_only=False, per_device_train_batch_size=4, per_device_eval_batch_size=4, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=<SchedulerType.COSINE: 'cosine'>, lr_scheduler_kwargs=None, warmup_ratio=0.05, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/runs', logging_strategy=<IntervalStrategy.STEPS: 'steps'>, logging_first_step=True, logging_steps=5, logging_nan_inf_filter=True, save_strategy=<SaveStrategy.STEPS: 'steps'>, save_steps=100, save_total_limit=2, save_safetensors=True, save_on_each_node=False, save_only_model=True, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=100, dataloader_num_workers=2, dataloader_prefetch_factor=10, past_index=-1, run_name='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, tp_size=0, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 3, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'offload_param': {'device': 'none', 'pin_memory': True}, 'overlap_comm': False, 'contiguous_gradients': True, 'sub_group_size': 1000000000.0, 'reduce_bucket_size': 'auto', 'zero_quantized_weights': False, 'zero_quantized_gradients': False, 'stage3_prefetch_bucket_size': 'auto', 'stage3_param_persistence_threshold': 'auto', 'stage3_max_live_parameters': 1000000000.0, 'stage3_max_reuse_distance': 1000000000.0, 'stage3_gather_16bit_weights_on_model_save': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=<OptimizerNames.ADAMW_TORCH: 'adamw_torch'>, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=<HubStrategy.EVERY_SAVE: 'every_save'>, hub_token=None, hub_private_repo=None, hub_always_push=False, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=1800, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, metric_warmup_step=0, fsdp_num=1, acc_steps=1, eval_use_evalscope=False, eval_datasets=[], eval_limit=None, eval_datasets_args=None, eval_generation_config=None, train_type='custom', optimizer='custom', local_repo_path=None, galore_config=None)"
+}

v0-20250508-223159/checkpoint-500/trainer_state.json ADDED Viewed

	@@ -0,0 +1,1089 @@

+{
+  "best_global_step": 500,
+  "best_metric": 1.84145534,
+  "best_model_checkpoint": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/checkpoint-500",
+  "epoch": 0.8336807002917882,
+  "eval_steps": 100,
+  "global_step": 500,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.0016673614005835765,
+      "grad_norm": 66.151507974008,
+      "learning_rate": 3.333333333333334e-08,
+      "loss": 2.5885090827941895,
+      "memory(GiB)": 22.52,
+      "step": 1,
+      "token_acc": 0.5925233644859813,
+      "train_speed(iter/s)": 0.015538
+    },
+    {
+      "epoch": 0.008336807002917883,
+      "grad_norm": 18.046810799704403,
+      "learning_rate": 1.6666666666666668e-07,
+      "loss": 2.8953185081481934,
+      "memory(GiB)": 40.37,
+      "step": 5,
+      "token_acc": 0.5351254480286738,
+      "train_speed(iter/s)": 0.028677
+    },
+    {
+      "epoch": 0.016673614005835766,
+      "grad_norm": 22.42233787075203,
+      "learning_rate": 3.3333333333333335e-07,
+      "loss": 2.8972284317016603,
+      "memory(GiB)": 40.37,
+      "step": 10,
+      "token_acc": 0.48271716260895703,
+      "train_speed(iter/s)": 0.032189
+    },
+    {
+      "epoch": 0.02501042100875365,
+      "grad_norm": 78.68221628982327,
+      "learning_rate": 5.000000000000001e-07,
+      "loss": 3.019224166870117,
+      "memory(GiB)": 40.37,
+      "step": 15,
+      "token_acc": 0.4233576642335766,
+      "train_speed(iter/s)": 0.033512
+    },
+    {
+      "epoch": 0.03334722801167153,
+      "grad_norm": 14.067342172356083,
+      "learning_rate": 6.666666666666667e-07,
+      "loss": 2.6378469467163086,
+      "memory(GiB)": 40.37,
+      "step": 20,
+      "token_acc": 0.5315636128196828,
+      "train_speed(iter/s)": 0.034241
+    },
+    {
+      "epoch": 0.041684035014589414,
+      "grad_norm": 15.42302796765105,
+      "learning_rate": 8.333333333333335e-07,
+      "loss": 2.9552268981933594,
+      "memory(GiB)": 40.37,
+      "step": 25,
+      "token_acc": 0.5008183306055647,
+      "train_speed(iter/s)": 0.034682
+    },
+    {
+      "epoch": 0.0500208420175073,
+      "grad_norm": 12.328721528711387,
+      "learning_rate": 1.0000000000000002e-06,
+      "loss": 2.829464340209961,
+      "memory(GiB)": 40.37,
+      "step": 30,
+      "token_acc": 0.4664549424374752,
+      "train_speed(iter/s)": 0.034997
+    },
+    {
+      "epoch": 0.05835764902042518,
+      "grad_norm": 19.22496551041839,
+      "learning_rate": 9.998094856697885e-07,
+      "loss": 2.7751808166503906,
+      "memory(GiB)": 40.37,
+      "step": 35,
+      "token_acc": 0.4324596774193548,
+      "train_speed(iter/s)": 0.035202
+    },
+    {
+      "epoch": 0.06669445602334306,
+      "grad_norm": 16.24767294289168,
+      "learning_rate": 9.99238087861994e-07,
+      "loss": 2.726279067993164,
+      "memory(GiB)": 40.37,
+      "step": 40,
+      "token_acc": 0.48909557408595256,
+      "train_speed(iter/s)": 0.035422
+    },
+    {
+      "epoch": 0.07503126302626094,
+      "grad_norm": 21.717265706221777,
+      "learning_rate": 9.982862420144986e-07,
+      "loss": 2.6006492614746093,
+      "memory(GiB)": 40.37,
+      "step": 45,
+      "token_acc": 0.44134321849105973,
+      "train_speed(iter/s)": 0.0356
+    },
+    {
+      "epoch": 0.08336807002917883,
+      "grad_norm": 51.241580059897494,
+      "learning_rate": 9.969546734883991e-07,
+      "loss": 2.6589160919189454,
+      "memory(GiB)": 40.37,
+      "step": 50,
+      "token_acc": 0.46153846153846156,
+      "train_speed(iter/s)": 0.035705
+    },
+    {
+      "epoch": 0.0917048770320967,
+      "grad_norm": 31.639449800632296,
+      "learning_rate": 9.95244397015239e-07,
+      "loss": 2.5741214752197266,
+      "memory(GiB)": 40.37,
+      "step": 55,
+      "token_acc": 0.5192943770672547,
+      "train_speed(iter/s)": 0.035771
+    },
+    {
+      "epoch": 0.1000416840350146,
+      "grad_norm": 26.452878691000056,
+      "learning_rate": 9.931567159237253e-07,
+      "loss": 2.641748809814453,
+      "memory(GiB)": 40.37,
+      "step": 60,
+      "token_acc": 0.5323529411764706,
+      "train_speed(iter/s)": 0.035864
+    },
+    {
+      "epoch": 0.10837849103793247,
+      "grad_norm": 17.167976065335807,
+      "learning_rate": 9.906932211465174e-07,
+      "loss": 2.4932350158691405,
+      "memory(GiB)": 40.37,
+      "step": 65,
+      "token_acc": 0.4754754754754755,
+      "train_speed(iter/s)": 0.035896
+    },
+    {
+      "epoch": 0.11671529804085036,
+      "grad_norm": 18.802598190849235,
+      "learning_rate": 9.87855790007845e-07,
+      "loss": 2.4108455657958983,
+      "memory(GiB)": 40.37,
+      "step": 70,
+      "token_acc": 0.4948392804482454,
+      "train_speed(iter/s)": 0.035905
+    },
+    {
+      "epoch": 0.12505210504376824,
+      "grad_norm": 10.472719628402842,
+      "learning_rate": 9.8464658479288e-07,
+      "loss": 2.4812793731689453,
+      "memory(GiB)": 40.37,
+      "step": 75,
+      "token_acc": 0.4957983193277311,
+      "train_speed(iter/s)": 0.035929
+    },
+    {
+      "epoch": 0.13338891204668613,
+      "grad_norm": 25.423686846144918,
+      "learning_rate": 9.810680510999506e-07,
+      "loss": 2.392130470275879,
+      "memory(GiB)": 59.23,
+      "step": 80,
+      "token_acc": 0.6406029203956665,
+      "train_speed(iter/s)": 0.035965
+    },
+    {
+      "epoch": 0.14172571904960402,
+      "grad_norm": 13.548571235807671,
+      "learning_rate": 9.771229159768549e-07,
+      "loss": 2.3535221099853514,
+      "memory(GiB)": 59.23,
+      "step": 85,
+      "token_acc": 0.5528120713305898,
+      "train_speed(iter/s)": 0.036012
+    },
+    {
+      "epoch": 0.15006252605252188,
+      "grad_norm": 9.343249502655699,
+      "learning_rate": 9.728141858426954e-07,
+      "loss": 2.092748260498047,
+      "memory(GiB)": 59.23,
+      "step": 90,
+      "token_acc": 0.6185185185185185,
+      "train_speed(iter/s)": 0.036025
+    },
+    {
+      "epoch": 0.15839933305543977,
+      "grad_norm": 12.84825439636651,
+      "learning_rate": 9.681451441968144e-07,
+      "loss": 2.2603179931640627,
+      "memory(GiB)": 59.23,
+      "step": 95,
+      "token_acc": 0.5625806451612904,
+      "train_speed(iter/s)": 0.036051
+    },
+    {
+      "epoch": 0.16673614005835766,
+      "grad_norm": 20.137499167393752,
+      "learning_rate": 9.631193491165798e-07,
+      "loss": 2.1494909286499024,
+      "memory(GiB)": 72.74,
+      "step": 100,
+      "token_acc": 0.7580698835274542,
+      "train_speed(iter/s)": 0.036061
+    },
+    {
+      "epoch": 0.16673614005835766,
+      "eval_loss": 2.2023122310638428,
+      "eval_runtime": 52.6566,
+      "eval_samples_per_second": 7.35,
+      "eval_steps_per_second": 0.475,
+      "eval_token_acc": 0.5591353661543519,
+      "step": 100
+    },
+    {
+      "epoch": 0.17507294706127552,
+      "grad_norm": 31.262270658879725,
+      "learning_rate": 9.577406305459252e-07,
+      "loss": 2.3257471084594727,
+      "memory(GiB)": 72.74,
+      "step": 105,
+      "token_acc": 0.5759222661396575,
+      "train_speed(iter/s)": 0.035377
+    },
+    {
+      "epoch": 0.1834097540641934,
+      "grad_norm": 17.341758332740685,
+      "learning_rate": 9.520130873767143e-07,
+      "loss": 2.1007978439331056,
+      "memory(GiB)": 72.74,
+      "step": 110,
+      "token_acc": 0.5401371520774506,
+      "train_speed(iter/s)": 0.035427
+    },
+    {
+      "epoch": 0.1917465610671113,
+      "grad_norm": 12.090791733454596,
+      "learning_rate": 9.459410843251496e-07,
+      "loss": 2.2100765228271486,
+      "memory(GiB)": 72.74,
+      "step": 115,
+      "token_acc": 0.5938957185247986,
+      "train_speed(iter/s)": 0.035464
+    },
+    {
+      "epoch": 0.2000833680700292,
+      "grad_norm": 14.65945354360213,
+      "learning_rate": 9.395292486056087e-07,
+      "loss": 2.129885673522949,
+      "memory(GiB)": 72.74,
+      "step": 120,
+      "token_acc": 0.5571059431524548,
+      "train_speed(iter/s)": 0.035497
+    },
+    {
+      "epoch": 0.20842017507294705,
+      "grad_norm": 20.955185795592147,
+      "learning_rate": 9.327824664044418e-07,
+      "loss": 2.078561782836914,
+      "memory(GiB)": 73.37,
+      "step": 125,
+      "token_acc": 0.6055045871559633,
+      "train_speed(iter/s)": 0.035534
+    },
+    {
+      "epoch": 0.21675698207586494,
+      "grad_norm": 12.581606956328924,
+      "learning_rate": 9.257058791564175e-07,
+      "loss": 2.124875068664551,
+      "memory(GiB)": 73.37,
+      "step": 130,
+      "token_acc": 0.5142463235294118,
+      "train_speed(iter/s)": 0.035582
+    },
+    {
+      "epoch": 0.22509378907878283,
+      "grad_norm": 13.605082688123597,
+      "learning_rate": 9.183048796266547e-07,
+      "loss": 2.2061405181884766,
+      "memory(GiB)": 73.37,
+      "step": 135,
+      "token_acc": 0.5257924176507147,
+      "train_speed(iter/s)": 0.03563
+    },
+    {
+      "epoch": 0.23343059608170072,
+      "grad_norm": 13.764836299774016,
+      "learning_rate": 9.105851078010267e-07,
+      "loss": 2.365943717956543,
+      "memory(GiB)": 73.37,
+      "step": 140,
+      "token_acc": 0.5246742992499013,
+      "train_speed(iter/s)": 0.035672
+    },
+    {
+      "epoch": 0.24176740308461858,
+      "grad_norm": 15.237998151609965,
+      "learning_rate": 9.025524465881684e-07,
+      "loss": 2.306344985961914,
+      "memory(GiB)": 73.37,
+      "step": 145,
+      "token_acc": 0.5653673680579511,
+      "train_speed(iter/s)": 0.035704
+    },
+    {
+      "epoch": 0.25010421008753647,
+      "grad_norm": 26.706683319752145,
+      "learning_rate": 8.942130173363629e-07,
+      "loss": 2.0439552307128905,
+      "memory(GiB)": 73.37,
+      "step": 150,
+      "token_acc": 0.5631201764057332,
+      "train_speed(iter/s)": 0.035727
+    },
+    {
+      "epoch": 0.25844101709045436,
+      "grad_norm": 48.80843897332085,
+      "learning_rate": 8.855731751687234e-07,
+      "loss": 2.094293212890625,
+      "memory(GiB)": 73.37,
+      "step": 155,
+      "token_acc": 0.5713038416763678,
+      "train_speed(iter/s)": 0.035749
+    },
+    {
+      "epoch": 0.26677782409337225,
+      "grad_norm": 15.263635854343017,
+      "learning_rate": 8.766395041402246e-07,
+      "loss": 2.1955413818359375,
+      "memory(GiB)": 73.37,
+      "step": 160,
+      "token_acc": 0.5173201370384469,
+      "train_speed(iter/s)": 0.035777
+    },
+    {
+      "epoch": 0.27511463109629014,
+      "grad_norm": 10.398850881836337,
+      "learning_rate": 8.674188122202757e-07,
+      "loss": 2.1197046279907226,
+      "memory(GiB)": 73.37,
+      "step": 165,
+      "token_acc": 0.5315372424722662,
+      "train_speed(iter/s)": 0.035794
+    },
+    {
+      "epoch": 0.28345143809920803,
+      "grad_norm": 13.880060097573867,
+      "learning_rate": 8.579181261046577e-07,
+      "loss": 2.1266895294189454,
+      "memory(GiB)": 73.37,
+      "step": 170,
+      "token_acc": 0.5184432181237293,
+      "train_speed(iter/s)": 0.035818
+    },
+    {
+      "epoch": 0.29178824510212586,
+      "grad_norm": 12.972578857357197,
+      "learning_rate": 8.481446858607781e-07,
+      "loss": 2.1367414474487303,
+      "memory(GiB)": 73.37,
+      "step": 175,
+      "token_acc": 0.5381393957523183,
+      "train_speed(iter/s)": 0.035825
+    },
+    {
+      "epoch": 0.30012505210504375,
+      "grad_norm": 27.378559722130987,
+      "learning_rate": 8.381059394103245e-07,
+      "loss": 2.0226306915283203,
+      "memory(GiB)": 73.37,
+      "step": 180,
+      "token_acc": 0.5733763903839254,
+      "train_speed(iter/s)": 0.03584
+    },
+    {
+      "epoch": 0.30846185910796164,
+      "grad_norm": 37.566462154714735,
+      "learning_rate": 8.278095368535215e-07,
+      "loss": 2.0788818359375,
+      "memory(GiB)": 73.37,
+      "step": 185,
+      "token_acc": 0.5885906040268456,
+      "train_speed(iter/s)": 0.035843
+    },
+    {
+      "epoch": 0.31679866611087953,
+      "grad_norm": 19.212837145590854,
+      "learning_rate": 8.17263324639316e-07,
+      "loss": 2.034734535217285,
+      "memory(GiB)": 73.37,
+      "step": 190,
+      "token_acc": 0.716458513663905,
+      "train_speed(iter/s)": 0.035842
+    },
+    {
+      "epoch": 0.3251354731137974,
+      "grad_norm": 17.36406198532525,
+      "learning_rate": 8.064753395859334e-07,
+      "loss": 1.9193729400634765,
+      "memory(GiB)": 73.37,
+      "step": 195,
+      "token_acc": 0.55078125,
+      "train_speed(iter/s)": 0.035858
+    },
+    {
+      "epoch": 0.3334722801167153,
+      "grad_norm": 13.789075783868897,
+      "learning_rate": 7.954538027563602e-07,
+      "loss": 2.210774803161621,
+      "memory(GiB)": 73.37,
+      "step": 200,
+      "token_acc": 0.5445278969957081,
+      "train_speed(iter/s)": 0.035873
+    },
+    {
+      "epoch": 0.3334722801167153,
+      "eval_loss": 1.962235689163208,
+      "eval_runtime": 50.5605,
+      "eval_samples_per_second": 7.654,
+      "eval_steps_per_second": 0.494,
+      "eval_token_acc": 0.5808334018246075,
+      "step": 200
+    },
+    {
+      "epoch": 0.3418090871196332,
+      "grad_norm": 27.83705818291825,
+      "learning_rate": 7.842071131934246e-07,
+      "loss": 1.980001449584961,
+      "memory(GiB)": 73.37,
+      "step": 205,
+      "token_acc": 0.6154087065455685,
+      "train_speed(iter/s)": 0.035554
+    },
+    {
+      "epoch": 0.35014589412255104,
+      "grad_norm": 45.7223229612559,
+      "learning_rate": 7.727438415192435e-07,
+      "loss": 2.071278381347656,
+      "memory(GiB)": 73.37,
+      "step": 210,
+      "token_acc": 0.5612172682236376,
+      "train_speed(iter/s)": 0.035572
+    },
+    {
+      "epoch": 0.3584827011254689,
+      "grad_norm": 40.58634252346181,
+      "learning_rate": 7.610727234039168e-07,
+      "loss": 2.0239721298217774,
+      "memory(GiB)": 73.37,
+      "step": 215,
+      "token_acc": 0.6295644522657281,
+      "train_speed(iter/s)": 0.035589
+    },
+    {
+      "epoch": 0.3668195081283868,
+      "grad_norm": 17.653250720885936,
+      "learning_rate": 7.492026529084469e-07,
+      "loss": 2.0968149185180662,
+      "memory(GiB)": 73.37,
+      "step": 220,
+      "token_acc": 0.5086447295036252,
+      "train_speed(iter/s)": 0.035609
+    },
+    {
+      "epoch": 0.3751563151313047,
+      "grad_norm": 12.109233598417216,
+      "learning_rate": 7.371426757069538e-07,
+      "loss": 2.071677398681641,
+      "memory(GiB)": 73.37,
+      "step": 225,
+      "token_acc": 0.538562091503268,
+      "train_speed(iter/s)": 0.035628
+    },
+    {
+      "epoch": 0.3834931221342226,
+      "grad_norm": 15.017493193481762,
+      "learning_rate": 7.24901982193353e-07,
+      "loss": 1.9428871154785157,
+      "memory(GiB)": 73.37,
+      "step": 230,
+      "token_acc": 0.565931863727455,
+      "train_speed(iter/s)": 0.035646
+    },
+    {
+      "epoch": 0.3918299291371405,
+      "grad_norm": 54.06229597216968,
+      "learning_rate": 7.12489900477749e-07,
+      "loss": 2.1239837646484374,
+      "memory(GiB)": 73.37,
+      "step": 235,
+      "token_acc": 0.5858555588852262,
+      "train_speed(iter/s)": 0.035662
+    },
+    {
+      "epoch": 0.4001667361400584,
+      "grad_norm": 17.07968196318303,
+      "learning_rate": 6.9991588927788e-07,
+      "loss": 2.1555171966552735,
+      "memory(GiB)": 73.37,
+      "step": 240,
+      "token_acc": 0.5906432748538012,
+      "train_speed(iter/s)": 0.035681
+    },
+    {
+      "epoch": 0.40850354314297627,
+      "grad_norm": 12.763401873866906,
+      "learning_rate": 6.871895307110333e-07,
+      "loss": 2.008000946044922,
+      "memory(GiB)": 75.81,
+      "step": 245,
+      "token_acc": 0.6288687299893276,
+      "train_speed(iter/s)": 0.035689
+    },
+    {
+      "epoch": 0.4168403501458941,
+      "grad_norm": 27.564341740152038,
+      "learning_rate": 6.743205229919224e-07,
+      "loss": 1.896212387084961,
+      "memory(GiB)": 75.81,
+      "step": 250,
+      "token_acc": 0.5528244933160845,
+      "train_speed(iter/s)": 0.035699
+    },
+    {
+      "epoch": 0.425177157148812,
+      "grad_norm": 8.844275761685454,
+      "learning_rate": 6.613186730420918e-07,
+      "loss": 2.200906753540039,
+      "memory(GiB)": 75.81,
+      "step": 255,
+      "token_acc": 0.5972680169571362,
+      "train_speed(iter/s)": 0.035709
+    },
+    {
+      "epoch": 0.4335139641517299,
+      "grad_norm": 16.848717163331084,
+      "learning_rate": 6.481938890164801e-07,
+      "loss": 2.0395198822021485,
+      "memory(GiB)": 75.81,
+      "step": 260,
+      "token_acc": 0.5625292740046839,
+      "train_speed(iter/s)": 0.035727
+    },
+    {
+      "epoch": 0.44185077115464777,
+      "grad_norm": 20.902788252644342,
+      "learning_rate": 6.349561727528389e-07,
+      "loss": 2.104880523681641,
+      "memory(GiB)": 75.81,
+      "step": 265,
+      "token_acc": 0.5611555009219422,
+      "train_speed(iter/s)": 0.035733
+    },
+    {
+      "epoch": 0.45018757815756566,
+      "grad_norm": 18.45925674176476,
+      "learning_rate": 6.216156121497579e-07,
+      "loss": 1.9798891067504882,
+      "memory(GiB)": 75.81,
+      "step": 270,
+      "token_acc": 0.6021021021021021,
+      "train_speed(iter/s)": 0.035741
+    },
+    {
+      "epoch": 0.45852438516048355,
+      "grad_norm": 12.732932455191273,
+      "learning_rate": 6.081823734791091e-07,
+      "loss": 2.020387077331543,
+      "memory(GiB)": 75.81,
+      "step": 275,
+      "token_acc": 0.5436971405557793,
+      "train_speed(iter/s)": 0.035755
+    },
+    {
+      "epoch": 0.46686119216340144,
+      "grad_norm": 7.6372746463330925,
+      "learning_rate": 5.946666936387637e-07,
+      "loss": 2.023111343383789,
+      "memory(GiB)": 75.81,
+      "step": 280,
+      "token_acc": 0.5396678966789668,
+      "train_speed(iter/s)": 0.035775
+    },
+    {
+      "epoch": 0.4751979991663193,
+      "grad_norm": 25.56559490423313,
+      "learning_rate": 5.810788723514909e-07,
+      "loss": 2.161258316040039,
+      "memory(GiB)": 75.81,
+      "step": 285,
+      "token_acc": 0.5329046898638427,
+      "train_speed(iter/s)": 0.035785
+    },
+    {
+      "epoch": 0.48353480616923716,
+      "grad_norm": 11.764873984092567,
+      "learning_rate": 5.674292643159765e-07,
+      "loss": 2.052559661865234,
+      "memory(GiB)": 75.81,
+      "step": 290,
+      "token_acc": 0.5171411969785009,
+      "train_speed(iter/s)": 0.035797
+    },
+    {
+      "epoch": 0.49187161317215505,
+      "grad_norm": 13.528737711855719,
+      "learning_rate": 5.537282713159508e-07,
+      "loss": 2.1512161254882813,
+      "memory(GiB)": 75.81,
+      "step": 295,
+      "token_acc": 0.5537091988130564,
+      "train_speed(iter/s)": 0.035803
+    },
+    {
+      "epoch": 0.5002084201750729,
+      "grad_norm": 9.34842802491852,
+      "learning_rate": 5.399863342934324e-07,
+      "loss": 1.973059844970703,
+      "memory(GiB)": 75.81,
+      "step": 300,
+      "token_acc": 0.5164319248826291,
+      "train_speed(iter/s)": 0.035819
+    },
+    {
+      "epoch": 0.5002084201750729,
+      "eval_loss": 1.8804595470428467,
+      "eval_runtime": 50.8824,
+      "eval_samples_per_second": 7.606,
+      "eval_steps_per_second": 0.491,
+      "eval_token_acc": 0.5884770280266294,
+      "step": 300
+    },
+    {
+      "epoch": 0.5085452271779908,
+      "grad_norm": 12.57411363519473,
+      "learning_rate": 5.262139253921319e-07,
+      "loss": 1.9409519195556642,
+      "memory(GiB)": 75.81,
+      "step": 305,
+      "token_acc": 0.5972499003587086,
+      "train_speed(iter/s)": 0.035593
+    },
+    {
+      "epoch": 0.5168820341809087,
+      "grad_norm": 16.159170559339547,
+      "learning_rate": 5.124215399770783e-07,
+      "loss": 1.9933902740478515,
+      "memory(GiB)": 75.81,
+      "step": 310,
+      "token_acc": 0.614070351758794,
+      "train_speed(iter/s)": 0.035604
+    },
+    {
+      "epoch": 0.5252188411838266,
+      "grad_norm": 29.403437567392693,
+      "learning_rate": 4.986196886365488e-07,
+      "loss": 1.9107620239257812,
+      "memory(GiB)": 75.81,
+      "step": 315,
+      "token_acc": 0.6104272266473569,
+      "train_speed(iter/s)": 0.035617
+    },
+    {
+      "epoch": 0.5335556481867445,
+      "grad_norm": 8.47359030775639,
+      "learning_rate": 4.848188891723991e-07,
+      "loss": 1.9372314453125,
+      "memory(GiB)": 75.81,
+      "step": 320,
+      "token_acc": 0.5383218307301126,
+      "train_speed(iter/s)": 0.035624
+    },
+    {
+      "epoch": 0.5418924551896623,
+      "grad_norm": 23.5402968598663,
+      "learning_rate": 4.7102965858489386e-07,
+      "loss": 2.0674997329711915,
+      "memory(GiB)": 75.81,
+      "step": 325,
+      "token_acc": 0.59916142557652,
+      "train_speed(iter/s)": 0.035634
+    },
+    {
+      "epoch": 0.5502292621925803,
+      "grad_norm": 13.92445713165454,
+      "learning_rate": 4.5726250505815166e-07,
+      "loss": 1.9347122192382813,
+      "memory(GiB)": 75.81,
+      "step": 330,
+      "token_acc": 0.5613346418056918,
+      "train_speed(iter/s)": 0.035645
+    },
+    {
+      "epoch": 0.5585660691954981,
+      "grad_norm": 8.236083974165254,
+      "learning_rate": 4.4352791995230434e-07,
+      "loss": 2.034567451477051,
+      "memory(GiB)": 75.81,
+      "step": 335,
+      "token_acc": 0.603348888278891,
+      "train_speed(iter/s)": 0.035658
+    },
+    {
+      "epoch": 0.5669028761984161,
+      "grad_norm": 19.864580375138843,
+      "learning_rate": 4.29836369808481e-07,
+      "loss": 1.9714237213134767,
+      "memory(GiB)": 75.81,
+      "step": 340,
+      "token_acc": 0.5345640219952867,
+      "train_speed(iter/s)": 0.035668
+    },
+    {
+      "epoch": 0.5752396832013339,
+      "grad_norm": 24.596139360443402,
+      "learning_rate": 4.161982883727021e-07,
+      "loss": 1.8711158752441406,
+      "memory(GiB)": 75.81,
+      "step": 345,
+      "token_acc": 0.6478540047313281,
+      "train_speed(iter/s)": 0.035677
+    },
+    {
+      "epoch": 0.5835764902042517,
+      "grad_norm": 22.60234592711427,
+      "learning_rate": 4.026240686447682e-07,
+      "loss": 1.995640182495117,
+      "memory(GiB)": 75.81,
+      "step": 350,
+      "token_acc": 0.5331266950794266,
+      "train_speed(iter/s)": 0.035689
+    },
+    {
+      "epoch": 0.5919132972071697,
+      "grad_norm": 11.421431658394818,
+      "learning_rate": 3.891240549581979e-07,
+      "loss": 2.0091426849365233,
+      "memory(GiB)": 75.81,
+      "step": 355,
+      "token_acc": 0.5572077653862041,
+      "train_speed(iter/s)": 0.035698
+    },
+    {
+      "epoch": 0.6002501042100875,
+      "grad_norm": 9.96900988873536,
+      "learning_rate": 3.757085350972524e-07,
+      "loss": 2.0257272720336914,
+      "memory(GiB)": 75.81,
+      "step": 360,
+      "token_acc": 0.5803937653814603,
+      "train_speed(iter/s)": 0.035706
+    },
+    {
+      "epoch": 0.6085869112130055,
+      "grad_norm": 18.56543999617741,
+      "learning_rate": 3.623877324570549e-07,
+      "loss": 1.8984945297241211,
+      "memory(GiB)": 75.81,
+      "step": 365,
+      "token_acc": 0.535421686746988,
+      "train_speed(iter/s)": 0.035714
+    },
+    {
+      "epoch": 0.6169237182159233,
+      "grad_norm": 26.643097778977424,
+      "learning_rate": 3.4917179825277656e-07,
+      "loss": 2.089377021789551,
+      "memory(GiB)": 75.81,
+      "step": 370,
+      "token_acc": 0.5212169735788631,
+      "train_speed(iter/s)": 0.035721
+    },
+    {
+      "epoch": 0.6252605252188412,
+      "grad_norm": 17.57538015227382,
+      "learning_rate": 3.3607080378383007e-07,
+      "loss": 1.960220718383789,
+      "memory(GiB)": 75.81,
+      "step": 375,
+      "token_acc": 0.5324612403100775,
+      "train_speed(iter/s)": 0.03573
+    },
+    {
+      "epoch": 0.6335973322217591,
+      "grad_norm": 10.370878007086118,
+      "learning_rate": 3.2309473275896024e-07,
+      "loss": 1.954535675048828,
+      "memory(GiB)": 75.81,
+      "step": 380,
+      "token_acc": 0.5692380278367539,
+      "train_speed(iter/s)": 0.03574
+    },
+    {
+      "epoch": 0.6419341392246769,
+      "grad_norm": 16.720641132769824,
+      "learning_rate": 3.102534736880878e-07,
+      "loss": 1.8954902648925782,
+      "memory(GiB)": 75.81,
+      "step": 385,
+      "token_acc": 0.5459272097053726,
+      "train_speed(iter/s)": 0.035748
+    },
+    {
+      "epoch": 0.6502709462275948,
+      "grad_norm": 12.094162861364651,
+      "learning_rate": 2.975568123466967e-07,
+      "loss": 1.9916807174682618,
+      "memory(GiB)": 75.81,
+      "step": 390,
+      "token_acc": 0.6003868471953578,
+      "train_speed(iter/s)": 0.03576
+    },
+    {
+      "epoch": 0.6586077532305127,
+      "grad_norm": 10.004610775669486,
+      "learning_rate": 2.85014424318512e-07,
+      "loss": 2.020763397216797,
+      "memory(GiB)": 75.81,
+      "step": 395,
+      "token_acc": 0.5471991701244814,
+      "train_speed(iter/s)": 0.035767
+    },
+    {
+      "epoch": 0.6669445602334306,
+      "grad_norm": 26.06737818600669,
+      "learning_rate": 2.7263586762215203e-07,
+      "loss": 1.910881805419922,
+      "memory(GiB)": 75.81,
+      "step": 400,
+      "token_acc": 0.5857530003871467,
+      "train_speed(iter/s)": 0.035777
+    },
+    {
+      "epoch": 0.6669445602334306,
+      "eval_loss": 1.851564645767212,
+      "eval_runtime": 50.6568,
+      "eval_samples_per_second": 7.64,
+      "eval_steps_per_second": 0.494,
+      "eval_token_acc": 0.5913536615435193,
+      "step": 400
+    },
+    {
+      "epoch": 0.6752813672363485,
+      "grad_norm": 10.894959246959745,
+      "learning_rate": 2.604305754273684e-07,
+      "loss": 2.1037982940673827,
+      "memory(GiB)": 75.81,
+      "step": 405,
+      "token_acc": 0.5681364543639993,
+      "train_speed(iter/s)": 0.035611
+    },
+    {
+      "epoch": 0.6836181742392664,
+      "grad_norm": 22.40605988808449,
+      "learning_rate": 2.4840784886643134e-07,
+      "loss": 1.7482885360717773,
+      "memory(GiB)": 75.81,
+      "step": 410,
+      "token_acc": 0.6083617747440273,
+      "train_speed(iter/s)": 0.035622
+    },
+    {
+      "epoch": 0.6919549812421842,
+      "grad_norm": 13.883087969470736,
+      "learning_rate": 2.3657684994613286e-07,
+      "loss": 1.9951847076416016,
+      "memory(GiB)": 75.81,
+      "step": 415,
+      "token_acc": 0.5066079295154186,
+      "train_speed(iter/s)": 0.035632
+    },
+    {
+      "epoch": 0.7002917882451021,
+      "grad_norm": 17.36765294429116,
+      "learning_rate": 2.2494659456581355e-07,
+      "loss": 2.1205303192138674,
+      "memory(GiB)": 75.81,
+      "step": 420,
+      "token_acc": 0.5367736692401462,
+      "train_speed(iter/s)": 0.035639
+    },
+    {
+      "epoch": 0.70862859524802,
+      "grad_norm": 13.304005930459187,
+      "learning_rate": 2.135259456467291e-07,
+      "loss": 2.0016607284545898,
+      "memory(GiB)": 75.81,
+      "step": 425,
+      "token_acc": 0.6043010752688172,
+      "train_speed(iter/s)": 0.035647
+    },
+    {
+      "epoch": 0.7169654022509379,
+      "grad_norm": 11.767328320827703,
+      "learning_rate": 2.0232360637799688e-07,
+      "loss": 2.051949691772461,
+      "memory(GiB)": 75.81,
+      "step": 430,
+      "token_acc": 0.5078066914498142,
+      "train_speed(iter/s)": 0.035658
+    },
+    {
+      "epoch": 0.7253022092538558,
+      "grad_norm": 10.934821929469377,
+      "learning_rate": 1.913481135842676e-07,
+      "loss": 2.091727447509766,
+      "memory(GiB)": 75.81,
+      "step": 435,
+      "token_acc": 0.5488389237007003,
+      "train_speed(iter/s)": 0.035668
+    },
+    {
+      "epoch": 0.7336390162567736,
+      "grad_norm": 11.977136051875894,
+      "learning_rate": 1.806078312201745e-07,
+      "loss": 1.9599157333374024,
+      "memory(GiB)": 75.81,
+      "step": 440,
+      "token_acc": 0.5574085952533675,
+      "train_speed(iter/s)": 0.035676
+    },
+    {
+      "epoch": 0.7419758232596916,
+      "grad_norm": 20.627732647045168,
+      "learning_rate": 1.7011094399652107e-07,
+      "loss": 1.981085205078125,
+      "memory(GiB)": 75.81,
+      "step": 445,
+      "token_acc": 0.5229176934450468,
+      "train_speed(iter/s)": 0.035667
+    },
+    {
+      "epoch": 0.7503126302626094,
+      "grad_norm": 14.670351734931344,
+      "learning_rate": 1.5986545114306202e-07,
+      "loss": 1.9209590911865235,
+      "memory(GiB)": 75.81,
+      "step": 450,
+      "token_acc": 0.6134969325153374,
+      "train_speed(iter/s)": 0.035666
+    },
+    {
+      "epoch": 0.7586494372655272,
+      "grad_norm": 16.134657938660713,
+      "learning_rate": 1.4987916031263236e-07,
+      "loss": 2.0653968811035157,
+      "memory(GiB)": 75.81,
+      "step": 455,
+      "token_acc": 0.6054333764553687,
+      "train_speed(iter/s)": 0.03566
+    },
+    {
+      "epoch": 0.7669862442684452,
+      "grad_norm": 11.523986096197236,
+      "learning_rate": 1.4015968163126733e-07,
+      "loss": 2.0374345779418945,
+      "memory(GiB)": 75.81,
+      "step": 460,
+      "token_acc": 0.5376560612162706,
+      "train_speed(iter/s)": 0.035644
+    },
+    {
+      "epoch": 0.775323051271363,
+      "grad_norm": 10.677303962923144,
+      "learning_rate": 1.307144218988507e-07,
+      "loss": 2.0082700729370115,
+      "memory(GiB)": 75.81,
+      "step": 465,
+      "token_acc": 0.5476498490728763,
+      "train_speed(iter/s)": 0.035637
+    },
+    {
+      "epoch": 0.783659858274281,
+      "grad_norm": 12.60923777318339,
+      "learning_rate": 1.215505789447093e-07,
+      "loss": 1.9037700653076173,
+      "memory(GiB)": 75.81,
+      "step": 470,
+      "token_acc": 0.5185313474194666,
+      "train_speed(iter/s)": 0.035622
+    },
+    {
+      "epoch": 0.7919966652771988,
+      "grad_norm": 10.817188917244303,
+      "learning_rate": 1.1267513614245291e-07,
+      "loss": 1.9895664215087892,
+      "memory(GiB)": 75.81,
+      "step": 475,
+      "token_acc": 0.5333613092740244,
+      "train_speed(iter/s)": 0.035626
+    },
+    {
+      "epoch": 0.8003334722801168,
+      "grad_norm": 18.630074276098856,
+      "learning_rate": 1.0409485708824507e-07,
+      "loss": 1.9701526641845704,
+      "memory(GiB)": 75.81,
+      "step": 480,
+      "token_acc": 0.544014904517932,
+      "train_speed(iter/s)": 0.035607
+    },
+    {
+      "epoch": 0.8086702792830346,
+      "grad_norm": 12.406562481684025,
+      "learning_rate": 9.581628044655396e-08,
+      "loss": 2.0273895263671875,
+      "memory(GiB)": 75.81,
+      "step": 485,
+      "token_acc": 0.6090668236679423,
+      "train_speed(iter/s)": 0.035594
+    },
+    {
+      "epoch": 0.8170070862859525,
+      "grad_norm": 11.501013766617222,
+      "learning_rate": 8.784571496731521e-08,
+      "loss": 2.060009574890137,
+      "memory(GiB)": 75.81,
+      "step": 490,
+      "token_acc": 0.5603591619554373,
+      "train_speed(iter/s)": 0.035578
+    },
+    {
+      "epoch": 0.8253438932888704,
+      "grad_norm": 33.22370771481993,
+      "learning_rate": 8.018923467830403e-08,
+      "loss": 1.9647792816162108,
+      "memory(GiB)": 75.81,
+      "step": 495,
+      "token_acc": 0.5664860358482701,
+      "train_speed(iter/s)": 0.035566
+    },
+    {
+      "epoch": 0.8336807002917882,
+      "grad_norm": 10.308961863506491,
+      "learning_rate": 7.285267425637622e-08,
+      "loss": 1.8943672180175781,
+      "memory(GiB)": 75.81,
+      "step": 500,
+      "token_acc": 0.589119170984456,
+      "train_speed(iter/s)": 0.035555
+    },
+    {
+      "epoch": 0.8336807002917882,
+      "eval_loss": 1.841455340385437,
+      "eval_runtime": 53.013,
+      "eval_samples_per_second": 7.3,
+      "eval_steps_per_second": 0.472,
+      "eval_token_acc": 0.5934905892989233,
+      "step": 500
+    }
+  ],
+  "logging_steps": 5,
+  "max_steps": 599,
+  "num_input_tokens_seen": 0,
+  "num_train_epochs": 1,
+  "save_steps": 100,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": false
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 797044869431296.0,
+  "train_batch_size": 4,
+  "trial_name": null,
+  "trial_params": null
+}

v0-20250508-223159/checkpoint-500/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d7711329b0007bbc0410de95348d7fda12c5d2925fa116bd3faf95659f61d06b
+size 8248

v0-20250508-223159/checkpoint-500/vit.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:06287d32599183860a5ea5f90221b04bfd3bc7b5b9bfe097563b40b5033d4915
+size 1337416944

v0-20250508-223159/checkpoint-599/README.md ADDED Viewed

	@@ -0,0 +1,202 @@

+---
+base_model: /cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct
+library_name: peft
+---
+# Model Card for Model ID
+<!-- Provide a quick summary of what the model is/does. -->
+## Model Details
+### Model Description
+<!-- Provide a longer summary of what this model is. -->
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+### Model Sources [optional]
+<!-- Provide the basic links for the model. -->
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+## Uses
+<!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
+### Direct Use
+<!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
+[More Information Needed]
+### Downstream Use [optional]
+<!-- This section is for the model use when fine-tuned for a task, or when plugged into a larger ecosystem/app -->
+[More Information Needed]
+### Out-of-Scope Use
+<!-- This section addresses misuse, malicious use, and uses that the model will not work well for. -->
+[More Information Needed]
+## Bias, Risks, and Limitations
+<!-- This section is meant to convey both technical and sociotechnical limitations. -->
+[More Information Needed]
+### Recommendations
+<!-- This section is meant to convey recommendations with respect to the bias, risk, and technical limitations. -->
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+## How to Get Started with the Model
+Use the code below to get started with the model.
+[More Information Needed]
+## Training Details
+### Training Data
+<!-- This should link to a Dataset Card, perhaps with a short stub of information on what the training data is all about as well as documentation related to data pre-processing or additional filtering. -->
+[More Information Needed]
+### Training Procedure
+<!-- This relates heavily to the Technical Specifications. Content here should link to that section when it is relevant to the training procedure. -->
+#### Preprocessing [optional]
+[More Information Needed]
+#### Training Hyperparameters
+- **Training regime:** [More Information Needed] <!--fp32, fp16 mixed precision, bf16 mixed precision, bf16 non-mixed precision, fp16 non-mixed precision, fp8 mixed precision -->
+#### Speeds, Sizes, Times [optional]
+<!-- This section provides information about throughput, start/end time, checkpoint size if relevant, etc. -->
+[More Information Needed]
+## Evaluation
+<!-- This section describes the evaluation protocols and provides the results. -->
+### Testing Data, Factors & Metrics
+#### Testing Data
+<!-- This should link to a Dataset Card if possible. -->
+[More Information Needed]
+#### Factors
+<!-- These are the things the evaluation is disaggregating by, e.g., subpopulations or domains. -->
+[More Information Needed]
+#### Metrics
+<!-- These are the evaluation metrics being used, ideally with a description of why. -->
+[More Information Needed]
+### Results
+[More Information Needed]
+#### Summary
+## Model Examination [optional]
+<!-- Relevant interpretability work for the model goes here -->
+[More Information Needed]
+## Environmental Impact
+<!-- Total emissions (in grams of CO2eq) and additional considerations, such as electricity usage, go here. Edit the suggested text below accordingly -->
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+## Technical Specifications [optional]
+### Model Architecture and Objective
+[More Information Needed]
+### Compute Infrastructure
+[More Information Needed]
+#### Hardware
+[More Information Needed]
+#### Software
+[More Information Needed]
+## Citation [optional]
+<!-- If there is a paper or blog post introducing the model, the APA and Bibtex information for that should go in this section. -->
+**BibTeX:**
+[More Information Needed]
+**APA:**
+[More Information Needed]
+## Glossary [optional]
+<!-- If relevant, include terms and calculations in this section that can help readers understand the model or model card. -->
+[More Information Needed]
+## More Information [optional]
+[More Information Needed]
+## Model Card Authors [optional]
+[More Information Needed]
+## Model Card Contact
+[More Information Needed]
+### Framework versions
+- PEFT 0.15.2

v0-20250508-223159/checkpoint-599/adapter_config.json ADDED Viewed

	@@ -0,0 +1,31 @@

+{
+  "alpha_pattern": {},
+  "auto_mapping": null,
+  "base_model_name_or_path": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "bias": "none",
+  "corda_config": null,
+  "eva_config": null,
+  "exclude_modules": null,
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layer_replication": null,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "loftq_config": {},
+  "lora_alpha": 32,
+  "lora_bias": false,
+  "lora_dropout": 0.0,
+  "megatron_config": null,
+  "megatron_core": "megatron.core",
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 64,
+  "rank_pattern": {},
+  "revision": null,
+  "target_modules": "^(model).*\\.(gate_proj|down_proj|o_proj|v_proj|q_proj|up_proj|k_proj)$",
+  "task_type": "CAUSAL_LM",
+  "trainable_token_indices": null,
+  "use_dora": false,
+  "use_rslora": false
+}

v0-20250508-223159/checkpoint-599/adapter_model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5fb76570fd694db99be9e6ff53c28ab20354ac70610614018318918bc7280090
+size 239536776

v0-20250508-223159/checkpoint-599/additional_config.json ADDED Viewed

	@@ -0,0 +1 @@


1	+ {"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06}

v0-20250508-223159/checkpoint-599/args.json ADDED Viewed

	@@ -0,0 +1,371 @@

+{
+  "model": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "model_type": "qwen2_5_vl",
+  "model_revision": null,
+  "task_type": "causal_lm",
+  "torch_dtype": "bfloat16",
+  "attn_impl": null,
+  "num_labels": null,
+  "problem_type": null,
+  "rope_scaling": null,
+  "device_map": null,
+  "max_memory": {},
+  "local_repo_path": null,
+  "template": "qwen2_5_vl",
+  "system": null,
+  "max_length": 8192,
+  "truncation_strategy": "delete",
+  "max_pixels": null,
+  "agent_template": null,
+  "norm_bbox": null,
+  "response_prefix": null,
+  "padding_side": "right",
+  "loss_scale": "default",
+  "sequence_parallel_size": 1,
+  "use_chat_template": true,
+  "template_backend": "swift",
+  "dataset": [
+    "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/msdata/wei682/amazon-qwen-file/updated_merged_data.json"
+  ],
+  "val_dataset": [],
+  "split_dataset_ratio": 0.01,
+  "data_seed": 42,
+  "dataset_num_proc": 2,
+  "dataset_shuffle": true,
+  "val_dataset_shuffle": false,
+  "streaming": false,
+  "interleave_prob": null,
+  "stopping_strategy": "first_exhausted",
+  "shuffle_buffer_size": 1000,
+  "enable_cache": false,
+  "download_mode": "reuse_dataset_if_exists",
+  "columns": {},
+  "strict": false,
+  "remove_unused_columns": true,
+  "model_name": [
+    null,
+    null
+  ],
+  "model_author": [
+    null,
+    null
+  ],
+  "custom_dataset_info": [],
+  "quant_method": null,
+  "quant_bits": null,
+  "hqq_axis": null,
+  "bnb_4bit_compute_dtype": "bfloat16",
+  "bnb_4bit_quant_type": "nf4",
+  "bnb_4bit_use_double_quant": true,
+  "bnb_4bit_quant_storage": null,
+  "max_new_tokens": 64,
+  "temperature": 0.0,
+  "top_k": null,
+  "top_p": null,
+  "repetition_penalty": null,
+  "num_beams": 1,
+  "stream": false,
+  "stop_words": [],
+  "logprobs": false,
+  "top_logprobs": null,
+  "ckpt_dir": null,
+  "load_dataset_config": null,
+  "lora_modules": [],
+  "tuner_backend": "peft",
+  "train_type": "custom",
+  "adapters": [],
+  "external_plugins": [
+    "examples/train/multimodal/lora_llm_full_vit/custom_plugin.py"
+  ],
+  "seed": 42,
+  "model_kwargs": {},
+  "load_args": false,
+  "load_data_args": false,
+  "use_hf": false,
+  "hub_token": null,
+  "custom_register_path": [],
+  "ignore_args_error": false,
+  "use_swift_lora": false,
+  "output_dir": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159",
+  "overwrite_output_dir": false,
+  "do_train": false,
+  "do_eval": false,
+  "do_predict": false,
+  "eval_strategy": "steps",
+  "prediction_loss_only": false,
+  "per_device_train_batch_size": 4,
+  "per_device_eval_batch_size": 4,
+  "per_gpu_train_batch_size": null,
+  "per_gpu_eval_batch_size": null,
+  "gradient_accumulation_steps": 4,
+  "eval_accumulation_steps": null,
+  "eval_delay": 0,
+  "torch_empty_cache_steps": null,
+  "learning_rate": 1e-05,
+  "weight_decay": 0.1,
+  "adam_beta1": 0.9,
+  "adam_beta2": 0.95,
+  "adam_epsilon": 1e-08,
+  "max_grad_norm": 1.0,
+  "num_train_epochs": 1.0,
+  "max_steps": -1,
+  "lr_scheduler_type": "cosine",
+  "lr_scheduler_kwargs": null,
+  "warmup_ratio": 0.05,
+  "warmup_steps": 0,
+  "log_level": "passive",
+  "log_level_replica": "warning",
+  "log_on_each_node": true,
+  "logging_dir": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/runs",
+  "logging_strategy": "steps",
+  "logging_first_step": true,
+  "logging_steps": 5,
+  "logging_nan_inf_filter": true,
+  "save_strategy": "steps",
+  "save_steps": 100.0,
+  "save_total_limit": 2,
+  "save_safetensors": true,
+  "save_on_each_node": false,
+  "save_only_model": true,
+  "restore_callback_states_from_checkpoint": false,
+  "no_cuda": false,
+  "use_cpu": false,
+  "use_mps_device": false,
+  "jit_mode_eval": false,
+  "use_ipex": false,
+  "bf16": true,
+  "fp16": false,
+  "fp16_opt_level": "O1",
+  "half_precision_backend": "auto",
+  "bf16_full_eval": false,
+  "fp16_full_eval": false,
+  "tf32": null,
+  "local_rank": 0,
+  "ddp_backend": null,
+  "tpu_num_cores": null,
+  "tpu_metrics_debug": false,
+  "debug": null,
+  "dataloader_drop_last": false,
+  "eval_steps": 100.0,
+  "dataloader_num_workers": 2,
+  "dataloader_prefetch_factor": null,
+  "past_index": -1,
+  "run_name": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159",
+  "disable_tqdm": null,
+  "label_names": null,
+  "load_best_model_at_end": false,
+  "metric_for_best_model": "loss",
+  "greater_is_better": false,
+  "ignore_data_skip": false,
+  "fsdp": "",
+  "fsdp_min_num_params": 0,
+  "fsdp_config": null,
+  "tp_size": 0,
+  "fsdp_transformer_layer_cls_to_wrap": null,
+  "accelerator_config": {
+    "dispatch_batches": false
+  },
+  "deepspeed": {
+    "fp16": {
+      "enabled": "auto",
+      "loss_scale": 0,
+      "loss_scale_window": 1000,
+      "initial_scale_power": 16,
+      "hysteresis": 2,
+      "min_loss_scale": 1
+    },
+    "bf16": {
+      "enabled": "auto"
+    },
+    "zero_optimization": {
+      "stage": 3,
+      "offload_optimizer": {
+        "device": "none",
+        "pin_memory": true
+      },
+      "offload_param": {
+        "device": "none",
+        "pin_memory": true
+      },
+      "overlap_comm": false,
+      "contiguous_gradients": true,
+      "sub_group_size": 1000000000.0,
+      "reduce_bucket_size": "auto",
+      "zero_quantized_weights": false,
+      "zero_quantized_gradients": false,
+      "stage3_prefetch_bucket_size": "auto",
+      "stage3_param_persistence_threshold": "auto",
+      "stage3_max_live_parameters": 1000000000.0,
+      "stage3_max_reuse_distance": 1000000000.0,
+      "stage3_gather_16bit_weights_on_model_save": true
+    },
+    "gradient_accumulation_steps": "auto",
+    "gradient_clipping": "auto",
+    "steps_per_print": 2000,
+    "train_batch_size": "auto",
+    "train_micro_batch_size_per_gpu": "auto",
+    "wall_clock_breakdown": false
+  },
+  "label_smoothing_factor": 0.0,
+  "optim": "adamw_torch",
+  "optim_args": null,
+  "adafactor": false,
+  "group_by_length": false,
+  "length_column_name": "length",
+  "report_to": [
+    "tensorboard"
+  ],
+  "ddp_find_unused_parameters": null,
+  "ddp_bucket_cap_mb": null,
+  "ddp_broadcast_buffers": null,
+  "dataloader_pin_memory": true,
+  "dataloader_persistent_workers": false,
+  "skip_memory_metrics": true,
+  "use_legacy_prediction_loop": false,
+  "push_to_hub": false,
+  "resume_from_checkpoint": null,
+  "hub_model_id": null,
+  "hub_strategy": "every_save",
+  "hub_private_repo": null,
+  "hub_always_push": false,
+  "gradient_checkpointing": true,
+  "gradient_checkpointing_kwargs": null,
+  "include_inputs_for_metrics": false,
+  "include_for_metrics": [],
+  "eval_do_concat_batches": true,
+  "fp16_backend": "auto",
+  "push_to_hub_model_id": null,
+  "push_to_hub_organization": null,
+  "push_to_hub_token": null,
+  "mp_parameters": "",
+  "auto_find_batch_size": false,
+  "full_determinism": false,
+  "torchdynamo": null,
+  "ray_scope": "last",
+  "ddp_timeout": 1800,
+  "torch_compile": false,
+  "torch_compile_backend": null,
+  "torch_compile_mode": null,
+  "include_tokens_per_second": false,
+  "include_num_input_tokens_seen": false,
+  "neftune_noise_alpha": null,
+  "optim_target_modules": null,
+  "batch_eval_metrics": false,
+  "eval_on_start": false,
+  "use_liger_kernel": false,
+  "eval_use_gather_object": false,
+  "average_tokens_across_devices": false,
+  "sortish_sampler": false,
+  "predict_with_generate": false,
+  "generation_max_length": null,
+  "generation_num_beams": null,
+  "generation_config": null,
+  "check_model": true,
+  "acc_strategy": "token",
+  "train_dataloader_shuffle": true,
+  "metric_warmup_step": 0,
+  "fsdp_num": 1,
+  "acc_steps": 1,
+  "eval_use_evalscope": false,
+  "eval_datasets": [],
+  "eval_limit": null,
+  "eval_datasets_args": null,
+  "eval_generation_config": null,
+  "freeze_parameters": [
+    "visual",
+    "visual.merger"
+  ],
+  "freeze_parameters_ratio": 0.0,
+  "trainable_parameters": [],
+  "freeze_llm": false,
+  "freeze_vit": true,
+  "freeze_aligner": true,
+  "target_modules": [
+    "all-linear"
+  ],
+  "target_regex": null,
+  "modules_to_save": [],
+  "lora_rank": 64,
+  "lora_alpha": 32,
+  "lora_dropout": 0.05,
+  "lora_bias": "none",
+  "lora_dtype": null,
+  "lorap_lr_ratio": null,
+  "use_rslora": false,
+  "use_dora": false,
+  "lora_ga_batch_size": 2,
+  "lora_ga_iters": 2,
+  "lora_ga_max_length": 1024,
+  "lora_ga_direction": "ArB2r",
+  "lora_ga_scale": "stable",
+  "lora_ga_stable_gamma": 16,
+  "init_weights": true,
+  "fourier_n_frequency": 2000,
+  "fourier_scaling": 300.0,
+  "boft_block_size": 4,
+  "boft_block_num": 0,
+  "boft_n_butterfly_factor": 1,
+  "boft_dropout": 0.0,
+  "vera_rank": 256,
+  "vera_projection_prng_key": 0,
+  "vera_dropout": 0.0,
+  "vera_d_initial": 0.1,
+  "adapter_act": "gelu",
+  "adapter_length": 128,
+  "use_galore": false,
+  "galore_target_modules": null,
+  "galore_rank": 128,
+  "galore_update_proj_gap": 50,
+  "galore_scale": 1.0,
+  "galore_proj_type": "std",
+  "galore_optim_per_parameter": false,
+  "galore_with_embedding": false,
+  "galore_quantization": false,
+  "galore_proj_quant": false,
+  "galore_proj_bits": 4,
+  "galore_proj_group_size": 256,
+  "galore_cos_threshold": 0.4,
+  "galore_gamma_proj": 2,
+  "galore_queue_size": 5,
+  "adalora_target_r": 8,
+  "adalora_init_r": 12,
+  "adalora_tinit": 0,
+  "adalora_tfinal": 0,
+  "adalora_deltaT": 1,
+  "adalora_beta1": 0.85,
+  "adalora_beta2": 0.85,
+  "adalora_orth_reg_weight": 0.5,
+  "llamapro_num_new_blocks": 4,
+  "llamapro_num_groups": null,
+  "lisa_activated_layers": 0,
+  "lisa_step_interval": 20,
+  "reft_layer_key": null,
+  "reft_layers": null,
+  "reft_rank": 4,
+  "reft_intervention_type": "LoreftIntervention",
+  "reft_args": null,
+  "swanlab_token": null,
+  "swanlab_project": null,
+  "swanlab_workspace": null,
+  "swanlab_exp_name": null,
+  "swanlab_mode": "cloud",
+  "add_version": true,
+  "resume_only_model": false,
+  "create_checkpoint_symlink": false,
+  "packing": false,
+  "lazy_tokenize": true,
+  "loss_type": null,
+  "optimizer": "custom",
+  "metric": null,
+  "zero_hpz_partition_size": null,
+  "rank": 0,
+  "global_world_size": 4,
+  "local_world_size": 4,
+  "model_suffix": "Qwen2.5-VL-3B-Instruct",
+  "model_info": "ModelInfo(model_type='qwen2_5_vl', model_dir='/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct', torch_dtype=torch.bfloat16, max_model_len=128000, quant_method=None, quant_bits=None, rope_scaling={'type': 'default', 'mrope_section': [16, 24, 24], 'rope_type': 'default'}, config=None, task_type='causal_lm', num_labels=None)",
+  "model_meta": "ModelMeta(model_type='qwen2_5_vl', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-3B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-7B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-32B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', hf_model_id='Qwen/Qwen2.5-VL-72B-Instruct-AWQ', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_vl', get_function=<function get_model_tokenizer_qwen2_5_vl at 0x7efddeda5bd0>, model_arch='qwen2_vl', architectures=['Qwen2_5_VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.49', 'qwen_vl_utils>=0.0.6', 'decord'], tags=[])",
+  "model_dir": "/cpfs01/shared/llm_ddd/tanghuanze/ckpts/hf_hub/Qwen/Qwen2.5-VL-3B-Instruct",
+  "hub": "<class 'swift.hub.hub.MSHub'>",
+  "evaluation_strategy": "steps",
+  "training_args": "Seq2SeqTrainingArguments(output_dir='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=<IntervalStrategy.STEPS: 'steps'>, prediction_loss_only=False, per_device_train_batch_size=4, per_device_eval_batch_size=4, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=4, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=<SchedulerType.COSINE: 'cosine'>, lr_scheduler_kwargs=None, warmup_ratio=0.05, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/runs', logging_strategy=<IntervalStrategy.STEPS: 'steps'>, logging_first_step=True, logging_steps=5, logging_nan_inf_filter=True, save_strategy=<SaveStrategy.STEPS: 'steps'>, save_steps=100, save_total_limit=2, save_safetensors=True, save_on_each_node=False, save_only_model=True, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=100, dataloader_num_workers=2, dataloader_prefetch_factor=10, past_index=-1, run_name='/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, tp_size=0, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 3, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'offload_param': {'device': 'none', 'pin_memory': True}, 'overlap_comm': False, 'contiguous_gradients': True, 'sub_group_size': 1000000000.0, 'reduce_bucket_size': 'auto', 'zero_quantized_weights': False, 'zero_quantized_gradients': False, 'stage3_prefetch_bucket_size': 'auto', 'stage3_param_persistence_threshold': 'auto', 'stage3_max_live_parameters': 1000000000.0, 'stage3_max_reuse_distance': 1000000000.0, 'stage3_gather_16bit_weights_on_model_save': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=<OptimizerNames.ADAMW_TORCH: 'adamw_torch'>, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=<HubStrategy.EVERY_SAVE: 'every_save'>, hub_token=None, hub_private_repo=None, hub_always_push=False, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=1800, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, metric_warmup_step=0, fsdp_num=1, acc_steps=1, eval_use_evalscope=False, eval_datasets=[], eval_limit=None, eval_datasets_args=None, eval_generation_config=None, train_type='custom', optimizer='custom', local_repo_path=None, galore_config=None)"
+}

v0-20250508-223159/checkpoint-599/trainer_state.json ADDED Viewed

	@@ -0,0 +1,1288 @@

+{
+  "best_global_step": 599,
+  "best_metric": 1.83980036,
+  "best_model_checkpoint": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/checkpoint-599",
+  "epoch": 0.9987494789495623,
+  "eval_steps": 100,
+  "global_step": 599,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.0016673614005835765,
+      "grad_norm": 66.151507974008,
+      "learning_rate": 3.333333333333334e-08,
+      "loss": 2.5885090827941895,
+      "memory(GiB)": 22.52,
+      "step": 1,
+      "token_acc": 0.5925233644859813,
+      "train_speed(iter/s)": 0.015538
+    },
+    {
+      "epoch": 0.008336807002917883,
+      "grad_norm": 18.046810799704403,
+      "learning_rate": 1.6666666666666668e-07,
+      "loss": 2.8953185081481934,
+      "memory(GiB)": 40.37,
+      "step": 5,
+      "token_acc": 0.5351254480286738,
+      "train_speed(iter/s)": 0.028677
+    },
+    {
+      "epoch": 0.016673614005835766,
+      "grad_norm": 22.42233787075203,
+      "learning_rate": 3.3333333333333335e-07,
+      "loss": 2.8972284317016603,
+      "memory(GiB)": 40.37,
+      "step": 10,
+      "token_acc": 0.48271716260895703,
+      "train_speed(iter/s)": 0.032189
+    },
+    {
+      "epoch": 0.02501042100875365,
+      "grad_norm": 78.68221628982327,
+      "learning_rate": 5.000000000000001e-07,
+      "loss": 3.019224166870117,
+      "memory(GiB)": 40.37,
+      "step": 15,
+      "token_acc": 0.4233576642335766,
+      "train_speed(iter/s)": 0.033512
+    },
+    {
+      "epoch": 0.03334722801167153,
+      "grad_norm": 14.067342172356083,
+      "learning_rate": 6.666666666666667e-07,
+      "loss": 2.6378469467163086,
+      "memory(GiB)": 40.37,
+      "step": 20,
+      "token_acc": 0.5315636128196828,
+      "train_speed(iter/s)": 0.034241
+    },
+    {
+      "epoch": 0.041684035014589414,
+      "grad_norm": 15.42302796765105,
+      "learning_rate": 8.333333333333335e-07,
+      "loss": 2.9552268981933594,
+      "memory(GiB)": 40.37,
+      "step": 25,
+      "token_acc": 0.5008183306055647,
+      "train_speed(iter/s)": 0.034682
+    },
+    {
+      "epoch": 0.0500208420175073,
+      "grad_norm": 12.328721528711387,
+      "learning_rate": 1.0000000000000002e-06,
+      "loss": 2.829464340209961,
+      "memory(GiB)": 40.37,
+      "step": 30,
+      "token_acc": 0.4664549424374752,
+      "train_speed(iter/s)": 0.034997
+    },
+    {
+      "epoch": 0.05835764902042518,
+      "grad_norm": 19.22496551041839,
+      "learning_rate": 9.998094856697885e-07,
+      "loss": 2.7751808166503906,
+      "memory(GiB)": 40.37,
+      "step": 35,
+      "token_acc": 0.4324596774193548,
+      "train_speed(iter/s)": 0.035202
+    },
+    {
+      "epoch": 0.06669445602334306,
+      "grad_norm": 16.24767294289168,
+      "learning_rate": 9.99238087861994e-07,
+      "loss": 2.726279067993164,
+      "memory(GiB)": 40.37,
+      "step": 40,
+      "token_acc": 0.48909557408595256,
+      "train_speed(iter/s)": 0.035422
+    },
+    {
+      "epoch": 0.07503126302626094,
+      "grad_norm": 21.717265706221777,
+      "learning_rate": 9.982862420144986e-07,
+      "loss": 2.6006492614746093,
+      "memory(GiB)": 40.37,
+      "step": 45,
+      "token_acc": 0.44134321849105973,
+      "train_speed(iter/s)": 0.0356
+    },
+    {
+      "epoch": 0.08336807002917883,
+      "grad_norm": 51.241580059897494,
+      "learning_rate": 9.969546734883991e-07,
+      "loss": 2.6589160919189454,
+      "memory(GiB)": 40.37,
+      "step": 50,
+      "token_acc": 0.46153846153846156,
+      "train_speed(iter/s)": 0.035705
+    },
+    {
+      "epoch": 0.0917048770320967,
+      "grad_norm": 31.639449800632296,
+      "learning_rate": 9.95244397015239e-07,
+      "loss": 2.5741214752197266,
+      "memory(GiB)": 40.37,
+      "step": 55,
+      "token_acc": 0.5192943770672547,
+      "train_speed(iter/s)": 0.035771
+    },
+    {
+      "epoch": 0.1000416840350146,
+      "grad_norm": 26.452878691000056,
+      "learning_rate": 9.931567159237253e-07,
+      "loss": 2.641748809814453,
+      "memory(GiB)": 40.37,
+      "step": 60,
+      "token_acc": 0.5323529411764706,
+      "train_speed(iter/s)": 0.035864
+    },
+    {
+      "epoch": 0.10837849103793247,
+      "grad_norm": 17.167976065335807,
+      "learning_rate": 9.906932211465174e-07,
+      "loss": 2.4932350158691405,
+      "memory(GiB)": 40.37,
+      "step": 65,
+      "token_acc": 0.4754754754754755,
+      "train_speed(iter/s)": 0.035896
+    },
+    {
+      "epoch": 0.11671529804085036,
+      "grad_norm": 18.802598190849235,
+      "learning_rate": 9.87855790007845e-07,
+      "loss": 2.4108455657958983,
+      "memory(GiB)": 40.37,
+      "step": 70,
+      "token_acc": 0.4948392804482454,
+      "train_speed(iter/s)": 0.035905
+    },
+    {
+      "epoch": 0.12505210504376824,
+      "grad_norm": 10.472719628402842,
+      "learning_rate": 9.8464658479288e-07,
+      "loss": 2.4812793731689453,
+      "memory(GiB)": 40.37,
+      "step": 75,
+      "token_acc": 0.4957983193277311,
+      "train_speed(iter/s)": 0.035929
+    },
+    {
+      "epoch": 0.13338891204668613,
+      "grad_norm": 25.423686846144918,
+      "learning_rate": 9.810680510999506e-07,
+      "loss": 2.392130470275879,
+      "memory(GiB)": 59.23,
+      "step": 80,
+      "token_acc": 0.6406029203956665,
+      "train_speed(iter/s)": 0.035965
+    },
+    {
+      "epoch": 0.14172571904960402,
+      "grad_norm": 13.548571235807671,
+      "learning_rate": 9.771229159768549e-07,
+      "loss": 2.3535221099853514,
+      "memory(GiB)": 59.23,
+      "step": 85,
+      "token_acc": 0.5528120713305898,
+      "train_speed(iter/s)": 0.036012
+    },
+    {
+      "epoch": 0.15006252605252188,
+      "grad_norm": 9.343249502655699,
+      "learning_rate": 9.728141858426954e-07,
+      "loss": 2.092748260498047,
+      "memory(GiB)": 59.23,
+      "step": 90,
+      "token_acc": 0.6185185185185185,
+      "train_speed(iter/s)": 0.036025
+    },
+    {
+      "epoch": 0.15839933305543977,
+      "grad_norm": 12.84825439636651,
+      "learning_rate": 9.681451441968144e-07,
+      "loss": 2.2603179931640627,
+      "memory(GiB)": 59.23,
+      "step": 95,
+      "token_acc": 0.5625806451612904,
+      "train_speed(iter/s)": 0.036051
+    },
+    {
+      "epoch": 0.16673614005835766,
+      "grad_norm": 20.137499167393752,
+      "learning_rate": 9.631193491165798e-07,
+      "loss": 2.1494909286499024,
+      "memory(GiB)": 72.74,
+      "step": 100,
+      "token_acc": 0.7580698835274542,
+      "train_speed(iter/s)": 0.036061
+    },
+    {
+      "epoch": 0.16673614005835766,
+      "eval_loss": 2.2023122310638428,
+      "eval_runtime": 52.6566,
+      "eval_samples_per_second": 7.35,
+      "eval_steps_per_second": 0.475,
+      "eval_token_acc": 0.5591353661543519,
+      "step": 100
+    },
+    {
+      "epoch": 0.17507294706127552,
+      "grad_norm": 31.262270658879725,
+      "learning_rate": 9.577406305459252e-07,
+      "loss": 2.3257471084594727,
+      "memory(GiB)": 72.74,
+      "step": 105,
+      "token_acc": 0.5759222661396575,
+      "train_speed(iter/s)": 0.035377
+    },
+    {
+      "epoch": 0.1834097540641934,
+      "grad_norm": 17.341758332740685,
+      "learning_rate": 9.520130873767143e-07,
+      "loss": 2.1007978439331056,
+      "memory(GiB)": 72.74,
+      "step": 110,
+      "token_acc": 0.5401371520774506,
+      "train_speed(iter/s)": 0.035427
+    },
+    {
+      "epoch": 0.1917465610671113,
+      "grad_norm": 12.090791733454596,
+      "learning_rate": 9.459410843251496e-07,
+      "loss": 2.2100765228271486,
+      "memory(GiB)": 72.74,
+      "step": 115,
+      "token_acc": 0.5938957185247986,
+      "train_speed(iter/s)": 0.035464
+    },
+    {
+      "epoch": 0.2000833680700292,
+      "grad_norm": 14.65945354360213,
+      "learning_rate": 9.395292486056087e-07,
+      "loss": 2.129885673522949,
+      "memory(GiB)": 72.74,
+      "step": 120,
+      "token_acc": 0.5571059431524548,
+      "train_speed(iter/s)": 0.035497
+    },
+    {
+      "epoch": 0.20842017507294705,
+      "grad_norm": 20.955185795592147,
+      "learning_rate": 9.327824664044418e-07,
+      "loss": 2.078561782836914,
+      "memory(GiB)": 73.37,
+      "step": 125,
+      "token_acc": 0.6055045871559633,
+      "train_speed(iter/s)": 0.035534
+    },
+    {
+      "epoch": 0.21675698207586494,
+      "grad_norm": 12.581606956328924,
+      "learning_rate": 9.257058791564175e-07,
+      "loss": 2.124875068664551,
+      "memory(GiB)": 73.37,
+      "step": 130,
+      "token_acc": 0.5142463235294118,
+      "train_speed(iter/s)": 0.035582
+    },
+    {
+      "epoch": 0.22509378907878283,
+      "grad_norm": 13.605082688123597,
+      "learning_rate": 9.183048796266547e-07,
+      "loss": 2.2061405181884766,
+      "memory(GiB)": 73.37,
+      "step": 135,
+      "token_acc": 0.5257924176507147,
+      "train_speed(iter/s)": 0.03563
+    },
+    {
+      "epoch": 0.23343059608170072,
+      "grad_norm": 13.764836299774016,
+      "learning_rate": 9.105851078010267e-07,
+      "loss": 2.365943717956543,
+      "memory(GiB)": 73.37,
+      "step": 140,
+      "token_acc": 0.5246742992499013,
+      "train_speed(iter/s)": 0.035672
+    },
+    {
+      "epoch": 0.24176740308461858,
+      "grad_norm": 15.237998151609965,
+      "learning_rate": 9.025524465881684e-07,
+      "loss": 2.306344985961914,
+      "memory(GiB)": 73.37,
+      "step": 145,
+      "token_acc": 0.5653673680579511,
+      "train_speed(iter/s)": 0.035704
+    },
+    {
+      "epoch": 0.25010421008753647,
+      "grad_norm": 26.706683319752145,
+      "learning_rate": 8.942130173363629e-07,
+      "loss": 2.0439552307128905,
+      "memory(GiB)": 73.37,
+      "step": 150,
+      "token_acc": 0.5631201764057332,
+      "train_speed(iter/s)": 0.035727
+    },
+    {
+      "epoch": 0.25844101709045436,
+      "grad_norm": 48.80843897332085,
+      "learning_rate": 8.855731751687234e-07,
+      "loss": 2.094293212890625,
+      "memory(GiB)": 73.37,
+      "step": 155,
+      "token_acc": 0.5713038416763678,
+      "train_speed(iter/s)": 0.035749
+    },
+    {
+      "epoch": 0.26677782409337225,
+      "grad_norm": 15.263635854343017,
+      "learning_rate": 8.766395041402246e-07,
+      "loss": 2.1955413818359375,
+      "memory(GiB)": 73.37,
+      "step": 160,
+      "token_acc": 0.5173201370384469,
+      "train_speed(iter/s)": 0.035777
+    },
+    {
+      "epoch": 0.27511463109629014,
+      "grad_norm": 10.398850881836337,
+      "learning_rate": 8.674188122202757e-07,
+      "loss": 2.1197046279907226,
+      "memory(GiB)": 73.37,
+      "step": 165,
+      "token_acc": 0.5315372424722662,
+      "train_speed(iter/s)": 0.035794
+    },
+    {
+      "epoch": 0.28345143809920803,
+      "grad_norm": 13.880060097573867,
+      "learning_rate": 8.579181261046577e-07,
+      "loss": 2.1266895294189454,
+      "memory(GiB)": 73.37,
+      "step": 170,
+      "token_acc": 0.5184432181237293,
+      "train_speed(iter/s)": 0.035818
+    },
+    {
+      "epoch": 0.29178824510212586,
+      "grad_norm": 12.972578857357197,
+      "learning_rate": 8.481446858607781e-07,
+      "loss": 2.1367414474487303,
+      "memory(GiB)": 73.37,
+      "step": 175,
+      "token_acc": 0.5381393957523183,
+      "train_speed(iter/s)": 0.035825
+    },
+    {
+      "epoch": 0.30012505210504375,
+      "grad_norm": 27.378559722130987,
+      "learning_rate": 8.381059394103245e-07,
+      "loss": 2.0226306915283203,
+      "memory(GiB)": 73.37,
+      "step": 180,
+      "token_acc": 0.5733763903839254,
+      "train_speed(iter/s)": 0.03584
+    },
+    {
+      "epoch": 0.30846185910796164,
+      "grad_norm": 37.566462154714735,
+      "learning_rate": 8.278095368535215e-07,
+      "loss": 2.0788818359375,
+      "memory(GiB)": 73.37,
+      "step": 185,
+      "token_acc": 0.5885906040268456,
+      "train_speed(iter/s)": 0.035843
+    },
+    {
+      "epoch": 0.31679866611087953,
+      "grad_norm": 19.212837145590854,
+      "learning_rate": 8.17263324639316e-07,
+      "loss": 2.034734535217285,
+      "memory(GiB)": 73.37,
+      "step": 190,
+      "token_acc": 0.716458513663905,
+      "train_speed(iter/s)": 0.035842
+    },
+    {
+      "epoch": 0.3251354731137974,
+      "grad_norm": 17.36406198532525,
+      "learning_rate": 8.064753395859334e-07,
+      "loss": 1.9193729400634765,
+      "memory(GiB)": 73.37,
+      "step": 195,
+      "token_acc": 0.55078125,
+      "train_speed(iter/s)": 0.035858
+    },
+    {
+      "epoch": 0.3334722801167153,
+      "grad_norm": 13.789075783868897,
+      "learning_rate": 7.954538027563602e-07,
+      "loss": 2.210774803161621,
+      "memory(GiB)": 73.37,
+      "step": 200,
+      "token_acc": 0.5445278969957081,
+      "train_speed(iter/s)": 0.035873
+    },
+    {
+      "epoch": 0.3334722801167153,
+      "eval_loss": 1.962235689163208,
+      "eval_runtime": 50.5605,
+      "eval_samples_per_second": 7.654,
+      "eval_steps_per_second": 0.494,
+      "eval_token_acc": 0.5808334018246075,
+      "step": 200
+    },
+    {
+      "epoch": 0.3418090871196332,
+      "grad_norm": 27.83705818291825,
+      "learning_rate": 7.842071131934246e-07,
+      "loss": 1.980001449584961,
+      "memory(GiB)": 73.37,
+      "step": 205,
+      "token_acc": 0.6154087065455685,
+      "train_speed(iter/s)": 0.035554
+    },
+    {
+      "epoch": 0.35014589412255104,
+      "grad_norm": 45.7223229612559,
+      "learning_rate": 7.727438415192435e-07,
+      "loss": 2.071278381347656,
+      "memory(GiB)": 73.37,
+      "step": 210,
+      "token_acc": 0.5612172682236376,
+      "train_speed(iter/s)": 0.035572
+    },
+    {
+      "epoch": 0.3584827011254689,
+      "grad_norm": 40.58634252346181,
+      "learning_rate": 7.610727234039168e-07,
+      "loss": 2.0239721298217774,
+      "memory(GiB)": 73.37,
+      "step": 215,
+      "token_acc": 0.6295644522657281,
+      "train_speed(iter/s)": 0.035589
+    },
+    {
+      "epoch": 0.3668195081283868,
+      "grad_norm": 17.653250720885936,
+      "learning_rate": 7.492026529084469e-07,
+      "loss": 2.0968149185180662,
+      "memory(GiB)": 73.37,
+      "step": 220,
+      "token_acc": 0.5086447295036252,
+      "train_speed(iter/s)": 0.035609
+    },
+    {
+      "epoch": 0.3751563151313047,
+      "grad_norm": 12.109233598417216,
+      "learning_rate": 7.371426757069538e-07,
+      "loss": 2.071677398681641,
+      "memory(GiB)": 73.37,
+      "step": 225,
+      "token_acc": 0.538562091503268,
+      "train_speed(iter/s)": 0.035628
+    },
+    {
+      "epoch": 0.3834931221342226,
+      "grad_norm": 15.017493193481762,
+      "learning_rate": 7.24901982193353e-07,
+      "loss": 1.9428871154785157,
+      "memory(GiB)": 73.37,
+      "step": 230,
+      "token_acc": 0.565931863727455,
+      "train_speed(iter/s)": 0.035646
+    },
+    {
+      "epoch": 0.3918299291371405,
+      "grad_norm": 54.06229597216968,
+      "learning_rate": 7.12489900477749e-07,
+      "loss": 2.1239837646484374,
+      "memory(GiB)": 73.37,
+      "step": 235,
+      "token_acc": 0.5858555588852262,
+      "train_speed(iter/s)": 0.035662
+    },
+    {
+      "epoch": 0.4001667361400584,
+      "grad_norm": 17.07968196318303,
+      "learning_rate": 6.9991588927788e-07,
+      "loss": 2.1555171966552735,
+      "memory(GiB)": 73.37,
+      "step": 240,
+      "token_acc": 0.5906432748538012,
+      "train_speed(iter/s)": 0.035681
+    },
+    {
+      "epoch": 0.40850354314297627,
+      "grad_norm": 12.763401873866906,
+      "learning_rate": 6.871895307110333e-07,
+      "loss": 2.008000946044922,
+      "memory(GiB)": 75.81,
+      "step": 245,
+      "token_acc": 0.6288687299893276,
+      "train_speed(iter/s)": 0.035689
+    },
+    {
+      "epoch": 0.4168403501458941,
+      "grad_norm": 27.564341740152038,
+      "learning_rate": 6.743205229919224e-07,
+      "loss": 1.896212387084961,
+      "memory(GiB)": 75.81,
+      "step": 250,
+      "token_acc": 0.5528244933160845,
+      "train_speed(iter/s)": 0.035699
+    },
+    {
+      "epoch": 0.425177157148812,
+      "grad_norm": 8.844275761685454,
+      "learning_rate": 6.613186730420918e-07,
+      "loss": 2.200906753540039,
+      "memory(GiB)": 75.81,
+      "step": 255,
+      "token_acc": 0.5972680169571362,
+      "train_speed(iter/s)": 0.035709
+    },
+    {
+      "epoch": 0.4335139641517299,
+      "grad_norm": 16.848717163331084,
+      "learning_rate": 6.481938890164801e-07,
+      "loss": 2.0395198822021485,
+      "memory(GiB)": 75.81,
+      "step": 260,
+      "token_acc": 0.5625292740046839,
+      "train_speed(iter/s)": 0.035727
+    },
+    {
+      "epoch": 0.44185077115464777,
+      "grad_norm": 20.902788252644342,
+      "learning_rate": 6.349561727528389e-07,
+      "loss": 2.104880523681641,
+      "memory(GiB)": 75.81,
+      "step": 265,
+      "token_acc": 0.5611555009219422,
+      "train_speed(iter/s)": 0.035733
+    },
+    {
+      "epoch": 0.45018757815756566,
+      "grad_norm": 18.45925674176476,
+      "learning_rate": 6.216156121497579e-07,
+      "loss": 1.9798891067504882,
+      "memory(GiB)": 75.81,
+      "step": 270,
+      "token_acc": 0.6021021021021021,
+      "train_speed(iter/s)": 0.035741
+    },
+    {
+      "epoch": 0.45852438516048355,
+      "grad_norm": 12.732932455191273,
+      "learning_rate": 6.081823734791091e-07,
+      "loss": 2.020387077331543,
+      "memory(GiB)": 75.81,
+      "step": 275,
+      "token_acc": 0.5436971405557793,
+      "train_speed(iter/s)": 0.035755
+    },
+    {
+      "epoch": 0.46686119216340144,
+      "grad_norm": 7.6372746463330925,
+      "learning_rate": 5.946666936387637e-07,
+      "loss": 2.023111343383789,
+      "memory(GiB)": 75.81,
+      "step": 280,
+      "token_acc": 0.5396678966789668,
+      "train_speed(iter/s)": 0.035775
+    },
+    {
+      "epoch": 0.4751979991663193,
+      "grad_norm": 25.56559490423313,
+      "learning_rate": 5.810788723514909e-07,
+      "loss": 2.161258316040039,
+      "memory(GiB)": 75.81,
+      "step": 285,
+      "token_acc": 0.5329046898638427,
+      "train_speed(iter/s)": 0.035785
+    },
+    {
+      "epoch": 0.48353480616923716,
+      "grad_norm": 11.764873984092567,
+      "learning_rate": 5.674292643159765e-07,
+      "loss": 2.052559661865234,
+      "memory(GiB)": 75.81,
+      "step": 290,
+      "token_acc": 0.5171411969785009,
+      "train_speed(iter/s)": 0.035797
+    },
+    {
+      "epoch": 0.49187161317215505,
+      "grad_norm": 13.528737711855719,
+      "learning_rate": 5.537282713159508e-07,
+      "loss": 2.1512161254882813,
+      "memory(GiB)": 75.81,
+      "step": 295,
+      "token_acc": 0.5537091988130564,
+      "train_speed(iter/s)": 0.035803
+    },
+    {
+      "epoch": 0.5002084201750729,
+      "grad_norm": 9.34842802491852,
+      "learning_rate": 5.399863342934324e-07,
+      "loss": 1.973059844970703,
+      "memory(GiB)": 75.81,
+      "step": 300,
+      "token_acc": 0.5164319248826291,
+      "train_speed(iter/s)": 0.035819
+    },
+    {
+      "epoch": 0.5002084201750729,
+      "eval_loss": 1.8804595470428467,
+      "eval_runtime": 50.8824,
+      "eval_samples_per_second": 7.606,
+      "eval_steps_per_second": 0.491,
+      "eval_token_acc": 0.5884770280266294,
+      "step": 300
+    },
+    {
+      "epoch": 0.5085452271779908,
+      "grad_norm": 12.57411363519473,
+      "learning_rate": 5.262139253921319e-07,
+      "loss": 1.9409519195556642,
+      "memory(GiB)": 75.81,
+      "step": 305,
+      "token_acc": 0.5972499003587086,
+      "train_speed(iter/s)": 0.035593
+    },
+    {
+      "epoch": 0.5168820341809087,
+      "grad_norm": 16.159170559339547,
+      "learning_rate": 5.124215399770783e-07,
+      "loss": 1.9933902740478515,
+      "memory(GiB)": 75.81,
+      "step": 310,
+      "token_acc": 0.614070351758794,
+      "train_speed(iter/s)": 0.035604
+    },
+    {
+      "epoch": 0.5252188411838266,
+      "grad_norm": 29.403437567392693,
+      "learning_rate": 4.986196886365488e-07,
+      "loss": 1.9107620239257812,
+      "memory(GiB)": 75.81,
+      "step": 315,
+      "token_acc": 0.6104272266473569,
+      "train_speed(iter/s)": 0.035617
+    },
+    {
+      "epoch": 0.5335556481867445,
+      "grad_norm": 8.47359030775639,
+      "learning_rate": 4.848188891723991e-07,
+      "loss": 1.9372314453125,
+      "memory(GiB)": 75.81,
+      "step": 320,
+      "token_acc": 0.5383218307301126,
+      "train_speed(iter/s)": 0.035624
+    },
+    {
+      "epoch": 0.5418924551896623,
+      "grad_norm": 23.5402968598663,
+      "learning_rate": 4.7102965858489386e-07,
+      "loss": 2.0674997329711915,
+      "memory(GiB)": 75.81,
+      "step": 325,
+      "token_acc": 0.59916142557652,
+      "train_speed(iter/s)": 0.035634
+    },
+    {
+      "epoch": 0.5502292621925803,
+      "grad_norm": 13.92445713165454,
+      "learning_rate": 4.5726250505815166e-07,
+      "loss": 1.9347122192382813,
+      "memory(GiB)": 75.81,
+      "step": 330,
+      "token_acc": 0.5613346418056918,
+      "train_speed(iter/s)": 0.035645
+    },
+    {
+      "epoch": 0.5585660691954981,
+      "grad_norm": 8.236083974165254,
+      "learning_rate": 4.4352791995230434e-07,
+      "loss": 2.034567451477051,
+      "memory(GiB)": 75.81,
+      "step": 335,
+      "token_acc": 0.603348888278891,
+      "train_speed(iter/s)": 0.035658
+    },
+    {
+      "epoch": 0.5669028761984161,
+      "grad_norm": 19.864580375138843,
+      "learning_rate": 4.29836369808481e-07,
+      "loss": 1.9714237213134767,
+      "memory(GiB)": 75.81,
+      "step": 340,
+      "token_acc": 0.5345640219952867,
+      "train_speed(iter/s)": 0.035668
+    },
+    {
+      "epoch": 0.5752396832013339,
+      "grad_norm": 24.596139360443402,
+      "learning_rate": 4.161982883727021e-07,
+      "loss": 1.8711158752441406,
+      "memory(GiB)": 75.81,
+      "step": 345,
+      "token_acc": 0.6478540047313281,
+      "train_speed(iter/s)": 0.035677
+    },
+    {
+      "epoch": 0.5835764902042517,
+      "grad_norm": 22.60234592711427,
+      "learning_rate": 4.026240686447682e-07,
+      "loss": 1.995640182495117,
+      "memory(GiB)": 75.81,
+      "step": 350,
+      "token_acc": 0.5331266950794266,
+      "train_speed(iter/s)": 0.035689
+    },
+    {
+      "epoch": 0.5919132972071697,
+      "grad_norm": 11.421431658394818,
+      "learning_rate": 3.891240549581979e-07,
+      "loss": 2.0091426849365233,
+      "memory(GiB)": 75.81,
+      "step": 355,
+      "token_acc": 0.5572077653862041,
+      "train_speed(iter/s)": 0.035698
+    },
+    {
+      "epoch": 0.6002501042100875,
+      "grad_norm": 9.96900988873536,
+      "learning_rate": 3.757085350972524e-07,
+      "loss": 2.0257272720336914,
+      "memory(GiB)": 75.81,
+      "step": 360,
+      "token_acc": 0.5803937653814603,
+      "train_speed(iter/s)": 0.035706
+    },
+    {
+      "epoch": 0.6085869112130055,
+      "grad_norm": 18.56543999617741,
+      "learning_rate": 3.623877324570549e-07,
+      "loss": 1.8984945297241211,
+      "memory(GiB)": 75.81,
+      "step": 365,
+      "token_acc": 0.535421686746988,
+      "train_speed(iter/s)": 0.035714
+    },
+    {
+      "epoch": 0.6169237182159233,
+      "grad_norm": 26.643097778977424,
+      "learning_rate": 3.4917179825277656e-07,
+      "loss": 2.089377021789551,
+      "memory(GiB)": 75.81,
+      "step": 370,
+      "token_acc": 0.5212169735788631,
+      "train_speed(iter/s)": 0.035721
+    },
+    {
+      "epoch": 0.6252605252188412,
+      "grad_norm": 17.57538015227382,
+      "learning_rate": 3.3607080378383007e-07,
+      "loss": 1.960220718383789,
+      "memory(GiB)": 75.81,
+      "step": 375,
+      "token_acc": 0.5324612403100775,
+      "train_speed(iter/s)": 0.03573
+    },
+    {
+      "epoch": 0.6335973322217591,
+      "grad_norm": 10.370878007086118,
+      "learning_rate": 3.2309473275896024e-07,
+      "loss": 1.954535675048828,
+      "memory(GiB)": 75.81,
+      "step": 380,
+      "token_acc": 0.5692380278367539,
+      "train_speed(iter/s)": 0.03574
+    },
+    {
+      "epoch": 0.6419341392246769,
+      "grad_norm": 16.720641132769824,
+      "learning_rate": 3.102534736880878e-07,
+      "loss": 1.8954902648925782,
+      "memory(GiB)": 75.81,
+      "step": 385,
+      "token_acc": 0.5459272097053726,
+      "train_speed(iter/s)": 0.035748
+    },
+    {
+      "epoch": 0.6502709462275948,
+      "grad_norm": 12.094162861364651,
+      "learning_rate": 2.975568123466967e-07,
+      "loss": 1.9916807174682618,
+      "memory(GiB)": 75.81,
+      "step": 390,
+      "token_acc": 0.6003868471953578,
+      "train_speed(iter/s)": 0.03576
+    },
+    {
+      "epoch": 0.6586077532305127,
+      "grad_norm": 10.004610775669486,
+      "learning_rate": 2.85014424318512e-07,
+      "loss": 2.020763397216797,
+      "memory(GiB)": 75.81,
+      "step": 395,
+      "token_acc": 0.5471991701244814,
+      "train_speed(iter/s)": 0.035767
+    },
+    {
+      "epoch": 0.6669445602334306,
+      "grad_norm": 26.06737818600669,
+      "learning_rate": 2.7263586762215203e-07,
+      "loss": 1.910881805419922,
+      "memory(GiB)": 75.81,
+      "step": 400,
+      "token_acc": 0.5857530003871467,
+      "train_speed(iter/s)": 0.035777
+    },
+    {
+      "epoch": 0.6669445602334306,
+      "eval_loss": 1.851564645767212,
+      "eval_runtime": 50.6568,
+      "eval_samples_per_second": 7.64,
+      "eval_steps_per_second": 0.494,
+      "eval_token_acc": 0.5913536615435193,
+      "step": 400
+    },
+    {
+      "epoch": 0.6752813672363485,
+      "grad_norm": 10.894959246959745,
+      "learning_rate": 2.604305754273684e-07,
+      "loss": 2.1037982940673827,
+      "memory(GiB)": 75.81,
+      "step": 405,
+      "token_acc": 0.5681364543639993,
+      "train_speed(iter/s)": 0.035611
+    },
+    {
+      "epoch": 0.6836181742392664,
+      "grad_norm": 22.40605988808449,
+      "learning_rate": 2.4840784886643134e-07,
+      "loss": 1.7482885360717773,
+      "memory(GiB)": 75.81,
+      "step": 410,
+      "token_acc": 0.6083617747440273,
+      "train_speed(iter/s)": 0.035622
+    },
+    {
+      "epoch": 0.6919549812421842,
+      "grad_norm": 13.883087969470736,
+      "learning_rate": 2.3657684994613286e-07,
+      "loss": 1.9951847076416016,
+      "memory(GiB)": 75.81,
+      "step": 415,
+      "token_acc": 0.5066079295154186,
+      "train_speed(iter/s)": 0.035632
+    },
+    {
+      "epoch": 0.7002917882451021,
+      "grad_norm": 17.36765294429116,
+      "learning_rate": 2.2494659456581355e-07,
+      "loss": 2.1205303192138674,
+      "memory(GiB)": 75.81,
+      "step": 420,
+      "token_acc": 0.5367736692401462,
+      "train_speed(iter/s)": 0.035639
+    },
+    {
+      "epoch": 0.70862859524802,
+      "grad_norm": 13.304005930459187,
+      "learning_rate": 2.135259456467291e-07,
+      "loss": 2.0016607284545898,
+      "memory(GiB)": 75.81,
+      "step": 425,
+      "token_acc": 0.6043010752688172,
+      "train_speed(iter/s)": 0.035647
+    },
+    {
+      "epoch": 0.7169654022509379,
+      "grad_norm": 11.767328320827703,
+      "learning_rate": 2.0232360637799688e-07,
+      "loss": 2.051949691772461,
+      "memory(GiB)": 75.81,
+      "step": 430,
+      "token_acc": 0.5078066914498142,
+      "train_speed(iter/s)": 0.035658
+    },
+    {
+      "epoch": 0.7253022092538558,
+      "grad_norm": 10.934821929469377,
+      "learning_rate": 1.913481135842676e-07,
+      "loss": 2.091727447509766,
+      "memory(GiB)": 75.81,
+      "step": 435,
+      "token_acc": 0.5488389237007003,
+      "train_speed(iter/s)": 0.035668
+    },
+    {
+      "epoch": 0.7336390162567736,
+      "grad_norm": 11.977136051875894,
+      "learning_rate": 1.806078312201745e-07,
+      "loss": 1.9599157333374024,
+      "memory(GiB)": 75.81,
+      "step": 440,
+      "token_acc": 0.5574085952533675,
+      "train_speed(iter/s)": 0.035676
+    },
+    {
+      "epoch": 0.7419758232596916,
+      "grad_norm": 20.627732647045168,
+      "learning_rate": 1.7011094399652107e-07,
+      "loss": 1.981085205078125,
+      "memory(GiB)": 75.81,
+      "step": 445,
+      "token_acc": 0.5229176934450468,
+      "train_speed(iter/s)": 0.035667
+    },
+    {
+      "epoch": 0.7503126302626094,
+      "grad_norm": 14.670351734931344,
+      "learning_rate": 1.5986545114306202e-07,
+      "loss": 1.9209590911865235,
+      "memory(GiB)": 75.81,
+      "step": 450,
+      "token_acc": 0.6134969325153374,
+      "train_speed(iter/s)": 0.035666
+    },
+    {
+      "epoch": 0.7586494372655272,
+      "grad_norm": 16.134657938660713,
+      "learning_rate": 1.4987916031263236e-07,
+      "loss": 2.0653968811035157,
+      "memory(GiB)": 75.81,
+      "step": 455,
+      "token_acc": 0.6054333764553687,
+      "train_speed(iter/s)": 0.03566
+    },
+    {
+      "epoch": 0.7669862442684452,
+      "grad_norm": 11.523986096197236,
+      "learning_rate": 1.4015968163126733e-07,
+      "loss": 2.0374345779418945,
+      "memory(GiB)": 75.81,
+      "step": 460,
+      "token_acc": 0.5376560612162706,
+      "train_speed(iter/s)": 0.035644
+    },
+    {
+      "epoch": 0.775323051271363,
+      "grad_norm": 10.677303962923144,
+      "learning_rate": 1.307144218988507e-07,
+      "loss": 2.0082700729370115,
+      "memory(GiB)": 75.81,
+      "step": 465,
+      "token_acc": 0.5476498490728763,
+      "train_speed(iter/s)": 0.035637
+    },
+    {
+      "epoch": 0.783659858274281,
+      "grad_norm": 12.60923777318339,
+      "learning_rate": 1.215505789447093e-07,
+      "loss": 1.9037700653076173,
+      "memory(GiB)": 75.81,
+      "step": 470,
+      "token_acc": 0.5185313474194666,
+      "train_speed(iter/s)": 0.035622
+    },
+    {
+      "epoch": 0.7919966652771988,
+      "grad_norm": 10.817188917244303,
+      "learning_rate": 1.1267513614245291e-07,
+      "loss": 1.9895664215087892,
+      "memory(GiB)": 75.81,
+      "step": 475,
+      "token_acc": 0.5333613092740244,
+      "train_speed(iter/s)": 0.035626
+    },
+    {
+      "epoch": 0.8003334722801168,
+      "grad_norm": 18.630074276098856,
+      "learning_rate": 1.0409485708824507e-07,
+      "loss": 1.9701526641845704,
+      "memory(GiB)": 75.81,
+      "step": 480,
+      "token_acc": 0.544014904517932,
+      "train_speed(iter/s)": 0.035607
+    },
+    {
+      "epoch": 0.8086702792830346,
+      "grad_norm": 12.406562481684025,
+      "learning_rate": 9.581628044655396e-08,
+      "loss": 2.0273895263671875,
+      "memory(GiB)": 75.81,
+      "step": 485,
+      "token_acc": 0.6090668236679423,
+      "train_speed(iter/s)": 0.035594
+    },
+    {
+      "epoch": 0.8170070862859525,
+      "grad_norm": 11.501013766617222,
+      "learning_rate": 8.784571496731521e-08,
+      "loss": 2.060009574890137,
+      "memory(GiB)": 75.81,
+      "step": 490,
+      "token_acc": 0.5603591619554373,
+      "train_speed(iter/s)": 0.035578
+    },
+    {
+      "epoch": 0.8253438932888704,
+      "grad_norm": 33.22370771481993,
+      "learning_rate": 8.018923467830403e-08,
+      "loss": 1.9647792816162108,
+      "memory(GiB)": 75.81,
+      "step": 495,
+      "token_acc": 0.5664860358482701,
+      "train_speed(iter/s)": 0.035566
+    },
+    {
+      "epoch": 0.8336807002917882,
+      "grad_norm": 10.308961863506491,
+      "learning_rate": 7.285267425637622e-08,
+      "loss": 1.8943672180175781,
+      "memory(GiB)": 75.81,
+      "step": 500,
+      "token_acc": 0.589119170984456,
+      "train_speed(iter/s)": 0.035555
+    },
+    {
+      "epoch": 0.8336807002917882,
+      "eval_loss": 1.841455340385437,
+      "eval_runtime": 53.013,
+      "eval_samples_per_second": 7.3,
+      "eval_steps_per_second": 0.472,
+      "eval_token_acc": 0.5934905892989233,
+      "step": 500
+    },
+    {
+      "epoch": 0.8420175072947061,
+      "grad_norm": 37.79175722562096,
+      "learning_rate": 6.58416245811115e-08,
+      "loss": 1.965580368041992,
+      "memory(GiB)": 75.81,
+      "step": 505,
+      "token_acc": 0.6186701893439014,
+      "train_speed(iter/s)": 0.035399
+    },
+    {
+      "epoch": 0.850354314297624,
+      "grad_norm": 24.16050385246648,
+      "learning_rate": 5.916142847424128e-08,
+      "loss": 1.963150405883789,
+      "memory(GiB)": 75.81,
+      "step": 510,
+      "token_acc": 0.5708955223880597,
+      "train_speed(iter/s)": 0.035379
+    },
+    {
+      "epoch": 0.8586911213005419,
+      "grad_norm": 15.7438949054889,
+      "learning_rate": 5.2817176628113813e-08,
+      "loss": 2.0368074417114257,
+      "memory(GiB)": 75.81,
+      "step": 515,
+      "token_acc": 0.6199198626216371,
+      "train_speed(iter/s)": 0.035365
+    },
+    {
+      "epoch": 0.8670279283034598,
+      "grad_norm": 7.4025193685123485,
+      "learning_rate": 4.681370372629368e-08,
+      "loss": 1.8261062622070312,
+      "memory(GiB)": 75.81,
+      "step": 520,
+      "token_acc": 0.6130584192439863,
+      "train_speed(iter/s)": 0.035352
+    },
+    {
+      "epoch": 0.8753647353063777,
+      "grad_norm": 13.135518505589328,
+      "learning_rate": 4.115558475925602e-08,
+      "loss": 1.934758186340332,
+      "memory(GiB)": 75.81,
+      "step": 525,
+      "token_acc": 0.5475268817204301,
+      "train_speed(iter/s)": 0.035359
+    },
+    {
+      "epoch": 0.8837015423092955,
+      "grad_norm": 19.184277409106556,
+      "learning_rate": 3.584713153798214e-08,
+      "loss": 2.049375534057617,
+      "memory(GiB)": 75.81,
+      "step": 530,
+      "token_acc": 0.6246962668433841,
+      "train_speed(iter/s)": 0.035347
+    },
+    {
+      "epoch": 0.8920383493122134,
+      "grad_norm": 11.940074446149914,
+      "learning_rate": 3.089238940811162e-08,
+      "loss": 2.0804649353027345,
+      "memory(GiB)": 75.81,
+      "step": 535,
+      "token_acc": 0.5032341526520052,
+      "train_speed(iter/s)": 0.035354
+    },
+    {
+      "epoch": 0.9003751563151313,
+      "grad_norm": 24.642810743866573,
+      "learning_rate": 2.6295134167157344e-08,
+      "loss": 1.9737207412719726,
+      "memory(GiB)": 75.81,
+      "step": 540,
+      "token_acc": 0.5261572172007669,
+      "train_speed(iter/s)": 0.035353
+    },
+    {
+      "epoch": 0.9087119633180492,
+      "grad_norm": 54.778236508394166,
+      "learning_rate": 2.205886918713152e-08,
+      "loss": 2.007395553588867,
+      "memory(GiB)": 75.81,
+      "step": 545,
+      "token_acc": 0.5539083557951483,
+      "train_speed(iter/s)": 0.03535
+    },
+    {
+      "epoch": 0.9170487703209671,
+      "grad_norm": 36.78224840874843,
+      "learning_rate": 1.8186822744775234e-08,
+      "loss": 2.115570831298828,
+      "memory(GiB)": 75.81,
+      "step": 550,
+      "token_acc": 0.6467358145210494,
+      "train_speed(iter/s)": 0.035342
+    },
+    {
+      "epoch": 0.9253855773238849,
+      "grad_norm": 16.832410284721337,
+      "learning_rate": 1.4681945561426548e-08,
+      "loss": 1.9375102996826172,
+      "memory(GiB)": 75.81,
+      "step": 555,
+      "token_acc": 0.5863259668508287,
+      "train_speed(iter/s)": 0.035332
+    },
+    {
+      "epoch": 0.9337223843268029,
+      "grad_norm": 14.92095340910814,
+      "learning_rate": 1.154690855440166e-08,
+      "loss": 2.054796028137207,
+      "memory(GiB)": 75.81,
+      "step": 560,
+      "token_acc": 0.5334335086401202,
+      "train_speed(iter/s)": 0.035321
+    },
+    {
+      "epoch": 0.9420591913297207,
+      "grad_norm": 12.453189198034085,
+      "learning_rate": 8.784100801602914e-09,
+      "loss": 1.9606590270996094,
+      "memory(GiB)": 75.81,
+      "step": 565,
+      "token_acc": 0.5819064656273959,
+      "train_speed(iter/s)": 0.035328
+    },
+    {
+      "epoch": 0.9503959983326385,
+      "grad_norm": 18.92769494448578,
+      "learning_rate": 6.395627720904519e-09,
+      "loss": 2.0567882537841795,
+      "memory(GiB)": 75.81,
+      "step": 570,
+      "token_acc": 0.5344363216621778,
+      "train_speed(iter/s)": 0.035323
+    },
+    {
+      "epoch": 0.9587328053355565,
+      "grad_norm": 11.551791479769273,
+      "learning_rate": 4.383309465703145e-09,
+      "loss": 1.9462024688720703,
+      "memory(GiB)": 75.81,
+      "step": 575,
+      "token_acc": 0.5558391831525208,
+      "train_speed(iter/s)": 0.035328
+    },
+    {
+      "epoch": 0.9670696123384743,
+      "grad_norm": 19.545395968878243,
+      "learning_rate": 2.7486795378570133e-09,
+      "loss": 2.116924285888672,
+      "memory(GiB)": 75.81,
+      "step": 580,
+      "token_acc": 0.5416,
+      "train_speed(iter/s)": 0.035314
+    },
+    {
+      "epoch": 0.9754064193413923,
+      "grad_norm": 45.23026432248804,
+      "learning_rate": 1.4929836190696325e-09,
+      "loss": 2.1118099212646486,
+      "memory(GiB)": 75.81,
+      "step": 585,
+      "token_acc": 0.5194642109669317,
+      "train_speed(iter/s)": 0.035317
+    },
+    {
+      "epoch": 0.9837432263443101,
+      "grad_norm": 13.67727308495489,
+      "learning_rate": 6.17178621608594e-10,
+      "loss": 1.8825286865234374,
+      "memory(GiB)": 75.81,
+      "step": 590,
+      "token_acc": 0.6187050359712231,
+      "train_speed(iter/s)": 0.03531
+    },
+    {
+      "epoch": 0.992080033347228,
+      "grad_norm": 32.76954958831426,
+      "learning_rate": 1.2193195908388745e-10,
+      "loss": 2.0694332122802734,
+      "memory(GiB)": 75.81,
+      "step": 595,
+      "token_acc": 0.5317195325542571,
+      "train_speed(iter/s)": 0.035298
+    },
+    {
+      "epoch": 0.9987494789495623,
+      "eval_loss": 1.8398003578186035,
+      "eval_runtime": 50.6264,
+      "eval_samples_per_second": 7.644,
+      "eval_steps_per_second": 0.494,
+      "eval_token_acc": 0.5929974521245993,
+      "step": 599
+    }
+  ],
+  "logging_steps": 5,
+  "max_steps": 599,
+  "num_input_tokens_seen": 0,
+  "num_train_epochs": 1,
+  "save_steps": 100,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": true
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 954945089044480.0,
+  "train_batch_size": 4,
+  "trial_name": null,
+  "trial_params": null
+}

v0-20250508-223159/checkpoint-599/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d7711329b0007bbc0410de95348d7fda12c5d2925fa116bd3faf95659f61d06b
+size 8248

v0-20250508-223159/checkpoint-599/vit.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:962dd848e1fb72f45eb89a54b5ce9eae31491b0b0d72c539eaed32b641b5a42b
+size 1337416944

v0-20250508-223159/images/eval_loss.png ADDED Viewed

v0-20250508-223159/images/eval_runtime.png ADDED Viewed

v0-20250508-223159/images/eval_samples_per_second.png ADDED Viewed

v0-20250508-223159/images/eval_steps_per_second.png ADDED Viewed

v0-20250508-223159/images/eval_token_acc.png ADDED Viewed

v0-20250508-223159/images/train_epoch.png ADDED Viewed

v0-20250508-223159/images/train_grad_norm.png ADDED Viewed

v0-20250508-223159/images/train_learning_rate.png ADDED Viewed

v0-20250508-223159/images/train_loss.png ADDED Viewed

v0-20250508-223159/images/train_memory(GiB).png ADDED Viewed

v0-20250508-223159/images/train_token_acc.png ADDED Viewed

v0-20250508-223159/images/train_total_flos.png ADDED Viewed

v0-20250508-223159/images/train_train_loss.png ADDED Viewed

v0-20250508-223159/images/train_train_runtime.png ADDED Viewed

v0-20250508-223159/images/train_train_samples_per_second.png ADDED Viewed

v0-20250508-223159/images/train_train_speed(iter_s).png ADDED Viewed

v0-20250508-223159/images/train_train_steps_per_second.png ADDED Viewed

v0-20250508-223159/logging.jsonl ADDED Viewed

	@@ -0,0 +1,128 @@

+{"loss": 2.58850908, "token_acc": 0.59252336, "grad_norm": 66.15150797, "learning_rate": 3e-08, "memory(GiB)": 22.52, "train_speed(iter/s)": 0.015538, "epoch": 0.00166736, "global_step/max_steps": "1/599", "percentage": "0.17%", "elapsed_time": "59s", "remaining_time": "9h 52m 45s"}
+{"loss": 2.89531851, "token_acc": 0.53512545, "grad_norm": 18.0468108, "learning_rate": 1.7e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.028677, "epoch": 0.00833681, "global_step/max_steps": "5/599", "percentage": "0.83%", "elapsed_time": "2m 49s", "remaining_time": "5h 35m 33s"}
+{"loss": 2.89722843, "token_acc": 0.48271716, "grad_norm": 22.42233787, "learning_rate": 3.3e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.032189, "epoch": 0.01667361, "global_step/max_steps": "10/599", "percentage": "1.67%", "elapsed_time": "5m 5s", "remaining_time": "5h 0m 10s"}
+{"loss": 3.01922417, "token_acc": 0.42335766, "grad_norm": 78.68221629, "learning_rate": 5e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.033512, "epoch": 0.02501042, "global_step/max_steps": "15/599", "percentage": "2.50%", "elapsed_time": "7m 22s", "remaining_time": "4h 47m 16s"}
+{"loss": 2.63784695, "token_acc": 0.53156361, "grad_norm": 14.06734217, "learning_rate": 6.7e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.034241, "epoch": 0.03334723, "global_step/max_steps": "20/599", "percentage": "3.34%", "elapsed_time": "9m 39s", "remaining_time": "4h 39m 28s"}
+{"loss": 2.9552269, "token_acc": 0.50081833, "grad_norm": 15.42302797, "learning_rate": 8.3e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.034682, "epoch": 0.04168404, "global_step/max_steps": "25/599", "percentage": "4.17%", "elapsed_time": "11m 55s", "remaining_time": "4h 33m 57s"}
+{"loss": 2.82946434, "token_acc": 0.46645494, "grad_norm": 12.32872153, "learning_rate": 1e-06, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.034997, "epoch": 0.05002084, "global_step/max_steps": "30/599", "percentage": "5.01%", "elapsed_time": "14m 12s", "remaining_time": "4h 29m 25s"}
+{"loss": 2.77518082, "token_acc": 0.43245968, "grad_norm": 19.22496551, "learning_rate": 1e-06, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035202, "epoch": 0.05835765, "global_step/max_steps": "35/599", "percentage": "5.84%", "elapsed_time": "16m 29s", "remaining_time": "4h 25m 42s"}
+{"loss": 2.72627907, "token_acc": 0.48909557, "grad_norm": 16.24767294, "learning_rate": 1e-06, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035422, "epoch": 0.06669446, "global_step/max_steps": "40/599", "percentage": "6.68%", "elapsed_time": "18m 44s", "remaining_time": "4h 21m 52s"}
+{"loss": 2.60064926, "token_acc": 0.44134322, "grad_norm": 21.71726571, "learning_rate": 1e-06, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.0356, "epoch": 0.07503126, "global_step/max_steps": "45/599", "percentage": "7.51%", "elapsed_time": "20m 59s", "remaining_time": "4h 18m 21s"}
+{"loss": 2.65891609, "token_acc": 0.46153846, "grad_norm": 51.24158006, "learning_rate": 1e-06, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035705, "epoch": 0.08336807, "global_step/max_steps": "50/599", "percentage": "8.35%", "elapsed_time": "23m 15s", "remaining_time": "4h 15m 22s"}
+{"loss": 2.57412148, "token_acc": 0.51929438, "grad_norm": 31.6394498, "learning_rate": 1e-06, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035771, "epoch": 0.09170488, "global_step/max_steps": "55/599", "percentage": "9.18%", "elapsed_time": "25m 32s", "remaining_time": "4h 12m 39s"}
+{"loss": 2.64174881, "token_acc": 0.53235294, "grad_norm": 26.45287869, "learning_rate": 9.9e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035864, "epoch": 0.10004168, "global_step/max_steps": "60/599", "percentage": "10.02%", "elapsed_time": "27m 48s", "remaining_time": "4h 9m 45s"}
+{"loss": 2.49323502, "token_acc": 0.47547548, "grad_norm": 17.16797607, "learning_rate": 9.9e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035896, "epoch": 0.10837849, "global_step/max_steps": "65/599", "percentage": "10.85%", "elapsed_time": "30m 5s", "remaining_time": "4h 7m 16s"}
+{"loss": 2.41084557, "token_acc": 0.49483928, "grad_norm": 18.80259819, "learning_rate": 9.9e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035905, "epoch": 0.1167153, "global_step/max_steps": "70/599", "percentage": "11.69%", "elapsed_time": "32m 24s", "remaining_time": "4h 4m 56s"}
+{"loss": 2.48127937, "token_acc": 0.49579832, "grad_norm": 10.47271963, "learning_rate": 9.8e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035929, "epoch": 0.12505211, "global_step/max_steps": "75/599", "percentage": "12.52%", "elapsed_time": "34m 42s", "remaining_time": "4h 2m 30s"}
+{"loss": 2.39213047, "token_acc": 0.64060292, "grad_norm": 25.42368685, "learning_rate": 9.8e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.035965, "epoch": 0.13338891, "global_step/max_steps": "80/599", "percentage": "13.36%", "elapsed_time": "36m 59s", "remaining_time": "3h 59m 59s"}
+{"loss": 2.35352211, "token_acc": 0.55281207, "grad_norm": 13.54857124, "learning_rate": 9.8e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.036012, "epoch": 0.14172572, "global_step/max_steps": "85/599", "percentage": "14.19%", "elapsed_time": "39m 15s", "remaining_time": "3h 57m 23s"}
+{"loss": 2.09274826, "token_acc": 0.61851852, "grad_norm": 9.3432495, "learning_rate": 9.7e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.036025, "epoch": 0.15006253, "global_step/max_steps": "90/599", "percentage": "15.03%", "elapsed_time": "41m 33s", "remaining_time": "3h 55m 1s"}
+{"loss": 2.26031799, "token_acc": 0.56258065, "grad_norm": 12.8482544, "learning_rate": 9.7e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.036051, "epoch": 0.15839933, "global_step/max_steps": "95/599", "percentage": "15.86%", "elapsed_time": "43m 50s", "remaining_time": "3h 52m 34s"}
+{"loss": 2.14949093, "token_acc": 0.75806988, "grad_norm": 20.13749917, "learning_rate": 9.6e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.036061, "epoch": 0.16673614, "global_step/max_steps": "100/599", "percentage": "16.69%", "elapsed_time": "46m 8s", "remaining_time": "3h 50m 13s"}
+{"eval_loss": 2.20231223, "eval_token_acc": 0.55913537, "eval_runtime": 52.6566, "eval_samples_per_second": 7.35, "eval_steps_per_second": 0.475, "epoch": 0.16673614, "global_step/max_steps": "100/599", "percentage": "16.69%", "elapsed_time": "47m 0s", "remaining_time": "3h 54m 36s"}
+{"loss": 2.32574711, "token_acc": 0.57592227, "grad_norm": 31.26227066, "learning_rate": 9.6e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035377, "epoch": 0.17507295, "global_step/max_steps": "105/599", "percentage": "17.53%", "elapsed_time": "49m 23s", "remaining_time": "3h 52m 20s"}
+{"loss": 2.10079784, "token_acc": 0.54013715, "grad_norm": 17.34175833, "learning_rate": 9.5e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035427, "epoch": 0.18340975, "global_step/max_steps": "110/599", "percentage": "18.36%", "elapsed_time": "51m 40s", "remaining_time": "3h 49m 41s"}
+{"loss": 2.21007652, "token_acc": 0.59389572, "grad_norm": 12.09079173, "learning_rate": 9.5e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035464, "epoch": 0.19174656, "global_step/max_steps": "115/599", "percentage": "19.20%", "elapsed_time": "53m 57s", "remaining_time": "3h 47m 6s"}
+{"loss": 2.12988567, "token_acc": 0.55710594, "grad_norm": 14.65945354, "learning_rate": 9.4e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035497, "epoch": 0.20008337, "global_step/max_steps": "120/599", "percentage": "20.03%", "elapsed_time": "56m 15s", "remaining_time": "3h 44m 34s"}
+{"loss": 2.07856178, "token_acc": 0.60550459, "grad_norm": 20.9551858, "learning_rate": 9.3e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035534, "epoch": 0.20842018, "global_step/max_steps": "125/599", "percentage": "20.87%", "elapsed_time": "58m 32s", "remaining_time": "3h 42m 0s"}
+{"loss": 2.12487507, "token_acc": 0.51424632, "grad_norm": 12.58160696, "learning_rate": 9.3e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035582, "epoch": 0.21675698, "global_step/max_steps": "130/599", "percentage": "21.70%", "elapsed_time": "1h 0m 48s", "remaining_time": "3h 39m 23s"}
+{"loss": 2.20614052, "token_acc": 0.52579242, "grad_norm": 13.60508269, "learning_rate": 9.2e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.03563, "epoch": 0.22509379, "global_step/max_steps": "135/599", "percentage": "22.54%", "elapsed_time": "1h 3m 4s", "remaining_time": "3h 36m 46s"}
+{"loss": 2.36594372, "token_acc": 0.5246743, "grad_norm": 13.7648363, "learning_rate": 9.1e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035672, "epoch": 0.2334306, "global_step/max_steps": "140/599", "percentage": "23.37%", "elapsed_time": "1h 5m 19s", "remaining_time": "3h 34m 11s"}
+{"loss": 2.30634499, "token_acc": 0.56536737, "grad_norm": 15.23799815, "learning_rate": 9e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035704, "epoch": 0.2417674, "global_step/max_steps": "145/599", "percentage": "24.21%", "elapsed_time": "1h 7m 36s", "remaining_time": "3h 31m 40s"}
+{"loss": 2.04395523, "token_acc": 0.56312018, "grad_norm": 26.70668332, "learning_rate": 8.9e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035727, "epoch": 0.25010421, "global_step/max_steps": "150/599", "percentage": "25.04%", "elapsed_time": "1h 9m 53s", "remaining_time": "3h 29m 13s"}
+{"loss": 2.09429321, "token_acc": 0.57130384, "grad_norm": 48.80843897, "learning_rate": 8.9e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035749, "epoch": 0.25844102, "global_step/max_steps": "155/599", "percentage": "25.88%", "elapsed_time": "1h 12m 10s", "remaining_time": "3h 26m 45s"}
+{"loss": 2.19554138, "token_acc": 0.51732014, "grad_norm": 15.26363585, "learning_rate": 8.8e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035777, "epoch": 0.26677782, "global_step/max_steps": "160/599", "percentage": "26.71%", "elapsed_time": "1h 14m 27s", "remaining_time": "3h 24m 16s"}
+{"loss": 2.11970463, "token_acc": 0.53153724, "grad_norm": 10.39885088, "learning_rate": 8.7e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035794, "epoch": 0.27511463, "global_step/max_steps": "165/599", "percentage": "27.55%", "elapsed_time": "1h 16m 44s", "remaining_time": "3h 21m 52s"}
+{"loss": 2.12668953, "token_acc": 0.51844322, "grad_norm": 13.8800601, "learning_rate": 8.6e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035818, "epoch": 0.28345144, "global_step/max_steps": "170/599", "percentage": "28.38%", "elapsed_time": "1h 19m 1s", "remaining_time": "3h 19m 24s"}
+{"loss": 2.13674145, "token_acc": 0.5381394, "grad_norm": 12.97257886, "learning_rate": 8.5e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035825, "epoch": 0.29178825, "global_step/max_steps": "175/599", "percentage": "29.22%", "elapsed_time": "1h 21m 20s", "remaining_time": "3h 17m 3s"}
+{"loss": 2.02263069, "token_acc": 0.57337639, "grad_norm": 27.37855972, "learning_rate": 8.4e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.03584, "epoch": 0.30012505, "global_step/max_steps": "180/599", "percentage": "30.05%", "elapsed_time": "1h 23m 37s", "remaining_time": "3h 14m 39s"}
+{"loss": 2.07888184, "token_acc": 0.5885906, "grad_norm": 37.56646215, "learning_rate": 8.3e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035843, "epoch": 0.30846186, "global_step/max_steps": "185/599", "percentage": "30.88%", "elapsed_time": "1h 25m 56s", "remaining_time": "3h 12m 19s"}
+{"loss": 2.03473454, "token_acc": 0.71645851, "grad_norm": 19.21283715, "learning_rate": 8.2e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035842, "epoch": 0.31679867, "global_step/max_steps": "190/599", "percentage": "31.72%", "elapsed_time": "1h 28m 16s", "remaining_time": "3h 10m 0s"}
+{"loss": 1.91937294, "token_acc": 0.55078125, "grad_norm": 17.36406199, "learning_rate": 8.1e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035858, "epoch": 0.32513547, "global_step/max_steps": "195/599", "percentage": "32.55%", "elapsed_time": "1h 30m 33s", "remaining_time": "3h 7m 36s"}
+{"loss": 2.2107748, "token_acc": 0.5445279, "grad_norm": 13.78907578, "learning_rate": 8e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035873, "epoch": 0.33347228, "global_step/max_steps": "200/599", "percentage": "33.39%", "elapsed_time": "1h 32m 50s", "remaining_time": "3h 5m 12s"}
+{"eval_loss": 1.96223569, "eval_token_acc": 0.5808334, "eval_runtime": 50.5605, "eval_samples_per_second": 7.654, "eval_steps_per_second": 0.494, "epoch": 0.33347228, "global_step/max_steps": "200/599", "percentage": "33.39%", "elapsed_time": "1h 33m 40s", "remaining_time": "3h 6m 53s"}
+{"loss": 1.98000145, "token_acc": 0.61540871, "grad_norm": 27.83705818, "learning_rate": 7.8e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035554, "epoch": 0.34180909, "global_step/max_steps": "205/599", "percentage": "34.22%", "elapsed_time": "1h 36m 1s", "remaining_time": "3h 4m 32s"}
+{"loss": 2.07127838, "token_acc": 0.56121727, "grad_norm": 45.72232296, "learning_rate": 7.7e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035572, "epoch": 0.35014589, "global_step/max_steps": "210/599", "percentage": "35.06%", "elapsed_time": "1h 38m 18s", "remaining_time": "3h 2m 6s"}
+{"loss": 2.02397213, "token_acc": 0.62956445, "grad_norm": 40.58634252, "learning_rate": 7.6e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035589, "epoch": 0.3584827, "global_step/max_steps": "215/599", "percentage": "35.89%", "elapsed_time": "1h 40m 36s", "remaining_time": "2h 59m 41s"}
+{"loss": 2.09681492, "token_acc": 0.50864473, "grad_norm": 17.65325072, "learning_rate": 7.5e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035609, "epoch": 0.36681951, "global_step/max_steps": "220/599", "percentage": "36.73%", "elapsed_time": "1h 42m 53s", "remaining_time": "2h 57m 15s"}
+{"loss": 2.0716774, "token_acc": 0.53856209, "grad_norm": 12.1092336, "learning_rate": 7.4e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035628, "epoch": 0.37515632, "global_step/max_steps": "225/599", "percentage": "37.56%", "elapsed_time": "1h 45m 10s", "remaining_time": "2h 54m 49s"}
+{"loss": 1.94288712, "token_acc": 0.56593186, "grad_norm": 15.01749319, "learning_rate": 7.2e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035646, "epoch": 0.38349312, "global_step/max_steps": "230/599", "percentage": "38.40%", "elapsed_time": "1h 47m 27s", "remaining_time": "2h 52m 23s"}
+{"loss": 2.12398376, "token_acc": 0.58585556, "grad_norm": 54.06229597, "learning_rate": 7.1e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035662, "epoch": 0.39182993, "global_step/max_steps": "235/599", "percentage": "39.23%", "elapsed_time": "1h 49m 44s", "remaining_time": "2h 49m 59s"}
+{"loss": 2.1555172, "token_acc": 0.59064327, "grad_norm": 17.07968196, "learning_rate": 7e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035681, "epoch": 0.40016674, "global_step/max_steps": "240/599", "percentage": "40.07%", "elapsed_time": "1h 52m 1s", "remaining_time": "2h 47m 33s"}
+{"loss": 2.00800095, "token_acc": 0.62886873, "grad_norm": 12.76340187, "learning_rate": 6.9e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035689, "epoch": 0.40850354, "global_step/max_steps": "245/599", "percentage": "40.90%", "elapsed_time": "1h 54m 20s", "remaining_time": "2h 45m 12s"}
+{"loss": 1.89621239, "token_acc": 0.55282449, "grad_norm": 27.56434174, "learning_rate": 6.7e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035699, "epoch": 0.41684035, "global_step/max_steps": "250/599", "percentage": "41.74%", "elapsed_time": "1h 56m 38s", "remaining_time": "2h 42m 49s"}
+{"loss": 2.20090675, "token_acc": 0.59726802, "grad_norm": 8.84427576, "learning_rate": 6.6e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035709, "epoch": 0.42517716, "global_step/max_steps": "255/599", "percentage": "42.57%", "elapsed_time": "1h 58m 56s", "remaining_time": "2h 40m 26s"}
+{"loss": 2.03951988, "token_acc": 0.56252927, "grad_norm": 16.84871716, "learning_rate": 6.5e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035727, "epoch": 0.43351396, "global_step/max_steps": "260/599", "percentage": "43.41%", "elapsed_time": "2h 1m 12s", "remaining_time": "2h 38m 2s"}
+{"loss": 2.10488052, "token_acc": 0.5611555, "grad_norm": 20.90278825, "learning_rate": 6.3e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035733, "epoch": 0.44185077, "global_step/max_steps": "265/599", "percentage": "44.24%", "elapsed_time": "2h 3m 31s", "remaining_time": "2h 35m 40s"}
+{"loss": 1.97988911, "token_acc": 0.6021021, "grad_norm": 18.45925674, "learning_rate": 6.2e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035741, "epoch": 0.45018758, "global_step/max_steps": "270/599", "percentage": "45.08%", "elapsed_time": "2h 5m 49s", "remaining_time": "2h 33m 19s"}
+{"loss": 2.02038708, "token_acc": 0.54369714, "grad_norm": 12.73293246, "learning_rate": 6.1e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035755, "epoch": 0.45852439, "global_step/max_steps": "275/599", "percentage": "45.91%", "elapsed_time": "2h 8m 6s", "remaining_time": "2h 30m 55s"}
+{"loss": 2.02311134, "token_acc": 0.5396679, "grad_norm": 7.63727465, "learning_rate": 5.9e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035775, "epoch": 0.46686119, "global_step/max_steps": "280/599", "percentage": "46.74%", "elapsed_time": "2h 10m 21s", "remaining_time": "2h 28m 31s"}
+{"loss": 2.16125832, "token_acc": 0.53290469, "grad_norm": 25.5655949, "learning_rate": 5.8e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035785, "epoch": 0.475198, "global_step/max_steps": "285/599", "percentage": "47.58%", "elapsed_time": "2h 12m 39s", "remaining_time": "2h 26m 9s"}
+{"loss": 2.05255966, "token_acc": 0.5171412, "grad_norm": 11.76487398, "learning_rate": 5.7e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035797, "epoch": 0.48353481, "global_step/max_steps": "290/599", "percentage": "48.41%", "elapsed_time": "2h 14m 56s", "remaining_time": "2h 23m 46s"}
+{"loss": 2.15121613, "token_acc": 0.5537092, "grad_norm": 13.52873771, "learning_rate": 5.5e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035803, "epoch": 0.49187161, "global_step/max_steps": "295/599", "percentage": "49.25%", "elapsed_time": "2h 17m 14s", "remaining_time": "2h 21m 25s"}
+{"loss": 1.97305984, "token_acc": 0.51643192, "grad_norm": 9.34842802, "learning_rate": 5.4e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035819, "epoch": 0.50020842, "global_step/max_steps": "300/599", "percentage": "50.08%", "elapsed_time": "2h 19m 30s", "remaining_time": "2h 19m 2s"}
+{"eval_loss": 1.88045955, "eval_token_acc": 0.58847703, "eval_runtime": 50.8824, "eval_samples_per_second": 7.606, "eval_steps_per_second": 0.491, "epoch": 0.50020842, "global_step/max_steps": "300/599", "percentage": "50.08%", "elapsed_time": "2h 20m 21s", "remaining_time": "2h 19m 53s"}
+{"loss": 1.94095192, "token_acc": 0.5972499, "grad_norm": 12.57411364, "learning_rate": 5.3e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035593, "epoch": 0.50854523, "global_step/max_steps": "305/599", "percentage": "50.92%", "elapsed_time": "2h 22m 44s", "remaining_time": "2h 17m 35s"}
+{"loss": 1.99339027, "token_acc": 0.61407035, "grad_norm": 16.15917056, "learning_rate": 5.1e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035604, "epoch": 0.51688203, "global_step/max_steps": "310/599", "percentage": "51.75%", "elapsed_time": "2h 25m 1s", "remaining_time": "2h 15m 12s"}
+{"loss": 1.91076202, "token_acc": 0.61042723, "grad_norm": 29.40343757, "learning_rate": 5e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035617, "epoch": 0.52521884, "global_step/max_steps": "315/599", "percentage": "52.59%", "elapsed_time": "2h 27m 19s", "remaining_time": "2h 12m 49s"}
+{"loss": 1.93723145, "token_acc": 0.53832183, "grad_norm": 8.47359031, "learning_rate": 4.8e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035624, "epoch": 0.53355565, "global_step/max_steps": "320/599", "percentage": "53.42%", "elapsed_time": "2h 29m 37s", "remaining_time": "2h 10m 27s"}
+{"loss": 2.06749973, "token_acc": 0.59916143, "grad_norm": 23.54029686, "learning_rate": 4.7e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035634, "epoch": 0.54189246, "global_step/max_steps": "325/599", "percentage": "54.26%", "elapsed_time": "2h 31m 55s", "remaining_time": "2h 8m 5s"}
+{"loss": 1.93471222, "token_acc": 0.56133464, "grad_norm": 13.92445713, "learning_rate": 4.6e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035645, "epoch": 0.55022926, "global_step/max_steps": "330/599", "percentage": "55.09%", "elapsed_time": "2h 34m 13s", "remaining_time": "2h 5m 42s"}
+{"loss": 2.03456745, "token_acc": 0.60334889, "grad_norm": 8.23608397, "learning_rate": 4.4e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035658, "epoch": 0.55856607, "global_step/max_steps": "335/599", "percentage": "55.93%", "elapsed_time": "2h 36m 29s", "remaining_time": "2h 3m 19s"}
+{"loss": 1.97142372, "token_acc": 0.53456402, "grad_norm": 19.86458038, "learning_rate": 4.3e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035668, "epoch": 0.56690288, "global_step/max_steps": "340/599", "percentage": "56.76%", "elapsed_time": "2h 38m 47s", "remaining_time": "2h 0m 57s"}
+{"loss": 1.87111588, "token_acc": 0.647854, "grad_norm": 24.59613936, "learning_rate": 4.2e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035677, "epoch": 0.57523968, "global_step/max_steps": "345/599", "percentage": "57.60%", "elapsed_time": "2h 41m 5s", "remaining_time": "1h 58m 35s"}
+{"loss": 1.99564018, "token_acc": 0.5331267, "grad_norm": 22.60234593, "learning_rate": 4e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035689, "epoch": 0.58357649, "global_step/max_steps": "350/599", "percentage": "58.43%", "elapsed_time": "2h 43m 22s", "remaining_time": "1h 56m 13s"}
+{"loss": 2.00914268, "token_acc": 0.55720777, "grad_norm": 11.42143166, "learning_rate": 3.9e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035698, "epoch": 0.5919133, "global_step/max_steps": "355/599", "percentage": "59.27%", "elapsed_time": "2h 45m 39s", "remaining_time": "1h 53m 51s"}
+{"loss": 2.02572727, "token_acc": 0.58039377, "grad_norm": 9.96900989, "learning_rate": 3.8e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035706, "epoch": 0.6002501, "global_step/max_steps": "360/599", "percentage": "60.10%", "elapsed_time": "2h 47m 57s", "remaining_time": "1h 51m 30s"}
+{"loss": 1.89849453, "token_acc": 0.53542169, "grad_norm": 18.56544, "learning_rate": 3.6e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035714, "epoch": 0.60858691, "global_step/max_steps": "365/599", "percentage": "60.93%", "elapsed_time": "2h 50m 15s", "remaining_time": "1h 49m 8s"}
+{"loss": 2.08937702, "token_acc": 0.52121697, "grad_norm": 26.64309778, "learning_rate": 3.5e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035721, "epoch": 0.61692372, "global_step/max_steps": "370/599", "percentage": "61.77%", "elapsed_time": "2h 52m 33s", "remaining_time": "1h 46m 47s"}
+{"loss": 1.96022072, "token_acc": 0.53246124, "grad_norm": 17.57538015, "learning_rate": 3.4e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03573, "epoch": 0.62526053, "global_step/max_steps": "375/599", "percentage": "62.60%", "elapsed_time": "2h 54m 50s", "remaining_time": "1h 44m 26s"}
+{"loss": 1.95453568, "token_acc": 0.56923803, "grad_norm": 10.37087801, "learning_rate": 3.2e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03574, "epoch": 0.63359733, "global_step/max_steps": "380/599", "percentage": "63.44%", "elapsed_time": "2h 57m 7s", "remaining_time": "1h 42m 4s"}
+{"loss": 1.89549026, "token_acc": 0.54592721, "grad_norm": 16.72064113, "learning_rate": 3.1e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035748, "epoch": 0.64193414, "global_step/max_steps": "385/599", "percentage": "64.27%", "elapsed_time": "2h 59m 24s", "remaining_time": "1h 39m 43s"}
+{"loss": 1.99168072, "token_acc": 0.60038685, "grad_norm": 12.09416286, "learning_rate": 3e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03576, "epoch": 0.65027095, "global_step/max_steps": "390/599", "percentage": "65.11%", "elapsed_time": "3h 1m 41s", "remaining_time": "1h 37m 21s"}
+{"loss": 2.0207634, "token_acc": 0.54719917, "grad_norm": 10.00461078, "learning_rate": 2.9e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035767, "epoch": 0.65860775, "global_step/max_steps": "395/599", "percentage": "65.94%", "elapsed_time": "3h 3m 58s", "remaining_time": "1h 35m 1s"}
+{"loss": 1.91088181, "token_acc": 0.585753, "grad_norm": 26.06737819, "learning_rate": 2.7e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035777, "epoch": 0.66694456, "global_step/max_steps": "400/599", "percentage": "66.78%", "elapsed_time": "3h 6m 15s", "remaining_time": "1h 32m 39s"}
+{"eval_loss": 1.85156465, "eval_token_acc": 0.59135366, "eval_runtime": 50.6568, "eval_samples_per_second": 7.64, "eval_steps_per_second": 0.494, "epoch": 0.66694456, "global_step/max_steps": "400/599", "percentage": "66.78%", "elapsed_time": "3h 7m 6s", "remaining_time": "1h 33m 4s"}
+{"loss": 2.10379829, "token_acc": 0.56813645, "grad_norm": 10.89495925, "learning_rate": 2.6e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035611, "epoch": 0.67528137, "global_step/max_steps": "405/599", "percentage": "67.61%", "elapsed_time": "3h 9m 28s", "remaining_time": "1h 30m 45s"}
+{"loss": 1.74828854, "token_acc": 0.60836177, "grad_norm": 22.40605989, "learning_rate": 2.5e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035622, "epoch": 0.68361817, "global_step/max_steps": "410/599", "percentage": "68.45%", "elapsed_time": "3h 11m 45s", "remaining_time": "1h 28m 23s"}
+{"loss": 1.99518471, "token_acc": 0.50660793, "grad_norm": 13.88308797, "learning_rate": 2.4e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035632, "epoch": 0.69195498, "global_step/max_steps": "415/599", "percentage": "69.28%", "elapsed_time": "3h 14m 2s", "remaining_time": "1h 26m 1s"}
+{"loss": 2.12053032, "token_acc": 0.53677367, "grad_norm": 17.36765294, "learning_rate": 2.2e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035639, "epoch": 0.70029179, "global_step/max_steps": "420/599", "percentage": "70.12%", "elapsed_time": "3h 16m 20s", "remaining_time": "1h 23m 40s"}
+{"loss": 2.00166073, "token_acc": 0.60430108, "grad_norm": 13.30400593, "learning_rate": 2.1e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035647, "epoch": 0.7086286, "global_step/max_steps": "425/599", "percentage": "70.95%", "elapsed_time": "3h 18m 37s", "remaining_time": "1h 21m 19s"}
+{"loss": 2.05194969, "token_acc": 0.50780669, "grad_norm": 11.76732832, "learning_rate": 2e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035658, "epoch": 0.7169654, "global_step/max_steps": "430/599", "percentage": "71.79%", "elapsed_time": "3h 20m 54s", "remaining_time": "1h 18m 57s"}
+{"loss": 2.09172745, "token_acc": 0.54883892, "grad_norm": 10.93482193, "learning_rate": 1.9e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035668, "epoch": 0.72530221, "global_step/max_steps": "435/599", "percentage": "72.62%", "elapsed_time": "3h 23m 10s", "remaining_time": "1h 16m 36s"}
+{"loss": 1.95991573, "token_acc": 0.5574086, "grad_norm": 11.97713605, "learning_rate": 1.8e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035676, "epoch": 0.73363902, "global_step/max_steps": "440/599", "percentage": "73.46%", "elapsed_time": "3h 25m 28s", "remaining_time": "1h 14m 15s"}
+{"loss": 1.98108521, "token_acc": 0.52291769, "grad_norm": 20.62773265, "learning_rate": 1.7e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035667, "epoch": 0.74197582, "global_step/max_steps": "445/599", "percentage": "74.29%", "elapsed_time": "3h 27m 51s", "remaining_time": "1h 11m 56s"}
+{"loss": 1.92095909, "token_acc": 0.61349693, "grad_norm": 14.67035173, "learning_rate": 1.6e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035666, "epoch": 0.75031263, "global_step/max_steps": "450/599", "percentage": "75.13%", "elapsed_time": "3h 30m 12s", "remaining_time": "1h 9m 36s"}
+{"loss": 2.06539688, "token_acc": 0.60543338, "grad_norm": 16.13465794, "learning_rate": 1.5e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03566, "epoch": 0.75864944, "global_step/max_steps": "455/599", "percentage": "75.96%", "elapsed_time": "3h 32m 34s", "remaining_time": "1h 7m 16s"}
+{"loss": 2.03743458, "token_acc": 0.53765606, "grad_norm": 11.5239861, "learning_rate": 1.4e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035644, "epoch": 0.76698624, "global_step/max_steps": "460/599", "percentage": "76.79%", "elapsed_time": "3h 35m 0s", "remaining_time": "1h 4m 58s"}
+{"loss": 2.00827007, "token_acc": 0.54764985, "grad_norm": 10.67730396, "learning_rate": 1.3e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035637, "epoch": 0.77532305, "global_step/max_steps": "465/599", "percentage": "77.63%", "elapsed_time": "3h 37m 23s", "remaining_time": "1h 2m 38s"}
+{"loss": 1.90377007, "token_acc": 0.51853135, "grad_norm": 12.60923777, "learning_rate": 1.2e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035622, "epoch": 0.78365986, "global_step/max_steps": "470/599", "percentage": "78.46%", "elapsed_time": "3h 39m 49s", "remaining_time": "1h 0m 19s"}
+{"loss": 1.98956642, "token_acc": 0.53336131, "grad_norm": 10.81718892, "learning_rate": 1.1e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035626, "epoch": 0.79199667, "global_step/max_steps": "475/599", "percentage": "79.30%", "elapsed_time": "3h 42m 7s", "remaining_time": "57m 59s"}
+{"loss": 1.97015266, "token_acc": 0.5440149, "grad_norm": 18.63007428, "learning_rate": 1e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035607, "epoch": 0.80033347, "global_step/max_steps": "480/599", "percentage": "80.13%", "elapsed_time": "3h 44m 35s", "remaining_time": "55m 40s"}
+{"loss": 2.02738953, "token_acc": 0.60906682, "grad_norm": 12.40656248, "learning_rate": 1e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035594, "epoch": 0.80867028, "global_step/max_steps": "485/599", "percentage": "80.97%", "elapsed_time": "3h 47m 1s", "remaining_time": "53m 21s"}
+{"loss": 2.06000957, "token_acc": 0.56035916, "grad_norm": 11.50101377, "learning_rate": 9e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035578, "epoch": 0.81700709, "global_step/max_steps": "490/599", "percentage": "81.80%", "elapsed_time": "3h 49m 27s", "remaining_time": "51m 2s"}
+{"loss": 1.96477928, "token_acc": 0.56648604, "grad_norm": 33.22370771, "learning_rate": 8e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035566, "epoch": 0.82534389, "global_step/max_steps": "495/599", "percentage": "82.64%", "elapsed_time": "3h 51m 52s", "remaining_time": "48m 43s"}
+{"loss": 1.89436722, "token_acc": 0.58911917, "grad_norm": 10.30896186, "learning_rate": 7e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035555, "epoch": 0.8336807, "global_step/max_steps": "500/599", "percentage": "83.47%", "elapsed_time": "3h 54m 17s", "remaining_time": "46m 23s"}
+{"eval_loss": 1.84145534, "eval_token_acc": 0.59349059, "eval_runtime": 53.013, "eval_samples_per_second": 7.3, "eval_steps_per_second": 0.472, "epoch": 0.8336807, "global_step/max_steps": "500/599", "percentage": "83.47%", "elapsed_time": "3h 55m 10s", "remaining_time": "46m 33s"}
+{"loss": 1.96558037, "token_acc": 0.61867019, "grad_norm": 37.79175723, "learning_rate": 7e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035399, "epoch": 0.84201751, "global_step/max_steps": "505/599", "percentage": "84.31%", "elapsed_time": "3h 57m 41s", "remaining_time": "44m 14s"}
+{"loss": 1.96315041, "token_acc": 0.57089552, "grad_norm": 24.16050385, "learning_rate": 6e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035379, "epoch": 0.85035431, "global_step/max_steps": "510/599", "percentage": "85.14%", "elapsed_time": "4h 0m 10s", "remaining_time": "41m 54s"}
+{"loss": 2.03680744, "token_acc": 0.61991986, "grad_norm": 15.74389491, "learning_rate": 5e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035365, "epoch": 0.85869112, "global_step/max_steps": "515/599", "percentage": "85.98%", "elapsed_time": "4h 2m 37s", "remaining_time": "39m 34s"}
+{"loss": 1.82610626, "token_acc": 0.61305842, "grad_norm": 7.40251937, "learning_rate": 5e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035352, "epoch": 0.86702793, "global_step/max_steps": "520/599", "percentage": "86.81%", "elapsed_time": "4h 5m 4s", "remaining_time": "37m 13s"}
+{"loss": 1.93475819, "token_acc": 0.54752688, "grad_norm": 13.13551851, "learning_rate": 4e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035359, "epoch": 0.87536474, "global_step/max_steps": "525/599", "percentage": "87.65%", "elapsed_time": "4h 7m 22s", "remaining_time": "34m 52s"}
+{"loss": 2.04937553, "token_acc": 0.62469627, "grad_norm": 19.18427741, "learning_rate": 4e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035347, "epoch": 0.88370154, "global_step/max_steps": "530/599", "percentage": "88.48%", "elapsed_time": "4h 9m 49s", "remaining_time": "32m 31s"}
+{"loss": 2.08046494, "token_acc": 0.50323415, "grad_norm": 11.94007445, "learning_rate": 3e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035354, "epoch": 0.89203835, "global_step/max_steps": "535/599", "percentage": "89.32%", "elapsed_time": "4h 12m 7s", "remaining_time": "30m 9s"}
+{"loss": 1.97372074, "token_acc": 0.52615722, "grad_norm": 24.64281074, "learning_rate": 3e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035353, "epoch": 0.90037516, "global_step/max_steps": "540/599", "percentage": "90.15%", "elapsed_time": "4h 14m 29s", "remaining_time": "27m 48s"}
+{"loss": 2.00739555, "token_acc": 0.55390836, "grad_norm": 54.77823651, "learning_rate": 2e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03535, "epoch": 0.90871196, "global_step/max_steps": "545/599", "percentage": "90.98%", "elapsed_time": "4h 16m 52s", "remaining_time": "25m 27s"}
+{"loss": 2.11557083, "token_acc": 0.64673581, "grad_norm": 36.78224841, "learning_rate": 2e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035342, "epoch": 0.91704877, "global_step/max_steps": "550/599", "percentage": "91.82%", "elapsed_time": "4h 19m 17s", "remaining_time": "23m 6s"}
+{"loss": 1.9375103, "token_acc": 0.58632597, "grad_norm": 16.83241028, "learning_rate": 1e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035332, "epoch": 0.92538558, "global_step/max_steps": "555/599", "percentage": "92.65%", "elapsed_time": "4h 21m 43s", "remaining_time": "20m 44s"}
+{"loss": 2.05479603, "token_acc": 0.53343351, "grad_norm": 14.92095341, "learning_rate": 1e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035321, "epoch": 0.93372238, "global_step/max_steps": "560/599", "percentage": "93.49%", "elapsed_time": "4h 24m 9s", "remaining_time": "18m 23s"}
+{"loss": 1.96065903, "token_acc": 0.58190647, "grad_norm": 12.4531892, "learning_rate": 1e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035328, "epoch": 0.94205919, "global_step/max_steps": "565/599", "percentage": "94.32%", "elapsed_time": "4h 26m 28s", "remaining_time": "16m 2s"}
+{"loss": 2.05678825, "token_acc": 0.53443632, "grad_norm": 18.92769494, "learning_rate": 1e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035323, "epoch": 0.950396, "global_step/max_steps": "570/599", "percentage": "95.16%", "elapsed_time": "4h 28m 51s", "remaining_time": "13m 40s"}
+{"loss": 1.94620247, "token_acc": 0.55583918, "grad_norm": 11.55179148, "learning_rate": 0.0, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035328, "epoch": 0.95873281, "global_step/max_steps": "575/599", "percentage": "95.99%", "elapsed_time": "4h 31m 11s", "remaining_time": "11m 19s"}
+{"loss": 2.11692429, "token_acc": 0.5416, "grad_norm": 19.54539597, "learning_rate": 0.0, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035314, "epoch": 0.96706961, "global_step/max_steps": "580/599", "percentage": "96.83%", "elapsed_time": "4h 33m 39s", "remaining_time": "8m 57s"}
+{"loss": 2.11180992, "token_acc": 0.51946421, "grad_norm": 45.23026432, "learning_rate": 0.0, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035317, "epoch": 0.97540642, "global_step/max_steps": "585/599", "percentage": "97.66%", "elapsed_time": "4h 35m 59s", "remaining_time": "6m 36s"}
+{"loss": 1.88252869, "token_acc": 0.61870504, "grad_norm": 13.67727308, "learning_rate": 0.0, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03531, "epoch": 0.98374323, "global_step/max_steps": "590/599", "percentage": "98.50%", "elapsed_time": "4h 38m 24s", "remaining_time": "4m 14s"}
+{"loss": 2.06943321, "token_acc": 0.53171953, "grad_norm": 32.76954959, "learning_rate": 0.0, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035298, "epoch": 0.99208003, "global_step/max_steps": "595/599", "percentage": "99.33%", "elapsed_time": "4h 40m 51s", "remaining_time": "1m 53s"}
+{"eval_loss": 1.83980036, "eval_token_acc": 0.59299745, "eval_runtime": 50.6264, "eval_samples_per_second": 7.644, "eval_steps_per_second": 0.494, "epoch": 0.99874948, "global_step/max_steps": "599/599", "percentage": "100.00%", "elapsed_time": "4h 43m 43s", "remaining_time": "0s"}
+{"train_runtime": 17026.6603, "train_samples_per_second": 2.254, "train_steps_per_second": 0.035, "total_flos": 954945089044480.0, "train_loss": 2.1272374, "epoch": 0.99874948, "global_step/max_steps": "599/599", "percentage": "100.00%", "elapsed_time": "4h 43m 46s", "remaining_time": "0s"}
+{"model_parameter_info": "PeftModelForCausalLM: 3874.3572M Params (788.4186M Trainable [20.3497%]), 0.0024M Buffers.", "last_model_checkpoint": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/checkpoint-599", "best_model_checkpoint": "/cpfs01/shared/llm_ddd/zhangyulong/sa_work/checkpoint/sft1e5/v0-20250508-223159/checkpoint-599", "best_metric": 1.83980036, "global_step": 599, "log_history": [{"loss": 2.5885090827941895, "token_acc": 0.5925233644859813, "grad_norm": 66.151507974008, "learning_rate": 3.333333333333334e-08, "memory(GiB)": 22.52, "train_speed(iter/s)": 0.015538, "epoch": 0.0016673614005835765, "step": 1}, {"loss": 2.8953185081481934, "token_acc": 0.5351254480286738, "grad_norm": 18.046810799704403, "learning_rate": 1.6666666666666668e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.028677, "epoch": 0.008336807002917883, "step": 5}, {"loss": 2.8972284317016603, "token_acc": 0.48271716260895703, "grad_norm": 22.42233787075203, "learning_rate": 3.3333333333333335e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.032189, "epoch": 0.016673614005835766, "step": 10}, {"loss": 3.019224166870117, "token_acc": 0.4233576642335766, "grad_norm": 78.68221628982327, "learning_rate": 5.000000000000001e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.033512, "epoch": 0.02501042100875365, "step": 15}, {"loss": 2.6378469467163086, "token_acc": 0.5315636128196828, "grad_norm": 14.067342172356083, "learning_rate": 6.666666666666667e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.034241, "epoch": 0.03334722801167153, "step": 20}, {"loss": 2.9552268981933594, "token_acc": 0.5008183306055647, "grad_norm": 15.42302796765105, "learning_rate": 8.333333333333335e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.034682, "epoch": 0.041684035014589414, "step": 25}, {"loss": 2.829464340209961, "token_acc": 0.4664549424374752, "grad_norm": 12.328721528711387, "learning_rate": 1.0000000000000002e-06, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.034997, "epoch": 0.0500208420175073, "step": 30}, {"loss": 2.7751808166503906, "token_acc": 0.4324596774193548, "grad_norm": 19.22496551041839, "learning_rate": 9.998094856697885e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035202, "epoch": 0.05835764902042518, "step": 35}, {"loss": 2.726279067993164, "token_acc": 0.48909557408595256, "grad_norm": 16.24767294289168, "learning_rate": 9.99238087861994e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035422, "epoch": 0.06669445602334306, "step": 40}, {"loss": 2.6006492614746093, "token_acc": 0.44134321849105973, "grad_norm": 21.717265706221777, "learning_rate": 9.982862420144986e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.0356, "epoch": 0.07503126302626094, "step": 45}, {"loss": 2.6589160919189454, "token_acc": 0.46153846153846156, "grad_norm": 51.241580059897494, "learning_rate": 9.969546734883991e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035705, "epoch": 0.08336807002917883, "step": 50}, {"loss": 2.5741214752197266, "token_acc": 0.5192943770672547, "grad_norm": 31.639449800632296, "learning_rate": 9.95244397015239e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035771, "epoch": 0.0917048770320967, "step": 55}, {"loss": 2.641748809814453, "token_acc": 0.5323529411764706, "grad_norm": 26.452878691000056, "learning_rate": 9.931567159237253e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035864, "epoch": 0.1000416840350146, "step": 60}, {"loss": 2.4932350158691405, "token_acc": 0.4754754754754755, "grad_norm": 17.167976065335807, "learning_rate": 9.906932211465174e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035896, "epoch": 0.10837849103793247, "step": 65}, {"loss": 2.4108455657958983, "token_acc": 0.4948392804482454, "grad_norm": 18.802598190849235, "learning_rate": 9.87855790007845e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035905, "epoch": 0.11671529804085036, "step": 70}, {"loss": 2.4812793731689453, "token_acc": 0.4957983193277311, "grad_norm": 10.472719628402842, "learning_rate": 9.8464658479288e-07, "memory(GiB)": 40.37, "train_speed(iter/s)": 0.035929, "epoch": 0.12505210504376824, "step": 75}, {"loss": 2.392130470275879, "token_acc": 0.6406029203956665, "grad_norm": 25.423686846144918, "learning_rate": 9.810680510999506e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.035965, "epoch": 0.13338891204668613, "step": 80}, {"loss": 2.3535221099853514, "token_acc": 0.5528120713305898, "grad_norm": 13.548571235807671, "learning_rate": 9.771229159768549e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.036012, "epoch": 0.14172571904960402, "step": 85}, {"loss": 2.092748260498047, "token_acc": 0.6185185185185185, "grad_norm": 9.343249502655699, "learning_rate": 9.728141858426954e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.036025, "epoch": 0.15006252605252188, "step": 90}, {"loss": 2.2603179931640627, "token_acc": 0.5625806451612904, "grad_norm": 12.84825439636651, "learning_rate": 9.681451441968144e-07, "memory(GiB)": 59.23, "train_speed(iter/s)": 0.036051, "epoch": 0.15839933305543977, "step": 95}, {"loss": 2.1494909286499024, "token_acc": 0.7580698835274542, "grad_norm": 20.137499167393752, "learning_rate": 9.631193491165798e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.036061, "epoch": 0.16673614005835766, "step": 100}, {"eval_loss": 2.2023122310638428, "eval_token_acc": 0.5591353661543519, "eval_runtime": 52.6566, "eval_samples_per_second": 7.35, "eval_steps_per_second": 0.475, "epoch": 0.16673614005835766, "step": 100}, {"loss": 2.3257471084594727, "token_acc": 0.5759222661396575, "grad_norm": 31.262270658879725, "learning_rate": 9.577406305459252e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035377, "epoch": 0.17507294706127552, "step": 105}, {"loss": 2.1007978439331056, "token_acc": 0.5401371520774506, "grad_norm": 17.341758332740685, "learning_rate": 9.520130873767143e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035427, "epoch": 0.1834097540641934, "step": 110}, {"loss": 2.2100765228271486, "token_acc": 0.5938957185247986, "grad_norm": 12.090791733454596, "learning_rate": 9.459410843251496e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035464, "epoch": 0.1917465610671113, "step": 115}, {"loss": 2.129885673522949, "token_acc": 0.5571059431524548, "grad_norm": 14.65945354360213, "learning_rate": 9.395292486056087e-07, "memory(GiB)": 72.74, "train_speed(iter/s)": 0.035497, "epoch": 0.2000833680700292, "step": 120}, {"loss": 2.078561782836914, "token_acc": 0.6055045871559633, "grad_norm": 20.955185795592147, "learning_rate": 9.327824664044418e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035534, "epoch": 0.20842017507294705, "step": 125}, {"loss": 2.124875068664551, "token_acc": 0.5142463235294118, "grad_norm": 12.581606956328924, "learning_rate": 9.257058791564175e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035582, "epoch": 0.21675698207586494, "step": 130}, {"loss": 2.2061405181884766, "token_acc": 0.5257924176507147, "grad_norm": 13.605082688123597, "learning_rate": 9.183048796266547e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.03563, "epoch": 0.22509378907878283, "step": 135}, {"loss": 2.365943717956543, "token_acc": 0.5246742992499013, "grad_norm": 13.764836299774016, "learning_rate": 9.105851078010267e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035672, "epoch": 0.23343059608170072, "step": 140}, {"loss": 2.306344985961914, "token_acc": 0.5653673680579511, "grad_norm": 15.237998151609965, "learning_rate": 9.025524465881684e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035704, "epoch": 0.24176740308461858, "step": 145}, {"loss": 2.0439552307128905, "token_acc": 0.5631201764057332, "grad_norm": 26.706683319752145, "learning_rate": 8.942130173363629e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035727, "epoch": 0.25010421008753647, "step": 150}, {"loss": 2.094293212890625, "token_acc": 0.5713038416763678, "grad_norm": 48.80843897332085, "learning_rate": 8.855731751687234e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035749, "epoch": 0.25844101709045436, "step": 155}, {"loss": 2.1955413818359375, "token_acc": 0.5173201370384469, "grad_norm": 15.263635854343017, "learning_rate": 8.766395041402246e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035777, "epoch": 0.26677782409337225, "step": 160}, {"loss": 2.1197046279907226, "token_acc": 0.5315372424722662, "grad_norm": 10.398850881836337, "learning_rate": 8.674188122202757e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035794, "epoch": 0.27511463109629014, "step": 165}, {"loss": 2.1266895294189454, "token_acc": 0.5184432181237293, "grad_norm": 13.880060097573867, "learning_rate": 8.579181261046577e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035818, "epoch": 0.28345143809920803, "step": 170}, {"loss": 2.1367414474487303, "token_acc": 0.5381393957523183, "grad_norm": 12.972578857357197, "learning_rate": 8.481446858607781e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035825, "epoch": 0.29178824510212586, "step": 175}, {"loss": 2.0226306915283203, "token_acc": 0.5733763903839254, "grad_norm": 27.378559722130987, "learning_rate": 8.381059394103245e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.03584, "epoch": 0.30012505210504375, "step": 180}, {"loss": 2.0788818359375, "token_acc": 0.5885906040268456, "grad_norm": 37.566462154714735, "learning_rate": 8.278095368535215e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035843, "epoch": 0.30846185910796164, "step": 185}, {"loss": 2.034734535217285, "token_acc": 0.716458513663905, "grad_norm": 19.212837145590854, "learning_rate": 8.17263324639316e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035842, "epoch": 0.31679866611087953, "step": 190}, {"loss": 1.9193729400634765, "token_acc": 0.55078125, "grad_norm": 17.36406198532525, "learning_rate": 8.064753395859334e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035858, "epoch": 0.3251354731137974, "step": 195}, {"loss": 2.210774803161621, "token_acc": 0.5445278969957081, "grad_norm": 13.789075783868897, "learning_rate": 7.954538027563602e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035873, "epoch": 0.3334722801167153, "step": 200}, {"eval_loss": 1.962235689163208, "eval_token_acc": 0.5808334018246075, "eval_runtime": 50.5605, "eval_samples_per_second": 7.654, "eval_steps_per_second": 0.494, "epoch": 0.3334722801167153, "step": 200}, {"loss": 1.980001449584961, "token_acc": 0.6154087065455685, "grad_norm": 27.83705818291825, "learning_rate": 7.842071131934246e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035554, "epoch": 0.3418090871196332, "step": 205}, {"loss": 2.071278381347656, "token_acc": 0.5612172682236376, "grad_norm": 45.7223229612559, "learning_rate": 7.727438415192435e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035572, "epoch": 0.35014589412255104, "step": 210}, {"loss": 2.0239721298217774, "token_acc": 0.6295644522657281, "grad_norm": 40.58634252346181, "learning_rate": 7.610727234039168e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035589, "epoch": 0.3584827011254689, "step": 215}, {"loss": 2.0968149185180662, "token_acc": 0.5086447295036252, "grad_norm": 17.653250720885936, "learning_rate": 7.492026529084469e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035609, "epoch": 0.3668195081283868, "step": 220}, {"loss": 2.071677398681641, "token_acc": 0.538562091503268, "grad_norm": 12.109233598417216, "learning_rate": 7.371426757069538e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035628, "epoch": 0.3751563151313047, "step": 225}, {"loss": 1.9428871154785157, "token_acc": 0.565931863727455, "grad_norm": 15.017493193481762, "learning_rate": 7.24901982193353e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035646, "epoch": 0.3834931221342226, "step": 230}, {"loss": 2.1239837646484374, "token_acc": 0.5858555588852262, "grad_norm": 54.06229597216968, "learning_rate": 7.12489900477749e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035662, "epoch": 0.3918299291371405, "step": 235}, {"loss": 2.1555171966552735, "token_acc": 0.5906432748538012, "grad_norm": 17.07968196318303, "learning_rate": 6.9991588927788e-07, "memory(GiB)": 73.37, "train_speed(iter/s)": 0.035681, "epoch": 0.4001667361400584, "step": 240}, {"loss": 2.008000946044922, "token_acc": 0.6288687299893276, "grad_norm": 12.763401873866906, "learning_rate": 6.871895307110333e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035689, "epoch": 0.40850354314297627, "step": 245}, {"loss": 1.896212387084961, "token_acc": 0.5528244933160845, "grad_norm": 27.564341740152038, "learning_rate": 6.743205229919224e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035699, "epoch": 0.4168403501458941, "step": 250}, {"loss": 2.200906753540039, "token_acc": 0.5972680169571362, "grad_norm": 8.844275761685454, "learning_rate": 6.613186730420918e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035709, "epoch": 0.425177157148812, "step": 255}, {"loss": 2.0395198822021485, "token_acc": 0.5625292740046839, "grad_norm": 16.848717163331084, "learning_rate": 6.481938890164801e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035727, "epoch": 0.4335139641517299, "step": 260}, {"loss": 2.104880523681641, "token_acc": 0.5611555009219422, "grad_norm": 20.902788252644342, "learning_rate": 6.349561727528389e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035733, "epoch": 0.44185077115464777, "step": 265}, {"loss": 1.9798891067504882, "token_acc": 0.6021021021021021, "grad_norm": 18.45925674176476, "learning_rate": 6.216156121497579e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035741, "epoch": 0.45018757815756566, "step": 270}, {"loss": 2.020387077331543, "token_acc": 0.5436971405557793, "grad_norm": 12.732932455191273, "learning_rate": 6.081823734791091e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035755, "epoch": 0.45852438516048355, "step": 275}, {"loss": 2.023111343383789, "token_acc": 0.5396678966789668, "grad_norm": 7.6372746463330925, "learning_rate": 5.946666936387637e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035775, "epoch": 0.46686119216340144, "step": 280}, {"loss": 2.161258316040039, "token_acc": 0.5329046898638427, "grad_norm": 25.56559490423313, "learning_rate": 5.810788723514909e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035785, "epoch": 0.4751979991663193, "step": 285}, {"loss": 2.052559661865234, "token_acc": 0.5171411969785009, "grad_norm": 11.764873984092567, "learning_rate": 5.674292643159765e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035797, "epoch": 0.48353480616923716, "step": 290}, {"loss": 2.1512161254882813, "token_acc": 0.5537091988130564, "grad_norm": 13.528737711855719, "learning_rate": 5.537282713159508e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035803, "epoch": 0.49187161317215505, "step": 295}, {"loss": 1.973059844970703, "token_acc": 0.5164319248826291, "grad_norm": 9.34842802491852, "learning_rate": 5.399863342934324e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035819, "epoch": 0.5002084201750729, "step": 300}, {"eval_loss": 1.8804595470428467, "eval_token_acc": 0.5884770280266294, "eval_runtime": 50.8824, "eval_samples_per_second": 7.606, "eval_steps_per_second": 0.491, "epoch": 0.5002084201750729, "step": 300}, {"loss": 1.9409519195556642, "token_acc": 0.5972499003587086, "grad_norm": 12.57411363519473, "learning_rate": 5.262139253921319e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035593, "epoch": 0.5085452271779908, "step": 305}, {"loss": 1.9933902740478515, "token_acc": 0.614070351758794, "grad_norm": 16.159170559339547, "learning_rate": 5.124215399770783e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035604, "epoch": 0.5168820341809087, "step": 310}, {"loss": 1.9107620239257812, "token_acc": 0.6104272266473569, "grad_norm": 29.403437567392693, "learning_rate": 4.986196886365488e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035617, "epoch": 0.5252188411838266, "step": 315}, {"loss": 1.9372314453125, "token_acc": 0.5383218307301126, "grad_norm": 8.47359030775639, "learning_rate": 4.848188891723991e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035624, "epoch": 0.5335556481867445, "step": 320}, {"loss": 2.0674997329711915, "token_acc": 0.59916142557652, "grad_norm": 23.5402968598663, "learning_rate": 4.7102965858489386e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035634, "epoch": 0.5418924551896623, "step": 325}, {"loss": 1.9347122192382813, "token_acc": 0.5613346418056918, "grad_norm": 13.92445713165454, "learning_rate": 4.5726250505815166e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035645, "epoch": 0.5502292621925803, "step": 330}, {"loss": 2.034567451477051, "token_acc": 0.603348888278891, "grad_norm": 8.236083974165254, "learning_rate": 4.4352791995230434e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035658, "epoch": 0.5585660691954981, "step": 335}, {"loss": 1.9714237213134767, "token_acc": 0.5345640219952867, "grad_norm": 19.864580375138843, "learning_rate": 4.29836369808481e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035668, "epoch": 0.5669028761984161, "step": 340}, {"loss": 1.8711158752441406, "token_acc": 0.6478540047313281, "grad_norm": 24.596139360443402, "learning_rate": 4.161982883727021e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035677, "epoch": 0.5752396832013339, "step": 345}, {"loss": 1.995640182495117, "token_acc": 0.5331266950794266, "grad_norm": 22.60234592711427, "learning_rate": 4.026240686447682e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035689, "epoch": 0.5835764902042517, "step": 350}, {"loss": 2.0091426849365233, "token_acc": 0.5572077653862041, "grad_norm": 11.421431658394818, "learning_rate": 3.891240549581979e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035698, "epoch": 0.5919132972071697, "step": 355}, {"loss": 2.0257272720336914, "token_acc": 0.5803937653814603, "grad_norm": 9.96900988873536, "learning_rate": 3.757085350972524e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035706, "epoch": 0.6002501042100875, "step": 360}, {"loss": 1.8984945297241211, "token_acc": 0.535421686746988, "grad_norm": 18.56543999617741, "learning_rate": 3.623877324570549e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035714, "epoch": 0.6085869112130055, "step": 365}, {"loss": 2.089377021789551, "token_acc": 0.5212169735788631, "grad_norm": 26.643097778977424, "learning_rate": 3.4917179825277656e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035721, "epoch": 0.6169237182159233, "step": 370}, {"loss": 1.960220718383789, "token_acc": 0.5324612403100775, "grad_norm": 17.57538015227382, "learning_rate": 3.3607080378383007e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03573, "epoch": 0.6252605252188412, "step": 375}, {"loss": 1.954535675048828, "token_acc": 0.5692380278367539, "grad_norm": 10.370878007086118, "learning_rate": 3.2309473275896024e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03574, "epoch": 0.6335973322217591, "step": 380}, {"loss": 1.8954902648925782, "token_acc": 0.5459272097053726, "grad_norm": 16.720641132769824, "learning_rate": 3.102534736880878e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035748, "epoch": 0.6419341392246769, "step": 385}, {"loss": 1.9916807174682618, "token_acc": 0.6003868471953578, "grad_norm": 12.094162861364651, "learning_rate": 2.975568123466967e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03576, "epoch": 0.6502709462275948, "step": 390}, {"loss": 2.020763397216797, "token_acc": 0.5471991701244814, "grad_norm": 10.004610775669486, "learning_rate": 2.85014424318512e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035767, "epoch": 0.6586077532305127, "step": 395}, {"loss": 1.910881805419922, "token_acc": 0.5857530003871467, "grad_norm": 26.06737818600669, "learning_rate": 2.7263586762215203e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035777, "epoch": 0.6669445602334306, "step": 400}, {"eval_loss": 1.851564645767212, "eval_token_acc": 0.5913536615435193, "eval_runtime": 50.6568, "eval_samples_per_second": 7.64, "eval_steps_per_second": 0.494, "epoch": 0.6669445602334306, "step": 400}, {"loss": 2.1037982940673827, "token_acc": 0.5681364543639993, "grad_norm": 10.894959246959745, "learning_rate": 2.604305754273684e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035611, "epoch": 0.6752813672363485, "step": 405}, {"loss": 1.7482885360717773, "token_acc": 0.6083617747440273, "grad_norm": 22.40605988808449, "learning_rate": 2.4840784886643134e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035622, "epoch": 0.6836181742392664, "step": 410}, {"loss": 1.9951847076416016, "token_acc": 0.5066079295154186, "grad_norm": 13.883087969470736, "learning_rate": 2.3657684994613286e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035632, "epoch": 0.6919549812421842, "step": 415}, {"loss": 2.1205303192138674, "token_acc": 0.5367736692401462, "grad_norm": 17.36765294429116, "learning_rate": 2.2494659456581355e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035639, "epoch": 0.7002917882451021, "step": 420}, {"loss": 2.0016607284545898, "token_acc": 0.6043010752688172, "grad_norm": 13.304005930459187, "learning_rate": 2.135259456467291e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035647, "epoch": 0.70862859524802, "step": 425}, {"loss": 2.051949691772461, "token_acc": 0.5078066914498142, "grad_norm": 11.767328320827703, "learning_rate": 2.0232360637799688e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035658, "epoch": 0.7169654022509379, "step": 430}, {"loss": 2.091727447509766, "token_acc": 0.5488389237007003, "grad_norm": 10.934821929469377, "learning_rate": 1.913481135842676e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035668, "epoch": 0.7253022092538558, "step": 435}, {"loss": 1.9599157333374024, "token_acc": 0.5574085952533675, "grad_norm": 11.977136051875894, "learning_rate": 1.806078312201745e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035676, "epoch": 0.7336390162567736, "step": 440}, {"loss": 1.981085205078125, "token_acc": 0.5229176934450468, "grad_norm": 20.627732647045168, "learning_rate": 1.7011094399652107e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035667, "epoch": 0.7419758232596916, "step": 445}, {"loss": 1.9209590911865235, "token_acc": 0.6134969325153374, "grad_norm": 14.670351734931344, "learning_rate": 1.5986545114306202e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035666, "epoch": 0.7503126302626094, "step": 450}, {"loss": 2.0653968811035157, "token_acc": 0.6054333764553687, "grad_norm": 16.134657938660713, "learning_rate": 1.4987916031263236e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03566, "epoch": 0.7586494372655272, "step": 455}, {"loss": 2.0374345779418945, "token_acc": 0.5376560612162706, "grad_norm": 11.523986096197236, "learning_rate": 1.4015968163126733e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035644, "epoch": 0.7669862442684452, "step": 460}, {"loss": 2.0082700729370115, "token_acc": 0.5476498490728763, "grad_norm": 10.677303962923144, "learning_rate": 1.307144218988507e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035637, "epoch": 0.775323051271363, "step": 465}, {"loss": 1.9037700653076173, "token_acc": 0.5185313474194666, "grad_norm": 12.60923777318339, "learning_rate": 1.215505789447093e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035622, "epoch": 0.783659858274281, "step": 470}, {"loss": 1.9895664215087892, "token_acc": 0.5333613092740244, "grad_norm": 10.817188917244303, "learning_rate": 1.1267513614245291e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035626, "epoch": 0.7919966652771988, "step": 475}, {"loss": 1.9701526641845704, "token_acc": 0.544014904517932, "grad_norm": 18.630074276098856, "learning_rate": 1.0409485708824507e-07, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035607, "epoch": 0.8003334722801168, "step": 480}, {"loss": 2.0273895263671875, "token_acc": 0.6090668236679423, "grad_norm": 12.406562481684025, "learning_rate": 9.581628044655396e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035594, "epoch": 0.8086702792830346, "step": 485}, {"loss": 2.060009574890137, "token_acc": 0.5603591619554373, "grad_norm": 11.501013766617222, "learning_rate": 8.784571496731521e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035578, "epoch": 0.8170070862859525, "step": 490}, {"loss": 1.9647792816162108, "token_acc": 0.5664860358482701, "grad_norm": 33.22370771481993, "learning_rate": 8.018923467830403e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035566, "epoch": 0.8253438932888704, "step": 495}, {"loss": 1.8943672180175781, "token_acc": 0.589119170984456, "grad_norm": 10.308961863506491, "learning_rate": 7.285267425637622e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035555, "epoch": 0.8336807002917882, "step": 500}, {"eval_loss": 1.841455340385437, "eval_token_acc": 0.5934905892989233, "eval_runtime": 53.013, "eval_samples_per_second": 7.3, "eval_steps_per_second": 0.472, "epoch": 0.8336807002917882, "step": 500}, {"loss": 1.965580368041992, "token_acc": 0.6186701893439014, "grad_norm": 37.79175722562096, "learning_rate": 6.58416245811115e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035399, "epoch": 0.8420175072947061, "step": 505}, {"loss": 1.963150405883789, "token_acc": 0.5708955223880597, "grad_norm": 24.16050385246648, "learning_rate": 5.916142847424128e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035379, "epoch": 0.850354314297624, "step": 510}, {"loss": 2.0368074417114257, "token_acc": 0.6199198626216371, "grad_norm": 15.7438949054889, "learning_rate": 5.2817176628113813e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035365, "epoch": 0.8586911213005419, "step": 515}, {"loss": 1.8261062622070312, "token_acc": 0.6130584192439863, "grad_norm": 7.4025193685123485, "learning_rate": 4.681370372629368e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035352, "epoch": 0.8670279283034598, "step": 520}, {"loss": 1.934758186340332, "token_acc": 0.5475268817204301, "grad_norm": 13.135518505589328, "learning_rate": 4.115558475925602e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035359, "epoch": 0.8753647353063777, "step": 525}, {"loss": 2.049375534057617, "token_acc": 0.6246962668433841, "grad_norm": 19.184277409106556, "learning_rate": 3.584713153798214e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035347, "epoch": 0.8837015423092955, "step": 530}, {"loss": 2.0804649353027345, "token_acc": 0.5032341526520052, "grad_norm": 11.940074446149914, "learning_rate": 3.089238940811162e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035354, "epoch": 0.8920383493122134, "step": 535}, {"loss": 1.9737207412719726, "token_acc": 0.5261572172007669, "grad_norm": 24.642810743866573, "learning_rate": 2.6295134167157344e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035353, "epoch": 0.9003751563151313, "step": 540}, {"loss": 2.007395553588867, "token_acc": 0.5539083557951483, "grad_norm": 54.778236508394166, "learning_rate": 2.205886918713152e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03535, "epoch": 0.9087119633180492, "step": 545}, {"loss": 2.115570831298828, "token_acc": 0.6467358145210494, "grad_norm": 36.78224840874843, "learning_rate": 1.8186822744775234e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035342, "epoch": 0.9170487703209671, "step": 550}, {"loss": 1.9375102996826172, "token_acc": 0.5863259668508287, "grad_norm": 16.832410284721337, "learning_rate": 1.4681945561426548e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035332, "epoch": 0.9253855773238849, "step": 555}, {"loss": 2.054796028137207, "token_acc": 0.5334335086401202, "grad_norm": 14.92095340910814, "learning_rate": 1.154690855440166e-08, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035321, "epoch": 0.9337223843268029, "step": 560}, {"loss": 1.9606590270996094, "token_acc": 0.5819064656273959, "grad_norm": 12.453189198034085, "learning_rate": 8.784100801602914e-09, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035328, "epoch": 0.9420591913297207, "step": 565}, {"loss": 2.0567882537841795, "token_acc": 0.5344363216621778, "grad_norm": 18.92769494448578, "learning_rate": 6.395627720904519e-09, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035323, "epoch": 0.9503959983326385, "step": 570}, {"loss": 1.9462024688720703, "token_acc": 0.5558391831525208, "grad_norm": 11.551791479769273, "learning_rate": 4.383309465703145e-09, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035328, "epoch": 0.9587328053355565, "step": 575}, {"loss": 2.116924285888672, "token_acc": 0.5416, "grad_norm": 19.545395968878243, "learning_rate": 2.7486795378570133e-09, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035314, "epoch": 0.9670696123384743, "step": 580}, {"loss": 2.1118099212646486, "token_acc": 0.5194642109669317, "grad_norm": 45.23026432248804, "learning_rate": 1.4929836190696325e-09, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035317, "epoch": 0.9754064193413923, "step": 585}, {"loss": 1.8825286865234374, "token_acc": 0.6187050359712231, "grad_norm": 13.67727308495489, "learning_rate": 6.17178621608594e-10, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.03531, "epoch": 0.9837432263443101, "step": 590}, {"loss": 2.0694332122802734, "token_acc": 0.5317195325542571, "grad_norm": 32.76954958831426, "learning_rate": 1.2193195908388745e-10, "memory(GiB)": 75.81, "train_speed(iter/s)": 0.035298, "epoch": 0.992080033347228, "step": 595}, {"eval_loss": 1.8398003578186035, "eval_token_acc": 0.5929974521245993, "eval_runtime": 50.6264, "eval_samples_per_second": 7.644, "eval_steps_per_second": 0.494, "epoch": 0.9987494789495623, "step": 599}, {"train_runtime": 17026.6603, "train_samples_per_second": 2.254, "train_steps_per_second": 0.035, "total_flos": 954945089044480.0, "train_loss": 2.1272373987557693, "epoch": 0.9987494789495623, "step": 599}], "memory": 75.814453125}

v0-20250508-223159/runs/events.out.tfevents.1746714741.dsw-2138-644b4b995d-5j9mw.1741121.0 ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:781d77131e94e32adce8d353f6614bc2d41a5d270004d79fd9dc845e3372cdf2
+size 56004

v0-20250508-223159/val_dataset.jsonl ADDED Viewed

The diff for this file is too large to render. See raw diff